Розробник створив меддовідник на AI, але Google забанив сайт через дублікати

·837 слівредакція
Розробник створив меддовідник на AI, але Google забанив сайт через дублікати

Автор проєкту «Jey Здоров’я» витратив місяці на захист від галюцинацій нейромереж, але сайт втратив індексацію через технічні помилки — тисячі майже однакових сторінок і неперекладений інтерфейс. Історія показує, як алгоритми Google карають навіть добре продуманий YMYL-контент.

Розробник громадської організації «Ахімса Екосистем» запустив безкоштовний довідник лабораторних маркерів «Jey Здоров’я» з Telegram-ботом для аналізу бланків. Проєкт мав допомагати пацієнтам готуватися до прийому лікаря, але зіткнувся з несподіваною проблемою: Google Search Console показав лише одну проіндексовану сторінку з понад двох тисяч.

Система будувалася на багатоагентному конвеєрі. Модель не генерувала тексти «від себе», а лише структурувала дані з дозволених джерел — NIH, StatPearls, клінічних настанов та лабораторних каталогів. Референсні діапазони підтягувалися з окремої бази. Кожна сторінка проходила через ланцюг перевірок: детерміновані скрипти звіряли числа та одиниці, незалежні LLM-рецензенти різних сімейств (Claude та GPT) перехресно контролювали твердження. Будь-який збій означав карантин — сторінка не потрапляла в продакшн.

Попри складний захист від галюцинацій, проблема виявилася іншою. Аналіз консолі показав дві причини падіння індексації. По-перше, близько 85% URL були комбінаторними шаблонами з майже ідентичним текстом — окремі сторінки для кожного діапазону маркера та калькулятори. Пошуковики 2026 року трактують це як scaled content abuse, особливо для YMYL-доменів. По-друге, на російськомовних сторінках залишився неперекладений український службовий текст, що для класифікатора якості виглядало як зламаний машинний генератор.

Для виправлення ситуації розробник використав тих самих AI-агентів. Він консолідував понад 2000 URL у ~300 унікальних сторінок-хабів на маркер, перенаправивши дублікати через 301-редіректи. Калькулятори вбудували в хаби. Переклад доповнили чотирма моделями та чотирма рецензентами, які вичищали неперекладені рядки. Кожну зміну перед деплоєм перевіряла зовнішня модель через код-рев’ю.

Станом на 18 липня 2026 року сайт має близько 300 сторінок, мовне сміття вичищено, подано нову карту сайту. Чи вистачить цього для відновлення індексації — покаже наступний місяць. У YMYL-тематиці спершу потрібно очистити та консолідувати контент, а вже потім будувати авторитет через зовнішні посилання.

Проєкт залишається некомерційним, живий лікар поки не вичитував сторінки — це наступний етап. Розробник визнає: складний захист від розумних помилок не рятує від банальних технічних недоліків.

Читайте також