Robots.txt — не тот рубильник, каким его считают
Смотри, что тут важно понять сразу: robots.txt никогда не был инструментом «спрятать контент от ИИ». Он говорит роботам, какие разделы сайта можно сканировать. Всё. Он не решает, что покажут в AI Overviews, и не решает, что вообще попадёт в выдачу как ответ на запрос.
А издатели годами относились к нему именно как к рубильнику. Закрыл директорию — и всё, контент невидим для машин. С обычным поиском это более-менее работало. С AI Overviews — не работает вообще так, как многие думают.
Google формирует ответы в AI Overviews на основе уже проиндексированного контента и собственных систем понимания страницы. Это не отдельный робот, которого можно перехватить простым disallow в файле. Нужны специальные директивы именно для контроля над использованием контента в ИИ-функциях — и это совсем другой уровень настройки, о котором многие даже не задумывались.
Почему это выяснилось только сейчас
AI Overviews раскатывали постепенно, и первое время всем было не до тонкостей — важнее было просто попасть туда или понять, откуда падает трафик. Сейчас, когда ИИ-ответы стали заметной частью выдачи и в Google, и постепенно проникают в логику российского поиска, вопрос управления видимостью встал в полный рост.
И тут выяснилось: часть сайтов теряет трафик не потому, что их контент плохой, а потому что настройки robots.txt писались из неверных предпосылок пять лет назад и с тех пор никто их не пересматривал. Файл продолжает делать то, что умел всегда — управлять сканированием, — а издатель был уверен, что тем самым управляет ещё и присутствием в ИИ-ответах.
Это довольно неприятная ситуация. Ты годами настраиваешь техническую часть, уверен, что контролируешь ситуацию, а на деле контролируешь только один из десяти рычагов.
Кому это особенно больно
Больнее всего это ощущается у новостных изданий и вообще у всех, кто живёт с трафика на статьи и данные. Если твоя аудитория ищет ответы через ИИ-поиск, а твой ценный контент по факту недоступен для правильной индексации под эти системы — ты теряешь именно тех читателей, ради которых всё затевалось.
Отдельная история — YMYL-тематики: там, где решается вопрос доверия, денег и здоровья. Если данные и экспертный контент по ошибке выпали из зоны видимости ИИ-ответов, то место займёт кто-то другой, у кого настройки были правильными или кто вообще не думал об этом и всё оставил открытым.
Что делать прямо сейчас
Первое — перестать полагаться на robots.txt как на инструмент управления AI Overviews. Для этого есть отдельные директивы Google, и разбираться нужно именно с ними, а не с классическим disallow.
Второе — пройтись по текущим настройкам robots.txt на своём сайте и честно ответить себе на вопрос: эти правила писались с расчётом на ИИ-поиск или это наследие старой логики?
Третье — проверить, доступен ли для индексации ИИ-системами весь ценный контент: новости, экспертные статьи, уникальные данные. Если аудитория ищет это через AI Overviews, а доступа нет — ты сам себе закрыл дверь.
Четвёртое — начать мониторить, где и как твой контент появляется в ИИ-ответах, и смотреть, как это соотносится с трафиком. Без этого любые изменения настроек — стрельба вслепую.
И пятое, самое скучное, но самое полезное — задокументировать правильную конфигурацию, чтобы на будущих проектах не повторять одну и ту же ошибку по кругу. Разгребать последствия неверных настроек всегда дольше, чем один раз всё сделать правильно.
Что с этим у нас в России
У нас пока нет прямого аналога AI Overviews в Яндексе в том же масштабе, но логика та же: чем активнее поисковики учатся собирать ответы из контента напрямую, тем важнее не путать техническое управление сканированием с управлением видимостью в готовом ИИ-ответе. Это тот случай, когда стоит разобраться заранее, а не когда трафик уже упал и непонятно, откуда.
Вывод
Robots.txt делает свою работу — управляет сканированием. Но он не управляет тем, что происходит после — окажется ли твой контент в ИИ-ответе или нет. Если ты давно не пересматривал техническую конфигурацию сайта с учётом новых реалий поиска, начните с SEO-аудита.