robots.txt — это не закон, а рекомендация
Тут многие удивятся, но факт остаётся фактом: robots.txt для Google — это не жёсткая команда, а скорее просьба.
Джон Мюллер из Google прямо объяснил, что поисковик может её игнорировать. Причём не из вредности, а из-за конкретных технических причин.
Обычно это случается, когда файл сам себе противоречит, когда есть проблемы с доступом к серверу, или когда правила настроены криво. Google в такой ситуации не встаёт в ступор, а принимает решение сам — и не всегда то, которое ты бы хотел.
Почему так вообще происходит
Смотри, что тут важно понять: robots.txt — это протокол-соглашение, а не система прав доступа.
Он говорит роботу «не ходи туда», но физически ничего не блокирует. Если Google видит конфликт правил или не может нормально получить сам файл robots.txt (например, сервер отдаёт ошибку или таймаут), у него включается запасной сценарий поведения.
И этот сценарий не обязан совпадать с твоими ожиданиями. Иногда Google решает, что лучше проиндексировать страницу, чем рисковать потерей важного контента из-за кривого файла.
Отсюда и странности, которые владельцы сайтов иногда видят в панели вебмастера: страница закрыта в robots.txt, а в индексе всё равно висит.
Где чаще всего теряют контроль
На практике проблема почти всегда growит из невнимательности на этапе разработки. Синтаксис robots.txt простой, но именно поэтому в него легко накосячить.
Частая история — блокировка папок с CSS и JS. Разработчик хочет закрыть технические директории от индексации, но заодно перекрывает Googlebot доступ к ресурсам, которые нужны для рендеринга страницы. Результат — робот видит кривую, “сломанную” версию страницы и оценивает её хуже, чем она есть на самом деле.
Ещё одна классика — противоречащие друг другу директивы Allow и Disallow, когда непонятно, какое правило должно победить. Тут Google принимает решение по своей логике, и она не всегда совпадает с твоей.
Что с этим делать по-хозяйски
Первое — не относись к robots.txt как к единственному рубежу защиты. Это инструмент управления краулингом, а не блокировка индексации в чистом виде.
Если тебе принципиально важно, чтобы страница не попала в индекс, надёжнее использовать мета-тег noindex или заголовок X-Robots-Tag. Они работают на уровне самой страницы, а не на уровне рекомендации роботу — и Google их учитывает совсем иначе.
Второе — регулярно проверяй файл в Google Search Console. Там есть инструмент проверки robots.txt, который показывает, как Google реально трактует твои правила. Не поленись зайти и свериться хотя бы раз в квартал, особенно после любых изменений структуры сайта.
Третье — держи руки прочь от CSS и JS в правилах блокировки, если только это не осознанное решение с полным пониманием последствий для рендеринга.
Четвёртое — следи за логикой самого файла. Если правила накладываются друг на друга и противоречат — рано или поздно это вылезет неприятным сюрпризом в индексации.
Почему это не мелочь
Казалось бы, один текстовый файл на несколько строк. Но именно через него часто утекает бюджет краулинга, теряется доступ к нужным страницам или наоборот — в индекс попадает то, что там быть не должно.
Для крупных сайтов — интернет-магазинов с тысячами карточек товаров, каталогов, контентных проектов — ошибка в robots.txt может стоить реальных позиций и трафика. И заметить это не всегда просто: сайт вроде работает, но что-то не так с видимостью в поиске.
Неужели стоит оставлять такой важный механизм на волю случая?
Итог
robots.txt — рабочий инструмент, но не гарантия. Google может отступить от его правил при ошибках и конфликтах, поэтому критичные решения об индексации лучше подкреплять мета-тегами и регулярной проверкой в панели вебмастера — а если хочется разобраться, что реально происходит с твоим сайтом в глазах поисковика, начать стоит с технического SEO-аудита.