Директивы disallow и allow

Директивы disallow и allow — это основные правила в файле robots.txt, которыми владелец сайта управляет тем, какие страницы и разделы поисковые краулеры могут сканировать. Disallow запрещает сканирование указанного пути, Allow — наоборот, разрешает (в том числе делает исключение внутри запрещённого раздела).

Простыми словами: robots.txt — это список правил на входе. Disallow — это «сюда роботам нельзя», Allow — «а вот эту комнату внутри — можно».

Что такое эти директивы и зачем они нужны

Не весь сайт полезно отдавать на сканирование. Админка, корзина, служебные скрипты, дубли фильтров — всё это стоит убрать из-под внимания краулера, чтобы он тратил краулинговый бюджет на важные страницы. Disallow и Allow — именно тот инструмент. Важно понимать грань: эти директивы управляют сканированием, а не индексацией. Запрет в robots.txt не гарантирует, что страница исчезнет из выдачи — для этого нужен noindex.

Синтаксис и пример кода

Файл robots.txt лежит в корне сайта. Базовая структура:

User-agent: *
Disallow: /admin/
Disallow: /cart/
Allow: /admin/help/

Sitemap: https://site.com/sitemap.xml

Здесь всем роботам (User-agent: *) запрещено сканировать /admin/ и /cart/, но разрешено исключение — /admin/help/. Пустой Disallow: (без пути) означает «разрешено всё».

Типичные ошибки

  • Случайный Disallow: / — закрывает весь сайт от сканирования. Классическая катастрофа после переноса с теста.
  • Запрет нужных ресурсов — закрытый CSS/JS мешает Google корректно отрендерить страницу.
  • Путаница между сканированием и индексацией — надеются убрать страницу из поиска через Disallow, но она остаётся в индексе без описания.

Пример

Магазин закрывает от сканирования страницы фильтров /catalog/?filter=, чтобы робот не блуждал тысячами комбинаций параметров и не «съедал» краулинговый бюджет. При этом основные категории каталога остаются открытыми. Одна строка Disallow здесь экономит ресурс сканирования для действительно важных страниц.

Часто путают с…

  • noindex — это запрет индексации (страница не в поиске); Disallow — запрет сканирования (робот не заходит). Это разные вещи, и путать их опасно.
  • Мета-тег robots — управляет поведением на уровне отдельной страницы; директивы robots.txt действуют на уровне путей и разделов.

Вопросы и ответы

Убирает ли Disallow страницу из поиска?

Не обязательно. Disallow запрещает сканирование, но страница может остаться в индексе (например, если на неё есть ссылки). Чтобы гарантированно убрать из выдачи — нужен noindex, и страницу нельзя одновременно закрывать в robots.txt.

Зачем нужна директива Allow?

Allow делает исключения внутри запрещённого раздела. Например, закрыть всю /admin/, но открыть один нужный подраздел.

Где лежит файл robots.txt?

В корне домена — по адресу site.com/robots.txt. Именно там его ищут все краулеры.

Не уверены, что robots.txt настроен правильно? Проверим директивы и сканирование — SEO-аудит и исправление ошибок на сайте.

Похожие термины: robots.txt, noindex, Индексация, Краулинговый бюджет, Sitemap.

Опишіть свій запит
і ми зробимо для Вас
пропозицію

Напишіть мені, щоб бути в ТОП

    [telegram]
    • icon-google-ads-color
    • icon-google-analytics
    • icon-google-partner