Robots.txt

Robots.txt — это текстовый файл в корне сайта, который управляет обходом: подсказывает поисковым роботам, какие разделы или страницы можно сканировать, а какие — нет. Он состоит из директив User-agent, Disallow, Allow и Sitemap. Важно: robots.txt управляет именно сканированием, а не индексацией страниц.

Простыми словами: это записка охраннику на входе — «сюда можно, а в эти двери не заглядывай». Но записка скорее о том, куда ходить, а не о том, что потом рассказывать другим.

Что такое robots.txt и зачем он нужен

Файл лежит по адресу site.com/robots.txt и загружается роботом самым первым, ещё до обхода страниц. Главная польза — экономия краулингового бюджета: вы закрываете от сканирования то, что не должно быть в поиске (админку, корзину, служебные скрипты, фильтры-дубли), и робот тратит ресурс на важные страницы.

Ключевой нюанс, на котором часто ошибаются: robots.txt управляет сканированием, а не индексацией. Если на закрытую страницу ведут внешние ссылки, Google может всё равно показать её в выдаче — без описания, но в индексе. Чтобы гарантированно убрать страницу из поиска, нужен именно noindex, а не запрет в robots.txt.

Синтаксис и пример кода

User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Disallow: /cart/
Sitemap: https://pro-fits.com.ua/sitemap.xml

Здесь User-agent: * — правила для всех роботов; Disallow закрывает раздел от сканирования; Allow делает исключение внутри закрытого; Sitemap указывает путь к карте сайта. Один лишний Disallow: / способен закрыть от обхода весь сайт — поэтому файл проверяют особенно внимательно.

Пример

Магазин закрыл в robots.txt сотни страниц фильтров-дублей (Disallow: /*?filter=), чтобы робот не тратил на них краулинговый бюджет. Через несколько недель Googlebot стал чаще обходить карточки товаров и категории — именно те страницы, что приносят трафик.

Часто путают с…

  • Noindex — управляет индексацией (будет ли страница в поиске); robots.txt управляет сканированием (зайдёт ли на неё робот). Это разные вещи.
  • Sitemap.xml — наоборот, подсказывает роботу, что обойти; robots.txt в основном — что НЕ обходить.

Вопросы и ответы

Robots.txt запрещает индексацию страницы?

Нет. Он управляет только сканированием. Закрытая в robots.txt страница всё равно может попасть в индекс по внешним ссылкам — для гарантированного удаления нужен noindex.

Где должен лежать файл robots.txt?

Только в корне домена: site.com/robots.txt. В другом месте робот его не будет искать и проигнорирует.

Что произойдёт при ошибочном Disallow: /?

Вы закроете от сканирования весь сайт. Это классическая критическая ошибка, поэтому каждое изменение robots.txt стоит проверять в валидаторе.

Не уверены, что robots.txt не режет лишнее? Проверим директивы и индексацию — SEO-аудит и исправление ошибок на сайте.

Похожие термины: Disallow и Allow, Краулинговый бюджет, Noindex, Sitemap, Индексация.

Опишіть свій запит
і ми зробимо для Вас
пропозицію

Напишіть мені, щоб бути в ТОП

    [telegram]
    • icon-google-ads-color
    • icon-google-analytics
    • icon-google-partner