Robots.txt — это текстовый файл в корне сайта, который управляет обходом: подсказывает поисковым роботам, какие разделы или страницы можно сканировать, а какие — нет. Он состоит из директив User-agent, Disallow, Allow и Sitemap. Важно: robots.txt управляет именно сканированием, а не индексацией страниц.
Простыми словами: это записка охраннику на входе — «сюда можно, а в эти двери не заглядывай». Но записка скорее о том, куда ходить, а не о том, что потом рассказывать другим.
Что такое robots.txt и зачем он нужен
Файл лежит по адресу site.com/robots.txt и загружается роботом самым первым, ещё до обхода страниц. Главная польза — экономия краулингового бюджета: вы закрываете от сканирования то, что не должно быть в поиске (админку, корзину, служебные скрипты, фильтры-дубли), и робот тратит ресурс на важные страницы.
Ключевой нюанс, на котором часто ошибаются: robots.txt управляет сканированием, а не индексацией. Если на закрытую страницу ведут внешние ссылки, Google может всё равно показать её в выдаче — без описания, но в индексе. Чтобы гарантированно убрать страницу из поиска, нужен именно noindex, а не запрет в robots.txt.
Синтаксис и пример кода
User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Disallow: /cart/
Sitemap: https://pro-fits.com.ua/sitemap.xmlЗдесь User-agent: * — правила для всех роботов; Disallow закрывает раздел от сканирования; Allow делает исключение внутри закрытого; Sitemap указывает путь к карте сайта. Один лишний Disallow: / способен закрыть от обхода весь сайт — поэтому файл проверяют особенно внимательно.
Пример
Магазин закрыл в robots.txt сотни страниц фильтров-дублей (Disallow: /*?filter=), чтобы робот не тратил на них краулинговый бюджет. Через несколько недель Googlebot стал чаще обходить карточки товаров и категории — именно те страницы, что приносят трафик.
Часто путают с…
- Noindex — управляет индексацией (будет ли страница в поиске); robots.txt управляет сканированием (зайдёт ли на неё робот). Это разные вещи.
- Sitemap.xml — наоборот, подсказывает роботу, что обойти; robots.txt в основном — что НЕ обходить.
Вопросы и ответы
Robots.txt запрещает индексацию страницы?
Нет. Он управляет только сканированием. Закрытая в robots.txt страница всё равно может попасть в индекс по внешним ссылкам — для гарантированного удаления нужен noindex.
Где должен лежать файл robots.txt?
Только в корне домена: site.com/robots.txt. В другом месте робот его не будет искать и проигнорирует.
Что произойдёт при ошибочном Disallow: /?
Вы закроете от сканирования весь сайт. Это классическая критическая ошибка, поэтому каждое изменение robots.txt стоит проверять в валидаторе.
Не уверены, что robots.txt не режет лишнее? Проверим директивы и индексацию — SEO-аудит и исправление ошибок на сайте.
Похожие термины: Disallow и Allow, Краулинговый бюджет, Noindex, Sitemap, Индексация.
Опишіть свій запит
і ми зробимо для Вас
пропозицію
Напишіть мені, щоб бути в ТОП
- Продвижение сайтов в Днепре
- Продвижение сайтов в Чернигове
- Продвижение сайтов в Николаеве
- Продвижение сайтов в Одессе
- Продвижение сайтов в Виннице
- Продвижение сайтов в Полтаве
- Продвижение сайтов в Черкассах
- Продвижение сайтов в Запорожье
- Продвижение сайтов в Ивано-Франковске
- Продвижение сайтов в Харькове