Crawler Directives (директивы для роботов) — это набор инструкций, которыми сайт сообщает поисковым роботам, что можно сканировать и индексировать, а что — нет. Основные механизмы: файл robots.txt, метатег robots и HTTP-заголовок X-Robots-Tag. Вместе они дают контроль над тем, как Google работает с вашими страницами.
Простыми словами: это дорожные знаки для роботов. Один говорит «сюда не заезжай», другой — «заехать можно, но не показывай этот адрес в поиске».
Что такое Crawler Directives и зачем они нужны
Без директив робот обойдёт и попытается проиндексировать вообще всё, до чего дотянется, — включая служебные страницы, корзину, результаты внутреннего поиска и дубли. Crawler Directives позволяют навести порядок: сэкономить краулинговый бюджет, убрать из поиска ненужное и избежать проблем с дубликатами. Это один из базовых инструментов технического SEO — и одновременно источник самых досадных ошибок, когда случайно закрывают нужное.
Три уровня директив
- robots.txt — управляет сканированием: пускать робота в раздел или нет. Не гарантирует исчезновения из поиска.
- Meta robots — тег в
<head>страницы, управляет индексацией и переходом по ссылкам (noindex, nofollow). - X-Robots-Tag — тот же набор команд, но в HTTP-заголовке; удобен для не-HTML файлов (PDF, изображения).
Синтаксис и пример кода
robots.txt (закрыть раздел от сканирования):
User-agent: *
Disallow: /wp-admin/
Meta robots (не индексировать страницу, но переходить по ссылкам):
<meta name="robots" content="noindex, follow">
X-Robots-Tag (закрыть PDF от индексации через заголовок):
X-Robots-Tag: noindex
Пример
Типичная ловушка: страницу закрыли в robots.txt, чтобы убрать из поиска. Но робот из-за этого не может прочитать noindex на самой странице — и если на неё есть внешние ссылки, она может остаться в индексе как «пустой» результат. Правильно: чтобы надёжно убрать страницу из поиска, её нужно оставить открытой для сканирования и поставить noindex.
Часто путают с…
- robots.txt vs noindex — первый запрещает обход, второй — показ в поиске. Это разные цели и разные механизмы.
- Canonical — это рекомендация о главной версии дублей, а не запрет; директивы жёстче.
Вопросы и ответы
Что такое Crawler Directives простыми словами?
Это инструкции, которыми сайт управляет поисковыми роботами: что сканировать, а что индексировать. Реализуются через robots.txt, метатег robots и заголовок X-Robots-Tag.
Чем robots.txt отличается от noindex?
robots.txt управляет сканированием — пускать робота на страницу или нет. noindex управляет индексацией — показывать страницу в поиске или нет. Чтобы убрать URL из выдачи, нужен именно noindex на открытой для обхода странице.
Где прописывать директивы для роботов?
robots.txt — в корне сайта, meta robots — в секции <head> конкретной страницы, X-Robots-Tag — в настройках сервера как HTTP-заголовок (удобно для файлов).
Путаница с robots.txt и noindex закрыла нужные страницы? Наведём порядок с директивами в рамках SEO-аудита и технических правок.
Похожие термины: robots.txt, noindex, Canonical, Индексация, Crawl Error.
Опишіть свій запит
і ми зробимо для Вас
пропозицію
Напишіть мені, щоб бути в ТОП
- Продвижение сайтов в Днепре
- Продвижение сайтов в Чернигове
- Продвижение сайтов в Николаеве
- Продвижение сайтов в Одессе
- Продвижение сайтов в Виннице
- Продвижение сайтов в Полтаве
- Продвижение сайтов в Черкассах
- Продвижение сайтов в Запорожье
- Продвижение сайтов в Ивано-Франковске
- Продвижение сайтов в Харькове