Crawler Directives

Crawler Directives (директивы для роботов) — это набор инструкций, которыми сайт сообщает поисковым роботам, что можно сканировать и индексировать, а что — нет. Основные механизмы: файл robots.txt, метатег robots и HTTP-заголовок X-Robots-Tag. Вместе они дают контроль над тем, как Google работает с вашими страницами.

Простыми словами: это дорожные знаки для роботов. Один говорит «сюда не заезжай», другой — «заехать можно, но не показывай этот адрес в поиске».

Что такое Crawler Directives и зачем они нужны

Без директив робот обойдёт и попытается проиндексировать вообще всё, до чего дотянется, — включая служебные страницы, корзину, результаты внутреннего поиска и дубли. Crawler Directives позволяют навести порядок: сэкономить краулинговый бюджет, убрать из поиска ненужное и избежать проблем с дубликатами. Это один из базовых инструментов технического SEO — и одновременно источник самых досадных ошибок, когда случайно закрывают нужное.

Три уровня директив

  • robots.txt — управляет сканированием: пускать робота в раздел или нет. Не гарантирует исчезновения из поиска.
  • Meta robots — тег в <head> страницы, управляет индексацией и переходом по ссылкам (noindex, nofollow).
  • X-Robots-Tag — тот же набор команд, но в HTTP-заголовке; удобен для не-HTML файлов (PDF, изображения).

Синтаксис и пример кода

robots.txt (закрыть раздел от сканирования):

User-agent: *
Disallow: /wp-admin/

Meta robots (не индексировать страницу, но переходить по ссылкам):

<meta name="robots" content="noindex, follow">

X-Robots-Tag (закрыть PDF от индексации через заголовок):

X-Robots-Tag: noindex

Пример

Типичная ловушка: страницу закрыли в robots.txt, чтобы убрать из поиска. Но робот из-за этого не может прочитать noindex на самой странице — и если на неё есть внешние ссылки, она может остаться в индексе как «пустой» результат. Правильно: чтобы надёжно убрать страницу из поиска, её нужно оставить открытой для сканирования и поставить noindex.

Часто путают с…

  • robots.txt vs noindex — первый запрещает обход, второй — показ в поиске. Это разные цели и разные механизмы.
  • Canonical — это рекомендация о главной версии дублей, а не запрет; директивы жёстче.

Вопросы и ответы

Что такое Crawler Directives простыми словами?

Это инструкции, которыми сайт управляет поисковыми роботами: что сканировать, а что индексировать. Реализуются через robots.txt, метатег robots и заголовок X-Robots-Tag.

Чем robots.txt отличается от noindex?

robots.txt управляет сканированием — пускать робота на страницу или нет. noindex управляет индексацией — показывать страницу в поиске или нет. Чтобы убрать URL из выдачи, нужен именно noindex на открытой для обхода странице.

Где прописывать директивы для роботов?

robots.txt — в корне сайта, meta robots — в секции <head> конкретной страницы, X-Robots-Tag — в настройках сервера как HTTP-заголовок (удобно для файлов).

Путаница с robots.txt и noindex закрыла нужные страницы? Наведём порядок с директивами в рамках SEO-аудита и технических правок.

Похожие термины: robots.txt, noindex, Canonical, Индексация, Crawl Error.

Опишіть свій запит
і ми зробимо для Вас
пропозицію

Напишіть мені, щоб бути в ТОП

    [telegram]
    • icon-google-ads-color
    • icon-google-analytics
    • icon-google-partner