Crawler Directives

Crawler Directives (директиви для роботів) — це набір інструкцій, якими сайт повідомляє пошуковим роботам, що можна сканувати й індексувати, а що — ні. Основні механізми: файл robots.txt, метатег robots і HTTP-заголовок X-Robots-Tag. Разом вони дають контроль над тим, як Google працює з вашими сторінками.

Простими словами: це дорожні знаки для роботів. Один каже «сюди не заїжджай», інший — «заїхати можна, але не показуй цю адресу в пошуку».

Що таке Crawler Directives і навіщо вони потрібні

Без директив робот обійде й спробує проіндексувати геть усе, до чого дотягнеться, — включно зі службовими сторінками, кошиком, результатами внутрішнього пошуку й дублями. Crawler Directives дозволяють навести лад: зекономити краулінговий бюджет, прибрати з пошуку непотрібне й уникнути проблем із дублікатами. Це один із базових інструментів технічного SEO — і водночас джерело найприкріших помилок, коли випадково закривають потрібне.

Три рівні директив

  • robots.txt — керує скануванням: пускати робота в розділ чи ні. Не гарантує зникнення з пошуку.
  • Meta robots — тег у <head> сторінки, керує індексацією й переходом по посиланнях (noindex, nofollow).
  • X-Robots-Tag — той самий набір команд, але у HTTP-заголовку; зручний для не-HTML файлів (PDF, зображення).

Синтаксис і приклад коду

robots.txt (закрити розділ від сканування):

User-agent: *
Disallow: /wp-admin/

Meta robots (не індексувати сторінку, але переходити по посиланнях):

<meta name="robots" content="noindex, follow">

X-Robots-Tag (закрити PDF від індексації через заголовок):

X-Robots-Tag: noindex

Приклад

Типова пастка: сторінку закрили в robots.txt, щоб прибрати з пошуку. Але робот через це не може прочитати noindex на самій сторінці — і якщо на неї є зовнішні посилання, вона може лишитися в індексі як «порожній» результат. Правильно: щоб надійно прибрати сторінку з пошуку, її треба залишити відкритою для сканування й поставити noindex.

Часто плутають з…

  • robots.txt vs noindex — перший забороняє обхід, другий — показ у пошуку. Це різні цілі й різні механізми.
  • Canonical — це рекомендація щодо головної версії дублів, а не заборона; директиви жорсткіші.

Питання та відповіді

Що таке Crawler Directives простими словами?

Це інструкції, якими сайт керує пошуковими роботами: що сканувати, а що індексувати. Реалізуються через robots.txt, метатег robots і заголовок X-Robots-Tag.

Чим robots.txt відрізняється від noindex?

robots.txt керує скануванням — пускати робота на сторінку чи ні. noindex керує індексацією — показувати сторінку в пошуку чи ні. Щоб прибрати URL із видачі, потрібен саме noindex на відкритій для обходу сторінці.

Де прописувати директиви для роботів?

robots.txt — у корені сайту, meta robots — у секції <head> конкретної сторінки, X-Robots-Tag — у налаштуваннях сервера як HTTP-заголовок (зручно для файлів).

Плутанина з robots.txt і noindex закрила потрібні сторінки? Наведемо лад із директивами в межах SEO-аудиту та технічних правок.

Схожі терміни: robots.txt, noindex, Canonical, Індексація, Crawl Error.

Опишіть свій запит
і ми зробимо для Вас
пропозицію

Напишіть мені, щоб бути в ТОП

    [telegram]
    • icon-google-partner
    • icon-google-analytics
    • icon-google-ads-color