Crawler Directives (директиви для роботів) — це набір інструкцій, якими сайт повідомляє пошуковим роботам, що можна сканувати й індексувати, а що — ні. Основні механізми: файл robots.txt, метатег robots і HTTP-заголовок X-Robots-Tag. Разом вони дають контроль над тим, як Google працює з вашими сторінками.
Простими словами: це дорожні знаки для роботів. Один каже «сюди не заїжджай», інший — «заїхати можна, але не показуй цю адресу в пошуку».
Що таке Crawler Directives і навіщо вони потрібні
Без директив робот обійде й спробує проіндексувати геть усе, до чого дотягнеться, — включно зі службовими сторінками, кошиком, результатами внутрішнього пошуку й дублями. Crawler Directives дозволяють навести лад: зекономити краулінговий бюджет, прибрати з пошуку непотрібне й уникнути проблем із дублікатами. Це один із базових інструментів технічного SEO — і водночас джерело найприкріших помилок, коли випадково закривають потрібне.
Три рівні директив
- robots.txt — керує скануванням: пускати робота в розділ чи ні. Не гарантує зникнення з пошуку.
- Meta robots — тег у
<head>сторінки, керує індексацією й переходом по посиланнях (noindex, nofollow). - X-Robots-Tag — той самий набір команд, але у HTTP-заголовку; зручний для не-HTML файлів (PDF, зображення).
Синтаксис і приклад коду
robots.txt (закрити розділ від сканування):
User-agent: *
Disallow: /wp-admin/
Meta robots (не індексувати сторінку, але переходити по посиланнях):
<meta name="robots" content="noindex, follow">
X-Robots-Tag (закрити PDF від індексації через заголовок):
X-Robots-Tag: noindex
Приклад
Типова пастка: сторінку закрили в robots.txt, щоб прибрати з пошуку. Але робот через це не може прочитати noindex на самій сторінці — і якщо на неї є зовнішні посилання, вона може лишитися в індексі як «порожній» результат. Правильно: щоб надійно прибрати сторінку з пошуку, її треба залишити відкритою для сканування й поставити noindex.
Часто плутають з…
- robots.txt vs noindex — перший забороняє обхід, другий — показ у пошуку. Це різні цілі й різні механізми.
- Canonical — це рекомендація щодо головної версії дублів, а не заборона; директиви жорсткіші.
Питання та відповіді
Що таке Crawler Directives простими словами?
Це інструкції, якими сайт керує пошуковими роботами: що сканувати, а що індексувати. Реалізуються через robots.txt, метатег robots і заголовок X-Robots-Tag.
Чим robots.txt відрізняється від noindex?
robots.txt керує скануванням — пускати робота на сторінку чи ні. noindex керує індексацією — показувати сторінку в пошуку чи ні. Щоб прибрати URL із видачі, потрібен саме noindex на відкритій для обходу сторінці.
Де прописувати директиви для роботів?
robots.txt — у корені сайту, meta robots — у секції <head> конкретної сторінки, X-Robots-Tag — у налаштуваннях сервера як HTTP-заголовок (зручно для файлів).
Плутанина з robots.txt і noindex закрила потрібні сторінки? Наведемо лад із директивами в межах SEO-аудиту та технічних правок.
Схожі терміни: robots.txt, noindex, Canonical, Індексація, Crawl Error.