Директиви disallow і allow — це основні правила у файлі robots.txt, якими власник сайту керує тим, які сторінки й розділи пошукові краулери можуть сканувати. Disallow забороняє сканування вказаного шляху, Allow — навпаки, дозволяє (зокрема, робить виняток усередині забороненого розділу).
Простими словами: robots.txt — це список правил на вході. Disallow — це «сюди роботам не можна», Allow — «а ось цю кімнату всередині — можна».
Що таке ці директиви і навіщо вони потрібні
Не весь сайт корисно віддавати на сканування. Адмінка, кошик, службові скрипти, дублі фільтрів — усе це варто прибрати з-під уваги краулера, щоб він витрачав краулінговий бюджет на важливі сторінки. Disallow і Allow — саме той інструмент. Важливо розуміти межу: ці директиви керують скануванням, а не індексацією. Заборона в robots.txt не гарантує, що сторінка зникне з видачі — для цього потрібен noindex.
Синтаксис і приклад коду
Файл robots.txt лежить у корені сайту. Базова структура:
User-agent: *
Disallow: /admin/
Disallow: /cart/
Allow: /admin/help/
Sitemap: https://site.com/sitemap.xmlТут усім роботам (User-agent: *) заборонено сканувати /admin/ і /cart/, але дозволено виняток — /admin/help/. Порожній Disallow: (без шляху) означає «дозволено все».
Типові помилки
- Випадкове
Disallow: /— закриває весь сайт від сканування. Класична катастрофа після переносу з тесту. - Заборона потрібних ресурсів — закритий CSS/JS заважає Google коректно відрендерити сторінку.
- Плутанина зі скануванням та індексацією — сподіваються прибрати сторінку з пошуку через
Disallow, але вона лишається в індексі без опису.
Приклад
Магазин закриває від сканування сторінки фільтрів /catalog/?filter=, щоб робот не блукав тисячами комбінацій параметрів і не «з’їдав» краулінговий бюджет. При цьому основні категорії каталогу лишаються відкритими. Один рядок Disallow тут економить ресурс сканування для дійсно важливих сторінок.
Часто плутають з…
- noindex — це заборона індексації (сторінка не в пошуку);
Disallow— заборона сканування (робот не заходить). Це різні речі, і плутати їх небезпечно. - Мета-тег robots — керує поведінкою на рівні окремої сторінки; директиви robots.txt діють на рівні шляхів і розділів.
Питання та відповіді
Чи прибирає Disallow сторінку з пошуку?
Не обов’язково. Disallow забороняє сканування, але сторінка може лишитися в індексі (наприклад, якщо на неї є посилання). Щоб гарантовано прибрати з видачі — потрібен noindex, і сторінку не можна одночасно закривати в robots.txt.
Навіщо потрібна директива Allow?
Allow робить винятки всередині забороненого розділу. Наприклад, закрити всю /admin/, але відкрити один потрібний підрозділ.
Де лежить файл robots.txt?
У корені домену — за адресою site.com/robots.txt. Саме там його шукають усі краулери.
Не впевнені, що robots.txt налаштований правильно? Перевіримо директиви й сканування — SEO-аудит та виправлення помилок на сайті.
Схожі терміни: robots.txt, noindex, Індексація, Краулінговий бюджет, Sitemap.