Директиви disallow і allow

Директиви disallow і allow — це основні правила у файлі robots.txt, якими власник сайту керує тим, які сторінки й розділи пошукові краулери можуть сканувати. Disallow забороняє сканування вказаного шляху, Allow — навпаки, дозволяє (зокрема, робить виняток усередині забороненого розділу).

Простими словами: robots.txt — це список правил на вході. Disallow — це «сюди роботам не можна», Allow — «а ось цю кімнату всередині — можна».

Що таке ці директиви і навіщо вони потрібні

Не весь сайт корисно віддавати на сканування. Адмінка, кошик, службові скрипти, дублі фільтрів — усе це варто прибрати з-під уваги краулера, щоб він витрачав краулінговий бюджет на важливі сторінки. Disallow і Allow — саме той інструмент. Важливо розуміти межу: ці директиви керують скануванням, а не індексацією. Заборона в robots.txt не гарантує, що сторінка зникне з видачі — для цього потрібен noindex.

Синтаксис і приклад коду

Файл robots.txt лежить у корені сайту. Базова структура:

User-agent: *
Disallow: /admin/
Disallow: /cart/
Allow: /admin/help/

Sitemap: https://site.com/sitemap.xml

Тут усім роботам (User-agent: *) заборонено сканувати /admin/ і /cart/, але дозволено виняток — /admin/help/. Порожній Disallow: (без шляху) означає «дозволено все».

Типові помилки

  • Випадкове Disallow: / — закриває весь сайт від сканування. Класична катастрофа після переносу з тесту.
  • Заборона потрібних ресурсів — закритий CSS/JS заважає Google коректно відрендерити сторінку.
  • Плутанина зі скануванням та індексацією — сподіваються прибрати сторінку з пошуку через Disallow, але вона лишається в індексі без опису.

Приклад

Магазин закриває від сканування сторінки фільтрів /catalog/?filter=, щоб робот не блукав тисячами комбінацій параметрів і не «з’їдав» краулінговий бюджет. При цьому основні категорії каталогу лишаються відкритими. Один рядок Disallow тут економить ресурс сканування для дійсно важливих сторінок.

Часто плутають з…

  • noindex — це заборона індексації (сторінка не в пошуку); Disallow — заборона сканування (робот не заходить). Це різні речі, і плутати їх небезпечно.
  • Мета-тег robots — керує поведінкою на рівні окремої сторінки; директиви robots.txt діють на рівні шляхів і розділів.

Питання та відповіді

Чи прибирає Disallow сторінку з пошуку?

Не обов’язково. Disallow забороняє сканування, але сторінка може лишитися в індексі (наприклад, якщо на неї є посилання). Щоб гарантовано прибрати з видачі — потрібен noindex, і сторінку не можна одночасно закривати в robots.txt.

Навіщо потрібна директива Allow?

Allow робить винятки всередині забороненого розділу. Наприклад, закрити всю /admin/, але відкрити один потрібний підрозділ.

Де лежить файл robots.txt?

У корені домену — за адресою site.com/robots.txt. Саме там його шукають усі краулери.

Не впевнені, що robots.txt налаштований правильно? Перевіримо директиви й сканування — SEO-аудит та виправлення помилок на сайті.

Схожі терміни: robots.txt, noindex, Індексація, Краулінговий бюджет, Sitemap.

Опишіть свій запит
і ми зробимо для Вас
пропозицію

Напишіть мені, щоб бути в ТОП

    [telegram]
    • icon-google-partner
    • icon-google-analytics
    • icon-google-ads-color