Robots.txt

Robots.txt — це текстовий файл у корені сайту, який керує обходом: підказує пошуковим роботам, які розділи чи сторінки можна сканувати, а які — ні. Він складається з директив User-agent, Disallow, Allow і Sitemap. Важливо: robots.txt керує саме скануванням, а не індексацією сторінок.

Простими словами: це записка охоронцю на вході — «сюди можна, а в ці двері не заглядай». Але записка радше про те, куди ходити, а не про те, що потім розповідати іншим.

Що таке robots.txt і навіщо він потрібен

Файл лежить за адресою site.com/robots.txt і завантажується роботом найпершим, ще до обходу сторінок. Головна користь — економія краулінгового бюджету: ви закриваєте від сканування те, що не має бути в пошуку (адмінку, кошик, службові скрипти, фільтри-дублі), і робот витрачає ресурс на важливі сторінки.

Ключовий нюанс, на якому часто помиляються: robots.txt керує скануванням, а не індексацією. Якщо на закриту сторінку ведуть зовнішні посилання, Google може все одно показати її у видачі — без опису, але в індексі. Щоб гарантовано прибрати сторінку з пошуку, потрібен саме noindex, а не заборона в robots.txt.

Синтаксис і приклад коду

User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Disallow: /cart/
Sitemap: https://pro-fits.com.ua/sitemap.xml

Тут User-agent: * — правила для всіх роботів; Disallow закриває розділ від сканування; Allow робить виняток усередині закритого; Sitemap вказує шлях до карти сайту. Один зайвий Disallow: / здатен закрити від обходу весь сайт — тому файл перевіряють особливо уважно.

Приклад

Магазин закрив у robots.txt сотні сторінок фільтрів-дублів (Disallow: /*?filter=), щоб робот не витрачав на них краулінговий бюджет. Через кілька тижнів Googlebot почав частіше обходити картки товарів і категорії — саме ті сторінки, що приносять трафік.

Часто плутають з…

  • Noindex — керує індексацією (чи буде сторінка в пошуку); robots.txt керує скануванням (чи зайде на неї робот). Це різні речі.
  • Sitemap.xml — навпаки, підказує роботу, що обійти; robots.txt здебільшого — що НЕ обходити.

Питання та відповіді

Robots.txt забороняє індексацію сторінки?

Ні. Він керує лише скануванням. Закрита в robots.txt сторінка все одно може потрапити в індекс за зовнішніми посиланнями — для гарантованого видалення потрібен noindex.

Де має лежати файл robots.txt?

Тільки в корені домену: site.com/robots.txt. В іншому місці робот його не шукатиме й проігнорує.

Що станеться при помилковому Disallow: /?

Ви закриєте від сканування весь сайт. Це класична критична помилка, тому кожну зміну robots.txt варто перевіряти у валідаторі.

Не впевнені, що robots.txt не ріже зайве? Перевіримо директиви й індексацію — SEO-аудит та виправлення помилок на сайті.

Схожі терміни: Disallow і Allow, Краулінговий бюджет, Noindex, Sitemap, Індексація.

Опишіть свій запит
і ми зробимо для Вас
пропозицію

Напишіть мені, щоб бути в ТОП

    [telegram]
    • icon-google-partner
    • icon-google-analytics
    • icon-google-ads-color