Robots.txt — це текстовий файл у корені сайту, який керує обходом: підказує пошуковим роботам, які розділи чи сторінки можна сканувати, а які — ні. Він складається з директив User-agent, Disallow, Allow і Sitemap. Важливо: robots.txt керує саме скануванням, а не індексацією сторінок.
Простими словами: це записка охоронцю на вході — «сюди можна, а в ці двері не заглядай». Але записка радше про те, куди ходити, а не про те, що потім розповідати іншим.
Що таке robots.txt і навіщо він потрібен
Файл лежить за адресою site.com/robots.txt і завантажується роботом найпершим, ще до обходу сторінок. Головна користь — економія краулінгового бюджету: ви закриваєте від сканування те, що не має бути в пошуку (адмінку, кошик, службові скрипти, фільтри-дублі), і робот витрачає ресурс на важливі сторінки.
Ключовий нюанс, на якому часто помиляються: robots.txt керує скануванням, а не індексацією. Якщо на закриту сторінку ведуть зовнішні посилання, Google може все одно показати її у видачі — без опису, але в індексі. Щоб гарантовано прибрати сторінку з пошуку, потрібен саме noindex, а не заборона в robots.txt.
Синтаксис і приклад коду
User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Disallow: /cart/
Sitemap: https://pro-fits.com.ua/sitemap.xmlТут User-agent: * — правила для всіх роботів; Disallow закриває розділ від сканування; Allow робить виняток усередині закритого; Sitemap вказує шлях до карти сайту. Один зайвий Disallow: / здатен закрити від обходу весь сайт — тому файл перевіряють особливо уважно.
Приклад
Магазин закрив у robots.txt сотні сторінок фільтрів-дублів (Disallow: /*?filter=), щоб робот не витрачав на них краулінговий бюджет. Через кілька тижнів Googlebot почав частіше обходити картки товарів і категорії — саме ті сторінки, що приносять трафік.
Часто плутають з…
- Noindex — керує індексацією (чи буде сторінка в пошуку); robots.txt керує скануванням (чи зайде на неї робот). Це різні речі.
- Sitemap.xml — навпаки, підказує роботу, що обійти; robots.txt здебільшого — що НЕ обходити.
Питання та відповіді
Robots.txt забороняє індексацію сторінки?
Ні. Він керує лише скануванням. Закрита в robots.txt сторінка все одно може потрапити в індекс за зовнішніми посиланнями — для гарантованого видалення потрібен noindex.
Де має лежати файл robots.txt?
Тільки в корені домену: site.com/robots.txt. В іншому місці робот його не шукатиме й проігнорує.
Що станеться при помилковому Disallow: /?
Ви закриєте від сканування весь сайт. Це класична критична помилка, тому кожну зміну robots.txt варто перевіряти у валідаторі.
Не впевнені, що robots.txt не ріже зайве? Перевіримо директиви й індексацію — SEO-аудит та виправлення помилок на сайті.
Схожі терміни: Disallow і Allow, Краулінговий бюджет, Noindex, Sitemap, Індексація.