Робот пошукової системи (пошуковий робот, краулер, спайдер, бот) — це програма, яка автоматично обходить сторінки в інтернеті за посиланнями, зчитує їхній вміст і передає його на обробку в індекс пошуковика. Саме завдяки роботам Google дізнається про існування нових і оновлених сторінок.
Простими словами: невтомний бібліотекар, який ходить від сторінки до сторінки за посиланнями й переписує собі, що де лежить, щоб потім швидко знайти потрібне.
Що таке робот пошукової системи і навіщо він потрібен
Без роботів пошук не існував би: спершу сторінку треба знайти й «прочитати», і лише потім вона може потрапити у видачу. Головний робот Google — Googlebot; є окремі версії для смартфонів, зображень, новин. «Робот пошукової системи», «пошуковий робот» і «краулер» — це синоніми одного й того самого: терміни вживають як взаємозамінні.
Як працює робот
- Сканування (crawling) — робот переходить за посиланнями зі сторінки на сторінку.
- Обробка — зчитує HTML, рендерить сторінку, збирає контент і посилання.
- Передача в індекс — придатні сторінки відправляються на індексацію.
- Повторні обходи — робот періодично повертається, щоб помітити зміни.
Чим керувати поведінкою робота
- robots.txt — які розділи не сканувати.
- meta robots / X-Robots-Tag — індексувати сторінку чи ні, переходити за посиланнями чи ні.
- XML-sitemap — підказка, які сторінки важливі.
- Краулінговий бюджет — скільки сторінок робот готовий обійти за візит.
Приклад
Ви опублікували нову статтю й поставили на неї внутрішнє посилання з головної. Під час чергового обходу Googlebot переходить за цим посиланням, зчитує статтю й додає її в чергу на індексацію. Без такого «містка» робот може дістатися до сторінки значно пізніше.
Часто плутають з…
- Індексація — це вже наступний етап: збереження й упорядкування контенту. Робот лише збирає дані.
- Асесор — це людина-оцінювач якості видачі, а не програма-обхідник.
Питання та відповіді
Робот пошукової системи і краулер — це одне й те саме?
Так, це синоніми. «Пошуковий робот», «краулер», «спайдер», «бот» описують ту саму програму, що обходить сторінки. Головний робот Google — Googlebot.
Як заборонити роботу сканувати сторінку?
Закрити розділ у robots.txt (заборона сканування) або поставити meta robots noindex (заборона індексації). Це різні речі: перше — про обхід, друге — про потрапляння у видачу.
Як прискорити обхід нових сторінок?
Додати їх у sitemap, поставити внутрішні посилання й за потреби надіслати на переобхід у Google Search Console.
Робот погано сканує сайт або витрачає бюджет на сміття? Розберемося в межах SEO-аудиту та виправлення помилок на сайті.
Схожі терміни: Краулер, Індексація, Пошукова система, Sitemap.