Робот пошукової системи

Робот пошукової системи (пошуковий робот, краулер, спайдер, бот) — це програма, яка автоматично обходить сторінки в інтернеті за посиланнями, зчитує їхній вміст і передає його на обробку в індекс пошуковика. Саме завдяки роботам Google дізнається про існування нових і оновлених сторінок.

Простими словами: невтомний бібліотекар, який ходить від сторінки до сторінки за посиланнями й переписує собі, що де лежить, щоб потім швидко знайти потрібне.

Що таке робот пошукової системи і навіщо він потрібен

Без роботів пошук не існував би: спершу сторінку треба знайти й «прочитати», і лише потім вона може потрапити у видачу. Головний робот Google — Googlebot; є окремі версії для смартфонів, зображень, новин. «Робот пошукової системи», «пошуковий робот» і «краулер» — це синоніми одного й того самого: терміни вживають як взаємозамінні.

Як працює робот

  • Сканування (crawling) — робот переходить за посиланнями зі сторінки на сторінку.
  • Обробка — зчитує HTML, рендерить сторінку, збирає контент і посилання.
  • Передача в індекс — придатні сторінки відправляються на індексацію.
  • Повторні обходи — робот періодично повертається, щоб помітити зміни.

Чим керувати поведінкою робота

  • robots.txt — які розділи не сканувати.
  • meta robots / X-Robots-Tag — індексувати сторінку чи ні, переходити за посиланнями чи ні.
  • XML-sitemap — підказка, які сторінки важливі.
  • Краулінговий бюджет — скільки сторінок робот готовий обійти за візит.

Приклад

Ви опублікували нову статтю й поставили на неї внутрішнє посилання з головної. Під час чергового обходу Googlebot переходить за цим посиланням, зчитує статтю й додає її в чергу на індексацію. Без такого «містка» робот може дістатися до сторінки значно пізніше.

Часто плутають з…

  • Індексація — це вже наступний етап: збереження й упорядкування контенту. Робот лише збирає дані.
  • Асесор — це людина-оцінювач якості видачі, а не програма-обхідник.

Питання та відповіді

Робот пошукової системи і краулер — це одне й те саме?

Так, це синоніми. «Пошуковий робот», «краулер», «спайдер», «бот» описують ту саму програму, що обходить сторінки. Головний робот Google — Googlebot.

Як заборонити роботу сканувати сторінку?

Закрити розділ у robots.txt (заборона сканування) або поставити meta robots noindex (заборона індексації). Це різні речі: перше — про обхід, друге — про потрапляння у видачу.

Як прискорити обхід нових сторінок?

Додати їх у sitemap, поставити внутрішні посилання й за потреби надіслати на переобхід у Google Search Console.

Робот погано сканує сайт або витрачає бюджет на сміття? Розберемося в межах SEO-аудиту та виправлення помилок на сайті.

Схожі терміни: Краулер, Індексація, Пошукова система, Sitemap.

Опишіть свій запит
і ми зробимо для Вас
пропозицію

Напишіть мені, щоб бути в ТОП

    [telegram]
    • icon-google-partner
    • icon-google-analytics
    • icon-google-ads-color