Краулер (crawler, павук, spider) — це пошуковий робот, який автоматично обходить сторінки сайтів за посиланнями, зчитує їхній вміст і передає дані в індекс пошукової системи. Найвідоміший приклад — Googlebot. Саме з роботи краулера починається шлях будь-якої сторінки в пошук.
Простими словами: це невтомний розвідник пошуковика. Він ходить по посиланнях, як по стежках, заглядає на кожну сторінку й записує, що там є, — щоб потім її можна було показати у видачі.
Що таке краулер і навіщо він потрібен
Пошуковик не «бачить» ваш сайт, доки на нього не зайшов краулер. Робот виявляє нові й змінені сторінки, читає їхній HTML і відправляє на обробку. Без цього кроку сторінка просто не потрапить в індекс, а отже, її не знайдуть у пошуку. Тому базова умова SEO — щоб важливі сторінки були доступні для сканування й не закриті випадково в robots.txt чи тегом noindex.
Як працює краулер
- Черга URL. Робот бере адреси зі списку відомих сторінок і карти сайту.
- Обхід за посиланнями. Заходить на сторінку, зчитує контент і збирає нові посилання — так знаходить наступні URL.
- Передача в індексацію. Зібраний вміст іде на обробку й потрапляє в індекс.
- Повторні візити. Робот повертається, щоб побачити оновлення; частота залежить від авторитетності й свіжості сайту.
Приклад
Ви опублікували нову статтю й поставили на неї посилання з головної та в sitemap. Під час чергового обходу Googlebot переходить за цим посиланням, зчитує текст і додає сторінку в індекс — після цього вона може з’явитися у видачі. Якщо ж на статтю не веде жодне посилання й її немає в карті сайту, робот може довго її не помічати.
Часто плутають з…
- Індексація — це вже зберігання й обробка сторінки в базі; краулер лише збирає дані. Сканування ≠ індексація.
- Асесор — це людина, що вручну оцінює якість видачі; краулер — автоматична програма.
- Парсер — розбирає структуру контенту; краулер спершу має цей контент знайти й завантажити.
Питання та відповіді
Що таке краулер простими словами?
Це робот пошуковика, який ходить по сайтах за посиланнями й зчитує сторінки, щоб потім їх можна було показати в пошуку. У Google його звати Googlebot.
Чим краулінг відрізняється від індексації?
Краулінг — це коли робот знаходить і зчитує сторінку. Індексація — це коли пошуковик зберігає й обробляє її вміст у своїй базі. Спочатку сканування, потім індексація.
Як допомогти краулеру обійти сайт?
Зробити чітку структуру й внутрішні посилання, тримати актуальну XML-карту сайту, не закривати потрібні сторінки в robots.txt і прибрати биті посилання.
Сторінки не потрапляють в індекс? Знайдемо, що заважає роботу — SEO-аудит та виправлення помилок на сайті.
Схожі терміни: Індексація, robots.txt, Sitemap, Краулінговий бюджет, Пошукова система.