Сканирование

Сканирование (crawling, краулинг) — это процесс, во время которого поисковый робот обходит страницы сайта, переходя по ссылкам, и считывает их содержимое. Это первый этап работы поисковика: сначала он должен «увидеть» страницу, и только потом её можно проиндексировать и показать в выдаче.

Простыми словами: робот, словно читатель с бесконечным списком адресов, ходит от страницы к странице по ссылкам и переписывает себе, что на них нашёл.

Что такое сканирование и зачем оно нужно

Без сканирования страницы для Google не существует. Специальный бот — краулер (у Google это Googlebot) — стартует с известных URL, загружает их HTML, находит в нём новые ссылки и ставит их в очередь на обход. Так, шаг за шагом, он обходит сеть. Если на страницу не ведёт ни одна ссылка и её нет в карте сайта, робот может вообще её не найти.

Сканирование и индексация — разные вещи. Робот может отсканировать страницу, но не добавить её в индекс (например, если там тег noindex или дубль). То есть «обход» ещё не гарантирует попадания в выдачу.

Как работает сканирование

  • Очередь URL. Робот берёт адреса из прошлых обходов, sitemap и внутренних ссылок.
  • Загрузка. Бот запрашивает страницу, читает HTML, иногда рендерит JavaScript.
  • Поиск ссылок. Найденные линки добавляются в очередь на будущий обход.
  • Ограничение. На каждый сайт выделяется краулинговый бюджет — сколько страниц робот готов обойти за период.

Пример

Вы опубликовали новую статью и поставили на неё ссылку с главной и в sitemap. Во время очередного обхода Googlebot видит линк, загружает страницу, считывает текст и ссылки внутри. Дальше страница идёт на индексацию — и только тогда получает шанс появиться в выдаче.

Часто путают с…

  • Индексация — это сохранение и обработка контента в базе; сканирование — только обход и считывание.
  • Ранжирование — это уже упорядочивание страниц в выдаче; оно происходит после индексации.

Вопросы и ответы

Чем сканирование отличается от индексации?

Сканирование — это обход и считывание страницы роботом. Индексация — сохранение и обработка её содержимого в базе поисковика. Страницу могут отсканировать, но не проиндексировать.

Как ускорить сканирование новых страниц?

Добавить их в XML-карту сайта, поставить внутренние ссылки с важных страниц и отправить URL на проверку в Google Search Console.

Что мешает сканированию?

Блокировка в robots.txt, ошибки сервера, плохая перелинковка и исчерпанный краулинговый бюджет на крупных сайтах.

Google плохо обходит ваш сайт? Найдём причину — SEO-аудит и исправление технических ошибок.

Похожие термины: Краулер, Индексация, Краулинговый бюджет, Sitemap.

Опишіть свій запит
і ми зробимо для Вас
пропозицію

Напишіть мені, щоб бути в ТОП

    [telegram]
    • icon-google-ads-color
    • icon-google-analytics
    • icon-google-partner