Crawling / Краулинг

Краулинг — обход страниц сайта поисковыми роботами: как он устроен, чем отличается от индексации, что мешает сканированию и как проверить обход.

Краулинг (crawling, сканирование) — это процесс, которым поисковые роботы обходят страницы сайта и скачивают их содержимое. Без краулинга страница не попадёт в индекс, а значит, не появится в результатах поиска: сканирование — первый обязательный шаг всей поисковой оптимизации.

Как это работает

Поисковая система поддерживает очередь адресов, которые нужно обойти. Робот берёт из неё URL, запрашивает страницу, разбирает HTML, находит в нём ссылки и добавляет новые адреса в ту же очередь. Так обход расходится по сайту от страницы к странице.

Адреса попадают в очередь несколькими путями:

  • по внутренним ссылкам — основной способ: робот пришёл на страницу и нашёл ссылки на соседние;
  • по внешним ссылкам с других сайтов;
  • из файла Sitemap, который вы сами отдаёте поисковику;
  • из истории — уже известные адреса робот периодически переобходит, чтобы заметить изменения.

Краулинг — это не индексация

Эти два понятия постоянно путают, хотя между ними принципиальная разница:

  • краулинг — робот скачал страницу;
  • индексация — поисковая система разобрала содержимое и решила сохранить его в своей базе.

Страницу могут просканировать и не проиндексировать — например, если содержимое сочтено малополезным или дублирующим. Обратное невозможно: без сканирования индексации не будет. Поэтому, разбирая проблему «страницы нет в поиске», сначала проверяют, доходил ли до неё робот вообще.

Что мешает сканированию

  • Запрет в robots.txt. Директива Disallow не даёт роботу скачать страницу. Частая ошибка — закрыть раздел «на время разработки» и забыть открыть.
  • Ошибки сервера. Если сайт регулярно отвечает 5xx или отдаёт страницы очень медленно, робот снижает частоту обхода.
  • Страницы-сироты. На документ не ведёт ни одна внутренняя ссылка — робот попросту не знает о его существовании.
  • Глубокая вложенность. Чем больше кликов от главной, тем реже страница попадает в обход.
  • Дубли и бесконечные адреса. Фильтры, сортировки и календари порождают тысячи почти одинаковых URL, на которые робот тратит ресурс вместо полезных страниц.

Бюджет сканирования

Поисковая система не обходит сайт бесконечно: на каждый ресурс выделяется ограниченное количество запросов. Для небольшого сайта это обычно не проблема, но крупный каталог может расходовать весь лимит на мусорные адреса. Подробнее — в статье Crawl Budget / Бюджет краулинга.

Как проверить, что происходит с обходом

  • Отчёты поисковых систем. Google Search Console и Яндекс.Вебмастер показывают статистику обхода и причины, по которым страницы не попали в индекс.
  • Логи сервера. Самый точный источник: видно, какие адреса робот запрашивал, как часто и какой код ответа получал.
  • Файл Sitemap. Стоит убедиться, что в нём только рабочие страницы, отдающие код 200.

Мы не даём гарантий по срокам индексации — они зависят от поисковой системы, а не от подрядчика. Но техническая часть, которая влияет на обход, полностью в вашей власти: скорость ответа, чистая структура ссылок, корректный robots.txt и Sitemap.