Краулинг (crawling, сканирование) — это процесс, которым поисковые роботы обходят страницы сайта и скачивают их содержимое. Без краулинга страница не попадёт в индекс, а значит, не появится в результатах поиска: сканирование — первый обязательный шаг всей поисковой оптимизации.
Как это работает
Поисковая система поддерживает очередь адресов, которые нужно обойти. Робот берёт из неё URL, запрашивает страницу, разбирает HTML, находит в нём ссылки и добавляет новые адреса в ту же очередь. Так обход расходится по сайту от страницы к странице.
Адреса попадают в очередь несколькими путями:
- по внутренним ссылкам — основной способ: робот пришёл на страницу и нашёл ссылки на соседние;
- по внешним ссылкам с других сайтов;
- из файла Sitemap, который вы сами отдаёте поисковику;
- из истории — уже известные адреса робот периодически переобходит, чтобы заметить изменения.
Краулинг — это не индексация
Эти два понятия постоянно путают, хотя между ними принципиальная разница:
- краулинг — робот скачал страницу;
- индексация — поисковая система разобрала содержимое и решила сохранить его в своей базе.
Страницу могут просканировать и не проиндексировать — например, если содержимое сочтено малополезным или дублирующим. Обратное невозможно: без сканирования индексации не будет. Поэтому, разбирая проблему «страницы нет в поиске», сначала проверяют, доходил ли до неё робот вообще.
Что мешает сканированию
- Запрет в robots.txt. Директива Disallow не даёт роботу скачать страницу. Частая ошибка — закрыть раздел «на время разработки» и забыть открыть.
- Ошибки сервера. Если сайт регулярно отвечает 5xx или отдаёт страницы очень медленно, робот снижает частоту обхода.
- Страницы-сироты. На документ не ведёт ни одна внутренняя ссылка — робот попросту не знает о его существовании.
- Глубокая вложенность. Чем больше кликов от главной, тем реже страница попадает в обход.
- Дубли и бесконечные адреса. Фильтры, сортировки и календари порождают тысячи почти одинаковых URL, на которые робот тратит ресурс вместо полезных страниц.
Бюджет сканирования
Поисковая система не обходит сайт бесконечно: на каждый ресурс выделяется ограниченное количество запросов. Для небольшого сайта это обычно не проблема, но крупный каталог может расходовать весь лимит на мусорные адреса. Подробнее — в статье Crawl Budget / Бюджет краулинга.
Как проверить, что происходит с обходом
- Отчёты поисковых систем. Google Search Console и Яндекс.Вебмастер показывают статистику обхода и причины, по которым страницы не попали в индекс.
- Логи сервера. Самый точный источник: видно, какие адреса робот запрашивал, как часто и какой код ответа получал.
- Файл Sitemap. Стоит убедиться, что в нём только рабочие страницы, отдающие код 200.
Мы не даём гарантий по срокам индексации — они зависят от поисковой системы, а не от подрядчика. Но техническая часть, которая влияет на обход, полностью в вашей власти: скорость ответа, чистая структура ссылок, корректный robots.txt и Sitemap.