Медиана

Краулинг: обход сайта роботом

Краулинг — обход сайта поисковым роботом и скачивание страниц. Как робот находит адреса, что ограничивает обход и чем краулинг отличается от индексации.

Обновлено 12.08.2026 · 2 мин чтения

Краулинг — процесс, при котором робот поисковой системы обходит страницы сайта по ссылкам и скачивает их содержимое. Это первый шаг: сначала страница должна быть найдена и загружена, и только потом система решает, включать ли её в индекс и показывать ли в результатах поиска.

Коротко

  • Краулинг — обход страниц роботом поисковой системы и скачивание их содержимого.
  • Робот находит новые адреса по ссылкам с уже известных страниц и по карте сайта.
  • Обойденная страница не обязана попасть в индекс — это следующее и отдельное решение системы.
  • Скорость обхода ограничена сверху: робот не грузит сервер сильнее, чем тот выдерживает.
Тонкая нить, проложенная извилистым путём мимо металлических меток

Краулинг — обход сайта роботом поисковой системы: программа переходит по ссылкам, запрашивает страницы у сервера и скачивает их содержимое. Всё, что поисковик знает об интернете, он узнал таким способом. Для сайта это первый и обязательный этап — то, что не обойдено, не существует для поиска.

Как робот находит адреса

Двумя путями, и первый важнее второго.

Основной — ссылки. Робот приходит на известную ему страницу, забирает список исходящих ссылок и ставит новые адреса в очередь. Так сайт обходится сам по себе, а страница, на которую не ведёт ни одна ссылка, остаётся невидимой. Отсюда практическая ценность внутренней перелинковки — она не только помогает людям, но и прокладывает роботу маршрут.

Дополнительный путь — карта сайта и явное указание адресов через панель вебмастера. Это подсказка, а не гарантия обхода: список адресов сообщает роботу об их существовании, но не обязывает загружать каждый.

Частота повторных визитов определяется системой. Раздел, который меняется каждый день, робот проверяет чаще, чем страницу, не менявшуюся год.

Что тормозит обход

  • Медленный ответ сервера — робот снижает темп, чтобы не мешать людям.
  • Ошибки и таймауты: серия неудачных ответов сокращает обращения.
  • Тысячи мусорных адресов от фильтров и сортировок, на которые тратится очередь.
  • Длинные цепочки редиректов вместо одного перехода.
  • Закрытые в robots.txt разделы — их робот не запрашивает вовсе.
  • Глубокая вложенность, когда до страницы нужно пройти много переходов от главной.

С чем путают краулинг

С индексацией. Обход — загрузка страницы, индексация — решение сохранить её в базе поиска. Между ними есть отбор, и часть загруженных страниц в индекс не попадает.

С ранжированием. Ранжирование определяет порядок страниц на странице выдачи и происходит в момент запроса, когда обход давно завершён.

С парсингом. Парсер тоже скачивает страницы, но собирает конкретные данные для своей задачи, а не строит общую карту сети.

С закрытием от индексации. Запрет в robots.txt останавливает обход, а не показ в результатах: адрес может остаться в выдаче без описания, потому что робот не смог прочитать страницу и узнать, что её показывать не нужно.

Частые вопросы

Как узнать, обходит ли робот мои страницы?

По логам сервера и по отчётам в панелях вебмастеров обеих систем. Логи показывают факт запроса и код ответа, панели — сводную статистику обхода и список адресов, которые робот загрузил, но не включил в индекс. Второе часто важнее первого.

Что такое краулинговый бюджет?

Условное название для количества страниц, которые робот готов загрузить с сайта за отрезок времени. Величина зависит от отклика сервера и от того, насколько содержимое сайта заслуживает частых обращений. На небольшом сайте вопрос обычно не возникает, на крупном каталоге становится определяющим.

Робот видит содержимое, которое подгружается скриптами?

Не в момент первой загрузки. Сначала он получает исходный код страницы, а выполнение скриптов происходит позже и отдельным этапом. Если ключевое содержимое появляется только после исполнения кода, оно рискует быть увиденным с задержкой или не увиденным вовсе.

Источники

  1. Web crawler — Wikipedia
  2. Поисковый робот — Wikipedia
Артём Строев
Пишу про измеримый маркетинг и видимость в ИИ-поиске. Публикуюсь под псевдонимом — почему так.