
Краулинг — обход сайта роботом поисковой системы: программа переходит по ссылкам, запрашивает страницы у сервера и скачивает их содержимое. Всё, что поисковик знает об интернете, он узнал таким способом. Для сайта это первый и обязательный этап — то, что не обойдено, не существует для поиска.
Как робот находит адреса
Двумя путями, и первый важнее второго.
Основной — ссылки. Робот приходит на известную ему страницу, забирает список исходящих ссылок и ставит новые адреса в очередь. Так сайт обходится сам по себе, а страница, на которую не ведёт ни одна ссылка, остаётся невидимой. Отсюда практическая ценность внутренней перелинковки — она не только помогает людям, но и прокладывает роботу маршрут.
Дополнительный путь — карта сайта и явное указание адресов через панель вебмастера. Это подсказка, а не гарантия обхода: список адресов сообщает роботу об их существовании, но не обязывает загружать каждый.
Частота повторных визитов определяется системой. Раздел, который меняется каждый день, робот проверяет чаще, чем страницу, не менявшуюся год.
Что тормозит обход
- Медленный ответ сервера — робот снижает темп, чтобы не мешать людям.
- Ошибки и таймауты: серия неудачных ответов сокращает обращения.
- Тысячи мусорных адресов от фильтров и сортировок, на которые тратится очередь.
- Длинные цепочки редиректов вместо одного перехода.
- Закрытые в robots.txt разделы — их робот не запрашивает вовсе.
- Глубокая вложенность, когда до страницы нужно пройти много переходов от главной.
С чем путают краулинг
С индексацией. Обход — загрузка страницы, индексация — решение сохранить её в базе поиска. Между ними есть отбор, и часть загруженных страниц в индекс не попадает.
С ранжированием. Ранжирование определяет порядок страниц на странице выдачи и происходит в момент запроса, когда обход давно завершён.
С парсингом. Парсер тоже скачивает страницы, но собирает конкретные данные для своей задачи, а не строит общую карту сети.
С закрытием от индексации. Запрет в robots.txt останавливает обход, а не показ в результатах: адрес может остаться в выдаче без описания, потому что робот не смог прочитать страницу и узнать, что её показывать не нужно.
Частые вопросы
Как узнать, обходит ли робот мои страницы?
Что такое краулинговый бюджет?
Робот видит содержимое, которое подгружается скриптами?