Медиана

Индексация: как страница попадает в поиск

Четыре шага от обхода до ранжирования, на каждом из которых страница может выпасть. Как понять, где именно застряла, и что с этим делать.

Обновлено 12.08.2026 · 7 мин чтения

Страница проходит четыре шага: обнаружение (робот узнал URL), обход (скачал содержимое), индексация (разобрал и сохранил в базу), ранжирование (показывает по запросам). Выпасть можно на любом. Поэтому диагностика начинается не с вопроса «почему нет в поиске», а с определения шага, на котором цепочка оборвалась — лечение у каждого шага своё.

Коротко

  • Индексация — не одно событие, а цепочка из четырёх шагов, и страница выпадает на любом из них.
  • «Не в индексе», «под фильтром» и «плохо ранжируется» — три разные проблемы с разными решениями.
  • Закрытая в robots.txt страница может остаться в индексе: файл управляет обходом, а не индексацией.
  • Ускорить индексацию ссылками с уже проиндексированных страниц надёжнее, чем повторными отправками в панель.
Выдвинутый ящик карточного каталога с пустыми карточками

Четыре шага, а не одно событие

Фраза «страница не индексируется» описывает симптом, а не причину. Между публикацией и появлением в выдаче лежит цепочка, и обрыв на разных её участках выглядит одинаково для владельца сайта, но лечится по-разному.

ШагЧто происходитКак выглядит обрыв
ОбнаружениеРобот узнаёт о существовании URL — из sitemap, по ссылке, из панелиURL нигде не встречается, робот о нём не знает
ОбходРобот скачивает содержимое страницы«Обнаружена, не просканирована»
ИндексацияСодержимое разбирается и попадает в базу«Просканирована, не проиндексирована»
РанжированиеСтраница участвует в выдаче по запросамВ индексе есть, показов нет

Первые два шага — про доступность. Третий — про качество. Четвёртый — про конкуренцию. Смешивать их в одну задачу «надо проиндексироваться» бессмысленно: на каждом шаге работают разные рычаги.

Как робот узнаёт о странице

Три источника, по убыванию надёжности:

Внутренние ссылки. Робот пришёл на сайт, увидел ссылку, перешёл. Это основной механизм, и он же объясняет, почему страница без входящих ссылок может годами не попадать в индекс, даже находясь в sitemap.

Sitemap.xml. Список адресов, который сайт предлагает роботу. Важное свойство: sitemap — рекомендация, а не команда. Наличие URL в файле не обязывает робота его обойти и тем более проиндексировать.

Внешние ссылки. Ссылка с чужого сайта одновременно сообщает адрес и даёт сигнал значимости.

Что тратит краулинговый бюджет

У робота ограничен ресурс на каждый сайт. Расходуется он не только на полезные страницы.

Типичные пожиратели: параметрические адреса фильтров и сортировок, пагинация без ограничений, страницы поиска по сайту, дубли с параметрами меток, версии для печати. Когда значительная часть обхода уходит на такие адреса, важные страницы обходятся реже.

Отсюда практический вывод, который выглядит контринтуитивно: удаление мусорных страниц нередко даёт больше, чем добавление новых. Освобождённый ресурс перераспределяется на то, что должно ранжироваться.

Ловушка robots.txt

Самое частое заблуждение в теме. Директива Disallow запрещает обход, но не удаляет страницу из индекса.

Механика такая: если на закрытую страницу ведут ссылки, поисковик может добавить её в базу, зная только адрес и анкоры, — без содержимого. В выдаче появляется запись без описания.

Дальше возникает вторая половина ловушки. Чтобы убрать страницу из индекса, нужен noindex в метатеге. Но робот не прочитает метатег, если страница закрыта от обхода. Правильный порядок: сначала открыть обход и поставить noindex, дождаться выпадения, и только потом при необходимости закрывать в robots.txt.

Симптом → причина → что делать

Диагностика по симптомам

Новый раздел не индексируется целиком. Проверьте, есть ли на него ссылки из меню или хаба. Раздел, доступный только через sitemap, обходится в последнюю очередь.

Часть страниц в статусе «просканирована, не проиндексирована». Робот видел содержимое и решил не добавлять. Причина почти всегда в содержании: дубли по смыслу, мало текста, шаблонные страницы, отличающиеся одним словом.

Страница в индексе, но показов нет. Индексация прошла, проблема в ранжировании — страница не попадает даже в глубокую выдачу по своим запросам. Это вопрос релевантности и конкуренции, а не индексации.

Индекс резко сократился. Проверьте, не появился ли случайный noindex при выкатке, не сменился ли ответ сервера, не закрылся ли раздел в robots.txt.

Чем помогает внутренняя структура

Страница на расстоянии одного-двух кликов от главной обходится заметно чаще, чем спрятанная на четвёртом уровне вложенности. Это прямое следствие того, как работает обход: робот идёт по ссылкам и расходует ресурс сверху вниз.

Практический приём для новых материалов: каждая свежая страница получает несколько ссылок со старых, уже обходимых. Это тот же механизм, что и перелинковка ради веса, но здесь он решает другую задачу — ввод в индекс.

Где заканчивается влияние вебмастера

Есть граница, за которой технические меры не работают. Если сайт в целом оценивается как малополезный, новые страницы могут не входить в индекс независимо от их качества и количества ссылок на них.

В такой ситуации бессмысленно бороться за индексацию конкретной страницы: сначала решается вопрос качества сайта в целом — сокращением мусора и доведением существующих материалов до состояния, ради которого их стоит держать в базе.

Чем закрыть страницу и что каждый способ делает

Способов шесть, и результат у них разный. Путаница между ними — вторая по частоте причина того, что мусор остаётся в базе, а нужные страницы из неё пропадают.

СпособЧто делаетОстанется ли в индексеКогда уместен
Disallow в robots.txtЗапрещает обходМожет остаться — по ссылкам и анкорам, без описанияСлужебные разделы, которые не должны тратить обход
noindex в метатегеЗапрещает добавление в базуВыпадет после следующего обходаСтраница нужна людям, но не нужна в поиске
X-Robots-Tag в ответе сервераТо же самое для файлов без HTMLВыпадет после обходаВыгрузки, документы, изображения
rel="canonical"Указывает предпочтительный адресОстаётся, но склеивается с основнымДубли с параметрами, версии сортировки
Код 404 или 410Сообщает, что страницы нетВыпадет, причём по 410 обычно быстрееУдалено насовсем
Редирект 301Передаёт адрес и накопленный вес другому URLЗаменяется целевым адресомПереезд, объединение двух материалов в один

Первые две строки нельзя складывать: noindex на странице, закрытой в robots.txt, робот не прочитает — он туда не пойдёт. Четвёртая строка вообще не запрет, а подсказка: канонический адрес поисковик вправе проигнорировать, если сочтёт страницы разными. Что именно считается дублем — в разборе дублирующегося контента.

Как найти шаг, на котором оборвалась цепочка

Диагностика идёт от дешёвых проверок к дорогим, и каждый шаг заканчивается записанным фактом, а не ощущением.

  1. Проверить ответ сервера по точному адресу. Не в браузере с открытой сессией, а запросом к URL. Готово, когда: известен код ответа и в теле виден текст страницы, а не заглушка.
  2. Посмотреть исходный HTML без исполнения скриптов. Робот работает с тем, что пришло в ответе. Готово, когда: основной текст и ссылки найдены в исходном коде, а не появляются после отрисовки.
  3. Собрать все директивы разом. robots.txt, метатег robots, X-Robots-Tag, canonical. Готово, когда: ни одна не запрещает и canonical не указывает на другой адрес.
  4. Найти внутренние ссылки, которые ведут на страницу. Готово, когда: их хотя бы две-три и стоят они на страницах, которые робот посещает регулярно — механика в перелинковке.
  5. Прочитать статус в панели вебмастера буквально. «Обнаружена», «просканирована», «проиндексирована» — три разных состояния, а не синонимы. Готово, когда: статус выписан словами и сопоставлен с таблицей четырёх шагов.
  6. Сравнить с соседней страницей того же шаблона, которая в индексе. Готово, когда: найдено хотя бы одно содержательное отличие. Если отличий нет, проблема лежит на уровне сайта, и копать дальше на уровне страницы бессмысленно.

Порядок именно такой, потому что первые три шага занимают минуты и закрывают большинство случаев, а шестой требует времени и нужен редко. Обратный порядок — обычная причина того, что неделю переписывают текст, а страница всё это время отдаёт редирект на главную. Что проверяется на уровне сайта целиком, собрано в техническом аудите.

Ложные выводы из отчётов

«Проиндексирована, но по названию не находится». Индекс и выдача — разные вещи. Страница в базе, но проигрывает по релевантности: это четвёртый шаг цепочки, а не третий.

«Страниц в индексе стало больше — значит, лучше». Рост чаще всего дают параметрические адреса и пагинация. Смотреть надо не на общее число, а на долю страниц, получающих показы.

«Индекс упал, а трафик не изменился». Выпали страницы, которые никто не открывал. Это уборка, а не авария, и восстанавливать их не нужно.

«Панель показывает ошибку обхода, но страница открывается». Робот и браузер приходят по-разному: другой адрес, другой user-agent, отсутствие cookie. Проверять надо тем же способом, каким приходит робот, — в панели вебмастера для этого есть отдельный инструмент.

Где правило «больше ссылок — быстрее индекс» перестаёт работать

Ссылки ускоряют обход, а не индексацию. Разница видна там, где страница обходится регулярно, но в базу не попадает: ещё десяток ссылок в этой ситуации ускорит только повторный отказ.

Четыре случая, в которых рычаг не срабатывает:

  • Страница дублирует существующую по смыслу. Робот приходит чаще и каждый раз принимает то же решение.
  • Ограничение на уровне сайта. Пока сайт целиком оценивается как малополезный, отдельная страница из этого не вырывается.
  • Сайт с сотнями тысяч адресов. Внутренние ссылки перераспределяют ресурс обхода, но не увеличивают его: ускорив одну страницу, вы замедлили другую.
  • Ссылки стоят на редко обходимых страницах. Ссылка работает со скоростью той страницы, на которой она находится.

Отдельная граница — массовая публикация. Сотня страниц, выложенных за один день, входит в индекс дольше, чем та же сотня, растянутая на месяц: робот не увеличивает выделенный ресурс по требованию.

Спорное место

Индексация — метрика, за которой удобно наблюдать, и поэтому за неё цепляются дольше, чем следует. Число страниц в индексе легко измерить, оно растёт от понятных действий и создаёт ощущение прогресса.

Но само по себе оно ничего не стоит. Тысяча проиндексированных страниц без показов — это тысяча записей в чужой базе данных. Полезнее смотреть на долю страниц, получающих хотя бы один показ в месяц: она честно отвечает на вопрос, зачем эти страницы существуют.

Частые вопросы

Сколько времени занимает индексация?

Конкретных сроков поисковые системы не гарантируют, и любая названная цифра будет выдумкой. На скорость влияют: как часто робот заходил на сайт раньше, сколько внутренних ссылок ведёт на страницу, обновлялся ли соседний контент. Новый сайт без входящих ссылок обходят реже, чем живой раздел с ежедневными публикациями.

Почему страница «обнаружена, но не проиндексирована»?

Робот знает URL, но не счёл нужным тратить ресурс на обход или обошёл и не добавил в базу. Типичные причины: страница дублирует другую по смыслу, слишком мало содержания, на неё почти нет внутренних ссылок, либо у сайта в целом низкая оценка качества.

Как ускорить попадание в индекс?

Самый надёжный способ — поставить 3–5 ссылок на новую страницу с тех, которые робот обходит часто: с хабов разделов и свежих материалов. Отправка URL в панель вебмастера помогает, но повторная отправка одного и того же адреса не ускоряет обработку.

Что делать, если страница выпала из индекса?

Сначала проверить технику: не появился ли noindex, не закрылась ли она в robots.txt, отдаёт ли сервер 200. Если технически всё в порядке — вопрос к содержанию: страница могла быть признана дублем или малополезной.

Источники

  1. Поисковый робот — принцип работы — Wikipedia
Артём Строев
Пишу про измеримый маркетинг и видимость в ИИ-поиске. Публикуюсь под псевдонимом — почему так.