
Четыре шага, а не одно событие
Фраза «страница не индексируется» описывает симптом, а не причину. Между публикацией и появлением в выдаче лежит цепочка, и обрыв на разных её участках выглядит одинаково для владельца сайта, но лечится по-разному.
| Шаг | Что происходит | Как выглядит обрыв |
|---|---|---|
| Обнаружение | Робот узнаёт о существовании URL — из sitemap, по ссылке, из панели | URL нигде не встречается, робот о нём не знает |
| Обход | Робот скачивает содержимое страницы | «Обнаружена, не просканирована» |
| Индексация | Содержимое разбирается и попадает в базу | «Просканирована, не проиндексирована» |
| Ранжирование | Страница участвует в выдаче по запросам | В индексе есть, показов нет |
Первые два шага — про доступность. Третий — про качество. Четвёртый — про конкуренцию. Смешивать их в одну задачу «надо проиндексироваться» бессмысленно: на каждом шаге работают разные рычаги.
Как робот узнаёт о странице
Три источника, по убыванию надёжности:
Внутренние ссылки. Робот пришёл на сайт, увидел ссылку, перешёл. Это основной механизм, и он же объясняет, почему страница без входящих ссылок может годами не попадать в индекс, даже находясь в sitemap.
Sitemap.xml. Список адресов, который сайт предлагает роботу. Важное свойство: sitemap — рекомендация, а не команда. Наличие URL в файле не обязывает робота его обойти и тем более проиндексировать.
Внешние ссылки. Ссылка с чужого сайта одновременно сообщает адрес и даёт сигнал значимости.
Что тратит краулинговый бюджет
У робота ограничен ресурс на каждый сайт. Расходуется он не только на полезные страницы.
Типичные пожиратели: параметрические адреса фильтров и сортировок, пагинация без ограничений, страницы поиска по сайту, дубли с параметрами меток, версии для печати. Когда значительная часть обхода уходит на такие адреса, важные страницы обходятся реже.
Отсюда практический вывод, который выглядит контринтуитивно: удаление мусорных страниц нередко даёт больше, чем добавление новых. Освобождённый ресурс перераспределяется на то, что должно ранжироваться.
Ловушка robots.txt
Самое частое заблуждение в теме. Директива Disallow запрещает обход, но не удаляет страницу из индекса.
Механика такая: если на закрытую страницу ведут ссылки, поисковик может добавить её в базу, зная только адрес и анкоры, — без содержимого. В выдаче появляется запись без описания.
Дальше возникает вторая половина ловушки. Чтобы убрать страницу из индекса, нужен noindex в метатеге. Но робот не прочитает метатег, если страница закрыта от обхода. Правильный порядок: сначала открыть обход и поставить noindex, дождаться выпадения, и только потом при необходимости закрывать в robots.txt.
Симптом → причина → что делать
Новый раздел не индексируется целиком. Проверьте, есть ли на него ссылки из меню или хаба. Раздел, доступный только через sitemap, обходится в последнюю очередь.
Часть страниц в статусе «просканирована, не проиндексирована». Робот видел содержимое и решил не добавлять. Причина почти всегда в содержании: дубли по смыслу, мало текста, шаблонные страницы, отличающиеся одним словом.
Страница в индексе, но показов нет. Индексация прошла, проблема в ранжировании — страница не попадает даже в глубокую выдачу по своим запросам. Это вопрос релевантности и конкуренции, а не индексации.
Индекс резко сократился. Проверьте, не появился ли случайный noindex при выкатке, не сменился ли ответ сервера, не закрылся ли раздел в robots.txt.
Чем помогает внутренняя структура
Страница на расстоянии одного-двух кликов от главной обходится заметно чаще, чем спрятанная на четвёртом уровне вложенности. Это прямое следствие того, как работает обход: робот идёт по ссылкам и расходует ресурс сверху вниз.
Практический приём для новых материалов: каждая свежая страница получает несколько ссылок со старых, уже обходимых. Это тот же механизм, что и перелинковка ради веса, но здесь он решает другую задачу — ввод в индекс.
Где заканчивается влияние вебмастера
Есть граница, за которой технические меры не работают. Если сайт в целом оценивается как малополезный, новые страницы могут не входить в индекс независимо от их качества и количества ссылок на них.
В такой ситуации бессмысленно бороться за индексацию конкретной страницы: сначала решается вопрос качества сайта в целом — сокращением мусора и доведением существующих материалов до состояния, ради которого их стоит держать в базе.
Чем закрыть страницу и что каждый способ делает
Способов шесть, и результат у них разный. Путаница между ними — вторая по частоте причина того, что мусор остаётся в базе, а нужные страницы из неё пропадают.
| Способ | Что делает | Останется ли в индексе | Когда уместен |
|---|---|---|---|
Disallow в robots.txt | Запрещает обход | Может остаться — по ссылкам и анкорам, без описания | Служебные разделы, которые не должны тратить обход |
noindex в метатеге | Запрещает добавление в базу | Выпадет после следующего обхода | Страница нужна людям, но не нужна в поиске |
X-Robots-Tag в ответе сервера | То же самое для файлов без HTML | Выпадет после обхода | Выгрузки, документы, изображения |
rel="canonical" | Указывает предпочтительный адрес | Остаётся, но склеивается с основным | Дубли с параметрами, версии сортировки |
| Код 404 или 410 | Сообщает, что страницы нет | Выпадет, причём по 410 обычно быстрее | Удалено насовсем |
| Редирект 301 | Передаёт адрес и накопленный вес другому URL | Заменяется целевым адресом | Переезд, объединение двух материалов в один |
Первые две строки нельзя складывать: noindex на странице, закрытой в robots.txt, робот не прочитает — он туда не пойдёт. Четвёртая строка вообще не запрет, а подсказка: канонический адрес поисковик вправе проигнорировать, если сочтёт страницы разными. Что именно считается дублем — в разборе дублирующегося контента.
Как найти шаг, на котором оборвалась цепочка
Диагностика идёт от дешёвых проверок к дорогим, и каждый шаг заканчивается записанным фактом, а не ощущением.
- Проверить ответ сервера по точному адресу. Не в браузере с открытой сессией, а запросом к URL. Готово, когда: известен код ответа и в теле виден текст страницы, а не заглушка.
- Посмотреть исходный HTML без исполнения скриптов. Робот работает с тем, что пришло в ответе. Готово, когда: основной текст и ссылки найдены в исходном коде, а не появляются после отрисовки.
- Собрать все директивы разом. robots.txt, метатег robots,
X-Robots-Tag, canonical. Готово, когда: ни одна не запрещает и canonical не указывает на другой адрес. - Найти внутренние ссылки, которые ведут на страницу. Готово, когда: их хотя бы две-три и стоят они на страницах, которые робот посещает регулярно — механика в перелинковке.
- Прочитать статус в панели вебмастера буквально. «Обнаружена», «просканирована», «проиндексирована» — три разных состояния, а не синонимы. Готово, когда: статус выписан словами и сопоставлен с таблицей четырёх шагов.
- Сравнить с соседней страницей того же шаблона, которая в индексе. Готово, когда: найдено хотя бы одно содержательное отличие. Если отличий нет, проблема лежит на уровне сайта, и копать дальше на уровне страницы бессмысленно.
Порядок именно такой, потому что первые три шага занимают минуты и закрывают большинство случаев, а шестой требует времени и нужен редко. Обратный порядок — обычная причина того, что неделю переписывают текст, а страница всё это время отдаёт редирект на главную. Что проверяется на уровне сайта целиком, собрано в техническом аудите.
«Проиндексирована, но по названию не находится». Индекс и выдача — разные вещи. Страница в базе, но проигрывает по релевантности: это четвёртый шаг цепочки, а не третий.
«Страниц в индексе стало больше — значит, лучше». Рост чаще всего дают параметрические адреса и пагинация. Смотреть надо не на общее число, а на долю страниц, получающих показы.
«Индекс упал, а трафик не изменился». Выпали страницы, которые никто не открывал. Это уборка, а не авария, и восстанавливать их не нужно.
«Панель показывает ошибку обхода, но страница открывается». Робот и браузер приходят по-разному: другой адрес, другой user-agent, отсутствие cookie. Проверять надо тем же способом, каким приходит робот, — в панели вебмастера для этого есть отдельный инструмент.
Где правило «больше ссылок — быстрее индекс» перестаёт работать
Ссылки ускоряют обход, а не индексацию. Разница видна там, где страница обходится регулярно, но в базу не попадает: ещё десяток ссылок в этой ситуации ускорит только повторный отказ.
Четыре случая, в которых рычаг не срабатывает:
- Страница дублирует существующую по смыслу. Робот приходит чаще и каждый раз принимает то же решение.
- Ограничение на уровне сайта. Пока сайт целиком оценивается как малополезный, отдельная страница из этого не вырывается.
- Сайт с сотнями тысяч адресов. Внутренние ссылки перераспределяют ресурс обхода, но не увеличивают его: ускорив одну страницу, вы замедлили другую.
- Ссылки стоят на редко обходимых страницах. Ссылка работает со скоростью той страницы, на которой она находится.
Отдельная граница — массовая публикация. Сотня страниц, выложенных за один день, входит в индекс дольше, чем та же сотня, растянутая на месяц: робот не увеличивает выделенный ресурс по требованию.
Спорное место
Индексация — метрика, за которой удобно наблюдать, и поэтому за неё цепляются дольше, чем следует. Число страниц в индексе легко измерить, оно растёт от понятных действий и создаёт ощущение прогресса.
Но само по себе оно ничего не стоит. Тысяча проиндексированных страниц без показов — это тысяча записей в чужой базе данных. Полезнее смотреть на долю страниц, получающих хотя бы один показ в месяц: она честно отвечает на вопрос, зачем эти страницы существуют.
Частые вопросы
Сколько времени занимает индексация?
Почему страница «обнаружена, но не проиндексирована»?
Как ускорить попадание в индекс?
Что делать, если страница выпала из индекса?
Источники
- Поисковый робот — принцип работы — Wikipedia