Медиана

Как мы считали

Полная методика двух замеров: откуда взяты выгрузки, как чистились запросы, что считалось темой и где эти данные перестают что-либо показывать.

Обновлено 13.08.2026 · 5 мин чтения

Оба замера построены на открытых выгрузках, снятых в августе 2026 года. Первый обрабатывает 305 435 строк поисковой видимости 16 сайтов до 22 862 уникальных тем, второй разбирает состав источников в 853 сгенерированных ответах. Считаются только факты присутствия: частотность, позиции и оценки авторитета доменов сознательно не используются.

Коротко

  • Оба замера сняты в августе 2026 года: первый — по 18 выгрузкам видимости для 16 сайтов, второй — по 853 сгенерированным ответам.
  • Из 305 435 строк до 22 862 тем ведут четыре шага: сведение к уникальным запросам, снятие брендовых, тематический фильтр, схлопывание перестановок.
  • Темой считается набор слов без учёта их порядка — синонимы и разные конструкции остаются разными темами намеренно.
  • Частотность, позиции и оценки авторитета доменов в расчёт не брались: их считают разными методиками, и складывать их с фактами присутствия некорректно.
  • Данные показывают видимость и состав источников — не спрос, не трафик и не деньги за темой.

Эта страница описывает, как получены числа в разборе блогов агентств и замере цитируемости. Она нужна, чтобы выводы можно было проверить, а не принять на веру. Общие правила обращения с цифрами на сайте описаны отдельно — в методике расчётов.

Откуда взяты данные первого замера

Восемнадцать выгрузок поисковой видимости по шестнадцати сайтам маркетинговых агентств и сервисов, снятые в августе 2026 года. По части сайтов выгрузок больше одной — это разные срезы одного домена.

Строка выгрузки — факт видимости: запрос, по которому сайт где-то показывался. Всего строк 305 435, уникальных запросов в них 262 891. Отдельно выделены 3 683 страницы блогов — по принадлежности адреса к блоговому разделу сайта, а не по содержанию текста.

Выборка не случайная и не полная. В неё вошли сайты, у которых есть заметная поисковая видимость по маркетинговой тематике в русскоязычной выдаче. Это классическая систематическая ошибка отбора, и её нужно держать в голове при чтении любых пропорций.

Как чистились запросы

Четыре шага, каждый с одним правилом.

ШагПравилоОсталось
Сведение к уникальнымодинаковая формулировка считается один раз262 891
Снятие брендовых и мусорныхназвания компаний, обрывки, служебные строки260 493
Тематический фильтростаётся только маркетинговая тематика31 409
Схлопывание перестановокформулировки с одинаковым набором слов сводятся в одну22 862

Тематический фильтр словарный: запрос остаётся, если содержит маркер одной из тем ниши. Он же — главный источник погрешности. Тема, названная непривычным словом, отсеивается вместе с мусором, а запрос, подходящий сразу под два словаря, распределяется формально.

Что считается темой

Тема — набор слов без учёта их порядка. «Что такое SERM» и «SERM что такое» сводятся в одну строку, потому что это один вопрос, напечатанный двумя способами.

Дальше объединение остановлено намеренно. «Удаление отзывов» и «как удалить отзыв» остаются разными темами, хотя по смыслу это одно и то же: автоматическое объединение по смыслу требует ручной проверки каждой пары, а непроверенное объединение искажает счёт сильнее, чем его отсутствие. Итог — 22 862 темы, и это верхняя оценка: реальных сюжетов меньше.

Распределение по десяти направлениям строилось тем же словарём. Границы групп заданы вручную, поэтому идеальными они не будут.

Как считалась широта присутствия

Второй показатель первого замера — сколько разных сайтов выборки одновременно видны по одной теме. Считается он просто: по каждой теме собирается список сайтов, у которых она есть в выгрузке, и берётся длина списка.

Потолок здесь — размер выборки: шестнадцать сайтов. Наблюдаемый максимум — восемь, то есть половина выборки. Это существенно для чтения таблицы: восьмёрка означает не «вся ниша пишет об этом», а «половина тех, кого мы смотрели».

Показатель понадобился потому, что число запросов само по себе ничего не подтверждает. Одна тема, обросшая хвостом формулировок у единственного сайта, даёт в таблице такой же вес, как тема, которую независимо ведут несколько редакций. Широта присутствия отделяет одно от другого: её нельзя набрать в одиночку. Слабость у показателя тоже есть — он поощряет темы, доступные блогам, и не видит тех, где выдачу занимают каталоги и агрегаторы.

Откуда взяты данные второго замера

Выгрузка сгенерированных ответов поисковой системы по 853 запросам маркетинговой тематики, август 2026 года. Для каждого ответа зафиксирован список доменов, на которые он ссылается.

Считались три вещи: среднее число цитируемых доменов на ответ (11,2), число запросов без единого распознанного источника (0) и частота отдельных доменов в выборке. Среднее — арифметическое. Медиана не считалась, поэтому разброс по запросам замером не описан.

Распознанным источником считается ссылка, которую удалось извлечь из ответа. Уместность ссылки и качество самого ответа не оценивались.

Что не учитывалось намеренно

ЧтоПочему
Частотность запросов и оценки трафикасчитаются разными сервисами по разным моделям и между собой несопоставимы
Позиции в выдачеважен факт видимости, а не место в списке результатов
Оценки авторитета доменоввычисляются вендорами по закрытым формулам
Даты публикации страницзамер о составе тем, а не о хронологии
Уместность цитатытребует ручного разбора каждого ответа
Названия сайтов и площадокни один вывод на них не опирается

Общий принцип: в расчёт берутся факты присутствия, а не оценки. Оценка, посчитанная чужой закрытой моделью, выглядит как число, но проверить её нельзя. А смешивать проверяемое с непроверяемым в одной таблице — значит обесценивать обе половины.

Чего эти данные не показывают

Список ограничений длиннее списка выводов, и это нормально для замера такого рода.

  • Спрос. Видимость сайта по запросу не говорит, сколько людей его задают.
  • Трафик. Ни в одном из замеров нет данных о визитах, переходах и поведении читателей.
  • Деньги. Тема с широким присутствием агентств может не приносить ни одной заявки, и наоборот.
  • Рынок целиком. Шестнадцать сайтов и 853 запроса — это выборки, а не генеральная совокупность.
  • Динамика. Оба среза сняты в один месяц: сезонность и изменения выдачи здесь не видны.
  • Другие платформы. Второй замер описывает одну поисковую систему с генеративными ответами.
  • Причины. Данные фиксируют, что происходит, и молчат о том, почему.

Как повторить замер

Порядок воспроизводим целиком, без закрытых инструментов:

  1. Составить список сайтов ниши, у которых есть поисковая видимость.
  2. Снять по ним выгрузки видимости и свести строки к уникальным запросам.
  3. Убрать брендовые запросы — по названиям компаний из списка.
  4. Отфильтровать по словарю тем и зафиксировать сам словарь: без него результат непроверяем.
  5. Схлопнуть перестановки слов и посчитать, по скольким сайтам встречается каждая тема.
  6. Для второго замера — собрать список запросов, снять по ним сгенерированные ответы и извлечь домены источников.

Расхождение ваших чисел с этими — не опровержение. У вас другая выборка, другой словарь и другой месяц.

Спорное место

Самое слабое звено — словарь тематического фильтра. Он определяет и объём выборки, и распределение по темам: сдвиньте границы словаря — сдвинется вся таблица. Проверить его со стороны нельзя, а публикация словаря целиком сделала бы страницу нечитаемой. Это честная дыра в воспроизводимости, и признать её правильнее, чем обойти молчанием.

Второе сомнение — соблазн сравнить два замера напрямую. Выглядит красиво: агентства пишут об одном, а нейросети цитируют других. Но это разные выборки, собранные разными способами, и такое сравнение будет фигурой речи, а не выводом. Единственное, на что оно годится, — сформулировать вопрос для следующего замера.

Частые вопросы

Можно ли повторить эти замеры самостоятельно?

Да, в этом смысл публикации методики. Нужны выгрузки поисковой видимости по своему списку сайтов и список запросов для сбора сгенерированных ответов. Числа получатся другие — выборка будет другой, — но порядок шагов воспроизводится полностью.

Почему в расчёт не берётся частотность запросов?

Оценки частотности и трафика считаются разными сервисами по разным моделям и между собой несопоставимы. Складывать такие оценки с фактами присутствия — значит смешивать измеренное с предсказанным. Замер оперирует только фактами: запрос есть в выгрузке, сайт по нему виден.

Что считается одной темой?

Набор слов без учёта порядка. «Что такое SERM» и «SERM что такое» — одна тема. Синонимы и разные грамматические конструкции остаются разными темами: автоматическое объединение по смыслу требует ручной проверки, которой в замере не было.

Почему не названы сайты и площадки из выборки?

Ни один вывод не опирается на то, чей именно это сайт. Список названий превратил бы замеры в рейтинг и увёл бы обсуждение с методики на состав участников. Проверить выводы можно на собственной выборке — для этого имена не нужны.

Можно ли сравнивать между собой результаты двух замеров?

Напрямую нет. Это разные выборки, собранные разными способами: видимость шестнадцати сайтов и источники в 853 ответах. Совпадения между ними стоит считать поводом для отдельной проверки, а не выводом.

Источники

  1. Систематическая ошибка отбора — Wikipedia
  2. Медиана (статистика) — Wikipedia
Артём Строев
Пишу про измеримый маркетинг и видимость в ИИ-поиске. Публикуюсь под псевдонимом — почему так.