Медиана

Perplexity: как устроен поиск с ответами и кого он цитирует

Как Perplexity собирает ответ со сносками, по какому принципу отбирает источники и что из этого следует для сайта, который хочет туда попасть.

Обновлено 21.08.2026 · 6 мин чтения

Perplexity — поисковая система, которая отдаёт связный текст со сносками на источники вместо списка ссылок. Вопрос раскладывается на поисковые запросы, из найденных документов отбираются отдельные фрагменты, из них собирается ответ, и рядом с утверждениями ставятся номера ссылок. Попадание в источники определяется пригодностью фрагмента к цитированию, а не позицией страницы целиком.

Коротко

  • Результат работы — написанный текст со сносками, поэтому конкуренция идёт за фрагмент, а не за позицию страницы.
  • Список источников виден прямо в ответе, и это единственная платформа, где состав выборки можно проверить глазами без инструментов.
  • Доступ разделён на две роли: сбор в индекс и открытие страницы по действию пользователя. Разрешение одной не даёт второй.
  • Свежесть материала весит больше, чем в обычной выдаче, потому что часть запросов уходит в поиск в реальном времени.
  • Переход приходит в аналитику обычным рефералом и описывает только ту часть влияния, которая дошла до счётчика.

Поиск с ответами устроен вокруг одного решения: пользователю отдаётся готовый текст со сносками, а не десять ссылок на выбор. Из этого решения выводится всё остальное — как отбираются источники, что вообще можно измерить и почему привычные приёмы работы с позициями здесь дают меньше, чем работа с формой абзаца.

Чем ответная машина отличается от обычной выдачи

Отличие не в оформлении, а в единице отбора. Обычная выдача ранжирует документы: десять мест, на каждом одна страница. Ответная машина ранжирует фрагменты и собирает из них новый текст, к утверждениям которого приписаны номера источников.

Следствий три, и все практические. Первое: страница попадает в ответ не целиком, а куском — сильный материал со слабо сформулированным нужным абзацем проигрывает слабому материалу с точной формулировкой. Второе: мест в ответе больше, чем в первой десятке, и они не упорядочены как позиции. Третье, самое полезное: список источников виден прямо в ответе, поэтому состав выборки читается глазами без единого инструмента — редкая ситуация, потому что в сгенерированных ответах поисковых систем состав приходится восстанавливать вручную.

Отсюда и другая постановка задачи. Цель — не «подняться выше», а «войти в состав источников по вопросу». Общая механика такого отбора разобрана в материале о четырёх слоях видимости; ниже — то, что специфично для этой платформы.

Путь запроса: от вопроса до сносок

Вопрос не ищется целиком. Он раскладывается на несколько поисковых формулировок, под каждую собираются документы, из документов вынимаются подходящие пассажи, и уже из пассажей пишется ответ.

ЭтапЧто решаетсяНа что вы влияете
Разбор вопроса на подзапросыКакие темы войдут в ответКосвенно — покрытием формулировок в семантике
Поиск документовКакие страницы попадут в кандидатыИндексацией, доступом ботов, свежестью
Отбор фрагментовКакой абзац будет прочитанФормой: прямой ответ, самодостаточный блок
Сборка ответаЧто войдёт в текстОднозначностью формулировки, наличием цифр и определений
Простановка сносокКого назовут источникомТем, вынимается ли утверждение без искажения

Третья и четвёртая строки — это работа со сходством смыслов, а не со словами: соответствие ищется через векторное представление текста, где близость считается по эмбеддингам, а не по совпадению фраз. Поэтому подгонка ключевых слов здесь бесполезна вдвойне, а точная формулировка мысли — наоборот, единственный рычаг.

Кого платформа берёт в источники

Прямого ответа на этот вопрос никто не публикует, но состав выборки виден в каждом ответе, и повторяющиеся типы источников видно за полчаса ручного просмотра.

Регулярно всплывают четыре категории: официальная документация и справки платформ, площадки вопросов и ответов, отраслевые блоги узкой тематики, обзорные подборки и рейтинги. Общее у них — форма, а не размер: короткий законченный ответ, который вынимается без контекста.

Числа по этой платформе у нас нет, и придумывать его мы не будем. Есть смежное наблюдение: в замере 853 сгенерированных ответов другой поисковой системы на один ответ приходилось в среднем 11,2 цитируемых домена, ответов без источников не встретилось, а среди цитируемых оказались блоги небольших профильных компаний. Переносить проценты нельзя, а вывод о структуре — можно: места в ответе не распределяются по размеру домена.

Обратная сторона того же наблюдения неприятна. Если формат «объяснить термин» уже плотно занят, ваш текст конкурирует не качеством, а отличием — что хорошо видно по разбору блогов агентств, где страницы разных компаний различаются оформлением, а не содержанием.

Доступ: две роли и два разных разрешения

Платформа ходит по сайтам под разными именами, и роли у них не совпадают. Одна собирает страницы в индекс, из которого потом отбираются кандидаты. Вторая открывает конкретный адрес в момент, когда он понадобился под запрос пользователя.

Разрешить первую и закрыть вторую — распространённая ошибка настройки robots.txt: страница будет в индексе, но не откроется в момент, когда её содержимое понадобится. Обратная комбинация не лучше: открывать нечего, если в индексе ничего нет.

Три технических условия к этому прилагаются. Контент отдаётся в HTML без исполнения JavaScript. Ответ сервера не зависит от того, откуда пришёл запрос. Защита на уровне CDN не режет обход по умолчанию — эту настройку нужно открыть и посмотреть, а не предположить.

Что попадает в аналитику, а что нет

Переход из ответа приходит обычным реферальным визитом с домена платформы. Никаких меток, никакого исходного вопроса, никакого указания на то, в каком именно ответе оказалась страница, в отчёт не передаётся — механика та же, что у переходов из ассистентов вообще.

Разметить такую ссылку метками вы не можете: адрес берётся из индекса, а не из вашей рассылки. Поэтому единственный доступный уровень — сегмент по домену источника, и он описывает нижнюю границу канала. Всё, что происходит без перехода, относится к нулевым кликам и в счётчик не попадает вовсе. Как сводить это в отчёт, не обманывая себя, разобрано в заметке про учёт трафика из нейросетей.

Симптом → причина → что делать

В обычном поиске страница в топе, в источниках её нет никогда. Это слой доступа, а не текста. Проверить обход ботами, отдачу контента без JavaScript и блокировки на стороне CDN — правка абзацев здесь ничего не даст.

Домен в источниках есть, но сноска ведёт на другую вашу страницу. Под этот подзапрос лучший фрагмент оказался не там, где вы его планировали. Нужен отдельный самодостаточный блок с прямым ответом на целевой странице, а не переработка всей статьи.

Присутствие скачет от прогона к прогону. Обычное состояние: выборка пересобирается заново. Считать долю прогонов с присутствием за месяц одним и тем же списком вопросов, а не реагировать на каждый.

Цитата есть, а в рекомендации назван конкурент. Вас используют как источник факта, но не как решение задачи. Это разные события, и лечится второе упоминаниями за пределами сайта, а не формой страницы.

Где эта картина перестаёт работать

Описанное выше объясняет ту часть, которой вы управляете. Есть области, где рычаг смещается и работа с сайтом не помогает.

  • Вопросы о свежих событиях. Решает скорость попадания в индекс, а не форма абзаца. Материал, опубликованный после того, как ответ собран, в него не попадёт.
  • Ответы, построенные на памяти модели. Если поиск не запускается, первые слои не участвуют: влияет только то, что было написано о предмете раньше и где-то ещё. Механика разобрана в устройстве языковых моделей.
  • Темы с повышенными требованиями к источнику. Право, здоровье, деньги: платформы осторожнее выбирают, кого назвать, и требование к говорящему перевешивает качество формулировки.
  • Узкие вопросы с двумя источниками в природе. Попасть легко, объёма это не даёт — спрашивают редко.
  • Разговоры в закрытых пространствах. Часть обсуждений идёт там, куда краулер не заходит; повлиять и посчитать нельзя.

Общее у пяти случаев одно: ни один не чинится переписыванием страницы, и честнее назвать границу вслух, чем править форму там, где решается не форма.

Спорное место

Слабое место всего написанного — источник знания. Ни одна платформа не публикует правила отбора источников, поэтому любой разбор устройства собран из наблюдений за поведением, официальной документации по ботам и переноса общей механики поиска с дополнением генерацией. Это модель, а не описание системы, и она устаревает быстрее, чем накапливается статистика.

Второе сомнение — про масштаб. Возможность увидеть состав источников глазами делает эту платформу удобной для наблюдения, и из-за этого её легко переоценить: измеримость канала часто путают с его размером. Разумная позиция — использовать её как испытательный стенд для проверки формулировок, а вес в плане назначать по доле трафика, которую она реально приносит.

Частые вопросы

Чем Perplexity отличается от чата с включённым поиском?

Порядком действий и назначением. В чате поиск — дополнительная возможность, включающаяся не всегда, а здесь он основной режим: почти каждый ответ строится на найденных документах и сопровождается ссылками. Практическое следствие — состав источников виден всегда, и его можно проверять как обычную выдачу.

Нужно ли открывать PerplexityBot в robots.txt?

Если вы хотите попадать в источники — да, без этого страница не собирается в индекс платформы. Отдельно проверьте вторую роль: агент, открывающий страницу по конкретному действию пользователя, ходит под другим именем, и разрешение одного не означает разрешения другого.

Почему нас процитировали один раз, а потом перестали?

Состав источников пересобирается под каждый запрос заново, и выпадение из одного ответа не означает потери позиции. Вывод делается по доле прогонов с вашим присутствием за несколько недель одним и тем же списком вопросов, а не по единичной проверке.

Сколько источников попадает в один ответ?

Числа для этой платформы у нас нет. В собственном замере сгенерированных ответов другой системы по 853 запросам на ответ приходилось в среднем 11,2 домена, а ответов без источников не встретилось. Переносить это на Perplexity без проверки нельзя — но порядок величины показывает, что мест в ответе обычно больше десяти.

Цитирование приносит переходы?

Частично. Часть аудитории удовлетворяется текстом ответа, часть открывает сноску, часть запоминает название и приходит позже напрямую. В отчётах видна только вторая группа, поэтому планировать канал по числу переходов и оценивать его по числу цитат — разные задачи.

Источники

  1. Perplexity AI — Wikipedia
  2. Retrieval-augmented generation — Wikipedia
  3. Документация Perplexity — Perplexity
Артём Строев
Пишу про измеримый маркетинг и видимость в ИИ-поиске. Публикуюсь под псевдонимом — почему так.