Что это
Компьютер не работает с текстом напрямую — он работает с числами. Эмбеддинг решает задачу перевода: каждому фрагменту сопоставляется набор из сотен или тысяч чисел, подобранный так, чтобы близкие по смыслу тексты оказались близко друг к другу.
Наглядная проверка этого свойства — арифметика над словами. Если из представления слова «король» вычесть «мужчина» и прибавить «женщина», ближайшим результатом окажется «королева». Смысловые отношения оказываются записаны в самой геометрии.
Где вы с этим сталкиваетесь
Поиск по смыслу. Страница про семантическое ядро находится по запросу «как сгруппировать запросы», хотя дословного совпадения нет: близость определяется не строкой, а расстоянием между представлениями.
Отбор источников для ответа нейросети. Прежде чем сгенерировать ответ, система ищет подходящие фрагменты — и ищет их именно векторным поиском. Попадание в выборку разбирается в материале про видимость в ответах нейросетей.
Отсечение похожего. При отборе почти-дубликат уже выбранного отбрасывается, потому что его представление слишком близко к предыдущему. Отсюда практический вывод: переписывать лидера «так же, только лучше» — способ гарантированно не попасть в ответ.
Единица отбора — фрагмент, а не страница
Следствие, которое упускают чаще прочих: представление строится не для документа целиком, а для куска текста. Длинный материал разрезается на фрагменты, и в выборку попадает фрагмент.
Отсюда два практических вывода. Первый: страница, отвечающая на пять разных вопросов, участвует в отборе пятью независимыми кусками, и один сильный раздел вытягивает её, даже если остальные слабые. Второй: ответ, размазанный по нескольким абзацам с отступлениями, целиком не попадает ни в один фрагмент и проигрывает более скучному, но собранному тексту.
Это же объясняет, почему структура страницы влияет на попадание в выборку сильнее, чем подбор слов: разрез идёт по границам смысловых блоков, и заголовок с самостоятельным ответом под ним даёт чистый фрагмент, а поток без границ — рваный.
Где ошибаются
Главное заблуждение — считать, что эмбеддинги «понимают» текст. Они фиксируют статистику совместной встречаемости, а не смысл: если в отрасли два термина годами путают, представление унаследует эту путаницу.
Второе — попытка оптимизировать текст под них. Никакой формы записи, повышающей качество представления, не существует; влияет только связность самого фрагмента. Абзац, отвечающий на один вопрос целиком, описывается точнее, чем абзац обо всём сразу.
Частые вопросы
Чем эмбеддинг отличается от ключевого слова?
Нужно ли что-то делать со своим текстом ради эмбеддингов?
Почему модель иногда путает похожие термины?
Источники
- Векторное представление слов — Wikipedia