Что это
Компьютер не работает с текстом напрямую — он работает с числами. Эмбеддинг решает задачу перевода: каждому фрагменту сопоставляется набор из сотен или тысяч чисел, подобранный так, чтобы близкие по смыслу тексты оказались близко друг к другу.
Наглядная проверка этого свойства — арифметика над словами. Если из представления слова «король» вычесть «мужчина» и прибавить «женщина», ближайшим результатом окажется «королева». Смысловые отношения оказываются записаны в самой геометрии.
Где вы с этим сталкиваетесь
Поиск по смыслу. Страница про семантическое ядро находится по запросу «как сгруппировать запросы», хотя дословного совпадения нет: близость определяется не строкой, а расстоянием между представлениями.
Отбор источников для ответа нейросети. Прежде чем сгенерировать ответ, система ищет подходящие фрагменты — и ищет их именно векторным поиском. Попадание в выборку разбирается в материале про видимость в ответах нейросетей.
Отсечение похожего. При отборе почти-дубликат уже выбранного отбрасывается, потому что его представление слишком близко к предыдущему. Отсюда практический вывод: переписывать лидера «так же, только лучше» — способ гарантированно не попасть в ответ.
Где ошибаются
Главное заблуждение — считать, что эмбеддинги «понимают» текст. Они фиксируют статистику совместной встречаемости, а не смысл: если в отрасли два термина годами путают, представление унаследует эту путаницу.
Второе — попытка оптимизировать текст под них. Никакой формы записи, повышающей качество представления, не существует; влияет только связность самого фрагмента. Абзац, отвечающий на один вопрос целиком, описывается точнее, чем абзац обо всём сразу.
Частые вопросы
Чем эмбеддинг отличается от ключевого слова?
Нужно ли что-то делать со своим текстом ради эмбеддингов?
Почему модель иногда путает похожие термины?
Источники
- Векторное представление слов — Wikipedia