Эмбеддинг
Обновлено 11.08.20261 мин
Эмбеддинг — представление текста, картинки или звука в виде набора чисел, где близкие по смыслу объекты оказываются рядом. На этом держатся семантический поиск, рекомендации и вся схема RAG.
Как это работает
Модель превращает фрагмент в вектор — список из сотен или тысяч чисел. Каждое число само по себе ничего не значит, но расстояние между двумя векторами отражает близость смыслов.
Поэтому «автомобиль» и «машина» оказываются рядом, а «автомобиль» и «суп» — далеко, хотя буквенно первое и второе не похожи. Поиск по эмбеддингам находит по смыслу, а не по совпадению строк.
Одна и та же модель эмбеддингов должна использоваться и при индексации, и при поиске. Векторы разных моделей несопоставимы: сменив модель, базу нужно строить заново.
Где это применяется
- Семантический поискНаходит нужный документ по описанию проблемы, даже если пользователь не знает правильных терминов.
- Поиск дубликатовДва текста об одном и том же оказываются рядом в векторном пространстве, даже будучи написанными разными словами.
- РекомендацииПохожие статьи, товары или треки подбираются по близости векторов, а не по совпадению тегов.
- КлассификацияОпределить тему или тональность можно по тому, к каким известным примерам вектор оказался ближе.