- BrainTools - https://www.braintools.ru -

«Эмбеддинги на примерах с собаками», или как работать с векторными представлениями: книги и руководства по теме

Мы в Beeline Cloud [1] собрали для вас подборку открытых руководств и обучающих материалов по теме эмбеддингов: что собой представляют подходы TF-IDF и Word2vec, какие нюансы стоит учитывать, используя косинусное сходство для семантического поиска, а также чем различаются алгоритмы векторизации — показательно на схемах.

Изображение: visuals (Unsplash License)

Изображение: visuals (Unsplash License)

Собаки —> книги

Питер Сарджент, разработчик открытого программного обеспечения и директор по ИИ в международной консалтинговой компании, опубликовал руководство по векторным представлениям [2] для не знакомых с программированием «любителей животных». На примере задачи, в которой необходимо классифицировать собак, он показывает, что такое эмбеддинги и как с ними работать.

Автор, очевидно, считает, что лучший учитель — это практика, поэтому без лишней теории показывает, как построить вектор для бульдога, немецкого дога, ши-тцу, бордер-колли и бигля; в качестве параметров он взял размер и уровень интеллекта [3] разных пород. Степень подобия Сарджент рассчитал, используя манхэттенское расстояние [4], чем познакомил читателей с основами векторной математики [5].

Во второй части материала автор от условных собак в вакууме переходит к более конкретному и практическому примеру — категоризации книг на английском языке с учетом количества слов и частоты их появления в каждом томе. В этом кейсе специалист рассказывает про мешок слов [6] и показывает, как отфильтровывать «полезные» лексемы от нерелевантного «шума» (в частности, артиклей и предлогов). Далее Сарджент последовательно переходит к обсуждению методов векторизации TF-IDF и Word2vec. К примеру, показывает, как Word2vec позволяет получить векторные представления, отражающие семантику слов, а также как рекуррентные нейронные сети (RNN [7]) дают возможность учитывать точную последовательность эмбеддингов.

Наглядность — признак мастерства

Бывший мейнтейнер фреймворка CAMEL и куратор awesome-подборки [8] со сценариями OpenClaw [9] Хесам Шейх опубликовал «Введение в эмбеддинги [10]». Материал ориентирован на начинающих погружение в тему векторных представлений, и интересен тем, как преподносит основы: от традиционных подходов на базе TF-IDF и Word2vec до трансформеров. Так, один из примеров посвящен применению TF-IDF для работы с открытым датасетом [11], содержащим тексты Шекспира. Специалист разбил набор данных на десять фрагментов, построил векторные представления для слов и использовал метод главных компонент (PCA [12]), чтобы отобразить их на графике. Большая часть слов оказалась сконцентрирована в одной области — как пишет автор, так получилось потому, что эмбеддинги по методу TF-IDF не отражают семантических связей между словами. Несмотря на определенные недостатки (и возраст подхода), TF-IDF до сих пор используют в задачах информационного поиска, извлечения ключевых слов и базового анализа текста.

В заключительной части материала автор показывает, как работать с векторными представлениями в современных БЯМ, а также предлагает пошаговый практикум по векторам с моделью DeepSeek-R1-Distill-Qwen-1.5B — от разбивки предложений на токены до преобразования их в эмбеддинги и поиска похожих представлений для конкретного слова.

Руководство содержит множество интерактивных визуализаций, блок-схем и облаков тегов, упрощающих восприятие [13] материала — даже на КДПВ представлен интерактивный граф, который можно «покрутить» [он отражает взаимосвязи между пятьюдесятью словами и ближайшими токенами в модели DeepSeek-R1-Distill-Qwen-1.5B]. Некоторые иллюстрации, вполне вероятно, были отрисованы Хесамом вручную. Ну а все примеры кода продублированы в репозитории [14] на GitHub.

Если вам близок стиль подачи автора, стоит обратить внимание [15] и на другие его образовательные проекты. Помимо курируемой awesome-подборки он также ведет репозиторий [16] со статьями и заметками по различным направлениям машинного обучения [17]. Среди материалов — разбор [18] графовых нейронных сетей и публикация [19], посвященная нюансам обработки естественного языка.

Эмбеддинги от А до Я

Вики Бойкис — инженер машинного обучения, которая проектировала инфраструктуру для интеллектуальных моделей в Mozilla.ai [20], писала алгоритмы для систем рекомендаций в компании Automattic, развивающей WordPress, и в одном из крупнейших телекомов — Comcast. Долгое время работая с эмбеддингами, структурами данных и моделями глубокого обучения, Вики отметила, что многие публикации или чересчур поверхностны, или, наоборот, написаны академическим языком и чрезмерно усложнены. 

В итоге она захотела написать собственное руководство «от А до Я» для начинающих, но слегка увлеклась и, по сути, написала полноценную книгу «Что такое эмбеддинги [21]», которую выложила в открытый доступ под лицензией CC BY-SA 3.0. Также материал был опубликован на GitHub [22], где набрал больше 1,1 тыс. звезд. По словам автора, руководство рассчитано на широкую аудиторию — от специалистов по машинному обучению до разработчиков, продакт-менеджеров, исследователей и студентов.

Изображение: Google DeepMind (Unsplash License)

Изображение: Google DeepMind (Unsplash License)

Первый и второй блоки книги — это общее введение, посвященное системам рекомендаций и векторным представлениям, для которого не нужны особые навыки в сфере МО или программирования. Но для последующих разделов уже потребуются знания линейной алгебры и Python. Например, третий блок посвящен классическим методам векторизации данных: One-Hot-кодированию [23], подходам векторного представления TF-IDF, Word2vec, а также латентно-семантическому анализу [24] и латентному размещению Дирихле (LDA [25]). Последний раздел — практический, в нем Бойкис рассматривает, как описанные в книге методы применяются в «боевых условиях», на примере известных платформ вроде Pinterest или Google Store.

Если после прочтения книги вы захотите глубже погрузиться в тему машинного обучения и эмбеддингов, то автор подготовила подборку персональных рекомендаций [26] для дополнительного чтения. Статьи про устройство векторов и работу с ними также можно найти и в блоге Бойкис, к примеру, в одной из публикаций она рассказывает, почему [27] и как менялись подходы к построению эмбеддингов. А ее пет-проект Viberary [28], система семантического поиска книг по настроению, появился как дополнение к руководству — в посте Бойкис объясняет, как именно разрабатывала инструмент (особенно подробно она разбирает реализацию векторных представлений).

Разница налицо — векторные методы в графиках

В 2025 году Памела Фокс, Python-разработчик из Microsoft, выступала на профильной конференции. Темой ее доклада [29], для которого она подготовила мегаслайд с графиками и иллюстрациями, была визуализация векторных представлений. Позже Фокс решила дополнить материалы выступления и опубликовала на его основе руководство «Наглядное введение в эмбеддинги [30]». В нем она рассматривает различные модели для преобразования текста в числовые векторы — привычную Word2vec, а также text-embedding-ada-002 с text-embedding-3-small, представленные OpenAI в 2022 и 2024 годах.

Ключевая особенность материала — наглядность и минимум текста. Возможности каждого метода описаны небольшими абзацами, а вся необходимая информация отображена на схемах. К примеру, на диаграмме для Word2vec показаны 300 измерений слова «королева». В таком духе Фокс сопоставляет подходы между собой, показывает отличия в метриках. В конце материала речь идет о продвинутых техниках работы с эмбеддингами. Например, как устроен метод векторного поиска и зачем нужны алгоритмы ANN [31], HNSW [32], DiskANN [33]. Еще Фокс говорит о способах векторного сжатия, скалярной и двоичной квантизации [34] и снижении [35] размерности в моделях с поддержкой MRL [36]. 

В прошлом году работа Памелы привлекла внимание резидентов Hacker News — тематический тред на площадке набрал больше ста восьмидесяти плюсов и десятки комментариев. В целом пользователи высоко оценили [37] наглядную подачу, отметив, что разбор сложных концепций векторизации нередко перегружают теорией и трудными для восприятия формулами, тогда как визуализации и диаграммы делают рассказ доступнее. Например, разработчик Танель Подер поделился [38] своим экспериментом, в котором показал, как модель компьютерного зрения [39] реагирует на одно и то же изображение кота, повернутое под разными углами, построив тепловые карты эмбеддингов для наглядности.

Косинусное сходство: инструкция по применению

В конце 2025 года Петр Мигдал, разработчик открытой Python-библиотеки для ML-визуализации livelossplot [40] и специалист в области науки о данных, опубликовал в личном блоге статью «Не используйте косинусное сходство бездумно [41]». Его ключевой тезис прост: косинусное сходство не стоит воспринимать как универсальный подход. По мнению эксперта, одна из главных проблем заключается в самой интерпретации понятия «сходство», которая может заметно меняться в зависимости от контекста. Как иронично замечает Мигдал, в США Word2vec вполне может посчитать «эспрессо» и «капучино» почти идентичными сущностями, хотя в Италии с таким утверждением многие бы поспорили.

Поэтому автор статьи предлагает альтернативные подходы по оценке схожести слов и понятий. Один из них — прямой запрос к LLM для сопоставления двух записей. Например, выбрав достаточно производительную модель, можно обратиться к ней с промптом: «Является ли {sentence_a} правдоподобным ответом на {sentence_b}?». По его словам, такой метод годится для RAG, поскольку отражает необходимость выбирать не только похожие документы, но и релевантные.

Еще немного по теме

Мы также собрали несколько профильных материалов на русском языке:

Beeline Cloud [1] — безопасный облачный провайдер. Разрабатываем облачные решения, чтобы вы предоставляли клиентам лучшие сервисы.

Что еще публикуем в нашем блоге и на платформе «вАЙТИ»:

Автор: beeline_cloud

Источник [49]


Сайт-источник BrainTools: https://www.braintools.ru

Путь до страницы источника: https://www.braintools.ru/article/30043

URLs in this post:

[1] Beeline Cloud: https://cloud.beeline.ru/?utm_source=owned_media&utm_medium=habr&utm_campaign=beeline_cloud&utm_term=embed

[2] руководство по векторным представлениям: https://sgnt.ai/p/embeddings-explainer/

[3] интеллекта: http://www.braintools.ru/article/7605

[4] манхэттенское расстояние: https://en.wikipedia.org/wiki/Taxicab_geometry

[5] математики: http://www.braintools.ru/article/7620

[6] мешок слов: https://en.wikipedia.org/wiki/Bag-of-words_model

[7] RNN: https://en.wikipedia.org/wiki/Recurrent_neural_network

[8] awesome-подборки: https://github.com/hesamsheikh/awesome-openclaw-usecases

[9] OpenClaw: https://github.com/openclaw/openclaw

[10] Введение в эмбеддинги: https://huggingface.co/spaces/hesamation/primer-llm-embedding

[11] датасетом: https://github.com/karpathy/char-rnn/blob/master/data/tinyshakespeare/input.txt

[12] PCA: https://en.wikipedia.org/wiki/Principal_component_analysis

[13] восприятие: http://www.braintools.ru/article/7534

[14] репозитории: https://github.com/hesamsheikh/llm-mechanics

[15] внимание: http://www.braintools.ru/article/7595

[16] репозиторий: https://github.com/hesamsheikh/ml-retreat

[17] обучения: http://www.braintools.ru/article/5125

[18] разбор: https://github.com/hesamsheikh/ml-retreat/blob/main/assets/introduction-to-GNN.pdf

[19] публикация: https://github.com/hesamsheikh/ml-retreat/blob/main/assets/Natural-Language-Processing.pdf

[20] Mozilla.ai: http://Mozilla.ai

[21] Что такое эмбеддинги: https://vickiboykis.com/what_are_embeddings/

[22] опубликован на GitHub: https://github.com/veekaybee/what_are_embeddings

[23] One-Hot-кодированию: https://sky.pro/wiki/analytics/one-hot-encoding-chto-eto-takoe-i-kak-primenyat-v-mashinnom-obuchenii/

[24] латентно-семантическому анализу: https://en.wikipedia.org/wiki/Latent_semantic_analysis

[25] LDA: https://en.wikipedia.org/wiki/Latent_Dirichlet_allocation

[26] подборку персональных рекомендаций: https://vickiboykis.com/what_are_embeddings/next.html

[27] почему: https://vickiboykis.com/2025/09/01/how-big-are-our-embeddings-now-and-why/?/

[28] Viberary: https://vickiboykis.com/2024/01/05/retro-on-viberary/

[29] доклада: https://drive.google.com/file/d/1pnI2XGxwhQQDKF2Ktl2XvaUUf294_-Qe/view?pli=1

[30] Наглядное введение в эмбеддинги: https://blog.pamelafox.org/2025/05/a-visual-exploration-of-vector.html

[31] ANN: https://www.elastic.co/blog/understanding-ann

[32] HNSW: https://en.wikipedia.org/wiki/Hierarchical_navigable_small_world

[33] DiskANN: https://github.com/microsoft/DiskANN

[34] квантизации: https://learn.microsoft.com/ru-ru/azure/search/vector-search-how-to-quantization

[35] снижении: https://en.wikipedia.org/wiki/Dimensionality_reduction

[36] MRL: https://huggingface.co/blog/matryoshka#theoretically-1

[37] высоко оценили: https://news.ycombinator.com/item?id=44127346

[38] поделился: https://tanelpoder.com/posts/comparing-vectors-of-the-same-rotated-image/

[39] зрения: http://www.braintools.ru/article/6238

[40] livelossplot: https://github.com/stared/livelossplot

[41] Не используйте косинусное сходство бездумно: https://p.migdal.pl/blog/2025/01/dont-use-cosine-similarity/

[42] Что такое эмбеддинги и как с ними работать: https://habr.com/ru/articles/947216/

[43] Что такое эмбеддинги и как они помогают искусственному интеллекту понять мир людей: https://www.nkj.ru/open/36052/

[44] Русскоязычная документация OpenAI: https://openai-docs.ru/docs/guides/embeddings%23what-are-embeddings

[45] Выходные — для развития: Пара книг и ресурсов для погружения в инженерию данных: https://habr.com/ru/companies/beeline_cloud/articles/1014908/

[46] Spring AI: феноменология цифрового сознания, или Как я перестал бояться и полюбил облачные модели: https://vaiti.io/spring-ai-fenomenologiya-czifrovogo-soznaniya-ili-kak-ya-perestal-boyatsya-i-polyubil-oblachnye-modeli/

[47] «Просто данных» больше недостаточно для обучения ИИ: https://vaiti.io/prosto-dannyh-bolshe-nedostatochno-dlya-obucheniya-ii/

[48] Как ИИ упирается в данные: кризис датасетов в активной фазе: https://vaiti.io/kak-ii-upiraetsya-v-dannye-krizis-datasetov-v-aktivnoj-faze/

[49] Источник: https://habr.com/ru/companies/beeline_cloud/articles/1033544/?utm_campaign=1033544&utm_source=habrahabr&utm_medium=rss

www.BrainTools.ru

Rambler's Top100