nlp.
Сжатие словаря. Языки из омонимов и хроматическое число
В естественном языке распространено такое явление, что, чтобы установить значение слова, необходимо обратиться к контексту. На грядках растёт много лука. / Сильно натянута тетива лука.
AudioToText: управление требованиями через записи встреч
Ссылка на GitHub с кодом проекта в конце статьиТранскрибация встреч и краткое summary сегодня уже не редкость: это умеют и корпоративные сервисы, и связка «транскрипт + LLM». Не хватает другого — материала, по которому можно сопоставлять позиции разных людей по одним и тем же сущностям и не терять историю принятых решений. Из этой задачи и вырос AudioToText: pet‑проект, который пытается превратить записи встреч в основу для управления требованиями на проекте, а не просто в ещё один текстовый артефакт.
Что общего у Таро, Viterbi и LLM: как алгоритм выбирает один смысл из многих
Представьте, что человек спрашивает о смене профессии и вытягивает три карты: Повешенный → Маг → Колесница. Из одной и той же последовательности можно собрать несколько правдоподобных историй: о паузе и переосмыслении, о найденных ресурсах или о риске принять резкое действие за настоящее решение. Карты одинаковые, а смысловые маршруты — разные. Как интерпретатор выбирает один из них? И можно ли описать этот выбор так же, как поиск гипотезы в распознавании речи, машинном переводе или языковой модели?От множества трактовок к лучшему пути
Облачные ИИ не справляются, MiniLM-L6 ломается на философии: строим локальный RAG для сложных семантических текстов
Этот проект долго вынашивался и, в конце концов, начался как очередная попытка разобраться в философских текстах, написанных Джейн Робертс во второй половине двадцатого века.Естественно, с появлением мощных облачных ИИ не оставлялись попытки найти в них “качественных собеседников” по предложенной теме. Но, как показала практика, они справились с этой задачей далеко не блестяще! То галлюцинировали факты из общих знаний, то упираясь в границы своих датасетов.
MF Spark Camp: Как мы превращаем сухие алгоритмы в живой интеллект и собираем команду у костра
Когда: 29 июля 2026Формат: Лекции + Квиз + Нетворкинг у костра
Своя GPT-like LLM по WH40K с нуля. Часть 4: Дообучение на вопрос–ответ (SFT)
Привет, Хабр! Меня зовут Владимир, и это четвёртая часть цикла статей по написанию и обучению небольшой decoder-only LLM с нуля. В третьей части мы собрали LinguaLaboratoriumMechanicus, обучили base-модель на корпусе данных по Warhammer 40K и получили модель, которая умеет продолжать текст. Данная статья целиком посвящена этапу SFT - дообучению на датасете “вопрос - ответ”, чтобы модель могла вести диалог с пользователем, а не просто дописывать за него фразы.Содержание циклаПодготовка и токенизация данныхТрансформер
Структура, скрытая за написанием текста языковыми моделями
Языковые модели генерируют текст, следуя скрытым грамматическим правилам, или грамматика - просто побочный эффект предсказания следующего слова? Этот вопрос увлёк меня почти на два года исследований.|
Своя GPT-like LLM по WH40K с нуля. Часть 3: pre-train LLM
Привет, Хабр! Меня зовут Владимир, и это третья часть цикла статей по написании и обучению небольшой decoder-only LLM с нуля. В первой части мы обучили токенизатор и собрали pretrain-датасет, во второй части реализовали класс Трансформер-блока. В этой части будем собирать и предобучать нашу LLM.Содержание циклаПодготовка и токенизация данныхТрансформерСборка и обучение LLM (вы находитесь здесь)SFT этап (дообучение на Вопрос-Ответ)

