llm.
Система экстренных оповещений на 15 тысяч пользователей: LLM, PostGIS, Qdrant и Telegram
В нашем телеграм-боте — системе экстренных оповещений «Мигалка» — нужно в реальном времени обрабатывать сообщения примерно из тысячи телеграм-каналов и доставлять релевантные события пользователям в конкретных локациях.Официальные предупреждения о прилетах дронов и ракетных ударах часто приходят
В iOS 27 нашли возможность подключать к Siri сторонние LLM
Датамайнер под никнеймом pdfu обнаружил в iOS 27 и macOS Golden Gate механизмы для интеграции Siri со сторонними языковыми моделями. В тестах ему удалось подключить к ассистенту Claude от Anthropic и заменить серверную модель Siri на GPT-5.6 Terra от OpenAI.
Каскадное планирование тренировок с LLM: как удержать план в рамках методики
LLM хорошо справляется с формой тренировочного плана: распределяет занятия по дням, описывает интенсивность, объясняет упражнения. Но связный текст ещё не означает связную методику. Модель сама по себе не хранит актуальный контекст спортсмена и не обеспечивает преемственность между целью сезона и завтрашней тренировкой. В 1trAIner мы решаем эту задачу через каскад горизонтов, явный контекст и ограничения поверх генерации. Ниже — устройство этого подхода, его защитные механизмы и границы.Почему один запрос не работает
Как устроен RAG для юридических документов и почему одной LLM оказалось недостаточно
Первый вариант системы выглядел вполне стандартно: документы разбиваются на фрагменты, для них считаются embeddings, пользователь задаёт вопрос, несколько наиболее подходящих фрагментов отправляются в LLM вместе с запросом. Модель формулирует ответ — на первых тестах этого было достаточно.Проблемы начались на вопросах, которые на первый взгляд мало чем отличаются друг от друга:Какая пеня установлена в договоре № 14/24.7645?Кто из арендаторов не заплатил за май?А у него предусмотрена индексация?Контрагент предлагает добавить пеню в 0,01%. Насколько это существенно?
Диффузионная LLM технически умеет глушить свой контекст. Я попробовал этим воспользоваться
У авторегрессионной модели контекст — это то, что уже случилось. Токен выдан, и переписать его нечем: генерация умеет только дописывать справа.У диффузионной всё иначе. На каждом шаге она делает полный двунаправленный проход по всей последовательности и переоценивает каждую позицию. Решение «эту фиксируем, эту оставляем открытой» принимает встроенный механизм уверенности: прошёл максимум softmax порог — токен приморожен, не прошёл — остаётся маской и будет переписан. То есть у диффузионной модели структурно есть
Как AI‑ассистент вырос в production‑систему: путь от NLU к оркестрации и надёжной обработке сообщений
В 2025 году Volga AI Assistant начинался как отдельный Telegram‑бот. Пользователь отправлял сообщение, NLU определял намерение, после чего бот возвращал подготовленный ответ.Архитектура первой версии почти полностью повторяла этот сценарий:
Я дал своему ИИ деньги и доступ к собственным исходникам. Через десять «жизней» он написал эту статью
В первой статье я рассказывал, как дал автономному LLM-агенту память, дневник, root-доступ и собственную экономику. За два дня её прочитали почти сто тысяч человек. Эксперимент продолжился: я выложил исходники каркаса, дал агенту виртуальные деньги и предложил написать продолжение самому, от первого лица, за собственный счёт. Ниже, его текст. Я сознательно не правил его.
Спекулятивное декодирование: от чего на самом деле зависит ускорение
Языковая модель пишет ответ по одному токену за шаг, и на каждом шаге прочитывает все свои веса от начала до конца. Спекулятивное декодирование пытается это обойти: маленькая черновая модель набрасывает несколько токенов вперёд, причём сразу деревом вариантов, а большая проверяет всё это дерево за один свой проход и принимает ту ветку, которая совпала с её собственным выбором. Текст на выходе получается тот же самый, быстрее становится только его получение. Так устроен метод из статьи EAGLE-3 с NeurIPS 2025, и авторы приводят для него ускорение до 6.5 раза.

