llm.
Как Jev сэкономил нам 90% бюджета
ВведениеВсем привет, мы команда разработчиков из Narisuemvse.by, и в данной статье мы хотим поделиться небольшим опытом по внедрению ИИ, и в частности рассказать об оптимизации автоматизации с помощью новой модели Jev. Прежде чем описать наш случай, хотелось бы внести некоторые пояснения по проекту. Внедряли мы это в магазин компьютерной техники, насчитывающий около 200 тыс. активных товаров.
Gartner: расходы на использование LLM превысят среднюю зарплату разработчика к 2028 году
Согласно прогнозам консалтинговой компании Gartner к 2028 году расходы на кодинг с использованием LLM превысят среднюю зарплату разработчика в связи с огромным ростом потребления токенов и повсеместным переходом к оплате, основанной на объёме потребления.AI‑токены — это единицы данных, которые обрабатываются генеративными моделями. Потребление токенов напрямую влияет на стоимость инструментов разработки с использованием LLM, особенно при использовании подписок с тарификацией на основе фактического потребления.
Вдвое меньше токенов без смены модели: что NVIDIA сделала с harness кодинг-агента
Исследователи из NVIDIA, MIT и NTU поручили одному ИИ-агенту улучшать программу, в которой работает другой ИИ-агент, кодинг-ассистент. Цель поставили одну: тратить меньше токенов и сохранить качество решения задач.Найденные приёмы сократили расход токенов на 45–49 %, счёт за API снизился примерно на треть. Счёт упал меньше, потому что сэкономленные токены в основном приходились на prompt cache, который и так стоит дешевле. Средний балл на бенчмарке EdgeBench при этом снизился на 6 %.Статья SoL-Pi вышла 17 сентября 2026 года, код открыт в репозитории NVlabs/SoL-Pi.Что такое harness
Как я собрал винный бенчмарк на 3 266 вопросов руками LLM и где они меня подвели
В феврале я решил измерить, сколько языковые модели на самом деле знают про вино. Умеют ли они поддержать разговор о Бордо, мне было неинтересно. Меня интересовало, знают ли они, сколько месяцев Бароло обязано провести в бочке и в каком округе штата Вашингтон лежит AVA Beverly. К сентябрю из этого вышел бенчмарк OenoBench: 38 104 факта, собранных 35 скраперами из открытых источников, 3 266 вопросов с выбором ответа и прогон шестнадцати моделей. Почти всю работу сделали агенты: вопросы генерировали пять моделей, проверяли их десять агентов аудита. Я был единственным человеком в этой схеме и отвечал за то, что агенты проверить не могут: за вино.
Что умеет и где ломается Jev: большое тестирование
В работе с моделями важно не только знать их точность, скорость и цену, но и понимать, где им можно доверять, а где нужна дополнительная проверка. Многие ограничения обнаруживаются уже в процессе интеграции — и о них хотелось бы знать заранее.
Как мы описываем тысячи таблиц с помощью LLM
Привет, Хабр! Меня зовут Сергей Третьяков. Я product owner MWS Data Scout — сервиса, который описывает таблицы баз данных с помощью больших языковых моделей (LLM).
Русский текст в Claude Opus 5 стоит в 3,9 раза дороже, чем в GPT-5.5, при одинаковой цене за токен
Цены на API языковых моделей публикуют за миллион токенов, и по этой цифре модели обычно сравнивают. Но «токен» у каждой модели свой. Я прогнал один и тот же русский текст через Claude Opus 5 и GPT-5.5: Opus 5 насчитал в нём в 3,9 раза больше токенов. Значит, при одинаковой цене за токен обработка русского текста на Opus 5 обойдётся почти вчетверо дороже, чем на GPT-5.5, — и это не зависит от того, у кого вы покупаете доступ.
Мы искали, куда coding agents тратят токены. Дело оказалось не в промптах
Мы много разрабатываем с помощью coding agents: веб‑приложения, MCP‑серверы, пайплайны обработки данных, системы из нескольких агентов. И чем лучше становилась инфраструктура вокруг агентов, тем больше в ней появлялось инструкций, проверок, субагентов и автоматики. По идее, разработка должна была становиться дешевле. А расход контекста рос.Первое подозрение было очевидным: слишком раздутые промпты. Мы искали не там.38 килобайт текста со смыслом «всё хорошо»Агент закончил изменение и запустил тесты. 178 тестов, все зелёные. На stdout прилетело 38 365 байт TAP:# Subtest:...ok 1 ‑...‑-duration_ms:...type: 'test'..
Нейросеть, которая молчит
15 сентября стартап TypeSafe AI вышел из стелса с раундом $40 млн и необычной новой моделью Jev. Она не умеет разговаривать и не пишет текста.Зачем она нужна? В компаниях AI чаще всего не болтает с человеком, а принимает тысячи мелких решений внутри программ: куда отправить письмо, насколько срочна заявка, похож ли платеж на мошенничество. Сейчас их все чаще отдают LLM, и она каждый раз генерирует текст, хотя программе нужно одно решение.

