llm. - страница 3

llm.

Как Jev сэкономил нам 90% бюджета

ВведениеВсем привет, мы команда разработчиков из Narisuemvse.by, и в данной статье мы хотим поделиться небольшим опытом по внедрению ИИ, и в частности рассказать об оптимизации автоматизации с помощью новой модели Jev. Прежде чем описать наш случай, хотелось бы внести некоторые пояснения по проекту. Внедряли мы это в магазин компьютерной техники, насчитывающий около 200 тыс. активных товаров.

продолжить чтение

50 лет эволюции поиска по коду: что под капотом кодинговых агентов

продолжить чтение

Gartner: расходы на использование LLM превысят среднюю зарплату разработчика к 2028 году

Согласно прогнозам консалтинговой компании Gartner к 2028 году расходы на кодинг с использованием LLM превысят среднюю зарплату разработчика в связи с огромным ростом потребления токенов и повсеместным переходом к оплате, основанной на объёме потребления.AI‑токены — это единицы данных, которые обрабатываются генеративными моделями. Потребление токенов напрямую влияет на стоимость инструментов разработки с использованием LLM, особенно при использовании подписок с тарификацией на основе фактического потребления.

продолжить чтение

Вдвое меньше токенов без смены модели: что NVIDIA сделала с harness кодинг-агента

Исследователи из NVIDIA, MIT и NTU поручили одному ИИ-агенту улучшать программу, в которой работает другой ИИ-агент, кодинг-ассистент. Цель поставили одну: тратить меньше токенов и сохранить качество решения задач.Найденные приёмы сократили расход токенов на 45–49 %, счёт за API снизился примерно на треть. Счёт упал меньше, потому что сэкономленные токены в основном приходились на prompt cache, который и так стоит дешевле. Средний балл на бенчмарке EdgeBench при этом снизился на 6 %.Статья SoL-Pi вышла 17 сентября 2026 года, код открыт в репозитории NVlabs/SoL-Pi.Что такое harness

продолжить чтение

Как я собрал винный бенчмарк на 3 266 вопросов руками LLM и где они меня подвели

В феврале я решил измерить, сколько языковые модели на самом деле знают про вино. Умеют ли они поддержать разговор о Бордо, мне было неинтересно. Меня интересовало, знают ли они, сколько месяцев Бароло обязано провести в бочке и в каком округе штата Вашингтон лежит AVA Beverly. К сентябрю из этого вышел бенчмарк OenoBench: 38 104 факта, собранных 35 скраперами из открытых источников, 3 266 вопросов с выбором ответа и прогон шестнадцати моделей. Почти всю работу сделали агенты: вопросы генерировали пять моделей, проверяли их десять агентов аудита. Я был единственным человеком в этой схеме и отвечал за то, что агенты проверить не могут: за вино.

продолжить чтение

Что умеет и где ломается Jev: большое тестирование

В работе с моделями важно не только знать их точность, скорость и цену, но и понимать, где им можно доверять, а где нужна дополнительная проверка. Многие ограничения обнаруживаются уже в процессе интеграции — и о них хотелось бы знать заранее.

продолжить чтение

Как мы описываем тысячи таблиц с помощью LLM

Привет, Хабр! Меня зовут Сергей Третьяков. Я product owner MWS Data Scout — сервиса, который описывает таблицы баз данных с помощью больших языковых моделей (LLM). 

продолжить чтение

Русский текст в Claude Opus 5 стоит в 3,9 раза дороже, чем в GPT-5.5, при одинаковой цене за токен

Цены на API языковых моделей публикуют за миллион токенов, и по этой цифре модели обычно сравнивают. Но «токен» у каждой модели свой. Я прогнал один и тот же русский текст через Claude Opus 5 и GPT-5.5: Opus 5 насчитал в нём в 3,9 раза больше токенов. Значит, при одинаковой цене за токен обработка русского текста на Opus 5 обойдётся почти вчетверо дороже, чем на GPT-5.5, — и это не зависит от того, у кого вы покупаете доступ.

продолжить чтение

Мы искали, куда coding agents тратят токены. Дело оказалось не в промптах

Мы много разрабатываем с помощью coding agents: веб‑приложения, MCP‑серверы, пайплайны обработки данных, системы из нескольких агентов. И чем лучше становилась инфраструктура вокруг агентов, тем больше в ней появлялось инструкций, проверок, субагентов и автоматики. По идее, разработка должна была становиться дешевле. А расход контекста рос.Первое подозрение было очевидным: слишком раздутые промпты. Мы искали не там.38 килобайт текста со смыслом «всё хорошо»Агент закончил изменение и запустил тесты. 178 тестов, все зелёные. На stdout прилетело 38 365 байт TAP:# Subtest:...ok 1 ‑...‑-duration_ms:...type: 'test'..

продолжить чтение

Нейросеть, которая молчит

15 сентября стартап TypeSafe AI вышел из стелса с раундом $40 млн и необычной новой моделью Jev. Она не умеет разговаривать и не пишет текста.Зачем она нужна? В компаниях AI чаще всего не болтает с человеком, а принимает тысячи мелких решений внутри программ: куда отправить письмо, насколько срочна заявка, похож ли платеж на мошенничество. Сейчас их все чаще отдают LLM, и она каждый раз генерирует текст, хотя программе нужно одно решение.

продолжить чтение