стоимость LLM.

ИИ-Автопилот: поток принятых задач вырос в тринадцать раз

В первой части я рассказал, как из ручного копипаста тикетов в консоль агента вырос ИИ-Автопилот — полный конвейер от YouTrack до проверки в живом 2D/3D GUI. По ощущениям всё летало: бэклог таял, в SVN постоянно появлялись коммиты, пользователи едва успевали проверять готовые задачи.Вот только «по ощущениям» — это ровно та валюта, в которой посчитано большинство статей про ИИ-агентов, и доверия к ней у меня немного. Любая активная система выглядит продуктивной: что-то постоянно собирается, коммитится, переписывается. Отличить эффективность от активности можно только замером.

продолжить чтение

Нашёл модель в 8 раз дешевле. Она начала писать иероглифы в русских новостях

Нашёл модель в 8 раз дешевле. Она начала писать иероглифы в русских новостяхTL;DR — пишу @futur_e_news_bot, двуязычную ленту новостей. Каждая новость проходит через LLM: категория, перевод, тон, разбор. Это ~936 вызовов в сутки, и мне захотелось платить меньше. Я перебрал все бесплатные модели OpenRouter, нашёл платную в 8 раз дешевле текущей, обрадовался и выкатил. Через час в ленте появился заголовок «Как не,让智能手机 перегревать: советы в жару».Бесплатных моделей 17, доступны 3Первая мысль была очевидной: раз есть модели с ценой $0, надо брать их. На OpenRouter таких нашлось 17.

продолжить чтение

Скрытая цена LLM: как KV-cache увеличивает стоимость инференса и как эту проблему решает Google TurboQuant

продолжить чтение