llm.
Модель Jev от TypeSafe AI стала доступна всем. На старте дают $5 на API‑счет
TypeSafe AI открыли общий доступ к Jev — модели для быстрых решений внутри AI-агентов и программных сценариев. Компанию основал Диого Алмейда, бывший исследователь OpenAI и соавтор работы об InstructGPT. Новым пользователям начисляют $5 на API-счёт — примерно 119 млн входных токенов по текущему тарифу.
Проверяем Jev на открытых и внутренних данных: классификаторили фильтр?
Jev отвечает только «да/нет» или выбирает один из предложенных вариантов. 16 000 вызовов:сначала сравнение с gpt-5.4-mini и gpt-5.6-luna на четырёх открытых датасетах, затем несколько тысяч реальных решений в рабочих процессах. Где он выигрывает, где ошибается и как его использовать.
Захватывающая история внедрения ИИ в умирающей не-IT-компании
Вся история выдумана. Любые совпадения с именами, должностями и компаниями случайны.Как компания забрала рынок
Тест Jev в качестве реранкера против LLM на классификации товаров по справочнику из 78 тысяч кодов
Публичные тарифы, токены фактические (у Gemini учтены токены мышления). Поиск без реранка даёт Acc@1 0.487 — ниже нижней границы графика.
Тупая модель с жёстким циклом проверки бьёт умную модель без него
Недавно читал тут статью про «Cost per Task» и про то, что самая дешёвая модель в линейке внезапно обгоняет самую умную по цене решённой задачи. С выводом согласен полностью, но хочу добавить то, чего в той статье не было: дело не только в модели. Дело в том, что происходит после того, как модель написала код.Последние восемь месяцев я строю агентную обвязку, в которой модель не просто пишет файлы, а обязана доказать, что написанное работает. Выяснилось следующее: если прикрутить к слабой модели честный цикл верификации, она уверенно обходит сильную модель, работающую в режиме «написал и отчитался».
Headroom на 80 запусках агента: что получилось с расходом токенов
Недавно увидел ещё один репозиторий с обещанием резко сократить расход контекста у LLM-агентов — Headroom. Я сейчас исследую эту тему на примере SKILL.state и уже писал о первых результатах на Хабре - это были первые инженерные эксперименты; более строгие проверки ещё продолжаются. Так что меня заинтересовал подход headroom и я решил заодно с прочими экспериментами наскоро прогнать Headroom через тот же тестовый стенд. Эта статья — о том, что получилось.
Почему regex больше не находит клиентов в Telegram: препарируем 12 081 сообщение с помощью каскадного AI-скоринга
## TL;DR (BLUF)Классический мониторинг Telegram-чатов по ключевым словам («ищу разработчика», «нужен сайт», «требуется подрядчик») в 2026 году технически мертв: регулярные выражения пропускают 79.5% целевых коммерческих заявок и одновременно генерируют более 60% ложноположительного шума (самореклама исполнителей, вакансии, взаимопиар). В этой статье мы разбираем инженерную архитектуру трехуровневого каскадного пайплайна: от легковесных эвристик (2 мс) и мультиязычных эмбеддингов (15 мс) до LLM Decision Logic со строгой JSON-схемой. Все выводы подкреплены открытым бенчмарком на выборке из
Вайб‑спекинг для 1С: как ИИ помогает аналитику превратить идею в техническое задание
Вайб‑кодинг уже стал привычным способом разработки: человек описывает задачу обычным языком, а ИИ помогает писать и уточнять код. Но до кода обычно появляются требования, карта процесса и техническое задание. Если этот этап выполнен поверхностно, модель лишь быстрее создаст решение не той задачи.Для работы аналитика точнее подходит термин вайб‑спекинг — диалог с ИИ, в котором исходная идея постепенно превращается в спецификацию: с границами доработки, объектами конфигурации, исключениями, рисками и критериями приёмки.

