Jev от TypeSafe: модель, с которой нельзя поговорить. API.. API. Jev.. API. Jev. llm.. API. Jev. llm. typesafe.. API. Jev. llm. typesafe. искусственный интеллект.. API. Jev. llm. typesafe. искусственный интеллект. калибровка.. API. Jev. llm. typesafe. искусственный интеллект. калибровка. классификация.. API. Jev. llm. typesafe. искусственный интеллект. калибровка. классификация. Программирование.. API. Jev. llm. typesafe. искусственный интеллект. калибровка. классификация. Программирование. Проектирование API.

Главное про Jev: с ней нельзя разговаривать. Текст она не генерирует вообще. На вход идёт состояние (строка или JSON) и набор заранее описанных вопросов, на выходе для каждого вопроса типизированный ответ с распределением вероятностей. Компанию основал Диогу Алмейда, бывший исследователь OpenAI, работавший над ChatGPT и RLHF.

Зачем это нужно

Типичная схема с LLM в роутинге тикетов: просим модель выбрать категорию, получаем текст, парсим, ловим случаи, когда модель ответила «скорее всего, это биллинг, но возможно…». Плюс ждём секунды там, где решение нужно для следующей строчки кода.

Jev закрывает ровно этот кусок. Вопросов три типа:

  • Choice выбирает один вариант из вашего списка;

  • Score ставит оценку по шкале, которую вы описали;

  • Noul возвращает вероятность того, что утверждение истинно.

В одном запросе их можно смешивать, все считаются параллельно по одному и тому же состоянию. Ответить чем-то вне вашего списка модель не может, отсюда у TypeSafe «0% галлюцинаций». Цифра взята из устройства API, замеров за ней нет.

Цифры вендора

TypeSafe заявляет 70–500 мс на ответ и $0.042 за миллион входных токенов, выходные бесплатно. В их же сравнениях Jev быстрее фронтирных LLM до 193 раз и дешевле до 444 раз. К этим числам две поправки из заметки Нженги: workflow для бенчмарков строила команда TypeSafe, а то, что цена не субсидирована, вендор, по его словам, пока доказать не может. Серверы на западном побережье США, так что из Европы и тем более из России задержка будет другой.

Что вышло у тестировавшего

Тикет «три дня не могу подключить Stripe, теряю продажи, помогите срочно» с тремя вопросами сразу дал за 72 мс:

  • отдел: технический, уверенность 72%;

  • срочность: 99%;

  • раздражение клиента: 1 по шкале до 2.

Интереснее сверка с документацией. В доках TypeSafe к Noul-вопросу «просит ли клиент живого оператора» приложены записанные ответы модели на шесть фраз. Нженга повторил три из них, две совпали точно: «Спасибо, помогло!» дала 0.02, «Я уже третий раз прошу, дайте поговорить с человеком» дала 0.99. А вот «Вы бот?» вместо заявленных в доках 0.40 получила 0.26.

Одна точка ничего не говорит о калибровке: для этого нужна размеченная выборка. Но воспроизводимость примеров страдает, а на вероятностях в Jev построено всё: документация прямо предлагает строить логику на порогах (высокая уверенность — действуем сами, средняя — переспрашиваем, низкая — отдаём человеку). Если ответ на пример из собственных доков сдвигается на 14 пунктов, пороги придётся подбирать на своих данных. Вероятно, это просто разница версий модели (сейчас 1.13), но проверить это снаружи нельзя.

Ограничения

Их TypeSafe перечисляет сама:

  • никакого многошагового рассуждения, модель рассчитана на быстрые суждения уровня «человек ответит за пару секунд» (отсюда название System One, по Канеману);

  • только текст; основной язык обучения английский, остальные, по словам вендора, работают хуже, и их советуют проверять на своих данных;

  • 64k токенов на весь запрос, но состояние вместе с самым длинным вопросом не больше 32k, и точность плывёт, когда состояние растёт;

  • лимиты вендор меняет на ходу: в заметке Нженги 250 тыс. токенов в секунду и 1200 запросов в минуту, в документации на 7 октября уже 100 тыс. токенов и 80 запросов в секунду;

  • доступ пока по листу ожидания.

Для русскоязычных команд второй пункт главный: публичных замеров на русском я не нашёл. Если у вас поддержка на русском, первая проверка — прогнать сотню реальных тикетов с известной разметкой и посмотреть, держится ли калибровка. 72 мс качество на русских тикетах не подтверждают.

Ниша при этом понятная: роутинг обращений, модерация, гардрейлы для ответов других LLM, разметка больших массивов текста. Везде, где сейчас стоит хрупкий if на регулярках или дорогой вызов чат-модели ради одного слова в ответе.

Автор: opium

Источник