llm. - страница 17

llm.

Модель Jev от TypeSafe AI стала доступна всем. На старте дают $5 на API‑счет

TypeSafe AI открыли общий доступ к Jev — модели для быстрых решений внутри AI-агентов и программных сценариев. Компанию основал Диого Алмейда, бывший исследователь OpenAI и соавтор работы об InstructGPT. Новым пользователям начисляют $5 на API-счёт — примерно 119 млн входных токенов по текущему тарифу.

продолжить чтение

Почему ваша LLM тупеет на больших документах и как ее починить

Привет, Хабр!Меня зовут Андрей Бирюков. Я — независимый эксперт в области ИТ и ИБ, преподаю в учебных центрах и пишу статьи и книги. Когда Google анонсировал 2M контекста, а Anthropic подкинул еще 100K, наверняка многие подумали, что RAG теперь можно выкинуть на свалку истории. Зачем париться с этими чанками, эмбеддингами и всякой прочей ерундой, если можно просто кинуть в модель весь дамп википедии и спросить ее что угодно?

продолжить чтение

Проверяем Jev на открытых и внутренних данных: классификаторили фильтр?

Jev отвечает только «да/нет» или выбирает один из предложенных вариантов. 16 000 вызовов:сначала сравнение с gpt-5.4-mini и gpt-5.6-luna на четырёх открытых датасетах, затем несколько тысяч реальных решений в рабочих процессах. Где он выигрывает, где ошибается и как его использовать.

продолжить чтение

Захватывающая история внедрения ИИ в умирающей не-IT-компании

Вся история выдумана. Любые совпадения с именами, должностями и компаниями случайны.Как компания забрала рынок

продолжить чтение

Программирование для тех, кто не пишет код: как устроен VibeCraft

продолжить чтение

Тест Jev в качестве реранкера против LLM на классификации товаров по справочнику из 78 тысяч кодов

Публичные тарифы, токены фактические (у Gemini учтены токены мышления). Поиск без реранка даёт Acc@1 0.487 — ниже нижней границы графика.

продолжить чтение

Тупая модель с жёстким циклом проверки бьёт умную модель без него

Недавно читал тут статью про «Cost per Task» и про то, что самая дешёвая модель в линейке внезапно обгоняет самую умную по цене решённой задачи. С выводом согласен полностью, но хочу добавить то, чего в той статье не было: дело не только в модели. Дело в том, что происходит после того, как модель написала код.Последние восемь месяцев я строю агентную обвязку, в которой модель не просто пишет файлы, а обязана доказать, что написанное работает. Выяснилось следующее: если прикрутить к слабой модели честный цикл верификации, она уверенно обходит сильную модель, работающую в режиме «написал и отчитался».

продолжить чтение

Headroom на 80 запусках агента: что получилось с расходом токенов

Недавно увидел ещё один репозиторий с обещанием резко сократить расход контекста у LLM-агентов — Headroom. Я сейчас исследую эту тему на примере SKILL.state и уже писал о первых результатах на Хабре - это были первые инженерные эксперименты; более строгие проверки ещё продолжаются. Так что меня заинтересовал подход headroom и я решил заодно с прочими экспериментами наскоро прогнать Headroom через тот же тестовый стенд. Эта статья — о том, что получилось.

продолжить чтение

Почему regex больше не находит клиентов в Telegram: препарируем 12 081 сообщение с помощью каскадного AI-скоринга

## TL;DR (BLUF)Классический мониторинг Telegram-чатов по ключевым словам («ищу разработчика», «нужен сайт», «требуется подрядчик») в 2026 году технически мертв: регулярные выражения пропускают 79.5% целевых коммерческих заявок и одновременно генерируют более 60% ложноположительного шума (самореклама исполнителей, вакансии, взаимопиар). В этой статье мы разбираем инженерную архитектуру трехуровневого каскадного пайплайна: от легковесных эвристик (2 мс) и мультиязычных эмбеддингов (15 мс) до LLM Decision Logic со строгой JSON-схемой. Все выводы подкреплены открытым бенчмарком на выборке из

продолжить чтение

Вайб‑спекинг для 1С: как ИИ помогает аналитику превратить идею в техническое задание

Вайб‑кодинг уже стал привычным способом разработки: человек описывает задачу обычным языком, а ИИ помогает писать и уточнять код. Но до кода обычно появляются требования, карта процесса и техническое задание. Если этот этап выполнен поверхностно, модель лишь быстрее создаст решение не той задачи.Для работы аналитика точнее подходит термин вайб‑спекинг — диалог с ИИ, в котором исходная идея постепенно превращается в спецификацию: с границами доработки, объектами конфигурации, исключениями, рисками и критериями приёмки.

продолжить чтение

1...10...151617181920...3040...366