оценка моделей.

Проверяем Jev на открытых и внутренних данных: классификаторили фильтр?

Jev отвечает только «да/нет» или выбирает один из предложенных вариантов. 16 000 вызовов:сначала сравнение с gpt-5.4-mini и gpt-5.6-luna на четырёх открытых датасетах, затем несколько тысяч реальных решений в рабочих процессах. Где он выигрывает, где ошибается и как его использовать.

продолжить чтение

Kimi K3 на PAC1 и ECOM1: результаты 204 задач и разбор отказов

Kimi K3 на PAC1 и ECOM1: результаты 204 задач и разбор отказов27 июля Moonshot AI опубликовала открытые веса Kimi K3 и технический отчёт с результатами на coding‑ и агентных бенчмарках. По этим таблицам K3 выглядит конкурентоспособной на задачах с кодом, терминалом и инструментами.Но итоговый балл не показывает, какие операции система действительно завершает, где оставляет неверное состояние и на каком шаге нарушает контракт. Мы решили проверить это на задачах с полностью открытыми трассами.

продолжить чтение

Эксплуатация моделей (ModelOps)

Привет, Хаброжители! Сегодня мы поделимся с вами отрывком из книги: "Современная бизнес-аналитика. Увеличьте ценность данных с помощью Python и R". Статья посвящена ModelOps — набору практик для эффективного развертывания и эксплуатации моделей машинного обучения. Вы узнаете, как организовать полный жизненный цикл модели: от оценки и мониторинга до переобучения. В материале приведены практические примеры создания приложений для пакетной и онлайн-оценки с помощью R Shiny и Python Streamlit, а также дашборда для мониторинга производительности в реальном времени.

продолжить чтение

Месть дата-сайентиста: почему LLM не отменили нашу профессию

Закончилась ли золотая эпоха дата-сайентистов? Когда-то Harvard Business Review назвал эту профессию «самой сексуальной работой XXI века». В технологической индустрии позиции data scientist часто входили в число самых высокооплачиваемых. При этом работа требовала необычного сочетания навыков:Data Scientist (сущ.): человек, который знает статистику лучше любого разработчика и разбирается в разработке лучше любого статистика.— JosH100 (@josh_wills), 3 мая 2012 года

продолжить чтение

DeepMind определил тест для AGI

Почти три года назад Google DeepMind опубликовала Levels of AGI - работу, которая определила пять уровней AI-систем (от начального до сверхчеловеческого) и шесть уровней автономии (от инструмента до полностью автономного агента). Индустрия получила общую терминологию - что-то вроде уровней автономного вождения , только для интеллекта. Но без способа измерить, на каком уровне находится конкретная система, классификация осталась сугубо теоретической. Каждый мог назвать свою модель level 2, и никто не мог это опровергнуть.В марте 2026-го вышло продолжение.

продолжить чтение

Метрики для задач NLP. Часть 2. Генерация текста: BLEU, ROUGE, METEOR, BERTScore

Всем привет! Меня зовут Максим. Я NLP‑инженер в red_mad_robot и автор Telegram‑канала Максим Максимов // IT, AI. Это вторая часть серии статей про метрики задач NLP, в которой я затрону тему оценки качества в задачах генерации текста. Мы рассмотрим следующие метрики: BLEUROUGEMETEORBERTScoreНачнем!Генерация текста

продолжить чтение

Новые финансовые бенчмарки для LLM. Лаборатории ИИ «Финама»

В Лаборатории искусственного интеллекта «Финама» мы изучаем и развиваем применение ИИ в домене финансов: от бенчмаркинга LLM до прикладных сценариев в трейдинге и управлении рисками. Сегодня хотим поделиться с вами нашим исследовательским проектом.В последнее время мы все чаще встречаем новости вроде “ИИ от OpenAI взял «золото» Международной олимпиады по информатике”. Главное преимущество такого формата оценки — уверенность, что задания оригинальные и что, при обучении модели они не встречались в идентичном виде.

продолжить чтение

Метрики для задач NLP. Часть 1. Классификация, NER, Кластеризация

Всем привет! Меня зовут Максим. Я NLP‑инженер в red_mad_robot и автор Telegram‑канала Максим Максимов // IT, AI. В этой серии статей я расскажу о метриках популярных задач Natural Language Processing (NLP). Первая часть будет посвящена подходам для оценки моделей в решении задач классификации, NER и кластеризации. Рассказ будет сопровождаться визуализацией, примерами и кодом на Python.СодержаниеВведениеКлассификацияNERКластеризация

продолжить чтение

LLM в роли «судьи» vs. человеческая оценка: почему вместе — лучше

В гонке за следующей волной «умных» систем большие языковые модели берут на себя неожиданные роли. Одна из самых интересных — использовать такие модели как «судей» для оценки других моделей. Подход уже экономит командам массу ручной работы, но остаются вопросы: способен ли LLM уловить каждую тонкую ошибку? Что происходит в ситуациях, где критичны человеческая интуиция или глубокая предметная экспертиза?

продолжить чтение

Понимание оценки LLM: детальный разбор 4 основных подходов

Привет! Вчера вышла отличная статья от Себастьяна Рашки, которая детально разбирает основные способы оценки LLM-моделей. Глобально их можно разделить на 4 категории: оценка по бенчмаркам, использование верификаторов, лидерборды и LLM-as-a-judge.

продолжить чтение

12