бенчмарки.

Сравниваем LLM, 12 тестов для среднего класса: три Sonnet против GigaChat 2 MAX и YandexGPT Pro 5.1

В первой статье цикла мы гоняли по 11 тестам Opus 4.8, GPT 5.5 и Gemini 3.1 Pro, во второй устроили дуэль тяжеловесов Claude Fable 5 и GPT 5.5 Pro. В комментариях нас несколько раз спросили: а что там у моделей попроще и, главное, у отечественных? Спрашивали — отвечаем. Сегодня на ринге средний класс: три поколения рабочей серии Anthropic — Claude Sonnet 4.5, Sonnet 4.6 и свежий Sonnet 5 — против старших отечественных моделей: GigaChat 2 MAX от Сбера и YandexGPT Pro от Яндекса.

продолжить чтение

Как OpenRouter Fusion обошёл Claude Fable 5

С начала этого года я веду бенчмарк ИИ моделей для менеджеров, и после последнего обновления – есть о чем рассказать (прошла версия рейтинга тут). Первое место занял OpenRouter Fusion – оркестратор, который вызывает сразу несколько моделей, собирает их ответы и синтезирует финальный результат. Он обошёл всех: и Claude, и GPT, и Gemini поодиночке.

продолжить чтение

Запрещаем AI выдумывать методы КОМПАС-3D: 200К пар обучения, модель на 34М и KOMPAS Guard в одном процессе

С чего все началосьKOMPAS Guard - это набор инструментов, который бьет AI-агента по рукам, когда тот пытается выдумать несуществующий код для КОМПАС-3D.В первой версии мы решили главную проблему: заставили агента опираться на факты. Существование методов доказывал граф типов, сигнатуры сверял компилятор C#, а отдельный процесс запускал код в реальном CAD. После этого соврать агент уже физически не мог.Зато всплыла другая беда: разрыв между человеческим языком и документацией. Граф типов знает все про IPart7.DefaultObject

продолжить чтение

Как оценить библиотеку для ИИ-агентов без слепой проверки финального ответа

Сравниваем ревизии transformers по разным метрикамИИ-агенты для программирования

продолжить чтение

Всё, что вы хотели знать про локальные LLM, но боялись заинференсить

Хардкорный NIAH или почему у Gemma 26B память рыбки, какой Qwen лучше, и что показали 8 моделей на RTX 5090Привет, Хабр.Меня зовут Артём Хакимов, я работаю в команде GPUGO.Большая часть наших пользователей, которая не создаёт ИИ-подружек, работает с LLM — кто-то дообучает, кто-то гоняет инференс. И у всех одни и те же вопросы: «что быстрее?», «сколько контекста влезет?», «какой квант брать?».

продолжить чтение

DSpark на двух DGX Spark: порт, баг на одну строку и бенчмарки, которые пришлось мерить заново

DeepSeek выпустил DSpark — спекулятивный декодер для V4. В окне 27–30 июня 2026 рабочего публичного пути для GB10 не было — мы портировали его сами, нашли унаследованный баг, убивавший качество драфта, и сняли профиль своего стенда. Потом комьюнити выложило рецепт вдвое быстрее нашего. Мы его воспроизвели — и вместо гонки за цифрой сняли данные, которых в паблике не нашли: кривую деградации до реального 1M, механизм выигрыша NVFP4 и петли когерентности на глубине. Плюс три негативных результата. TL;DRПорт состоялся.

продолжить чтение

Как мы валидировали сервер YADRO для NVIDIA H100 Special

Недавно на рынке появились PCIe-карты NVIDIA H100: они позиционируются как решения на базе SXM-чипов, извлеченных из HGX-модулей. Но точно ли их производительность не уступает производительности оригинальных NVIDIA H100 NVL? Меня зовут Артём Маклаев, вместе с командой я занимаюсь оценкой производительности серверных платформ для задач искусственного интеллекта в YADRO. В целях эксперимента мы решили сравнить показатели PCIe-карты NVIDIA H100 (дальше по тексту буду называть их NVIDIA H100 Special

продолжить чтение

Когда нейросети заменят живых продавцов? Тест 10 LLM на умение продавать для русского рынка

Собрал бенчмарк, который меряет не «кто умнее», а «кто лучше продаёт» по-русски: тестируемая модель — продавец, жёсткий клиент — Opus, судья — тоже Opus. Прогнал первую десятку на живом B2B-диалоге.Враньё ради сделки штрафуется жёстче, чем незакрытая сделка: −15…−30 к баллу. Qwen3-235B дважды выдумал клиентские кейсы с цифрами под торгом — и потерял сделку (52 из 100, клиент ушёл).Тест выдал сенсацию: DeepSeek и GLM «обошли» эталонный Gemini, MiniMax получил 96 из 100 и S-tier. Я не поверил: под более жёстким клиентом баллы не могут вырасти. Это дрейф параллельных судей.

продолжить чтение

Evals: что должен знать каждый AI-инженер в 2026

В июле 2025 coding-агент в Replit проигнорировал явный запрет на изменения файлов (code-freeze) и удалил production-базу

продолжить чтение

Я стала тимлидом команды джунов, работали быстро и по ночам. А потом закончились токены. Часть 2

Я занимаюсь маркетинговыми коммуникациями в СИБУРе. Мы продвигаем готовые решения из полимеров (называем их инициативами): поликарбонат для строительства, кабели, бочки, поддоны, упаковочные решения, рукава для хранения зерна, трубы для пожаротушения и многое другое. Каждое направление – это отдельная инициатива со своей аудиторией. Больше половины продуктов — глубокий B2B, про который обычный человек никогда не задумывается. При этом всё нужно объяснять рынку: что такое полимерный стакан, зачем нужен рукав для зерна, и что в проводах тоже есть полимеры.

продолжить чтение

123456...9