бенчмарки.

Grok 4.7, GPT-6 Astra, Claude и китайские модели, кто эффективнее?

Вчера SpaceXAI выложила Grok 4.7. За три недели до этого OpenAI выпустила GPT-6 Astra, Anthropic — Claude Fable 5.1. Ещё в июле рядом встал Claude Opus 5: сама Anthropic пишет, что для большинства задач включать надо его, а Fable доставать, когда Opus уже не тянет ваши замеры.Китайские лаборатории в этой компании больше не «дешёвый запасной аэродром». Qwen3.8 Max стоит те же $2 и $6 за миллион токенов, что и Grok, и на общем индексе отстаёт на один балл. Kimi K3 на суточных инженерных задачах сидит в том же коридоре, что и свежий Grok.

продолжить чтение

Бенчмарк Маракуйя ИИ на Terminal-Bench 4 и OSWorld 2

Всем привет!В прошлой статье я гонял Алису и Гигачат по сложным бенчмаркам как чаты: Arena-Hard, WildBench, MultiChallenge, τ³, ПРАКТ-120. Там модель должна была отвечать текстом в браузере - как будто она общалась с пользователем, а пользователь задавал разные задания. Те тесты определяли, справляется ли модель именно как чат-агент.

продолжить чтение

Проверяем Jev на открытых и внутренних данных: классификаторили фильтр?

Jev отвечает только «да/нет» или выбирает один из предложенных вариантов. 16 000 вызовов:сначала сравнение с gpt-5.4-mini и gpt-5.6-luna на четырёх открытых датасетах, затем несколько тысяч реальных решений в рабочих процессах. Где он выигрывает, где ошибается и как его использовать.

продолжить чтение

Открываем AliceAI-Foundation-80B-A3B-Base — новую языковую модель Яндекса, обученную с нуля

Сегодня мы открываем

продолжить чтение

Сравнение Алисы (Яндекс) и Гигачат (Сбер) по 5 бенчмаркам: τ³, ПРАКТ-120, MultiChallenge, WildBench и Arena‑Hard

Пара вводных слов, чтобы было понятно о чем речьВсем привет!Я обещал написать эту статью и я наконец-то закончил тесты и готов поделиться с вами результатами.Я потратил МНОГО времени на то, чтобы прогнать эти бенчмарки. Много времени на сетапы, много времени на ожидание тестов. Все вместе заняло около двух недель работы - модели обрывались, где-то нужно было костылять заплатки чтобы они отвечали, где-то просто ждать по несколько дней на прохождение теста (даже в многопоточном тестировании).

продолжить чтение

SKILL.state в coding-агентах: меньше истории, но не всегда меньше работы

О чём этот текстЭто рассказ о моём эксперименте: что захотелось попробовать, что получилось и где пришлось пересмотреть свои ожидания. Я не ставлю здесь задачу кого-то обучить или доказать, как правильно устраивать память агентов. Просто захотелось поделиться этим опытом — вместе с результатами, ошибками и вопросами, на которые у меня пока нет ответа.С чего всё началосьНедавно мне попалась статья SKILL.state: Scalable Long-Horizon Agent Skills

продолжить чтение

Локальный ассистент для зумов, часть 3: кто это говорит — и почему я трижды ошибся, отвечая на этот вопрос

В конце второй части я пообещал честный замер новых локальных моделей распознавания. Обещание пришлось выполнять целый день, и результат оказался самым обидным из возможных: менять нечего. Ни модель, ни эмбеддер, ни алгоритм. А три дефекта, которые я за этот день торжественно нашёл, оказались дефектами не системы, а моего измерительного стенда.Эта часть — про диаризацию: как ассистент отвечает на вопрос «кто это сказал» и почему на рабочем созвоне этот вопрос сложнее, чем разобрать слова. Предыдущие части читать не обязательно: первая

продолжить чтение

Вышла новая модель? Не смотри на бенчмарки, смотри на поисковик за её спиной

В этой статье я рассмотрю несколько тенденций в ИИ‑индустрии, которые не сильно освещаются в СМИ и не вызывают интереса у обычных читателей, но имеют огромный практический смысл. Мы с вами вместе проанализируем статистику за последние годы и разберём эти тенденции.Центр тяжести в ИИ‑гонке смещается от гонки самих LLM в сторону развития поисковых инструментов и сопутствующей инфраструктуры. Актуальность ответа LLM критически зависима не столько от данных, полученных при обучении, сколько от качества внешнего поиска и обработки найденной информации.

продолжить чтение

Галлюцинации нейросетей. Как это устроено, откуда берётся и как с этим бороться. Часть 2

В предыдущей статье мы обсудили откуда берутся галлюцинации LLM и что может их спровоцировать. В этой поговорим о последствиях и методах борьбы. Whisper слышит больше, чем нужноШесть дел, которых не было

продолжить чтение

Галлюцинации нейросетей. Как это устроено, откуда берётся и как с этим бороться. Часть 1

Одна маленькая даже не ошибка, а скорее особенность нейросетей пока мешает им развиваться и внедряться в жизнь куда более бурными темпами, чем сейчас. Хотя, казалось бы, — куда ещё быстрее? Но нет. Эта особенность стоила юристам отстранений от практики, авиакомпании — проигранного суда, а для Google стала поводом к потере примерно ста миллиардов долларов капитализации за один день. Слово «галлюцинация» станет словом года сразу в двух словарях.

продолжить чтение

123456...10...11