Grok 4.7, GPT-6 Astra, Claude и китайские модели, кто эффективнее?
Вчера SpaceXAI выложила Grok 4.7. За три недели до этого OpenAI выпустила GPT-6 Astra, Anthropic — Claude Fable 5.1. Ещё в июле рядом встал Claude Opus 5: сама Anthropic пишет, что для большинства задач включать надо его, а Fable доставать, когда Opus уже не тянет ваши замеры.Китайские лаборатории в этой компании больше не «дешёвый запасной аэродром». Qwen3.8 Max стоит те же $2 и $6 за миллион токенов, что и Grok, и на общем индексе отстаёт на один балл. Kimi K3 на суточных инженерных задачах сидит в том же коридоре, что и свежий Grok.
Бенчмарк Маракуйя ИИ на Terminal-Bench 4 и OSWorld 2
Всем привет!В прошлой статье я гонял Алису и Гигачат по сложным бенчмаркам как чаты: Arena-Hard, WildBench, MultiChallenge, τ³, ПРАКТ-120. Там модель должна была отвечать текстом в браузере - как будто она общалась с пользователем, а пользователь задавал разные задания. Те тесты определяли, справляется ли модель именно как чат-агент.
Проверяем Jev на открытых и внутренних данных: классификаторили фильтр?
Jev отвечает только «да/нет» или выбирает один из предложенных вариантов. 16 000 вызовов:сначала сравнение с gpt-5.4-mini и gpt-5.6-luna на четырёх открытых датасетах, затем несколько тысяч реальных решений в рабочих процессах. Где он выигрывает, где ошибается и как его использовать.
Открываем AliceAI-Foundation-80B-A3B-Base — новую языковую модель Яндекса, обученную с нуля
Сегодня мы открываем
Сравнение Алисы (Яндекс) и Гигачат (Сбер) по 5 бенчмаркам: τ³, ПРАКТ-120, MultiChallenge, WildBench и Arena‑Hard
Пара вводных слов, чтобы было понятно о чем речьВсем привет!Я обещал написать эту статью и я наконец-то закончил тесты и готов поделиться с вами результатами.Я потратил МНОГО времени на то, чтобы прогнать эти бенчмарки. Много времени на сетапы, много времени на ожидание тестов. Все вместе заняло около двух недель работы - модели обрывались, где-то нужно было костылять заплатки чтобы они отвечали, где-то просто ждать по несколько дней на прохождение теста (даже в многопоточном тестировании).
SKILL.state в coding-агентах: меньше истории, но не всегда меньше работы
О чём этот текстЭто рассказ о моём эксперименте: что захотелось попробовать, что получилось и где пришлось пересмотреть свои ожидания. Я не ставлю здесь задачу кого-то обучить или доказать, как правильно устраивать память агентов. Просто захотелось поделиться этим опытом — вместе с результатами, ошибками и вопросами, на которые у меня пока нет ответа.С чего всё началосьНедавно мне попалась статья SKILL.state: Scalable Long-Horizon Agent Skills
Вышла новая модель? Не смотри на бенчмарки, смотри на поисковик за её спиной
В этой статье я рассмотрю несколько тенденций в ИИ‑индустрии, которые не сильно освещаются в СМИ и не вызывают интереса у обычных читателей, но имеют огромный практический смысл. Мы с вами вместе проанализируем статистику за последние годы и разберём эти тенденции.Центр тяжести в ИИ‑гонке смещается от гонки самих LLM в сторону развития поисковых инструментов и сопутствующей инфраструктуры. Актуальность ответа LLM критически зависима не столько от данных, полученных при обучении, сколько от качества внешнего поиска и обработки найденной информации.
Галлюцинации нейросетей. Как это устроено, откуда берётся и как с этим бороться. Часть 2
В предыдущей статье мы обсудили откуда берутся галлюцинации LLM и что может их спровоцировать. В этой поговорим о последствиях и методах борьбы. Whisper слышит больше, чем нужноШесть дел, которых не было
Галлюцинации нейросетей. Как это устроено, откуда берётся и как с этим бороться. Часть 1
Одна маленькая даже не ошибка, а скорее особенность нейросетей пока мешает им развиваться и внедряться в жизнь куда более бурными темпами, чем сейчас. Хотя, казалось бы, — куда ещё быстрее? Но нет. Эта особенность стоила юристам отстранений от практики, авиакомпании — проигранного суда, а для Google стала поводом к потере примерно ста миллиардов долларов капитализации за один день. Слово «галлюцинация» станет словом года сразу в двух словарях.

