Anatomy of a Broken Benchmark Runner: How Seven AI Models Fixed (or Didn’t Fix) run-code.sh
IntroductionThere is a question quietly buried inside every task handed to a language model, and it rarely gets asked out loud. Do you trust one model? Do you go looking for the best model? Do you run several models side by side and keep whatever each of them happens to catch? Or — one turn further still — do you hand that whole pile of partial answers to yet another model and ask it to combine them into one? Each answer sounds reasonable on its own. Each is also, on its own, incomplete — and the only way to find out which incompleteness actually hurts you is to run the experiment rather than assume the answer.This article runs it, in four steps that build on each other.One model. A single broken bash script, with seven distinct bugs of varying severity, was handed to four models — Sonnet 5, HY3, Qwen3-Max, DeepSeek-V4-Flash — each working alone, each with no knowledge of what the others were doing. That's the first framing: one model, unaided, fixing only what it personally noticed.Best model.
Русский метаболический ИИ оказался сложнее, чем может переварить Claude Code
Мы строим метаболический ИИ. Синтетическую нервную систему с внутренним состоянием, с физиологией, с историей. И у всех агентов и продуктов на нашем коде есть традиция: каждая архитектурная фича имеет научное обоснование, каждый запрет — причину. Это не стайлгайд. Это физика системы.У нас долгое время была проблема с кодинг-агентами. Не техническая. Коцептуальная.Клод понимал архитектуру. Но писал по-своему.
Cerebras ускорила 1 трлн модель kimi K2.6 до тысяча т-sec
Недавно компания производитель чипов Cerebras добавила топовую открытую трилионную модель Kimi k2.6, на свою платформу.
Пилот взлететел, полет нормальный
Миронов В.О., Попов Д.В. ВведениеДиспетчер, общий сбор всех Хабристов !!! У нас экстренный пациент, надо доставить его как можно быстрее !!! Именно в таком формате у нас и проходил хакатон, который мы организовывали на базе Финансового университета при Правительстве РФ с поддержкой многопрофильного ИТ-холдинга T1. Для нас это был "пилотный" проект, и мы выполнили его очень бодро и весело. По моему мнению, участники остались довольны и было высказано всеобщее мнение повторить подобное ещё не раз.
Оказывается, у JetBrains есть свой CLI-агент Junie и он оказался лучшим в Terminal-Bench 2.0
Оказывается, JetBrains тихо развивает собственный агент для работы в терминале — Junie CLI. Инструмент не фигурирует в публичных анонсах, но именно он занял первое место в свежем бенчмарке Terminal-Bench 2.0, обойдя более известные решения.
Mistral выкатили Devstral 2 — открытая SOTA модель для кодинга
Неделю назад мы писали про Mistral 3 с MoE-моделью на 675B параметров. Сегодня компания представила Devstral 2 — новое поколение открытых моделей для кодинга.Главное:Devstral 2 (123B): 72.2% на SWE-bench Verified, фактически новый SOTA среди open-weight кодовых агентов.
Cursor 2.0 и модель Composer: как изменился популярный AI-редактор кода
Вчера компания Anysphere выпустила Cursor 2.0
Grok Code Fast 1 стала самой используемой моделью на OpenRouter
Модель Grok Code Fast 1 заняла первое место в рейтинге
LLM-инференс в 20 раз быстрее, чем на GPU! Как подключить агента-кодера с CLINE и Cerebras
Хочешь, чтобы твой AI-ассистент для кодинга работал в 20 раз быстрее, чем на современных GPU? В этой статье покажу, как подключить Cerebras к CLINE — и получить мгновенные ответы от LLM. Почему Cerebras в 20 раз быстрее, чем GPUКомпания Cerebras использует Wafer-Scale Engine 3 (WSE-3) — самый большой и быстрый ИИ-чип в мире. Основные фишки:WSE-3: гигантский кремниевый чип, размером с CD-диск, 4 триллиона транзисторов и 900 000 ядер.44 ГБ встроенной SRAM на самом кристалле → почти нет обмена с внешней памятью.20 Пбайт/с

