coding.

Anatomy of a Broken Benchmark Runner: How Seven AI Models Fixed (or Didn’t Fix) run-code.sh

IntroductionThere is a question quietly buried inside every task handed to a language model, and it rarely gets asked out loud. Do you trust one model? Do you go looking for the best model? Do you run several models side by side and keep whatever each of them happens to catch? Or — one turn further still — do you hand that whole pile of partial answers to yet another model and ask it to combine them into one? Each answer sounds reasonable on its own. Each is also, on its own, incomplete — and the only way to find out which incompleteness actually hurts you is to run the experiment rather than assume the answer.This article runs it, in four steps that build on each other.One model. A single broken bash script, with seven distinct bugs of varying severity, was handed to four models — Sonnet 5, HY3, Qwen3-Max, DeepSeek-V4-Flash — each working alone, each with no knowledge of what the others were doing. That's the first framing: one model, unaided, fixing only what it personally noticed.Best model.

продолжить чтение

Русский метаболический ИИ оказался сложнее, чем может переварить Claude Code

Мы строим метаболический ИИ. Синтетическую нервную систему с внутренним состоянием, с физиологией, с историей. И у всех агентов и продуктов на нашем коде есть традиция: каждая архитектурная фича имеет научное обоснование, каждый запрет — причину. Это не стайлгайд. Это физика системы.У нас долгое время была проблема с кодинг-агентами. Не техническая. Коцептуальная.Клод понимал архитектуру. Но писал по-своему.

продолжить чтение

Cerebras ускорила 1 трлн модель kimi K2.6 до тысяча т-sec

Недавно компания производитель чипов Cerebras добавила топовую открытую трилионную модель Kimi k2.6, на свою платформу.

продолжить чтение

Пилот взлететел, полет нормальный

Миронов В.О., Попов Д.В. ВведениеДиспетчер, общий сбор всех Хабристов !!! У нас экстренный пациент, надо доставить его как можно быстрее !!! Именно в таком формате у нас и проходил хакатон, который мы организовывали на базе Финансового университета при Правительстве РФ с поддержкой многопрофильного ИТ-холдинга T1. Для нас это был "пилотный" проект, и мы выполнили его очень бодро и весело. По моему мнению, участники остались довольны и было высказано всеобщее мнение повторить подобное ещё не раз.

продолжить чтение

Оказывается, у JetBrains есть свой CLI-агент Junie и он оказался лучшим в Terminal-Bench 2.0

Оказывается, JetBrains тихо развивает собственный агент для работы в терминале — Junie CLI. Инструмент не фигурирует в публичных анонсах, но именно он занял первое место в свежем бенчмарке Terminal-Bench 2.0, обойдя более известные решения.

продолжить чтение

Mistral выкатили Devstral 2 — открытая SOTA модель для кодинга

Неделю назад мы писали про Mistral 3 с MoE-моделью на 675B параметров. Сегодня компания представила Devstral 2 — новое поколение открытых моделей для кодинга.Главное:Devstral 2 (123B): 72.2% на SWE-bench Verified, фактически новый SOTA среди open-weight кодовых агентов.

продолжить чтение

Cursor 2.0 и модель Composer: как изменился популярный AI-редактор кода

Вчера компания Anysphere выпустила Cursor 2.0

продолжить чтение

Вышла Code World Model: новая модель для кодинга

Meta (признана экстремистской и запрещена в РФ) выкатила Code World Model (CWM) — LLM на 32 млрд параметров, которая не просто предсказывает следующую строчку кода, а учится понимать, как код исполняется. Впервые модель массово тренировали не только на исходниках, но и результатах выполнения Python-кода и взаимодействии с Docker-средами — по сути, научили её играть в программиста, который пишет, запускает, дебажит и фиксит баги.

продолжить чтение

Grok Code Fast 1 стала самой используемой моделью на OpenRouter

Модель Grok Code Fast 1 заняла первое место в рейтинге

продолжить чтение

LLM-инференс в 20 раз быстрее, чем на GPU! Как подключить агента-кодера с CLINE и Cerebras

Хочешь, чтобы твой AI-ассистент для кодинга работал в 20 раз быстрее, чем на современных GPU? В этой статье покажу, как подключить Cerebras к CLINE — и получить мгновенные ответы от LLM. Почему Cerebras в 20 раз быстрее, чем GPUКомпания Cerebras использует Wafer-Scale Engine 3 (WSE-3) — самый большой и быстрый ИИ-чип в мире. Основные фишки:WSE-3: гигантский кремниевый чип, размером с CD-диск, 4 триллиона транзисторов и 900 000 ядер.44 ГБ встроенной SRAM на самом кристалле → почти нет обмена с внешней памятью.20 Пбайт/с

продолжить чтение

12