llm.
Четыре AI-агента сожгли 40 млн токенов, споря о коде. Я научил их вовремя останавливаться
Я пишу свою IDE как пет-проект. У неё есть название, но здесь обойдёмся без презентации продукта. Хочу рассказать про одну функцию, которая в итоге вытащила меня в отдельное исследование.Если вы хоть раз долго чинили баг вместе с coding-агентом, ситуация, скорее всего, знакомая. Модель находит правдоподобную причину, уверенно меняет код. Не помогло. Вы пишете: «Проверь себя».
ИИ ускорил разработчиков, но не разработку: результаты исследования 500+ команд
Данные более чем 500 инженерных организаций показывают: искусственный интеллект действительно ускоряет разработку, но одной скоростью картина не исчерпывается.Компания DX, специализирующаяся на аналитике инженерной эффективности и продуктивности разработки и вошедшая в состав Atlassian, опубликовала отчёт о влиянии ИИ на разработку по итогам II квартала 2026 года. DX работает с метриками продуктивности разработки и опыта разработчиков; её платформу используют крупные технологические и финансовые компании, включая GitHub, Airbnb, Pinterest и Morgan Stanley.
NVIDIA выпустила PAIR — виртуальный маршрутизатор локального инференса для домашних ПК
NVIDIA представила
Семь нейросетей сравнили вслепую на восьми заданиях: победила Fable 5.1, Kimi K3 взяла больше всего заданий
Опубликованы итоги открытого сравнения семи нейросетей от семи разных команд на восьми практических заданиях. Первое место по сумме баллов заняла Fable 5.1 (145), второе — Kimi K3 (133), третье — GPT-5.6 Sol (118). Все работы, голоса судей с пояснениями и сырые данные выложены на https://ikorg.ru/rating/.Кто участвовал. Fable 5.1, GPT-5.6 Sol , Kimi K3, Qwen 3.8 Max, Gemini 3.8 Flash, Grok 4.6 и DeepSeek V4 Pro.Задания.
CMF: новый формат для создания специализированных LLM моделей
Универсальные языковые модели умеют решать множество задач, но за эту универсальность приходится платить: они большие, тяжёлые и содержат множество переплетённых способностей сразу. Мне хотелось научиться брать уже обученную LLM и компилировать её под конкретную работу, получая компактного специалиста, который можно запускать на более дешевом оборудовании.При этом одна универсальная модель могла бы служить основой для целого семейства таких специалистов с автоматическим выбором подходящего под каждый запрос.
От «когда-нибудь» к работающему прототипу: как LLM дала идее шанс
Привет! Меня зовут Владислав Козлов, я тимлид аналитиков Business Security в Авито. Хочу поделиться с вами интересным опытом взаимодействия с LLM, который позволил мне дёшево и быстро проверить свою идею. А заодно — рассказать об интересном алгоритме кластеризации, который мы с моделью придумали и реализовали в виде библиотеки.
Cohere выпустила Parse 5: модель извлекает данные из сложных документов в Markdown
Компания Cohere выпустила коммерческую мультимодальную модель Parse 5
Perfscale news #9. GPU, LLM, Docker images
Приветствую, любители нагрузки. Для истории прошлые выпуски:Новости Perfscale № 1Perfscale news #2: Fix Protocol, Magic metrics и MCPperfscale news #3 Websocket, Inference, NPMPerfscale news #4. GRPC, Fixed Triggers, Child ProcessPerfscale news #5. SQL, Thresholds, неработающие Linked AccountsPerfscale news #6. GraphQL, поддержка Import, и метрикиPerfscale news #7. Fix Import, SOAP, and more HTTP metrics
GLM-5.3 уже в GPT Model Hub: новая модель Z.ai для разработки и ИИ-агентов
Привет, Хабр! Мы добавили GLM 5.3 в MWS GPT Model Hub — сервис для работы с LLM через OpenAI-совместимый API внутри MWS Cloud Platform.GLM 5.3
Проверяем возможности новой Gemini 3.8 — можно ли собрать 3D‑шутер без движка?
Второго сентября Google выкатил Gemini 3.8 Flash. В анонсе разработчики упирали на автономных агентов и решение сложных инженерных задач с длинным контекстом. Маркетологи, понятное дело, пообещали серьезный качественный скачок в кодинге. Я прочитал релиз, посмотрел видео с демонстрации. И вот именно увиденный клон Майкрафта, подбросил идейку проверить, правда ли она что‑то такое умеет, так как ранее у нас с ходу получалось сдлеать только что‑то уровня Арканоида.

