llm. - страница 33

llm.

Четыре AI-агента сожгли 40 млн токенов, споря о коде. Я научил их вовремя останавливаться

Я пишу свою IDE как пет-проект. У неё есть название, но здесь обойдёмся без презентации продукта. Хочу рассказать про одну функцию, которая в итоге вытащила меня в отдельное исследование.Если вы хоть раз долго чинили баг вместе с coding-агентом, ситуация, скорее всего, знакомая. Модель находит правдоподобную причину, уверенно меняет код. Не помогло. Вы пишете: «Проверь себя».

продолжить чтение

ИИ ускорил разработчиков, но не разработку: результаты исследования 500+ команд

Данные более чем 500 инженерных организаций показывают: искусственный интеллект действительно ускоряет разработку, но одной скоростью картина не исчерпывается.Компания DX, специализирующаяся на аналитике инженерной эффективности и продуктивности разработки и вошедшая в состав Atlassian, опубликовала отчёт о влиянии ИИ на разработку по итогам II квартала 2026 года. DX работает с метриками продуктивности разработки и опыта разработчиков; её платформу используют крупные технологические и финансовые компании, включая GitHub, Airbnb, Pinterest и Morgan Stanley.

продолжить чтение

NVIDIA выпустила PAIR — виртуальный маршрутизатор локального инференса для домашних ПК

NVIDIA представила

продолжить чтение

Семь нейросетей сравнили вслепую на восьми заданиях: победила Fable 5.1, Kimi K3 взяла больше всего заданий

Опубликованы итоги открытого сравнения семи нейросетей от семи разных команд на восьми практических заданиях. Первое место по сумме баллов заняла Fable 5.1 (145), второе — Kimi K3 (133), третье — GPT-5.6 Sol (118). Все работы, голоса судей с пояснениями и сырые данные выложены на https://ikorg.ru/rating/.Кто участвовал. Fable 5.1, GPT-5.6 Sol , Kimi K3, Qwen 3.8 Max, Gemini 3.8 Flash, Grok 4.6 и DeepSeek V4 Pro.Задания.

продолжить чтение

CMF: новый формат для создания специализированных LLM моделей

Универсальные языковые модели умеют решать множество задач, но за эту универсальность приходится платить: они большие, тяжёлые и содержат множество переплетённых способностей сразу. Мне хотелось научиться брать уже обученную LLM и компилировать её под конкретную работу, получая компактного специалиста, который можно запускать на более дешевом оборудовании.При этом одна универсальная модель могла бы служить основой для целого семейства таких специалистов с автоматическим выбором подходящего под каждый запрос.

продолжить чтение

От «когда-нибудь» к работающему прототипу: как LLM дала идее шанс

Привет! Меня зовут Владислав Козлов, я тимлид аналитиков Business Security в Авито. Хочу поделиться с вами интересным опытом взаимодействия с LLM, который позволил мне дёшево и быстро проверить свою идею. А заодно — рассказать об интересном алгоритме кластеризации, который мы с моделью придумали и реализовали в виде библиотеки.

продолжить чтение

Cohere выпустила Parse 5: модель извлекает данные из сложных документов в Markdown

Компания Cohere выпустила коммерческую мультимодальную модель Parse 5

продолжить чтение

Perfscale news #9. GPU, LLM, Docker images

Приветствую, любители нагрузки. Для истории прошлые выпуски:Новости Perfscale № 1Perfscale news #2: Fix Protocol, Magic metrics и MCPperfscale news #3 Websocket, Inference, NPMPerfscale news #4. GRPC, Fixed Triggers, Child ProcessPerfscale news #5. SQL, Thresholds, неработающие Linked AccountsPerfscale news #6. GraphQL, поддержка Import, и метрикиPerfscale news #7. Fix Import, SOAP, and more HTTP metrics

продолжить чтение

GLM-5.3 уже в GPT Model Hub: новая модель Z.ai для разработки и ИИ-агентов

Привет, Хабр! Мы добавили GLM 5.3 в MWS GPT Model Hub — сервис для работы с LLM через OpenAI-совместимый API внутри MWS Cloud Platform.GLM 5.3

продолжить чтение

Проверяем возможности новой Gemini 3.8 — можно ли собрать 3D‑шутер без движка?

Второго сентября Google выкатил Gemini 3.8 Flash. В анонсе разработчики упирали на автономных агентов и решение сложных инженерных задач с длинным контекстом. Маркетологи, понятное дело, пообещали серьезный качественный скачок в кодинге. Я прочитал релиз, посмотрел видео с демонстрации. И вот именно увиденный клон Майкрафта, подбросил идейку проверить, правда ли она что‑то такое умеет, так как ранее у нас с ходу получалось сдлеать только что‑то уровня Арканоида.

продолжить чтение