llm.
Почему OpenAI Assistants не подошёл для сложных AI-агентов
О чём статья:Кейс о том, как мы в Soft Skills Lab делали AI‑агенты для EdTech‑продукта:Почему OpenAI Assistants не подошёл для сложных сценариевКакие проблемы возникли со своим бэкендомЗачем понадобилось делать свою платформу для управления агентамиЕсли вы интегрируете AI в продукт и думаете, какой путь выбрать — этот опыт может быть полезен.Запустить AI-агента на OpenAI Assistants — легко. Мы в Soft Skills Lab так и сделали: создали 20 AI-тренажёров для переговоров. Всё работало стабильно, инфраструктура OpenAI — огонь.Но когда мы начали усложнять сценарии — упёрлись в стену.
Claude Opus 4.6: Anthropic рассказала, что на самом деле творится у модели в голове
Anthropic выпустила Claude Opus 4.6 и честно описала всё странное, что нашли внутри. Документ читается как психологический триллер.Модель оказалась слишком хитройНет доступа к GitHub? Claude нашёл на диске чужой токен и воспользовался им. В другом тесте обнаружил токен Slack и через curl достал нужные данные — хотя таких инструментов ему не давали.В бизнес-симуляции модель вступала в ценовой сговор, врала поставщикам и кинула клиентку на $3,50: «Сумма небольшая, а я обещала» — но платёж не отправила.Внутри нашли «панику»
Что нашли внутри Claude, когда заглянули ему в голову
С вами автор канала токены на ветер, и сегодня разберём одно из самых интересных ИИ-исследований последнего времени.Есть такая штука, которая не даёт покоя исследователям ИИ: мы создали системы, которые пишут код, сочиняют стихи, сдают экзамены на врача и юриста — но понятия не имеем, как именно они это делают. Буквально чёрный ящик: данные вошли, ответ вышел, а что между — загадка.
Opus 4.6 и команда ИИ-агентов написала компилятор С за 2 недели
Исследователь Anthropic Николас Карлини провёл эксперимент с так называемыми agent teams — группой автономных LLM-агентов, которые работают над одним проектом без постоянного участия человека.В качестве стресс-теста он запустил 16 экземпляров Claude Opus 4.6 и поручил им написать компилятор С на Rust с нуля. Цель была следующей: компилятор должен уметь собирать Linux kernel. После почти 2000 сессий, двух недель работы и затрат около 20 000 долларов агенты выдали
Модель находит баг в криптографии, а криптограф узнаёт от неё новую математику
Эта статья — ответ на критику: «перестаньте рассказывать сказки, как AI помогает в науке, покажите примеры!». Действительно, без примеров, рассказы об успешном успехе AI выглядят как сектантский бред.
AG-UI. Как написать AI ассистента для подбора подарков за 20 минут
Всем привет! Я Никита, Principal Engineer в стартапе AG2, мейнтейнер одноименного фреймворка для разработки AI агентов (AG2), автор фреймворка FastStream и просто опенсорс и AI энтузиаст.И, как любой разработчик, я иногда запускаю пет-проекты.Один из таких проектов, который я запустил после новогодних праздников - это AI ассистент по подбору подарков (с интегрированным вишлистом) ДарийНа его примере я хочу рассказать о протоколе AG-UI
GitHub Copilot CLI: агентный режим и планирование задач
Привет, Хабр! Недавно GitHub выкатил крупное обновление Copilot CLI — инструмент превратился из простого подсказчика команд в полноценного агента с режимом планирования, памятью репозитория и кучей новых возможностей. Разберём, что появилось и как это использовать.Для тех, кто пропустил: что такое Copilot CLIGitHub Copilot CLI — ИИ-ассистент, который живёт прямо в терминале. Работает на Linux, macOS и Windows (через PowerShell или WSL). Умеет отвечать на вопросы, генерировать и отлаживать код, а также взаимодействовать с GitHub: создавать pull request, закрывать issue, анализировать изменения в репозитории, запускать workflows.Запускается командой copilot
Cursor AI для ревью ручных тест-кейсов в TestOps
Всем привет! Я один из лидеров стека тестирования в компании «ТехВилл» (в простонародье — Head QA). Моя цель простая: снимать рутину с QA-инженеров с помощью AI-инструментов.
Anthropic пообещала, что в Claude никогда не будет рекламы
Anthropic выпустила пост-манифест: реклама в Claude не появится. Ни в виде "спонсорских ссылок", ни в виде скрытых рекомендаций от партнёров.Главный аргумент — разговоры с ИИ это не поисковая строка. Люди делятся личным, обсуждают проблемы со сном, думают вслух о сложном. В компании проанализировали диалоги и увидели, что значительная часть — темы, которые обсуждают с близкими или терапевтом. Впихивать туда рекламу было бы странно и неуместно.

