120 выдуманных ссылок против 8: что агентный поиск делает с галлюцинациями LLM на строительных нормах
Один контрольный эксперимент — и один красивый ложный вывод, который мы чуть не опубликовалиTL;DRШесть систем × 100 вопросов по строительным нормам, отобранных из ~6 000 реальных запросов пользователей; 3000 оценок от пяти LLM-судей — вслепую, по единой рубрике, с проверкой ссылок по корпусу нормативов.Контрольный эксперимент: один и тот же генератор (DeepSeek V4-Pro) с агентным поисковым контуром и без. С контуром — достоверность ссылок 4,25 из 5 и 8 пометок «выдуманная ссылка»; соло — 2,60 и 120 пометок.Лучший генералист (GPT-5.5) обходит систему только по полноте ответа. Обе «доказательные» оси проигрывает.
Kadr: видеоредактор, в котором Claude Code монтирует рядом с тобой
Я задался вопросом: как должен выглядеть видеоредактор, если проектировать его в эпоху ИИ-агентов — не «редактор плюс кнопка с нейросетью», а инструмент, где агент работает на том же таймлайне, теми же операциями, что и человек? Ответа не нашлось, и я начал писать свой.Так появился Kadr — открытый (GPL-3.0) многодорожечный видеоредактор на Electron + React + TypeScript: GPU-композитинг на WebGL2, WYSIWYG-экспорт, локальное распознавание речи, программируемая моушн-графика на React — и настоящая интерактивная сессия Claude Code в панели рядом с превью, подключённая к живому проекту через MCP.
IKEA-подход к AI и вайбкодингу: как не остаться без шкафа в гонке за внедрениями
ДисклеймерЯ понимаю, что аудитория Хабра по большей части технически подкованная, и если вам было бы интересно почитать о реальных провалах вайбкодинга с техническими деталями, то статья не про это. Однако, если у вашего руководителя подгорает от желания сделать дизрапт с помощью автоматизации с ИИ-ботом “вчера и дёшево” — киньте ему эту ссылку. В ней достаточно мало “как сделать технически”, но вполне себе достаточно “зачем вообще делать?”.Ну и причем здесь IKEA?
89% моих трат на AI‑агентов — это кэш, а не генерация. Написал CLI, чтобы увидеть
Я много работаю с кодинг‑агентами в Claude Code. В какой‑то момент поймал себя на том, что не представляю, на что уходят токены. Счёт в конце месяца есть, а из чего он складывается, непонятно. Написал небольшую утилиту, которая читает то, что Claude Code и так пишет на диск, и раскладывает расходы по статьям. То, что она показала, мне не понравилось.Вывод ledgent report ‑redact
Samsung удалит медицинские данные пользователей, если они не разрешат использовать эту информацию для обучения ИИ
Samsung начала уведомлять пользователей Samsung Health о том, что им необходимо дать согласие на использование их личных медицинских данных для обучения новых моделей искусственного интеллекта. В противном случае владельцы рискуют потерять эти данные навсегда.
Как OpenRouter Fusion обошёл Claude Fable 5
С начала этого года я веду бенчмарк ИИ моделей для менеджеров, и после последнего обновления – есть о чем рассказать (прошла версия рейтинга тут). Первое место занял OpenRouter Fusion – оркестратор, который вызывает сразу несколько моделей, собирает их ответы и синтезирует финальный результат. Он обошёл всех: и Claude, и GPT, и Gemini поодиночке.

