искусственный интеллект. - страница 84

120 выдуманных ссылок против 8: что агентный поиск делает с галлюцинациями LLM на строительных нормах

Один контрольный эксперимент — и один красивый ложный вывод, который мы чуть не опубликовалиTL;DRШесть систем × 100 вопросов по строительным нормам, отобранных из ~6 000 реальных запросов пользователей; 3000 оценок от пяти LLM-судей — вслепую, по единой рубрике, с проверкой ссылок по корпусу нормативов.Контрольный эксперимент: один и тот же генератор (DeepSeek V4-Pro) с агентным поисковым контуром и без. С контуром — достоверность ссылок 4,25 из 5 и 8 пометок «выдуманная ссылка»; соло — 2,60 и 120 пометок.Лучший генералист (GPT-5.5) обходит систему только по полноте ответа. Обе «доказательные» оси проигрывает.

продолжить чтение

Giga4DQM: мультиагентный подход к расследованию качества данных на базе GigaChat

продолжить чтение

Kadr: видеоредактор, в котором Claude Code монтирует рядом с тобой

Я задался вопросом: как должен выглядеть видеоредактор, если проектировать его в эпоху ИИ-агентов — не «редактор плюс кнопка с нейросетью», а инструмент, где агент работает на том же таймлайне, теми же операциями, что и человек? Ответа не нашлось, и я начал писать свой.Так появился Kadr — открытый (GPL-3.0) многодорожечный видеоредактор на Electron + React + TypeScript: GPU-композитинг на WebGL2, WYSIWYG-экспорт, локальное распознавание речи, программируемая моушн-графика на React — и настоящая интерактивная сессия Claude Code в панели рядом с превью, подключённая к живому проекту через MCP.

продолжить чтение

IKEA-подход к AI и вайбкодингу: как не остаться без шкафа в гонке за внедрениями

ДисклеймерЯ понимаю, что аудитория Хабра по большей части технически подкованная, и если вам было бы интересно почитать о реальных провалах вайбкодинга с техническими деталями, то статья не про это. Однако, если у вашего руководителя подгорает от желания сделать дизрапт с помощью автоматизации с ИИ-ботом “вчера и дёшево” — киньте ему эту ссылку. В ней достаточно мало “как сделать технически”, но вполне себе достаточно “зачем вообще делать?”.Ну и причем здесь IKEA?

продолжить чтение

У ИИ есть душа? Даём LLM характер и эмоции

Если вы когда‑нибудь общались с популярными чат‑ботами или заглядывали на Character.ai, легко поддаться иллюзии, будто на той стороне экрана сидит живой человек. ИИ шутит, сопереживает, злится и подыгрывает. Ведёт себя почти как человек. Но может ли за всем этим скрываться настоящее сознание и душа?Ответим вам прямо — за экраном только пустота и холодные математические расчеты.Любая современная языковая модель представляет собой сложный калькулятор статистики, который предсказывает следующее, наиболее вероятное и приятное вам слово. Но не более того.

продолжить чтение

89% моих трат на AI‑агентов — это кэш, а не генерация. Написал CLI, чтобы увидеть

Я много работаю с кодинг‑агентами в Claude Code. В какой‑то момент поймал себя на том, что не представляю, на что уходят токены. Счёт в конце месяца есть, а из чего он складывается, непонятно. Написал небольшую утилиту, которая читает то, что Claude Code и так пишет на диск, и раскладывает расходы по статьям. То, что она показала, мне не понравилось.Вывод ledgent report ‑redact

продолжить чтение

Samsung удалит медицинские данные пользователей, если они не разрешат использовать эту информацию для обучения ИИ

Samsung начала уведомлять пользователей Samsung Health о том, что им необходимо дать согласие на использование их личных медицинских данных для обучения новых моделей искусственного интеллекта. В противном случае владельцы рискуют потерять эти данные навсегда. 

продолжить чтение

Как OpenRouter Fusion обошёл Claude Fable 5

С начала этого года я веду бенчмарк ИИ моделей для менеджеров, и после последнего обновления – есть о чем рассказать (прошла версия рейтинга тут). Первое место занял OpenRouter Fusion – оркестратор, который вызывает сразу несколько моделей, собирает их ответы и синтезирует финальный результат. Он обошёл всех: и Claude, и GPT, и Gemini поодиночке.

продолжить чтение

«ГигаЧат» научился распознавать эмоции, различать спикеров и находить нужные моменты в длинных аудио

продолжить чтение

Опять назвали медведем. Прогнал 21 телеграм-канал про нейросети через 6 ИИ и посчитал, кого они реально видят

продолжить чтение