ai-агенты.

Оценка AI‑агентов: 7 ошибок, из‑за которых тесты врут

Всем привет, меня зовут Сергей Прощаев, и в этой статье расскажу про семь ошибок в оценке AI‑агентов — тех самых, из‑за которых прогон тестов светится зелёным, а о деградации команда узнаёт от поддержки.У команды есть

продолжить чтение

После Copilot: как «Диасофт» строит AI-Native SDLC вместо ИИ-ассистентов

Привет, Хабр!Я Дмитрий Старов, директор департамента «Инструменты и технологии разработки» компании «Диасофт». Еще относительно недавно вопрос звучал так: сможет ли искусственный интеллект писать код?Сегодня этот вопрос уже не кажется самым интересным. Современные модели умеют генерировать код, находить ошибки, писать тесты и объяснять, как работает тот или иной фрагмент программы. Каждые несколько месяцев появляются новые AI-ассистенты, и каждый обещает работать быстрее, точнее или самостоятельнее, чем предыдущий.

продолжить чтение

Почему AI-агент не цифровой сотрудник

Привет, Хабр! На связи Алексей Лапунов из департамента информационной безопасности и системного администрирования ТЕХНОНИКОЛЬ Диджитал.В прошлый раз мы разбирали, как анализировать сложные проблемы: почему важно не хвататься за первое попавшееся решение, а декомпозировать проблему и находить точки изменений.

продолжить чтение

ИИ становится рабочим инструментом 1С: что покажут на TECH EVENT

ИИ в 1С уже не ограничивается генерацией кода и экспериментами с чат-ботами. Его подключают к тестированию, мониторингу, интеграциям, корпоративным данным и внутренним бизнес-процессам. Вокруг него появляются новые подходы к разработке, документации и работе команд.На INFOSTART TECH EVENT 2026 этой теме посвящены

продолжить чтение

BlueSec: открытые соревнования ИИ-агентов по расследованию инцидентов

Привет, Хабр! Меня зовут Андрей Кузнецов, я занимаюсь ML в кибербезе. Наше сообщество FalsePositive разбирает научные статьи, последние разработки в ML. А теперь мы запускаем BlueSec, открытые соревнования, в которых ИИ-агенты расследуют ИБ-инциденты. Агент получает первую улику, сам собирает картину атаки и выносит вердикт. Платформа оценивает, насколько точно и с минимальным количеством тулколлов он это сделал. Если вы работаете с LLM и агентами, то это возможность проверить свои и агентские скиллы в задачах на стыке ML и кибербеза, области, которая, думаю, переживает даже больше изменений, чем разработка. 

продолжить чтение

AGI обыкновенный: как я завёл дома второй мозг размером с ладонь

Всем привет! Я Слава, AI продакт менеджер в крупном банке. Больше 4 лет строю AI/ML продукты с нуля, набивал много шишек и думал, что мало что сможет удивить после стольких лет использования и построения продуктов с нуля. Но кое что этим летом заставило пересмотреть мой подход к тому, как я отношусь к нейронкам в своем использованииВ середине лета Anthropic отключил мой аккаунт, который я исправно оплачивал больше 2 лет с своей личной карты. Историю чатов разрешили забрать, формально всё честно, но факту я получил коробку с логами вместо среды, в которой жил кусок моей головыТам были:

продолжить чтение

Jev: модель, которая ничего не пишет

Если вы много слышали про Jev, но так и не разобрались до конца в чем состоит его идея, то мы с командой решили собрать все воедино и рассказать что это за загадочно дешевая модель, которая выдает бесплатно токены ответа. Начнем Мы привыкли, что нейросеть должна что‑то генерировать. ChatGPT пишет ответ, Claude Code — пишет код, Gemini может редактировать таблицы и презентации. Даже если от модели требуется всего лишь определить, спам перед ней или нет, внутри все равно запускается большая языковая модель, которая последовательно генерирует токены, а взаимодействие с ней происходит в формате чата.

продолжить чтение

Flowise закрыли, я его форкнул — и выяснил, что форкать было нельзя

Flowise — визуальный конструктор для LLM-приложений: перетаскиваете на холст модель, векторное хранилище, инструменты и память, соединяете их линиями и получаете чат-бота, RAG-поиск по документам или агента. У проекта 55 тысяч звёзд на GitHub, 25 тысяч форков и почти 7 миллионов скачиваний Docker-образа. Его разворачивают у себя компании, которым нельзя отправлять данные в облачные конструкторы.

продолжить чтение

LLM предлагает, код исполняет: как разделить reasoning и side effects в production‑пайплайне

Привет! Я Андрей Непряхин — директор департамента разработки в AGIMA.

продолжить чтение

AI пишет код быстрее, но ревью становится тяжелее: откуда берётся когнитивный долг

TL;DRВремя на погружение в контекст теперь приходится в основном на этап ревью.Если принимать код только потому, что он работает, можно накопить долг, которого команда даже не замечает.Стоит либо снижать объём ручного ревью, либо автоматизировать повторяющиеся проверки.В разговоре с одним из клиентов об AI-разработке я услышал мнение, что ревью кода, сгенерированного агентами, создаёт огромную когнитивную нагрузку — приходится одновременно держать в голове множество деталей, чтобы понять работу и оценить её качество.

продолжить чтение

123456...1020...47