Evals для чайников. Как тестировать AI-агента, чтобы понимать, где именно он ломается
Большинство команд оценивают производительность AI-агентов через end-to-end метрики: success rate, количество токенов, tool usage, стоимость запроса, долю успешных задач. Это полезно для общего контроля ситуации, но почти бесполезно для реальной диагностики системы.
Нагрузочное тестирование: не просто скриптики и кнопка «Запуск»
ОглавлениеВведениеЧто такое нагрузка и почему она ломает всё подрядПримеры провалов системТипы нагрузочных тестовПодходы в нагрузке
«70% соответствия ТЗ — это уже хорошо»: три мифа заказной разработки
Привет, Хабр! Меня зовут Александр Сахаров, я директор по работе с партнерами компании "Диасофт".За двадцать с лишним лет в индустрии никто из нас не видел идеального ТЗ. Ни разу. При этом каждый новый проект начинается с уверенного «у нас всё прописано». Компании теряют сотни миллионов на выборе стека, который считают «деталью». А low-code продолжают высмеивать, не заметив, что инструмент за десять лет стал другим.
Контекст для LLM в тестировании: от калькулятора страховой премии до ТЗ на сотню страниц
Всем привет! Продолжаю цикл статей про применение ИИ в тестирование. Здесь можно прочитать первую статью "ИИ в тестировании: зачем мы пошли в пилот и почему начали с чата, а не с агентов”. Сегодня поговорим про тестирование требований, а именно про первый и самый важный этап — подготовку контекста. В своей статье под контекстом я буду подразумевать структурированную информацию о продукте:описания компонентов;бизнес-правила;сценарии использования;связи между сущностями.
Как я выиграла билет на Heisenbug и узнала про «биполярное тестирование»
ИИ и тут предложил свой вариант биполярки в тестировании
Cursor пишет вам unit‑тесты за минуту. 5 паттернов, на которых эти тесты пропустят любой баг
Cursor пишет тесты быстро. Открыл класс, нажал Ctrl+I, кинул промпт «напиши unit‑тесты» — через минуту в файле сорок строк с моками, ассертами и красивыми именами вроде shouldReturnUserWhenIdIsValid. Прогнал — зелёные. Закоммитил, замержил, побежал дальше. Покрытие в проекте растёт, скорость написания тестов раза в три‑четыре выше, чем руками.А потом замечаешь, что тесты есть, а толку от них всё меньше. Регрессия пролетает мимо них и падает в проде. Открываешь тот самый тест, который должен был это ловить, — формально зелёный, но если присмотреться, не проверяет вообще ничего.
Назирокодил утилиту на Kotlin и JavaScript для создания аккордов в любой тональности
Пробовали когда-нибудь сочинять свои аккорды на гитаре, укулеле или на клавишных? Не всякий аккорд подходить к любому другому, так? Например, ре-мажорный аккорд (D) не очень-то ладит с фа-минорным (Fm). То есть просто "слепить" любые аккорды друг с другом в одну последовательность не получится. Тем более, что хочется, чтобы их было больше 2-х. И повторять до бесконечности Am Dm Em не хочется, так?Для решения этой проблемки написал, используя ИИ, утилиту на JavaScript, доступную по URL:https://6a1998fa8733707618d3a7e0--gregarious-flan-52fbaf.netlify.app/
Почему ломается ваш AI-агент — и почему смена модели обычно его не чинит
Представьте внутреннего AI-агента, который помогает компании искать общие документы и управлять ими. Он работает. До тех пор, пока 12–15% запросов не начинают падать. Агент возвращает не тот документ, редактирует не тот файл, молча падает или уверенно ссылается на файл, которого не существует. Поиск по фото отказывает с той же частотой. Ошибки размазаны равномерно по пользователям, фичам и запросам.

