Тестирование IT-систем. - страница 8

Evals для чайников. Как тестировать AI-агента, чтобы понимать, где именно он ломается

Большинство команд оценивают производительность AI-агентов через end-to-end метрики: success rate, количество токенов, tool usage, стоимость запроса, долю успешных задач. Это полезно для общего контроля ситуации, но почти бесполезно для реальной диагностики системы.

продолжить чтение

Нагрузочное тестирование: не просто скриптики и кнопка «Запуск»

ОглавлениеВведениеЧто такое нагрузка и почему она ломает всё подрядПримеры провалов системТипы нагрузочных тестовПодходы в нагрузке

продолжить чтение

«70% соответствия ТЗ — это уже хорошо»: три мифа заказной разработки

Привет, Хабр! Меня зовут Александр Сахаров, я директор по работе с партнерами компании "Диасофт".За двадцать с лишним лет в индустрии никто из нас не видел идеального ТЗ. Ни разу. При этом каждый новый проект начинается с уверенного «у нас всё прописано». Компании теряют сотни миллионов на выборе стека, который считают «деталью». А low-code продолжают высмеивать, не заметив, что инструмент за десять лет стал другим.

продолжить чтение

Контекст для LLM в тестировании: от калькулятора страховой премии до ТЗ на сотню страниц

Всем привет! Продолжаю цикл статей про применение ИИ в тестирование. Здесь можно прочитать первую статью "ИИ в тестировании: зачем мы пошли в пилот и почему начали с чата, а не с агентов”. Сегодня поговорим про тестирование требований, а именно про первый и самый важный этап — подготовку контекста. В своей статье под контекстом я буду подразумевать структурированную информацию о продукте:описания компонентов;бизнес-правила;сценарии использования;связи между сущностями.

продолжить чтение

Как оценивать ИИ‑агентов в проде: нижняя планка, трассы и кодовые проверки

продолжить чтение

Как я выиграла билет на Heisenbug и узнала про «биполярное тестирование»

ИИ и тут предложил свой вариант биполярки в тестировании

продолжить чтение

Cursor пишет вам unit‑тесты за минуту. 5 паттернов, на которых эти тесты пропустят любой баг

Cursor пишет тесты быстро. Открыл класс, нажал Ctrl+I, кинул промпт «напиши unit‑тесты» — через минуту в файле сорок строк с моками, ассертами и красивыми именами вроде shouldReturnUserWhenIdIsValid. Прогнал — зелёные. Закоммитил, замержил, побежал дальше. Покрытие в проекте растёт, скорость написания тестов раза в три‑четыре выше, чем руками.А потом замечаешь, что тесты есть, а толку от них всё меньше. Регрессия пролетает мимо них и падает в проде. Открываешь тот самый тест, который должен был это ловить, — формально зелёный, но если присмотреться, не проверяет вообще ничего.

продолжить чтение

Назирокодил утилиту на Kotlin и JavaScript для создания аккордов в любой тональности

Пробовали когда-нибудь сочинять свои аккорды на гитаре, укулеле или на клавишных? Не всякий аккорд подходить к любому другому, так? Например, ре-мажорный аккорд (D) не очень-то ладит с фа-минорным (Fm). То есть просто "слепить" любые аккорды друг с другом в одну последовательность не получится. Тем более, что хочется, чтобы их было больше 2-х. И повторять до бесконечности Am Dm Em не хочется, так?Для решения этой проблемки написал, используя ИИ, утилиту на JavaScript, доступную по URL:https://6a1998fa8733707618d3a7e0--gregarious-flan-52fbaf.netlify.app/

продолжить чтение

Как мы тестируем в Профи.ру: почему у нас нет пирамиды, зато есть ромб и матрица

продолжить чтение

Почему ломается ваш AI-агент — и почему смена модели обычно его не чинит

Представьте внутреннего AI-агента, который помогает компании искать общие документы и управлять ими. Он работает. До тех пор, пока 12–15% запросов не начинают падать. Агент возвращает не тот документ, редактирует не тот файл, молча падает или уверенно ссылается на файл, которого не существует. Поиск по фото отказывает с той же частотой. Ошибки размазаны равномерно по пользователям, фичам и запросам.

продолжить чтение

1...67891011...2030...32