Тестирование IT-систем. - страница 4

Perfscale news #9. GPU, LLM, Docker images

Приветствую, любители нагрузки. Для истории прошлые выпуски:Новости Perfscale № 1Perfscale news #2: Fix Protocol, Magic metrics и MCPperfscale news #3 Websocket, Inference, NPMPerfscale news #4. GRPC, Fixed Triggers, Child ProcessPerfscale news #5. SQL, Thresholds, неработающие Linked AccountsPerfscale news #6. GraphQL, поддержка Import, и метрикиPerfscale news #7. Fix Import, SOAP, and more HTTP metrics

продолжить чтение

Я дал четырем ИИ-ревьюерам 60 багов, про которые точно известно, что они баги

Про ИИ и код пишут много, и почти все эти тексты одного жанра: человек попробовал, ему понравилось или не понравилось, вот пара примеров. Чисел нет. Я честно искал статью, где кто-то взял бы набор дефектов с заранее известным ответом по каждому, прогнал через агента и посчитал. Не нашел.Понятно почему. Такой набор взять неоткуда. Реальные баги из трекера давно починены и с большой вероятностью лежали в обучающей выборке. Синтетические баги пишет человек, а человек пишет такие баги, какие сам привык замечать, и меряет в итоге собственные слепые пятна.

продолжить чтение

На что способен бесплатный Devin: тест на реальном проекте

Привет, Хабр! Меня зовут Завур, я фронтенд-разработчик в Selectel

продолжить чтение

Когда все тесты зелёные, а баги едут в прод

Статья подготовлена в рамках курса «Автоматизатор тестирования на JavaScript». Привет, Хабр!Меня зовут Андрей Бирюков. Я — независимый эксперт в области ИТ и ИБ, преподаю в учебных центрах и пишу статьи и книги.Вы когда‑нибудь получали от ИИ тесты, которые «идеально проходят», а через неделю ловили баг в том самом месте, которое должно быть покрыто? Это не случайность — это симптом тавтологического тестирования.

продолжить чтение

Сравниваем LLM, 12 тестов для китайских рабочих лошадок: MiniMax M3, LongCat 2.0, MiMo-v2.5-Pro и DeepSeek V4 Pro

В первой статье цикла мы гоняли по нашим тестам Opus 4.8, GPT 5.5 и Gemini 3.1 Pro, во второй устроили дуэль тяжеловесов Claude Fable 5 и GPT 5.5 Pro, в третьей спустились в средний класс, а в четвёртой вывели на ринг китайские флагманы. В комментариях к прошлой части нас спросили о том, что происходит этажом ниже: флагманы флагманами, а работать людям приходится на моделях попроще. Справедливо. Сегодня спускаемся на пару ступеней ниже.

продолжить чтение

От разовых запросов к повторно используемым ИИ‑флоу в QA

Введение Прежде чем начать, скажу, что эта статья написана для QA‑инженеров, которые только начинают использовать AI в QA‑процессах. Это не глубокое погружение в продвинутое использование Agentic AI или во внутреннюю логику AI‑систем. Автономные AI‑агенты и системы оркестрации сейчас активно обсуждаются, но стоит помнить: sic parvis magna. Так что добро пожаловать.

продолжить чтение

Агент написал себе навык и соврал, что тот работает

Я делаю агента, который умеет дописывать себе навыки. Не в смысле «подключает плагины из маркетплейса», а буквально: упёрся в то, чего не умеет — сгенерировал код, собрал, установил, пользуется.Первый раз это сработало примерно так, как я и мечтал. Агент сказал «у меня нет такого навыка», спросил разрешения, минуту пыхтел компилятором и отчитался: готово, метод доступен.Метода не было.

продолжить чтение

AI Enablement at Scale, часть 1: почему мы начали не с агентов, а с оценки 13 команд

Самая опасная фраза в корпоративной AI-трансформации звучит примерно так:«Давайте сначала выдадим всем инструменты, а потом разберемся, как ими пользоваться».Инструменты действительно можно развернуть быстро. Подключить Claude Code, ChatGPT, GitHub Copilot, Cursor или Rovo технически проще, чем изменить привычки нескольких сотен инженеров, тестировщиков, аналитиков, продакт-менеджеров и дизайнеров.Меня зовут Евгений Семенюк. Я работаю как AI Dev/Test Coach, Solution Architect и Quality Architect. Моя роль в этой программе находилась на пересечении разработки, тестирования, архитектуры, coaching и engineering productivity.

продолжить чтение

658 тест‑кейсов за 24 часа: как мы встроили ИИ‑агентов в тестирование банковского ПО

Где команда получила ускорение почти в 9 раз, почему на другом сценарии выиграла всего 11 часов и зачем считать настройку агента частью тестирования 770 кейсов вручную210 ч ручной цикл 658 кейсов с агентами 24 ч цикл с ревью Что вы вычеркиваете первым, когда поставка уже близко?У многих тестировщиков есть сценарий, который воспроизводится стабильнее большинства автотестов: перед поставкой обязательно выясняется, что на полный регресс времени уже нет.

продолжить чтение

GigaChat 2 Max с памятью на связях обходит Claude Opus 5 без неё: замер семи моделей

Кратко: на классе задач «в работе всплыла проблема — каким изменением её уже чинили»:GigaChat 2 Max с памятью на связях отвечает верно в 57% случаев,YandexGPT Pro 5.1 — в 61%,Claude Opus 5 с обычным поиском — в 41%.Модели никто не трогал: разница целиком в том, доехал ли до модели нужный факт в контексте.

продолжить чтение

1...234567...2030...37