Тестирование СУБД с использованием tpc-ds и методы сравнительного анализа
Когда мы начали искать альтернативы Greenplum, у руководителя уже был явный фаворит StarRocks. Но мне было непонятно, как доказать, что он действительно лучше других кандидатов, а не просто производит хорошее первое впечатление.Полгода я и несколько коллег собирали информацию о разных аналитических СУБД. StarRocks был кандидатом с самого начала, остальные находили по ходу работы. Поднимали системы, запускали бенчмарки, читали документацию, смотрели на настройки и пытались понять, с чем потом придётся жить.
Что будет если загрузить в «симулятор общества» чистый lorem ipsum? Большое исследование MiroFish, часть 1
Первая статья из трёх об исследовании MiroFish, открытого стека мультиагентной симуляции общества. В этой части: стек, методология и находка Silent Failure. Бэкенд зафиксировал отказ за десятки миллисекунд, статусный API отдал задачу как выполненную, а индикатор прогресса не отвечал более часа.
ИИ-Автопилот: поток принятых задач вырос в тринадцать раз
В первой части я рассказал, как из ручного копипаста тикетов в консоль агента вырос ИИ-Автопилот — полный конвейер от YouTrack до проверки в живом 2D/3D GUI. По ощущениям всё летало: бэклог таял, в SVN постоянно появлялись коммиты, пользователи едва успевали проверять готовые задачи.Вот только «по ощущениям» — это ровно та валюта, в которой посчитано большинство статей про ИИ-агентов, и доверия к ней у меня немного. Любая активная система выглядит продуктивной: что-то постоянно собирается, коммитится, переписывается. Отличить эффективность от активности можно только замером.
ИИ-агент в тестировании: почему сильный результат рождается не из промпта, а из инженерного контура
Введение: агент — не оракулПредставим обычную задачу «к тестированию». В ней есть краткое описание, несколько комментариев, ссылка на документ, родительская задача, пара коммитов и стенд, который иногда доступен. Часть требований уже изменилась. Часть — живёт в коде соседней команды. Часть — существует только как договорённость между людьми.Можно потребовать от постановщика идеальный документ. Можно не начинать работу, пока не появятся критерии в правильной форме. В реальном проекте это часто означает не повышение качества, а перенос ответственности и задержку обратной связи.
За полчаса и 10 рублей — полноценный сайт для загрузки и редактирования скриншотов на вайбкоде. Пошаговая инструкция
Делюсь личным опытом создания проекта с нуля на вайбкоде.Красивый сайт со сверхбыстрой загрузкой и функционалом, которого не найти на ресурсах без авторизации. И всё это — с нуля за полчаса описания банальных пожеланий на русском языке и менее 10 рублей затрат на одном из самых дешёвых ИИ-сервисов. Это реально новый мир.Описываю в деталях по шагам. В том числе — как ИИ банально «тупит» и не может решить указанную задачу, и как это преодолеть. Промпты — в статье.Что сделал
ИИ-Автопилот: замкнутый цикл разработки на C++ — от тикета до проверки в живом GUI
Привет, Хабр. Расскажу, как я собрал ИИ-Автопилот — замкнутый цикл разработки, где задача входит тикетом в YouTrack, а выходит GUI-проверенным исправлением в продукте. Агент разбирается в задаче, правит C+±код, собирает, идёт в живой интерфейс нашего геофизического приложения, проверяет там результат — и закрывает тикет ответом человеку в YouTrack. Дальше расскажу, как оно выросло и где людям всё ещё есть чем заняться.
416 тестов и кнопка «снести все»: где ломаются агентные проекты
Сурок: ральф-луп под --dangerously-skip-permissions У меня на ноутбуке с февраля 2026 года крутится автономный агент. Зовут Сурок (Groundhog, от известного мема). Claude Code по подписке, флаг --dangerously-skip-permissions, поверх — ральф-луп
Kimi K3 на PAC1 и ECOM1: результаты 204 задач и разбор отказов
Kimi K3 на PAC1 и ECOM1: результаты 204 задач и разбор отказов27 июля Moonshot AI опубликовала открытые веса Kimi K3 и технический отчёт с результатами на coding‑ и агентных бенчмарках. По этим таблицам K3 выглядит конкурентоспособной на задачах с кодом, терминалом и инструментами.Но итоговый балл не показывает, какие операции система действительно завершает, где оставляет неверное состояние и на каком шаге нарушает контракт. Мы решили проверить это на задачах с полностью открытыми трассами.
Как QA я все равно пишу документацию, но с ИИ трачу на нее часы, а не дни
Привет! Меня зовут Никита, с недавнего времени работаю в Cloud.ru на позиции QA-инженера, отвечаю за качество продукта для совместной разработки под названием Repo. В этой сфере я уже четыре года и успел поработать на проектах в GameDev и веб-разработке.
Хуки Claude Code: запрещаем агенту коммитить без прогона тестов
Знакомая сцена: длинная сессия, агент поправил тест и потянулся коммитить, не прогнав тесты. Запрещающее правило никуда не делось — оно всё ещё лежало в CLAUDE.md. Просто перестало весить.

