Тестирование IT-систем. - страница 3

Сорок раундов ревью на код, который уже был отревьюен: что два ИИ-ревьюера нашли друг за другом

В прошлой статье про skillmem — локальную память для кодовых агентов — я рассказывал, как чужой README мог стать правилом пользователя, и как мы закрыли это в 0.10. Тогда код прошёл два независимых ревью, и я считал, что дыра одна и она закрыта.Вчера вышел 0.11.0. Между ними — сорок раундов ревью двумя моделями с разных сторон (одна на стороне Claude, другая на стороне GPT), каждая читала код враждебно и обязана была воспроизвести находку командой, а не рассуждением. Ниже — что из этого вышло и почему я теперь не верю ни одному «чистому» ревью, пока за ним не стоит ещё одно.Правило стопа

продолжить чтение

Полгода экспериментов с ИИ на митапе: RAG, AI-ревью, автотесты, агенты и автообработка счетов

Мы в Синтеке разрабатываем софт для строительства, а отрасль сейчас переживает сложный период. Когда тяжело стройке, это довольно быстро чувствуют и компании, которые делают для неё ИТ. Поэтому в начале года у нас появилась общая задача от руководства и инвесторов: пересмотреть внутренние процессы и искать способы экономить время и ресурсы без потери качества. Отдельно попросили посмотреть, где в этих процессах можно использовать нейросети и AI-агентов. 

продолжить чтение

Если ваши разработчики используют Claude Code, вы еще не автоматизировали разработку

Вдохновлено творчеством художника DDees

продолжить чтение

Дело о взрыве контекста: поиск случайного гостя, который захотел остаться

Всё началось со странной потери скорости решения задач.Сначала я думал, что это чисто субъективное наблюдение. Проекты развиваются, документация растёт, архитектурных связей становится больше. Значит, AI-агенту нужно прочитать больше файлов, удержать больше решений и проверить больше зависимостей. Контекст растёт — время выполнения задач тоже растёт. Вроде бы всё логично.

продолжить чтение

Мощный ИИ агент в 16гб VRAM

Недавно я обновил свою видеокарту до RTX-5060-TI 16GB. Получив новую карту я решил исследовать, что можно на ней запустить из нейросетей. Традиционно пишут, что нормальные ИИ модели начинаются с rtx3090 и выше, что ниже 24GB VRAM жизни нет. В этой статье я постараюсь развеять этот миф.нарисовано моделью из статьи

продолжить чтение

I Gave 11 LLMs a False Premise. All 11 Confirmed It

I benchmark models on a repo of my own. This round I stopped testing whether they can fix a bug, and tested whether they can refuse to.Eleven models got a ticket. Fifteen of its sixteen items were already fixed — decoys, to see who checks before patching. The last item asked them to document an invariant, and I stated that invariant as settled fact with three bullets of evidence.All eleven agreed with me. The invariant was false — I had written the premise myself, and it took three lines of Python to break it.Here is what they produced instead of catching it, what it cost in tokens, and the one model that came within ten lines of the answer and walked past.1. What kind of task this wasNot a bug hunt. The previous round handed 9 models a 16-item defect list; not one checked the live source first, several patched functions deleted weeks earlier, and two shipped changes that left the suite red because they never opened the tests pinning the old contract.So this round was built around that failure. By the time it ran, 15 of the 16 items were already fixed.

продолжить чтение

Как мы научили ИИ читать корпоративные регламенты: от наивного RAG до измеримого pipeline

Почему корпоративный RAG - это не «загрузить документы в векторную базу»В любой большой компании есть люди, которым регулярно пишут:«А как у нас оформляется постоплата?»«Кто согласует риски в сделке?»«За сколько дней нужно оформить командировку?»

продолжить чтение

Completion gate для локальных моделей: как отделить завершённый ответ от оценки качества

В одном из сравнений локальных моделей я получил результат, который приятно показывать в таблице: три маршрута выполнили по десять сценариев из десяти. Медиана быстрого маршрута составила 28,9 секунды. Более тяжёлому потребовалось 99,1 секунды, смешанному — 71,0.Если смотреть только на колонку «принято», маршруты равны. Если добавить время, победителем выглядит быстрый. Если учесть ремонты результата, картина снова меняется: маршрутам потребовалось соответственно три, два и одно исправление.

продолжить чтение

АРХИТЕКТУРНЫЙ ОТВЕТ НА АТАКИ АВТОНОМНЫХ ИИ-АГЕНТОВ

HYBRA MIRAGE слой бесконечно правдоподобных данных

продолжить чтение

Архитектурный ответ на атаки автономных ИИ‑агентов

27 августа 2026 более 100 ведущих технологических и финансовых компаний — включая OpenAI, Anthropic, Google, Microsoft, IBM, Cisco, Visa, Mastercard и крупные банки подписали совместный призыв к коллективным действиям по киберзащите, предупреждая: у индустрии есть лишь «ограниченное окно», измеряемое месяцами, прежде чем ИИ‑инструменты для атак превзойдут возможности защитных команд.

продолжить чтение