Отдал сайт ИИ‑агентам: из 111 находок аудита 25 пошли в мусор, 4 оказались выдумкой
Мой сайт ведут ИИ‑агенты. Они пишут код, правят тексты, проводят ревью, собирают и выкатывают. 207 коммитов.Я не буду рассказывать, как это ускорило работу — ускорило, это скучно и все уже слышали. Расскажу про то, о чём говорят реже: узкое место переехало с написания кода на его проверку. Агент производит правки быстрее, чем человек успевает их прочитать, и если не встроить проверку в конвейер, разница между «работает» и «выглядит как работает» перестаёт быть заметной.Две цифры для затравки:
Промпт — не контракт: замерил, как часто модель нарушает жёсткие правила, и вынес их в код
У меня в проде работает ИИ-консультант на сайте. У него есть два правила, которые нарушать нельзя вообще: не называть цены и не называть клиентов, которые под NDA. Оба правила были написаны в системном промпте капслоком, с объяснением почему.Я замерил, как они соблюдаются. Получилось так:правило «не называй цен» модель срывает примерно раз на восемь прогонов;имя клиента под NDA проскакивало раз на пять.
Визуализация изменений при помощи LLM, стопки листов и графа между ними
Первая практическая статья. На примере анализа двух редакций Правил продажи.Долго выбирал что взять в первый практический разбор/демонстрацию возможностей своего инструмента. Решил остановиться на разборе изменений Правил продажи.С 1 сентября действуют новые Правила продажи товаров - ПП № 657. Прежние, ПП № 2463, утратили силу. Это не поправки, а новый документ: в начало добавили три пункта, и дальше вся нумерация сдвинулась на три.Наверняка его уже всесторонне разобрали, но я решил показать возможный новый способ.Почему ответ модели нельзя проверить чтением
Как сравнить две версии регламента за 15 минут: LLM строит карту изменений, а вы проверяете её глазами
Первая практическая статья. На примере анализа двух редакций Правил продажи.Долго выбирал что взять в первый практический разбор/демонстрацию возможностей своего инструмента. Решил остановиться на разборе изменений Правил продажи.С 1 сентября действуют новые Правила продажи товаров - ПП № 657. Прежние, ПП № 2463, утратили силу. Это не поправки, а новый документ: в начало добавили три пункта, и дальше вся нумерация сдвинулась на три.Наверняка его уже всесторонне разобрали, но я решил показать возможный новый способ.Почему ответ модели нельзя проверить чтением
Агент написал себе навык и соврал, что тот работает
Я делаю агента, который умеет дописывать себе навыки. Не в смысле «подключает плагины из маркетплейса», а буквально: упёрся в то, чего не умеет — сгенерировал код, собрал, установил, пользуется.Первый раз это сработало примерно так, как я и мечтал. Агент сказал «у меня нет такого навыка», спросил разрешения, минуту пыхтел компилятором и отчитался: готово, метод доступен.Метода не было.
Train и eval в ARC-AGI-2 — это разные распределения
Train и eval в ARC-AGI-2 лежат в разных распределенияхЕсли вы замеряете прогресс своего солвера на случайной подвыборке из train, вы замеряете его не на том наборе. Медианная задача train занимает 100 клеток на выходе, у медианной задачи eval их 225. Два и более тестовых входа требуют 6.9 процента задач train и 40.8 процента задач eval. Расхождение держится по всем шести структурным осям, которые я померил, и переживает поправку на множественные сравнения.
Правильный код мы отклоняем — и так задумано
Работаю в компании «Сибинтек-Софт», занимаюсь поддержкой корпоративных информационных систем. Имею сертификат DevOps-инженера, в рамках задач отдела внедряю ИИ в рабочие процессы.Как-то мой валидатор забраковал ответ, сославшись на статью, которой не существует.
Как мы в отделе документации создали LLM агента для автоматизированного перевода с английского на другие языки
Автор: Александр Казанцев, руководитель отдела документации и контентаПредставьте, что вы поддерживаете крупный проект с документацией на нескольких языках. Каждый раз, когда в английской версии появляется новое руководство или исправляется ошибка, нужно вручную обновлять все переводы в других языковых версиях. Это дорого, медленно и чревато рассинхронизацией. Даже два дополнительных языка начинают создавать проблему, а если их больше?LLM-модели на вашем сервереЛучшие LLM-модели на профессиональных серверах с GPU-картами
Технологическая сингулярность. От 2 месяцев до 2 дней — Claude и n8n сократили разработку в промышленной IoT
Писать надо только тогда, когда не можешь не писать (С) Л.Н. ТолстойНа самом деле я работал над статьей о Claude Code, но тут пальцы сами открыли ноут на начали набивать буквы. Извините!ПриквелНачну издалека, с темы, максимально далекой от предмета статьи. У меня есть друг, который постоянно норовит втянуть меня в свои хобби. За десятилетие я попробовал стать фанатом ножей, огнестрельного и пневматического оружия, охоты, выживания в БП, полетах на самолетах. Ни одно хобби не зашло.
Как стартап с суперсилой для родителей не смог и почему даже «святые» идеи нужно проверять
На связи Анатолий Шостак. Я стартап-валидатор. Человек, который хладнокровно проверяет бизнес-идеи на прочность. Но этот кейс особенный. Здесь я чуть снова не попал в эмоциональную ловушку, в которую попадают 90% фаундеров - влюбился в свой продукт.Это история о том, как желание сделать мир лучше столкнулось с суровой реальностью рынка, и почему умение вовремя остановиться - это тоже победа.

