Строим продвинутый каркас для ИИ-агента
В основе базового agentic harness — простой цикл: LLM получает задачу, выбирает и вызывает инструмент, результат возвращается в контекст, после чего модель решает, какое действие выполнить следующим. Цикл продолжается, пока модель не решит, что задача выполнена.
Тупая модель с жёстким циклом проверки бьёт умную модель без него
Недавно читал тут статью про «Cost per Task» и про то, что самая дешёвая модель в линейке внезапно обгоняет самую умную по цене решённой задачи. С выводом согласен полностью, но хочу добавить то, чего в той статье не было: дело не только в модели. Дело в том, что происходит после того, как модель написала код.Последние восемь месяцев я строю агентную обвязку, в которой модель не просто пишет файлы, а обязана доказать, что написанное работает. Выяснилось следующее: если прикрутить к слабой модели честный цикл верификации, она уверенно обходит сильную модель, работающую в режиме «написал и отчитался».
120 выдуманных ссылок против 8: что агентный поиск делает с галлюцинациями LLM на строительных нормах
Один контрольный эксперимент — и один красивый ложный вывод, который мы чуть не опубликовалиTL;DRШесть систем × 100 вопросов по строительным нормам, отобранных из ~6 000 реальных запросов пользователей; 3000 оценок от пяти LLM-судей — вслепую, по единой рубрике, с проверкой ссылок по корпусу нормативов.Контрольный эксперимент: один и тот же генератор (DeepSeek V4-Pro) с агентным поисковым контуром и без. С контуром — достоверность ссылок 4,25 из 5 и 8 пометок «выдуманная ссылка»; соло — 2,60 и 120 пометок.Лучший генералист (GPT-5.5) обходит систему только по полноте ответа. Обе «доказательные» оси проигрывает.
Классификация и анализ методов верификации нейросетей
Классификация и анализ методов верификации нейросетейПри эксплуатации нейросетей вида r=f(a,w) в ответственных системах необходимо соблюдение двух фундаментальных требований: повторяемость и проверяемость результата. Информация о требовании повторяемости на основе детерминированного ответа изложена в ранее опубликованной статье. Но с выполнением второго требования всё несколько сложнее.
Я спросил у нейронки, как верифицировать её ответы, и она сказала: «Хочешь честно? Это про доверие»
Не доверяйте нейросетям... проверяйте их!Классификация и анализ методов верификации нейросетейПри эксплуатации нейросетей вида r=f(a,w) в ответственных системах необходимо соблюдение двух фундаментальных требований: повторяемость и проверяемость результата. Информация о требовании повторяемости на основе детерминированного ответа изложена в ранее опубликованной статье. Но с выполнением второго требования всё несколько сложнее.
Как двухбуквенная технология проверяет трёхбуквенную организацию
Как ИИ занимает роль, которую нельзя доверить ни одному живому человеку«Кто устережёт самих сторожей?» — Ювенал, около 100 года н. э.Вопрос, на который две тысячи лет не было ответаЕсть вопросы, которые человечество тихо отложило в папку «так уж устроен мир». Не потому что они неважные. А потому что слишком долго упирались в одну и ту же стену.
ChatGPT теперь требует селфи с паспортом: как OpenAI и Anthropic внедряют KYC и убивают анонимность в ИИ
Эпоха, когда лучшие в мире ИИ-инструменты были «общественным благом для свободного пользования», стремительно заканчивается. Им на смену приходит жесткое регулирование, сбор персональных данных и обязательная верификация личности.
Ни одна ошибка не нова: почему провал ИИ в First Proof был предсказуем заранее
В начале июня 2026 вышли результаты First Proof Second Batch — первого бенчмарка, который одновременно: (1) состоит из исследовательских задач, (2) заведомо не встречавшихся в обучающих данных, и (3) проверяется живыми математиками вслепую по правилам журналов.Заголовки привычно написали: «ИИ провалил тест по математике». Но самое интересное в отчёте — не счёт, а то, что ни один тип ошибок не нов. Каждую можно было предсказать заранее из классических работ о математическом мышлении и надёжности проверок. Если сложить эти источники, результаты First Proof перестают удивлять.
От языковых моделей к вычислимому мышлению: как SymFSM меняет архитектуру AI-систем
Когда LLM перестаёт быть «генератором текста»
Spotify внедрила новые меры верификации подкастов для борьбы с недобросовестным использованием ИИ
Стриминговый сервис Spotify развернул иконки верификации для подкастов, ужесточив борьбу с недобросовестным использованием искусственного интеллекта.

