Frontiers in Artificial Intelligence, статья от 7 сентября 2026 года.
Оригинальная публикация распространяется по лицензии CC BY 4.0.
1. От способных моделей — к надёжным системам
Большие языковые модели (LLM) уже показали, насколько сильно они могут изменить автономные системы и процессы принятия критически важных решений. Однако отдельные модели по-прежнему ограничены в устойчивости, надёжности и возможности гарантировать безопасность — особенно если речь идёт о системах, где цена ошибки высока.
Эта подборка исследований исходит из предположения, что подобные ограничения эффективнее устранять за счёт структурированного объединения нескольких специализированных моделей, а не простого масштабирования одной LLM (Guo et al., 2024).
Авторы Research Topic предложили исследователям рассмотреть интеграцию нескольких LLM для восприятия окружающей среды, навигации и принятия решений в роботах, беспилотниках и автомобилях; взаимодействие человека и робота; поддержку принятия решений в ответственных сценариях; проверку результатов, оценку неопределённости и обеспечение безопасности; а также адаптацию систем в реальном времени.
В подборку вошли семь работ. Они охватывают автоматическое создание агентов, оркестрацию, восприятие, преобразование запросов, автоматизированное машинное обучение, обнаружение сетевых атак и механизмы управления действиями ИИ.
В таких условиях меняется и сам вопрос о качестве системы. Уже недостаточно оценивать модель только по тому, насколько связно она отвечает или насколько точно решает отдельную задачу. Нужно учитывать привязку ответа к реальным данным и контексту, воспроизводимость, задержку, калибровку уверенности, локализацию отказов, человеческий контроль и возможность последующего аудита.
Работы из разных областей сходятся в одном выводе: надёжная автономность — прежде всего задача системной инженерии.
Надёжность возникает не потому, что мы начинаем больше доверять одной модели, а потому, что заранее определяем, как модели объединяются, какими ограничениями связаны, как проверяются их результаты и каким образом вывод модели может превратиться в действие.
2. Оркестрация и адаптивный состав агентов
Perera et al. ставят под сомнение распространённое предположение, что состав многоагентной системы должен быть заранее фиксирован.
Предложенные ими механизмы Initial Automatic Agent Generation и Dynamic Real-Time Agent Generation создают специализированных агентов на основе постоянно меняющегося контекста разговора.
В медицинском сценарии, на котором проверялась система, динамическое создание агентов обеспечило лучшее покрытие темы, более разнообразную лексику и более релевантные ответы по сравнению со статической конфигурацией AutoGen. Иными словами, сам состав системы становится переменной, которую можно менять во время работы.
Похожий переход от жёстко заданных программ к поведению, определяемому промптами, уже наблюдается и в моделировании роевых систем с помощью LLM (Jimenez-Romero et al., 2025).
Zhou и Chan рассматривают другую сторону проблемы — воспроизводимость.
Созданный ими оркестратор ORCH разбивает исходную задачу на части, получает результаты анализа от нескольких разнородных моделей, а затем объединяет их по детерминированному протоколу. Дополнительный модуль экспоненциального скользящего среднего позволяет со временем корректировать маршрутизацию запросов на основе накопленной обратной связи.
Наибольший выигрыш такая схема показывает на сложных задачах, требующих рассуждений. Однако за это приходится платить ростом задержки и стоимости вычислений.
Вместе эти исследования показывают, что адаптивность и детерминизм не обязательно противоречат друг другу. Состав агентов и маршрутизация запросов могут меняться динамически, в то время как интерфейсы между компонентами, резервные сценарии и процедуры объединения результатов остаются явно заданными и пригодными для аудита.
Похожий принцип используется в архитектурах «ансамбль + арбитр», где измеряется расхождение между ответами моделей, а спорные случаи передаются человеку на проверку (Lipianina-Honcharenko et al., 2026).
3. Принятие решений с опорой на реальную обстановку
Nazar et al. переносят идею оркестрации в физический сценарий, непосредственно связанный с безопасностью.
Предполагается, что система уже обнаружила потерю внимания водителем. После этого она объединяет данные с камеры и GPS с несколькими специализированными агентами, отвечающими за визуальное восприятие, ограничения скорости, дорожную обстановку и погоду, а затем формирует короткие голосовые предупреждения.
Авторы сообщают примерно о 86% корректности вмешательств по смыслу при средней задержке 1,74 секунды.
Таким образом, модульное объединение нескольких компонентов позволяет создавать контекстно-зависимые системы, способные реагировать в реальном времени. Однако их практическое применение напрямую зависит от надёжности сенсоров, устойчивости связи и способности контролировать объём генерируемого ответа.
Huang и Tao применяют ту же интеграционную логику ко всему жизненному циклу машинного обучения.
Их агент связывает взаимодействие на естественном языке с подготовкой данных, определением типа задачи, выбором модели, оптимизацией гиперпараметров и последующей оценкой результата.
Такой подход показывает, как LLM могут снижать технический порог входа в машинное обучение (Yao et al., 2025). Одновременно он вскрывает типичные проблемы, возникающие при переходе от демонстрации к промышленной эксплуатации: необходимость проверять сгенерированный код, обеспечивать воспроизводимость, защищать конфиденциальные данные, учитывать смещения моделей, контролировать стоимость API и предусматривать восстановление после сбоев.
Ещё две работы напрямую связаны с критической инфраструктурой.
Dranca et al. объединили граф знаний (Mariotti et al., 2024), связывание сущностей (Mavridis et al., 2025), компактные дообученные модели, а также синтаксическую и семантическую проверку, чтобы преобразовывать вопросы на испанском языке в запросы Flux и InfluxQL к рабочей базе данных предприятия агропищевой отрасли.
Авторы оценивают систему на трёх уровнях. Синтаксический анализатор в большинстве случаев выдаёт корректную конструкцию запроса. Доля успешно исполняемых запросов уже ниже, а доля запросов, возвращающих действительно правильный результат, оказывается ещё меньше.
Это позволяет точнее локализовать проблему: основное узкое место находится уже не на уровне синтаксиса, а на уровне правильной привязки языка пользователя к реальному смыслу данных — semantic grounding.
Saidi также не полагается исключительно на генеративную модель.
В системе NIDS-β* компактный Transformer-кодировщик последовательностей сетевых потоков объединяется с табличными признаками, обычной обучаемой головой классификации, one-class-модулем, а также средствами объяснения результата на основе attention и SHAP (Mohale and Obagbuwa, 2025).
На трафике атак нулевого дня система достигла F1-score 0,972, а ожидаемая ошибка калибровки составила 1,9%.
Калибровка здесь принципиально важна: от неё зависит, можно ли доверять оценке уверенности модели настолько, чтобы автоматически принять решение или передать ситуацию человеку.
В совокупности эти результаты показывают, что системы поддержки критически важных решений требуют явного представления предметной области, откалиброванных выходных данных и проверки результата относительно реальной операционной среды (Wickramasinghe Brahmana et al., 2025).
4. Управление как часть архитектуры
Наиболее явно этот принцип сформулирован в работе Calboreanu.
Архитектура LATTICE разделяет планирование, исполнение и контроль таким образом, чтобы один и тот же компонент не мог одновременно принять решение о действии и самостоятельно признать это действие допустимым.
Правила реализуются по принципу policy-as-code: политика безопасности существует не только как описание в документации, но и как непосредственно исполняемые правила.
Выполнение действий проходит через отдельные контрольные шлюзы. Случаи, в которых система не уверена, передаются человеку, а происхождение решений и действий сохраняется с помощью криптографически защищённого журнала аудита.
Авторы намеренно построили оценку так, чтобы результат не зависел от конкретного планировщика.
Для четырёх семейств современных моделей-планировщиков базовая схема, разрешавшая действие после превышения заданного порога уверенности, показывала долю ошибочно разрешённых действий от 0,03 до 0,998.
В управляемой версии системы при консервативной настройке не было разрешено ни одного небезопасного действия — правда, при этом она также автоматически не разрешала вообще никаких действий.
Авторы подчёркивают, что речь идёт не о соревновании автономности или «умности» систем, а об анализе безопасности и контроля доступа. Полученные выводы справедливы при оговорённых предположениях о доверенной инфраструктуре.
Это различие принципиально важно: способность модели правильно решить задачу и наличие гарантии, что ей вообще разрешено выполнить соответствующее действие, — связанные, но всё же разные инженерные задачи.
Схожим образом архитектуры обнаружения атак с принудительно применяемыми политиками выносят функции управления системой в отдельный, пригодный для аудита слой (Adabara et al., 2026).
5. Что объединяет все эти исследования
Семь опубликованных работ связывают четыре общих принципа.
Во-первых, специализация компонентов приносит пользу только тогда, когда продумана их координация. Само по себе увеличение количества агентов ещё не делает систему лучше.
Во-вторых, свободный текст, который генерирует модель, желательно как можно раньше превращать в промежуточные объекты, которые можно проверить программно. Это могут быть роли, подзадачи, сущности схемы данных, запросы, числовые оценки, политики или формализованные наборы действий.
Исследования, в которых текстовые описания LLM преобразуются в параметризованные политики взаимодействия агентов, приводят к тому же выводу: структурированное представление позволяет установить источник решения, наложить на него ограничения и встроить его в систему управления (de Curtò et al., 2026).
В-третьих, проверка должна происходить на границах системы (Anh-Hoang et al., 2025) — до того, как сгенерированный моделью текст превратится в запрос к базе данных, предупреждение водителю, реакцию системы информационной безопасности или непосредственно выполняемую команду.
В-четвёртых, качество таких систем нельзя оценивать только одной итоговой метрикой точности (Polonioli, 2025).
Необходимо учитывать задержку, калибровку уверенности, количество ложных срабатываний, способность системы отказаться от самостоятельного решения или передать его человеку, стоимость вычислительных ресурсов, устойчивость к изменению распределения данных и дополнительную нагрузку, которую система создаёт для операторов.
Следующим этапом должно стать объединение этих принципов в полноценные сквозные системы обеспечения надёжности.
Для этого необходимы совместимые контракты между агентами и инструментами, тесты, учитывающие изменение распределения данных и преднамеренно создаваемые ошибки (Radanliev et al., 2026), избирательная автономность с проверенными резервными сценариями, а также исследования, ориентированные на человека и изучающие качество объяснений и механизмы передачи решений оператору.
Главный вывод этих работ достаточно сдержан, но имеет далеко идущие последствия.
Большие языковые модели становятся пригодными для автономных систем и поддержки принятия критически важных решений не тогда, когда превращаются в самостоятельных принимающих решения субъектов.
Они становятся пригодными для таких задач тогда, когда встроены в архитектуру, которая делает неопределённость видимой, ограничивает допустимые действия, сохраняет ответственность за решения и оставляет человеку реальный контроль над системой (Santoni de Sio and van den Hoven, 2018).
Авторы благодарят всех участников исследований, рецензентов и редакционную команду Frontiers за вклад в развитие этой междисциплинарной области.
Прим. переводчика
За многоагентной архитектурой быстро появляется ещё один инженерный уровень — инфраструктурный. Если приложение одновременно держит несколько моделей, маршрутизирует запросы между ними и работает с длинным контекстом, скорость и стоимость инференса становятся частью архитектуры не меньше, чем сами промпты и логика агентов.
Для таких сценариев можно развернуть свои модели на выделенных GPU с почасовой и поминутной оплатой: арендовать GPU в GPUGO.
Информация об авторах и публикации
Вклад авторов
I. de Zarzà: концепция исследования, подготовка первоначального текста, рецензирование и редактирование.
J. de Curtò: концепция исследования, подготовка первоначального текста, рецензирование и редактирование.
Carlos T. Calafate: концепция исследования, научное руководство, рецензирование и редактирование.
Финансирование
Исследование поддержано Luxembourg Institute of Science and Technology в рамках проектов ADIALab-MAST и LLMs4EU (грантовое соглашение № 101198470), а также Barcelona Supercomputing Center в рамках проекта TIFON (№ MIG-20232039).
Конфликт интересов
Авторы заявили, что работа выполнялась при отсутствии коммерческих или финансовых отношений, которые могли бы рассматриваться как потенциальный конфликт интересов.
Примечание издателя
Все утверждения в статье принадлежат исключительно её авторам и не обязательно отражают позицию организаций, с которыми они связаны, издателя, редакторов или рецензентов.
Упоминание или оценка любого продукта, а также утверждения его производителя не означают, что издатель гарантирует или поддерживает этот продукт.
Литература
-
Adabara I., Sadiq B. O., Shuaibu A. N., Danjuma Y. I., Maninti V., Joe M. (2026). The Agentic AI Framework (AAIF): a policy-enforced architecture for accountable and high-performance intrusion detection. Frontiers in Artificial Intelligence, 9:1755696. DOI
-
Anh-Hoang D., Tran V., Nguyen L.-M. (2025). Survey and analysis of hallucinations in large language models: attribution to prompting strategies or model behavior. Frontiers in Artificial Intelligence, 8:1622292. DOI
-
de Curtò J., de Zarzà I., Cabot J., Manzoni P., Calafate C. T. (2026). From LLM narratives to parameterized cooperation policies in multi-agent systems. Frontiers in Artificial Intelligence, 9:1820827. DOI
-
Guo T., Chen X., Wang Y., Chang R., Pei S., Chawla N. V. et al. (2024). Large Language Model Based Multi-agents: A Survey of Progress and Challenges. Proceedings of IJCAI 2024, pp. 8048–8057. DOI
-
Jimenez-Romero C., Yegenoglu A., Blum C. (2025). Multi-agent systems powered by large language models: applications in swarm intelligence. Frontiers in Artificial Intelligence, 8:1593017. DOI
-
Lipianina-Honcharenko K., Drakokhrust T., Bykovyy P., Turchynov K., Ihnatiev I. (2026). Bridging jurisdictions and legislatures: an LLM ensemble and arbiter framework for automated legal risk triage in digital media. Frontiers in Artificial Intelligence, 9:1841104. DOI
-
Mariotti L., Guidetti V., Mandreoli F., Belli A., Lombardi P. (2024). Combining large language models with enterprise knowledge graphs: a perspective on enhanced natural language understanding. Frontiers in Artificial Intelligence, 7:1460065. DOI
-
Mavridis A., Tegos S., Anastasiou C., Papoutsoglou M., Meditskos G. (2025). Large language models for intelligent RDF knowledge graph construction: results from medical ontology mapping. Frontiers in Artificial Intelligence, 8:1546179. DOI
-
Mohale V. Z., Obagbuwa I. C. (2025). A systematic review on the integration of explainable artificial intelligence in intrusion detection systems to enhancing transparency and interpretability in cybersecurity. Frontiers in Artificial Intelligence, 8:1526221. DOI
-
Polonioli A. (2025). Moving LLM evaluation forward: lessons from human judgment research. Frontiers in Artificial Intelligence, 8:1592399. DOI
-
Radanliev P., Santos O., Maple C. (2026). Threats and vulnerabilities in artificial intelligence and agentic AI models. Frontiers in Artificial Intelligence, 9:1731566. DOI
-
Santoni de Sio F., van den Hoven J. (2018). Meaningful human control over autonomous systems: a philosophical account. Frontiers in Robotics and AI, 5:15. DOI
-
Wickramasinghe Brahmana C. S., Marino D., De Silva D., Manic M. (2025). Editorial: Machine learning for cybersecurity. Frontiers in Artificial Intelligence, 8:1640609. DOI
-
Yao J., Zhang L., Huang J. (2025). Evaluation of large language model-driven AutoML in data and model management from human-centered perspective. Frontiers in Artificial Intelligence, 8:1590105. DOI
Атрибуция
Оригинал: de Zarzà I., de Curtò J., Calafate C. T. (2026). Editorial: Advanced integration of large language models for autonomous systems and critical decision support. Frontiers in Artificial Intelligence, 9:1962295.
DOI: 10.3389/frai.2026.1962295
© 2026 de Zarzà, de Curtò and Calafate. Оригинальная статья распространяется по лицензии Creative Commons Attribution 4.0 International.
Перевод и редакционная адаптация выполнены на русском языке. В перевод добавлен отдельный блок «Прим. переводчика», не являющийся частью оригинального текста.
Перевёл: https://t.me/Vladimir_dmdrtt
Сайт компании: https://gpugo.ru/
Автор: gpugo_team


