- BrainTools - https://www.braintools.ru -

Передовые инструменты ИИ всех типов и моделей по‑прежнему не могут [1] выполнять подавляющее большинство рабочих задач на приемлемом уровне. К такому выводу пришли исследователи Калифорнийского университета в Беркли, проверив современные ИИ‑модели с помощью собственного бенчмарка Agents’ Last Exam.
Для проверки они собрали более 1500 задач, подготовленных экспертами, и распределили их по 55 профессиям. В список вошли как сферы, где ИИ уже активно используется, например разработка программного обеспечения и графический дизайн, так и направления, где его возможности пока мало изучены, в том числе сельское хозяйство и морское дело. Среди протестированных моделей были GPT-5.5 от OpenAI, Fable 5 от Anthropic, Composer 2.5 от Cursor и Gemini 3.1 Pro от Google.
Результаты оказались слабыми. Лучше других показала себя GPT-5.5, она справилась с 24% задач. На самом сложном уровне все протестированные модели, включая Fable 5, показали 0% успеха.
Авторы работы отмечают, что ИИ может закрывать часть рутинных задач, но в проектах, где нужны длительное рассуждение, узкие знания и стабильная работа в течение долгого времени, они пока сильно отстают от человека.
Исследователи также указывают на высокую стоимость большинства моделей. По их данным, Fable 5 показывает сопоставимый результат с GPT-5.5 и Composer 2.5, но обходится примерно в 4–12 раз дороже за одну задачу. При этом учёные признают, что даже неидеальные ИИ‑системы могут заметно повлиять на профессии, где много повторяющихся и чётко описанных процессов.
Автор: AnnieBronson
Источник [2]
Сайт-источник BrainTools: https://www.braintools.ru
Путь до страницы источника: https://www.braintools.ru/article/33659
URLs in this post:
[1] не могут: https://futurism.com/artificial-intelligence/frontier-ai-faceplanting-real-world-tasks
[2] Источник: https://habr.com/ru/news/1063952/?utm_source=habrahabr&utm_medium=rss&utm_campaign=1063952
Нажмите здесь для печати.