Исследование: ИИ по‑прежнему не способен справиться со сложными задачами в большинстве профессий. fable 5.. fable 5. gemini.. fable 5. gemini. gpt.. fable 5. gemini. gpt. Будущее здесь.. fable 5. gemini. gpt. Будущее здесь. искусственный интеллект.. fable 5. gemini. gpt. Будущее здесь. искусственный интеллект. Машинное обучение.
Исследование: ИИ по‑прежнему не способен справиться со сложными задачами в большинстве профессий - 1

Передовые инструменты ИИ всех типов и моделей по‑прежнему не могут выполнять подавляющее большинство рабочих задач на приемлемом уровне. К такому выводу пришли исследователи Калифорнийского университета в Беркли, проверив современные ИИ‑модели с помощью собственного бенчмарка Agents’ Last Exam.

Для проверки они собрали более 1500 задач, подготовленных экспертами, и распределили их по 55 профессиям. В список вошли как сферы, где ИИ уже активно используется, например разработка программного обеспечения и графический дизайн, так и направления, где его возможности пока мало изучены, в том числе сельское хозяйство и морское дело. Среди протестированных моделей были GPT-5.5 от OpenAI, Fable 5 от Anthropic, Composer 2.5 от Cursor и Gemini 3.1 Pro от Google.

Результаты оказались слабыми. Лучше других показала себя GPT-5.5, она справилась с 24% задач. На самом сложном уровне все протестированные модели, включая Fable 5, показали 0% успеха.

Авторы работы отмечают, что ИИ может закрывать часть рутинных задач, но в проектах, где нужны длительное рассуждение, узкие знания и стабильная работа в течение долгого времени, они пока сильно отстают от человека.

Исследователи также указывают на высокую стоимость большинства моделей. По их данным, Fable 5 показывает сопоставимый результат с GPT-5.5 и Composer 2.5, но обходится примерно в 4–12 раз дороже за одну задачу. При этом учёные признают, что даже неидеальные ИИ‑системы могут заметно повлиять на профессии, где много повторяющихся и чётко описанных процессов.

Автор: AnnieBronson

Источник