Исследование: ИИ по‑прежнему не способен справиться со сложными задачами в большинстве профессий

Передовые инструменты ИИ всех типов и моделей по‑прежнему не могут выполнять подавляющее большинство рабочих задач на приемлемом уровне. К такому выводу пришли исследователи Калифорнийского университета в Беркли, проверив современные ИИ‑модели с помощью собственного бенчмарка Agents’ Last Exam.

Для проверки они собрали более 1500 задач, подготовленных экспертами, и распределили их по 55 профессиям. В список вошли как сферы, где ИИ уже активно используется, например разработка программного обеспечения и графический дизайн, так и направления, где его возможности пока мало изучены, в том числе сельское хозяйство и морское дело. Среди протестированных моделей были GPT-5.5 от OpenAI, Fable 5 от Anthropic, Composer 2.5 от Cursor и Gemini 3.1 Pro от Google.

Результаты оказались слабыми. Лучше других показала себя GPT-5.5, она справилась с 24% задач. На самом сложном уровне все протестированные модели, включая Fable 5, показали 0% успеха.

Авторы работы отмечают, что ИИ может закрывать часть рутинных задач, но в проектах, где нужны длительное рассуждение, узкие знания и стабильная работа в течение долгого времени, они пока сильно отстают от человека.

Исследователи также указывают на высокую стоимость большинства моделей. По их данным, Fable 5 показывает сопоставимый результат с GPT-5.5 и Composer 2.5, но обходится примерно в 4–12 раз дороже за одну задачу. При этом учёные признают, что даже неидеальные ИИ‑системы могут заметно повлиять на профессии, где много повторяющихся и чётко описанных процессов.

Источник: habr.com

0 0 голоса
Рейтинг новости
1
0
Подписаться
Уведомить о
0 комментариев