Ученые нашли у ИИ опасную черту: модели слепо верят большинству

Современные системы искусственного интеллекта все чаще работают не поодиночке, а в «коллективах» — группы моделей обмениваются ответами и совместно решают задачи. И, как оказалось, такие ИИ‑агенты способны самопроизвольно приходить к единому мнению, просто подстраиваясь под большинство.

Группа специалистов Университета Констанца под руководством Джордано Де Марцо решила подойти к изучению ИИ так же, как физики и биологи изучают стаи птиц или косяки рыб: не оценивать, что «знает» один агент, а анализировать, как ведет себя целая популяция. В ходе нового исследования его авторы изучали следование ИИ мнению большинства: склонен ли агент выбирать тот вариант, который уже популярен вокруг него, даже без подсказок о «правильности» ответа.

В первом эксперименте ученые запустили десятки экземпляров разных языковых моделей (GPT, Claude, Llama) и случайным образом присвоили каждой одну из двух нейтральных «позиций», обозначенных случайными буквами, чтобы избежать скрытых ассоциаций «да/нет». На каждом шаге агенту показывали список мнений остальных и просили выбрать свое новое мнение, не говоря, что нужно соглашаться.

Оказалось, что продвинутые модели — на момент эксперимента это были GPT‑4 Turbo и Claude 3 Opus — почти всегда приходят к полному согласию: 100% агентов в итоге выбирают один вариант. Более простые модели, такие как GPT‑3.5 Turbo, так и не могли стабильно договориться — их распределение колебалось вокруг 50/50. «Группы ИИ‑агентов действительно склонны “держаться вместе”. При двух равноценных вариантах, отсутствии правильного ответа и явных инструкций они все равно сходятся к общему выбору, просто следуя за большинством», отмечает Де Марцо.

Источник: hi-tech.mail.ru

0 0 голоса
Рейтинг новости
1
0
Подписаться
Уведомить о
0 комментариев