Современные LLM оказались плохими грибниками: модели принимают ядовитые грибы за съедобные в каждом девятом случае

Разработчик Пётр Мигдал представил итоги эксперимента, в котором популярные LLM определяли виды грибов по фотографии и решали, можно ли их есть. Выяснилось, что даже лучшие модели примерно в 12% случаев принимали ядовитые грибы за съедобные.

Бенчмарк включает в себя 1040 фотографий грибов, которые LLM получают по очереди. В ответ модель должна вывести пять наиболее вероятных названий видов на латиницы. Нейросети не дообучали и не использовали навыки.

Снимки взяли из датасета FungiTastic, построенного на материалах Atlas of Danish Fungi. В полном наборе данных более 600 тыс. фотографий грибов с названиями и классификацией от специалистов, а у некоторых образцов есть результаты анализа ДНК. Из этого разнообразия Мигдал выбрал 55 видов, которые чаще всего встречаются в Польше.

Лучшие результаты показала Gemini 3.8 Flash: в 65% случаев правильное название гриба находилось на первом месте и попало в пятёрку вариантов в 85%. Следом идут ещё две модели Google: Gemini 3.6 Flash с 64% и 85% соответственно и Gemini 3.7 Flash с 61% и 82%. Худшие результаты показали модели Qwen 3.8–27b, MiniMax‑M3 и Qwen 3.8-flash.

Вместе с этим автор эксперимента проверили не только ошибки в определениях видов, но и случае, когда нейросеть делает опасные для жизни и здоровья ошибки. Для этого он для каждого ответа смотрел, считается ли названный моделью гриб ядовитым. Gemini 3.8 Flash и Gemini 3.6 Flash в 11% случаев называли ядовитый гриб съедобным. У GPT-5.6 Sol показатель вырос до 24%, у Claude Opus 5 — до 29%, а у Qwen3.8 27B — до 36%.

Частые ошибки моделей

Важно отметить, что модель не отвечали на вопрос «можно ли есть этот гриб». Вместо этого они пытались определить вид, а уже затем автор эксперимента сопоставлял результаты с таблицей «съедобности». Кроме того, некоторые модели отказывались классифицировать гриб.

Источник: habr.com

0 0 голоса
Рейтинг новости
1
0
Подписаться
Уведомить о
0 комментариев