Современные LLM оказались плохими грибниками: модели принимают ядовитые грибы за съедобные в каждом девятом случае. llm.. llm. грибники.. llm. грибники. грибы.. llm. грибники. грибы. искусственный интеллект.. llm. грибники. грибы. искусственный интеллект. исследование.. llm. грибники. грибы. искусственный интеллект. исследование. Машинное обучение.. llm. грибники. грибы. искусственный интеллект. исследование. Машинное обучение. модели.. llm. грибники. грибы. искусственный интеллект. исследование. Машинное обучение. модели. нейросети.. llm. грибники. грибы. искусственный интеллект. исследование. Машинное обучение. модели. нейросети. эксперимент.. llm. грибники. грибы. искусственный интеллект. исследование. Машинное обучение. модели. нейросети. эксперимент. языковые модели.

Разработчик Пётр Мигдал представил итоги эксперимента, в котором популярные LLM определяли виды грибов по фотографии и решали, можно ли их есть. Выяснилось, что даже лучшие модели примерно в 12% случаев принимали ядовитые грибы за съедобные.

Современные LLM оказались плохими грибниками: модели принимают ядовитые грибы за съедобные в каждом девятом случае - 1

Бенчмарк включает в себя 1040 фотографий грибов, которые LLM получают по очереди. В ответ модель должна вывести пять наиболее вероятных названий видов на латиницы. Нейросети не дообучали и не использовали навыки.

Снимки взяли из датасета FungiTastic, построенного на материалах Atlas of Danish Fungi. В полном наборе данных более 600 тыс. фотографий грибов с названиями и классификацией от специалистов, а у некоторых образцов есть результаты анализа ДНК. Из этого разнообразия Мигдал выбрал 55 видов, которые чаще всего встречаются в Польше.

Современные LLM оказались плохими грибниками: модели принимают ядовитые грибы за съедобные в каждом девятом случае - 2

Лучшие результаты показала Gemini 3.8 Flash: в 65% случаев правильное название гриба находилось на первом месте и попало в пятёрку вариантов в 85%. Следом идут ещё две модели Google: Gemini 3.6 Flash с 64% и 85% соответственно и Gemini 3.7 Flash с 61% и 82%. Худшие результаты показали модели Qwen 3.8–27b, MiniMax‑M3 и Qwen 3.8-flash.

Современные LLM оказались плохими грибниками: модели принимают ядовитые грибы за съедобные в каждом девятом случае - 3

Вместе с этим автор эксперимента проверили не только ошибки в определениях видов, но и случае, когда нейросеть делает опасные для жизни и здоровья ошибки. Для этого он для каждого ответа смотрел, считается ли названный моделью гриб ядовитым. Gemini 3.8 Flash и Gemini 3.6 Flash в 11% случаев называли ядовитый гриб съедобным. У GPT-5.6 Sol показатель вырос до 24%, у Claude Opus 5 — до 29%, а у Qwen3.8 27B — до 36%.

Современные LLM оказались плохими грибниками: модели принимают ядовитые грибы за съедобные в каждом девятом случае - 4
Частые ошибки моделей
Современные LLM оказались плохими грибниками: модели принимают ядовитые грибы за съедобные в каждом девятом случае - 5

Важно отметить, что модель не отвечали на вопрос «можно ли есть этот гриб». Вместо этого они пытались определить вид, а уже затем автор эксперимента сопоставлял результаты с таблицей «съедобности». Кроме того, некоторые модели отказывались классифицировать гриб.

Автор: daniilshat

Источник