- BrainTools - https://www.braintools.ru -

Исследование: «призраки» искусственного интеллекта заражают академические публикации

Исследование: «призраки» искусственного интеллекта заражают академические публикации - 1

В списках авторов научных публикаций появились [1]«призраки»: Елена Васкес и Маркус Чен нередко указываются как эксперты или соавторы. На самом деле этих людей не существует, а их имена выдают большие языковые модели при генерации экспертов в определённых областях.

Исследователи из Samsung и Варшавского университета нашли несколько имён, которые часто встречаются в списках экспертов и соавторов. Этот феномен объясняется склонностью моделей генерировать одно и то же имя в рамках похожей задачи. Так, ChatGPT, Gemini и Claude очень часто вписывают в свои художественные произведения человека по имени Элиас Торн, и этот персонаж часто оказывается смотрителем маяка.

Аналогичный процесс, судя по всему, происходит и в научных публикациях: когда модель просят сгенерировать имя разработчика ПО или эксперта в технике, она часто генерирует имя Маркус Чен. Среди других имён, «любимых» моделями, встречаются Елена Амара Оконкво или Окафор (Claude), Лена Петрова (Gemini), а также Элара Восс (ChatGPT).

Как рассказал ведущий автор исследования Михал Бржозовский, учёные обнаружили более 1,5 тыс. статей, в авторах которых значились «призраки».

«Мы обнаружили 1655 записей от „призрачных“ авторов на Zenodo, хранилище данных ЦЕРН. Согласно данным хранилища, журналы, в которых якобы опубликованы эти статьи, не существуют, а даты публикации сфабрикованы», — рассказал он. 

Исследователи также заметили, что LLM не просто часто используют одни и те же имена, они склонны составлять из них одни и те же ансамбли, то есть некоторые имена с большей вероятностью будут появляться вместе. Более того, по их словам, по именам можно определить модель, которая сгенерировала контент. Так, имя Елена Васкес чаще всего появляется в генерациях Claude Sonnet 4, поэтому статьи, где встречается это имя, скорее всего, были созданы с помощью этой LLM. 

Однако, как признаёт Бржозовский, такой уровень точности может быть недолговечным: сгенерированный контент с указанными именами распространяется везде в интернете и влияет на все модели, которые обучаются на актуальных данных.

Автор: AnnieBronson

Источник [2]


Сайт-источник BrainTools: https://www.braintools.ru

Путь до страницы источника: https://www.braintools.ru/article/34926

URLs in this post:

[1] появились : https://www.404media.co/the-ai-ghosts-contaminating-academic-publishing/

[2] Источник: https://habr.com/ru/news/1076766/?utm_source=habrahabr&utm_medium=rss&utm_campaign=1076766

www.BrainTools.ru

Rambler's Top100