Тестирование показало, что AI Overviews от Google выдаёт миллионы ложных ответов в час. ai overviews.. ai overviews. gemini.. ai overviews. gemini. google.. ai overviews. gemini. google. nyt.. ai overviews. gemini. google. nyt. oumi.. ai overviews. gemini. google. nyt. oumi. ии-обзоры.. ai overviews. gemini. google. nyt. oumi. ии-обзоры. искусственный интеллект.. ai overviews. gemini. google. nyt. oumi. ии-обзоры. искусственный интеллект. исследование.. ai overviews. gemini. google. nyt. oumi. ии-обзоры. искусственный интеллект. исследование. Исследования и прогнозы в IT.. ai overviews. gemini. google. nyt. oumi. ии-обзоры. искусственный интеллект. исследование. Исследования и прогнозы в IT. Машинное обучение.. ai overviews. gemini. google. nyt. oumi. ии-обзоры. искусственный интеллект. исследование. Исследования и прогнозы в IT. Машинное обучение. Поисковые технологии.. ai overviews. gemini. google. nyt. oumi. ии-обзоры. искусственный интеллект. исследование. Исследования и прогнозы в IT. Машинное обучение. Поисковые технологии. тестирование.

Функция AI Overviews (ИИ-обзоры) в поисковой системе Google Search выдаёт миллионы ложных ответов в час, показало тестирование New York Times. Запущенный в 2024 году инструмент использует несколько компонентов, включая языковые модели Gemini.

Тестирование показало, что AI Overviews от Google выдаёт миллионы ложных ответов в час - 1

NYT указывает, что ИИ-обзоры точны в 90% случаев. Газета провела анализ функции совместно со стартапом Oumi, который сам разрабатывает модели искусственного интеллекта. Компания использовала для проверки AI Overviews бенчмарк SimpleQA от OpenAI, а также собственные ИИ-инструменты. Бенчмарк включает более 4 тыс. вопросов с проверяемыми ответами, чтобы оценить выдачу модели.

Oumi начала тестирование в прошлом году, когда актуальной моделью Google была Gemini 2.5. Тогда тест показал точность в 85%. Когда испытание провели после релиза Gemini 3, AI Overviews отвечала правильно на 91% вопросов. Если связать этот процент со всеми запросами в поисковике Google, то станет ясно, что ИИ-обзоры генерируют десятки миллионов неверных ответов ежедневно.

В одном из примеров у AI Overviews попросили назвать дату, когда дом музыканта Боба Марли стал музеем. Функция сослалась на три страницы, две из которых не содержали этой даты. На последней странице, из «Википедии», есть два противоречащие другу года, но инструмент выбрал неверный.

Пресс-секретарь Google Нед Адрианс заявил, что SimpleQA содержит неверную информацию. Часто модели оценивают на аналогичном тесте под названием SimpleQA Verified, который использует меньший набор вопросов, прошедших более тщательную проверку. В исследовании NYT и Oumi есть серьёзные недостатки, оно не отражает того, что люди ищут в Google на самом деле, подчеркнул Адрианс.

Издание Ars Technica указывает, что оценка новых ИИ-моделей больше напоминает искусство, чем науку — это представляет собой проблему. У каждой компании есть свой предпочтительный способ демонстрации возможностей модели, а недетерминированная природа генеративного ИИ способна затруднить проверку. Oumi использует ИИ-инструменты для оценки, а модели в их основе также могут галлюцинировать.

Кроме того, AI Overviews — это не монолитная модель. Google сообщила, что использует «правильную модель» для каждого запроса. ИИ-обзоры выдавали бы наилучшие ответы, если бы постоянно использовали Gemini 3.1 Pro, но это медленно и затратно. Для быстрой загрузки информации на страницу поиска функция применяет более быстрые модели Gemini Flash.

В прошлом году кулинарные блогеры обвинили AI Overviews в снижении трафика на свои сайты. ИИ-обзоры генерировали бессмысленные рецепты и ремиксы реальных рецептов, сопровождая их сгенерированными изображениями блюд. В некоторых случаях ИИ-обзоры содержали ссылки на реальные рецепты, но сам ответ содержал множество неточностей.

Автор: Travis_Macrif

Источник