Почему нельзя просто загрузить историю с фитнес-браслета в LLM и попросить оценить здоровье
Исследователи из Meta и KAIST решили проверить очевидный на первый взгляд вопрос: если дать большой языковой модели реальную историю измерений с фитнес-трекера — пульс, сон, шаги за полгода — сможет ли она разобраться в этих данных так же уверенно, как рассуждает о здоровье вообще? Результат оказался неожиданным. Модели гораздо хуже справлялись с простыми вычислениями по самим цифрам, чем с клинической интерпретацией того же ряда. GPT-4o правильно считал тренды и аномалии лишь в четверти случаев, а вот рассуждал о рисках для здоровья на основе тех же данных вдвое увереннее.

