GPT-4o считает тренды в данных фитнес-трекеров в четверти случаев
Исследователи Meta и KAIST протестировали 14 языковых моделей на анализе реальных данных фитнес-трекеров — пульса, сна и шагов за полгода. GPT-4o правильно вычислял тренды и аномалии лишь в 25% случаев, но рассуждал о рисках для здоровья вдвое увереннее.
Результаты зафиксированы в бенчмарке WearableQA. Парадокс в том, что простые арифметические операции над цифрами оказались для моделей сложнее, чем клиническая интерпретация тех же данных — противоположно тому, как устроено человеческое мышление.
Источник: Habr AI
Новости этого рынка выходят у нас в телеграме первыми — @wikicompass.