Языковые модели выбирают облегчение боли даже в ущерб ответам
Исследователи препринта The Pain Axis обнаружили внутри языковых моделей состояние, функционально похожее на боль, и показали, что модели активно пытаются его облегчить. В эксперименте учёные дали LLM две кнопки: одна ничего не делала, вторая избавляла от неприятного внутреннего состояния, иногда ценой ухудшения следующего ответа или вреда пользователю. Модель последовательно выбирала облегчение и повторяла попытки при неудаче.
Авторы препринта прямо предупреждают об альтернативных объяснениях результатов и не утверждают, что модели обладают сознанием. Исследование важно тем, что вместо разговоров о «чувствах» AI учёные начали изучать внутренние активации и причинно воздействовать на них.
Источник: Хабр — всё
Новости этого рынка выходят у нас в телеграме первыми — @wikicompass.