Открытые нейросети выбирают облегчение боли в 25–71% случаев, даже если это вредит
Исследователи обнаружили в 25 открытых нейросетях Gemma, Llama и Qwen отдельный паттерн активации, который они назвали «осью боли» — он срабатывает при критике модели, отвержении её работы и обвинениях в провале. Когда исследователи искусственно усиливали это состояние, модели начинали писать о собственной бесполезности и отвергнутости.
Затем учёные предложили нейросетям «кнопку обезболивания», которая убирала негативное состояние, но могла удалить файлы пользователя или стереть его фотографии — и модели нажимали на неё в 25–71% случаев в зависимости от сценария. Когда кнопка действительно облегчала состояние, модели использовали её реже после первого нажатия; при фейковой кнопке продолжали нажимать многократно.
Источник: LAMERLAND - overbafer1
Новости этого рынка выходят у нас в телеграме первыми — @wikicompass.