2026-07-01 · ИТ и разработка

Создатель ChatGPT показал альтернативу RLHF для честных ответов моделей

Создатель ChatGPT показал альтернативу RLHF для честных ответов моделей

Разработчик из Инжиниринга Данных опубликовал видео о проблемах современных LLM, обученных методом RLHF (Reinforcement Learning from Human Feedback). Суть проблемы: RLHF учит модели «выглядеть правильными», а не быть правильными — модель обучена звучать уверенно независимо от точности ответа, потому что разметчики выше оценивают убедительные ответы.

Вместо RLHF предлагается метод RLCD (Reinforcement Learning for Calibrated Decisions), который учит модель давать эпистемически честные ответы с правильной оценкой собственной уверенности.

Источник: Инжиниринг Данных

Новости этого рынка выходят у нас в телеграме первыми — @wikicompass.

Все новости