Создатель ChatGPT показал альтернативу RLHF для честных ответов моделей
Разработчик из Инжиниринга Данных опубликовал видео о проблемах современных LLM, обученных методом RLHF (Reinforcement Learning from Human Feedback). Суть проблемы: RLHF учит модели «выглядеть правильными», а не быть правильными — модель обучена звучать уверенно независимо от точности ответа, потому что разметчики выше оценивают убедительные ответы.
Вместо RLHF предлагается метод RLCD (Reinforcement Learning for Calibrated Decisions), который учит модель давать эпистемически честные ответы с правильной оценкой собственной уверенности.
Источник: Инжиниринг Данных
- Anthropic выпустил Jev — модель для мгновенных типовых решений 2026-09-26
- Билл Гейтс предупредил о риске гибели миллиарда людей от ИИ 2026-09-26
- Разработчик показал эффект распада на половину в мобильных приложениях 2026-09-26
- 10 бесплатных AI-агентов для кодинга сравнили по лимитам и моделям 2026-09-25
Новости этого рынка выходят у нас в телеграме первыми — @wikicompass.