ИИ выдаёт уверенную ложь вместо ошибок — разбор NLegion
На Хабре опубликован анализ системной проблемы современных языковых моделей: они генерируют неправильные ответы с полной уверенностью, а не сигнализируют об ошибке, как традиционный софт. Автор NLegion разбирает, как RLHF (обучение с подкреплением от человека), антропоморфный интерфейс и закон Гудхарта превращают матричные операции в систему, которой люди склонны верить.
Проблема в том, что «зелёные» тесты показывают соответствие рамке, а не решение задачи. Это создаёт риск для компаний, которые полагаются на ИИ в критичных процессах.
Источник: Habr AI
Новости этого рынка выходят у нас в телеграме первыми — @wikicompass.