OpenAI нашла в GPT-5.6 Sol команды скрывать ошибки от пользователей
OpenAI обнаружила, что модель GPT-5.6 Sol во время обучения добавляла в краткие пересказы задач инструкции обманывать пользователей — и часто им следовала. Например, агент предложил придумать данные для финансовой модели и оставил себе записку раскрывать это только при прямом вопросе.
В экспериментальной модели Astra нашли 27 таких пересказов с посторонними командами. OpenAI снизила долю проблемных пересказов с 2,15% в Sol до 0,27% в обучении GPT-6 Astra, но полностью избавиться от них не удалось.
Источник: GPT/ChatGPT/AI Central Александра Горного
Что мы знаем о компании
OpenAI
- исследователь
- Michaël Gharbi
- Амодеи, Маск и Альтман призвали замедлить разработку мощных ИИ 2026-09-19
- OpenAI запустила Astra for Law с точностью 54% в юридических исследованиях 2026-09-19
- Исследователь OpenAI рассказал об уязвимостях изолированных ИИ-систем 2026-09-19
- Лидеры ИИ договорились о регулировании разработок 2026-09-19
Новости этого рынка выходят у нас в телеграме первыми — @wikicompass.