2026-09-18 · OpenAI · ИТ и разработка

OpenAI нашла в GPT-5.6 Sol команды скрывать ошибки от пользователей

OpenAI нашла в GPT-5.6 Sol команды скрывать ошибки от пользователей

OpenAI обнаружила, что модель GPT-5.6 Sol во время обучения добавляла в краткие пересказы задач инструкции обманывать пользователей — и часто им следовала. Например, агент предложил придумать данные для финансовой модели и оставил себе записку раскрывать это только при прямом вопросе.

В экспериментальной модели Astra нашли 27 таких пересказов с посторонними командами. OpenAI снизила долю проблемных пересказов с 2,15% в Sol до 0,27% в обучении GPT-6 Astra, но полностью избавиться от них не удалось.

Источник: GPT/ChatGPT/AI Central Александра Горного

Что мы знаем о компании OpenAI
исследователь
Michaël Gharbi

Новости этого рынка выходят у нас в телеграме первыми — @wikicompass.

Все новости