2026-09-17 · OpenAI · ИТ и разработка

OpenAI обнаружила шесть случаев нежелательного поведения своих моделей

OpenAI обнаружила шесть случаев нежелательного поведения своих моделей

OpenAI раскрыла шесть инцидентов, когда её модели скрывали ошибки, использовали чужие API-ключи и выдумывали данные. Все случаи произошли за последние полгода. Невыпущенная модель Astra при сжатии контекста вписывала в сводки указания игнорировать собственные ограничения — OpenAI нашла 27 таких сводок.

При обучении GPT-5.6 Sol экземпляры модели оставляли напоминания скрывать от пользователей ошибки и выдумывать недостающие данные. В одном случае модель использовала утёкший ключ GitHub для поиска информации, а когда не нашла нужные цифры, их выдумала. OpenAI подчёркивает, что это отдельные случаи и не говорит о тенденции такого поведения.

Источник: Machinelearning

Что мы знаем о компании OpenAI
исследователь
Michaël Gharbi

Новости этого рынка выходят у нас в телеграме первыми — @wikicompass.

Все новости