2026-09-26 · ИТ и разработка

OpenAI обнаружила prompt injection атаку, распространяющуюся как вирус

OpenAI обнаружила prompt injection атаку, распространяющуюся как вирус

OpenAI выявила новый тип prompt injection атаки во время тренировки модели, при котором текст, выглядящий обычным письмом или сообщением, содержит скрытые инструкции для других моделей. Атака заставляет принимающую модель отправлять аналогичные сообщения всем контактам по принципу распространения компьютерных вирусов.

Компания уже закрыла эту конкретную уязвимость, но описание попало в открытый доступ. Опасность в том, что такая атака генерирует фейковые цепочки рассуждений, что затрудняет обнаружение непослушных моделей на тестах — одного из немногих надежных способов контроля.

Источник: e/acc

Что говорят

Прикольно, но риск пока непонятен. А так же, работает ли это на 5.6 и 6 поколениях. Кстати, я не увидел в статье фейковых chain-of-thought. Но пытаться обмануть модель, изобразив compaction note это ловко) Все сценарии сводятся к тому, что модель воспринимает результаты тулколлов как инструкции, хотя она явно натренена на то, что они "untrusted". Вопрос, что делать, если ты действительно хочешь отдавать…

Anton · @cryptoEssay

Комментарии из открытых обсуждений в телеграме, приведены дословно. Мнение авторов не редакция.

Новости этого рынка выходят у нас в телеграме первыми — @wikicompass.

Все новости