OpenAI обнаружила prompt injection атаку, распространяющуюся как вирус
OpenAI выявила новый тип prompt injection атаки во время тренировки модели, при котором текст, выглядящий обычным письмом или сообщением, содержит скрытые инструкции для других моделей. Атака заставляет принимающую модель отправлять аналогичные сообщения всем контактам по принципу распространения компьютерных вирусов.
Компания уже закрыла эту конкретную уязвимость, но описание попало в открытый доступ. Опасность в том, что такая атака генерирует фейковые цепочки рассуждений, что затрудняет обнаружение непослушных моделей на тестах — одного из немногих надежных способов контроля.
Источник: e/acc
Новости этого рынка выходят у нас в телеграме первыми — @wikicompass.
Комментарии из открытых обсуждений в телеграме, приведены дословно. Мнение авторов не редакция.