Anthropic заявила об устойчивости Claude Opus 5 к prompt-инъекциям
Anthropic утверждает, что Claude Opus 5 стал первой моделью, которую команда не может взломать через prompt injection — атаки, когда пользователь пытается переписать инструкции модели. По словам создателя Claude Code Бориса Черного, на YC Startup School компания заявила: «модель больше не поддаётся prompt injection».
Исследователи из сторонней лаборатории проверили Opus 5, Fable и Sonnet на бенчмарке из 72 сценариев по 10 раз каждый — ни одна атака не сработала. Anthropic регулярно публикует результаты собственных оценок безопасности моделей.
Источник: Habr AI
Что мы знаем о компании
ОБЩЕСТВО С ОГРАНИЧЕННОЙ ОТВЕТСТВЕННОСТЬЮ "РАФТ"
- Выручка за 2025
- 12,9 млрд ₽
Новости этого рынка выходят у нас в телеграме первыми — @wikicompass.