Anthropic выявила новые векторы атак на языковые модели
Компания Anthropic опубликовала исследование о способах злоупотребления ИИ-моделями. В работе описаны техники, которые позволяют обойти встроенные ограничения и заставить нейросеть выполнять опасные задачи.
Исследование помогает разработчикам понять уязвимости и укрепить защиту своих систем перед массовым внедрением.
Источник: источник
Что мы знаем о компании
Ведомости
- Выручка за 2025
- 1,4 млрд ₽
- В рейтингах
- 2-е место — Коммерсантъ: Топ-100 коммерческих директоров (Топ-1000 российских менеджеров, 2025), 2025
Новости этого рынка выходят у нас в телеграме первыми — @wikicompass.