Selectel разобрал пять способов взлома ограничений нейросетей текстом
Инженер по информационной безопасности Selectel Андрей Якунин опубликовал на Хабре разбор JailBreak-атак — методов обхода встроенных ограничений ИИ-моделей через правильно составленный текст. В материале разобраны классические техники: DAN (имитация персонажа без правил), «Бабушка» (манипуляция через эмоциональный контекст), Crescendo (постепенное усложнение запросов), кодирование в Base64 и стеганография.
Якунин объясняет, почему эти приемы работают: модели искренне пытаются помочь и обходят собственные ограничения сами. Материал адресован разработчикам продуктов на базе LLM, специалистам по информационной безопасности и тем, кто хочет понять механику атак на нейросети.
Источник: Habr AI
- бэкенд-разработчик
- Вадим Гартман
- Selectel объяснил, что сертифицируют в защищённых дата-центрах 2026-09-21
- Дайджест Selectel о новинках серверного железа за август 2026. 2026-09-18
- 8 октября в Москве на конференции Selectel ТехноДень состоится живая запись выпуска «Вселенной Плюс» с участием Алексея 2026-09-18
- От архитектуры RISC-V в ЦОД до 256-ядерных чипов Diamond Rapids: новинки серверного железа за август 2026 2026-09-18
Новости этого рынка выходят у нас в телеграме первыми — @wikicompass.