2026-09-22 · Selectel · ИТ и разработка

Selectel разобрал пять способов взлома ограничений нейросетей текстом

Selectel разобрал пять способов взлома ограничений нейросетей текстом

Инженер по информационной безопасности Selectel Андрей Якунин опубликовал на Хабре разбор JailBreak-атак — методов обхода встроенных ограничений ИИ-моделей через правильно составленный текст. В материале разобраны классические техники: DAN (имитация персонажа без правил), «Бабушка» (манипуляция через эмоциональный контекст), Crescendo (постепенное усложнение запросов), кодирование в Base64 и стеганография.

Якунин объясняет, почему эти приемы работают: модели искренне пытаются помочь и обходят собственные ограничения сами. Материал адресован разработчикам продуктов на базе LLM, специалистам по информационной безопасности и тем, кто хочет понять механику атак на нейросети.

Источник: Habr AI

Что мы знаем о компании Selectel
бэкенд-разработчик
Вадим Гартман

Новости этого рынка выходят у нас в телеграме первыми — @wikicompass.

Все новости