
Что такое JailBreak-атаки: почему ИИ нарушает собственные правила и как это работает
Чтобы «взломать» нейросеть, иногда хватит правильно составленного текста. Попросить модель сыграть персонажа без правил, вспомнить покойную бабушку с химзавода, разбить опасный вопрос на цепочку безобидных или просто закодировать его в Base64. Дальше модель обходит собственные ограничения сама, причем из лучших побуждений, так как искренне хочет помочь.На связи Андрей Якунин, инженер по информационной безопасности в Selectel. В тексте разберу классику JailBreak-атак: DAN, «Бабушку», Crescendo, обход фильтров через кодирование и стеганографию. По пути поговорим, чем джейлбрейк отличается от промпт-инъекции и почему эти приемы вообще срабатывают. Будет полезно тем, кто строит продукты поверх LLM и хочет понимать, что однажды прилетит в их чат-бота, ИБ-специалистам, которым эти продукты защищать, и всем, кому просто интересно, как устроены атаки на ИИ. Под кат →