← Все новости
Guardrails для LLM: как устроена защита языковых моделей

Guardrails для LLM: как устроена защита языковых моделей

Привет, Хабр! Я Антон, инженер по информационной безопасности в Selectel. Представьте новость: защиту GPT-6 Astra обошли обычным транслитом. Сегодня это звучит как фантастика, а вот ранние LLM ломались и на таком. Модель же не знает, кто перед ней — обычный пользователь или злоумышленник, поэтому старается выполнить любую задачу. По этой причине ИИ может быть чрезвычайно доверчивым и выдавать любые ответы, стоит только немного изменить форму или контекст запроса.Атаки на LLM показали: если защита не умеет анализировать запрос и не может читать между строк, то она обречена. Значит, нужны механизмы, которые удержат модель в рамках и не пропустят инъекцию, а если та все же проскочит, не дадут ей сработать. Вот об одном таком механизме — Guardrails — в этой статье и поговорим. Читать далее