← Все новости
Как защитить LLM-агентов от gradient-based adversarial attacks-атак: VRF + LoRA подход

Как защитить LLM-агентов от gradient-based adversarial attacks-атак: VRF + LoRA подход

Представьте LLM-агента, который читает торговые сигналы из публичных источников, анализирует их и принимает решение покупать/продавать токены. Каждый день он управляет миллионами долларов. Такие агенты встречаются везде: в Discord, Twitter, Telegram, на собственных серверах компаний.Проблема? Как и большинство LLM-систем в production, они работают на открытых моделях - LLaMA, Mistral и т.д.Открытая модель означает одно: атакующий может скачать её веса и локально оптимизировать адверсариальную атаку через градиентный спуск. И самое страшное - найденная атака будет работать на всех инстансах одновременно, независимо от платформы.Это не персональный фишинг. Это архитектурная уязвимость класса adversarial attacks. Читать далее