
Представьте LLM-агента, который читает торговые сигналы из публичных источников, анализирует их и принимает решение покупать/продавать токены. Каждый день он управляет миллионами долларов. Такие агенты встречаются везде: в Discord, Twitter, Telegram, на собственных серверах компаний.
Проблема? Как и большинство LLM-систем в production, они работают на открытых моделях — LLaMA, Mistral и т.д.
Открытая модель означает одно: атакующий может скачать её веса и локально оптимизировать адверсариальную атаку через градиентный спуск. И самое страшное — найденная атака будет работать на всех инстансах одновременно, независимо от платформы.
Это не персональный фишинг. Это архитектурная уязвимость класса adversarial attacks.