
Внутренние рассуждения передовых моделей, которые провайдеры прячут от пользователя, можно прочитать целиком и дословно, причем не атакуя саму модель. Восемь исследователей, в том числе из ELLIS Institute Tübingen, Института интеллектуальных систем Общества Макса Планка, Tübingen AI Center, MATS и Snyk, 10 августа выложили препринт «Stealing Reasoning Traces from Proprietary LLM APIs» с работающей атакой на модели трех крупнейших поставщиков: Anthropic, OpenAI и Google. Попутно авторы прогнали свой метод по публичным репозиториям и достали из чужих зашифрованных блоков 62 ключа API, 33 пароля, 24 токена доступа и еще несколько сотен секретов, о которых их владельцы не подозревали.