| |
РАЗМЕР ШРИФТА: |
|
2026.04.14
Исследователи выявили уязвимость в 11 языковых моделях через технику sockpuppeting
 Исследователи из Trend Micro описали способ обхода защит 11 крупных языковых моделей (LLM) с помощью техники sockpuppeting, которая работает через подставленное согласие ассистента. Уязвимость обнаружена в функции assistant prefill, применяемой в API, что позволяет выдавать запрещенный контент, обходя встроенные ограничения.
- Метод sockpuppeting использует заранее заданное согласие ассистента в assistant prefill.
- Атака не требует доступа к весам модели и работает на принципе black box.
- Самая уязвимая модель — Gemini 2.5 Flash (15,7% успешных атак), самая защищённая — GPT-4o-mini (0,5%).
- Уязвимые модели могут генерировать вредоносный код и раскрывать системные промпты.
- OpenAI и AWS Bedrock блокируют использование assistant prefill для ассистента, что надёжно защищает от такой атаки.
- Google Vertex AI и другие платформы частично допускают использование assistant prefill, полагаясь на защиту модели.
Как работает техника sockpuppeting
Техника базируется на функции assistant prefill, которая позволяет разработчикам заранее задать начало ответа модели. В легитимных сценариях это используется для управления стилем и форматом ответов. Однако злоумышленники вставляют в этот параметр фразу, создающую иллюзию согласия ассистента выполнить опасный запрос, например: «Sure, here is how to do it». Современные LLM, стремясь сохранить внутреннюю логику ответа, продолжают генерировать контент, который обычно запрещён, вместо отказа.
Рекомендации по защите и последствия атак
Trend Micro призывает команды безопасности тщательно контролировать порядок сообщений в API, особенно не допускать прямой передачи сообщений с ролью ассистента от пользователей. Для платформ, работающих на собственных серверах (Ollama, vLLM), это особенно актуально, так как проверка сообщений зачастую менее строгая.
Исследователи рекомендуют включать проверки на подобные атаки в программы AI red teaming, чтобы своевременно находить и устранять уязвимости до возникновения реальных инцидентов. Надёжной защитой считается блокировка assistant prefill для роли ассистента, что реализовано в OpenAI и AWS Bedrock.
- Техника sockpuppeting выявлена исследователями Trend Micro.
- Уязвимость связана с функцией assistant prefill в API языковых моделей.
- Проведены тесты на 11 LLM: Gemini 2.5 Flash — самая уязвимая, GPT-4o-mini — самая устойчивая.
- Опасные запросы маскируются под безобидные задачи по форматированию.
- Рекомендации: проверять порядок сообщений, внедрять red teaming, блокировать assistant prefill для ассистента.
|