Городская поликлиника №227
Управление здравоохранения Юго-Восточного административного округа города Москвы
  РАЗМЕР ШРИФТА:
2026.04.14
Исследователи выявили уязвимость в 11 языковых моделях через технику sockpuppeting

Исследователи из Trend Micro описали способ обхода защит 11 крупных языковых моделей (LLM) с помощью техники sockpuppeting, которая работает через подставленное согласие ассистента. Уязвимость обнаружена в функции assistant prefill, применяемой в API, что позволяет выдавать запрещенный контент, обходя встроенные ограничения.

  • Метод sockpuppeting использует заранее заданное согласие ассистента в assistant prefill.
  • Атака не требует доступа к весам модели и работает на принципе black box.
  • Самая уязвимая модель — Gemini 2.5 Flash (15,7% успешных атак), самая защищённая — GPT-4o-mini (0,5%).
  • Уязвимые модели могут генерировать вредоносный код и раскрывать системные промпты.
  • OpenAI и AWS Bedrock блокируют использование assistant prefill для ассистента, что надёжно защищает от такой атаки.
  • Google Vertex AI и другие платформы частично допускают использование assistant prefill, полагаясь на защиту модели.

Как работает техника sockpuppeting

Техника базируется на функции assistant prefill, которая позволяет разработчикам заранее задать начало ответа модели. В легитимных сценариях это используется для управления стилем и форматом ответов. Однако злоумышленники вставляют в этот параметр фразу, создающую иллюзию согласия ассистента выполнить опасный запрос, например: «Sure, here is how to do it». Современные LLM, стремясь сохранить внутреннюю логику ответа, продолжают генерировать контент, который обычно запрещён, вместо отказа.

Рекомендации по защите и последствия атак

Trend Micro призывает команды безопасности тщательно контролировать порядок сообщений в API, особенно не допускать прямой передачи сообщений с ролью ассистента от пользователей. Для платформ, работающих на собственных серверах (Ollama, vLLM), это особенно актуально, так как проверка сообщений зачастую менее строгая.

Исследователи рекомендуют включать проверки на подобные атаки в программы AI red teaming, чтобы своевременно находить и устранять уязвимости до возникновения реальных инцидентов. Надёжной защитой считается блокировка assistant prefill для роли ассистента, что реализовано в OpenAI и AWS Bedrock.

  1. Техника sockpuppeting выявлена исследователями Trend Micro.
  2. Уязвимость связана с функцией assistant prefill в API языковых моделей.
  3. Проведены тесты на 11 LLM: Gemini 2.5 Flash — самая уязвимая, GPT-4o-mini — самая устойчивая.
  4. Опасные запросы маскируются под безобидные задачи по форматированию.
  5. Рекомендации: проверять порядок сообщений, внедрять red teaming, блокировать assistant prefill для ассистента.

г. Москва,
Перервинский бульвар, д. 5, к. 1
Справочная служба:
(495) 654-96-77
Вызов врача на дом:
(495) 658-52-90
Задать вопрос врачу
Поликлиника | Регистратура | Отделения и кабинеты | Населению | Вопрос врачу | Справочная информация | Интернет ресурсы | Контакты | Поиск по сайту | Карта сайта