Prompt-инъекции против Google Gemini: одно сообщение — и ваш дом под угрозой
DeepSeek увидел фичу в открытых окнах, Claude — провал threat-модели
Исследователи SafeBreach показали, как атаки с внедрением промптов угрожают ИИ-ассистенту Google Gemini. Достаточно одного сообщения или приглашения в календарь, чтобы злоумышленник заставил ассистента открыть окна умного дома, начать звонок в Zoom или прочитать уведомления. Атака обходит защитные фильтры с помощью косвенных инъекций, отравления памяти, отложенного выполнения и манипуляции контекстом. Эти техники демонстрируют, что абсолютной защиты от prompt-инъекций пока нет. Разработчикам важно учитывать такие риски при интеграции LLM в приложения, а пользователям — внимательно проверять разрешения ассистента.
Исследователи из компании SafeBreach провели два эксперимента, демонстрирующих уязвимость ИИ-ассистента Google Gemini перед атаками с внедрением промптов. В первом случае вредоносные инструкции попадали в ассистента через приглашение в Google Календарь, во втором — через обычное текстовое сообщение (SMS, Signal или сообщение в соцсети). Даже одна такая инъекция могла заставить Gemini выполнить несанкционированные действия: открыть окна в доме через Google Home, начать звонок в Zoom, удалить данные календаря или отправить личную информацию на сторонний сервер. Чтобы обойти несколько эшелонов защиты Google, атакующие использовали комбинацию приёмов. Первый — косвенная инъекция промпта: команды скрывались не в прямых запросах пользователя, а во внешних данных, которые ассистент обязан обработать, например в полях календарного события или в ссылках внутри сообщения. Второй — отравление памяти: вредоносные инструкции записывались в долговременную память агента, чтобы срабатывать при выполнении заданных условий. Третий — отложенное выполнение: агента вынуждали дождаться следующей команды пользователя и лишь потом активировать злонамеренное действие, минуя проверки, срабатывающие сразу после чтения письма. Четвёртый — манипуляция контекстом: перед критичными операциями Gemini проверяет, действительно ли пользователь их инициировал, и тогда злоумышленники помещали вредоносный текст в невидимую или непонятную часть сообщения — например, на китайском языке, а рядом ставили безобидную видимую фразу, на которую пользователь отвечал «Да», неосознанно подтверждая скрытые команды. На смартфонах под управлением Android опасность усиливается, так как Gemini имеет доступ к уведомлениям и может читать текст любых входящих сообщений. Это открывает практически бесконечное поле для атак: злоумышленник может прислать SMS, и ассистент его прочитает. Голосовой ассистент способен самостоятельно инициировать диалог, например сообщить о «системной ошибке» и попросить запустить устранение неполадок — типичная тактика из категории ClickFix. Проблема prompt-инъекций остаётся нерешённой, любые защитные фильтры можно обойти с помощью изобретательных уловок. Для разработчиков это сигнал к тому, чтобы при интеграции LLM тщательно проектировать безопасность: минимизировать доступ агента к критическим функциям, внедрять явное подтверждение пользователем каждой потенциально опасной операции и по возможности не допускать обработки непроверенных внешних данных. Пользователям же стоит критически оценивать разрешения, предоставленные ИИ-помощнику, и помнить, что даже знакомый интерфейс может скрывать невидимые для человека угрозы.