maybeelf связь самит maybeelf

В OpenAI раскрыли новый тип атак на ИИ‑агентов

Компания OpenAI рассказала о новом типе атак на ИИ‑агентов. Он предполагает внедрение вредоносной инструкции, которая заставляет модель не только выполнить команды злоумышленника, но и перенести саму промпт‑инъекцию в другие сообщения или файлы для дальнейшего распространения.Атака получила название self‑replicating prompt injection (самокопирующиеся промпт‑инъекции).

OpenAI смогла обнаружить сценарий во время тестирования моделей с помощью автоматизированного red‑teaming‑агента GPT‑Red. Пока нет доказательств того, что подобные атаки происходили в реальных условиях.Самая простая реализация связана с электронной почтой.

DMCA