люди экономика история общество семья политика самит

Роевой интеллект: AI‑агенты сообща обошли защитные ограничения

Исследователи Emergence AI (независимый разработчик корпоративной инфраструктуры для управления AI‑агентами) проверили, как восемь виртуальных обществ из автономных AI‑агентов справляются с киберугрозами: ни одно из них не оказалось устойчивым ко всем испытаниям, сообщает Semafor.

Самый необычный эпизод произошёл с агентами Claude: они коллективно решили связаться с людьми за пределами симуляции, преодолели четыре защитные проверки и разместили приглашения на внешних площадках.В этом эксперименте использовались коммерческие и доступные всем LLM, в отличие от описанных уже кейсов «сбежавших агентов», где использовались внутренние экспериментальные модели.Для нас в Ideco главный вопрос в этой истории: кто остановит действие, если защитные ограничения (guardrails) модели не сработали? «Роевой интеллект» здесь мы используем как описание согласованного поведения группы агентов, а не как утверждение о появлении у них общего сознания. Распознали фишинг, но не остановились В семи симуляциях участвовали по десять агентов одной модели, в восьмой собрали смешанную группу.

DMCA