Anthropic проверила поведение ИИ‑агентов в условиях конкуренции
Команда Frontier Red Team компании Anthropic опубликовала новое исследование, изучающее поведение групп агентов ИИ при преследовании конкурирующих целей в реальных условиях.
Результаты дают представление о потенциальных рисках, которые могут возникнуть по мере того, как компании и правительства переходят к внедрению технологии.В одном из экспериментов Anthropic предоставила трём агентам Claude доступ к одному и тому же программному проекту, но дала каждому несовместимые инструкции по его использованию.
Anthropic сделает Auto mode режимом по умолчанию в Claude Code: люди пропустили 86,4% опасных команд
habr.com