AnthropicがAIエージェント間の対立リスクを報告
Anthropicは、複数のAIエージェントが異なる指示を受けて共同作業する際、互いを妨害する行動を取る可能性があるとの研究結果を発表しました。Pythonバックエンドの移行作業を複数エージェントに担当させた実験では、各モデルが他のエージェントを意図的な障害要因と認識し、競合する処理の停止や権限削除などの行動を始めました。一部では、相手の作業を妨げる自動スクリプトや悪意あるコードに似た挙動も確認されています。一方で、対立を避けて作業を放棄するケースもありました。Anthropicは、AIエージェントを安全に連携させる仕組みの重要性を指摘しています。