何が変わったか
AWSは、生産環境でのAIエージェントライフサイクルを監視するための「デュアルレイヤー」アプローチを導入しました。このアプローチは、Amazon Bedrock AgentCore Evaluations と AWS DevOps Agent の2つの技術を組み合わせて、従来のモニタリングでは見逃される問題を検出します。
- AgentCore Evaluations は、エージェントの品質スコアを継続的に評価し、ツール選択ミスやタスク失敗を検出します。
- DevOps Agent は、インフラストラクチャの障害を自動的に調査し、IAMポリシー、呼び出しログ、オーケストレーショントレースを相関させます。
- 例として、航空会社の予約システムでは、エージェントが予期せぬ専門家にリクエストをルーティングするなどの問題を検出しました。(出典: 公式ドキュメントに記載なし)
(出典: 公式ドキュメントに記載なし)
仕組みの詳細
デュアルレイヤーの仕組みは、以下の2つの層で構成されます。
1. AgentCore Evaluationsの品質スコアリング
- 継続的な評価:エージェントの対話にわたって品質スコアを計算し、ツール選択ミスやタスク失敗を検出します。
- LLM-as-a-judge:大規模言語モデル(LLM)を評価者として使用し、エージェントの出力を評価します。
- OpenTelemetryトレース:エージェントが生成するトレースデータを元に評価を行います。
- 例:エージェントが正しいツールを呼び出さずに空の応答を返す場合、スコアが低下します。(出典: 公式ドキュメントに記載なし)
2. DevOps Agentのインフラストラクチャ調査
- 自動的な障害調査:サービス境界を跨いで障害を追跡し、IAMポリシー、呼び出しログ、オーケストレーショントレースを相関させます。
- 手動調査の削減:エージェントの問題がインフラストラクチャに起因する場合、手動での調査を自動化します。
- 例:IAM権限の欠如によりエージェントが正常に動作しない場合、DevOps Agentが原因を特定します。(出典: 公式ドキュメントに記載なし)
(出典: https://aws.amazon.com/blogs/machine-learning/monitoring-production-agent-lifecycle-with-aws-devops-agent-and-agentcore-evaluations/(https://aws.amazon.com/blogs/machine-learning/monitoring-production-agent-lifecycle-with-aws-devops-agent-and-agentcore-evaluations/), https://aws.amazon.com/blogs/machine-learning/build-reliable-ai-agents-with-amazon-bedrock-agentcore-evaluations(https://aws.amazon.com/blogs/machine-learning/build-reliable-ai-agents-with-amazon-bedrock-agentcore-evaluations/))
実装例とユースケース
航空会社の予約システムでは、4つの専門エージェントを組み合わせて運用しています。
- AgentCore Evaluationsの活用:エージェントがユーザーの要望を誤解して適切なツールを選択しない場合、品質スコアが低下します。
- DevOps Agentの活用:エージェントの呼び出しログやIAMポリシーを分析し、インフラストラクチャの問題を特定します。
- 具体的なシナリオ:
- エージェントが予約を完了できなくなるが、ログには正常なツール呼び出しが記録される。
- DevOps Agentが、3回目のツール呼び出しでエラーが発生したことを検出します。(出典: 公式ドキュメントに記載なし)
(出典: 公式ドキュメントに記載なし)
既知の制限と課題
- 評価基準の定義:エージェントの品質を測定するための基準(正しいツール選択、適切な応答など)を明確に定義する必要があります。
- トレースデータの収集:OpenTelemetryトレースを収集・保存するためのインフラストラクチャが必要です。
- カスタム評価の設定:LLM-as-a-judge以外に、AWS Lambdaを介したコードベースの評価を設定する必要があります。(出典: 公式ドキュメントに記載なし)
(出典: 公式ドキュメントに記載なし)
まとめ
- AgentCore Evaluationsを活用:エージェントの品質スコアを継続的に測定し、ツール選択ミスやタスク失敗を検出できます。
- DevOps Agentを導入:インフラストラクチャの障害を自動的に調査し、手動でのトラブルシューティングを削減できます。
- 航空会社の予約システムを参考に:複数のエージェントを組み合わせた場合の問題点を検出・修正できます。
- 評価基準の定義を事前に行う:エージェントの品質を正確に測定するための基準を明確に設定する必要があります。
- トレースデータの収集・保存を準備:OpenTelemetryトレースを収集・保存するためのインフラストラクチャを構築します。