【Check Point公式ブログ】同期型制御モニタリング:AIエージェントの有害な動作をリアルタイムで防ぐ

Check Point社は、同期型制御モニタリング(Synchronous Control Monitoring)を活用し、エージェントの整合性と制御を確保しています。同社のモデルはエージェントの実行を監視し、トレースをコンテキストとして継続的に取り込み、100ミリ秒未満のレイテンシで有害なアクションが実行される前にリアルタイムで防止します。

同期型制御モニタリング:AIエージェントの有害な動作をリアルタイムで防ぐ - Check Point Blog

制御モニタリングの必要性

制御モニタリング(Control Monitoring)は、自律型エージェントの実行時における整合性と安全性を確保するための強力なツールです。Hugging Faceのインシデント以降、既存の安全機構に加えた制御モニタリングの必要性が再認識され、OpenAIもモニタリング安全ツールへの投資を強化しました。非同期型制御モニタリングは、実行中に不整合を検出してセッションを一時停止する手法として一般的に利用されています。

しかし、非同期モニタリング手法には大きな欠点があります。有害なアクションがフラグを立てられる頃には、すでに実行済みになっているという点です。破壊的なアクションや情報漏洩につながるアクションが発生した場合、その被害は取り返しがつきません。たとえば認証情報が漏洩した場合、該当のクレデンシャルのローテーションや第三者への通知が必要になります。

Check Point社のアプローチ:サイドカー型のリアルタイム監視

Check Point社のモニタリングアプローチはさらに一歩進んでいます。同社のモニタリングモデルはサイドカーとして動作し、有害なアクションが実行される前にリアルタイムで防止します。サイドカーはトレースの一部をコンテキストとして取り込み、不整合や有害性を同期的に(事後フラグではなく)遮断します。また、有害性が検出された際にエージェントを適切に誘導することで、自律型エージェントのより安全かつ広範な展開を可能にし、モデルの能力スケールを加速させます。

従来型セーフガードの限界

従来型のセーフガード(分類器やプローブなど)はコンテキストを持ちません。各アクションは単独で判断されるため、複数のステップにまたがる有害な動作を検出できません。

例えば、変数LOGに保存された本番ログにデータベースのパスワードが含まれているとします。エージェントが「$LOGを参照するGitHub Issueを作成する」ツール呼び出しを実行しようとした場合、従来のセーフガードはLOG変数にパスワードが含まれているというコンテキストを持たないため、構造的にこの有害な動作を検出することが不可能です。

制御モニタリングの仕組み

制御モニタリングモデルはトレースをコンテキストとして取り込みます。このコンテキストは実行トレースの一部から構成されており、過去のステップから得た情報を組み合わせて判断を下すことができます。先ほどの例では、制御モニタリングモデルがLOGにデータベースのパスワードが含まれることを認識し、$LOGをGitHubに投稿するツール呼び出しがクレデンシャルを漏洩させることを正確に検出・拒否します。

処理は次の2つのフェーズに分かれています:

  • コンテキスト蓄積(非同期・高コスト):エージェントの実行中、モニターはエージェントのトレースを非同期でコンテキストに蓄積し続けます。トレースはエージェントのハーネスからモニターモデルへ継続的にストリーミングされます。
  • ツール呼び出し分類(同期・低コスト):各ツール呼び出しが実行される前に、モニターモデルによる分類がブロッキングモードで行われます。分類時のコンテキストには過去のすべてのターンが含まれており、複数のステップにまたがる高度にコンテキスト依存した有害動作も検出可能です。

100ミリ秒未満のレイテンシを実現

分類のレイテンシは実行の長さに関わらず100ミリ秒未満です。高コストなコンテキスト蓄積はエージェントの実行中に先行して行われるため、ツール呼び出し分類の時点ではほぼすべての計算が完了しています。徹底的に最適化された推論スタックと組み合わせることで、高パラメータのモニタリングモデルをツール呼び出しごとに100ミリ秒未満のレイテンシでリアルタイム提供することが可能になりました。

パフォーマンスと安全性の評価

Check Point社はDecodingTrustレッドチームフレームワーク上での攻撃成功率(ASR)に対するモニターの効果を測定しました。モニターモデルを安全ツールとして使用することで、エージェントとドメインをまたいでASRをおよそ1桁(約10分の1)削減できることが示されており、フロンティアモデルの組み込みセーフガードに加えた追加的な安全性を提供します。

良性のエージェント実行における誤検知率は1アクションあたり0.048%で測定されました。本番環境では、拒否はエージェントの実行を中断せず、エージェントは誘導されて実行を継続できるため、誤検知はリカバリー可能です。SWE-bench Lite(Claude 3.5 Sonnet)での評価では、モニターの追加によるエンドツーエンドのタスク時間のオーバーヘッドは0.2〜0.6%でした。

今後の展開

Check Point社の同期型モニタリングアプローチは、あらゆる自律型エージェントの標準的なデプロイにおけるセーフティツールの一部となるべきものです。このアプローチは、Check Point社のAIセキュリティ製品の一部として、エージェント全体にわたる実行制御を一元管理する標準的なランタイム整合性メカニズムとして展開されています。モニターは任意のエージェントハーネスにアタッチでき、メタ情報(ID情報やランタイム情報など)を付加することで制御の再現率をさらに向上させることができます。


本記事は Check Point Software Technologies Ltd. の公式ブログ記事を、同社の許諾のもと日本語に翻訳・掲載したものです。
原文: https://blog.checkpoint.com/ai-security/synchronous-control-monitoring-preventing-harmful-agent-actions-in-real-time/