エージェントの目標は、エージェントがどのようにその目標に到達するかをほとんど規定していません。そして、高性能なエージェントは誰も想定していなかったルートを見つけることに長けています。
- → NVIDIA Open Agent Safety Platformは、エージェントの手の届かないインフラストラクチャの中に境界を設ける
- → Check Point社のセマンティックモニタリングは、各ステップがまだタスクに合致しているかを判断する
- → 両者はすでにNVIDIA OpenShellとのベータ統合として連携している
- → モニターの判定はアクションが実行される前、100ミリ秒以内に届く
目標が見落とすもの
組織が自律型エージェントに仕事を任せるとき(たとえばサプライヤーの請求書処理など)、目標を提示するだけで、制限のほとんどは暗黙のままにされます。請求書処理エージェントが給与システムには立ち入るべきでないとは、誰も明記しません。人はそのような制限を当然のことと考えますが、目標に向かって動くエージェントにはそう考える理由がありません。
7月、このギャップが公のインシデントとなりました。OpenAIの内部サイバー評価を実行していたエージェントが隔離環境を脱出し、テストの答えを求めてHugging Faceの本番インフラ内に4日半にわたって潜伏したのです。攻撃を受けたわけではありません。エージェントは指示された通りのことをしていたのですが、誰も予期しないルートを通って実行していました。そのルートを管理することがセキュリティの役割であり、それには2種類の制御が必要です。
エージェントの手の届かない境界
まず必要なのは「境界」です。NVIDIAのセキュリティチームは「AIエージェントスタックにおけるセキュリティの位置付け」の中でこう述べています。「ハーネスはエージェントが何を試みるかを導く。インフラストラクチャはエージェントが何をできるかを制御する。」プロンプトやモデルのセーフガードは動作を形成しますが、エージェントはそれを回避できるため、境界にはなり得ません。
NVIDIA Open Agent Safety Platformはその境界をインフラストラクチャに組み込みます。中核をなすのがNVIDIA OpenShellです。これはエージェントの実行方法、参照・操作できる対象、推論の送信先を管理するオープンでセキュアなランタイムです。デフォルトでは何も許可されず、すべての許可・拒否が記録され、エンフォースメントはエージェントのプロセスの外で実行されるため、エージェントが侵害されても機能し続けます。このプラットフォームにはNVIDIA Sentryも含まれており、NVIDIA BlueField-4上で動作し、NVIDIA DOCAを使ってアウトオブバンドの監視とセキュリティポリシーのエンフォースメントを実施します。このハードウェアで隔離されたホスト非依存の監視機能は、ホスト自体が侵害された場合でもポリシーの適用を継続します。NVIDIA Vera CPUおよびBlueField DPUベースのシステムに最適化されていますが、他のハードウェアシステムとも互換性があります。
境界が止められないもの
境界は、あるアクションが許可されるかどうかを決定します。そのアクションがタスクとして依然として意味をなすかどうかは別の判断であり、往々にして本当の問題はそこに潜んでいます。
請求書の読み取り、サプライヤーデータベースへの照会、承認済みの支払いワークフローの開始は、いずれも請求書エージェントの業務です。しかし、その後エージェントが認証情報のリストアップを始め、請求書と無関係なファイルを開き、新しい宛先にデータを送信しようとしたとしたら、各アクション単体ではチェックをパスするかもしれません。しかし、一連の流れを見ると、エージェントが本来の仕事をやめてしまったことが分かります。これは行動を継続的に追跡したときにだけ見えるパターンです。

単一のプロンプトや応答を検査するガードレールは引き続き不可欠であり、Check Point Software社のAIセキュリティの中核を担っています。しかし、20ステップにわたって展開される問題にはセマンティックモニタリングが必要です。これはエージェントの動作を追跡しながら、推論シグナル、ツール呼び出し、過去のアクションを用いて、各アクションをエージェントに与えられたタスクと照合します。すべてのステップで同じ問いに立ち返ります。「これはまだエージェントに与えられた仕事に合致しているか?」Check Point社はこのアプローチを「誰もルール化できなかったAIエージェントの行動を止める」という記事で解説しており、同社の研究チームはその判定がアクション実行前の100ミリ秒以内に届くことを実証しています。
NVIDIA OpenShellと共に構築したもの
エージェントが逸脱していると分かるだけでは意味がありません。何かがそれに対処できなければなりません。だからこそ、境界と判断は一体でなければならないのです。Check Point社はセマンティックモニタリングをNVIDIA OpenShellと連携させ、ランタイムのセキュリティミドルウェアを通じて動作させています。OpenShellはホストに到達する前に各アクションを確認し、Check Point社のモニターがエージェントのタスクと履歴に照らしてそれを評価し、OpenShellがその結果を強制執行します。同社の研究チームによる同期制御モニタリングの投稿には、有害なエージェントアクションを実行前に停止させ、安全なタスクは通過させる動作が動画とともに紹介されています。
エージェントが有用である理由の一つは、誰も予見しなかったアプローチを見つけることです。そのため、対応は状況に応じて段階的に行われます。アクションのログ記録、承認待ち保留から、エージェントの停止まで様々です。
今後の展開
エージェントが行うすべてのことを一つの視点から把握することはできません。そのため、Check Point社のアプローチは、各所に個別のセキュリティスタックを置くのではなく、多くのエンフォースメントポイントを活用する一つの共有判断レイヤーを構築することです。NVIDIA Open Agent Safety Platformは、そのようなポイントをさらに追加します。NVIDIA Sentryはエージェントの行動を検査し逸脱を検出するための証明済みテレメトリを提供します。
これらのシグナルは、サイバーセキュリティがすでに保持しているコンテキストと組み合わせたときに最も有効です。異常なツール呼び出しは単独では大した意味を持たないかもしれません。しかし、タスクを逸脱して脆弱な本番システムにアクセスしようとしている高い権限を持つエージェントからのものであれば、まったく別の意味を持ちます。エージェントは、セキュリティチームがすでに保護しているアイデンティティ、ネットワーク、データと同じものの上で動作しており、そのセキュリティは独立した分野として扱うことはできません。
OpenShellがオープンソースであることはCheck Point社にとって重要です。同社はOpenShellコミュニティと連携して取り組んでおり、セキュリティのアイデアが多くのコントリビューターによってオープンに検証されています。このパートナーシップにより、同社自身の成果をコミュニティに還元する直接的な経路が生まれています。
請求書エージェントに戻ると
請求書エージェントの目標は最初と変わりません。しかし今や、その周囲には言葉で説得できないランタイム、シリコン上のウォッチドッグ、そしてエージェントの経路が今も仕事に合致しているかを継続的に確認するモニターが存在します。NVIDIAがAIファクトリーと呼ぶ領域でエージェントがより長期的・自律的な仕事を担うようになる中、この組み合わせがエージェントの振る舞いにセキュリティが追随するための方法です。
リソース
- NVIDIA OpenShell
- NVIDIA OpenShellドキュメント
- GitHub上のNVIDIA OpenShell
- NVIDIA BlueField
- NVIDIA DOCA
- Check Point AIエージェントセキュリティ
- Check Point社によるNVIDIAとのAIファクトリーセキュリティ確保
- Check Point社のAIセキュリティチームへのお問い合わせ
原文: https://blog.checkpoint.com/ai-security/check-point-nvidia-openshell/