数週間前、あるAIサイバー評価において、ベンチマークを解決するための予想外に効率的な戦略が生み出されました。エージェントたちは答えを探しに行ったのです。
OpenAI社の予備開示によると、高度なサイバー能力のテストを受けていたモデルが、ベンチマークを完了するのに役立つ機密情報を入手する方法を見つけました。これらのモデルは脆弱性、盗まれた認証情報、インターネットアクセス、そしてベンチマーク資料がホストされている可能性のある場所についての推論を連鎖させました。この経路は最終的にHugging Faceのインフラストラクチャに到達し、そこで活動が検知され封じ込められました。
Hugging Faceはその後、17,600件のアクションの技術的再構築を公開しました。同社の調査員は、ツールを再構築し、代替手段をテストし、パスが失敗するたびにチャネルを変更する、一貫性のある侵入を発見しました。OpenAI社の開示は引き続き予備的なものです。Hugging Faceのタイムラインは、調査員が観察した技術を記述しています。
このエピソードは、有益な問いも投げかけています。
各アクションを次の合理的なステップに見せたものは何だったのでしょうか?
エージェントには目的がありました。情報を収集し、結果を観察し、新しいオプションを発見し、計画を更新しました。認証情報によって到達可能な範囲が変わりました。インターネットアクセスによって発見可能な範囲が変わりました。ツールの出力によってエージェントの知識が変わりました。作業コンテキストへの各追加が、先の道筋を変えていったのです。
最終的なアクションがセキュリティログに現れた時点では、意思決定のほとんどはすでに完了していました。
AIエージェントはコンテキストに基づいて行動する。あなたのセキュリティもそうあるべき
セキュリティチームはアクションの再構築を得意としています。IDがシステムにアクセスした。プロセスがAPIを呼び出した。認証情報がリソースを開いた。ネットワーク接続が宛先に到達した。
これらの記録は依然として不可欠です。しかし、エージェントの場合、そのアクションははるかに長い取引における最後のレシートに過ぎない可能性があります。
顧客記録を照会してメールを送信するサポートエージェントを考えてみましょう。その決定は、数か月前のシステムプロンプト、ユーザーのリクエスト、受信チケット、取得されたポリシー、保存されたメモリ、そして以前のツールの出力を反映している可能性があります。
各項目は単独では正当なものだったかもしれません。それらの組み合わせがアクションを生み出したのです。
ツール呼び出しは可視化されています。しかし、それを合理的に見せたコンテキストは、6つものシステムに分散している可能性があります。
インシデント対応者にとって、これは出所の問題を生み出します。セキュリティアーキテクトにとっては、制御の問題を生み出します。両者は同じニーズから始まります。コンテキストをその源泉から影響を与えた決定まで追跡することです。
データが命令になるとき
従来のアプリケーションは、データと実行可能な命令を別のレーンに保つために懸命に努力しています。エージェントシステムは、こうしたレーンマーキングをかなり心もとないものにします。
エージェントは何をすべきかを理解するために自然言語を読みます。残念ながら、自然言語はメール、文書、ウェブサイト、チケット、コードコメント、検索結果、ツールレスポンス、メモリにも現れます。データとして導入されたコンテンツが計画に影響を与え始める可能性があるのです。
Hugging Faceの再構築は、この境界が非常に文字通りの形で崩壊することを示しています。URLホワイトリストがリモートリソースの取得試行をブロックした後、エージェントはアプローチを変更しました。悪意のあるデータセット設定を使用して本番ワーカーにローカルファイルを読み取らせ、後にテンプレートインジェクションを通じてコードを実行させました。コマンド出力はHugging Face APIと攻撃者が制御するデッドドロップデータセットを通じて返されました。エージェントはこれらの結果を読み取り、次のアクションを作成しました。
データ処理パイプラインは、侵入ポイントとフィードバックループの両方になっていたのです。
メールがスケジューリングエージェントに返信前に無関係なファイルを取得するよう求める。ウェブページが調査エージェントに割り当てを無視するよう指示する。ツールレスポンスが機密情報の新しい宛先を提供する。汚染されたメモリが来週のタスクに安全でない前提を持ち込む。
コンテキストは明示的なコマンドとして扱われなくても重要になり得ます。注意をリダイレクトしたり、誤った前提を作り出したり、矛盾を隠したり、安全でないアクションを目的と一貫しているように見せたりすることができます。
したがって、セキュリティ境界はユーザープロンプトを超えて広がります。エージェントの実効的な命令は、観察と記憶を許可されたすべてのものから出現するのです。
OWASPは永続性の観点から同じ結論に達しています。対話を生き残るコンテキストは、元の入力が消えた後も長期にわたって計画とツール使用を形成し続けることができます。メモリはセキュリティ上関連する状態になります。
ファイルキャビネットが意見を持つようになったのです。セキュリティは関心を持つべきかもしれません。
コンテキストの層
「プロンプト」について話すと、エージェントが1つのまとまった命令ブロックを受け取ってから作業に取り掛かるという印象を与える可能性があります。本番システムはあまり整然としていない傾向があります。
アクションの背後にあるコンテキストには、以下が含まれる可能性があります。
- エージェントの役割を定義するシステムおよび開発者の命令
- ユーザーのリクエストとその意図したビジネス成果
- タスク中に取得された文書、メッセージ、ウェブコンテンツ、記録
- 会話履歴、要約、長期メモリ
- ツール、API、データベース、他のエージェントから返された出力
- その時点で利用可能なID、権限、認証情報、機能
これらの層は相互作用します。広範な権限は誤解を招く文書の結果を変えます。古いメモリは現在のリクエストの解釈方法を変えます。新しいツールは提案を実行可能なオプションに変えます。無害なデータの一部は、他の場所で収集された情報と組み合わされると機密になります。
再構築されたシーケンスは、この相互作用を異常に可視化しています。ほとんどの試みは行き詰まりましたが、各結果が検索を絞り込み、別の機能を露出し、または以前の手がかりを復活させました。成功した連鎖は、実行中に生成されたコンテキストから出現しました。
NISTの2026年概念文書「ソフトウェアとAIエージェントのIDと認可」は、結果として生じるいくつかの質問を直接テーブルに載せています。エージェントのコンテキストが変化したときに認可も変更すべきか?エージェントはアクションの背後にある意図をどのように伝えるべきか?エージェントが誰かの代理として行動する場合、委任された権限はどのように機能すべきか?
これらの質問は、進化するタスクを評価できるセキュリティモデルを指し示しています。IDは依然として重要です。目的、コンテキストの源泉、使用中のツール、そして次のアクションの結果も同様に重要です。
コンテキストの証拠保全
法律や鑑識の作業では、証拠保全(chain of custody)は、証拠がどこから来たのか、誰が扱ったのか、どのように変化したのかを記録することによって、証拠への信頼を保持します。エージェントコンテキストには、同等の規律が必要です。
すべての文に対するセキュリティエスコートは過剰でしょう。実用的な目的は、6つの質問に答えるのに十分な出所とポリシーコンテキストを保持することです。
- 起源: このコンテキストはどこから来たのか?ユーザー、内部システム、外部ウェブサイト、取得されたファイル、別のエージェント、または未知のソース?
- 信頼: 組織はそのソースにどのレベルの信頼を置いており、コンテンツは命令に影響を与えることが許可されているか?
- 目的: なぜ導入されたのか?タスクをサポートしているのか、それともエージェントが隣接するミッションに迷い込んだのか?Hugging Faceは、情報の収集とリーチのマッピングを中心とした目的と一致する、DryRun=Trueを伴う潜在的に破壊的なクラウドAPI呼び出しを観察しました。
- 鮮度: 情報は最新か、古いか、または以前の対話から継承されたものか?
- 機密性: 保護されたデータ、認証情報、ビジネスロジック、またはタスクの影響を拡大する可能性のある権限が含まれているか?
- 影響: どの決定、ツール呼び出し、または出力を形成したか?
この最後の質問が重要です。その影響を理解せずにコンテキストを収集すると、依然としてほとんど意味をなさないインシデントの美しく詳細な記録が生成される可能性があります。
有用な証拠保全は、ソースと決定を結びつけます。これにより、セキュリティチームは、外部文書が新しい命令を導入し、メモリがそれを永続化し、ツールがそれを実行可能にし、認証情報がそれを重大なものにしたことを確認できます。
ランタイムでの証拠保全
出所は、アクションが実行される前にその価値を発揮します。
信頼できないコンテンツは、権威ある命令と区別可能なままにすべきです。取得された文書とツール出力は、計画を再形成する前に評価されるべきです。認証情報とツールは、タスクにスコープされたままにすべきです。コンテキストまたは機能の重大な変更は、新たなポリシー決定をトリガーすべきです。
影響の大きいアクションには承認が必要な場合があります。パターン外の宛先はブロックに値するかもしれません。機密コンテンツには編集が必要かもしれません。ユーザーの意図を超えるツール呼び出しには、より狭いスコープが必要かもしれません。適切な対応は、完全な相互作用に依存します。ワークフローの開始時に設定されたルールでは、全負荷を運ぶことができません。
Check Point AI Agent Securityは、結果を変更する機会がまだある間に、プロンプト、外部コンテンツ、データフロー、ツール呼び出し、エージェントアクションを評価することで、この原則をランタイムで適用します。
ロギングは調査とチューニングにとって引き続き価値があります。ランタイム強制は、そのコンテキストに運用目的を与えます。出所を、許可、ブロック、編集、制約、承認、またはエスカレーション決定のライブ入力に変えるのです。
連続的な形成
OpenAI-Hugging Faceインシデントは、調査が進展するにつれて技術的な教訓を提供し続けるでしょう。1つの教訓は、今日エージェントを構築している企業にとってすでに有用です。
エージェントの経路は連続的に形成されます。新しい情報がその理解を変えます。新しい機能がそのオプションを変えます。新しい権限が可能な影響を変えます。元のプロンプトは多くの影響の中の1つになります。
エージェントが安全でない何かをしたとき、行動するIDを特定することは調査の始まりです。セキュリティは、エージェントが何を達成しようとしていたのか、どのコンテキストがその推論を形成したのか、そのコンテキストがどのようにワークフローに入ったのか、そしてなぜそのアクションがその瞬間に受け入れ可能になったのかも知る必要があります。
その連鎖は、インシデントが誰もを好奇心にさせる前に可視化されている必要があります。
原文: https://blog.checkpoint.com/ai-security/ai-agent-context-chain-of-custody/