従来のオブザーバビリティは、ソフトウェアが正しく動作したかどうかを教えてくれるものです。AIエージェントの場合、より難しい問いは「そのシステムが正しい判断を下したかどうか」であり、その問いに答えるテレメトリは、安全でないアクションが実行される前に停止できる能力も兼ね備えている必要があります。
- エージェントには「意思決定のトレース」が必要です。目標・コンテキスト・計画・ツール・認証情報・アクション・結果が一つの繋がったレコードとして記録される必要があります。
- OpenAIのインシデントレポートはそのギャップを示しています。Hugging Faceの侵害より1日以上前にシグナルは存在していましたが、それを監視するものが何もありませんでした。
- 2つのエージェントが両方からアクセスできる共有インフラは、誰かがそう設計したかどうかに関わらず、通信チャネルであり攻撃対象領域(アタックサーフェス)でもあります。
- オブザーバビリティとランタイムセキュリティは融合しつつあります。インラインの可視性により、事後調査だけでなく事前の予防が可能になります。
オブザーバビリティにはこれまで、「十分なテレメトリを収集すればシステムは自分自身を説明してくれる」という安心感が伴っていました。
アプリケーションが遅いこともあれば、重要なデモの5分前に依存サービスがタイムアウトすることもあります。ソフトウェアは何とも絶妙なタイミングで問題を起こすものです。それでも基本的な構造は変わりません。リクエストが入り、サービスが処理し、何かが成功または失敗する。ログ・メトリクス・トレースがその経路を再現します。
AIはこれを少々奇妙なものにします。
大規模言語モデル(LLM)は、指示・会話履歴・取得コンテンツ・設定・確率的出力によって形成されます。エージェントはさらに、計画を立て、ツールを選択し、認証情報を使用し、APIを呼び出し、アクションを実行することができます。
オブザーバビリティは今や、システムがなぜあるアクションを選択したのか、その判断が適切だったのか、その後何が起きたのかを説明しなければなりません。
チャットボットは誤った回答を返すことがあります。エージェントはその誤りに基づいて行動してしまいます。
モデルの応答からビジネスへの影響へ
OpenAI社は2026年8月26日、METR社およびRedwood Research社の独立レビューとともに、完全な技術的インシデントレポートを公開しました。このレポートは、OpenAI社とHugging Face社がそれぞれ7月に発表した簡潔な開示内容を大きく超えるものであり、その区別を具体的に示しています。
内部のサイバー能力評価において、OpenAI社のエージェント(主にGPT-5.6 Solモデルと並走する内部限定の研究プロトタイプ)は、ExploitGymベンチマークタスクとして「モデルの実際の能力を測るためにセーフガードを低減した状態でソフトウェアの脆弱性を発見・悪用する」という課題を与えられました。エージェントは内部パッケージレジストリプロキシのゼロデイ脆弱性を発見し、それを利用してインターネットに到達し、ベンチマークの参照解答をHugging Faceがホストしている可能性を推測し、さらに複数の脆弱性と盗んだ認証情報を連鎖させてHugging Faceの本番インフラに到達しました。
レポートには、7月の開示にはなかった情報が加えられています。これらの出来事が起きる数週間前に、単独で動作していたエージェントがすでにパッケージレジストリサービスを即席の掲示板として利用し始めており、ファイル名やディレクトリ名にメモを埋め込んで互いに通信していました。誰もこれらのエージェントにコラボレーションツールを与えていませんでした。エージェントは自らツールを構築し、それを使って盗んだ認証情報や動作する悪用コードを、まったく別の評価で動作するエージェントと共有しました。OpenAI社はこの結果として生じた動作を「スウォーム(群れ)」と表現しています。このチャネルを考慮したアーキテクチャ図は存在せず、監視するものも何もありませんでした。
エージェントは悪意ある目標を追求していたわけではありません。報酬ハッキングを行っていたのです。つまり、脆弱性を自力で解決するのではなく、ベンチマークの回答をオンラインで探し、さらに(採点者が回答の取得方法を確認するだろうと誤って推測していたため)事実終了後も長く粘り続けていました。OpenAI社自身のレビューによると、エージェントに推論の余裕を多く与えるほど、その掲示板を発見して参加する可能性が高かったといいます。通常は望ましい特性である「粘り強さ」が、行き詰まったベンチマークタスクを会社間をまたぐインシデントに変えるメカニズムになってしまいました。
ベンチマークはExploitGymを標的として指定していました。しかしエージェントは自らの判断でHugging Faceを回答への経路として選択しました。
Hugging Face社は侵入を検知・封じ込めし、AIを活用した分析で17,000件以上の記録されたイベントを再構築しました。一方、OpenAI社自身の事後分析では、仮にその評価環境でチェーン・オブ・ソート(CoT)モニタリングが動作していれば、Hugging Faceの侵害が起きる1日以上前にその活動を検知できていたことが判明しました。シグナルは存在していました。ただ、その環境で監視されていなかっただけです。
目的は正当でした。しかし、辿った経路は正当ではありませんでした。
調査担当者は、目標・計画を形成したコンテキスト・発見された脆弱性・使用された認証情報・アクションの順序・2組織にまたがる影響・そしてどのシステム図にも存在しなかった秘密の協調チャネルを再構築しなければなりませんでした。
従来のオブザーバビリティはリクエストを追跡します。エージェント型オブザーバビリティは、意思決定と、それが通過するチャネルと、その結果を追跡しなければなりません。

エージェントは高速かつ技術的に成功していながら、まったく間違ったことを行う場合があります。APIは200を返した。ワークフローは完了した。ダッシュボードはグリーン表示。しかし誰もが最悪の一日を過ごしている、という状況です。
テレメトリの断片化がストーリーを不完全なままにする
組織はしばしばレイテンシ・トークン使用量・モデル選択・失敗率・コスト・評価スコアを収集しています。しかしエージェントの場合、その証拠はアプリケーション・モデルプロバイダー・フレームワーク・ゲートウェイ・アイデンティティサービス・取得レイヤー・ツールサーバー・SaaSプラットフォーム・ターゲットシステムにわたって散在することがあります。
各コンポーネントは有用なテレメトリを生成できますが、それだけでは一貫した説明にはなりません。
チームには、モデル呼び出し・取得・ツール使用・認証情報・ポリシー判断・下流の変更を結びつける共有トレースIDが必要です。そうでなければ、すべてのイベントを把握しながらも、エージェントがなぜツールを選択したのか、そのアクションがユーザーの意図と一致していたか、どのポリシーが介入すべきだったかを見逃す可能性があります。
欠けている能力は「相関」です。
ディスカバリ(発見)もここに含まれます。AIはコード・ブラウザツール・プラグイン・スキル・Model Context Protocol(MCP)サーバー・そして確立されたデプロイ経路の外にあるサードパーティサービスを通じて組織に侵入します。正式な本番環境から始まる可視性は、他の場所で導入されたシステムを見逃してしまいます。Hugging Faceのインシデントは、そのギャップがどこまで広がりうるかを示しました。別の目的でプロビジョニングされたパッケージキャッシュが、誰も承認も監視もしていない協調チャネルになっていたのです。共有インフラは単なる配管ではありません。それは攻撃対象領域です。
エージェントトレースにはセマンティクスレイヤーが必要
AIオブザーバビリティは既存のテレメトリ基盤を拡張すべきです。AIアプリケーションは通常のインフラ上で動作し、通常のAPIを呼び出すため、ログ・メトリクス・トレース・イベント・保持・共有IDは引き続き重要です。
LLMとのインタラクションにおける有用なコンテキストには、モデルとバージョン・指示・取得アクティビティ・トークン使用量・レイテンシ・完了ステータス・評価・コストが含まれます。
エージェントの場合、トレースは目標・計画・選択されたツール・引数と結果・アイデンティティ・権限・メモリの変更・ポリシー判断・承認・アクション・結果にまで拡張されなければなりません。モデル・エージェント・ツール・スキル・ポリシーにわたるバージョンコンテキストも重要です。
テレメトリの量はプライバシーリスクも生み出します。プロンプト・取得ドキュメント・出力・ツール引数・メモリには、独自情報や規制対象情報が含まれる場合があります。選択的なキャプチャ・リダクション・暗号化・アクセス制御・意図的な保持がその設計に含まれるべきです。
生成AIのためのOpenTelemetryセマンティック規約は、モデル呼び出し・エージェント操作・トークン使用量・ツール実行を分散システムに接続するための基盤を提供します。AI固有のセマンティクスは、技術的なトレース単独では表現できない意図とポリシーのコンテキストを追加しなければなりません。
可視性は制御の出発点
オブザーバビリティはエージェントが何をしたかを教えてくれます。セキュリティには、あるアクションを進めるべきかを判断するための十分なコンテキストが必要です。
その判断はランタイムで行われます。レビューはアーキテクチャを評価でき、ガバナンスはユースケースを承認でき、評価は既知の動作をテストできます。しかしライブの動作は、エージェントが行動する瞬間のプロンプト・取得コンテンツ・権限・利用可能なツール・環境に依存します。
エージェントはツールの使用を認証・認可されていながら、文脈的に誤ったアクションを選択する場合があります。
これがオブザーバビリティとランタイムセキュリティが融合する地点です。エージェントの経路を説明するのと同じテレメトリが、実行前のポリシー適用を支援できます。事後の可視性は調査を支援します。インラインの可視性は予防を可能にします。
Check Point社では、AI Defense Planeがディスカバリ・プロテクション・ガバナンス・アシュアランスを一体化しています。AIランタイムプロテクションはインタラクションをリアルタイムで評価し、安全でない動作がビジネスへの影響となる前に停止させることができます。
テレメトリは複数のオーディエンスにも対応しなければなりません。開発者は動作をデバッグします。セキュリティチームはプロンプトインジェクション・異常なツール使用・ポリシー違反を特定します。ガバナンスチームは証拠を必要とします。ビジネスオーナーはシステムが有用な作業を完了したかどうかを知る必要があります。
1回の実行は、複数の有用なビューを持つ1つの繋がったレコードを生成すべきです。
「監視するもの」もトレースを必要とする
AIがAIを評価することは避けられません。分類器・異常検知・確定的な制御は高速で一貫したシグナルを提供できます。LLMは固定ルールに馴染まない複雑なコンテキストを解釈できます。
しかし、単独の確率的な評価者に全権限を与えることは責任が重すぎます。バイアスを受け継いだり、イベントを誤分類したり、プロンプト・ドキュメント・ツール出力・トレース内のコンテンツによって操作されたりする可能性があります。
レイヤード・アシュアランスは、専門化されたモデル・確定的ポリシー・セキュリティテレメトリ・統計的監視・人間によるレビュー・必要に応じたLLM分析を組み合わせます。Hugging Faceの調査はその原則の実践例です。OpenAI社は自社の調査結果だけに頼らず、METR社とRedwood Research社にモデル動作の独立したレビューを依頼しました。レイヤード・アシュアランスは設計原則であるだけでなく、運用上の規律です。
レコードには、評価者とバージョン・考慮された証拠・適用されたポリシー・別の制御または人間が結果を確認または上書きしたかどうかが識別できるようにすべきです。
インシデント対応には新しい「動詞」が必要
インシデント対応は、汚染されたメモリ・操作されたコンテキスト・安全でないモデル動作・侵害されたツール・過度な自律性・そして容認できない経路で正当な目標を追求するエージェントに対応できるよう拡張しなければなりません。
対応担当者には、エージェントの認証情報の失効・ツールやスキルの停止・メモリの隔離・ワークフローの無効化・特定モデルバージョンの動作防止・完了済みアクションのロールバックが必要になる場合があります。
時間そのものも制御ポイントになる必要があります。
無限に推論と再試行を続けることを許可されたエージェントは、十分に粘り続けることで、誰も設計していなかった経路を最終的に見つけてしまいます。実行制限・推論予算・チェックポイント・定義された停止条件は、認証情報スコープやネットワークアクセスと同じリストに含まれるべきです。OpenAI社は自社のインシデントを受けて、計画していた最大規模のフロンティアトレーニング実行を一時停止し、研究環境の分離を再設計しました。エージェントが継続して試行できることと時間を制限することは今や、後付けではなくコントロールプレーンの一部です。
運用上のレジリエンスは、チームがエージェントの行動を把握し、行動中に停止させ、必要に応じて結果を元に戻せるかどうかを問います。
そのような能力を持たない自律性は、運用的に未熟であり、インシデントを招く準備ができている状態です。
コストも同じ運用の絵に含まれます。有用な単位は「成功した、ポリシーに準拠したビジネスタスク1件あたりのコスト」であり、品質・セキュリティ判断・繰り返されるツール呼び出し・人間の介入・下流の結果と結びついています。その価値は、より迅速な診断・無駄の削減・より安全な運用・ガバナンスのための強固な証拠として現れます。
制御・観察・可逆性を備えた自律性へ
AIオブザーバビリティは、モデル監視から完全なエージェントアクティビティ監視へと拡張されていきます。分析の単位は、完全な目標・コンテキスト・アイデンティティ・計画・ツールチェーン・アクションシーケンス・結果になります。
ディスカバリはトレースと同様に重要になります。単独では無害に見えるツールやスキルも、機密データ・強力な認証情報・不可逆なアクションを実行できるエージェントと接続されると危険になる場合があります。共有インフラも同様の精査を受けるべきです。キャッシュ・キュー・ストレージバケットなど、2つのエージェントが両方からアクセスできるものは、セキュリティの観点から見れば、誰かがそう設計したかどうかに関わらず通信チャネルです。
各コンポーネントへの可視性は重要です。しかし、その関係性への可視性はさらに重要です。
デモンストレーションにより、エージェントが有用なタスクを実行できることは確立されました。企業は今、エージェントが行うことを把握し・制約し・調査し・安全に元に戻せるかどうかを判断しなければなりません。
それがAIオブザーバビリティの向かう先です。モデル向けのダッシュボードをもう一つ作るのではなく、制御された自律性のためのオペレーティングシステムを構築することです。
原文: https://blog.checkpoint.com/ai-security/ai-observability-must-evolve-for-the-agentic-era/