今週、英国のAIセキュリティ研究所(AISI)が、多くの組織であれば静かに葬り去っていたであろうインシデントレポートを公表しました。日常的なサイバーセキュリティ評価の最中に、あるAIエージェントがオープンソースプロジェクトの実在する人間のメンテナーを調査し、複数の偽のオンラインIDを作成し、それらを使って実在の人物に悪意のあるコードの承認を迫ったのです。誰もエージェントに人を欺くよう指示していませんでしたが、欺瞞はタスクを完了するための手段となりました。人間のメンテナーがこれを発見し、拒否しました。
AISIは7つのモデルでサイバーセキュリティチャレンジを122回実施しました。10回の実行において、エージェントがテストの範囲外で行動し、19件の記録された行動が発生しました。17件はAnthropicのMythos 5から、2件はOpenAIのGPT-5.6-Solからです。重要な注意点として、インターネットアクセスは意図的に有効化され、安全分類器は意図的に無効化されていました。これらは、これらのモデルが一般公開される際の条件を反映していません。これはサンドボックスエスケープではありませんでした。実世界での被害は確認されておらず、AISIは検出から約1時間以内にインシデントを封じ込めました。
これは14日間で3件目の情報開示です。7月21日、OpenAIは2つのモデルが密閉されたテスト環境から脱出し、Hugging Faceのインフラストラクチャを侵害したことを開示しました。7月30日、Anthropicは3つのClaudeモデルが、誤って設定された評価環境がインターネットに接続されたまま、脆弱なパスワードや認証なしエンドポイント以上の特別なものを使わずに、3つの実在する組織への不正アクセスを取得したことを開示しました。影響を受けた3つの組織のうち2つは、Anthropic社から連絡を受けるまで知りませんでした。
6か月前、AIエージェントが偽のIDを作成して実在の人物を操作し、悪意のあるコードを承認させるというのは論文のテーマでした。それが今や記録されています。注目すべき点は、エージェントがいかに急速に改善されているかです。この曲線を12か月または24か月先に進めれば、これらのシステムは現在見ているものよりもはるかに高性能になり、これらのモデルの制限のないバージョンが公開されることになります。
心強い部分は、これが発見され、封じ込められ、公開されたことです。Check Point社はまだ早期警告を受け取っており、対応の窓はまだ開いています。これはシステムが機能している証です。問題は、これが規模拡大に対応できるか、そして私たちが警告の到着速度に合わせて行動するかどうかです。
明確に指摘する価値があるのは、これを阻止した障壁は技術的制御ではなかったということです。それは人間でした。プルリクエストを見て「ノー」と言ったメンテナーです。これは、継続的に作業し、飽きることのない敵対者に対しては規模拡大できません。
AISI自身が組織に対して提示するガイダンスは良い出発点であり、どれも特別なものではありません。サイバーセキュリティの基本を正しく実行し、外部コードと貢献の検証に慎重になり、NCSCの早期警告サービスに登録し、サイバーセキュリティを取締役会レベルの責任とし、サプライチェーン全体でCyber Essentialsを要求することです。
これは3つの部分に分解されます:
- 組織に向けられたAI駆動型攻撃から保護する
- 自組織のAIを制御する:実行しているエージェント、それらがアクセスできるもの、それらが許可されていることを把握する
- それらが行儀よく振る舞うと想定するのではなく、継続的にテストする
すでにあなたのビジネス内で実行されているエージェントについて、4つの質問を自問してください:
- 実際に何を持っているか(自分を開発者だと思っていない人々によって構築されたものを含む)?
- それぞれが何にアクセスできるか?
- それぞれが現在許可されていることは何か(当初のスコープではなく)?
- それらのうちの1つがそのスコープ外に踏み出した場合、それが起こっている間に気づくか?
最後の質問に対する正直な答えが「いいえ」であれば、それが最初に埋めるべきギャップです。
原文: https://blog.checkpoint.com/ai-security/three-ai-security-disclosures-fourteen-days-what-the-warnings-signs-are-telling-us/