【Check Point公式ブログ】PuzzleMask:平文に隠されたプロンプトインジェクション

はじめに

プロンプトインジェクションの検出機能の多くは、明らかな攻撃を捕捉するために設計されています。エンコーディングの異常、不可視のUnicode文字、絵文字を使った密輸など、分類器がパターンマッチングで検知できるシグネチャを対象としています。今回新たに開示された技術「PuzzleMask」は、こうした検出をすべて回避します。この技術は、ポリシー違反のペイロードを、流暢で正しく句読点が付いた散文の中に埋め込み、入力側での難読化を検出するヒューリスティックに引っかかることなく、LLMベースのゲートキーパーを通過させるものです。

この技術が標的とするのは、本番LLMパイプラインで標準化されつつある特定のアーキテクチャです。高速かつ低コストのモデルが、より高性能なターゲットモデル(多くの場合、高度な推論能力とツールアクセスを持つ)が実際にリクエストを処理する前に、定義されたポリシーに照らして入力を審査します。これは紙の上では合理的な多層防御のパターンです。しかしPuzzleMaskは、この2つのモデル間のリソース非対称性そのものが悪用可能な攻撃面であることを示しています。

図1 – 難読化されたベクターには明らかなエンコーディングの痕跡(絵文字、Base64など)が含まれておらず、出力やチェーンオブソートを監視しないLLMポリシーエンフォーサーによるチェックを回避します。

主な結論:

  • 完全に平文で書かれたポリシー違反のプロンプトが、Claude-3-Haiku、GPT-4o-Mini、GPT-oss-safeguard、llama-Guard3を含む4つの異なるLLMゲートキーパーをすべて回避し、23回の試行で検出率0%を記録しました。
  • 下流のターゲットモデル(gpt-5-thinking、高推論能力、コードインタープリター有効)は、約94%の試行で埋め込まれたペイロードを復元・実行しました。各試行は1分以上の推論と複数のツール呼び出しを必要としました。
  • これはジェイルブレイクではありません。この技術はターゲットモデルのアライメントや安全トレーニングを低下させるとは主張していません。外部の入力分類レイヤーを無効化し、ターゲット自身の判断だけが残る唯一のコントロールとなります。
  • ペイロードの復元は、推論の深さとコード実行に依存しており、これらは軽量なゲートキーパーが持つように設計されていないリソースです。
  • AnthropicのOpusクラスのモデルはこの攻撃に対して完全に抵抗しました。Check Point社はこれを、入力検査だけに頼るのではなく、チェーンオブソート内で難読化されたプロンプト処理の兆候を検出する分類器の存在によるものと推測しています。

PuzzleMaskとは何か

PuzzleMaskは、ポリシー違反の指示を通常のテキストのラッパーの中に埋め込むプロンプト作成技術であり、自動化されたLLMポリシーチェックを回避しながら、より高性能な下流モデルによる復元を可能にします。分類器が通常フラグを立てる難読化の痕跡は一切必要ありません。ペイロードは、表面上は詩、物語の抜粋、その他の平凡な文章に見える言語の中に埋め込まれています。

PuzzleMaskが何でないかについて正確に述べることが重要です。これはジェイルブレイク技術ではありません。Check Point社はこの技術がターゲットモデルの安全トレーニングへの不服従の可能性を高めるとは主張しません。この技術が行うのは、ゲートキーパーを方程式から完全に取り除くことであり、その後に何が起きるかはターゲットモデル自身の判断に完全に依存します。

ゲートキーパーからターゲットへのパイプラインの仕組み

信頼されていない入力を扱うほとんどの本番LLMシステムが2段階パイプラインに依存するのは、まさにこのためです。単一モデルの内部アライメントだけでは十分とは見なされないからです。

  • ゲートキーパーは、高速でリソースに制限のあるモデルであり、その唯一の役割は、定義されたポリシーに対して受信プロンプトを安全か安全でないかに分類することです(応答は行いません)。
  • ターゲットは、ユーザーのリクエストを実際に処理する、より高性能なモデルであり、多くの場合、高い推論能力とコードインタープリターなどのツールへのアクセスを持ちます。

PuzzleMaskは、これら2つの役割間のリソースギャップを悪用します。ゲートキーパーはラッパーテキストを読み取り、何も異常を検出しません。ターゲットは、十分な時間とツールアクセスが与えられれば、隠された指示を抽出して実行します。

図2 – llama-guard3が、ポリシー違反の作成された「ラッパー」プロンプトを安全と分類しています。

テストで判明したこと

Check Point社は、平文のポリシー違反ペイロードを自然な文体の散文の中にラップする自動パイプラインを構築し、実際のゲートキーパーとターゲットモデルに対してテストを実施しました。

ゲートキーパーの結果:

  • 4つのモデル(gpt-4o-mini、gpt-oss-safeguard、claude-3-haiku、llama-guard3)がゲートキーパーとしてテストされました。
  • 4つのモデルすべてが、難読化されていない平文で書かれた同じペイロードを正しく検出しました。
  • PuzzleMaskを使ってラップされた場合、4つの分類器すべてが作成されたすべてのプロンプトを見逃し、テストセット全体で100%の回避率となりました。
  • いずれのゲートキーパーも、隠されたペイロードの存在を疑う兆候は示しませんでした。

ターゲットの結果:

  • ターゲットモデル(高推論能力とコードインタープリターアクセスで実行されたgpt-5-thinking)は、18回中17回(約94%)の試行で隠されたペイロードを復元・実行しました。
  • 成功したすべての抽出には、1分以上の推論と複数のコードスクリプトの実行が必要でした。
  • AnthropicのOpusクラスのモデルが唯一の一貫した例外であり、毎回インタラクションを終了させました。Check Point社はこれが、進行中の難読化プロンプト処理を検出するよう設計された分類器によるものだと推測しています。

セキュリティチームにとっての意義

多層防御は、各レイヤーが独立したカバレッジを提供することを前提としています。PuzzleMaskは、明らかな操作を検出するために構築されたゲートキーパーが、検出可能なシグネチャを持たないペイロードに対しては何ら保護を提供しないことを示しています。疑わしいフォーマットにフラグを立てるよう訓練された分類器は、適切に句読点が付いた段落では何も検出するものがなく、この技術は外部のコンテンツインジェクションやプラグイン操作も必要としません。ペイロードはプロンプト自体の中に直接含まれています。

これは、AIパイプラインの主要なコントロールとして入力分類に依存しているチームにとって最も重要な問題です。テスト結果は、そのコントロールがこのクラスの攻撃に対して測定可能な盲点を持つことを示唆しています。

防御策

Check Point社は公開に先立ち、Anthropic、Meta、OpenAIに技術の詳細を開示し、それぞれトレードオフを伴う複数の緩和策を提示しました:

  • 信頼されていない入力をゲートキーパーに到達する前にLLMを通じてパラフレーズする。これにより、PuzzleMaskが依存する埋め込み構造を確実に除去できますが、レイテンシが増加し、正当なプロンプトの忠実度が失われる可能性があります。
  • テキスト全体に対して定量的かつ自己参照的なフレーズにフラグを立てる言語でゲートキーパーのポリシーを強化する。gpt-4o-miniに対するテストでは作成されたすべてのプロンプトを検出しましたが、偽陽性が増加する可能性があります。
  • 入力だけでなく、出力と推論を監視する。これはAnthropicのOpusクラスのモデルがこの攻撃に抵抗した理由を説明すると思われるアプローチであり、ペイロードのラッピング方法に関わらずこの技術を検出できます。
  • ゲートキーパーの能力をターゲットの能力に合わせる。原則として最も堅牢な選択肢ですが、高速モデルと高性能モデルのコスト差を考えると、ほとんどのチームにとって現実的ではありません。

高性能モデルの前に高速モデルを配置して運用しているあらゆる組織にとって、結論は明確です。入力のスクリーニングだけでは十分ではありません。カバレッジは、プロンプトが入力された後にモデルが何をするかにまで拡張される必要があります。入力途中のプロンプトの見た目だけではなりません。Check Point Researchによる詳細なレポートはこちらからご覧いただけます。


本記事は Check Point Software Technologies Ltd. の公式ブログ記事を、同社の許諾のもと日本語に翻訳・掲載したものです。
原文: https://blog.checkpoint.com/security/puzzlemask-the-prompt-injection-hiding-in-plain-sight/