パターンを読み込んでいます…
スポットライティングとデータマーキング(SDM)
信頼できない外部テキストを、信頼できる指示から確実に区別できるようにする、低コストな変換の一群。デリミティングは外部コンテンツを一意の境界で囲み、データマーキングは信頼できない範囲のすべての空白に特別なトークンを挟み込み、base64などのエンコーディングはそれを指示チャネルからさらに分離する。間接的なプロンプトインジェクションに対する安価な第一の防御線だが、適応型攻撃には弱くなるため、多層防御と組み合わせるべきである。
30秒でわかる概要
- 概要
- 信頼できない外部テキストを一意の区切り記号で囲み、空白部分に特殊トークンを挟み込み、あるいは base64 でエンコードして、信頼できる指示と視覚的に区別できるようにする。
- 使いどころ
- モデルを狙った隠れたインジェクションが含まれうる外部コンテンツ(ウェブページ、ユーザーのアップロード、API のレスポンス)を扱う場合。
- 注意点
- 適応的な攻撃者はあなたのマーカーを学習して回避できる。これはあくまで第一層であり、完全な防御ではないと考えること。
このパターンについてAIエキスパートに質問
質問が入力済みの状態でアシスタントが開きます。送信前に内容を確認できます。
スポットライティングとデータマーキング: 概要
信頼できない外部テキストを、信頼できる指示から確実に区別できるようにする、低コストな変換の一群。デリミティングは外部コンテンツを一意の境界で囲み、データマーキングは信頼できない範囲のすべての空白に特別なトークンを挟み込み、base64などのエンコーディングはそれを指示チャネルからさらに分離する。間接的なプロンプトインジェクションに対する安価な第一の防御線だが、適応型攻撃には弱くなるため、多層防御と組み合わせるべきである。
- Delimiting marks the start and end of untrusted spans
- Datamarking interleaves a special token across untrusted text
- Encoding (base64/rot13) moves data off the instruction channel
- Model learns to treat marked spans as data, not commands
- Very low latency and token overhead
- Reduces indirect injection but not adaptive-attack proof
The Agent Architect
1つのパターン、1つのトレードオフ、1つの本番障害事例。エージェントシステムを構築する人のための短い週刊ブリーフィング。
週1回のメール、ワンクリックで購読解除できます。アドレスはブリーフィングの送信のみに使用します。
参考文献
このパターンの根拠となる論文、仕様、リポジトリです。
このカタログを作ったエンジニアが担当
あなたのエージェントシステムをレッドチーミング
ここで説明した対策は、誰かが破ろうとして初めて確かめられます。実際の攻撃者と同じ手口で検証します。プロンプトインジェクション、ジェイルブレイク、ツールの悪用、データ持ち出しまで、すべての指摘に修正方法を添えます。
€750(通常€1,500)・1週間・文書レポートとウォークスルーコール・9月30日まで