Loading...
🧬
自動プロンプト最適化(APO)
エージェントパイプライン内のプロンプトや指示を手作業で調整するのではなく、学習可能なパラメータとして扱い、指標とラベル付きデータセットに対してプログラム的に最適化する。オプティマイザは few-shot の実例を自動生成して指示の言い回しを探索し、リフレクティブな手法は過去の失敗の実行トレースを読み取ってプロンプトを変異させる。
複雑さ: high学習と適応
In 30 seconds
- What
- プロンプトを学習可能なパラメータとして扱い、手作業のチューニングではなく、few-shotブートストラップ、命令の探索、失敗トレースの分析、LLMによるフィードバックループを用いて指標に対して最適化する。
- When to use
- ラベル付きの検証データ、明確な指標、そしてパイプラインを何度も反復してプロンプト品質を体系的に高めるだけの計算予算がある場合。
- Watch out
- 最適化が検証セットや指標に過剰適合し、新しい領域では機能しないプロンプトや、本当の能力向上ではなく報酬の抜け道を突くだけのプロンプトを生み出すことがある。
Loading technique guide…