パターンを読み込んでいます…
LLM as Judge(LJ)
プロデューサー・クリティック・パターンの具体的な実装で、LLM がクリティック(批評役)として出力を評価するもの
30秒でわかる概要
- 概要
- 複数の候補出力を生成し、二つ目の LLM が評価基準に照らしてそれぞれを採点し、最高評価の結果を選びます。
- 使いどころ
- 一貫した品質フィルタリングが必要で、複数回の LLM 呼び出しに予算を割ける場合。速度よりもランク付けが重要なときに向きます。
- 注意点
- 審査役の LLM が評価基準を安定して一貫適用できるとは限りません。特に主観的な基準やエッジケースでは注意が必要です。
このパターンについてAIエキスパートに質問
質問が入力済みの状態でアシスタントが開きます。送信前に内容を確認できます。
LLM as Judge: 概要
プロデューサー・クリティック・パターンの具体的な実装で、LLM がクリティック(批評役)として出力を評価するもの
- Automated quality assessment
- Natural language evaluation
- Scalable ranking/scoring
- Configurable rubrics
The Agent Architect
1つのパターン、1つのトレードオフ、1つの本番障害事例。エージェントシステムを構築する人のための短い週刊ブリーフィング。
週1回のメール、ワンクリックで購読解除できます。アドレスはブリーフィングの送信のみに使用します。
参考文献
このパターンの根拠となる論文、仕様、リポジトリです。
- Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena (Zheng et al., 2023)arXiv:2306.05685
- G-Eval: NLG Evaluation using GPT-4 with Better Human Alignment (Liu et al., 2023)arXiv:2303.16634
- Large Language Models are not Fair Evaluators (Wang et al., 2023)arXiv:2305.17926
- Prometheus: Inducing Fine-grained Evaluation Capability in LLMs (Kim et al., 2024)arXiv:2310.08491
- OpenAI Evals Framework Documentation
このカタログを作ったエンジニアが担当
エージェント構成をレビューします
このページが扱うのは1つのパターンです。実際のシステムは数十を組み合わせて動き、障害の多くはその繋ぎ目で起きます。カタログの288パターンに照らして設計全体をレビューします。アーキテクチャ、信頼性、評価、コストまで、指摘ごとに対応するパターンを示します。
€750(通常€1,500)・1週間・文書レポートとウォークスルーコール・9月30日まで