正在加载模式…
LLM 作为评判者(LJ)
生产者-评审者模式的一种具体实现,其中 LLM 充当评审者以评估输出
30秒速览
- 是什么
- 生成多个候选输出,再用第二个 LLM 按评分标准逐一打分,并选出得分最高的结果。
- 何时使用
- 你需要一致的质量筛选,且有预算支持多次 LLM 调用;排序比速度更重要。
- 注意
- 担任评委的 LLM 未必能可靠且一致地套用评分标准,在主观标准或边缘案例上尤其如此。
向AI专家咨询此模式
打开助手并预填您的问题,发送前可先确认。
LLM 作为评判者: 概览
生产者-评审者模式的一种具体实现,其中 LLM 充当评审者以评估输出
- Automated quality assessment
- Natural language evaluation
- Scalable ranking/scoring
- Configurable rubrics
The Agent Architect
每周一个模式、一个权衡、一个生产事故案例。为构建智能体系统的人准备的每周简报。
每周一封邮件,一键退订。您的地址仅用于发送简报。
参考资料
该模式所依据的论文、规范和代码仓库。
- Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena (Zheng et al., 2023)arXiv:2306.05685
- G-Eval: NLG Evaluation using GPT-4 with Better Human Alignment (Liu et al., 2023)arXiv:2303.16634
- Large Language Models are not Fair Evaluators (Wang et al., 2023)arXiv:2305.17926
- Prometheus: Inducing Fine-grained Evaluation Capability in LLMs (Kim et al., 2024)arXiv:2310.08491
- OpenAI Evals Framework Documentation
由本目录背后的工程师执行
为你的智能体架构做一次评审
本页讲的是一个模式。真实系统会同时跑几十个,而多数故障恰恰出在它们的衔接处。我们按本目录的 288 个模式评审你的整体设计:架构、可靠性、评测与成本,每一条结论都对应到能修复它的模式。
€750(原价 €1,500),一周交付,书面报告加讲解通话,9月30日前