Muster werden geladen…
LLM als Richter(LJ)
Eine spezielle Ausprägung des Produzent-Kritiker-Musters, bei der ein LLM als Kritiker fungiert, um Ausgaben zu bewerten
In 30 Sekunden
- Was
- Erzeugt mehrere Ausgabekandidaten und lässt sie von einem zweiten LLM anhand eines Bewertungsrasters benoten, um das bestbewertete Ergebnis auszuwählen.
- Wann einsetzen
- Sie brauchen eine konsistente Qualitätsfilterung und haben Budget für mehrere LLM-Aufrufe; das Ranking zählt mehr als die Geschwindigkeit.
- Achtung
- Das bewertende LLM wendet Raster womöglich nicht zuverlässig konsistent an, besonders bei subjektiven Kriterien oder Grenzfällen.
Fragen Sie den KI-Experten zu diesem Pattern
Öffnet den Assistenten mit vorbereiteter Frage. Sie prüfen sie vor dem Senden.
LLM als Richter: Überblick
Eine spezielle Ausprägung des Produzent-Kritiker-Musters, bei der ein LLM als Kritiker fungiert, um Ausgaben zu bewerten
- Automated quality assessment
- Natural language evaluation
- Scalable ranking/scoring
- Configurable rubrics
The Agent Architect
Ein Pattern, ein Tradeoff, eine Produktionspanne. Ein kurzes wöchentliches Briefing für alle, die agentische Systeme bauen.
Wöchentliche E-Mail, Abmeldung mit einem Klick. Ihre Adresse wird nur für das Briefing verwendet.
Quellen
Die Veröffentlichungen, Spezifikationen und Repositories, auf denen dieses Muster beruht.
- Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena (Zheng et al., 2023)arXiv:2306.05685
- G-Eval: NLG Evaluation using GPT-4 with Better Human Alignment (Liu et al., 2023)arXiv:2303.16634
- Large Language Models are not Fair Evaluators (Wang et al., 2023)arXiv:2305.17926
- Prometheus: Inducing Fine-grained Evaluation Capability in LLMs (Kim et al., 2024)arXiv:2310.08491
- OpenAI Evals Framework Documentation
Vom Ingenieur hinter diesem Katalog
Lassen Sie Ihre Agenten-Architektur prüfen
Diese Seite dokumentiert ein Pattern. Ihr System betreibt Dutzende, und die meisten Ausfälle entstehen im Zusammenspiel. Lassen Sie den gesamten Entwurf an den 288 Patterns dieses Katalogs messen: Architektur, Zuverlässigkeit, Evaluation und Kosten, jeder Befund verknüpft mit dem Pattern, das ihn behebt.
750 € statt 1.500 €, eine Woche, schriftlicher Bericht und Walkthrough-Call, bis 30. September