Labor für Musterevaluierung
Führen Sie ein kleines Testset mit verschiedenen Agentenmustern und verschiedenen Modellen nebeneinander aus. Jeder Lauf zeigt echte Ausgabe, Latenz, Tokenzahl und Kosten; ein KI-Richter bewertet die Qualität gegen Ihre erwarteten Antworten, und der ganze Vergleich lässt sich als JSON oder CSV exportieren. Die Musterwahl beruht auf Messwerten und nicht auf Bauchgefühl.
Ein echter Vergleich
Dieselbe Aufgabe, vier Wege
Zwei Modelle und zwei Patterns bei einer Frage, gemessen statt angenommen. Die Latenz ist Wanduhrzeit, die Token stammen vom Anbieter, und die Kosten sind die tatsächlich abgerechneten.
Aufgabe: A bat and a ball cost $1.10 in total. The bat costs $1.00 more than the ball. How much does the ball cost?
| Modell | Pattern | Antwort | Latenz | Token | Kosten |
|---|---|---|---|---|---|
| anthropic/claude-sonnet-5 | Direct | $0.05 | 3,065 ms | 63 | $0.000174 |
| anthropic/claude-sonnet-5 | Chain of Thought | $0.05 | 4,870 ms | 366 | $0.0031 |
| google/gemini-2.5-flash | Direct | $0.05 | 458 ms | 45 | $0.000024 |
| google/gemini-2.5-flash | Chain of Thought | $0.05 | 1,257 ms | 276 | $0.00058 |
Alle vier Läufe antworteten richtig. Bei dieser Aufgabe brachte das Reasoning-Pattern also nichts außer Zeit und Geld: Der teuerste Lauf kostete rund das 128-fache des günstigsten. Genau darum misst man eine Pattern-Entscheidung, statt sie anzunehmen, und darum zeigt das Lab Kosten und Latenz neben der Ausgabe.
Gemessen am 2026-08-06
Und ein Richter, der seine Arbeit zeigt
Das Lab bewertet Qualität auch mit einem KI-Richter, gestützt auf die erwartete Antwort, die Sie vorgeben. In diesem erfassten Vergleich berechneten beide Läufe die richtige Zahl, und der Richter trennte sie trotzdem: Die Aufgabe verlangte die Zahl zuerst, und der Lauf, der sie vergrub, verlor Punkte bei der Anweisungstreue.
Aufgabe: A retail API rate limiter allows 120 requests per minute per key. A batch job needs to send 4,500 requests. What is the minimum time in minutes to send them all, and how should the job pace itself? Answer with the number first.
Erwartete Antwort: 37.5 minutes (4500 / 120), pacing at or under 2 requests per second.
| Modell | Pattern | Qualität | Anweisungstreue | Latenz | Kosten |
|---|---|---|---|---|---|
| openai/gpt-5-mini | Chain of Thought | 5.00/5 | 5/5 | 14,220 ms | $0.0021 |
| anthropic/claude-haiku-4-5 | Chain of Thought | 4.67/5 | 3/5 | 4,688 ms | $0.0023 |
Der Richter zum abgewerteten Lauf: “The calculation and pacing advice are correct and clearly explained, but the answer is not given first as instructed; it only appears at the end after several intermediate steps.”
Direkte Urteile werden auf Positionsbias geprüft: Der Richter wird zweimal mit vertauschter Reihenfolge befragt, und bei diesem knappen Paar änderte er seine Wahl, also meldete das Lab ein Unentschieden, statt einen Sieger zu erfinden.
Von anthropic/claude-sonnet-5 mit 1 bis 5 gegen die erwartete Antwort bewertet. Gemessen am 2026-08-10