Laboratoire d’évaluation des modèles
Exécutez un petit jeu de test avec différents modèles d’agents et différents LLM, côte à côte. Chaque exécution indique la sortie réelle, la latence, le nombre de jetons et le coût ; un juge IA note la qualité par rapport à vos réponses attendues, et toute la comparaison s’exporte en JSON ou CSV. Le choix d’un modèle repose sur des mesures plutôt que sur l’intuition.
Une comparaison réelle
La même tâche, quatre façons
Deux modèles et deux patterns sur une même question, mesurés plutôt que supposés. La latence est mesurée en temps réel, les jetons viennent du fournisseur, et le coût est celui réellement facturé.
Tâche: A bat and a ball cost $1.10 in total. The bat costs $1.00 more than the ball. How much does the ball cost?
| Modèle | Pattern | Réponse | Latence | Jetons | Coût |
|---|---|---|---|---|---|
| anthropic/claude-sonnet-5 | Direct | $0.05 | 3,065 ms | 63 | $0.000174 |
| anthropic/claude-sonnet-5 | Chain of Thought | $0.05 | 4,870 ms | 366 | $0.0031 |
| google/gemini-2.5-flash | Direct | $0.05 | 458 ms | 45 | $0.000024 |
| google/gemini-2.5-flash | Chain of Thought | $0.05 | 1,257 ms | 276 | $0.00058 |
Les quatre exécutions ont répondu correctement : sur cette tâche, le pattern de raisonnement n'a rien apporté d'autre que du temps et de l'argent, la plus coûteuse revenant à environ 128 fois la moins chère. C'est l'argument pour mesurer un choix de pattern au lieu de le supposer, et la raison pour laquelle le lab affiche coût et latence à côté du résultat.
Mesuré le 2026-08-06
Et un juge qui montre son travail
Le lab note aussi la qualité avec un juge IA, ancré dans la réponse attendue que vous lui donnez. Dans cette comparaison capturée, les deux exécutions ont calculé le bon nombre, et le juge les a quand même départagées : la tâche demandait le nombre en premier, et l'exécution qui l'a enfoui a perdu des points de respect des consignes.
Tâche: A retail API rate limiter allows 120 requests per minute per key. A batch job needs to send 4,500 requests. What is the minimum time in minutes to send them all, and how should the job pace itself? Answer with the number first.
Réponse attendue: 37.5 minutes (4500 / 120), pacing at or under 2 requests per second.
| Modèle | Pattern | Qualité | Consignes | Latence | Coût |
|---|---|---|---|---|---|
| openai/gpt-5-mini | Chain of Thought | 5.00/5 | 5/5 | 14,220 ms | $0.0021 |
| anthropic/claude-haiku-4-5 | Chain of Thought | 4.67/5 | 3/5 | 4,688 ms | $0.0023 |
Le juge sur l'exécution pénalisée: “The calculation and pacing advice are correct and clearly explained, but the answer is not given first as instructed; it only appears at the end after several intermediate steps.”
Les verdicts en face-à-face sont contrôlés contre le biais de position : le juge est interrogé deux fois avec l'ordre inversé, et sur cette paire serrée il a changé de choix, donc le lab a rapporté un match nul au lieu d'inventer un gagnant.
Noté de 1 à 5 par anthropic/claude-sonnet-5 par rapport à la réponse attendue. Mesuré le 2026-08-10