Muster werden geladen…
Progressives Rollout und Schattenmodus(PRS)
Die Deployment-Seite des sicheren Ausrollens einer Agenten- oder Prompt-Version. Der Kandidat läuft zunächst im Schattenmodus: Er wird auf echtem Produktionsverkehr ausgeführt, während seine Ausgabe den Nutzern vorenthalten und offline mit der ausgelieferten Version verglichen wird, geht dann als Canary auf 1 bis 5 Prozent des Live-Verkehrs, bewertet durch Online-Evals gegen eine Kontrollgruppe, und anschließend in eine schrittweise Hochskalierung, mit automatischem Rollback in dem Moment, in dem eine überwachte Kennzahl sich verschlechtert. Die Kombination von Online-Evals (die Live-Verkehr im laufenden Betrieb bewerten) mit Offline-Evals erfasst die Long-Tail-Fehler, die ein statisches Golden-Set nicht vorhersagen kann. Zu unterscheiden von eval-driven-agent-development, das Änderungen offline vor dem Merge kontrolliert, während dieses Muster die Online-Hochskalierung nach dem Merge steuert.
In 30 Sekunden
- Was
- Lässt den Kandidaten-Agenten auf Produktionsverkehr laufen, ohne dessen Ausgabe auszuliefern, und gibt ihn dann schrittweise für Nutzer frei, mit automatischem Rollback bei Metrikverschlechterung.
- Wann einsetzen
- Wenn Sie Agenten- oder Prompt-Änderungen ausliefern, bei denen Long-Tail-Fehler auf echtem Verkehr mehr zählen als statische Testsätze, und Sie vor dem vollständigen Rollout Sicherheit brauchen.
- Achtung
- Latenz und Kosten der Online-Auswertung skalieren mit dem Verkehrsaufkommen; ein langsamer oder teurer Scorer kann zum Engpass werden, bevor Sie echte Probleme entdecken.
Fragen Sie den KI-Experten zu diesem Pattern
Öffnet den Assistenten mit vorbereiteter Frage. Sie prüfen sie vor dem Senden.
Progressives Rollout und Schattenmodus: Überblick
Die Deployment-Seite des sicheren Ausrollens einer Agenten- oder Prompt-Version. Der Kandidat läuft zunächst im Schattenmodus: Er wird auf echtem Produktionsverkehr ausgeführt, während seine Ausgabe den Nutzern vorenthalten und offline mit der ausgelieferten Version verglichen wird, geht dann als Canary auf 1 bis 5 Prozent des Live-Verkehrs, bewertet durch Online-Evals gegen eine Kontrollgruppe, und anschließend in eine schrittweise Hochskalierung, mit automatischem Rollback in dem Moment, in dem eine überwachte Kennzahl sich verschlechtert. Die Kombination von Online-Evals (die Live-Verkehr im laufenden Betrieb bewerten) mit Offline-Evals erfasst die Long-Tail-Fehler, die ein statisches Golden-Set nicht vorhersagen kann. Zu unterscheiden von eval-driven-agent-development, das Änderungen offline vor dem Merge kontrolliert, während dieses Muster die Online-Hochskalierung nach dem Merge steuert.
- Shadow mode: candidate runs on live traffic, output withheld, compared offline
- Canary on 1-5% of live traffic scored by online evals against a control
- Progressive ramp with predefined promotion and rollback thresholds
- Automatic rollback triggered by a monitored metric regression
- Online evals (in-flight scoring) paired with offline evals for long-tail failures
- Per-request telemetry span ties the eval score to the routing decision for auto-gating
Den Agent-Evals-Field-Guide erhalten
Alle 25 Methoden zur Agentenbewertung in einem Leitfaden: welcher Benchmark was misst, wann ein öffentlicher Score in die Irre führt und wie Sie Evals aus Ihren eigenen Fehlern bauen. Der Link kommt mit Ihrer Bestätigung, zusammen mit dem wöchentlichen Agent Architect.
Wöchentliche E-Mail, Abmeldung mit einem Klick. Ihre Adresse wird nur für das Briefing verwendet.
Quellen
Die Veröffentlichungen, Spezifikationen und Repositories, auf denen dieses Muster beruht.
Vom Ingenieur hinter diesem Katalog
Finden Sie heraus, was Ihre Evals übersehen
Einen Agenten zu messen ist schwerer, als ihn auszuliefern, und die meisten Suiten bleiben grün, während die Produktion abdriftet. Lassen Sie Ihr Evaluations-Setup durchgehend prüfen: was Sie heute messen, was Sie noch nicht sehen, und welche Regressionen Ihre Suite derzeit durchlässt.
750 € statt 1.500 €, eine Woche, schriftlicher Bericht und Walkthrough-Call, bis 30. September