Modellarchitekturen
Systeme zur Werkzeugnutzung und Schlussfolgerung
Platzieren Sie ein Modell innerhalb eines Controllers, der planen, typisierte Tools aufrufen, Ergebnisse prüfen, überarbeiten, verifizieren, stoppen und die Kontrolle an eine Person weitergeben kann.
Denkmodell
Das Modell schlägt Aktionen vor; die Laufzeitumgebung validiert sie und führt sie aus. „Reasoning Model“ beschreibt Verhalten, Training und Laufzeit, nicht eine einzelne neuronale Topologie.
Datenfluss
- Ziel + Richtlinie + Zustand
- Modell schlägt Antwort oder typisierte Aktion vor
- Schema-/Berechtigungsprüfung
- Werkzeugausführung in einer begrenzten Umgebung
- Beobachtung → fortsetzen, verifizieren oder stoppen
So wird trainiert
Demonstrationen zur Werkzeugnutzung, überwachte Schlussfolgerungspfade, Ergebnis- oder Prozessrückmeldungen, Reinforcement Learning und überprüfbare Aufgaben können das Verhalten formen. Laufzeit-Scaffolding bleibt auch dann notwendig, wenn das Basismodell nachträglich für die Werkzeugnutzung trainiert wird.
So läuft die Inferenz
Der Controller kann mehrere Modellaufrufe und Tool-Operationen pro Aufgabe benötigen. Budgets, Fristen, Idempotenz, Genehmigungs-Gates, Sandboxing und explizite Endbedingungen begrenzen die Schleife.
Stärken
- Zugriff auf aktuelle Daten, Rechner, Code und Unternehmessysteme
- Kann mehrstufige Arbeit zerlegen, prüfen und verifizieren
- Typisierte Schnittstellen machen Fähigkeiten und Berechtigungen explizit
Zielkonflikte
- Höhere Latenz, Kosten und Ausfallmodi als ein einzelner Modellaufruf
- Tool-Ausgabe und abgerufener Web-Inhalt sind nicht vertrauenswürdige Eingaben
- Schleifen, wiederholte Seiteneffekte und übermäßige Autorität erzeugen operationelle Risiken
Geeignet, wenn
- Die Aufgabe erfordert Aktionen oder Informationen außerhalb der Modellgewichte
- Zwischenergebnisse können validiert werden
- Berechtigungen, Budgets, Wiederholungsversuche und menschliche Genehmigung sind explizit
Vermeiden oder hinterfragen, wenn
- Ein deterministischer API-Aufruf löst die Aufgabe
- Der Agent würde breite Anmeldeinformationen ohne Containment erhalten
- Es gibt keine Evaluierung für Schleifen, Tool-Fehler oder unsichere Aktionen
Beispielhafte veröffentlichte Familien
- • ReAct-ähnliche Reason-and-Act-Schleife
- • Toolformer Forschungsansatz
- • Planer–Executor und Verifier Muster