モデルアーキテクチャ
ツール利用と推論システム
モデルをコントローラー内に配置し、計画、型付きツールの呼び出し、結果の検査、修正、検証、停止、および人間へのコントロール権限移譲を行えます。
理解のためのモデル
モデルが提案し、実行時は検証と実行を行います。“推論モデル”とは、特定のニューラルトポロジーではなく、振る舞い/トレーニング/実行時における記述です。
データフロー
- 目標 + ポリシー + 状態
- モデルは回答または型付きアクションを提案
- スキーマ/権限検証
- 境界付き環境でのツール実行
- 観測 → 続行、検証、または停止
学習方法
ツールデモンストレーション、教師あり推論トレース、結果またはプロセスフィードバック、強化学習、および検証可能なタスクが振る舞いを形作ります。基本モデルをツール利用のためにポストトレーニングしても、実行時スキャフォールディングは依然として必要です。
推論の実行方法
コントローラーは1つのタスクに対して複数のモデル呼び出しとツール操作を行う場合があります。予算、期限、冪等性、承認ゲート、サンドボックス化、および明示的な終了条件がループをバインドします。
強み
- 最新データ、電卓、コード、およびエンタープライズシステムへのアクセス
- 多段階作業の分解、検査、および検証が可能
- 型付きインターフェースは機能と権限を明確にします
トレードオフ
- 単一モデル呼び出しよりもレイテンシ、コスト、および失敗モードが増加します
- ツールの出力と取得したWebコンテンツは信頼できない入力です
- ループ、繰り返しの副作用、および過剰な権限が運用リスクを生み出します
適する場合
- タスクにはモデルの重みの外にあるアクションまたは情報が必要
- 中間結果を検証可能
- 権限、予算、リトライ、および人間による承認が明示的
避ける・再検討する場合
- 単一の決定論的なAPI呼び出しでタスクが解決される
- エージェントはコンテナ化なしに広範な認証情報を取得する
- ループ、ツールエラー、または危険なアクションに対する評価がない
公開された方式の例
- • ReActスタイルの推論と行動ループ
- • Toolformer研究アプローチ
- • プランナー–実行者および検証者パターン
よく組み合わせる要素
テキストとチャット言語モデルRAGコードサンドボックスポリシーエンジン人間による承認