模型架构
工具使用与推理系统
将模型置于控制器内部,该控制器可以规划、调用类型化的工具、检查结果、修订、验证、停止并交接给人工。
思维模型
模型提出建议;运行时进行验证和执行。“推理模型”是行为/训练/运行时的描述,而不是单个神经网络拓扑结构。
数据流
- 目标 + 策略 + 状态
- 模型提出答案或类型化操作
- 模式/权限验证
- 在受限环境中执行工具
- 观察 → 继续、验证或停止
训练方式
工具演示、监督式推理轨迹、结果或过程反馈、强化学习以及可验证任务可以塑造行为。即使基础模型经过后训练以进行工具使用,运行时脚手架仍然是必要的。
推理运行方式
控制器可能在一个任务上花费多次模型调用和工具操作。预算、截止日期、幂等性、审批网关、沙箱以及显式的终端条件限制了循环。
优势
- 访问当前数据、计算器、代码和企业系统
- 可以分解、检查和验证多步骤工作
- 类型化接口明确了功能和权限
权衡
- 比一次模型调用具有更高的延迟、成本和故障模式
- 工具输出和检索到的网页内容是不可信任的输入
- 循环、重复的副作用和过多的授权会带来运营风险
适用场景
- 任务需要超出模型权重的操作或信息
- 可以验证中间结果
- 权限、预算、重试和人工审批是显式的
应避免或质疑的场景
- 一次确定性的 API 调用可以解决该任务
- 代理将获得没有约束的广泛凭证
- 无法评估循环、工具错误或不安全操作
已发表的示例系列
- • ReAct 风格的推理-行动循环
- • Toolformer 研究方法
- • 规划器–执行者和验证者模式
常见组合
文本与聊天语言模型RAG代码沙箱策略引擎人工审批