正在加载模式…
投机式与并行工具执行(STE)
根据智能体反复出现的执行轨迹预测最有可能的下一次工具调用,并在 LLM 仍在生成时投机式地执行该调用;在模型确认此次调用之前,投机结果保持隔离,一旦预测错误便将其丢弃。它还涵盖在流式用户回合进行到一半时启动检索,以及返回部分或流式的工具结果。它有别于 async-await、fork-join、scatter-gather 和 map-reduce,后几者都是对已确定且已知相互独立的调用进行扇出;此处的新意在于对尚未确认的预测调用先行动作,从而让工具延迟与生成过程相重叠,而非发生在生成之后。
30秒速览
- 是什么
- 根据智能体过往的模式预测下一次工具调用,并在 LLM 仍在生成时投机执行,在模型确认该调用之前将结果隔离。
- 何时使用
- 对延迟敏感的工作流:同一套工具调用序列会可预测地重复出现,且工具执行时间在响应延迟中占主导。
- 注意
- 预测失误会浪费算力;若投机执行的副作用泄漏到已确认的执行路径中,还会引发难以察觉的状态不一致。
向AI专家咨询此模式
打开助手并预填您的问题,发送前可先确认。
投机式与并行工具执行: 概览
根据智能体反复出现的执行轨迹预测最有可能的下一次工具调用,并在 LLM 仍在生成时投机式地执行该调用;在模型确认此次调用之前,投机结果保持隔离,一旦预测错误便将其丢弃。它还涵盖在流式用户回合进行到一半时启动检索,以及返回部分或流式的工具结果。它有别于 async-await、fork-join、scatter-gather 和 map-reduce,后几者都是对已确定且已知相互独立的调用进行扇出;此处的新意在于对尚未确认的预测调用先行动作,从而让工具延迟与生成过程相重叠,而非发生在生成之后。
- Predicts the next tool call from recurring agent trajectories
- Launches the predicted call while the LLM is still decoding
- Speculative result kept isolated until the model confirms the call
- Mispredicted calls discarded with no effect on real state
- Mid-stream retrieval plus partial or streamed tool results
- Overlaps tool latency with generation instead of serial round-trips
The Agent Architect
每周一个模式、一个权衡、一个生产事故案例。为构建智能体系统的人准备的每周简报。
每周一封邮件,一键退订。您的地址仅用于发送简报。
参考资料
该模式所依据的论文、规范和代码仓库。
- Parallelizing Tool Execution and LLM Generation for Low-Latency Agent Serving (PASTE) - Sui et al. (ArXiv 2026)arXiv:2603.18897
- Speculative Interaction Agents: Building Real-Time Agents with Asynchronous I/O and Speculative Tool Calling - Hooper et al. (ArXiv 2026)arXiv:2605.13360
- ToolSpec: Accelerating Tool Calling via Schema-Aware and Retrieval-Augmented Speculative Decoding - Xia et al. (ArXiv 2026)arXiv:2604.13519
由本目录背后的工程师执行
为你的智能体架构做一次评审
本页讲的是一个模式。真实系统会同时跑几十个,而多数故障恰恰出在它们的衔接处。我们按本目录的 288 个模式评审你的整体设计:架构、可靠性、评测与成本,每一条结论都对应到能修复它的模式。
€750(原价 €1,500),一周交付,书面报告加讲解通话,9月30日前