正在加载模式…
世界模型仿真规划(WMSP)
智能体维护一个世界模型(或直接将 LLM 本身用作世界模型),用它预测每个候选动作的下一状态和后果,然后在真实环境中执行任何操作之前,运行前瞻式推演(“先想象,再行动”)来对动作进行评分和选择。这将基于模型的强化学习扩展到语言智能体,在动作不可逆、且无法在线上网站或 GUI 上回退的场景中尤为重要。它不同于 scenario-planning,后者在没有动作-后果模拟器的情况下对若干战略性未来进行推理;也不同于 reflective-mcts,后者搜索的是推理轨迹,而非模拟的环境状态。
30秒速览
- 是什么
- 智能体用 LLM 或学习得到的模型模拟各候选动作的结果,为其打分,然后在真实环境中执行最优的那个。
- 何时使用
- 在线网站或图形界面上的不可逆操作:回退不可能或代价高昂,出错后果严重。
- 注意
- 模拟误差会累积:推演早期的一次错误预测会层层放大,即便打分逻辑正确,动作选择依然会出错。
向AI专家咨询此模式
打开助手并预填您的问题,发送前可先确认。
世界模型仿真规划: 概览
智能体维护一个世界模型(或直接将 LLM 本身用作世界模型),用它预测每个候选动作的下一状态和后果,然后在真实环境中执行任何操作之前,运行前瞻式推演(“先想象,再行动”)来对动作进行评分和选择。这将基于模型的强化学习扩展到语言智能体,在动作不可逆、且无法在线上网站或 GUI 上回退的场景中尤为重要。它不同于 scenario-planning,后者在没有动作-后果模拟器的情况下对若干战略性未来进行推理;也不同于 reflective-mcts,后者搜索的是推理轨迹,而非模拟的环境状态。
- LLM or learned model simulates the outcome of each candidate action
- Look-ahead rollouts score actions before any real execution
- Avoids irreversible mistakes on live web and GUI environments
- Value function or scorer ranks the simulated end states
- More efficient than tree search that cannot backtrack a live action
- Self-evolving variants update the world model from prediction errors
The Agent Architect
每周一个模式、一个权衡、一个生产事故案例。为构建智能体系统的人准备的每周简报。
每周一封邮件,一键退订。您的地址仅用于发送简报。
参考资料
该模式所依据的论文、规范和代码仓库。
- Is Your LLM Secretly a World Model of the Internet? Model-Based Planning for Web Agents - Gu et al. (ArXiv 2024)arXiv:2411.06559
- Self-Evolving World Models for LLM Agent Planning - Zhang et al. (ArXiv 2026)arXiv:2606.30639
- Internalizing the Future: A Unified Agentic Training Paradigm for World Model Planning (ArXiv 2026)arXiv:2606.27483
由本目录背后的工程师执行
为你的智能体架构做一次评审
本页讲的是一个模式。真实系统会同时跑几十个,而多数故障恰恰出在它们的衔接处。我们按本目录的 288 个模式评审你的整体设计:架构、可靠性、评测与成本,每一条结论都对应到能修复它的模式。
€750(原价 €1,500),一周交付,书面报告加讲解通话,9月30日前