Loading...
🔮
世界模型仿真规划(WMSP)
智能体维护一个世界模型(或直接将 LLM 本身用作世界模型),用它预测每个候选动作的下一状态和后果,然后在真实环境中执行任何操作之前,运行前瞻式推演(“先想象,再行动”)来对动作进行评分和选择。这将基于模型的强化学习扩展到语言智能体,在动作不可逆、且无法在线上网站或 GUI 上回退的场景中尤为重要。它不同于 scenario-planning,后者在没有动作-后果模拟器的情况下对若干战略性未来进行推理;也不同于 reflective-mcts,后者搜索的是推理轨迹,而非模拟的环境状态。
复杂度: high规划
In 30 seconds
- What
- 智能体用 LLM 或学习得到的模型模拟各候选动作的结果,为其打分,然后在真实环境中执行最优的那个。
- When to use
- 在线网站或图形界面上的不可逆操作:回退不可能或代价高昂,出错后果严重。
- Watch out
- 模拟误差会累积:推演早期的一次错误预测会层层放大,即便打分逻辑正确,动作选择依然会出错。
Loading technique guide…