Loading...
🔮
世界モデルシミュレーションによるプランニング(WMSP)
エージェントは、各候補アクションの次の状態と結果を予測する世界モデルを保持する(あるいは LLM 自体を世界モデルとして用いる)とともに、実環境で何かを実行する前に先読みのロールアウト(「行動する前に想像する」)を走らせてアクションを評価・選択します。これはモデルベース強化学習を言語エージェントへ拡張したものであり、アクションが不可逆で、稼働中のウェブサイトや GUI 上で後戻りが不可能な場面で最も重要になります。複数の戦略的な未来を、行動と結果のシミュレーターなしで推論する scenario-planning とは異なり、また、シミュレートされた環境状態ではなく推論トレースを探索する reflective-mcts とも異なります。
複雑さ: highプランニング
In 30 seconds
- What
- エージェントは LLM や学習済みモデルで候補となる行動の結果をシミュレートし、それらを採点したうえで、最良のものを実環境で実行します。
- When to use
- 本番のウェブサイトや GUI 上での不可逆な操作で、後戻りが不可能または高コストであり、ミスの代償が大きい場面。
- Watch out
- シミュレーションの誤差は積み重なります。ロールアウトの早い段階での予測ミスが連鎖し、採点ロジックが正しくても行動選択を誤らせます。
Loading technique guide…