Dans l'actualité
The Physics of Multi-Turn Long-Horizon Planning: From Pre-training to Post-training via Single- and Multi-Teacher On-Policy Agentic Distillation
arXiv cs.AI · Publié le · 3 min de lecture
En 30 secondes
- Ce qui s'est passé
- Researchers studied how AI agents learn multi-step planning through pre-training, post-training refinement, and multi-teacher knowledge integration using controlled environments.
- Pourquoi ça compte
- Engineers building foundation model agents need this when designing training pipelines for long-horizon planning tasks and understanding data quality tradeoffs.
- Vigilance
- Study uses controlled synthetic environments, not real-world data. Findings about trajectory quality and teacher compatibility may not transfer to production settings.
Écouter ce résumé
Extrait de l'article
-->
Computer Science > Computation and Language
arXiv:2607.24720v1 (cs)
[Submitted on 27 Jul 2026]
Title: The Physics of Multi-Turn Long-Horizon Planning: From Pre-training to Post-training via Single- and Multi-Teacher On-Policy Agentic Distillation
Authors: Tianyi Men , Zhuoran Jin , Kang Liu , Jun Zhao
View a PDF of the paper titled The Physics of Multi-Turn Long-Horizon Planning: From Pre-training to Post-training via Single- and Multi-Teacher On-Policy Agentic Distillation, by Tianyi Men and 3 other authors
View PDF HTML (experimental)
Abstract: Multi-turn long-horizon planning is critical for foundation model agents, yet how to fundamentally improve it remains unclear. Existing models are trained on uncontrollable and opaque Internet data, making it difficult to identify how planning ability is acquired, shaped, and integrated. To address this challenge, we introduce a unified and controlled multi-turn environment that enables precise control. It allows systematically study long-horizon planning across three stages. (1) Planning ability acquisition during pre-training. We study data format, distribution, and quality. Explicit world model construction through CoT state transition modeling yields stronger long-horizon generalization. Atomic skills alone are insufficient for compositional generalization, whereas a litte long-horizon data works. Moreover, suboptimal t
Extrait de l'original. Lisez l'article complet à la source.
- agent
- agentic
The Agent Architect
Un pattern, un compromis, une panne de production racontée. Un brief hebdomadaire court pour ceux qui construisent des systèmes agentiques.
Un email par semaine, désinscription en un clic. Votre adresse ne sert qu'à envoyer le brief.