X-Planner:面向具身智能的事件结构化任务规划框架
针对现代视觉-语言-动作(VLA)系统在长程操作中缺乏显式中间结构、现有思维链规划器依赖粗粒度标注的问题,研究团队提出了 X-Planner 规划前端。该方案同时改善具身推理的监督与表征,融合了第一人称视角、通用操作接口及遥操作等多源数据,构建了具备分层粒度和差异化标注深度的规划数据集。由于原始摘要截断,具体的下游控制效果待全文进一步阐释。
针对现代视觉-语言-动作(VLA)系统在长程操作中缺乏显式中间结构、现有思维链规划器依赖粗粒度标注的问题,研究团队提出了 X-Planner 规划前端。该方案同时改善具身推理的监督与表征,融合了第一人称视角、通用操作接口及遥操作等多源数据,构建了具备分层粒度和差异化标注深度的规划数据集。由于原始摘要截断,具体的下游控制效果待全文进一步阐释。
针对当前智能体在重复任务中表现不一致且极度耗费资源的缺陷,研究团队开展测试发现,智能体在重复执行中不一致率达38%至74%,且超95%的生成内容都在重复推导已知方案。为此,研究提出“技能习惯养成”(skill habit formation)机制,让智能体从历史执行记录中挖掘候选确定性技能,使其与既有方案竞争并界定适用输入空间,从而大幅改善智能体在重复任务中的一致性与计算效率。