400 128 6709

行业新闻

NeurIPS 2025 | 机器人操纵世界模型来了,成功率超过谷歌RT-1 26.6%

发布时间:2024-11-01点击次数:

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

neurips 2024 | 机器人操纵世界模型来了,成功率超过谷歌rt-1 26.6%

AIxiv专栏是本站发布学术、技术内容的栏目。过去数年,本站AIxiv专栏接收报道了2000多篇内容,覆盖全球各大高校与企业的顶级实验室,有效促进了学术交流与传播。如果您有优秀的工作想要分享,欢迎投稿或者联系报道。投稿邮箱:liyazhou@jiqizhixin.com;zhaoyunfeng@jiqizhixin.com

对于人类而言,一旦掌握了 “打开瓶盖” 的动作,面对 “拧紧螺丝” 这样的任务通常也能游刃有余,因为这两者依赖于相似的手部动作。然而,对于机器人来说,即使是这样看似简单的任务转换依然充满挑战。例如,换成另一种类型的瓶盖,机器人可能无法成功打开。这表明,目前的机器人方法尚未充分让模型学习到任务的内在执行逻辑,而只是单纯的依赖于数据拟合。

针对该问题,来自中山大学和华为诺亚等单位的研究团队提出了一种全新的原语驱动的路径点感知世界模型,借助 VLMs 作为机器人的大脑,理解任务之间的动作关联性,并通过 “世界模型” 获取对未来动作的表征,从而更好地帮助机器人学习和决策。该方法显著提升了机器人的学习能力,并保持良好的泛化性。

NeurIPS 2024 | 机器人操纵世界模型来了,成功率超过谷歌RT-1 26.6%

  • 论文地址:https://arxiv.org/abs/2410.10394
  • 项目主页:https://abliao.github.io/PIVOT-R/

研究动机

NeurIPS 2024 | 机器人操纵世界模型来了,成功率超过谷歌RT-1 26.6%

当前,现有机器人操作任务有两个关键问题:

  1. 机器人模型在开放世界中表现差且不稳定:许多机器人操作模型虽然能够处理复杂任务,但往往直接将用户指令和视觉感知映射到低层次的可执行动作上,而忽略了操作任务中关键状态(路径点)的建模。这种方式容易使模型记住表面数据模式,导致模型在开放环境中表现脆弱。模型缺乏对关键路径点的预测,使得每个动作的随机性可能逐步放大,降低了任务的执行成功率。
  2. 计算效率低:随着模型的增大(例如 RT-2, RT-H),运行速率随之降低,无法满足机器人任务实时性的需求。

为了解决上述问题,研究团队提出了 PIVOT-R,一种原语驱动的路径点感知世界模型。如上图所示,对比左图现有的方法,右图展示了 PIVOT-R 通过关注与任务相关的路径点预测,提升机器人操作的准确性,并设计了一个异步分层执行器,降低计算冗余,提升模型的执行效率。

这样做有几个好处:

  1. 它使得模型可以更好的学习任务与动作之间的内在关联性,减少其他干扰因素的影响,并更好地捕捉不同任务之间的相似性(例如,拧瓶盖和拧螺丝的动作是相似的,拿杯子和搭积木都有一个抓住物体的过程),从而使得模型可以在多任务数据下学习到可迁移的知识。
  2. 通过世界模型建模的方式获得对未来关键动作的表征,避免了文本语言带来的模糊性、不确定性。
  3. 通过异步执行的方式,确保各模块独立运行、互不阻塞,从而有效避免了大模型导致的低速率问题。

研究方法 

NeurIPS 2024 | 机器人操纵世界模型来了,成功率超过谷歌RT-1 26.6%

原语动作解析

PIVOT-R 的第一个核心步骤是原语动作解析,这一步通过预训练的视觉 - 语言模型(VLM)来解析用户的语言指令。VLM 可以将复杂的自然语言指令转换为一组简单的原语动作,例如 “靠近”、“抓取”、“移动” 等。这些原语动作为机器人提供了操作任务的粗略路径。

具体流程如下:

  1. 用户输入的语言指令(例如 “请给我那个杯子”)首先被输入到 VLM 中,VLM 会将其解析为与任务相关的原语动作(如 “靠近杯子”、“抓取杯子”)。
  2. 原语动作作为提示,指导机器人在接下来的步骤中专注于特定的操作轨迹点。这种方式确保机器人不会被复杂的环境因素干扰,而是明确知道每个动作的目的。

路径点预测

Remover Remover

几秒钟去除图中不需要的元素

Remover 304 查看详情 Remover

在原语动作解析后,PIVOT-R 的下一步是路径点预测。路径点代表了机器人操控过程中一些关键的中间状态,例如靠近物体、抓取物体、移动物体等。通过预测路径点,PIVOT-R 能够在机器人执行任务时提供明确的操作指导。具体来说,通过一个 Transformer 架构的模型,预测路径点对应的视觉特征,为后续的动作预测模块提供指引。

动作预测模块

动作预测模块负责根据预测的路径点生成具体的低层次机器人动作。它以路径点为提示,结合机器人历史状态(如位置、姿态等),计算下一步应该执行的动作。该模块使用轻量级的 Transformer 架构进行动作预测,确保计算效率和性能的平衡。这一模块的设计重点在于低延迟和高精度执行操控任务。

异步分层执行器

此外,PIVOT-R 还引入了一个关键的执行机制,即异步分层执行器。与以往的机器人模型不同,PIVOT-R 并不对所有模块在每一步都进行同步更新,而是为不同模块设置了不同的执行频率,以多线程的方式进行异步更新,从而提升执行速度。

实验

作者在具有复杂指令的 SeaW*e *环境和真实环境下进行实验。

NeurIPS 2024 | 机器人操纵世界模型来了,成功率超过谷歌RT-1 26.6%

NeurIPS 2024 | 机器人操纵世界模型来了,成功率超过谷歌RT-1 26.6%

如 Table 1 和 Table 2 所示,PIVOT-R 在*环境和真实环境都取得了最优的效果,同时,模型的速度和 RT-1 等方法速度相近,没有因为使用大模型而导致速度变慢。

NeurIPS 2024 | 机器人操纵世界模型来了,成功率超过谷歌RT-1 26.6%

作者也在 SeaW*e 上做了泛化性测试,在三种泛化性测试场景下,PIVOT-R 仍保持远高于其他模型的成功率。

研究总结

PIVOT-R 通过引入原语动作驱动的路径点感知,显著提升了机器人在复杂操控任务中的性能。该模型不仅在执行效率上具备优势,还能够更好地应对复杂、多变的环境。该方法在*环境和真实环境操纵下表现优异,为机器人学习提供了一个新范式。

以上就是NeurIPS 2025 | 机器人操纵世界模型来了,成功率超过谷歌RT-1 26.6%的详细内容,更多请关注其它相关文章!


# 诺亚  # 自制大型网站建设  # 井冈山seo全网优化  # 衡阳市品牌营销推广中心  # 湖州网站优化平台  # 青岛网站优化在哪里  # 电子网站推广排名  # 实景现房如何做推广营销  # 敦煌网络推广招聘网站  # 山东智能化网站建设平台  # 微商水印相机seo引流  # 数年  # 操作流程  # 中山大学  # 工程  # 更好地  # 所示  # 执行器  # 提出了  # 多线程  # 来了  # type  # 邮箱  # ai  # 谷歌  # git  # pivot-r  # 机器人 


相关栏目: 【 行业新闻62819 】 【 科技资讯67470


相关推荐: 智能机器人正在彻底改变客户服务  人工智能在重症监护室的未来  浪潮KaiwuDB:“快人一步” - 打造更懂物联网的数据库  奥比中光子公司和斯坦德机器人深度合作,共同推进新一代激光雷达的研发  京东 AI 大模型官宣 7 月 13 日发布,还有重磅合作  人工智能的变革之路:通过OpenAI的GPT-4漫游  微软在 Bing 和 Edge 浏览器中拓展网购服务,帮用户选购心仪产品  中国最强AI研究院的大模型为何迟到了  元宇宙迈入2.0时代,它和生成式人工智能有何关联吗?  Gartner发布中国企业人工智能趋势浪潮3.0  阿里云连续两年进入Gartner云AI开发者“挑战者象限”  人工智能赋能无人驾驶:商业化进程再提速  人工智能在商业中的风险和局限性  LinkedIn 推出生成式 AI 辅助撰写帖文功能,将向所有用户开放  苹果AIGC专利:可通过语音指令生成AR/VR虚拟场景  轻量级的深度学习框架Tinygrad  自己动手使用AI技术实现数字内容生产  探展WAIC |万向区块链杜宇:不存在单一技术的iPhone时刻,Web3.0核心将基于AI+区块链+物联网  微软新出热乎论文:Transformer扩展到10亿token  构建AI绘画网站的方法:使用API接口和调用步骤  应用生成式人工智能技术改善农业产业  谷歌借AI打破十年排序算法封印,每天被执行数万亿次,网友却说是最不切实际的研究?  AI框架生态峰会本周开幕 华为昇腾“朋友圈”再聚首 全球首个全模态大模型将登场  央视报道车载人机交互技术!MWC上海魅族表现亮眼,现场热火朝天  1000万张照片训练AI模型 科学家找到水下定位新方法  谷歌推出RT-2视觉语言动作模型,使机器人能够掌握垃圾丢弃技能  大疆 Air 3 无人机售价和实物照片曝光  微软宣布为 Azure AI 添加男性声线,增强文本转语音功能  Stability AI 推出文生图模型 SDXL0.9,GPU要求下探至消费级水平  AMD在ChinaJoy展示全新的锐龙AI笔记本,开创了人工智能领域的新时代!  解决导航“最后50米”难题 高德地图升级AR步行导航找终点功能  “聚智启新,‘蓉’力同行” 成都市人工智能产业融通对接会成功举办  人工智能创作的“婴儿版超级英雄”,你觉得哪个最可爱  OpenAI限制网络爬虫访问以保护数据免被用于AI模型训练  【澎湃原动力】人工智能产业协同创新中心:全产业链资源在这里汇聚  朝鲜出现国产大型察打一体无人机,实力世界第二,太意外了  WAIC 2025|云深处科技绝影Lite3与X20四足机器人亮相  Dubbo负载均衡策略之 一致性哈希  利用AI探索抗体“钥匙”、加速药物研发——访百图生科团队  360°/180°双模式,佳能公布可折叠小体积的VR全景相机  赋能金融新生态,多家银行创新应用成果亮相世界人工智能大会  马斯克的幽默“现实”:AR眼镜与20美元“增强现实”哪个真实?  普林斯顿大学推出 Infinigen AI 模型,生成真实自然环境 3D 场景  高质量数据推动AI场景化应用快速发展及落地  从GOXR到PartyOn,XRSPACE致力打造多元共赢的元宇宙世界  2025VR&AR显示技术峰会展示歌尔光学最新一代光学模组  “踩油门,也要会踩刹车” 互联网企业高管谈人工智能发展  人工智能快速发展 打开就业新空间  AI在教育中的角色:AI如何改变我们的学习方式  “五年内人类程序员将消失”预言引争议,AI真的那么强大了吗? 

400 128 6709
E-mail

contact@tlftec.cn

扫一扫,添加微信

©  云南淘乐房科技有限公司 版权所有  滇ICP备2025071560号  

云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司