ITBEAR科技资讯
网站首页 科技资讯 财经资讯 分享好友

谷歌DeepMind再发力:新机器人AI模型攻克全身控制,灵巧性挑战仍存

时间:2026-07-31 13:15:07来源:ITBEAR编辑:快讯

谷歌DeepMind近日宣布推出一款专为人形机器人设计的全新人工智能模型——Gemini Robotics 2,旨在实现机器人全身动作的精准协调。这一突破被视为谷歌将Gemini系列AI技术向机器人领域深度拓展的重要里程碑,目标是为机器人赋予推理能力、多任务规划能力以及适应复杂人类环境的能力。

与传统机器人模型主要聚焦上半身控制不同,Gemini Robotics 2实现了对整个人形机器人的全身动作整合。在DeepMind发布的预录演示中,该模型操控Apptronik公司的人形机器人Apollo完成了一系列复杂动作:从穿过房间、避开障碍物,到精准拿起洒水壶并放置在架子上,全程无需人工干预。这一成果展示了机器人在动态环境中自主决策与执行的能力。

与此同时,DeepMind还推出了另外两款协同工作的AI模型。其中,Gemini Robotics 2负责将摄像头捕捉的画面和自然语言指令转化为机器人电机的控制信号;而Gemini Robotics ER 2则作为“推理中枢”,规划多步骤任务并协调多个机器人共同完成目标。例如,在测试中,ER 2成功指挥机器人完成“拧下灯泡”任务,成功率高达92%,但在扎垃圾袋、密封Ziplock袋等更精细操作中,成功率仍有待提升。

谷歌强调,Gemini Robotics ER 2在安全性方面取得显著进展,尤其在遵循人类指令和避让障碍物方面表现突出。该模型将通过谷歌的AI Studio开发者平台开放,并在企业级AI平台上提供私人预览服务。而更专业化的Gemini Robotics 2和On-Device 2模型则优先向早期合作伙伴及100多家受信任的测试机构开放。

DeepMind机器人业务副总裁Carolina Parada表示,团队的目标是构建一个“通用智能层”,使所有机器人都能共享这一技术底座,从而将AI能力从虚拟世界延伸至物理场景。然而,业务总监Kanishka Rao也坦言,当前机器人仍面临诸多挑战:动作速度缓慢且谨慎,因为它们需要反复计算人类凭直觉就能完成的决策;学习效率远低于人类,例如人类只需一两次错误就能调整行为,而机器人仍需大量训练数据。

此次发布基于谷歌2025年推出的Gemini Robotics基础模型,该模型能将语言和视觉信息直接转化为机器人动作。这一战略标志着谷歌重启已延续十余年的机器人研发计划——此前,其母公司Alphabet曾收购多家机器人初创公司,但于2023年关闭了Everyday Robots部门。目前,谷歌正与Apptronik、Agile Robots SE和Boston Dynamics等核心合作伙伴展开合作,并向开发者开放模型候补名单。

在竞争格局方面,OpenAI和英伟达也在加速布局机器人AI领域。OpenAI致力于开发融合视觉、语言和动作的通用机器人基础模型,而英伟达则通过提供训练平台支持开发者优化AI机器人性能。随着技术迭代加速,机器人领域的商业化应用正迎来新的突破点。

更多热门内容