导语:
9月的上海,华为全联接大会2026以“智启新未来”为主题,系统阐述AI基础设施的构建新路径。在华为云生态伙伴开放麦上,北京人形机器人创新中心有限公司(以下简称“北京人形”)多模态算法负责人张怡,以《从“预测世界”到“执行任务”:世界模型驱动机器人的理解、规划与行动》为题,分享了北京人形统一具身世界模型 Pelican-Unify 的探索与实践。


“具身智能这几年最不缺的,是令人惊叹的演示。最缺的,是换一个场景、换一个物品、换一台本体之后,还依然能够完成任务的能力。”
张怡开门见山,把行业争论的焦点从“演示效果”拉回到“泛化能力”这个硬指标上。她把具身智能模型的泛化拆成了四层递进的台阶:背景泛化、组合泛化、交叉泛化,以及最难企及的域外泛化。
“泛化上限,决定了具身智能是从实验室走向真实世界的通行证,还是一张只在一个考场有效的准考证。”
这也是 Pelican-Unify 的立论之本。

张怡介绍,Pelican-Unify 是北京人形的统一具身世界模型,整体参数量 14B,已完成真机推理验证。它的架构是:
上层,是一个统一的VLM理解器与推理器。 负责理解与推理——把场景、指令、视觉上下文和动作历史映射进同一个语义空间,生成面向任务、动作与未来后果的任务链式推理,并将这条推理链压缩为稠密隐变量,传递给下层。
下层,是一个统一的未来生成器。 基于上层传来的隐变量,一个共享的扩散Transformer架构同时生成未来视频和未来动作——机器人在“想象中”看到任务将如何展开,也在“想象中”得到自己该做的每一个动作。
训练目标,是统一的。 语言损失、视频损失、动作损失三者反向传播到同一个共享表示中,相互约束、共同优化。
“很多多模态模型,是把几个能力在输出端拼在一起。我们主张的统一,是共享表示、相互约束、共同训练——这是本质区别。”张怡强调, Pelican-Unify对三类泛化以及对扩散模型有益的能力要提升,原本的通用理解能力要守住。

张怡介绍了北京人形的具身大模型技术版图——双线并进。
一条是大小脑分层架构。以具身多模态大模型 Pelican-VL 为“大脑”,负责意图理解、空间感知、自然交互与任务规划;以运控模型为“小脑”,负责全身控制、双臂协作、稳定移动与定位导航。这条路线成熟稳定,支撑着当下规模化落地的主力场景。
另一条,是以 Pelican-Unify 为代表的世界模型大一统路线——理解、规划、预测与行动在同一个模型中完成,代表更前沿的架构方向。
两条路线都跑在同一套“一脑多能”与“一脑多机”的“地基”上:具身天工通用人形机器人平台与慧思开物通用具身智能平台。一套智能系统,能跨工业、商用、家庭、特种作业多场景复用,也能驱动各种机器人硬件。
“模型再先进,也要有一副好身体和一块好平台来承载;数据再稀缺,也要有闭环让它转起来。这是全栈公司才有的便利,也是我们的责任。”
“具身智能不是一家企业能闭环的事。数据、算力、工具链、场景,每一个环节都需要伙伴。”她介绍了北京人形与华为云的深度协同:此前,北京人形已参与华为云“百模千态,云聚共赢”生态合作计划发布仪式,正式成为华为云具身智能生态合作伙伴,并入驻华为云行业AI梦工厂具身智能专区首批机构。
在标准共建层面,双方围绕SC42《人工智能 具身智能云协议要求》开展线上讨论,并对《人工智能 具身智能数据质量规范 第2部分:生成数据》《人形机器人与具身智能 灵巧手技术规范》提交了反馈意见——“把工程实践沉淀成标准,让后来者不必重复踩坑,这是头部企业应该做的事。”
面向未来,双方将聚焦三个方向深度协同:依托华为云算力底座与开发平台加速具身大模型研发迭代;联合搭建开放共享的开发者社区,整合数据集与仿真环境,降低行业研发门槛;深耕多元应用场景,以“云+端”软硬协同模式攻克产业化难点。
北京人形把“创新技术、服务人类、改变世界”作为理念——技术是出发点,人是目的地,让机器人先在想象中预演风险,再在现实中安心走进产线、家庭与危险现场。
作为工信部与北京市政府联合授牌的国家地方共建具身智能机器人创新中心、国内首家具身智能软硬件全栈科技公司,北京人形以“具身天工”与“慧思开物”两大平台为双核心,朝着“全球具身智能领导者”稳步前行。
以「慧思开物」为底座,北京人形正践行“不止步、不独行、不筑墙、不踩坑”,以“开物生态 万物·生”向全球伙伴开放代码、工具链与创新土壤。
当机器人开始“想象未来”,它也在帮人类预演一个更远的未来。北京人形正以前沿的技术创新带动和促进具身智能改变世界,一步步走向“人机共生”的明天。

扫一扫,或长按识别二维码
关注艾瑞网官方微信公众号