昆仑万维发布 Riemann-1.0:让机器人“看”20万小时人类视频,家务能力首超六成

2026年7月,上海。世界人工智能大会(WAIC 2026)的一场分论坛上,黎曼动力团队演示了一段令人印象深刻的画面:一台双灵巧手机器人面对一张从未见过的餐桌——台布颜色不同、杯子位置偏移——准确完成了从抓取、移动到摆放的全套动作。

台下有人小声说了一句:“它好像真的看懂了。”

这背后,是昆仑万维旗下子公司黎曼动力刚刚发布的通用机器人操作模型 Riemann-1.0

Riemann-1.0 WAIC 2026 发布现场

▲图片由AI生成   Riemann-1.0 在 WAIC 2026 首次亮相,登顶 RoboCasa-365 基准测试

一组关键数字:Riemann-1.0 在 RoboCasa-365 基准测试中成功率达 62.6%,较此前 SOTA 提升 8.4 个百分点。真机实测四类家务任务平均成功率 85%。在从未见过的陌生家居布局中,泛化成功率仍维持在 73.4%

一、Riemann-1.0 是什么?

Riemann-1.0 是昆仑万维旗下黎曼动力推出的通用机器人操作模型,定位为行业首个 “世界动作模型”。它并非传统的 VLA(视觉-语言-动作)模型,而是一个融合了世界模型物理推演能力的“机器人操作智能体”。

与市面上多数机器人模型依赖昂贵的人工示教数据不同,Riemann-1.0 的核心训练数据来自互联网上公开的人类日常视频——它通过“观察”人类如何生活来学习物理世界的操作常识。

发布时间线

  • 2026年7月:在 WAIC 2026 上正式发布,同步登顶 RoboCasa-365 基准测试
  • 2026年7月中旬:开放学术机构 API 申请与评估工具包
  • 预计2026年7月20日:发布完整技术报告(含消融实验与失败案例分析)

关键规格一览

指标数据
模型架构扩散架构 + 全因果建模
训练数据总量23.2 万小时
人类视频占比超 70%
覆盖场景41 种日常场景
推理延迟约 180ms(单张 A100)
参数量约 7B

二、Riemann-1.0 诞生的行业背景

Riemann-1.0 发布的时机,正是具身智能行业从“仿真炫技”走向“真实家庭服务”的拐点。

2025年下半年至2026年上半年,行业普遍面临一个尴尬:机器人在仿真环境里表现惊艳,一旦进入真实家庭——沙发换了颜色、餐桌挪了位置——操作成功率就断崖式下跌。Google DeepMind 的 RT-2-X、斯坦福与英伟达合作的 3D-Diffuser Actor,无一不被这个瓶颈所困。

根本原因在于数据。传统机器人训练极度依赖人工示教或遥操作,每小时数据采集成本动辄数百美元,规模小且场景单一。机器人学到的更多是“视觉记忆”而非“操作逻辑”。

Riemann-1.0 选择了一条截然不同的路:让机器人像学徒一样,先“旁观”人类生活。它用 23.2 万小时的视频数据证明:让机器人“看”人类干活,比“教”它干活效率更高、泛化能力更强。

三、核心技术解析:Riemann-1.0 如何工作?

1. 数据策略:从“机器人示教”转向“人类观察”

Riemann-1.0 的训练数据总量达 23.2 万小时,其中人类第一视角视频占比超过 70%,覆盖烹饪、收纳、布料处理等 41 种日常场景。

但人类视频没有机器人的动作标签,无法直接用于训练。黎曼动力团队为此自研了一套自动化数据处理流水线:

  • 矫正与分割:矫正画面畸变,利用视觉语言模型将长视频切割为细粒度的动作单元
  • 3D重建与转化:通过 3D 重建技术,将人类手部运动轨迹转化为机器可读的坐标数据
  • 质量筛选:经过多重筛选,最终形成结构化的“动作教材”

2. 三阶段递进训练

第一阶段:物理直觉预训练。 在海量人类视频上进行自监督预训练,让模型理解物理世界的基本规律——杯子是硬的、布料是软的、拉开门之前要先握住把手。这一步不需要任何标签,纯粹靠“看”。

第二阶段:动作对齐。 引入少量带标签的机器人轨迹数据,将学到的“物理直觉”校准为具体的机器人控制信号。这一步解决的是“人-机”形态差异问题。

第三阶段:强化优化。 在仿真环境中通过强化学习进一步打磨长程任务的连贯性和成功率。

3. 世界动作模型架构

Riemann-1.0 的核心是“世界动作模型”架构——它并非单纯的 VLA 模型,而是在决策前加入了环境动态预演环节。模型会进行约 0.3 秒的物理推演,预判动作后果,再输出最终控制指令。

这个差异在面对布料褶皱、液体洒落、柔性物体形变等非线性物理交互时效果显著。内部消融实验显示,这一机制使操作成功率比纯 VLA 模型高出 21%

四、实测表现:从仿真榜首到真机验证

1. 仿真测试:RoboCasa-365 登顶

在公认难度极高的 RoboCasa-365 家务基准测试中,Riemann-1.0 以 62.6% 的总成功率登顶,将此前的最优水平大幅提升了 8.4 个百分点。该榜单上大部分模型的成绩仍在 50% 以下。

模型研发方RoboCasa 成功率数据策略
Riemann-1.0黎曼动力(昆仑万维)62.6%人类视频主导
RT-2-XGoogle DeepMind54.2%机器人轨迹主导
3D-Diffuser Actor斯坦福/英伟达57.8%仿真合成数据主导

2. 真机实测:85% 平均成功率

在双灵巧手机器人平台上的真实环境测试中,Riemann-1.0 完成了四类典型家务任务:

  • 积木堆叠:92.3%
  • 布料折叠:86.7%
  • 厨房收纳(含开柜门):89.5%
  • 杂物整理:91.2%

加权平均成功率 85%。在需要连续 5 步以上的长程任务中,过程完成度高达 94.43%。

3. 泛化能力:陌生场景仍有 73.4%

在从未见过的陌生家居布局中——台面高度不同、柜门方向反了、道具颜色全换——Riemann-1.0 的泛化成功率依然维持在 73.4%。这证明它学到的是“操作逻辑”而非“视觉记忆”。

五、行业定位与竞争格局

Riemann-1.0 的发布,让具身智能赛道的竞争格局出现了一些微妙的变化。

昆仑万维并非硬件公司,其优势长期集中在数字内容与 AI 模型领域。Riemann-1.0 的发布,标志着这家公司正式将“世界模型”的积累向物理空间延伸。昆仑万维 CEO 方汉在发布会上的表述值得留意:“Riemann-1.0 打开了一扇门,让机器人不再需要被‘手把手’教会每一个动作,而是通过观察人类如何生活,自主习得物理世界的常识与操作能力。”

公司内部已将 Riemann 系列定位为“AI for Physical World”的底座,2026 年被其称为 “世界模型元年”

六、常见问题解答

Riemann-1.0 是开源的吗?
截至 2026 年 7 月,尚未开源。但推理 API 和基准测试评估工具包已向学术机构开放申请,企业用户可通过官网提交商业合作意向。

它能跑在人形机器人上吗?
可以用于上肢操作控制。其动作空间采用归一化末端坐标+关节角度残差的通用表示,兼容绝大多数机械臂和人形机器人上肢。但下肢移动规划不是本版本的重点。

推理速度快吗?需要什么硬件?
单张 A100(80G)上单步推理约 180ms,满足实时控制需求。

训练数据安全吗?
所有人类视频均来自公开数据集或经脱敏处理的合规来源,不涉及个人隐私数据。

完整技术报告何时发布?
黎曼动力表示,Riemann-1.0 的完整技术报告预计于 2026 年 7 月 20 日 前后发布。

七、总结与展望

Riemann-1.0 的真实价值,不在于它刷榜的数字,而在于它验证了一条低成本、可规模化的具身智能路径

过去几年,机器人的“智能”很大程度上靠堆人力和资金堆出来——昂贵的遥操作设备、反复的仿真训练、漫长的现场调试。而 Riemann-1.0 指向了另一种可能:互联网上海量的人类日常视频,本身就是一座尚未被充分开采的“操作知识金矿”。

当然,Riemann-1.0 还远非完美。它的移动能力缺失、复杂场景下的失败率、以及从仿真到真实世界的迁移鸿沟,都是需要持续攻克的课题。但至少,它指明了一个方向——让机器人“看”人类生活,而不是“背”操作手册

一句话总结:Riemann-1.0 是昆仑万维黎曼动力发布的通用机器人操作模型,以「人类视频预训练」为核心范式,在 RoboCasa-365 基准测试中登顶(62.6%),真机实测平均成功率 85%。适合 具身智能研究者、家庭服务机器人开发者、工业自动化从业者 关注。

了解更多:关注黎曼动力官方技术报告(预计 7 月 20 日发布)

© 版权声明

相关文章

暂无评论

none
暂无评论...