2026年7月,上海。世界人工智能大会(WAIC 2026)的一场分论坛上,黎曼动力团队演示了一段令人印象深刻的画面:一台双灵巧手机器人面对一张从未见过的餐桌——台布颜色不同、杯子位置偏移——准确完成了从抓取、移动到摆放的全套动作。
台下有人小声说了一句:“它好像真的看懂了。”
这背后,是昆仑万维旗下子公司黎曼动力刚刚发布的通用机器人操作模型 Riemann-1.0。

▲图片由AI生成 Riemann-1.0 在 WAIC 2026 首次亮相,登顶 RoboCasa-365 基准测试
一组关键数字:Riemann-1.0 在 RoboCasa-365 基准测试中成功率达 62.6%,较此前 SOTA 提升 8.4 个百分点。真机实测四类家务任务平均成功率 85%。在从未见过的陌生家居布局中,泛化成功率仍维持在 73.4%。
一、Riemann-1.0 是什么?
Riemann-1.0 是昆仑万维旗下黎曼动力推出的通用机器人操作模型,定位为行业首个 “世界动作模型”。它并非传统的 VLA(视觉-语言-动作)模型,而是一个融合了世界模型物理推演能力的“机器人操作智能体”。
与市面上多数机器人模型依赖昂贵的人工示教数据不同,Riemann-1.0 的核心训练数据来自互联网上公开的人类日常视频——它通过“观察”人类如何生活来学习物理世界的操作常识。
发布时间线
- 2026年7月:在 WAIC 2026 上正式发布,同步登顶 RoboCasa-365 基准测试
- 2026年7月中旬:开放学术机构 API 申请与评估工具包
- 预计2026年7月20日:发布完整技术报告(含消融实验与失败案例分析)
关键规格一览
| 指标 | 数据 |
|---|---|
| 模型架构 | 扩散架构 + 全因果建模 |
| 训练数据总量 | 23.2 万小时 |
| 人类视频占比 | 超 70% |
| 覆盖场景 | 41 种日常场景 |
| 推理延迟 | 约 180ms(单张 A100) |
| 参数量 | 约 7B |
二、Riemann-1.0 诞生的行业背景
Riemann-1.0 发布的时机,正是具身智能行业从“仿真炫技”走向“真实家庭服务”的拐点。
2025年下半年至2026年上半年,行业普遍面临一个尴尬:机器人在仿真环境里表现惊艳,一旦进入真实家庭——沙发换了颜色、餐桌挪了位置——操作成功率就断崖式下跌。Google DeepMind 的 RT-2-X、斯坦福与英伟达合作的 3D-Diffuser Actor,无一不被这个瓶颈所困。
根本原因在于数据。传统机器人训练极度依赖人工示教或遥操作,每小时数据采集成本动辄数百美元,规模小且场景单一。机器人学到的更多是“视觉记忆”而非“操作逻辑”。
Riemann-1.0 选择了一条截然不同的路:让机器人像学徒一样,先“旁观”人类生活。它用 23.2 万小时的视频数据证明:让机器人“看”人类干活,比“教”它干活效率更高、泛化能力更强。
三、核心技术解析:Riemann-1.0 如何工作?
1. 数据策略:从“机器人示教”转向“人类观察”
Riemann-1.0 的训练数据总量达 23.2 万小时,其中人类第一视角视频占比超过 70%,覆盖烹饪、收纳、布料处理等 41 种日常场景。
但人类视频没有机器人的动作标签,无法直接用于训练。黎曼动力团队为此自研了一套自动化数据处理流水线:
- 矫正与分割:矫正画面畸变,利用视觉语言模型将长视频切割为细粒度的动作单元
- 3D重建与转化:通过 3D 重建技术,将人类手部运动轨迹转化为机器可读的坐标数据
- 质量筛选:经过多重筛选,最终形成结构化的“动作教材”
2. 三阶段递进训练
第一阶段:物理直觉预训练。 在海量人类视频上进行自监督预训练,让模型理解物理世界的基本规律——杯子是硬的、布料是软的、拉开门之前要先握住把手。这一步不需要任何标签,纯粹靠“看”。
第二阶段:动作对齐。 引入少量带标签的机器人轨迹数据,将学到的“物理直觉”校准为具体的机器人控制信号。这一步解决的是“人-机”形态差异问题。
第三阶段:强化优化。 在仿真环境中通过强化学习进一步打磨长程任务的连贯性和成功率。
3. 世界动作模型架构
Riemann-1.0 的核心是“世界动作模型”架构——它并非单纯的 VLA 模型,而是在决策前加入了环境动态预演环节。模型会进行约 0.3 秒的物理推演,预判动作后果,再输出最终控制指令。
这个差异在面对布料褶皱、液体洒落、柔性物体形变等非线性物理交互时效果显著。内部消融实验显示,这一机制使操作成功率比纯 VLA 模型高出 21%。
四、实测表现:从仿真榜首到真机验证
1. 仿真测试:RoboCasa-365 登顶
在公认难度极高的 RoboCasa-365 家务基准测试中,Riemann-1.0 以 62.6% 的总成功率登顶,将此前的最优水平大幅提升了 8.4 个百分点。该榜单上大部分模型的成绩仍在 50% 以下。
| 模型 | 研发方 | RoboCasa 成功率 | 数据策略 |
|---|---|---|---|
| Riemann-1.0 | 黎曼动力(昆仑万维) | 62.6% | 人类视频主导 |
| RT-2-X | Google DeepMind | 54.2% | 机器人轨迹主导 |
| 3D-Diffuser Actor | 斯坦福/英伟达 | 57.8% | 仿真合成数据主导 |
2. 真机实测:85% 平均成功率
在双灵巧手机器人平台上的真实环境测试中,Riemann-1.0 完成了四类典型家务任务:
- 积木堆叠:92.3%
- 布料折叠:86.7%
- 厨房收纳(含开柜门):89.5%
- 杂物整理:91.2%
加权平均成功率 85%。在需要连续 5 步以上的长程任务中,过程完成度高达 94.43%。
3. 泛化能力:陌生场景仍有 73.4%
在从未见过的陌生家居布局中——台面高度不同、柜门方向反了、道具颜色全换——Riemann-1.0 的泛化成功率依然维持在 73.4%。这证明它学到的是“操作逻辑”而非“视觉记忆”。
五、行业定位与竞争格局
Riemann-1.0 的发布,让具身智能赛道的竞争格局出现了一些微妙的变化。
昆仑万维并非硬件公司,其优势长期集中在数字内容与 AI 模型领域。Riemann-1.0 的发布,标志着这家公司正式将“世界模型”的积累向物理空间延伸。昆仑万维 CEO 方汉在发布会上的表述值得留意:“Riemann-1.0 打开了一扇门,让机器人不再需要被‘手把手’教会每一个动作,而是通过观察人类如何生活,自主习得物理世界的常识与操作能力。”
公司内部已将 Riemann 系列定位为“AI for Physical World”的底座,2026 年被其称为 “世界模型元年”。
六、常见问题解答
Riemann-1.0 是开源的吗?
截至 2026 年 7 月,尚未开源。但推理 API 和基准测试评估工具包已向学术机构开放申请,企业用户可通过官网提交商业合作意向。
它能跑在人形机器人上吗?
可以用于上肢操作控制。其动作空间采用归一化末端坐标+关节角度残差的通用表示,兼容绝大多数机械臂和人形机器人上肢。但下肢移动规划不是本版本的重点。
推理速度快吗?需要什么硬件?
单张 A100(80G)上单步推理约 180ms,满足实时控制需求。
训练数据安全吗?
所有人类视频均来自公开数据集或经脱敏处理的合规来源,不涉及个人隐私数据。
完整技术报告何时发布?
黎曼动力表示,Riemann-1.0 的完整技术报告预计于 2026 年 7 月 20 日 前后发布。
七、总结与展望
Riemann-1.0 的真实价值,不在于它刷榜的数字,而在于它验证了一条低成本、可规模化的具身智能路径。
过去几年,机器人的“智能”很大程度上靠堆人力和资金堆出来——昂贵的遥操作设备、反复的仿真训练、漫长的现场调试。而 Riemann-1.0 指向了另一种可能:互联网上海量的人类日常视频,本身就是一座尚未被充分开采的“操作知识金矿”。
当然,Riemann-1.0 还远非完美。它的移动能力缺失、复杂场景下的失败率、以及从仿真到真实世界的迁移鸿沟,都是需要持续攻克的课题。但至少,它指明了一个方向——让机器人“看”人类生活,而不是“背”操作手册。
一句话总结:Riemann-1.0 是昆仑万维黎曼动力发布的通用机器人操作模型,以「人类视频预训练」为核心范式,在 RoboCasa-365 基准测试中登顶(62.6%),真机实测平均成功率 85%。适合 具身智能研究者、家庭服务机器人开发者、工业自动化从业者 关注。
了解更多:关注黎曼动力官方技术报告(预计 7 月 20 日发布)
© 版权声明
© 本站文章版权归 众享AI 所有,未经许可禁止转载。
相关文章
暂无评论...



