机器人学习买方常要求人类演示数据「更多样」,却缺少对覆盖度的共同定义。场景覆盖不等于原始小时数,也不等于营销场景库里的片段数量。它是一套可度量的组合——任务族、环境、交互类型与采集包络——训练与评估集真正用得上的那种。若不量化,采购就会默认盯着体量;而体量本身挡不住训练/评估偏斜、脆弱策略,或是表格上很「多样」、光学与时间失败模式却一再重复的批次。
本文是面向买方的指南,说明如何为第一视角双目人类演示项目量化场景覆盖。它把常被混为一谈的三件事拆开:(1) 用于范围讨论的场景库;(2) 证明传感器栈的我方设备参考采集;(3) 以可验收小时计量的产能。下文数字与产物仅来自可核验的公开事实:样片 2 条 episode、4,914 帧、合计 163.47 s(EP001 电脑接线 121.57 s;EP002 补货 41.90 s),以 LeRobot v3 发布、许可 CC BY-NC 4.0,配套工具与面向商业范围讨论的产品站。任何覆盖计划旁边都应写清那条不变的核心主张:时间戳是记录的,不是计算的。
为什么「多样性」当不了验收指标
「场景多样」听起来买方友好,却过不了质检。两家供应商都可以声称多样,同时交付:
- 同一接触模式、换壁纸的大量短片段
- 混用多类相机、却没有共享标定版本
- 软同步双目却标成第一视角双目
- 按 FPS 回填时间列,让每条 episode 看起来都像完美的 30 fps 网格
- 把第三方素材库说成与 SOW 参考同一套设备栈
覆盖度量化就是为了挡住这些替换。你需要的语言是:哪些任务族、在何种光学与时间包络下、带何种出处、每月可验收吞吐是多少。再软一点,交付后就会变成扯皮。
覆盖的三层(不要合并)
第一层 — 场景库(范围参考)
场景库回答:我们该规划哪些内容族? 规划讨论里,一个有用的参考是 89 个片段、跨 8 个场景。用它讨论任务配比、边界情况与评估切片——工厂装配相对电子、零售补货相对家庭操作、包装相对服装作业,等等。
关键边界:在该场景库叙事中,只有 EP001 与 EP002 是我方设备采集。不要在 SOW、数据集卡片或销售材料里,把其余库内片段写成同一设备栈录制。场景库是覆盖规划地图,不是声称每个片段都具备公开样片的双目、IMU 与时间戳属性。
第二层 — 我方设备参考样片(包络证明)
没有封存光学/时间包络的覆盖是虚构。公开样片是可核验的证明——「第一视角双目人类演示」在验收上意味着什么:
| 项目 | 事实 |
|---|---|
| Episodes | 2(EP001 电脑接线,EP002 补货) |
| 帧数 | 4,914 |
| 时长 | 163.47 s(121.57 s + 41.90 s) |
| 视频 | 1920×1200/目,彩色 RGB,30 fps,硬件同步双目 |
| 时序 | 帧间隔中位数 = p99 = 最大值 ≈ 33.28 ms;0 超规;100% 设备侧时间戳;无插值 |
| IMU | 300.48 Hz;每曝光 10 个样本;18,050 连续;0 处间隙 >10 ms |
| 位姿 | 逐帧 6-DoF 头部位姿 |
| 双目质检 | 基线 60.7 mm;Sampson 0.166 px;重投影 0.800 px;15,811 内点 |
| 标定 | K、KB4、R1/R2、P1/P2、Q、IMU↔cam、标定版本 |
| Schema | LeRobot v3;LeRobotDataset();pi-data-sharing |
| 许可(样片) | CC BY-NC 4.0 |
EP001(接线)与 EP002(补货)刻意对应不同交互模式——精细电子接触相对货架/补货运动——这样覆盖讨论可以从两个真实任务起步,而不必虚构第三类设备。
第三层 — 产能(可验收小时)
产能回答:每月能发出多少已通过验收的小时? 参考数字是 10,000+ 可验收小时/月。「可验收」必须指已通过与样片包络相同门控的小时——硬件同步、记录时间戳、IMU 连续性、标定打包、schema 加载——而不是原始墙钟录制时间。把产能与场景库片段数混在一起,团队就会买到 10,000 小时错误分布。
买方可用的实用覆盖记分卡
沿可审计的轴量化覆盖。让每条轴独立,这样强场景库遮不住弱时间基准。
1. 任务族配比(来自 89 / 8 场景库)
开录前为每个场景族设定目标百分比。规划问题示例(不是虚构交付承诺):
- 精细装配/类接线接触,相对类补货伸取放置,各要多少可验收小时?
- 哪些评估场景必须留出、永不进入训练批次?
- 哪些族只用于范围讨论(库片段),哪些是生产采集承诺?
把配比写成按族的可验收小时目标,而不是「我们会覆盖场景库」。库的 89 片段 / 8 场景 提供分类法;生产小时在设备包络下兑现该分类法。
2. 交互密度与 episode 长度
覆盖不只是「哪个房间」。接触密集的接线(EP001,121.57 s)与更短的补货(EP002,41.90 s)说明:episode 长度与交互密度也应上记分卡。要求清单报告每条 episode 时长、帧数与任务标签,才能发现供应商用空转走动填满某族配额。
3. 光学与时间包络覆盖
每小时可验收交付都应落在声明包络内:
- 双目 1920×1200、30 fps、硬件同步双目
- 间隔统计匹配参考档(中位数/p99/最大值 ≈ 33.28 ms,0 超规)
- 时间戳在设备上记录——100% 覆盖、无插值
- IMU 约 300.48 Hz,每曝光 10 样本,0 处间隙 >10 ms
- 逐帧 6-DoF 头部位姿
若一批次靠加入软同步或回填素材来「扩大覆盖」,应视为另一种产品,而不是同一种覆盖的更多份。
4. 几何与标定覆盖
双目覆盖需要随货产物:K、KB4、R1/R2、P1/P2、Q、IMU↔cam 外参,以及标定版本。公开参考量级的残差报告(Sampson 0.166 px、重投影 0.800 px、15,811 内点、基线 ~60.7 mm)给质检一个数字伴证。没有版本化标定的覆盖,是你无法复现的覆盖。
5. Schema 与许可覆盖
以 LeRobot v3 交付,可用 LeRobotDataset() 加载,并对齐 Physical-Intelligence/pi-data-sharing 检查。公开样片的 CC BY-NC 4.0 是可核验的参考许可;生产批次的商业条款写在 SOW。Schema 覆盖意味着每小时可验收都能同样加载——而不是一半「多样」集合需要定制适配器。
如何度量覆盖、又不夸大出处
买方与供方应共享一条出处规则:
- 场景库片段(89 / 8)= 规划分类法与讨论起点。
- EP001 / EP002 = 带完整包络指标的我方设备双目参考。
- 生产批次 = 在 SOW 门控下的可验收小时,与场景库规模分开计数。
- 绝不暗示非 EP001/EP002 的库素材继承样片的硬件同步、IMU 连续性或标定残差。
这条规则保护双方。买方避免为虚幻设备出处付钱。供方避免无意越界宣称。覆盖报告于是列出:各族小时、包络通过率、所用标定版本、schema 加载成功——而不是把混源素材洗进同一个「第一视角双目」桶。
可粘贴的场景覆盖 SOW 表述
SCENE COVERAGE — QUANTIFICATION BLOCK
[ ] Coverage taxonomy referenced from scene library: 89 clips / 8 scenes (scoping only)
[ ] Provenance rule: only EP001 and EP002 are our-device reference captures in the library narrative
[ ] Accepted-hour targets assigned per scene family (table attached)
[ ] Eval hold-outs named; not counted toward training coverage quotas
[ ] Optical/temporal envelope for all accepted hours:
1920×1200/eye, 30 fps, hardware-synced stereo;
median=p99=max ≈ 33.28 ms; 0 out of spec;
100% device-side timestamps, no interpolation (timestamps recorded, not computed);
IMU ~300.48 Hz, 10 samples/exposure, 0 gaps >10 ms; per-frame 6-DoF head pose
[ ] Calibration products ship with each batch: K, KB4, R1/R2, P1/P2, Q, IMU↔cam, version
[ ] Geometric QA reported against reference class where applicable
(baseline ~60.7 mm; Sampson 0.166 px; reprojection 0.800 px; 15,811 inliers at sample scale)
[ ] Delivery schema: LeRobot v3; LeRobotDataset(); pi-data-sharing checks
[ ] Capacity commitment stated as accepted hours/month (reference: 10,000+)
[ ] Public sample reference: 2 episodes / 4,914 frames / 163.47 s
(EP001 wiring 121.57 s; EP002 restocking 41.90 s)
演算示例:从场景库到可验收小时
假设某项目要电子接触与零售补货的模仿数据。用公开样片作包络证明:
- 让工程打开 Hugging Face 上的 EP001(接线,121.57 s)与 EP002(补货,41.90 s)。
- 仅用 89 片段 / 8 场景 库决定相邻哪些族进训练、哪些进评估。
- 按族写可验收小时配额,并要求每批通过上述时序/IMU/标定/schema 门。
- 月供对照 10,000+ 可验收小时/月 产能计数——不要对照场景库缩略图有多少。
- 清单分开「范围库 ID」与「生产 episode ID」,让出处可审计。
这套流程把「更多样」变成带通过/失败列的表格,而不是一种感觉。
软性下一步
若你在规划第一视角双目人类演示,需要一份采购与研究都能签字的覆盖计划:先从可核验样片起步——2 episodes / 4,914 帧 / 163.47 s、硬件同步双目、设备侧时间戳、连续 IMU、版本化标定、LeRobot v3——再用 89 片段 / 8 场景 库叠任务族目标,且不夸大设备出处。
- 样片:https://huggingface.co/datasets/tatezhou/ego-stereo-cn-v1
- 工具:https://github.com/TateZhouSiu/ego-stereo-cn-v1-tools
- 产品:https://10khoursdata.com
- 联系:tate@10khoursdata.com
可约一次讲解:可验收小时如何对照包络门计数,以及场景库范围讨论如何与我方设备参考采集分开。这是从「我们需要多样演示」走到可量化覆盖 SOW 的最短路径。
10K HoursData — 第一视角双目人类演示数据,时间戳是记录的、不是计算的;场景库用于范围讨论;可验收小时用于供给。