网境智能 · 手谈 SHOUTAN
手谈 SHOUTAN —— 具身智能数据采集与部署平台
人用手教,机器用手学。一副采集设备让录制下来的数据物理可用;一台 $899 的部署机器人把训练出的策略真正跑起来,并在干活的同时把数据再采回来。
为什么大多数录像是不能用的
具身智能需要的不是更多视频,而是能经受物理检验的视频。以下五项缺一项,录制内容在训练里就是噪声,而且事后都修不回来:同步误差(50 ms 的 RGB-IMU 偏移在原始数据里看不见,在策略训练里是灾难)、尺度不定性(单目在 Sim(3) 下求解,8 cm 和 80 cm 的杯子成同一张图)、卷帘快门(逐行曝光在高速运动下扭曲几何,而接触瞬间正是运动最快、信息最密的瞬间)、手的自我遮蔽(手指在接触闭合的瞬间出画)、触觉空白(视觉在物理上看不到力、剪切与滑移)。
对应的解法:硬件触发线做 ≤1 ms 硬同步(系统帧间隔抖动 <30 μs);63–70 mm 立体基线(Z = fB/d)让尺度可观测,IMU 兜底;双目鱼眼全局快门;手腕模块补上缺失视角;夹爪扭矩 + 视觉以十分之一以下的成本给出力的上界、接触位置与接触时刻。
工作原理:一个任务、四个界面、一本账
- 发布 GO — 买方选档位、看混合比、下单,款项进入托管;系统算混合比、定 SLA、锁预算。
- 仿真 ARENA — 仿真侧接单、训练、提交成果包;可用性预检 → 效果打分 → 消融归因,按效果分档结算。
- 采集 PICK — 采集者接单、自查、边录边改、提交;端侧过滤 + 云端分级(S / A / B),按合格样本分配采集池。
- 部署 CONSOLE — 机器人实机运行,达标全额放款、未达按分退款。
部署即采集:每次运行都在回采数据 → 改进策略 → 让下一次运行更好。这是它和模型仓库的根本差别——模型仓库里,部署之后模型并不会变。四端共用同一个任务号、同一套验收规则与同一本账;买方看到的完成率、控制台上的效果分、受託者拿到的等级系数,是同一个数字的三个视角。
采集当下就在纠正:四层实时反馈
- L1 技术质量 10 Hz — 曝光 / 抖动 / 失焦 / 丢帧,视野左侧四个指示片。
- L2 同步健康 1 Hz — 设备对齐与实时误差(ms),顶部状态条。
- L3 数据价值 2 Hz — 训练价值分数与新异性百分位,底部价值条。
- L4 行为引导 事件驱动 — 一条具体、可执行的建议,底部单行。
三条硬约束:端到端反馈延迟超过 500 ms 就形不成「动作—反馈」联结;判定全部在端侧完成(网络延迟不可控,私密画面也不该实时上传);中央 60% 视野永远不遮挡——盖住被摄主体等于毁掉正在录的东西。四层与结算连通:L2 同步低于等级,设备降级,单样本系数随之下降。
两件硬件
采集设备:整机 <55 g,双目鱼眼全局快门、63–70 mm 基线、6 轴 IMU、硬件触发 ≤1 ms,目标单价 $45–90。手机算,眼镜感。部署机器人:RDK X5 级算力 + 低成本双臂 + 扫地机级底盘,出厂预标定,开箱约 15 分钟干活,BOM ¥5,200–7,200,目标零售价 $899。对买家是能干活的家用机器人,对平台是自我复制的采集节点:每卖一台就多一个 S 级采集点,采集成本从人手的 $2.21/样本降到 $0.37。
档位与结算
快车(仿真 80 : 真实 20,SLA ≥85%,2–4 小时,中位价 $2.00)与专车(仿真 40 : 真实 60,SLA ≥98%,30–60 分钟,中位价 $4.10)。档位不是两个价格,而是直接决定真实数据占比的数据策略。佣金 18%,两个池子从(R − 佣金)里切,绝不能从 R 里切;三块内译必须对得上账。仿真侧按效果分档(≥85 ×1.0 / 75–84 ×0.85 / 60–74 ×0.7 / <60 不计且不影响声誉);采集侧只对合格样本付费,设备同步等级定系数(≤1 ms ×1.0 / ≤5 ms ×0.7 / 10–50 ms ×0.4 / >50 ms 禁止上传)。
四项尚未验证的前提
- 50 ms 同步误差对策略训练的实际影响幅度。
- 卷帘快门与全局快门在操作成功率上的差别。
- 众包用户在无监督下能否正确使用 UMI 式夹爪。
- 实时反馈的延迟阈值(200 / 500 / 1000 ms 阶梯)。
以上是推理,不是数据。在实验做完之前,我们不把它们当功能卖。
Open the interactive page
·
网境智能首页
·
具身智能产业图谱
咨询:sales@netverseai.com · 设计基线 v2.1 · 2026.09 · 页面提供中 / 英 / 日三语。文中价格为目标值,非定价。