洱海新闻

世界模型有触觉了!50万小时视频,训出首个隐式触觉世界动作模型

来源:洱海新闻 分类:科技
世界模型有触觉了!50万小时视频,训出首个隐式触觉世界动作模型

刚刚,BeingBeyond智在无界正式发布了首个基于人类视频数据的隐式触觉世界动作模型——Being-H0.8。这套带有触觉感知的隐式世界—动作模型,在预训练阶段就开始教导机器人如何预测即将发生的物体接触,并在接触实际发生后,依据触觉反馈灵活调整动作策略。

对比过去单纯依赖画面信息来决定动作的世界模型,Being-H0.8将触觉整合进了"预测—执行—反馈"的完整操作链路中。模型会先分析当前画面,预判可能发生的接触场景,在执行过程中再读取最新的触觉数据,并据此重新生成下一阶段的动作指令。

具体实施时,Being-H0.8从数据维度、模型架构和控制逻辑三个层面同步推进。基于这种设计思路,Being-H0.8在真实双臂机器人实验中,成功完成了包括包内取物、毛笔书写、挤牙膏、夹取薯片等在内的多项需要精细触觉协调的高难度任务。

要说Being-H0.8最引人注目的创新,当数其隐式触觉世界动作模型架构和超过50万小时的超大规模人类视频数据集。我们先深入探讨模型层面的突破。

对于具身智能体而言,触觉不仅影响着操作的精细度,还能辅助其完成单纯依靠视觉难以实现的接触状态推断。过去两年,学界围绕触觉如何增强具身基础模型展开了诸多探索。李飞飞、徐丹飞、Wenzhen Yuan、宋舒然等研究者都积极推动了相关方向的研究。但聚焦到世界模型领域,触觉数据如何有效融入世界模型,依然是一个悬而未决的课题。

一方面,当前多数世界模型仍以视觉为核心。这些模型可以观测物体的运动轨迹和形态变化,却难以精确判断接触是否发生、具体接触位置以及物体承受的作用力大小。另一方面,触觉传感器种类虽多,但其数据格式和表征方式缺乏统一标准。更严峻的现实是,绝大多数大规模人类视频和机器人数据集,根本没有同步记录触觉信息。

这意味着要训练具备触觉能力的世界模型,不仅面临触觉表征标准不统一的困境,还缺少可规模化获取的训练数据支持。Being-H0.8正是智在无界针对这一挑战提出的解决方案。

该模型在Being-H0.7隐式世界—动作模型的基础上,首创性地将触觉模态纳入隐空间表示体系,将原本以视觉预测为主的建模方式升级为隐式触觉世界—动作模型(即Latent Tactile World-Action Model),并将触觉预训练扩展到可大规模处理的第一视角人类视频数据。

这里的核心理念在于,Being-H0.8并非要在像素层还原未来画面,而是在隐空间中预测与任务直接相关的交互结果,例如接触是否会发生、接触可能引发的状态转变,并利用这些预测结果优化动作生成。

换句话说,Being-H0.8致力于让机器人不仅能"看见"即将发生的情况,还能从缺乏显式触觉标注的人类视频中,学习对接触和受力结果的隐式理解。

从技术架构上看,Being-H0.8包含四个核心模块:负责预测交互后果的Mixture of Transformers (MoT)、负责执行与实时调整的慢—快动作专家系统、负责标准化触觉输入的通用触觉编码器,以及负责统一动作空间的TopoHand系统。其中,通用触觉编码器将不同传感器采集的触觉信号转换为统一格式的触觉token,有效降低了设备差异和数据形态多样性带来的问题。

慢—快动作专家系统则兼顾了推理效率与接触反馈的实时性。这种设计使机器人无需每次触觉变化都重新计算完整计划,也能根据滑动、受力变化或接触偏移快速调整动作策略。

在训练阶段,未来时刻的触觉token会输入MoT的后验分支,帮助模型理解真实接触发生后世界状态的变化规律。进入部署阶段后,MoT负责预测交互结果,慢速流维持整体情境连贯性,快速流则根据最新触觉反馈实时修正动作执行。

相关推荐