
你见过机器人自己“画”动作吗?不是写代码,也不是调参数,而是像人画画一样——用像素把动作本身‘描’进画面里。清华刘烨斌团队和影身智能刚干了件挺酷的事:他们没让视频模型硬啃一串冷冰冰的关节角度数字,而是直接把机器人怎么动、占多大空间、会挡住啥、可能碰着哪儿……全‘画’成一段带遮挡关系的视觉掩码。模型一眼就‘看’懂了动作,而不是靠猜。

过去视频世界模型想预测机器人下一步干啥,得先把‘向右转30度+抬臂15厘米’这种数值指令,一层层翻译成姿态、投影、运动、环境反馈……中间漏一环,画面就穿帮。Masked Visual Actions 把这整套翻译工作提前做完了——训练时既用真实视频抠机械臂,也用URDF模型+相机参数渲染动作轨迹。结果呢?模型输入一张起始图+一段‘画’出来的动作,就能自然补全杯子被推走的轨迹、桌面反光的变化、甚至手指擦过杯沿时的微小形变。
这不是炫技。李飞飞在最新文章里反复强调:当前90%的‘世界模型’其实只是‘渲染器’——画得再像,物理上站不住脚。而清华和影身做的这事,是往‘模拟器’这个被低估的枢纽上狠狠钉了一颗钉子。它让视频模型第一次真正‘看见’动作里的物理因果:不是‘手到了这里’,而是‘手到这里,必然带动这个力矩,导致那个接触,引发这处遮挡’。现场参会的北大查红彬教授说得很实在:‘三维表征不是锦上添花,是机器动手前必须有的‘脑内沙盘’。’现在这块沙盘,终于能动起来了。
这背后其实藏着一个长期被忽视的断层:我们教AI看世界,却很少教它“预演”世界。就像小孩搭积木前会先在脑子里转一转哪块该放哪——不是靠算力硬推,而是靠空间直觉。清华团队这次做的,就是给视频模型装上了这个“脑内沙盘”。他们没绕开物理,反而把URDF(机器人结构模型)、相机标定参数、碰撞检测逻辑全塞进训练数据里,让模型在学“画动作”的同时,顺手记住了“机械臂肘部转过60度时,小臂末端离桌沿只剩2.3厘米”。这种精度,不是靠后期微调抠出来的,是模型自己从掩码序列里长出来的理解。
更关键的是,它落地不挑食。实验室用UR5e机械臂验证时,只给了120段真实操作视频+对应渲染掩码,没喂任何动力学方程,模型就学会了预测推箱子时的滑动距离、抓取软体物体时的形变趋势。影身智能在东莞一家电子组装厂试跑了一周,模型能提前两帧判断出夹爪是否会对PCB板上的焊点造成遮挡干扰——而过去这类问题,得靠工程师手动写规则或加激光传感器补位。
有人问:这跟传统运动规划有啥区别?区别在于“门槛”。以前部署一个抓取任务,得调ROS节点、配MoveIt!、校准力控参数,光调试就得三天。现在产线工人用平板随手涂个“手往左下划一下”的掩码,模型立刻生成带物理约束的动作序列,连仿真结果都自动叠在实拍画面上供确认。这不是替代工程师,而是把重复性判断交给视觉直觉,让人腾出手去解决真问题。
查红彬教授团队最近复现了这套方法,在双臂协作装配任务中,动作预测误差比纯视频扩散模型下降了41%(来源:《IEEE Transactions on Robotics》2024年7月预印本)。更实在的是,他们发现模型对“不可见材质”的泛化能力意外地强——训练时没见过硅胶垫,但推一个新模具时,仍能准确预估其轻微回弹带来的遮挡延迟。这说明,当动作被“画”成视觉关系,物理规律就不再是抽象公式,而成了像素间的自然张力。
说到底,AI动手之前,得先学会“想”。不是想指令,是想空间、想接触、想后果。清华和影身没造新模型,只是换了一种方式“教AI看”——把动作还给画面,把因果还给眼睛。这条路不 flashy,但每一步,都踩在机器真正走进现实的节拍上。
长宏网提示:文章来自网络,不代表本站观点。