机器人拒绝“拿来主义” 具身智能正在和大模型“分家”
近日,蚂蚁灵波密集发布6款模型,从视觉感知到世界模型再到动作执行,几乎亮出了具身智能的整条技术链。但在眼花缭乱的发布背后,真正值得行业关注的并非某个模型的参数指标,而是一个更值得思考的命题:物理世界的智能,究竟需不需要一套与数字世界截然不同的“原生”技术体系?
具身智能是否需要自己的“原生”技术栈?
当前,具身智能领域的主流做法,是尽可能复用大模型的能力,用视觉语言模型做感知,用扩散模型做动作生成,用大语言模型做任务规划。蚂蚁灵波科技首席科学家沈宇军表示,数字世界模型与机器人具身模型本质是两类目标完全不同的模型,不能简单将机器人视作大模型在物理世界的延伸,采用数字模型微调嫁接方案虽然短期落地速度快,但存在底层逻辑冲突,强行耦合只能走短期捷径,长期必然遇到发展瓶颈。
沈宇军指出,数字模型主要面向内容生成与创作,侧重图像语义,而机器人身处物理环境,必须具备真实距离感知。像玻璃这类透明障碍物,数字模型往往会“看穿”玻璃、识别出后方的物体,却感知不到玻璃本身的存在,无法判断阻隔,容易造成行动失误,这是物理场景独有的感知难题。同时,人类行动前会预判推演,和商用视频生成逻辑完全不同。数字生成追求高清精细画面,机器人只需要快速预判因果,优先保证响应速度,无需渲染细节,例如预判咖啡倾倒,只需快速得出会洒出的结论即可。而且数字模型不存在和现实环境交互的需求,机器人作业时则持续和真实环境产生互动。
针对以上需求,沈宇军提出具身原生技术路线,所谓具身原生,是指从训练一开始,就在架构、数据、算法等方面天然地为机器人设计,并且锚定物理交互三大核心目标:看得更清楚、想得更明白、干得更利索。
行业内不少企业认为,随着算力提升和模型规模化,数字世界模型的“通用能力”终将覆盖物理世界需求,无需另起炉灶。而蚂蚁灵波这类“原生派”则认为,从数字模型迁移微调的过程中会不可避免地产生知识损失,难以充分满足物理交互需求,必须从预训练阶段就重新设计。这场路线之争尚无定论,但灵波通过行业首个具身原生世界动作模型LingBot-VA 2.0,至少在技术层面提供了一种可行性样本。
具身智能谈“商业爆发”,为时尚早
沈宇军认为,制约通用机器人发展的一大核心瓶颈是数据。
沈宇军指出,通用大模型建立在互联网数十年积累的标准化图文数据之上,数据已经在那里,量大、规范、随手可取。但具身智能的数据现状是“一片空白”,多传感器同步录制没有标准、信号误差校正没有方案、实时传输存储没有成熟链路。一个数据采集链路的调试周期动辄长达一个月,反复返工是常态。
沈宇军表示,长期来看,高效的多模态对齐真机数据获取方式,将成为拉开企业技术差距的第一道分水岭。这不是简单的“多采数据”就能解决的问题,而是需要从采集链路设计、标注规范制定、闭环反馈机制等层面进行系统性建设。谁先跑通这个“数据飞轮”,谁就有可能率先跨越从实验室到真实场景的鸿沟。
而在硬件侧,他指出了三大核心变化方向:一是灵巧手产业将加速发展,当前简易夹爪严重限制了机器人的精细操作能力;二是多模态感知必须深度融入具身原生模型,触觉、听觉等维度的引入势在必行,但传感器硬件迭代和多模态融合算法仍需要长期探索;三是软硬件必须同步迭代,硬件短板会直接压低模型落地效果的上限。
没有标准化的数据规范,没有统一的操作系统接口,没有通用的硬件兼容框架。在这个阶段谈“商业爆发”,为时尚早。
具身智能急需自己的评价标尺
在数字世界,评价一个视频生成模型的标准相对清晰:画质、清晰度、语义一致性、创意丰富度。这些指标可量化、可对比,Benchmark体系成熟。但目前全球缺少公允、统一的具身智能 Benchmark,不同厂商模型性能无法横向对比,技术迭代缺乏统一标尺。
沈宇军呼吁,行业需要一套公允、统一的具身智能Benchmark评测体系,用以标准化定义感知、预测、操作基础能力,让不同厂商模型具备横向对比标尺,引领整体技术迭代方向。同时,希望降低开发者参与门槛,当前实体机器人硬件成本高,中小开发者、高校缺少真机调试条件,社区可搭建云端设备共享、远程真机接入体系,吸纳更多人才参与技术创新。
沈宇军认为,具身智能真正的产业拐点,是普通用户、开发者都能低成本参与机器人训练、持续沉淀真实场景数据,届时机器人将逐步走进家庭,承接重复劳动、高危作业,实现产业大范围普及。
具身原生路线的出现,本质是行业从“数字 AI 延伸”转向“物理 AI 原生” 的范式切换,并非单一企业的技术营销,而是整个产业面对数据、实时性、物理交互三重约束下的尝试和选择。虽然这条路线尚未被全行业验证,但至少提出了一个值得认真对待的命题:物理世界的智能,可能需要从第一性原理出发重新构建,而不是从数字世界的成果中做嫁接。
- 上一篇:把算力中心搬上天
- 下一篇:李彦宏:DAA是智能经济增长的“度量衡”














