在2026年世界人工智能大会(WAIC)期间,端侧AI独角兽面壁智能联合OpenBMB正式发布并开源了其首个具身智能技术成果——MiniCPM-Robot系列模型。包括基于MiniCPM-V 4.6训练的通用VLA模型MiniCPM-RobotManip(参数仅1.5B,性能比肩3-4B模型,流式推理成本减半,并支持1分钟具身原生记忆),以及与南京大学联合研发的MiniCPM-RobotTrack(业内首个支持真实本地断网部署的纯视觉跟踪模型,适配宇树Go2 Edu)。

对此,面壁智能联合创始人、首席科学家刘知远与面壁智能学术合伙人、多模态智能首席科学家姚远接受了大模型之家等多家媒体采访,就具身智能的技术泡沫、端侧AI的发展规律以及通往通用人工智能(AGI)的真实路径,展开了一场深刻且充满金句的理性对话。
面壁智能明确提出:具身智能决不能靠过拟合的专有demo“爬树登月”,端侧AI的未来属于“高智能密度”与“先通后专”的通用大模型范式。
“爬树去不了月球”:具身智能决不能重蹈“专用小模型”老路
针对当前行业普遍通过大量采集特定任务数据,如叠衣服、打乒乓球等来宣传具身智能进展的现象,刘知远和姚远给出了清醒的警示。
姚远指出,目前很多场景展示的所谓“专家模型”,实际上是通过对极少数场景进行高度“过拟合”(Overfitting)来实现的,这并不代表具身智能领域的真实通用突破。

图:面壁智能学术合伙人、多模态智能首席科学家姚远
刘知远借用经典比喻指出:“如果你的目标是登月,但你现在以爬树的形式尝试离月亮更近,你是永远不可能到月亮上去的。”
2010年至2018年,深度学习阶段的“专用人工智能”(如人脸识别、早期自动驾驶)就是典型的“爬树模式”——只收集特定场景的数据训特定模型,除了该单一能力外一无所长。在真实物理世界复杂的随机性与多样性面前,靠过拟合特定动作的僵化机械无法支撑真正的具身未来,具身智能必须彻底摆脱旧有专用AI的路径依赖。
具身破局要“先通后专”:先培养“聪明的大学生”,再去做“专业工种”
谈及具身智能的破局路线,面壁智能提出了“先通后专”的核心范式。
刘知远表示,人类学习开车或做饭之所以快,是因为人在十几年的生命成长中已经吸收了关于物理世界的丰富常识,哪怕没学过物理定律,也知道塑料袋可以踩、水泥柱不能撞。
“通用人工智能的逻辑一定是先通后专。模型得先具备关于这个世界的通用常识,你再把他培养为相关领域的专家,那个上限才会更高。”刘知远形象地比喻道,这就像培养人才——“你必须先培养出一个聪明的大学生,然后再让他去变成一个聪明的程序员或车间工人;如果只是用代码去训模型,绝对达不到今天的智能效果。”

图:面壁智能联合创始人、首席科学家刘知远
目前,各大厂商展示的工厂流水线拣选包裹等僵化动作,本质上不需要通用的具身机器人。具身大模型的真正价值,在于先打造具备世界常识与通用理解能力的“通用大脑”,进而快速适配极度广泛的物理场景。
感知、思考与行动闭环:“完全态智能”是迈向AGI的必由路线
大语言模型解决了智能的“思考”与“决策”,多模态模型补齐了“感知”。而在面壁智能的技术蓝图中,具身智能则是补齐了“行动(Action)”模块,从而构成了智能能力的完整闭环。
刘知远强调,本次WAIC上发布的MiniCPM-Robot系列,正是面壁智能第一次面向行业呈现包含“感知、思考、行动”完全态的模型体系。无论是基于MiniCPM-V 4.6打造的MiniCPM-RobotManip,还是首次实现纯视觉本地断网自主追踪的MiniCPM-RobotTrack,都是将极致的端侧多模态能力延伸至物理世界作用力上的里程碑。这一闭环的形成,标志着AI开始真正走进物理空间参与干活、改变现实。

MiniCPM-RobotManip已位列通用VLA模型第一梯队
端侧AI发展不能“划延长线”:追求“高密度”才是算力小型化的本质
很多从业者习惯用云端大模型的思维来看待端侧AI,认为模型越做越大才是技术含量高。对此,刘知远提出了坚决的否定:“不能划延长线去预测未来。如果只看延长线,就不会出现智能手机,芯片就会越做越大,而不是越做越小。”
回顾集成电路几十年的发展史,从大型机到PC再到Smartphone,本质上是将电路做致密、将芯片小型化。端侧算力的总体规模未来将数十倍于云端,而端侧AI的突破核心在于“提高智能密度”。
在严格受限的功耗、显存和响应时间下,把模型做精、做紧凑、做高效,其技术难度丝毫不亚于云端千亿大模型。面壁坚持每100天将模型密度翻倍的“密度定律”,正是把握住了端侧AI“小型化、高致密”的物理规律。
“跑得快不如跑得准”:以“软硬协同+开源生态”构建具身大脑终局
在竞争激烈的商业化与生态定位上,刘知远表示面壁智能不会谋求包揽一切的独占模式,而是坚定走“生态合作与开源驱动”的路线。
“跑得早、跑得快都不重要,重要的是跑得准,方向是对的。”——刘知远对大模型之家表示。
面壁智能定位为AI生态中的通用“大脑”提供者,与硬件本体厂商紧密协同。具身智能涉及极其复杂的“软硬协同、端云协同、数模协同”,任何单一企业都难以通吃。
面壁将“开源”视为人工智能行业流淌在血液里的信仰,通过将极致压缩的视觉Token技术(16倍无损压缩率)、原生上下文管理及推理加速框架向社区开放,降低具身训练与部署门槛,以开放心态推动整个具身生态跨越发展的“1-2年培育期”,迎来端侧智能的爆发。
大模型之家认为,在喧嚣与泡沫并存的具身智能赛道上,理性与远见尤为珍贵。正如刘知远所言,时间既是最大的挑战,也是最好的朋友。通过在“先通后专”路线上的深耕与对端侧“智能密度”的极致追求,面壁智能等企业正在用技术事实证明,真正的通用具身智能必将在厚积薄发中驶向浩瀚星海。
