从模块化控制到端到端智能|基于开源鸿蒙具身智能学习路径探究
分享嘉宾:祝欣蓉
开源鸿蒙教育委员会(筹)委员、上海杉达学院副教授、具身智能PMC(筹)成员,华为开发者专家(HDE)
导读
具身智能的浪潮正从实验室涌向产业一线。2026年国际消费电子展上,业界公认这一节点为“AI从虚拟走向物理世界的里程碑”——物理AI成为热词,具身智能技术正从“炫技”转向“务实”。然而,技术火热的另一面是人才的结构性缺失:机械专业的学生懂结构设计却不懂深度学习,计算机专业的学生懂算法却不懂电机控制与实时系统。具身智能需要的是“能写STM32底层驱动、能做MuJoCo物理仿真、能训VLA大模型”的复合型人才。
在本期直播中,祝欣蓉围绕“从模块化控制到端到端智能——基于开源鸿蒙具身智能学习路径探究”,系统梳理了行业背景与人才挑战、技术核心架构理念、学习路线设计以及专业建设思考。
整场分享的核心逻辑是:具身智能的人才培养不能仅停留在算法调参,而应贯通“感知—决策—执行—控制”的完整闭环;不能只关注云端大模型,更要深耕端侧部署;不能只追求通用性,更要结合细分行业的语义理解,走差异化发展之路。
直播开篇即点明:具身智能强调智能体必须拥有物理身体,通过与环境的动态交互产生认知。它不同于仅存于虚拟空间的AI,核心特征是“有身体、能感知、会行动”。
技术范式正发生根本转变。传统工业机器人依赖预编程、固定轨迹和结构化环境,核心是重复精度,局限是“换个工件需重新编程”;而具身智能走的是端到端学习路径,强调泛化能力和非结构化环境适应力,核心是适应性交互,优势是“像人一样思考”,自主处理未知情况。
具身智能的应用正从三个方向全面渗透。在运动控制层面,涉及拾取操作、平面移动、群体优化协调;在感知交互层面,包括取物、移动避障、表面缺陷识别、安全巡检、陪伴对话、教育辅导;在推理决策层面,聚焦模仿人类、自主导航。与此同时,CES 2026传递了明确信号:具身智能进入“工具期”——行业不再单纯追求形态,转而关注投入产出比和规模化商用。
但现实挑战同样严峻。当前具身智能人才供给存在明显的结构性缺失。机械专业学生懂结构却不懂深度学习,计算机专业学生懂算法却不懂实时系统。市场亟需能够贯通硬件底层、算法仿真到模型部署全链路的复合型人才。
为帮助开发者建立系统认知,直播提出了具身智能的“大脑—小脑—躯干”三层架构。这一架构模仿了生物进化逻辑,核心是“频率递增、逻辑由抽象变具体”的层级设计。
大脑是决策层,处理语义理解、长程规划,频率较低,大约10赫兹。例如,听到“给我拿杯咖啡”后的任务拆解。小脑是运动层,处理平衡、避障、力控,频率较高,大约500赫兹。例如,走路不摔倒、拿杯子的力道控制。躯干是执行层,负责物理信号的直接处理,要求硬实时,大约1千赫兹,包括电机驱动、原始数据采集。大脑负责“想”,不需要很快但需要“聪明”;小脑和躯干负责“动”,必须具备极高的实时性,否则机器人会因反应慢而失去平衡或发生碰撞。
与三层架构相对应的是“感知—决策—执行—控制”的横向闭环。这是一个严密的实时闭环,任何环节的延迟都会导致系统崩溃。在具身智能中,从感知到控制的反馈链路如果断了或慢了,机器人就会摔倒或动作走形。
在纵向维度上,直播重点介绍了当前最前沿的两个进化方向。VLA(视觉-语言-动作)实现了从看到物体到直接输出动作序列的端到端能力,关键技术包括Transformer、ACT动作分块算法、Diffusion Policy扩散策略。VLN(视觉-语言-导航)解决了机器人在复杂陌生环境中的“寻路”问题,关键技术包括语义地图、SLAM实时定位与建图、图神经网络。
基于上述架构,直播系统梳理了具身智能技术的五条核心学习路线。
🔹感知路线是让机器人“看懂”世界。感知是具身智能的基础,核心是让机器人理解自身与环境的关系。学习者需掌握计算机视觉(目标检测、语义分割)、位姿估计(确定物体在三维空间的位置和姿态)、深度估计与3D重建。起步建议学习OpenCV基础、掌握SIFT/ORB等经典算法、熟悉PyTorch/TensorFlow框架。工程落地需关注嵌入式部署、多传感器融合以及应对光照变化与动态环境干扰。
🔹控制路线是让机器人“动得稳”。控制是具身智能的执行层,核心是让机器人精确、稳定地完成动作。需掌握运动学建模(描述关节角度与末端位置关系)、运动规划(规划无碰撞路径)、运动控制(PID/MPC控制器)、力控(保证接触安全)。起步建议学习机器人运动学基础、掌握经典控制理论、熟悉ROS系统。工程落地需关注控制器参数整定、实时操作系统以及安全机制设计。
🔹模仿学习路线是让机器人“照着做”。模仿学习是让机器人快速获取技能的有效方法。核心范式包括行为克隆(直接学习从观测到动作的映射)、演示学习(从人类演示中学习策略)、混合模仿学习(先学基础策略再用强化学习优化)。核心挑战是处理演示数据噪声与偏差,提升模型泛化能力。
🔹强化学习路线是让机器人“自己摸索”。强化学习让机器人通过与环境交互和试错来优化策略。离线强化学习利用静态数据集学习,安全性高但可能存在数据分布偏差;在线强化学习与真实环境实时交互,适应动态环境但样本效率低。进阶技术包括层次化强化学习(将复杂任务分解为子任务)、序列经验回放(优先回放重要经验片段)、世界模型(在虚拟世界中规划和探索)。
🔹VLA路线是实现端到端的通用智能。VLA模型将视觉、语言和动作统一到单一模型中,是具身智能的核心方向。RT系列通过Transformer融合多模态信息直接映射指令到动作;OpenVLA开源生态大幅降低研究门槛;π系列结合强化学习赋予模型持续优化能力。VLA的核心价值在于提升机器人的通用性与泛化能力,适应未知环境。
具身智能的训练离不开仿真,但从仿真到现实存在三道鸿沟。物理建模偏差表现为仿真器无法完全复现真实世界的摩擦、惯性、材质;感知域差距表现为虚拟传感器数据与真实传感器存在噪声和延迟差异;动作执行差距表现为真实机器人存在控制延迟和机械误差。
跨越鸿沟的关键技术方案包括:领域随机化——在仿真中随机化物理参数、光照、纹理等,迫使模型学习本质特征而非依赖虚拟假象;系统辨识与校准——通过真实数据精确校准仿真模型的动力学参数;域适应——利用少量真实世界数据对仿真预训练模型进行微调。
直播的后半部分聚焦于人才培养的落地路径。当前,教育部已新增具身智能相关专业目录,职业本科和高职院校正面临如何建设这一新兴专业的课题。
差异化发展思路强调深耕“具身”的物理属性。首先是强化数据采集与标注的工程链条,建立机器人遥操作实训基地,组织学生通过VR设备或外骨骼采集真实的物理交互数据。这类高质量的“专家轨迹数据”是产业紧缺的资源。其次是专注端侧部署与国产化替代,避开云端大模型,深耕端侧小模型在国产硬件上的适配,解决工业环境下的低延迟与高安全需求。再次是深挖细分行业的语义理解,结合院校优势学科训练具有行业特定知识的机器人。最后是推动仿真到真实环境的迁移,重点研究实物调试,利用院校拥有的实训机床和物理场景优势,解决“仿真与现实鸿沟”。
在课程体系设计上,直播提出了“三位一体”人才培养矩阵。职业本科侧重系统集成与全栈开发,培养“从0到1”的系统构建能力;
高职侧重运维部署与实操技能,培养“从1到N”的落地能力;微专业为机械、自动化等传统专业学生提供智能升级路径。
课程体系贯穿三年。第一学年夯实工程通识与硬件核心,包括具身智能导论、机器人工程数学、程序设计基础、电路与电子技术、微控制器接口技术。第二学年聚焦系统与运动、仿真与感知,包括计算机视觉、机器人运动学、ROS 2实训、MuJoCo物理仿真、SLAM自主定位与导航。第三学年攻坚智能核心与系统集成,包括深度学习、VLA与模仿学习、强化学习、边缘计算部署、Sim-to-Real迁移实训。
总结:具身智能人才培养,是一场“从模块化控制到端到端智能”的系统工程
本期直播传递了一个关键认知:具身智能的落地,不仅需要技术突破,更需要人才梯队的系统培养。
从“大脑—小脑—躯干”的三层架构,到“感知—决策—执行—控制”的实时闭环;从VLA与VLN的智能进化,到五条学习路线的系统梳理——技术体系的每一层都对应着不同的人才能力维度。而“三位一体”的培养矩阵、差异化的课程设计、从仿真到现实的工程训练,则为院校提供了可落地的建设路径。
当具身智能教育不再只是“调参训练”,而是贯通硬件底层、算法仿真、模型部署与行业应用的全链路培养体系时,才能真正为产业输送“能写驱动、能训模型、能解问题”的复合型人才。与其预见未来,不如亲手创造物理世界的智能。
·