具身智能的“大脑”之争:宇树机器人等硬件厂商对通用大模型的依赖与突破

AI智能2小时前更新 admin
20 0
生成摘要
机器人要真正“完成一件事”,却卡在大脑与小脑的撕裂:通用大模型能理解复杂指令并规划长程动作,推理却常以秒计,而伺服控制必须毫秒响应。端侧部署又难兼顾算力、功耗与智能深度。宇树等硬件厂商正以大小脑协同破局——高层规划交给通用模型,实时执行交给专用网络。当模型与本体各司其职,硬件积累的物理经验会成为怎样的独特筹码?
— AI 生成,仅供参考

2025年,具身智能首次被写入《政府工作报告》,机器人产业随之从“动起来”的阶段,快速转向“真正完成一件事”的新考场。但一个微妙的分歧正在硬件厂商之间浮现:当机器人需要理解复杂指令、规划长程动作时,究竟该把“大脑”交给云端或本地的通用大模型,还是该在端侧部署一套更轻、更快的专用模型?

这个问题,本质上关乎 AI 智能如何真正“进入”物理实体。对于宇树等以本体硬件见长的厂商来说,选择尤为关键——他们既要拥抱大模型带来的推理能力,又必须守住实时控制这条生命线。

1787243836-wf_img6a872d3c5ea3a0.11856682.webp

大脑和小脑,为什么必须分开

要理解这场“大脑”之争,先得把机器人的智能拆成两层。业界通常把具身智能划分为“大脑”和“小脑”:大脑负责推理、规划、决策和感知,比如理解“把桌上的杯子拿到厨房”这句话,并拆解成一系列动作;小脑则负责运动控制和协调,把高层指令转化为电机的电流或扭矩信号,并在执行过程中实时修正误差。

通用大模型的强项显然在大脑层面。它们擅长理解自然语言、进行语义推理、生成结构化的任务规划。但问题在于,大模型的推理速度往往以秒甚至更长的时间计,而机器人的伺服控制需要毫秒级的响应。如果每个动作都要等大模型“想清楚”再执行,机器人会显得迟钝笨拙,更无法应对突然出现的障碍物或动态变化的环境。

这正是机器人行业长期面临的“系统割裂、实时性不足”困局。感知决策与运动控制分属不同芯片或系统,通信协作过程中产生的系统级延迟,让机器人的反应总是慢半拍。于是,主流方案逐渐形成共识:高层任务用大模型做推理,底层基元和伺服级执行则交给专用神经网络或预编程方法。简单说,就是让“大脑”想得深,让“小脑”动得快。

端侧模型的瓶颈:快与聪明的博弈

对硬件厂商而言,把大模型部署到端侧是极具吸引力的方案。本地推理能避免网络延迟,保护数据隐私,也让机器人在离线环境下依然具备智能。但端侧部署的瓶颈同样明显。

首先是算力与功耗的矛盾。机器人的电池容量有限,而大模型的推理极其消耗计算资源。即便使用集成实时控制模块的专用芯片,也难以在有限功耗内跑起参数量庞大的通用模型。为了适配端侧,厂商往往需要把模型蒸馏、量化到更小的规模,但这又不可避免地牺牲推理能力——模型变小了,对复杂语义的理解和对长程任务的规划能力也会随之下降。

其次是实时性的根本挑战。即便模型已经足够轻量,一次完整的推理仍然需要时间。对于“拿起杯子”这种单步动作,端侧模型或许能勉强应付;但对于“烤面包、倒饮料、取出面包并装盘”这类包含几十甚至几百个动作的长程任务,机器人需要持续决策并保持上下文,端侧模型的计算开销会急剧膨胀,延迟问题被成倍放大。

这正是端侧模型在动作规划中的真实困境:不是不能做,而是很难同时做到“快”和“聪明”。追求实时性,就得牺牲一部分推理深度;追求智能水平,又难以满足毫秒级的控制要求。

1787243836-wf_img6a872d3cc27255.53356760.webp

硬件厂商的破局思路:大小脑协同

面对这样的矛盾,硬件厂商的破局方向并非二选一,而是走向“大小脑协同”的混合架构。宇树等厂商的实践中,一个典型方案是:云端或本地部署的通用大模型负责全局理解与任务规划,生成高层指令;端侧的专用控制网络则负责把这些指令转化为实时的电机控制信号,并在执行过程中根据传感器反馈快速调整。

这种分工让每一层都用上了最合适的工具。大模型不必关心电机怎么转,控制网络也不必理解复杂的语义。更重要的是,端到端控制网络的训练正在加速这一进程——通过强化学习,把基元级规划与伺服级执行整合起来,让机器人对动态环境具备快速自适应能力。

对于硬件厂商来说,这种架构还有一个现实好处:它降低了对单一通用大模型的依赖。机器人本体厂商不必把全部智能押注在某一家大模型上,而是可以像搭积木一样,根据任务需求灵活更换或升级“大脑”模块。硬件积累的传感器数据、运动学模型和物理交互经验,反而成为他们在“大脑”之争中的独特筹码——毕竟,再聪明的模型,最终也要通过扎实的硬件才能触达物理世界。

具身智能的“大脑”之争,短期内不会有一个标准答案。可以确定的是,通用大模型与实时控制之间的张力,正在催生更精细的分工体系。对硬件厂商而言,与其纠结于“用不用大模型”,不如思考如何让模型与硬件各司其职,在延迟与智能之间找到那个动态平衡点。毕竟,让机器人真正“进入”物理世界,靠的不是某一种模型的胜利,而是整个系统的协同进化。

© 版权声明

相关文章

暂无评论

none
暂无评论...