GPT拆掉了「具身大脑」,Embodied PhyStack会是具身智能的下一站吗? - 版本更新
在数字体育快速发展的今天,星空体育APP始终致力于为用户提供稳定、高效的赛事资讯与实时比分服务。进入2026年,我们的客户端在功能定义与用户体验上进行了全面升级,确保每一位体育爱好者都能第一时间获取最新版本与安装指导。
- 客户服务
过去两年间,“大脑”成为了具身智能领域最引人注目的叙事之一。
海外市场,从Physical Intelligence的π系列、Figure的Helix到Google DeepMind的Gemini Robotics,多款备受瞩目的具身大脑模型,均致力于将视觉、语言与动作整合至同一学习框架内。
国内创业公司同样沿着这一方向积极布局。据IT桔子数据,2026年上半年,国内具身智能赛道共完成322笔融资,总额达935亿元,较2025年同期增长5倍。其中,超过一半资金流向VLA模型、世界模型及数据基础设施,“大脑-小脑-本体”成为主流技术路径。
然而,经过两年的探索,行业发现“大脑”依然是一块难啃的硬骨头。不过,2026年9月3日,GPT-6 Astra的发布,为具身智能的发展带来了新的变量。
OpenAI将其官方定位为通用模型,并未直接提及机器人。但当研究人员将GPT-6 Astra接入人形机器人后,立即引爆了具身智能产业。在9月12日GitHub发布的评测报告《GPT-6 Astra as an Embodied Policy》中,GPT-6 Astra以压倒性优势超越其他模型,“空降”RoboDojo排行榜首位。
《GPT-6 Astra as an Embodied Policy》中,GPT-6 Astra在十项机器人测试中均位列第一
通用大模型,真的要重返具身智能的“主桌”了吗?
1. 通用大模型,重返“主桌”
要真正理解GPT-6 Astra对具身智能产业的冲击力度,首先需厘清两个基础问题:具身智能究竟要解决什么?以及,为什么这如此困难?
具身智能的终极目标是实现无人化作业,即让机器人达成“自治”。而让机器人动起来,仅仅是这条路径的起点。
过去十多年,机器人产业中进展最快的部分是“身体”与“控制”。机械臂解决了确定性环境下的重复作业,轮式底盘则将作业半径从工位扩展至整个车间……本体形态的多样化,使机器人能够到达更多场景;控制能力的提升,则让机器人在这些场景中稳定完成工作。两者结合,逐步拓宽了机器人的自治边界。
但轮式底盘与机械臂的自治边界存在上限——它们依赖相对结构化的环境。在众多本体形态中,双足人形机器人更有可能逼近更完整、更广泛的自治边界。因为人类环境本身便是按双足形态设计的,门把手、楼梯、工具、工位均为人类而建。行业意识到这一点后,人形机器人在本体上持续迭代了多年。
控制层也在同步演进。进入具身智能时代,强化学习与仿真训练推动了人形机器人的运动控制。走路、跑步、上下楼梯、摔倒后起身,已逐渐成为行业基础能力。灵巧手、电机、减速器与力传感器仍在进步,本体的可用性也在不断提升。
身体与控制这两层正逐步成熟。但真正的难点也随之暴露:认知与决策,即如何让机器人在开放环境中自主判断该做什么、怎么做,或者说,让机器人“长出大脑”。
国内清华系创业公司动易科技的双足人形机器人PHYBOT C2,可视为一个典型案例。
2025年底,动易科技团队在全球率先实现了双足人形机器人与人自主对打羽毛球的能力;今年4月的广交会上,这台身高1.35米的双足人形机器人手持球拍,与现场观众智能对打,正手、反手、挑球均能接住,全程无需工程师介入。
让双足人形机器人自主与人打羽毛球,难点在于时间窗口极短——球从对手球拍离开到抵达己方击球点,通常不足一秒。机器人需在此时间内完成观察、判断、跨步、引拍、击球的全流程,任何环节的延迟都会导致失败。PHYBOT C2的成功证明:在几十毫秒级的闭环中,具身智能已能凭借端到端的感知决策模型,脱离遥控与预设,完成自主状态下的高动态实时交互。
但需注意,打羽毛球是目标单一、规则封闭的任务,机器人无需思考打完球后该做什么。PHYBOT C2撕开了人形机器人实时决策的口子,但具身智能的长程任务与多任务规划能力仍未突破;后者需要的,是对物理世界建模的理解力,以及读懂人类意图与逻辑顺序的能力。
换言之,让机器人“长出大脑”确实极为困难。
在大语言模型(LLM)爆发的早期,研究人员并非未尝试将LLM平行移植到具身智能机器人上,但效果不佳。在专门考察长程家庭任务中规划级自治能力的Long Act基准测试中,GPT-5在HoloMind框架下的目标完成度为59%,完整任务成功率仅16%;Qwen3-VL-32B分别为51.2%与15%。而人类被试的成功率为93%。
LLM路径不通,VLA、世界模型等路线逐渐成为产业的“香饽饽”。随之而来的是大规模数据采集、更大的VLA模型、更大的世界模型,以及更强的模型形态。
值得注意的是,VLA出现的时间并不比LLM晚。2023年,谷歌RT-2将机器人动作编码为文本Token,使模型像生成文字一样生成动作,奠定了VLA路线的基础。此后,在行业巨额融资的推动下,“具身大脑”成为最热门话题。甚至有行业人士戏称:“没有基座模型,都不好意思做机器人了。”
然而,资金投入后,问题并未消失。 今年7月的RoboDojo评测中,30个主流机器人Policy的平均成功率仅为12.8%,官方评价为“大多还在山脚适应高反”。VLA的“相机-基座耦合”问题仍未解决,相机视角稍有变化,任务成功率便会急剧下降。长程任务与多任务规划能力则更为困难。
在此之前,业内普遍的解法是——采集数据,采集更多数据,用Scaling Law逼出具身智能产业的“智能涌现”时刻。
直到大模型开始展现新的可能。
2026年9月3日,OpenAI正式发布GPT-6 Astra,官方宣称其“面向复杂推理、软件工程、计算机使用、科学研究与专业文档”,上下文窗口达105万Tokens,最大输出12.8万Tokens,整篇发布报告未提具身智能。
在RoboDojo官方评测中,GPT-6 Astra在42项机器人任务、2100次测试中,取得22.48%的平均成功率与28.97分,排名高于当时全部40个公开机器人策略,也高于原公开榜首DM0.5的19.34%与24.90分。
2. 具身智能,格局生变
一个此前被默认为“终局”的架构判断,开始动摇。
过去几年,行业最常见的划分是“大脑—小脑—本体”:上层负责认知与决策,中间负责运动控制,身体负责执行。随着VLA与世界模型兴起,行业投入大量资源,试图让“大脑”包办一切:既能理解世界,又能拆解任务,还能直接指挥身体。
但GPT-6 Astra展示了一个新可能:通用大模型本身,即可承担过去“大脑”中最难的部分——深度思考。
动易科技团队认为,机器人公司不再需要自行构建一个集中式的全能“大脑”。深度思考可以交由通用大模型处理,机器人公司需补足的是浅层思考与实时决策这一层。未来的具身智能技术栈,可能从三层走向四层,自上而下分别为通用大模型、物理智能体PhyAgents、运动控制系统PhyCore与本体PHYBOT,动易科技将其命名为:Embodied PhyStack(具身智能技术栈)。
动易科技Embodied PhyStack示意图
第一层,通用大模型:视觉输入,负责长程任务与多任务规划,通过深度思考理解人类意图,拆分任务序列,判断逻辑顺序,进而调用物理智能体PhyAgents的能力解决任务;同时,其作为云端大模型响应偏慢的问题,也由PhyAgents来补全。
第二层,物理智能体:视觉输入,进行实时决策,以端到端VLA能力为核心,通过浅层思考,将大模型分配的子任务翻译成机器人可实时执行的指令。
第三层,运控模型:本体感知,实时控制,相当于人的“小脑”。PhyCore根据PhyAgents的任务指令,平衡身体、驱动机器人本体完成执行。
第四层,机器人本体:由PHYBOT身体负责执行,并基于现实环境与本体状态变化,定向反馈给上述三层,予以纠偏并重新规划执行:步态与移动的平衡性控制问题,修正回流给PhyCore;针对环境变化反馈给PhyAgents,做出毫秒级实时决策;整体执行节奏与能力边界的触达情况则回到第一层——身体在触碰边界时发出的信号,让通用大模型据此进行重新规划。
Embodied PhyStack技术栈的意义,不仅在于多了一层。它把“具身大脑”从一家公司必须包揽的全部,拆分为通用大模型与机器人公司之间的分工协作:通用大模型负责其最擅长的深度思考与推理规划,机器人公司负责其最擅长的实时决策、物理闭环与稳定执行。对具身智能产业而言,这是一条更现实、也更经济的路线判断——不必再造一个“什么都自己干”的超级大脑,而是让专业的人做专业的事。
提出这条路径的动易科技,用三组实验进行了验证。
3. 动易科技的三组实验
第一组实验,用通用大模型作为大脑,与动易科技的PhyCore运控系统配合,驱动机器人执行长程任务。
该组实验中,通用大模型作为深度思考层,将端到端的VLA直接应用于长程任务,未针对特定任务重新微调模型,便获得了足够高的完成度。在零件收纳任务中,“通用大模型+PhyCore”的组合已能跑通完整任务链路。无论在仿真环境还是真机验证中,机器人都能理解人类意图,结合现实环境状态,执行并完成长程任务与多任务。
例如,在安装电池的仿真环境中,机器人将失误行为直接反馈给通用大模型,利用大模型对人类意图的理解进行思考,主动寻找安装位置,完成训练任务。
仿真环境中,机器人利用通用大模型完成安装电池训练
在真机任务的执行中,机器人基于对语义与环境的深层次理解能力,对失误行为做出反馈,由通用大模型进行重新思考与规划,完成任务。在下方实验中,PHYBOT在抓取银色工件时出现两次失误,基于通用大模型对深层意图与环境的理解判断,在第三次成功完成任务。
上方为通用大模型推理过程,下方为真机完成工件抓取过程,已200倍速
第一组实验验证了大模型在长程任务上的可行性,但也暴露了一个问题:通用大模型做深度思考够用,做毫秒级实时决策太慢。在执行工件抓取任务时,机器人用时约3小时,这不利于在更复杂的操作中实现实时平衡控制。
这也引出了第二组实验。
该组实验要解决的,是用物理智能体PhyAgents毫秒级的实时决策能力,补齐通用大模型效率上的短板,更好地完成长程任务与多任务。
该组实验还原了酒店环境中的清洁用品收纳场景,考察机器人对物理世界的理解与多任务的实时规划。具体流程分为两部分:
- 通用大模型收到任务需求后,基于意图与环境判断进行深度思考,拆分为多个子任务,给出任务序列,并调用PhyAgents端侧VLA的能力分配执行;
- 机器人收到子任务序列指令后,在PhyAgents的实时决策配合下逐一完成。这主要依赖PhyAgents通过端到端的VLA实时决策能力,评估环境与本体状态,浅层分析任务完成度,驱动PhyCore的运控指令,让机器人本体执行,直至任务全部完成。
Embodied PhyStack技术栈的真机实验效果,推理过程5倍速,真机操作原速
本组实验成果比第一组更为突出。通过通用大模型与物理智能体、运控模型、机器人本体的协同,机器人已具备深度思考与实时决策能力,能准确、及时地完成长程操作。效率对比更直观:同样是抓取任务,第二组抓取3个工件仅用时不到2分钟。按单个工件平均耗时计算,第二组效率较第一组提升超过100倍。
第三组验证,指向新场景的训练效率。
前两组验证的是“通用大模型能否做决策规划”,以及“如何配合通用大模型实现机器人的深度思考与实时决策”。第三组则将通用大模型的能力用于机器人训练环节。工程师仅输入任务需求,包括约束条件、训练目标,以及从仿真迁移到真机时需注意的事项,通用大模型便可进一步生成训练智能体,调用GPU训练机器人运动控制的神经网络,并在仿真环境中自动验证与迭代,最终将达标的训练结果部署到真机。
上方为通用大模型训练的智能体,下方为真机效果
该实验带来的变化主要体现在训练效率上。据动易科技团队测试,此前训练一个智能体通常需接近一周;接入通用大模型后,同类流程最快可压缩至3小时左右。过去大量依赖算法工程师“手搓”、手工调试、反复验证的工作,开始逐步由通用大模型参与自动生成与迭代。通过联动通用大模型,机器人新场景训练的工作效率提升数十倍。
这三组实验指向同一个判断——通用大模型与具身智能的协作,正将具身智能从单点能力突破推向系统级自治能力闭环。 人类意图的理解、长程任务与多任务规划、逻辑顺序的把握,这些过去被认为必须由具身智能公司自己攻克的难题,开始通过分工协作加速解决。对产业而言,这意味着具身智能的落地节奏可能比预想中更快。
从OpenAI的官方报告中也可看到,GPT-6 Astra的视觉理解力既来自前期网络视频数据的积累,也来自多模态模型的基础能力。混合具身数据后,两条线在物理世界任务上完成了汇合。互联网规模的预训练,率先在机器人决策环节直接兑现为可测量的成功率。
而这,恰恰踩中了整个具身智能产业的痛点。
此前的具身大模型始终面临一个结构性难题:机器人拥有的数据规模很难与互联网大模型处于同一数量级。机器人动作数据必须通过真机、遥操作、仿真或人工示教获得,成本高出几个数量级,且不同本体的数据分布并非完全兼容。更关键的是,机器人数据中极为丰富的信息往往集中于“怎么动”,而长程任务所需的世界知识与逻辑能力,却恰恰是互联网数据更擅长提供的。
这也解释了,动易科技Embodied PhyStack为何将通用大模型置于第一层:认知短板不必由具身智能公司自行补齐,物理闭环、实时决策与稳定执行才是它们更应集中资源之处。
4. 我们正在见证一场价值迁移
通用大模型与具身智能的分工边界一旦打通,具身智能的整个产业格局也将随之变化。
首先是技术层面。 若这一趋势持续,未来的具身智能技术栈可能不会收敛为一个包办一切的“大脑”,而是重新将通用认知能力、物理智能、运动控制、本体操作等分别拆开,成为一套效率更高的协同系统。Embodied PhyStack正是这一判断下的具体路线: 通用大模型负责深度思考,PhyAgents负责实时决策,PhyCore负责运控,PHYBOT负责执行与反馈。
业内遵循此类方案的玩家其实不少。例如,谷歌DeepMind的Gemini Robotics-ER,从设计之初便只做推理不做动作,处理视觉与空间理解、任务规划和成功检测,作为机器人的高层推理模型,通过原生调用Google Search、VLA或任意第三方函数完成任务。Gemini Robotics 1.5引入的“先思考再行动”机制,可将长程任务的失败率从44.5%降至22%。
国内创业公司动易科技则用Embodied PhyStack做了另一件事:并非将通用大模型简单粗暴地嫁接至机器人本体,而是将深度思考与实时决策拆开,通过四层协同完成工作目标。结果是在长程任务与多任务的规划上,执行效率比单层方案提升超过百倍。
第二个变化将是资源配置的转移。 随着上层通用认知能力越来越易获得,具身智能企业可将更多资源集中于物理智能、控制、本体和真实场景,这些恰恰是互联网Scaling极难解决的问题。
过去,具身智能创业公司可能需同时投入本体、数据采集、基础模型、VLA和控制。未来,所有企业都需重新回答三个问题:哪些能力可直接站在通用模型之上?哪些能力必须依靠真实物理世界训练?哪些能力最终只能通过工程和场景积累解决?
若通用大模型继续提高物理世界理解与推理能力,上述技术层面的“分层架构”可能成为具身智能产业一条更经济的路线:通用模型公司继续投入巨额算力和互联网规模数据,将认知能力向上推;具身智能企业则将有限的研发资源集中于通用模型难以从互联网获得的部分——如何让模型进入实时物理闭环,以及运动控制、本体和真实场景。
一旦世界知识、视觉理解和长程推理可直接从通用模型API获得,具身智能真正稀缺的资产将毫无疑问地重新聚焦物理世界,回归产品、回归场景。谁能更快将这些资源压到真实任务、好的产品上,谁就更有可能建立起下一代具身智能公司的壁垒。
而第三个变化,可能也是最令人意想不到的变化,是Token产业生态的变化。
今天,通用大模型最大的Token消费终端主要是人和数字Agent。机器人进入规模部署后,一台持续工作的机器人会不断产生视觉、语音、环境状态和任务历史,同时持续向上层模型请求判断。它每执行一次长程任务,便需将大量视觉帧、状态数据和历史轨迹灌入上层模型的上下文窗口,端侧仅负责执行基础运动控制、导航与简单识别。长期来看,具身智能可能成为基础模型公司尤为重要的多模态推理消耗场景之一。
但Token消耗本身并非终点。真正值得关注的,是这些消耗背后,机器人在物理世界中究竟完成了什么。
客观而言,GPT-6 Astra在RoboDojo的平均成功率仅为22.48%,距离可靠自治还很远。其在精细操作、动态控制和双臂协同上同样存在短板,说明物理智能拥有独立于语言智能的Scaling问题。截至本文发稿前,已有不少于3个新策略在RoboDojo上超越GPT-6 Astra,“空降”榜单前列。
具身智能离攻克“全自治”还有很远
然而,一个未经任何具身智能针对性调整训练的GPT-6 Astra尚能取得如此惊人的成绩,人们难以想象GPT-7、GPT-8将会带来怎样的颠覆性成果,也同样难以想象国内大模型沿自身节奏持续迭代后,会给具身智能产业带来多大变量。
随着通用模型“跨界”能力的提升,Embodied PhyStack这类分层架构也将一个更尖锐的问题摆在产业面前:若世界认知、复杂推理和任务规划可越来越多地由通用模型完成,具身智能