您现在的位置是:首页 > 特别推荐 >
大晓机器人:以开悟世界模型为底座,推动物理AGI走向产业实景落地
2026-08-21 13:02:27作者:路沙来源:中国信息化周报
摘要近日,世界机器人大会备受行业瞩目,各式功能形态的机器人同台亮相、争奇斗艳,新品与前沿方案轮番登场,尽显你方唱罢我登场的热闹盛况。其中一个明显变化就是行业关注的焦点开始从“跑得快、站得稳、拿得准”的技术迭代转向全方位场景落地。 ...
近日,世界机器人大会备受行业瞩目,各式功能形态的机器人同台亮相、争奇斗艳,新品与前沿方案轮番登场,尽显你方唱罢我登场的热闹盛况。其中一个明显变化就是行业关注的焦点开始从“跑得快、站得稳、拿得准”的技术迭代转向全方位场景落地。
身处其中,大晓机器人不仅在大会上集中展示了开悟世界模型(Kairos)3.1、环境式数据采集方案2.0,更展示了面向即时零售、酒店服务和开放场景的“晓满”、“晓新”、“晓途”三大行业解决方案。
明确世界模型的技术内核
大晓机器人开悟世界模型研发负责人王飞表示,近一年来,世界模型受到资本市场与技术领域的广泛关注,但行业对其概念尚未形成统一认知。结合机器人的实际工作场景,世界模型的核心内涵可以理解为机器人通过视觉获取现实世界的初始画面,画面中包含桌面、抽屉、魔方以及机器人双臂等环境要素,针对同一现实场景,可向机器人下发差异化动作指令,例如左臂拾取魔方、右臂关闭抽屉、左臂关闭抽屉。面对不同指令,世界模型能够推演输出三种不同的未来世界状态,同时输出对应的动作执行策略。
坦白来讲,世界模型的核心逻辑为结合机器人当前观测到的现实环境,以及待执行的动作指令,推演事件后续的发展走向。其底层运行机制是输入现实观测信息与交互动作,输出未来世界状态,该状态既包含视觉层面的未来画面,也涵盖机器人后续执行策略。
“可以说,大语言模型、VLA模型的核心是预测下一个token(词元),而世界模型聚焦于预测下一个世界状态。这一特性赋予了机器人关键能力:正式执行动作前,可在虚拟空间内推演多种可能性,无需盲目试错,预先判断动作对应的结果,从中筛选高成功率执行方案。我们认为,该能力是人形机器人、具身智能建立物理直觉,自主完成复杂任务的核心基础。而基于这一理解,大晓机器人进一步探索出依托世界模型实现物理AI、物理AGI的技术路径,核心成果为自研推出了Kairos 3.1,即多模态理解、生成、预测一体化架构。”王飞解释说。
构建全链路自进化闭环
从技术的角度来看,Kairos 3.1不仅从底层实现了世界理解、物理生成、动作预测三大能力的深度融合。同时还构建了“理解—推演—执行—反思”全链路自进化闭环,可在执行失败时自主定位问题、迭代优化动作策略,让机器人大脑在真实作业中持续自我进化。
对此。王飞表示,Kairos 3.1的输入信息涵盖视觉观测、文本指令、机器人力触状态、机械臂与灵巧手本体策略轨迹等多模态数据。多模态输入经由混合Transformer架构与共享混合注意力机制,完成理解、生成、预测一体化的端到端联合训练与处理,最终压缩为共享隐空间内的世界特征表达。该特征既包含当下输入状态,也内化了模型在训练过程中习得的物理因果规律、运动学规律以及状态演化信息。
“依托共享隐空间,一方面,模型可完成对现实世界的理解、过程解析与结果评估;另一方面,能够开展未来状态的平行推演,在符合物理因果的前提下演算多种执行策略,筛选出最优运动轨迹,将末端执行器信号、关节指令下发至实体机器人完成动作执行。任务运行全程,评估器会持续开展状态判别与结果反思。”王飞进一步说道。
例如,模型推演“倒水后将杯子放置水池边”的完整流程后,理解模块会评估任务完成度并输出判定依据。反馈模块是平行推演的重要支撑,只有明确推演结果的优劣,模型的自我迭代与反思才能获得有效信号。
毕马威在最新发布的《世界模型如何重塑具身智能产业与商业新范式》报告中指出,具身世界模型正沿着“物理一致、因果干预、离线策略评估、实时闭环控制及自我进化”等方向持续演进,并从单一生成能力迈向理解、推演、执行与反思的一体化智能,原生一体化架构是世界模型的重要演进方向,Kairos正是其中代表性模型之一,凭借对多维能力的原生融合与自我进化闭环,处于世界模型发展的行业第一梯队,代表着具身智能基础模型的前沿方向。
面向未来,王飞提到了大晓机器人的中长期规划。他表示,一是梯度布局模型尺寸,大模型探索能力边界,轻量化小模型支撑产业落地。后续将把8B模型轻量化为2B级别端侧模型,适配Thor、Orin以及国产芯片,同时研发更大参数规模模型,探索物理智能的能力上限;二是迭代训练框架。世界模型快速迭代依赖高效训练基础设施,持续优化理解—生成—预测一体化共享隐空间,完善世界理解、平行空间两大模块,重点打通真机数据闭环,回流真实世界交互数据,驱动模型迭代更新。
物理AGI加速从实验室走向真实场景落地
经过广泛实践之后,大晓机器人判断,大模型已经实现对人类语言的理解,未来世界模型将实现对现实世界的理解。世界模型并非视频生成技术的简单拓展,其本质是构建机器对现实世界运行规律的认知。伴随世界模型、强化学习、机器人技术不断融合,物理AGI有望走出实验室落地真实场景,这也是大晓机器人世界模型团队持续探索的方向。
基于这一探索,面向即时零售、酒店服务、开放场景自主作业三大赛道,大晓机器人推出了“晓满”“晓新”“晓途”三大行业解决方案,推进具身智能在真实商业流程中的规模化应用进程。
大晓机器人研发副总裁刘春晓表示,“晓满”作为即时零售赛道的软硬一体化垂直解决方案,聚焦商品交付给消费者之前的履约环节,配套自研履约机器人W1,具备高可靠性、高灵巧性和空间适配能力,不仅能够满足即时零售高峰期长时间高强度连续作业,双臂还采用了仿生力控设计,力控精度小于1牛顿。此外,W1底盘最小通过宽度75厘米,可在零售店、前置仓、仓店一体等狭窄场景作业;面向酒店客衣服务场景的“晓新”,针对长程任务规划和异常场景处理两大应用难点,依托ACE—Brain—0.5认知底座,可以完成长程任务自主拆解与时序规划。同时,结合世界模型的平行推演与反思能力,例如夹爪抓取舱门位置偏移导致开门失败,失败结果将作为输入传入模型,模型定位失败原因,调整策略重新执行。此外,“晓途”则面向户外及开放环境,实现多形态机器人适配、自主导航、动态避障和集群调度,已在城市治理及文旅服务等场景落地。
关于场景落地,王飞认为,技术规模化落地离不开产业生态协同,因此大晓机器人秉持开放开源思路,共建技术基座,推动具身智能全产业链发展。在算力层面,与壁仞、沐曦、曙光、辉羲等国产芯片企业开展适配优化,完成Kairos模型在云侧训练、云侧推理、端侧推理多类芯片的部署;本体层面,与宇树、智元、众擎、银河通用等硬件厂商合作,将世界模型、具身大脑算法适配多类机器人硬件,拓展零售、安防、文娱等多元应用场景。
从最终结果来看,从开悟世界模型、环境式数采方案到三大行业解决方案,大晓机器人正在构建一条“真实场景落地—高质量数据回流—世界模型能力进化—应用规模复制”的产业飞轮。以真实商业场景检验机器人能力,以高质量具身数据反哺模型进化,再将持续升级的“最强大脑”复制到更多应用环境,推动机器人加速走进零售、酒店、城市治理等真实商业场景。
(本文不涉密)
责任编辑:路沙
身处其中,大晓机器人不仅在大会上集中展示了开悟世界模型(Kairos)3.1、环境式数据采集方案2.0,更展示了面向即时零售、酒店服务和开放场景的“晓满”、“晓新”、“晓途”三大行业解决方案。
明确世界模型的技术内核
大晓机器人开悟世界模型研发负责人王飞表示,近一年来,世界模型受到资本市场与技术领域的广泛关注,但行业对其概念尚未形成统一认知。结合机器人的实际工作场景,世界模型的核心内涵可以理解为机器人通过视觉获取现实世界的初始画面,画面中包含桌面、抽屉、魔方以及机器人双臂等环境要素,针对同一现实场景,可向机器人下发差异化动作指令,例如左臂拾取魔方、右臂关闭抽屉、左臂关闭抽屉。面对不同指令,世界模型能够推演输出三种不同的未来世界状态,同时输出对应的动作执行策略。
坦白来讲,世界模型的核心逻辑为结合机器人当前观测到的现实环境,以及待执行的动作指令,推演事件后续的发展走向。其底层运行机制是输入现实观测信息与交互动作,输出未来世界状态,该状态既包含视觉层面的未来画面,也涵盖机器人后续执行策略。
“可以说,大语言模型、VLA模型的核心是预测下一个token(词元),而世界模型聚焦于预测下一个世界状态。这一特性赋予了机器人关键能力:正式执行动作前,可在虚拟空间内推演多种可能性,无需盲目试错,预先判断动作对应的结果,从中筛选高成功率执行方案。我们认为,该能力是人形机器人、具身智能建立物理直觉,自主完成复杂任务的核心基础。而基于这一理解,大晓机器人进一步探索出依托世界模型实现物理AI、物理AGI的技术路径,核心成果为自研推出了Kairos 3.1,即多模态理解、生成、预测一体化架构。”王飞解释说。
构建全链路自进化闭环
从技术的角度来看,Kairos 3.1不仅从底层实现了世界理解、物理生成、动作预测三大能力的深度融合。同时还构建了“理解—推演—执行—反思”全链路自进化闭环,可在执行失败时自主定位问题、迭代优化动作策略,让机器人大脑在真实作业中持续自我进化。
对此。王飞表示,Kairos 3.1的输入信息涵盖视觉观测、文本指令、机器人力触状态、机械臂与灵巧手本体策略轨迹等多模态数据。多模态输入经由混合Transformer架构与共享混合注意力机制,完成理解、生成、预测一体化的端到端联合训练与处理,最终压缩为共享隐空间内的世界特征表达。该特征既包含当下输入状态,也内化了模型在训练过程中习得的物理因果规律、运动学规律以及状态演化信息。
“依托共享隐空间,一方面,模型可完成对现实世界的理解、过程解析与结果评估;另一方面,能够开展未来状态的平行推演,在符合物理因果的前提下演算多种执行策略,筛选出最优运动轨迹,将末端执行器信号、关节指令下发至实体机器人完成动作执行。任务运行全程,评估器会持续开展状态判别与结果反思。”王飞进一步说道。
例如,模型推演“倒水后将杯子放置水池边”的完整流程后,理解模块会评估任务完成度并输出判定依据。反馈模块是平行推演的重要支撑,只有明确推演结果的优劣,模型的自我迭代与反思才能获得有效信号。
毕马威在最新发布的《世界模型如何重塑具身智能产业与商业新范式》报告中指出,具身世界模型正沿着“物理一致、因果干预、离线策略评估、实时闭环控制及自我进化”等方向持续演进,并从单一生成能力迈向理解、推演、执行与反思的一体化智能,原生一体化架构是世界模型的重要演进方向,Kairos正是其中代表性模型之一,凭借对多维能力的原生融合与自我进化闭环,处于世界模型发展的行业第一梯队,代表着具身智能基础模型的前沿方向。
面向未来,王飞提到了大晓机器人的中长期规划。他表示,一是梯度布局模型尺寸,大模型探索能力边界,轻量化小模型支撑产业落地。后续将把8B模型轻量化为2B级别端侧模型,适配Thor、Orin以及国产芯片,同时研发更大参数规模模型,探索物理智能的能力上限;二是迭代训练框架。世界模型快速迭代依赖高效训练基础设施,持续优化理解—生成—预测一体化共享隐空间,完善世界理解、平行空间两大模块,重点打通真机数据闭环,回流真实世界交互数据,驱动模型迭代更新。
物理AGI加速从实验室走向真实场景落地
经过广泛实践之后,大晓机器人判断,大模型已经实现对人类语言的理解,未来世界模型将实现对现实世界的理解。世界模型并非视频生成技术的简单拓展,其本质是构建机器对现实世界运行规律的认知。伴随世界模型、强化学习、机器人技术不断融合,物理AGI有望走出实验室落地真实场景,这也是大晓机器人世界模型团队持续探索的方向。
基于这一探索,面向即时零售、酒店服务、开放场景自主作业三大赛道,大晓机器人推出了“晓满”“晓新”“晓途”三大行业解决方案,推进具身智能在真实商业流程中的规模化应用进程。
大晓机器人研发副总裁刘春晓表示,“晓满”作为即时零售赛道的软硬一体化垂直解决方案,聚焦商品交付给消费者之前的履约环节,配套自研履约机器人W1,具备高可靠性、高灵巧性和空间适配能力,不仅能够满足即时零售高峰期长时间高强度连续作业,双臂还采用了仿生力控设计,力控精度小于1牛顿。此外,W1底盘最小通过宽度75厘米,可在零售店、前置仓、仓店一体等狭窄场景作业;面向酒店客衣服务场景的“晓新”,针对长程任务规划和异常场景处理两大应用难点,依托ACE—Brain—0.5认知底座,可以完成长程任务自主拆解与时序规划。同时,结合世界模型的平行推演与反思能力,例如夹爪抓取舱门位置偏移导致开门失败,失败结果将作为输入传入模型,模型定位失败原因,调整策略重新执行。此外,“晓途”则面向户外及开放环境,实现多形态机器人适配、自主导航、动态避障和集群调度,已在城市治理及文旅服务等场景落地。
关于场景落地,王飞认为,技术规模化落地离不开产业生态协同,因此大晓机器人秉持开放开源思路,共建技术基座,推动具身智能全产业链发展。在算力层面,与壁仞、沐曦、曙光、辉羲等国产芯片企业开展适配优化,完成Kairos模型在云侧训练、云侧推理、端侧推理多类芯片的部署;本体层面,与宇树、智元、众擎、银河通用等硬件厂商合作,将世界模型、具身大脑算法适配多类机器人硬件,拓展零售、安防、文娱等多元应用场景。
从最终结果来看,从开悟世界模型、环境式数采方案到三大行业解决方案,大晓机器人正在构建一条“真实场景落地—高质量数据回流—世界模型能力进化—应用规模复制”的产业飞轮。以真实商业场景检验机器人能力,以高质量具身数据反哺模型进化,再将持续升级的“最强大脑”复制到更多应用环境,推动机器人加速走进零售、酒店、城市治理等真实商业场景。
(本文不涉密)
责任编辑:路沙





