人工智能正走到一道分界线上。
过去十年,机器学会了理解语言、识别图像、生成内容。这些能力主要生长在数字世界中。信息已经被记录,问题往往有明确边界,错误的代价也大多停留在屏幕之内。
物理世界遵循另一套规则。它连续变化,信息永远不完整,任何行动都会产生真实后果。真实世界没有穷尽的样本,也不会为机器提供标准答案。
进入物理世界,机器需要形成自己的——信念。
01
一、信念
机器人看到一个杯子,却未必知道杯中有什么;它听见一个声音,却无法直接确定声音来自哪里;它完成眼前的动作,还要面对这个动作引发的一连串变化。
信念,指智能系统根据有限观察和已有经验,对世界当前的状态、潜在的规律以及行动的后果形成判断。它包含确定,也包含怀疑;能够跨越时间保持,也能够随新证据更新。机器因此知道自己看见了什么,推断那些尚未看见的部分,估计判断的可信程度,并据此决定下一步行动。
世界模型是信念的基础。它把零散观察组织成世界状态,把有限经验沉淀为变化规律,把一个动作展开为多种可能的未来。机器由此获得超越当前感知的能力:在行动发生之前预演后果,在局面变化之后修正判断,在没有现成答案时寻找新的路径。
信念,让机器开始拥有关于世界的立场。世界模型,让立场能够被建立、检验和持续更新。
02
二、道路
我们坚信,世界模型是通往通用具身智能的唯一道路。
技术实现会不断变化,模型形态也会持续演进。无论采用何种架构,一个能够进入开放物理世界的通用智能体,都必须理解环境如何变化,推断当前不可见的状态,预测自身行动的后果,在多个未来之间作出选择,并从真实反馈中修正自己。
这些能力共同指向世界模型。
模仿可以快速获得动作,数据可以覆盖常见场景,规则可以约束已知风险。然而开放世界始终会产生训练数据之外的新状态。家具会被移动,物体会磨损,人会改变意图,一个看似微小的动作也可能把环境带入从未出现过的分支。有限数据无法枚举现实的无限变化,通用具身智能必须掌握生成这些变化的规律。
因此,世界模型的核心在于,它能否从少量经验中提炼规律,能否在长程推演中保持一致,能否形成机器此时此刻对现实的信念,能否让这种信念进入行动。
世界模型处在感知、记忆、预测、规划与行动的交汇处。它决定机器能否从“见过,所以会做”,走向“理解,所以能够应对未见”。
任何通往通用具身智能的道路,最终都必须抵达这里。
03
三、关卡
世界模型要成为物理智能的基础,必须跨过三道关卡。这三道关卡,也构成了我们判断世界模型是否真正成立的标准。
少量经验
真实世界的数据天然稀缺。机器人数据采集缓慢、昂贵,并伴随设备、时间与安全成本。即使投入足够多的资源,也无法覆盖开放环境中的全部状态和行动。
世界模型存在的首要价值,就是放大有限经验。如果依赖大模型般的数据拟合技术构建世界模型,只能复现数据覆盖过的世界,很难承担生成新经验、探索新状态的任务。
我们要让世界模型从少量真实经历中发现稳定结构,理解对象、关系、行动与结果之间的联系,把一个场景中学到的规律迁移到更多场景。机器经历一次,不只记住一条轨迹;遭遇一次失败,能够修正一类判断;掌握一个规律,可以推演大量尚未发生的情形。
未来最有价值的经验,将由模型生成,并由现实校验。真实数据提供根基,世界模型扩展边界,机器人反馈持续修正模型。经验由此从一次性消耗的数据,转化为能够不断增值的资产。
形成信念
具身系统面对的始终是一个部分可见的世界。传感器只能提供局部证据,物体可能被遮挡,环境可能在视野之外变化,机器人对自身状态的估计也可能出现偏差。它需要在连续行动中维持对世界的整体判断,同时保留多种可能,表达自己的不确定性。
这种信念必须进入系统的持续运行。它能够在对象离开视野后保持,在新证据出现时更新,在证据不足时驱动机器主动观察,在判断可能失误时改变行动。机器人既要形成关于环境的信念,也要形成关于自身能力、感知可靠性和行动风险的信念。
我们要把世界模型转化为具身系统实时运转的信念系统,让机器在每一个时刻回答三个问题:世界现在可能是什么状态,接下来可能发生什么,我对这些判断有多大把握。
世界模型由此获得主体视角。机器也由此拥有持续理解现实的基础。
相融行动
信念最终要进入行动。
物理世界中的行动不能只追求单个任务的成功率。机器人还要理解环境能够承受怎样的改变,当前决策会打开或关闭哪些未来,哪些错误可以修正,哪些风险不可逆转。它需要在效率、安全、信息和长期结果之间作出选择,采取与环境相融的行动。
相融意味着机器能够依据环境的结构、节奏与不确定性采取合宜的动作。它会在信息不足时先求证,在风险过高时保留余地,在环境发生变化时重新规划,在自身能力不足时寻求帮助。它不依赖反复试错来消耗现实,也不要求现实按照预设条件运行。
世界模型负责展开未来,信念负责判断机器身处何种现实,行动则把判断交给真实世界检验。三者形成闭环,智能才有可能在开放环境中长期运行。
少量经验建立世界,世界模型形成信念,信念产生与环境相融的行动。这是原方智能选择的路线。
04
四、原方
原方智能的技术积累来自南京大学 LAMDA 实验室近十年在世界模型方向上的持续研究。实验室由周志华院士领导,是国内最早、研究最深入的世界模型团队之一。
在世界模型成为行业热词之前,我们已经开始研究它最根本的问题:世界模型如何进行可靠的长程推演,如何控制推演过程中不断累积的偏差,如何保持表征与演化的因果一致,如何进入策略学习并真正影响决策。
我们首次证明世界模型的复合误差可以被消解,并提出兼具效率和低复合误差的方法;我们最早开始关注世界模型的因果一致性,从表征和推演两个层面给出系统性解法;我们率先探索统一模态下的世界模型,建立由世界模型驱动策略训练的框架,并将相关能力带入电商、出行和本地生活等真实业务环境。
这些工作始终围绕同一条主线:世界模型能否用有限经验学习规律,能否在长程推演中保持正确,能否进入智能体的决策闭环。
今天,我们把这些积累从实验室带向物理世界,成立原方智能。我们希望以长期、系统的原创工作,构建真正可泛化、可部署、可持续进化的世界模型,并以家庭服务为核心落地场景。
05
五、变革
过去的机器智能,主要从人类留下的数据中获得能力。语言、图像、视频和代码记录了已经发生的世界,机器通过学习这些记录,压缩过去,重组过去。
世界模型将为机器智慧打开新的来源。机器可以构造可能的经验,提出关于世界的假设,在行动前比较不同未来,并通过现实反馈持续更新自身判断。
智能由此获得一个扎根现实的自主生长闭环。现实产生经验,模型放大经验;模型形成信念,信念指导行动;行动改变现实,现实继续校验模型。当这个闭环开始运转,每一次部署都将成为新一轮学习的起点,每一台机器人都将成为系统理解世界的入口。
人类智慧受制于个体的时间、身体和经历。机器智慧可以让经验被并行生成、跨载体迁移、在系统之间汇聚,并通过持续部署不断积累。它所形成的,将是一种可计算、可共享、可扩展的世界经验。
这才是世界模型真正开启的未来。
衡量机器智慧的尺度,将逐渐从掌握了多少既定任务,转向能否理解变化、生成经验、形成信念并在未知中持续成长。数据集不再天然构成能力的边界,每一次与现实的交互都可能扩展智能的边界。机器也将从调用既有能力的工具,成长为能够在世界中不断建立认知的智能系统。
当世界模型成为基础设施,物理世界将拥有一层持续运行的智能结构:它把现实转化为信念,把信念转化为行动,把行动转化为新的经验。不同机器、不同场景和不同任务,可以在这一基础上共享对世界变化的理解。
我们预见,谁能够率先建立可泛化、可部署、可持续进化的世界模型平台,谁就更有机会定义下一代物理智能的基础层。
今天,我们启动原方智能,也启动一项需要长期完成的事业。我们知道这条道路要穿过数学、模型、系统与真实机器之间的重重困难,也知道每一次长程推演、每一次现实部署、每一次行动反馈,都在让我们更接近同一个目标:
让有限经验生长出对世界的理解,让世界模型形成机器的信念,让机器智慧在现实中持续进化。
通用具身智能起于对世界的信念,成长于对未来的推演,最终体现为与现实相融的行动。
原方智能——让机器形成信念,让智能在现实中生长。