来源:环球网

【环球网科技报道 记者 郑湘琪】“过去两年AI行业的核心命题是‘生成’,从2026年开始,核心命题将转向‘理解’与‘交互’,让AI真正理解物理世界的运行规律并与真实环境进行闭环互动。”WAIC 2026期间,昆仑万维董事长兼CEO方汉在接受记者采访时,谈到了AI产业正在经历的关键转折。在他看来,世界模型正是实现这一跨越的关键底座。


如其所言,回看近年来的产业脉络,当文生图、文生视频逐渐从新鲜事物变成日常工具,行业对“生成”能力的追逐正在悄然让位于一个更根本的追问:AI能不能真正“看懂”和“介入”物理世界?从科技巨头密集布局Physical AI,到具身智能赛道持续升温,一个判断正在被越来越多的人接受——让AI“懂世界”“能行动”,才是下一阶段竞争的重心。

在方汉看来,世界模型的技术路径已越来越清晰。“自动驾驶经过多种技术路线的角逐,最后收敛到了端到端的FSD模型上。世界模型最后也会收敛到端到端的模型上去,但数据规模仍是有待突破的瓶颈。”

世界模型无疑需要海量训练数据,但传统精密采集方式成本极高。对此,方汉给出的解法是异构数据。“异构数据成本低、场景丰富,采集门槛极低,会成为世界模型预训练的主要数据来源。而更好的精密数据可用来做后训练,这些数据可以进行互补。”

数据问题有了突破口,技术落地该往哪走?方汉将其拆解为三个看得见的方向。其一,世界模型将走出屏幕,进入物理世界。具身智能正从实验室走向真实环境,这一趋势要求机器人在行动前需要先对环境进行推演——预判动作后果、评估环境变化、调整应对策略。这种能力的突破,将使竞争焦点从单一任务转向陌生环境下的通用模型能力。“谁能训练出在复杂场景中依然‘看得懂、做得对’的模型,谁就拿到物理智能时代的入场券,这也是中国智能制造和机器人产业真正亟需的底层能力。”他说。

其二,游戏行业将率先被世界模型改变,开放世界游戏不再依赖数百人团队数年的手工搭建。方汉预计,未来三到五年世界模型将成为游戏行业的基础设施,彻底刷新内容生产方式,而国产模型已在这一赛道领跑全球。

作为昆仑万维世界模型系列的最新迭代,Matrix-Game 3.5在本届WAIC上带来了技术升级。据介绍,Matrix-Game 3.5聚焦可交互世界模型技术,实现了Patch级别的记忆注入与系统级性能优化,5B模型在720p分辨率下可实现单卡20FPS实时生成,具备1分钟记忆能力。

其三,AI音乐、AI视频等工具将从技术试验变成大众创作工具,促进AIGC的深层发展。此次WAIC同步发布的Mureka v9.5与O3音乐大模型,其中v9.5版本聚焦“没有AI味”,不再依赖声部堆砌和复杂编配制造“厉害”的第一印象,而是在真实音乐框架中以更克制的方式处理编配、人声与情绪。O3则让模型在生成过程中持续审视当前表达:局部旋律是否仍服务全曲目标,编配是否遮蔽人声,情绪是否提前透支,结构是否正在偏离最初意图。

据方汉介绍,当前一首歌经常和视频一起被消费,短视频、游戏、影视预告、品牌片和虚拟人演出,都需要声音与画面共同表达,Mureka 这次升级,也把音乐与视频 MV 接进了同一条创作链路。歌词决定叙事、节拍决定剪辑、旋律决定记忆点、画面决定传播场景,Agent 要做的,是让这些信息在同一个创作目标下持续传递,而不是把几个生成工具简单拼在一起。

更为重要的是,Mureka已从单一的音乐生成工具演进为完整的“版本化制作”平台。对此,方汉强调,这并非是为了替代音乐人,而是以期大幅降低创作门槛,让更多人的表达得以释放,从而改变音乐乃至整个 AIGC 产业的创作生态。

诚然,技术普惠的逻辑在于,门槛每降低一分,能参与的人就多一圈。方汉以网络小说行业为参照解释称,“当创作门槛降低之后,整个创作者规模会急剧扩大,市场空间会不断扩容。因为视频比文字覆盖的人群更广,现在模型能力已经够了,我们要做的就是让提示词写得不好的人也能生成效果逼真的视频。”

而展望具身智能赛道的竞争格局,方汉认为中国的独特优势正在显现。“中国是全球数据采集设备的硬件产地,拥有门类齐全完整的工业体系和庞大的服务业人群。因此,中国在具身智能赛道上的竞争态势要比文本大模型有利非常多。”