Create

Sign in to ReadmeX

Sign in to join communities, post, vote and chat.

New here?

Story

MoWorld world model reaches Huawei Mate 90 phones

AI summary

Moxin Technology is reported to have deployed its MoWorld-2.0-Flash world-model variant in the HarmonyOS-exclusive Moxiao Pet app for Huawei’s Mate 90 series. The source says cloud infrastructure generates 3D Gaussian assets while the approximately 600-million-parameter model runs on the phone for rendering, but the performance and cost claims are promotional and unverified.

Why it matters: The deployment illustrates an emerging cloud-device approach for bringing interactive 3D and 4D generation to consumer hardware.

Moxin TechnologyMoWorldMoWorld-2.0-Flash

0
Source text新智元 · 11 min read

ASI启示录 2026-10-05 14:58 辽宁

新智元报道  

这个假期,当大家在朋友圈晒国旗、晒旅行、晒美食的时候,华为选择在国庆节这一天扔出了重磅产品——

华为Mate 90系列正式发布,全系搭载新一代麒麟芯片,鸿蒙7加持!

发布会上有太多值得聊的东西,但有一个细节——一款叫「摸小宠」的鸿蒙独占应用,惊艳地亮了个相。

它能干啥?你掏出手机,拍几张你家猫的照片,上传。

几秒钟后,你手机里就多了一只「猫」。

不是那种只能转圈圈的3D模型猫,而是一只有空间结构、会动、能从任意角度看、你走近它它还在摇尾巴的4D数字猫。

你可以绕着它转,它就在那里,在你的手机屏幕里,像真的一样。

听着是不是有点科幻?

这是4D世界模型第一次真正跑进了手机应用。

而做到这件事的魔芯科技,也成为全球范围内率先将4D世界模型推进到产业应用落地的公司。背后的技术叫MoWorld。

一张照片,「走进去」的世界

过去我们说AI能生成图片,比如你给Midjourney一句话,它给你一张图。

后来AI能生成视频了,Sora们开始造出能动的画面。但本质上,那还是一段录像带,它的视角是选定的,不会变,你不能走过去看看那栋建筑背后长什么样。

而MoWorld做的事情,是把一张照片变成一个「可以走进去」的世界。或者用更技术的话说,叫原生重建4D世界模型,它从一开始「原生」生成的就是一个4D空间。

你给它几张普通手机拍的照片,甚至几段随手拍的视频。MoWorld不会简单地「复制」画面,而是去理解这些画面背后的空间结构——那堵墙在哪儿?那张桌子离镜头多远?桌子后面被挡住的部分长什么样?

然后,它会基于这种空间理解,把平面的图像扩展成一个三维空间。你可以在这个空间里前进、后退、转弯,看到照片里没有直接展示过的角度和区域。

这就是「摸小宠」这个小应用背后真正厉害的技术底座。

你上传几张猫的照片,MoWorld先理解猫的三维形体结构,真正从有限的视角信息里推算出猫的空间结构、毛发纹理、体型比例。

然后,它还理解猫正在做什么。

猫在摇尾巴?好,当你切换到侧面视角的时候,尾巴的摇晃动作依然是连续的、符合空间逻辑的。你绕到猫的背后,猫不会突然僵住。它该怎么动还怎么动,只是你观察的角度变了。

这就是所谓的「4D」——三维空间加上时间和变化的维度。

模型不仅知道物体在哪里、长什么形状、从不同角度看应该是什么样子,还知道物体正在怎么运动、动作在不同视角下怎么连续呈现、场景随时间发生了什么变化。

如果用一个更直观的比喻:以前的AI生成内容是「给你看一部电影」,而MoWorld生成的,是一个「你可以走进去逛逛的片场」。

最能展示这种能力的,就是所谓的「子弹时间」效果。

就像《黑客帝国》里Neo躲子弹那个经典镜头:模型根据少量图像恢复场景和物体的空间关系,从不同角度生成连续、稳定的环绕视图。

不同的是,这里不需要几十台摄像机,几张手机照片就够了。

不只是宠物:

应用落地才是真正的护城河

魔芯科技最值得关注的一点,恰恰是它在应用落地上的领先——摸小宠只是其中一个消费级入口,MoWorld已经在多条产业线上同步推进,多个合作项目进入技术验证和具体实施阶段。

影视和游戏。传统的影视制作流程中,一个场景需要经历建模、贴图、灯光、动画等多个漫长环节。

MoWorld可以把前期场景搭建周期大幅压缩,快速生成场景资产,支持自由运镜、天气切换、物体编辑。

天气切换

一个场景可以生成多个故事走向的版本,分镜预演和概念验证的成本陡然下降。

在游戏产业,500FPS以上的资产渲染能力和移动终端的高帧率运行,有望降低互动世界对高端显卡的依赖。

室内空间4D建模

具身智能训练。 以前训练一个机器人抓取、避障、搬运,需要在真实环境里反复试错。设备损耗、场地成本、还有碰撞伤人的安全隐患。

MoWorld搭建的数字仿真训练场,可以让机器人在虚拟空间里完成所有动作演练,碰撞和失误只产生虚拟损耗,支持高频次复盘迭代。

加入物理属性后,机器人还可以在仿真环境里体验重力、碰撞反馈和物体交互。

自动驾驶。 MoWorld可以在3D空间中调整道路环境、交通参与者和物体运动状态,特别适合生成那些现实中成本高、风险大、难以重复采集的长尾场景。例如雨雪天气、坑洼路面、突发事件。3D/4D资产可以方便地调整、复用和重新渲染,提高训练数据的生产效率。

自动驾驶训练场景

工业数字孪生。 工厂产线、矿山等场景中,MoWorld可以将真实环境快速转化为空间资产,用于设备布局调整、改造方案预演、远程培训和异常场景模拟。

不再需要反复人工建模,现实场景到仿真数据的转化效率大幅提升。

矿山建模

城乡规划与文旅。虚拟游览、沉浸式内容生产、方案展示、空间重建,这些以前需要大量人工搭建的工作,MoWorld可以用算法来加速。

文旅场景重建

MoWorld的价值不是单纯地「画面更好」或「帧率更高」,而在于它能以低成本方式生成高质量、可复用的3D/4D空间资产,让这些资产真正流入产业系统被反复使用。

这是一条从「技术能力」通往「产业效能」的桥梁。

端云协同:

6亿参数模型怎么塞进手机的

这些产业应用能铺开,离不开一个前提:MoWorld跑得动、跑得起。

听到这儿你可能会问:这种级别的AI运算,不得在数据中心里烧几百张GPU才能跑?手机?开什么玩笑?

确实不全是手机在算,摸小宠背后是一条端云协同的链路:照片上传到云端,昇腾NPU上的扩散模型先生成高质量3D高斯模型——这一步算力需求大,交给服务器。

然后魔芯科技做了一个「瘦身版」MoWorld-2.0-Flash,约6亿参数,经过量化裁剪和算子适配,直接跑在Mate 90的麒麟芯片上。最终渲染呈现也在手机端完成。

国产算力训练,云端生成,端侧渲染。

说着轻巧,做起来极难。

把一个大型服务器上的世界模型塞进手机,不是压缩打包那么简单。

算子要适配麒麟架构,量化要保效果又降开销,延迟、功耗、发热全是硬骨头。

但这么做有个很实际的好处:省钱。

一部分计算搬到手机上,云端负载就下来了,运营成本随之降低。对一个面向普通消费者的应用来说,这一点决定了它能不能大规模铺开。

还有个细节值得注意:这整条链路从头到尾跑在国产硬件上。

训练用昇腾NPU,云端推理用昇腾平台,端侧跑麒麟芯片。

这条路线让MoWorld的推理成本只有同等进口GPU方案的30%。降本70%,这才是世界模型能规模化落地的真前提。

不止是看着真:它开始懂物理了

跑得动、跑得起之外,MoWorld还在持续拉高技术上限。

如果它只是能生成逼真的3D场景,那不过是个高级建模工具。真正让它配得上「世界模型」四个字的,是它开始理解物理规律。

今年7月MoWorld 1.0发布时,主打一个「快」——全国产NPU,最高约50 FPS实时交互。那时候它已经证明自己不是论文demo,而是真能跑起来的系统。

之后的迭代速度很猛。到9月底,几个关键能力已经质变:

物理属性进来了。重力、弹力、刚性、外力,这些真实世界的规则被显式融入模型。

踢一脚足球,球沿地面滚动弹起;碰一下花草,花草会摆动;同一场景可以切换晴天雨天雪天。

模型不再只管「世界看起来什么样」,开始回答「世界被碰了一下会怎么变」。

渲染帧率提高了。3D/4D高斯资产渲染突破500 FPS,手机端侧也能跑到100 FPS。不需要高端显卡,普通手机就能流畅呈现三维交互世界。

输出的东西能用了。MoWorld生成的不再只是「好看的3D视频」,而是标准化的3D/4D高斯资产,可以直接导入游戏引擎、影视制作系统、数字孪生平台、机器人训练环境。生成一次,到处调用。

场景还能改。增删物体、调整位置、切换天气,同一条街可以一键从晴天变暴雪,同一个影视场景换道具换镜头,不用从头重建。

把这些能力叠在一起看,MoWorld更接近于在模拟一个遵循物理规律的平行世界。

而摸小宠恰恰是这个看着最「轻」的场景,证明了一件最「重」的事——4D世界模型可以跑在每个人的手机上。

过去,世界模型一直漂在实验室和论文里,从Sora到Atlas,大家讨论的都是能力多强、效果多好,但很少有人认真回答一个问题:普通人什么时候能用上?

魔芯科技用摸小宠回答,现在就可以。

全球坐标系下的MoWorld:

应用落地上的领先身位

把MoWorld放到全球竞争格局里看,它的差异化就更清晰了。

2026年9月,李飞飞创立的World Labs发布了Atlas——一个多模态世界模型,核心能力是使用少量照片生成可交互的3D世界。

这个产品在业内引发了巨大关注,某种程度上甚至标志着世界模型赛道正式进入国际主流视野。

Atlas和MoWorld有不少共同点:都可以用少量普通照片作为输入,都能输出三维场景结构,都支持自由浏览和新视角合成,都利用大模型来补全有限观测之外的空间信息。

但差异同样显著:

动态4D理解。 Atlas目前主要聚焦于静态3D空间的生成与理解。MoWorld则已经做到了动态4D——不仅理解空间,还理解时间。

物理交互能力。 MoWorld已经将重力、弹力、刚性等物理属性引入生成空间,物体能够对用户动作做出基于物理逻辑的响应。而Atlas目前更侧重于空间结构和多模态理解。

推理效率与成本。 MoWorld在推理速度和成本控制上具有优势。基于国产昇腾NPU的部署路线让它的推理成本只有进口GPU方案的30%,并且已经探索出了手机端侧运行的能力。

可以说,如果Atlas代表了世界模型在「空间理解深度」上的国际标杆,那么MoWorld的核心优势不仅在模型能力上不遑多让,更在应用落地上全面领先——

从4D动态理解到物理交互,从云端到端侧,从实验室到真实产品和产业流程,它已经跑出了一条完整的路。

00后博士和他的百亿征途

最后,聊聊这家公司。

魔芯科技的创始人陈天润是一个00后。浙江大学博士在读,师从中国工程院院士潘云鹤。

陈天润在Science、Nature Photonics、IEEE TPAMI等顶级期刊,以及ICCV、CVPR、ICML、SIGGRAPH等顶级会议上发表高水平论文50余篇。2022年获得共青团中央科技创新最高奖项「中国青少年科技创新奖」,是浙江省高校唯一获奖者。

他在央视的采访中说过一段话:「世界模型更像是给机器提供一个理解世界的大脑,让机器去理解它所在的环境,就像人一样,给机器提供了预测下一个世界状态的能力。这是一种冒险,但是冒险背后是我们真切地拿着这把舵在开这艘船,所以我相信既然这个舵掌握在我们手上,希望能够把这艘船开得很远。」

这不是一句空话。

从2025年底到2026年9月,魔芯科技在9个月内连续完成5轮融资,最新一轮融资规模达10亿元量级,公司估值已经逼近100亿元。投资界的评价是,这是世界模型赛道上跑得最快的中国选手之一。

如今,华为手机发布会上给了他们展示位。

从全国产算力训练到鸿蒙应用端的完整链路,魔芯科技已经成为4D世界模型领域的基础设施构建者。

编辑:所罗门

秒追ASI

⭐点赞、转发、在看一键三连⭐

点亮星标,锁定新智元极速推送!

跳转微信打开

Read the original →

Comments

I've used this: share my experience What I think: share my view
How important is this story?No ratings yet

No comments yet. Start the conversation.