打开手机拍一张照片,几十秒后就能拿到一个可以 360 度旋转、导出 GLB、连接 3D 打印机的高还原度模型——这件在 2025 年还像科幻的事,被一家 2025 年才成立的初创公司做成了原生鸿蒙应用,直接登上了华为应用市场下载榜 Top 30,并拿下当月最佳应用。这家公司就是极顶数创,产品叫 V2Fun。它在 2026 华为开发者大会(HDC 2026)上作为鸿蒙系统首个 3D 大模型 AI 原生应用亮相,引发了科技圈与资本市场的密集讨论。鸿蒙为什么在 3D 这种重技术、高门槛的赛道,唯独把生态首发的位置给了一家年轻公司?
把视角拉到更远处看,这件事并不只是 V2Fun 这款产品拿到了鸿蒙的背书,而是鸿蒙押注了极顶数创背后那一整套关于「世界模型」的终局想象。换句话说,极顶数创今天拿到的,不是单一应用的入口,而是一张通往 3D 世界模型底层设施的入场券。
传统 3D 建模的痛点,不在某一个软件难用,而在于它本身就是一条工业流水线:模型轮廓要准、结构要稳、材质要完整,还要能被打开、查看、导出,最后进入打印、游戏、动画或工业设计的下一步。对专业设计师而言这是日常工作,对绝大多数普通人来说却是「看得见,做不了」的高门槛。
V2Fun 在移动端做的事情,就是把这条流水线压缩成三步:拍摄或上传图片——AI 识别主体——生成 3D 模型。整个过程只要几十秒,生成的模型支持 GLB、3MF 等行业标准格式,可以直接对接 3D 打印机,把数字创意变成实体手办、潮玩或个性化礼物。
这一步真正改变的不是「某个按钮更易点」,而是整个 3D 创作链路的认知门槛被整体前移。一个从来没接触过建模的人,想要做一个宠物摆件的 3D 模型,过去要先去理解什么是拓扑、什么是 UV,现在只需要拍一张照片。
V2Fun 的产品矩阵是「移动端轻量起草 + Web 端专业深化」的双端闭环生态。移动端负责低门槛普及,Web 工作台(v2fun.art)负责工业级高效生产。Web 端提供 AI 生图、智能编辑、多视图生成、8K PBR 材质、骨骼自动绑定、动作库调用等完整管线,本质上是一套面向专业内容生产者的 AI 3D 全流程工厂。
资深游戏原画师「喵不灵」在接入 V2Fun 之前,曾为了独立构建新艺术运动风格的西欧幻想小镇游戏场景《唯诗利亚》(Wishlia),先后放弃过 7 次尝试。问题不在设计能力,而在原画、模型、地编三个环节之间高昂的转化成本——请同行帮忙建一个角色模型就要上万元,一个人面对一整座小镇的建模工作量几乎注定失败。但在接入 V2Fun 之后,通过「图生模」工作流,他一次性拿到了超过 100 个高还原度的建筑、街角和道具 3D 资产,在空间中快速组合验证,顺利推进了第 8 次尝试,也是最接近成型的一次。
他的原话很能说明问题:「传统流程里,原画、模型、地编是割裂的。而现在,因为 V2Fun 降低了转化成本,这些职能正在合并。我不再只是一个画画的,我成了一个真正的设计师、一个造物主。」这个案例说明,V2Fun 提升的不是单个模型的生成效率,而是让个人创作者第一次有机会打通从概念、资产到空间验证的完整链路。
二、鸿蒙给的到底是什么:四项系统级原生突破
很多人会问,V2Fun 既然是云端 AI 生成工具,放到 iOS 或者安卓上也一样能用,鸿蒙到底提供了什么独特价值?极顶数创在 HarmonyOS 上做的,不是简单的应用迁移,而是围绕系统级 3D 图形、资产管理、格式流转和用户感知,做了四项原生突破。
第一是系统级 3D 图形能力适配。依托鸿蒙的 ArkGraphics 3D 服务,V2Fun 在移动端实现了自然的 3D 模型预览、旋转与交互,解决了 3D 文件在 C 端长期「无法直观查看」的痛点。过去即便有人做出了 GLB 文件,在普通手机上打开也是一张静态缩略图,完全没有 3D 的体验;鸿蒙把这件事做成了系统能力,任何合规应用都可以调用。
第二是 3D 资产无缝沉淀至华为图库。生成的 GLB、3MF 等标准格式文件,可以像管理普通照片一样在图库里管理、按日期浏览、跨设备同步。这意味着 3D 资产第一次进入了系统级内容管理入口,不再沉睡在某个冷门文件夹里。
第三是标准格式导出与 3D 打印链路打通。通过原生架构,模型可以无缝流转到物理制造环节,契合空间智能从虚拟走向真实的生态趋势。
第四是鸿蒙原生体验提升内容流转效率。把建模、预览、图库管理、流转分享融为一体,形成端到端的端侧创作闭环。
这四项突破单看每一项都不算革命性,但组合在一起的意义很明确:3D 内容从生产到消费到分发再到物理落地,第一次有了一套完整的系统级支撑。鸿蒙给出的不是某个 API,而是把 3D 当作一类一等公民内容来对待。
三、极顶数创的核心底牌:VAE + DiT 与几何 Token 化
如果只靠系统级适配,V2Fun 完全可以做成一个普通的鸿蒙原生应用。鸿蒙之所以愿意把生态首发位置给它,核心在于极顶数创背后的自研 3D 大模型具备行业领先的精度与还原度,这是大厂也难以短期复制的技术底牌。
团队的技术路径经历了从「二维升三维」到「VAE + Diffusion」,再到全面迈向「VAE + DiT」架构的持续迭代。VAE + DiT 架构相较于传统 Diffusion 架构,更适合大规模模型训练和复杂结构建模,能够在更统一的表示空间中处理几何、纹理、视角和语义信息,有利于提升 3D 生成的一致性、可控性和扩展能力。在这一架构背后,极顶数创对 AI 3D 的判断是:3D 生成不是图像生成的延伸,还需要同时解决结构、纹理、视角和资产可用性问题。VAE + DiT 路线更适合支撑未来从单物体生成走向场景生成、动画生成和世界模型构建。
在具体算法层面,极顶数创做了两个核心突破。
第一个是几何表达层面的突破。传统路线要么使用 SDF 进行密集采样,导致 Token 臃肿;要么使用 Dual Contouring,把大量算力浪费在无效的「结构记账」上。极顶数创提出了新的几何表达框架,把网格 Token 化重新定义为「局部表面证据采样」。基于「局部平面」假设,每个体素仅使用一个表面支点加一个朝向符号(Dim 4),即可精确诱导重建。再结合「空间复杂度非均匀」假设,采用金字塔式自适应分配,把精细 Token 投向高曲率、薄结构等复杂区域。最终呈现在用户面前的效果是,模型轮廓更准确、薄壁结构更完整。
第二个是纹理生成层面的突破。针对多视角高分辨率去噪时极易引发的物体表面结构错位与纹理撕裂问题,极顶数创提出了局部—全局双流去噪与稀疏 3D 空间库注意力机制。全局流锚定物体身份与粗结构,局部流专注于合成表面细节。最核心的创新在于,所有可见 Token 会按照其在三维表面上的真实位置,直接索引进一个共享的稀疏 3D 记忆库中交换外观信息。该设计与视角数量和分辨率完全解耦,可在推理时无缝扩展出工业级 8K 乃至 12K 的极致原生贴图效果。
这些算法听起来很抽象,翻译成用户的体验就是:模型在多角度查看时不崩、纹理在放大后仍然清晰、生成出来的资产可以直接进入专业软件、动画生产、3D 打印和后续工作流。换句话说,V2Fun 不是「生成得快」这么简单,而是「生成得对、生成得能用」。
四、复合人才壁垒:算法、图形学、系统、产品同时到位
光有模型能力还不够。AI 3D 的产品化,需要算法、图形学、XR 交互、工程系统和产品能力同时到位。这恰恰是极顶数创团队结构的独特之处。
创始人兼 CEO 嵇盼毕业于浙江大学,后赴海外攻读博士学位,师从 3D 视觉领域世界级科学家;他曾深耕硅谷核心 AI 圈五年,回国后加盟顶尖大厂,担任腾讯 XR 感知交互中心负责人。在 3D 空间计算、XR 感知交互、大模型算法管线和系统级工程产品化落地方面,他有丰富的实战经验。算法与工程团队的核心成员同样来自浙大、上交、同济、澳国立、山大等海内外院校,覆盖 3D 视觉、深度学习、图形学、AIGC 等方向。
这种团队结构在 AI 3D 这个赛道极为稀缺。很多 AI 公司擅长模型,但缺乏对图形学底层、系统工程、XR 交互和产品落地的理解;很多传统 3D 工具公司又停留在几何处理层面,缺乏对新一代大模型架构的把握。极顶数创既不是单纯的算法团队,也不是传统 3D 工具团队,而是一支同时具备 3D 视觉、深度学习、图形学、XR 交互、系统工程和产品化能力的复合型战队。
这也就解释了为什么 V2Fun 能与 HarmonyOS 做深度适配。它需要的不只是一个模型,也不是一个前端产品,而是一套从技术、工程系统到产品化落地的复合能力。在 AI 3D 这一赛道,人才密度本身就是优势,也是短期内大厂或竞品难以跨越的硬核护城河。
五、从 3D 实体到世界模型:极顶数创的终局想象力
如果说前四项还是 V2Fun 这款产品本身的成功,鸿蒙真正押注的,其实是极顶数创关于世界模型的终局想象。「极顶数创从创立之初,定位就是一家世界模型方向的基础设施公司。」嵇盼这样定义。
目前关于世界模型的探索主要有两条路线:一条偏向纯 2D 视频生成,通过连续画面模拟世界变化,缺乏显式三维结构,在长程交互中容易变形和漂移;另一条偏向纯 3D 场景生成,可构建精美空间,但缺少时间维度和物理因果,很难成为可推演的动态世界。极顶数创的核心判断是,下一代世界模型必须是渲染、仿真与规划的深度融合——因此他们选择以具备实体、动画和骨骼的「真 3D」为世界主体,借助「动作控制视频生成技术」引入时间与物理因果,实现从资产到世界的平滑过渡,「以 3D 实体为骨骼,以动作控制为血肉」。
这一布局分为两个阶段。第一阶段通过 V2Fun 双端产品构建主体与确定性资产,生成带精准几何、材质和骨骼的高精度 3D 原生实体,世界模型的主体必须是真 3D 的。第二阶段引入动作与时间维度,实现动态交互闭环。为此,极顶数创在最新前沿研究中引入了「隐空间高斯记忆体(Latent Gaussian Memory)」与「动态偏差归档机制(Dynamic Deviation Archive)」:高斯记忆体把实时动作与视角切换无延迟地转化为 3D 记忆颗粒,动态偏差归档机制让 AI 在训练阶段便接种了「差错抗体」,在交互推理时自动修正长程误差。无论视角走多远、绕多大一圈,AI 都能在「脑海」深处精准召回空间记忆,场景颜色始终如一、几何结构稳如磐石,彻底解决纯视频路线结构变形的硬伤。
六、四个底层场景:工业、具身、仿真、世界模型
具体到落地,极顶数创的布局指向了四个底层场景,每一个都不是当下热门的浅层应用,而是空间智能真正进入产业的关键节点。
在工业制造领域,V2Fun 的 3D 生成能力可以用于产品原型设计、零部件建模、外观方案验证、个性化定制和 3D 打印前置流程,帮助企业降低建模和打样成本。这意味着工业设计师可以大幅缩短从概念草图到可验证原型的周期。
在具身智能领域,高质量 3D 资产、动态动作数据和可编辑场景可以成为机器人训练和仿真的重要基础。相比单纯的视频数据,结构化 3D 内容更有利于机器人理解空间、物体关系和交互过程。当具身智能从 demo 走向规模化部署时,数据基础设施的角色将远比想象中重要。
在仿真训练领域,世界模型可以让智能体在虚拟空间中进行大规模、长程、可重复的训练,同时避免现实世界的高成本与安全风险。极顶数创所积累的 3D 模型、动画、动作和场景生成能力,正是构建动态 3D 世界状态的内容基础。
在世界模型领域,V2Fun 的能力将进一步成为构建动态 3D 世界状态的内容底层。未来用户不只是生成一个模型,还将生成一个可编辑、可交互、可推演的空间环境。
从这个意义上看,V2Fun 承载着一个「入口」角色:它先让用户生成一个模型,再让模型变成资产,进入图库、格式导出、打印和专业工作流;下一步模型会被绑定骨骼、加入动作、形成动画;再进一步连接到可交互、可推演的 3D 世界。这条路径构成了极顶数创区别于其他玩家的根本差异——它真正想争夺的不是「谁能更快生成一个模型」,而是当 AI 从二维内容生成走向三维世界生成时,谁能成为那个底层入口。
七、鸿蒙押注的真正含义:一张通往空间智能基础设施的入场券
回过头看,鸿蒙为什么押注一家世界模型狂想者,答案就清楚了。表面上看,V2Fun 在 2026 HDC 上的亮相是单一产品的生态首发,实际上是鸿蒙空间智能战略的一次精准落子。鸿蒙给出的四项系统级原生突破,本质是在表达「愿意把 3D 当作一等公民内容对待」——这种表态在操作系统层面非常稀缺。而极顶数创给出的也不只是一个 AI 3D 生成工具,而是一套从几何 Token 化、稀疏 3D 记忆库、隐空间高斯记忆体到动态偏差归档的完整算法体系,以及一支能同时打通算法、图形学、XR、系统、产品的复合团队。
V2Fun 上架、登顶 Top 30、获评当月最佳,这些只是开头。真正的胜负手是:当世界模型从概念走向产业化落地,谁掌握了高精度 3D 资产的生产能力、动态记忆与长程一致性、跨场景的内容流转链路,谁就掌握了空间智能时代的基础设施话语权。在 3D 生成刚跨过「拍照即生成」门槛的当下,极顶数创已经把视野放到全功能世界模型与空间智能基础设施上——这或许正是它被鸿蒙选中的真正原因。