分类:AI动态 标签:人工智能、大模型、计算机视觉、开源项目


十年前,微软亚洲研究院首席研究员童欣站在讲台上,向全行业抛出了一个略显落寞的问题:文字、图片、视频都在互联网时代迎来了大爆发,为什么计算机图形学(Graphics)却好像什么都没发生?当时,由于专业门槛极高、设备昂贵,3D 始终无法真正走进普通人的世界。

十年后的今天,故事迎来了转机。童欣已正式加入由胡渊鸣创立的 AI 3D 独角兽企业 Meshy 担任首席科学家。这位深耕计算机图形学二十五年的学者,终于和行业一起,走到了自己十年前那个问题的下一页。

从「不可能」到「Everyone」:创作门槛的全面瓦解

回看 2016 年的 VR 爆火浪潮,行业空前热闹,但童欣当时的冷思考精准切中了痛点:Everyone(每个人都可以创造内容)与 Everywhere(内容跨越设备与场景传播)并未实现。当时,制作一个简单的 3D 模型需要艺术家学习多年,动捕和扫描设备价格昂贵,普通人根本无法参与。

但在生成式 AI 时代,这一切被彻底改写:

  • 创作入口的改变:用户不再需要学习复杂的专业建模软件,输入一张图片、一张草图,甚至仅仅是一句话,AI 就能在短时间内生成 3D 模型。
  • 效率的质变:Meshy 等平台将生成时间压制在数十秒内,让 3D 创作拥有了类似图片生成的快速反馈循环,使得「反复失败与修改」成为可能。

从静态展示到可用资产:Meshy 的全链路破局

如果生成的结果只能看、不能用,3D 依然无法融入真实生产。Meshy 的核心优势,恰恰在于打通了生成式 AI 与下游专业工作流(Pipeline)的壁垒:

  • 高效拓扑与拆件:传统 AI 生成的模型往往内部结构混乱,难以直接用于游戏或 3D 打印。Meshy 推出的 Smart Topology 与 Auto Split 功能,能够直接生成带原生分件、可直接导向 Blender、Unity、Unreal Engine 的标准资产。
  • 真实场景的验证:从三七互娱等游戏厂商的实际应用来看,Meshy 能够将复杂次世代项目的高模雕刻工作量大幅缩减。目前,Meshy 平台已拥有超过 1200 万注册用户,累计生成超过 1 亿个 3D 模型。

走向 AI for Fun:构建实时交互的开放世界

在解决「AI for 3D」的资产生产效率后,Meshy 正在向更深水区迈进——AI for Fun。

通过最新推出的多模态开放世界实时架构 Mora,Meshy 尝试将代码生成、3D 空间架构与实时视频大模型有机结合。在这个架构中,Coding Agent 负责生成世界规则,3D 模型构建骨架,实时视频模型则负责最终呈现。这种路线避开了纯视频模型在物理规律和空间记忆上的缺陷,成功实现了空间解谜、物理互动及不同视觉风格在毫秒级的实时切换。

总结

从早期的基础研究到如今大模型爆发,计算机图形学正在经历前所未有的重构。童欣选择加入 Meshy,不仅是因为技术成熟度达到了临界点,更是因为千万级用户与真实生产场景产生的数据智能,正在形成一个强劲的正向循环。

当技术门槛被抹平,工具链与下游应用彻底打通,被「Everyone」与「Everywhere」困扰多年的 3D 视觉,终于迎来了属于自己的互联网时刻。