腾讯科技 · SOURCE ARTICLE

GPT-6 Astra宣告了3D模型的末日?我觉得恰好相反

GPT-6 Astra发布至今短短七天,已经掀起了一阵又一阵的海啸;在我的印象中,上次AI界出现如此盛况,还要追溯到2024年GPT-4o的发布。所以,我觉得自己对这个问题还是有发言权的,我的回答很明确:现在不仅不是3D模型的末日,反而是一个充满机遇的新时代的开始!首先我们要搞清一个技术问题:GPT-6 Astra没有原生3D生成能力,至少现在没有;它是一个有能力操作第三方软件完成3D内容创作的多模态大模型。所谓原生3D模型,可以基于用户提供的文本、图片等Prompt,直接生成3D数字资产。

SOURCE ARTICLE · 来源正文

GPT-6 Astra宣告了3D模型的末日?我觉得恰好相反

GPT-6 Astra发布至今短短七天,已经掀起了一阵又一阵的海啸;在我的印象中,上次AI界出现如此盛况,还要追溯到2024年GPT-4o的发布。在Astra发布当天,OpenAI总裁Greg Brokman的介绍语是:”Welcome to the AGI era.” 英伟达的老黄则简洁地表示:”AGI has arrived.” 仅仅几个月前,全球领先AI Lab融资时,还只敢提出“我们的长期愿景是实现AGI”,现在AGI仿佛已经唾手可得,简直是恍若隔世。

Astra究竟有没有实现AGI, 还是得留给学术界下结论。不管怎么说,用户口碑是藏不住的。在我的微信朋友圈,已经有十几位朋友亲身尝试过,并发表了感想。一位朋友表示:“Astra解决了长期困扰我的视频剪辑问题——只花十几分钟时间就可以总结超长视频素材并进行剪辑包装,让我再次感受到了半年前OpenClaw带来的震撼!”还有两位朋友,以前一行代码都没敲过,更没在游戏行业工作过,却都用Astra做出了以自己工作环境为背景的小游戏,并在微信群进行了小范围传播,我还津津有味地玩通关了。

大家讨论最热烈的,还是Astra的3D能力,有的朋友已经用它为自己的新房子做出了精美的3D装修效果图;用Astra做出来的游戏,大多包含3D数字资产(水平往往相当不错)。我的一位创业者朋友有些夸张地表示:“3D体验必将泛化,后Astra时代的互联网世界,将被3D内容淹没!”

恰恰就在Astra发布的前几天,今年9月初,长期在全球第三方评测中排名第一的3D大模型Tripo的开发商——VAST, 完成了由经纬创投领投的总额30亿元的B轮和B+轮融资。最近半年内,VAST的融资总额达到50亿,刷新了全球3D AI领域的纪录。随着Astra的迅速走红,很多人提出了一个疑问:通用大模型的3D能力已经如此强大,今后还需要专业的原生3D模型吗?现在会不会是原生3D模型的“落日余晖时刻”?

放在半年前,我恐怕没有资格回答这么专业的技术问题。不过,最近半年我大部分时间都在忙AI漫剧的策划和制作,对于包括图片、视频和3D在内的多模态模型,有了相当程度的涉猎。前天深夜,我还在跟AI漫剧承制公司的朋友深入讨论“有了Astra还需不需要Tripo”的问题。所以,我觉得自己对这个问题还是有发言权的,我的回答很明确:现在不仅不是3D模型的末日,反而是一个充满机遇的新时代的开始!

首先我们要搞清一个技术问题:GPT-6 Astra没有原生3D生成能力,至少现在没有;它是一个有能力操作第三方软件完成3D内容创作的多模态大模型。所谓原生3D模型,可以基于用户提供的文本、图片等Prompt, 直接生成3D数字资产;Astra则是通过编写代码等方式,操作Blender, CAD等专业图形软件,生成3D数字资产。严格地说,Astra更像一个“3D艺术家”,而不是“3D资产生成器”——这个定义,是Astra自己在对话框里告诉我的。

在Astra生成3D内容的过程中,当然可以包括Tripo这样的原生3D模型,而且经常包括!Astra刚刚发布之后,X (Twitter)上最早火起来的那一批3D视频,其制作过程往往都是:用Tripo生成模型,然后把设置交给Astra负责,然后导入到Blender里用Astra接管后续流程。有人形象地将其形容为:“Tripo建模,Astra上发条。”接下来,如果你要做的是游戏,还可以接入Unity乃至Unreal 3D引擎;要做设计图,则可以接入AutoCAD或者CAXA;要进一步加强3D视频效果,则可以接入After Effects……Astra是一个指挥官,帮助用户最高效地发挥各类专业软件的能力,而不是去替代这些软件。

(Tripo生成的二次元角色,由Astra添加了动态表情,在X获得1300+点赞;这只是众多案例之一)

当然,在上面的工作流当中,你也可以不用任何原生3D模型,直接让Astra操作Blender完成全部流程,对于业余创作或许也够用了。但是重视生成质量的专业人士或发烧友,肯定不会止步于此。尤其是在复杂角色、道具、批量物件和多轮迭代当中,能快速生成高质量3D资产的专业模型,几乎是决定性的、必不可少的!

举一个例子:你想给自家房子的客厅做软装效果图,包括沙发、桌子、椅子等大量家具。Astra通过程序代码控制这些家具的尺寸和框架,Tripo则负责还原特定的细节造型,二者接合才是一个优秀的效果图。我的茶几造型是“戴珍珠耳环的猫咪”,沙发是白色布艺,在沙发和茶几之间还有两个铁艺火烈鸟摆件——如果不使用原生3D模型,这些细节是很难还原的。如果你的需求更加专业,比如要设计一家咖啡馆、餐馆之类的经营场所,或者五星级酒店的大堂,那么原生3D模型扮演的角色还会更重要。

我想起了十多年前,随着智能手机的普及、短视频平台以及手机剪辑工具的崛起,我们进入了一个“视频内容泛化”的时代。人人都会拍视频、剪视频、发布视频,这曾经是难以想象的,现在却已司空见惯。这一幕完全有可能在3D内容领域复刻:再过几年,或许用不了那么久,人人会做3D数字资产也不是什么不可思议的事情。金字塔的基座扩大了,每一层的市场规模都会相应扩大。不管今后大家操作的是Astra还是其他Agent,原生3D模型的地位,绝不会削弱,只会更重要。

不久前发布的Tripo P2.0, 其实已经在为这个“3D体验泛化”的时代做准备了:

  • 秒级生成能力,让Agent可以在“生成-运行-检查-修改”的循环中快速获得3D对象,多轮迭代;
  • 按目标面数范围生成,让Agent可以根据性能预算选择几何复杂度,减少后续工作量;
  • 忠实还原创作意图的能力,提高了Agent连续执行任务的稳定性,减少重复生成和人工修正;
  • 天然语义分析,让3D模型成为可识别和操控的部件,为Agent编写部件级交互创造了条件。

具备以上特性的Tripo P2.0,补上了从“Agent会写代码”到“Agent创作和驱动3D对象”之间的重要环节。而且,早在Astra上线之前,Tripo就完成了全链路开发者技术基建,例如Tripo的Codex插件在9月2日上线,直接承接了Codex内部的流量——自从Astra上线以来,Tripo的API调用量其实是快速增长的!在此之前,在DeepSeek, GPT-4o等大模型的3D工作流当中,Tripo就发挥着举足轻重的作用;现在,在GPT-6 Astra的时代,它的地位更加稳固了。

我们不妨分析地更细致一些。在3D生成领域,由通用大模型主导的““生成-运行-检查-修改”循环能否成立,很大程度上取决于两个技术特征:能否做到秒级生成,成本是否可控。没有前者,就无法实现快速多轮迭代;没有后者,这种迭代的成本将膨胀到用户无法承担。3D模型可以用更少的尝试、更低的成本,完成反复出现的构造和修改,这就是无论哪家的Agent都要反复选择专业3D模型承担生成任务的核心原因!Astra推进的项目越复杂,3D模型的能力就越是清晰地显现出来。在复杂角色+有机资产场景当中,Tripo目前是Astra工作流当中的高频选择,这一点毫不令人奇怪

我还想从一个创作者的角度,谈一谈“3D体验泛化”之后的需求端变化。Agent+3D模型可以在游戏行业、设计领域的数字资产生成当中发挥重大作用,这一点大部分人都赞成。我已经看到了业余爱好者用Astra + Tripo + Godot三位一体手搓的“三国志”风格战略游戏,颇具可玩性,把专业游戏开发的门槛降低到了前所未有的水平。我想增加一个“暴论”:在长期,或许3D state(三维状态)+生成画面的结合,才是AI视频的正确打开方式,至少是正确打开方式之一。

图片 (Astra + Tripo + Godot制作的游戏《山河志》,颇有光荣《三国志》的神韵)

大约一年前,我初次跟一家互联网大厂的朋友,一边喝着咖啡一边讨论:“何时才能出现AI原生的影视工业级作品?”当时我的观点是,今后还是要依靠3D模型,把场景美术搭建好、把角色模型做好,让主要角色在场景里面“走戏”,就像真人影视剧拍摄中导演指挥演员和剧组一样。由于技术条件限制,这一幕实现可能还要很久,当时我还是十分保守的。

万万没想到,Seedance 2.0、可灵3.0等模型的推出,大幅提升了原生视频模型的上限,使得AI影视的时代提前到来了。然而,当前主流视频模型的生成方式都是“抽卡”——无论你的Prompt多么详细,乃至加入手绘原画,生成结果仍然是不确定的,要通过多次试错接近自己想要的结果。这种建立在抽卡基础上的创作模式,与传统的影视创作模式大相径庭。在AI短剧大行其道的今天,传统影视剧的AI改造尚未取得突破性成果,不是影视行业不想拥抱AI,很大程度上是创作方法的区别导致的。

其实,画面由谁生成可以放在一条轴上:一端是完整3D场景决定画面,一端是视频模型根据少量输入自由补全;中间的方法,可以按对象、区域和动作,决定哪些内容必须遵守3D,哪些允许模型发挥。而且结构化3D资产与状态维护,是纯抽卡式生成给不了的。在这种3D state+生成画面的结合模式中,导演可以精细地操控角色和环境,完整地、不打折扣地实现自己想要的结果。对于精品化的中长剧和大电影来说,这简直是雪中送炭,实用价值怎么估计都不过分!

此时此刻,Astra + Tripo + Blender, 已经具备了从剧本到3D视频的能力雏形。照这个势头发展下去, “用AI复刻传统影视创作模式”的愿景,或许再过几年乃至几个季度就能实现了。当然,现有的视频模型有其独特的优势,未来不是谁替代谁的关系,应该是齐头并进的关系。在短剧、漫剧等互联网信息流内容当中,完全基于Prompt的AI原生视频可能会在很长一段时间里占据主流;而在大银幕上,以及精品化的网生内容当中,3D模型的意义会率先体现出来。

总而言之,Agent + 3D模型的市场空间,可能比任何人想象的还大。一切才刚刚开始,让我们深呼吸,等待更多的奇迹到来吧。