最近两天,相信大家都被GPT-6Astra的各种逆天玩法刷屏了——一句话完成3D建模、从零制作完整游戏、几千个零件的东西说拆就拆,甚至还能拿来控制机器人……总之,强得没边。网友们有句话说得很夸张:只要你学得慢,你就可以不用学。但是GPT-6Astra确实给人一种感觉,它一出来,原来困扰很多领域的复杂性突然就有解决的苗头了。
这种趋势不容小觑,但模型现阶段的能力也不宜过度夸大。在这篇文章中,我们就来盘点一下GPT-6Astra的各种逆天玩法,及其当前的局限。
3D建模这件事,
突然开始变简单了?
这两天Astra最密集刷屏的能力,大概就是3D。
有人拿它来直接生成3D的火车:
两列火车都是Astra用TypeScript和Three.js代码,在浏览器运行时直接生成出来的。车身尺寸、轮廓、各种几何结构来自代码里的尺寸参数、profile和geometryfunction;车轮运动是代码,整辆火车炸开、零件散开再重新组装的动画也全是代码。
而且,这些模型做出来之后还能按部件拆开。一台相机可以被拆成122个组件组、1877个独立建模部件。整个任务大概跑了3个小时,作者表示之前根本没意识到Three.js(一个用于在浏览器中创建和展示3D图形的JavaScript库)还能这么玩。
相机能拆,特斯拉也能拆。有人将其拆成了334个建模部件,而且这334个零件的名称、编号和基础结构是有官方依据的,不是AI凭空捏造的。当然,它仅仅是一个非常粗略的框架级拆解,远远达不到3D拆解所需的精细度。
有意思的是,这个作者拆完特斯拉不过瘾,还建了个网站来「拆人(男性)」:全身的2234个建模部件可以逐一查看,而且可以映射到源文件。
看到这些案例,有人高呼「3D建模的学生天塌了」。
但也有人说,AI现在直出的结果还不能商用。
而且,稳定性也是一大问题,它终究还是需要人来修bug的。
这些Demo的意义,并不只是证明Astra会建模。更重要的是,它展示了一种新的交互方式:人不再需要学习复杂的3D软件,而是直接描述想要的世界,让AI负责把想法翻译成空间结构。
过去,3D建模是进入数字世界的门槛;未来,它可能变成AI理解和生成现实世界的一种基础能力。当然,距离真正工业级应用还有距离,但这条路正在变得越来越清晰。
软件不用学了?
Astra自己进去点
在OpenAI的官方定位里,computeruse、browseruse都是GPT-6Astra的王牌能力。在一个Canva绘画案例中,我们看到了这方面的真实体现。
在这个案例中,网友让Astra在Canva里把他画出来(根据参考照片复刻肖像)。画图过程中,Astra能够直接操控浏览器中的Canva界面:选择工具、精确点击/拖动、逐层绘制(从背景到身体、手臂,再到脸部细节),最终完成一张高度相似的像素风格半写实肖像。
这里面还涉及长时间多步骤操作(作者反馈约1小时)、工具切换(Chrome中途出问题后切换到computeruse模式),以及极高的界面理解与精细控制精度。
隔壁fable5.1也拿到了相同的提示,但结果让网友略显失望:
做这个实验的还不止他一个人。另一个网友也拿同一张照片让两个AI画,结果也差不多:Astra更写实,Fable5.1更洒脱……
视频链接:https://mp.weixin.qq.com/s/6tOR2GptUa97ffW-jWJF2Q
不过,有网友指出,这些东西的最终视觉效果不是重点,重要的是有Astra加持的Agent已经能够自己操作Blender、虚幻引擎、浏览器,把prompt直接变成工程文件。
这几天刷屏的「Astra使用Blender重建旧金山艺术宫」「张老蒸汽火车图纸,变成Blender里的3295个可编辑对象」「600个AstraAgent住进同一个Unreal世界」都是这一方向的典型案例。
视频链接:https://mp.weixin.qq.com/s/6tOR2GptUa97ffW-jWJF2Q
另一个比较有意思的案例是「弹钢琴」。OpenAI员工VictorE.Nunez让Astra找一个在线钢琴,用ComputerUse弹《RiverFlowsinYou》。在执行过程中,Astra自己搜索并打开了一个在线虚拟钢琴网站,然后用ComputerUse直接操控电脑界面:鼠标点击当作「右手」,点击钢琴键。键盘控制当作「左手+快速段落」。两者同时进行,精确控制节奏、音符时值,完整演奏了《RiverFlowsinYou》这首曲子。
视频链接:https://mp.weixin.qq.com/s/6tOR2GptUa97ffW-jWJF2Q
更有意思的是,Astra自己录了屏幕,并剪辑了这个演示视频。整个过程是端到端的:从理解任务→找网站→加载乐器→实时演奏,无需人工干预中间步骤。
这些案例表明,GPT-6Astra在agenticcomputeruse上达到了新的高度,速度、精度、多工具并行和实时反馈能力都达到了相当高的水平。
或许,以后人们可以不执着于想怎么把某个专业软件的能力重新做成AI功能,直接把软件交给AI用就行了。能够操作任何为人类设计的软件,大大扩展了AI的应用场景。
屏幕之外,
Astra开始控制机器人了
前面的Demo再离谱,本质上还都发生在电脑里。
网友JayChooi做的测试就不太一样了:他们真的把Astra接到了机械臂上。
其中一个任务,是让机械臂把积木放进碗里。GPT-6Astra做了20次,成功率达到95%;对照的Fable5.1是40%。同时,其输出token数仅为后者的约16%,成本仅为后者的约43%。
更关键的是,这里没有针对这个任务给Astra做示范或者微调。JayChooi后来专门补充,这是一个zero-shot测试。模型负责给出机械臂末端执行器的位置和姿态,再通过自动逆运动学求解器转换成机械臂动作。
随着大模型token输出速度的加快,JayChooi乐观预计,LLM最早今年年底就能实时控制机械臂,最迟在2029年。
英伟达前研究科学家YuXiang则进一步指出,机器人学的下一个前沿可能是如何真正利用先进的AI模型来进行操控。仅仅将它们用作调用感知和规划模块的Agent是不够的。我们需要新的方法来将这些模型与物理世界连接起来。
这样的结果也让人好奇,OpenAI到底在后训练里加了什么,才让模型这么全能?还是说预训练有所突破?
还学吗?
看了这些,有人感叹,AI已经不满足于生成一张图,而是开始试着「重构世界」了。
一个问题自然浮出水面:当AI能建模、能写代码、能操作软件,甚至开始碰物理世界,我们今天苦学的这些技能,到底还有多少会以现在的形态存在?
这个问题现在当然没有答案。Astra还有大量不稳定、粗糙甚至根本不能用的地方,但这两天真正让人不安又兴奋的,可能也正是这一点:很多过去默认必须由人掌握的复杂操作,第一次出现了被整体打包给AI的可能。
至于「以后还要不要学」,答案肯定是还得学。只是我们可能得重新想想,到底什么才值得学。

相关文章

头条焦点
精彩导读
关注我们
【查看完整讨论话题】 | 【用户登录】 | 【用户注册】