人工智能

GPT-6 Astra还没正式开放 大家怎么把庆功宴都办完了

字号+作者:差评 来源:差评 2026-09-05 14:33 评论(创建话题) 收藏成功收藏本文

GPT-6还没正式开放,怎么全网已经替它把庆功宴都办完了?这场面虽然有点夸张,但这香槟可能还真开对了。4号凌晨,在经历了服务器爆炸,熬夜等待三小时之后,OpenAI'...

GPT-6还没正式开放,怎么全网已经替它把庆功宴都办完了?这场面虽然有点夸张,但这香槟可能还真开对了。4号凌晨,在经历了服务器爆炸,熬夜等待三小时之后,OpenAI终于发布了被他们寄予厚望的最新模型:GPT-6Astra。DYf品论天涯网

DYf品论天涯网

副总裁Greg更是直接大胆放话,宣称欢迎进入AGI时代。DYf品论天涯网


DYf品论天涯网

但大伙们敢提前开香槟,押的其实不是模型的跑分,大家押的是一个已经被市场验证过的方向:Work。DYf品论天涯网

过去一年,CodingAgent已经证明,只要AI真能交付结果,用户就愿意高频使用,企业也愿意真金白银地付钱。现在,OpenAI要把这套已经跑通的模式,从代码编辑器复制到整台电脑。DYf品论天涯网

在过去几个月里,OpenAI买了上万台Mac来收集的数据,算是终于有了成果。DYf品论天涯网


DYf品论天涯网

GPT-6,它很可能是目前,最会用电脑干活的模型。DYf品论天涯网

它既能直接用你电脑上的浏览器来填表格。DYf品论天涯网


DYf品论天涯网

也可以直接使用Blender、Unity、KiCad这些专业软件来干活,直接建模,生成游戏,画电路板。DYf品论天涯网


DYf品论天涯网

如果说曾经的Claude3.7开启了全面AIcoding的时代的话,那么现在的Astra很可能会开启一个全面的AI打工浪潮。DYf品论天涯网

很多软件不能适应AI,没关系,现在,AI可以直接回过头来适应这些软件。DYf品论天涯网

像找漏洞Bug,科研这方面的题目也难不倒Astra。DYf品论天涯网


DYf品论天涯网

也可以直接在Mac上生成一个可以交互的3Dipod。DYf品论天涯网


DYf品论天涯网

除此之外我们还发现,传统的模型测评方式,可能已经没有办法试出Astra的深浅了。DYf品论天涯网

虽然咱们还没办法正式用上Astra,但是光看官方放出来的跑分就会发现,很多项目测出来的结果,其实有点自己在打架了。DYf品论天涯网

在有些榜单上,Astra看起来是平平无奇。DYf品论天涯网

就比如测试模型综合能力的AA,给Astra的分数是61分,不但比Fable低,就连小扎的Muse都比不上。DYf品论天涯网


DYf品论天涯网

而在某些榜单上,Astra的表现则是和开了一样没区别。DYf品论天涯网

今年3月,前Google研究员弗朗索瓦·肖莱发布了一个全新的模型测试集——ARC-AGI-3。DYf品论天涯网


DYf品论天涯网

和过去传统的问答式的测试不一样,ARC-AGI-3主要测试的,是模型自主理解问题,自主交互,自主学习的能力。DYf品论天涯网

说人话就是测模型玩游戏的能力,他们设计了一大堆的小游戏,有的让你推箱子。DYf品论天涯网


DYf品论天涯网

有的让你移动准星。。DYf品论天涯网


DYf品论天涯网

这些游戏怎么玩,全靠你自己摸索。DYf品论天涯网

在这种地狱级交互测试里,即使是史上最强的Fable5也得甘拜下风,只能拿到30%的分。DYf品论天涯网

但到了当代最强的Astra这就不一样了,它直接把这个测试集给打穿了,直接干到了和人类同级的99.9%DYf品论天涯网


DYf品论天涯网

也就是说,不管分数到底是高还是低,我们现在测评模型的方式,或许已经没有办法准确的评价Astra了。DYf品论天涯网

实际上,就连OpenAI自己,都不敢说能完全了解Astra。DYf品论天涯网

这次新模型的一个很大变化就是,它越来越不需要把思考过程写给我们看了。DYf品论天涯网

英国AI安全研究做了个测试,不让Astra输出思维链,让它凭直觉直接来做题,DYf品论天涯网

结果发现在这种条件下,5.6Sol只能稳定处理相当于人类几分钟解题量的问题,而Astra已经把这个尺度推到了约半小时。DYf品论天涯网

同时,Astra更擅长控制自己写出来的思维链,思考的时候会装糖藏一手,有些不好的信息,甚至直接就不往思维链里写了,而是直接在潜空间里完成思考。DYf品论天涯网


DYf品论天涯网

这也意味着过去我们监控模型思考,保证模型安全的手段,变的不再那么有效了。DYf品论天涯网

当然,OpenAI也马上表示说现在的Astra还是很安全的,他们测试下来感觉没啥问题。DYf品论天涯网


DYf品论天涯网

他们也在内部做了一个测试,他们故意给模型一个很难完成的攻击任务,旁边再放一个更容易下手、但没有授权攻击的目标。DYf品论天涯网

结果发现过去的5.6Sol有48%的情况下会为了完成任务而偷偷越界,而Astra越界概率则是0%。DYf品论天涯网


DYf品论天涯网

看起来是一等一的听话了。DYf品论天涯网

只不过这个“听话”,让人看着则是更担心了。DYf品论天涯网

毕竟上个月,他们内部的模型可是实打实越狱出来,爆锤了隔壁HuggingFace的服务器的,现在出来说模型安全,多少有些亡羊补牢的味道。DYf品论天涯网


DYf品论天涯网

最后,所以GPT-6Astra到底算不算AGI呢?DYf品论天涯网

说实话,现在讨论这个问题,意义已经越来越小了,AGI都快成AI公司时尚单品了。DYf品论天涯网

会做题,是AGI;会写代码,是AGI;现在会点鼠标,也能再宣布一次AGI。嘴上喊的是虚的,正在能做到的,才是实打实的。DYf品论天涯网

毕竟,真正的AGI到来的时候,是不用AI公司们的营销和新闻稿的,估计大伙们自己,就能真真切切感受到。DYf品论天涯网

本网除标明“PLTYW原创”的文章外,其它文章均为转载或者爬虫(PBot)抓取; 本文只代表作者个人观点,不代表本站观点,仅供大家学习参考。本网站属非谋利性质,旨在传播马克思主义和共产主义历史文献和参考资料。凡刊登的著作文献侵犯了作者、译者或版权持有人权益的,可来信联系本站删除。 本站邮箱[email protected]