GPT-6还没正式开放,怎么全网已经替它把庆功宴都办完了?这场面虽然有点夸张,但这香槟可能还真开对了。4号凌晨,在经历了服务器爆炸,熬夜等待三小时之后,OpenAI终于发布了被他们寄予厚望的最新模型:GPT-6Astra。
副总裁Greg更是直接大胆放话,宣称欢迎进入AGI时代。
但大伙们敢提前开香槟,押的其实不是模型的跑分,大家押的是一个已经被市场验证过的方向:Work。
过去一年,CodingAgent已经证明,只要AI真能交付结果,用户就愿意高频使用,企业也愿意真金白银地付钱。现在,OpenAI要把这套已经跑通的模式,从代码编辑器复制到整台电脑。
在过去几个月里,OpenAI买了上万台Mac来收集的数据,算是终于有了成果。
GPT-6,它很可能是目前,最会用电脑干活的模型。
它既能直接用你电脑上的浏览器来填表格。
也可以直接使用Blender、Unity、KiCad这些专业软件来干活,直接建模,生成游戏,画电路板。
如果说曾经的Claude3.7开启了全面AIcoding的时代的话,那么现在的Astra很可能会开启一个全面的AI打工浪潮。
很多软件不能适应AI,没关系,现在,AI可以直接回过头来适应这些软件。
像找漏洞Bug,科研这方面的题目也难不倒Astra。
也可以直接在Mac上生成一个可以交互的3Dipod。
除此之外我们还发现,传统的模型测评方式,可能已经没有办法试出Astra的深浅了。
虽然咱们还没办法正式用上Astra,但是光看官方放出来的跑分就会发现,很多项目测出来的结果,其实有点自己在打架了。
在有些榜单上,Astra看起来是平平无奇。
就比如测试模型综合能力的AA,给Astra的分数是61分,不但比Fable低,就连小扎的Muse都比不上。
而在某些榜单上,Astra的表现则是和开了一样没区别。
今年3月,前Google研究员弗朗索瓦·肖莱发布了一个全新的模型测试集——ARC-AGI-3。
和过去传统的问答式的测试不一样,ARC-AGI-3主要测试的,是模型自主理解问题,自主交互,自主学习的能力。
说人话就是测模型玩游戏的能力,他们设计了一大堆的小游戏,有的让你推箱子。
有的让你移动准星。。
这些游戏怎么玩,全靠你自己摸索。
在这种地狱级交互测试里,即使是史上最强的Fable5也得甘拜下风,只能拿到30%的分。
但到了当代最强的Astra这就不一样了,它直接把这个测试集给打穿了,直接干到了和人类同级的99.9%
也就是说,不管分数到底是高还是低,我们现在测评模型的方式,或许已经没有办法准确的评价Astra了。
实际上,就连OpenAI自己,都不敢说能完全了解Astra。
这次新模型的一个很大变化就是,它越来越不需要把思考过程写给我们看了。
英国AI安全研究做了个测试,不让Astra输出思维链,让它凭直觉直接来做题,
结果发现在这种条件下,5.6Sol只能稳定处理相当于人类几分钟解题量的问题,而Astra已经把这个尺度推到了约半小时。
同时,Astra更擅长控制自己写出来的思维链,思考的时候会装糖藏一手,有些不好的信息,甚至直接就不往思维链里写了,而是直接在潜空间里完成思考。
这也意味着过去我们监控模型思考,保证模型安全的手段,变的不再那么有效了。
当然,OpenAI也马上表示说现在的Astra还是很安全的,他们测试下来感觉没啥问题。
他们也在内部做了一个测试,他们故意给模型一个很难完成的攻击任务,旁边再放一个更容易下手、但没有授权攻击的目标。
结果发现过去的5.6Sol有48%的情况下会为了完成任务而偷偷越界,而Astra越界概率则是0%。
看起来是一等一的听话了。
只不过这个“听话”,让人看着则是更担心了。
毕竟上个月,他们内部的模型可是实打实越狱出来,爆锤了隔壁HuggingFace的服务器的,现在出来说模型安全,多少有些亡羊补牢的味道。
最后,所以GPT-6Astra到底算不算AGI呢?
说实话,现在讨论这个问题,意义已经越来越小了,AGI都快成AI公司时尚单品了。
会做题,是AGI;会写代码,是AGI;现在会点鼠标,也能再宣布一次AGI。嘴上喊的是虚的,正在能做到的,才是实打实的。
毕竟,真正的AGI到来的时候,是不用AI公司们的营销和新闻稿的,估计大伙们自己,就能真真切切感受到。

相关文章

头条焦点
精彩导读
关注我们
【查看完整讨论话题】 | 【用户登录】 | 【用户注册】