人工智能

DeepSeek的这次小更新 原来藏着两个大招

字号+作者:差评 来源:差评 2026-08-04 09:01 评论(创建话题) 收藏成功收藏本文

谁也没想到,DeepSeek这次又给大家憋了个大的,卡着7月的尾巴,发布了DeepSeekV4Flash的正式版。说实话,一开始,世超对这次更新其实是没有太在意的……毕竟只是'...

谁也没想到,DeepSeek这次又给大家憋了个大的,卡着7月的尾巴,发布了DeepSeekV4Flash的正式版。说实话,一开始,世超对这次更新其实是没有太在意的……毕竟只是一个顶着Flash名头的模型更新,主力军Pro系列更是动都没动。上一次只更新Flash,不更新Pro模型的大模型厂商还是Google,现在已经成了大家的玩梗对象。4re品论天涯网


4re品论天涯网

这你一个Flash模型再更新,能力总不能超过Pro吧……4re品论天涯网


4re品论天涯网

??4re品论天涯网


4re品论天涯网

不是哥们,你这Flash模型怎么比Pro模型的跑分都强了???4re品论天涯网

这还是Flash吗?4re品论天涯网

不对DeepSeek,大模型不是这样玩的,你应该先发一个Flash模型,然后说自己只是速度快一些罢了,你怎么直接让Flash模型追上了自家的Pro模型,然后价格还只卖2块钱/百万token,而且时不时还能有个打一折的缓存命中优惠,我周末用了1个亿token才花掉了5块钱。4re品论天涯网


4re品论天涯网

世超根据这次V4Flash亮出来的跑分整理了一下,可以发现这次Flash模型的能力极其夸张。4re品论天涯网


4re品论天涯网

超过了自己的大哥Pro不说,虽然比不上ClaudeOpus5、GPT-5.6Sol、还有KimiK3、这些顶级模型。4re品论天涯网

但是,正式版的V4Flash,基本上也就不如这几家了。4re品论天涯网

有网友把各家大模型的能力和价格,收集到一起做了个表整理了出来:4re品论天涯网


4re品论天涯网

每个大模型在表上都是一个点,点的位置越靠左边,说明模型越便宜,点的位置越靠上面,说明模型的性能越好。4re品论天涯网

这样一看就会很直观的发现,市面上绝大多数模型,都处在一个很尴尬的位置。4re品论天涯网

性能没DeepSeek好就算了,价格还比DeepSeek要贵。4re品论天涯网

而那些性能比DeepSeek要强的模型,处境其实也没好到哪去。4re品论天涯网

因为它们的价格实在是太贵了。4re品论天涯网

差友们可能没注意到,上面这张图的横轴,它不是一个线性坐标轴,而是个对数轴。4re品论天涯网

但咱给模型花钱的时候可不是这么算的。4re品论天涯网

于是世超稍微动用了一下很久没有用过的PS手段,把这张图给拉成了线性坐标轴来看看,发现它的真实比例,其实是这样的……4re品论天涯网


4re品论天涯网

也就是说,论性能的话,ClaudeFable5,GPT-5.6Sol这些模型比起V4Flash来说,可能有个这么两成的提升。4re品论天涯网

但是这些模型的价格,可能也要比V4Flash多了两0。4re品论天涯网


4re品论天涯网

夸张一些的话,可以说DeepSeek又一次重新定义了模型的斩杀线。4re品论天涯网


4re品论天涯网

所以,这次DeepSeek是怎么做到的?明明模型的架构,参数都没啥变化,为什么一个模型的能力会突然有如此巨大的变化?4re品论天涯网

世超也是往回翻了翻DeepSeek的论文和公开资料,找到了两个概率最大的方向。4re品论天涯网

首先最重要的一个点就是后训练。4re品论天涯网

这也是官方承认的,预览版和正式版差距最大的地方了。4re品论天涯网


4re品论天涯网

这里给对大模型不太了解的差友科普一下,一般来说,我们会把大模型的训练给分成两个阶段。4re品论天涯网

第一个阶段叫预训练。4re品论天涯网

在这块,我们需要给模型塞进去海量文本、代码和其他数据,以此来让它学会回答问题的基本能力。4re品论天涯网

整个过程有点像在培养一个高中生,不管是语数外,还是物化生,政史地,还是音乐美术体育计算机,各种领域的知识都要拿点过来给他,通过这种方式来提高模型的基础能力。4re品论天涯网

而第二个阶段后训练,则是锻炼的真正干活解题的能力。4re品论天涯网

这块做的活主要是刷题,让模型通过反反复复地刷题,来提高模型的应试教育能力,让它来学会怎么解决问题。4re品论天涯网

研究人员会通过监督微调、强化学习和大量任务数据,让模型学会理解指令、拆解问题、使用工具,以及按照人类偏好的方式给出答案。4re品论天涯网

同样预训练出来的一个模型,在经过了不同的后训练刷题练习之后,是很容易刷出完全不同的表现的。4re品论天涯网

之前DeepSeekR1的论文里就讲过,他们把V3拿过来做了GRPO(群组相对策略优化)强化学习之后,模型的数学能力就得到了巨大的提升,在AIME2024测试集上的正确率直接从开始的15.6%给飙升到了71%。4re品论天涯网

OpenAI当年的InstructGPT也一样。4re品论天涯网

经过监督微调和RLHF之后,一个只有13亿参数的模型,在真人盲评里,甚至能打赢参数量大了100多倍的GPT-3。4re品论天涯网


4re品论天涯网

如果说预训练决定了模型的大脑里有没有相关的知识的话,那么后训练就是决定模型有没有掌握把这些知识给拿出来的能力。4re品论天涯网

当然,光靠后训练,或许还不能完全解释这次V4Flash的夸张成绩。4re品论天涯网

仔细看DeepSeek的发布说明,大家还能发现一件事:4re品论天涯网

那就是这次公开的部分跑分,DeepSeek并不是让模型直接裸跑得出来的。4re品论天涯网

而是用上了一个叫做DeepSeekHarness的未发布工具。4re品论天涯网


4re品论天涯网

Harness这个词大家这半年来应该也听过不少,现在热的红火的ClaudeCode,Codex,OpenClaw其实都可以算是Harness,或者说是Agent工具的一种。4re品论天涯网

就连现在大伙经常刷到的Workbuddy,Qoder,Trae也都能算是。4re品论天涯网

而现在,DeepSeek要推出自己的Agent工具卷进来了。4re品论天涯网


4re品论天涯网

这件事,可能比单独更新一个模型还要关键得多。4re品论天涯网

因为在现在这个Agent时代,一个模型最后能干出什么成绩,已经不只取决于模型本身有多聪明,还取决于外面给它套了一套什么样的工具。4re品论天涯网

一个裸模型就像一个坐在考场里的学生,遇到复杂的问题就只能靠自己的脑子硬算。4re品论天涯网

但Agent会给模型安上搜索引擎,能给它配上代码的运行环境,还会帮它管理好项目的上下文,检查项目的运行结果,甚至跑错了还能直接重来一次。4re品论天涯网

通过这些外置工具给模型上Buff,AI实际做事的能力可以得到极大的增强。4re品论天涯网

今年年初的时候,多伦多大学的团队做了一个研究,他们把同一个大模型,放到不同的Agent工具里面来做测试。4re品论天涯网

结果发现同一个模型,在不同的工具里表现的完全不同,完成问题的概率最高能差个好几倍。4re品论天涯网


4re品论天涯网

前不久有人说过,现在AI的发展,就像一级一级向上爬的阶梯。4re品论天涯网

去年的阶梯是思维链,通过思维链的方式,我们可以让模型学会自己思考,来让AI能做到更多的事情。4re品论天涯网

而今年,AI发展最重要的阶梯就是Agent。4re品论天涯网

现在,DeepSeek也交出了自己对Agent的答案。4re品论天涯网

通过高质量的后训练和Agent工具,把原本负责轻量应用的Flash,给直接拉到了全球旗舰模型的身后。4re品论天涯网

说实话,世超看到这个超级强化后的SuperProMax版本的Flash模型,已经开始期待起来了。4re品论天涯网


4re品论天涯网

既然一个用来打下沉市场的小弟,都能靠着出神入化的后训练和DeepSeekHarness工具,跟GPT-5.6Sol、ClaudeFable5这些身娇肉贵的“太上皇”们掰掰手腕……4re品论天涯网

那要是等DeepSeek把这套版本答案,给套在更强的V4Pro上呢?4re品论天涯网

本网除标明“PLTYW原创”的文章外,其它文章均为转载或者爬虫(PBot)抓取; 本文只代表作者个人观点,不代表本站观点,仅供大家学习参考。本网站属非谋利性质,旨在传播马克思主义和共产主义历史文献和参考资料。凡刊登的著作文献侵犯了作者、译者或版权持有人权益的,可来信联系本站删除。 本站邮箱[email protected]