人工智能

DeepSeek V4-Flash正式版实测Agent能力直追顶级模型

字号+作者:每日经济新闻 来源:每日经济新闻 2026-08-02 07:54 评论(创建话题) 收藏成功收藏本文

7月31日,DeepSeek官宣DeepSeek-V4-Flash正式版API(接口)开启公测。DeepSeek表示,DeepSeek-V4-Flash正式版大幅升级其代理能力,正式版的基准测试得分已远超V4'...

7月31日,DeepSeek官宣DeepSeek-V4-Flash正式版API(接口)开启公测。DeepSeek表示,DeepSeek-V4-Flash正式版大幅升级其代理能力,正式版的基准测试得分已远超V4-pro预览版。3j8品论天涯网

基准测试数据显示,在Agent智能体终极测试中,V4-Flash正式版的得分为25.2分,接近Opus-4.825.7分的得分,远高于V4-pro预览版15.8的得分。3j8品论天涯网


3j8品论天涯网

消息一出,吸引了全球AI开发者的关注,V4-Flash正式版的价格、公测体验、Agent(智能体)能力成为不少科技爱好者的关注点。3j8品论天涯网

过去一年,DeepSeek凭借极低的API价格和优秀的模型能力,在全球开发者市场迅速建立影响力。DeepSeekV4-Flash正式版在大模型市场,对AI开发者而言,是否仍有吸引力?3j8品论天涯网

实测:Agent能力不错交付结果达到可用水平3j8品论天涯网

在关注到DeepSeek-V4-Flash正式版API开启公测后,AI深度开发者张泽第一时间接入了V4-Flash正式版API,在此之前,他深度使用codex和hermes等国内外各类AI产品。3j8品论天涯网

V4-Flash正式版上线之后,张泽将其接入Hermes使用。“最直观的感受就是任务处理速度很快,在给到相同任务和提示词的情况下,V4-Flash正式版+Hermes大概用了40秒完成,而GPT-5.6Sol+Codex用了1分47秒。当然也要承认Codex的输出内容质量确实更高一些,不过V4-Flash正式版的交付也达到了可用水平,在及格线之上。”3j8品论天涯网

8月1日,AI开发者孙涛也向《每日经济新闻》记者反馈其体验后的感受,“在国内模型里,它比GLM5.2会好一些,但是比GPT5.6其实还差一些”。3j8品论天涯网

对于V4-Flash正式版的Agent能力提升,孙涛反馈“现在主力用的工具一个是Codex,一个是PiAgent。我把DeepSeekV4-Flash接入PiAgent,目前的使用体验挺好的,V4-Flash不像GPT那样是多模态,所以它的主要用途可能是在偏推理、代码和长文档这一块。”3j8品论天涯网

而在Agent能力体验上,张泽认为,V4-Flash正式版在接入Hermes的实际使用中选择和调用skill的准确度总体上还不错,可以根据工具返回结果调整后续步骤,从实际体验来说,这套组合已经能够比较顺畅满足个人需求。3j8品论天涯网

51万Tokens消耗0.53元V4-Flash正式版性价比很高3j8品论天涯网

不过对AI开发者以及个人爱好者而言,价格依然是他们的敏感区间。3j8品论天涯网

6月29日,每经记者收到DeepSeek在今年6月底发给API用户的邮件,DeepSeek在邮件中提到了V4正式版在功能和性能上会有更多优化和提升,更重要的是,API定价策略首次引入了峰谷定价机制。3j8品论天涯网

根据最新的定价机制,DeepSeek-V4-Pro的价格相较于4月份的预览版出现大幅下降。其中百万tokens输入(缓存命中)的价格下降幅度最为明显,从4月份的1元,下降为正式版平时价格0.025元,高峰时段0.05元。3j8品论天涯网


3j8品论天涯网

图片来源:每经记者整理3j8品论天涯网

整体来看,对于API用户而言,DeepSeek-V4正式版发布,token(词元)成本有了大幅降低。但对DeepSeek而言,这次的定价调整,也存在不降反升的情况。3j8品论天涯网

譬如DeepSeek-V4-Flash正式版,百万tokens输入(缓存未命中)和百万tokens输出在高峰时段的成本反而比4月的预览版定价翻倍,分别是2元和4元。3j8品论天涯网

根据最新披露的百万tokens价格来看,DeepSeek的价格体系和此前邮件透露的保持一致。不过目前峰谷定价机制具体的执行时间,还未正式通知。3j8品论天涯网

那么,对比国外大模型,V4-Flash正式版在成本上有多大的优势?3j8品论天涯网

张泽给了每经记者一组非常直观且鲜明的对比。3j8品论天涯网

按照当下的官方API定价,GPT-5.6Sol每百万tokens输入、缓存输入和输出价格分别是5美元、0.5美元和30美元;而V4-Flash正式版分别是1元、0.02元和2元人民币,成本差距差不多在数十倍到上百倍。“在我平时只是利用AI搜集汇总信息、总结一些文件和简单编程的情况下,V4-Flash正式版非常香,性价比很高,从账单上看,V4-Flash正式版接入Hermes执行了一次本地文件阅读和全网的信息检索汇总任务用量大概是51万tokens,消耗0.53元。”3j8品论天涯网


3j8品论天涯网

DeepSeekHarness即将公布3j8品论天涯网

过去一年,DeepSeek凭借极低的API价格和优秀的模型能力,在全球开发者市场迅速建立影响力。越来越多企业开始接入DeepSeekAPI,大量海外开发者迁移至其平台,其调用量快速增长。3j8品论天涯网

7月28日,OpenRouter最新数据显示,中国AI大模型周调用量领跑全球。依次为小米MiMo-V2.5、DeepSeekV4-Flash、腾讯HY3、智谱GLM-5.2以及DeepSeekV4Pro。DeepSeek的2个模型都挤进了前五名的席位。3j8品论天涯网

OpenRouter官方此前披露,中国模型全球市场份额于6月初整体超越美国模型。截至7月26日的近28天统计数据显示,中国模型所占份额约为63.5%,美国模型份额为35.5%,双方差距进一步拉大。3j8品论天涯网

而当AI的趋势向Agent转向时,Harness的重要性日益提升。Harness是包裹在AI模型外的一整套工作条件,负责给模型准备上下文、工具、任务状态、反馈和边界,简单说就是让AI智能体从”能聊天"变成"能干活"的基础设施。3j8品论天涯网

DeepSeek在上半年加大Harness布局。在此前释放的招聘信息中,多次提到了Harness领域的人才招聘。6月21日,崔添翼在社交媒体发文表示,作为新成立的部门,DeepSeekHarness组的目标远大、工作繁重,仍然非常缺人。3j8品论天涯网

时隔一个月后,DeepSeek-V4-Flash首次披露了DeepSeekHarness的新进展:DeepSeekHarness即将公布。3j8品论天涯网

中信证券认为,Harness核心价值:一是解决长程任务痛点,将模型能力转化为稳定、低成本的端到端交付;二是连接模型与泛办公场景,拓展万亿市场并沉淀稀缺数据反哺迭代。AI竞争正由模型转向任务交付,成熟Harness厂商将占先机。3j8品论天涯网

本网除标明“PLTYW原创”的文章外,其它文章均为转载或者爬虫(PBot)抓取; 本文只代表作者个人观点,不代表本站观点,仅供大家学习参考。本网站属非谋利性质,旨在传播马克思主义和共产主义历史文献和参考资料。凡刊登的著作文献侵犯了作者、译者或版权持有人权益的,可来信联系本站删除。 本站邮箱[email protected]