DeepSeek V4 Pro正式版“V5”,但鹈鹕测试翻车了

8月12日深夜,DeepSeek官网的API文档页面悄然完成了一次更新。Pro模型的版本号更换成了DeepSeek-V4-Pro-0813。与此同时,根据第一财经报道,DeepSeek官方群放出了一组评分数据,表格中显示DeepSeek V4 Pro的性能远远超过了预览版,甚至在Terminal Bench ……

作者:苗正,编辑:王靖,原文标题:《V4Pro正式版“V5”,但鹈鹕测试翻车了》,题图来自:AI生成

8月12日深夜,DeepSeek官网的API文档页面悄然完成了一次更新。Pro模型的版本号更换成了DeepSeek-V4-Pro-0813。

与此同时,根据第一财经报道,DeepSeek官方群放出了一组评分数据,表格中显示DeepSeek V4 Pro的性能远远超过了预览版,甚至在Terminal Bench 2.1这个Agent领域影响极大的测试集上,性能比肩当下最强的模型Claude Fable 5。

另一方面,在DeepSWE测试集上,预览版仅得12.8分,基本属于“不会做”的水平;正式版直接飙到62.7分,涨幅接近5倍。

这个测试集是衡量代码Agent能力的核心基准。同样翻倍的还有DSBench-Hard,从31.1冲到67.2;DSBench-FullStack从41.8提升到71.1。

如此这般的性能提升,将其称之为DeepSeek V5 Pro都不为过。

硬件规格上,V4 Pro延续了MoE架构设计,总参数规模1.6万亿,每次推理激活约490亿参数。接口侧提供100万 token上下文和最高38.4万 Token 输出,这两个数字对普通聊天可能意义不大,但对长任务Agent却是硬刚需。

尤其是大型代码库、长时间运行的日志以及连续工具调用,都会快速吃掉上下文。窗口不够大,Agent就只能不断压缩记忆,压着压着,前面做过什么也忘了。

调用方式保持不变,模型名仍然是deepseek-v4-pro,老用户的代码一行不用改,后端就自动切换到了新版本。

价格方面,0813版每百万token缓存未命中输入3元、输出6元,和预览版时期一致,并没有随模型转正而同步上调。

而就在不久前,DeepSeek官方曾表示价格将要上涨。

一、DeepSeek V4引发全球降价

自DeepSeek V4发布以后行业内有个怪现象,几乎所有大厂都在降价。但大背景却是只要跟AI相关的,一定都在涨价。最开始是GPU、内存,现在连硬盘、电,甚至陶瓷都涨了。

就好像西红柿涨价、鸡蛋涨价、糖涨价,结果西红柿炒鸡蛋反而比以前更便宜了。

2025年的时候,DeepSeek R1虽然引发了DeepSeek时刻,可当时由于行业重点在于输出内容的质量,所以OpenAI、Anthropic还能用“我们更聪明”来维持溢价。

但是现在今年7月31日V4 Flash正式版上线以后,行业叙事改成了“每任务/单位智能的价格”,DeepSeek V4 Flash正式版凭借“能力够用+价格便宜两个数量级”形成了一道独有的斩杀线。

根据Artificial Analysis的测试,在完成相同水平任务的前提下,DeepSeek V4 Flash的价格低于市面上70%的模型,而那些处于这70%分水岭内的模型,称之为被DeepSeek“斩杀”。

落在斩杀线上的竞品,只剩两条出路,要不然主动大幅下调定价,或者干脆放弃普惠开发者市场,收缩到预算充足的高端企业客户。

于是各家厂商的处境变得很微妙。短期内没办法提高智能水平,又舍不得开发者市场,降价就成了唯一能立刻执行的防御手段。

OpenAI是最典型的例子。GPT-5.6 Luna 7月9日才上线,7月30日就宣布降价80%,输入价从每百万token 1美元砍到0.2美元,输出价从6美元砍到1.2美元。一款刚发布的新旗舰,上市不到一个月就打两折,这也是无可奈何的事情。

OpenAI在降价当天同步发了一篇技术博客,称GPT-5.6 Sol自己重写并优化了部分生产推理内核,把端到端模型服务成本压低了约20%,token生成效率提升了15%以上。

这就使得它能把省下来的钱,直接变成给用户的降价补贴。换句话说,OpenAI这波降价,是被自己模型写代码省下的成本托起来的。

不过成本降低20%和提升15%生成效率这两个数字,似乎跟降价80%匹配不上。

根据OpenAI的投资人披露,该企业单季营收57亿美元,同比增长约3倍;经营性亏损93亿美元,当期现金消耗(实际烧掉的现金)37亿美元,相当于每赚1美元收入就要烧掉约0.65美元现金。当季研发支出高达86亿美元,整体毛利率仅39%。

并且市场预测,OpenAI在2026年的全年经营性亏损约为140亿美元。

因此,无论如何OpenAI发布的技术报告内容如何,如果没这条斩杀线,这笔效率红利大概率会先进利润表,而不是变成用户账单上的折扣。

Anthropic也有相似的反应。Claude Opus 5发布后,其定价改为了5美元/25美元,正好是Fable 5的半价。Sonnet 5首发优惠价2美元/10美元,比标准定价低了三分之一,优惠期一路延到8月31日。

随着DeepSeek斩杀线的发酵,Anthropic在8月10日宣布,将Sonnet 5的优惠价格变为永久价格,再也不会恢复成为原价格。

谷歌7月21日一口气发三款 Gemini Flash 轻量模型,主力款3.6 Flash当天宣布输出价永久下调17%。

国内更是放血式促销,8月11日,智谱把GLM Coding Plan全员额度重置回满,再叠1.5倍限时加成;火山引擎给 GLM-5.2开出四倍折扣系数,49元的套餐能换到五千多万token;OpenRouter上GLM-5.2的三家供应商互相压价,从60%打到80%,再到95%。

二、反直觉,斩杀线其实会越来越低

逃避斩杀线的路有两条:一条往下走,一条往上走。

往下走是防御,是承认自己在这个区间和DeepSeek没有本质区别,只能拼价格。往上走是进攻,是只要能力足够强、DeepSeek够不到,就根本不在斩杀线的杀伤范围内。

在DeepSeek的斩杀线之上可以继续收溢价,因此,诸如GPT-5.6 Sol、Kimi K3、Claude Fable 5,这些真正站在金字塔尖的旗舰模型,一个都没降价。

以Kimi K3为例,于2026年7月16日正式上线,本身就发布在DeepSeek V4 Flash之后,其 API 定价为:国际版输入3美元/百万token、输出15美元/百万token;国内版输入20元/百万token、输出100元/百万token。

对比上一代旗舰K2.6,K3国内版的输入价格上涨了208%,输出价格上涨270%

但是有个事得提前说明白,如今已经2026年过半了。DeepSeek V4 Flash的总参数量为284B,这在当下其实是一个非常轻量的模型,它的定位是“高效率地完成大多数任务”。

Artificial Analysis的智能指数里,V4 Flash只得了50分,明显低于 Kimi K3、GPT-5.6和Claude Fable 5。

这就使得在复杂推理、长链路任务、多步规划、需要深度领域知识的判断,这些超级硬核的任务上,DeepSeek V4 Flash的完成率和可靠性,远不如头部模型。

斩杀线扫过的是“够用就好”的那片海,在“必须万无一失”的那片土地上,DeepSeek暂时还过不去。

不过这个斩杀线其实也维持不了多久,因为“推测解码”越来越成为了主流。这也是为什么,所有大厂都要研发旗舰模型的同时,开发一款极其便宜的小模型。

所谓推测解码,是指2022年时,谷歌Research团队的亚尼夫·利维坦(Yaniv Leviathan)、马坦·卡尔曼(Matan Kalman)和约西·马蒂亚斯(Yossi Matias)曾在论文《通过推测解码实现Transformer的快速推理》(Fast Inference from Transformers via Speculative Decoding)中提出,用一个小模型快速出草稿,大模型只负责并行验证和修正,草稿命中率一旦稳定在80%以上,旗舰模型的有效推理成本就能降到原来的1/3到1/5。

但以前这项技术不太能降低成本,原因在于以前给旗舰模型配草稿,用的是7B、13B的通用超小模型,命中率上不去,所以价格就打不下来。

可推测解码仍然是业内公认最可行的方向,这才使得大家都备有一款小模型。

现在来看,推测解码逐渐走向成熟。2026年6月DeepSeek发布了DSpark推测解码模块,并部署到V4 Flash和V4 Pro的线上流量,在相同吞吐下单用户生成速度提升了60%到85%,这也直接造成了DeepSeek的大幅降价。

随着DSpark的成功,势必会有越来越多的厂商部署推测解码,以实现更快更便宜的效果。

除了推测解码外,还有一个技术也可能会降低模型成本,那就是静态知识剥离。

这个技术其实起源更早,它是Meta AI的帕特里克·刘易斯(Patrick Lewis)等人在2020年论文《面向知识密集型NLP任务的检索增强生成》(Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks)中提出的。

简单来讲,它就是让模型在思考的过程中,把事实性知识从参数中拆出去,只靠外部检索补充。这样整个思考过程就会更快,成本因此更低,并且由于外部引入知识,还能让输出结果幻觉更少。

不过真正把这个技术发扬光大的依然是DeepSeek。2026年1月,DeepSeek联合北大发表论文《通过可扩展查找实现条件记忆》(Conditional Memory via Scalable Lookup)

论文的观点是,语言建模本质上包含两类完全不同的任务,一类是需要深度动态计算的组合推理,另一类是检索静态知识,但Transformer把这两件事混在一起做了。

于是论文就依照静态知识剥离的逻辑提出了一个叫做Engram的技术。

打个比方,在考试的时候,让大模型背下所有公式、历史年份、名人身份、地理常识。然而这就导致大模型只能用一部分的脑容量来解题。背得越多,能用来思考的脑容量就越少。

Engram干的事就是把闭卷考试改成开卷考试。它在模型中间插了一本“速查手册”,遇到 “戴安娜王妃是谁”、“张仲景是什么朝代的”这种事实性问题,不用现场一层层推导,直接翻手册,一秒查到。

这样,模型的脑容量就可以全部用来做真正需要动脑筋的事,比如解数学题、写代码、做逻辑推理。

Engram一旦成熟,也将大幅减少模型成本。

三、DeepSeek V4 Pro真的发布了吗?

随着DeepSeek V4 Pro的更新,网上最大的声音便是质疑。因为这次更新和DeepSeek V4 Flash正式版的更新方式截然不同,V4 Flash正式版有完整的官方更新日志,明确标题“DeepSeek-V4-Flash更新”,列出了9项基准测试的具体分数。最关键的是,DeepSeek会注明“模型结构、尺寸和Preview保持一致,仅重新进行了后训练”这些细节。

可截止发稿,DeepSeek V4 Pro正式版相关的发布痕迹也只有三处:官网的“模型 & 价格”页面、官网首页出现一句简短的滚动公告、一张跑分表。

甚至就连官方的更新日志,也停留在DeepSeek V4 Flash正式版上。

除了这些迹象外,权威评测机构Artificial Analysis上线了V4 Pro 0813(最大推理强度)的独立评测页,综合智能指数为53 分。相比预览版的45分确有提升,和GLM-5.2齐平。

但问题在于,53分这个档位和Fable 5差了很远,无法匹配跑分表中的“接近甚至超过Fable 5”。

作为参照,同一天发布的Grok 4.6还拿到了61分。

不只是Artificial Analysis,在比较模型数学能力的Proof Bench上,作为靠数学能力而声名鹊起的DeepSeek,其V4 Pro正式版甚至连前10都没有挤进去。

更有一些个人评测者对V4 Pro正式版进行了深度的测试,均表示实测效果皆不尽人意。

AI博主牙医就发文表示“刚发的DeepSeek-V4-Pro-0813好像的确有问题。reasoning_effort=max的时候模型在长程 AgenticCoding 任务下更倾向于早停。”

他进一步表示,“我这个测试总计50轮,让模型不断优化代码, 结果他在3次测试中,2次都在42-43轮左右的情况下停止了。并未用完全部机会。而且目前成绩来看,甚至没打过 GLM-5.1 (仅我这一个case, 我不对其它case负责)。”

以最常见的“鹈鹕测试”为例,提示词为“Generate an animated looping SVG of a pelican riding a bicycle. Wheels spin, pedals move, pelican’s legs pedal correctly, smooth infinite loop, no javascript, use native SVG animateTransform only.”(生成一个循环动画SVG:鹈鹕骑自行车。轮子旋转、踏板转动、鹈鹕的腿正确踩踏板,平滑无限循环,不要JS,只用SVG原生animateTransform动画。)

我将相同的提示词分别发给DeepSeek V4 Pro正式版和Flash正式版,结果发现,反而Flash做的效果远远超过了V4 Pro,无论是鹈鹕的动作还是背景中的云彩,V4 Flash正式版均比Pro正式版更好。

V4 Pro正式版

V4 Flash正式版

0813这个版本号本身可能只是一个“占位符”。

换句话说,DeepSeek可能并没有直接上线新模型,或者是有意去压制新模型的能力,先把坑占上了,等后续做好准备再上线,这样就不用担心一瞬间超高并发挤爆服务器了。

此前,DeepSeek Harness负责人崔添翼曾透露,DeepSeek V4 Pro的正式版将和DeepSeek Harness同时上线。而8月13日这天,是DeepSeek Harness的最后一次测试。

在DeepSeek Harness内测群中就有这样一条消息,0813版本计划发布DeepSeek Harness的公测版。

目前看来该Harness产品还未发布,并且DeepSeek V4 Flash之前的测试中,就有很多成绩是DeepSeek Harness上跑出来的。那么结合官方群里的跑分表,尤其是在Terminal Bench这样的测试集上,使用的可能就是传说中的DeepSeek Harness。

模型的斩杀线会下降,但DeepSeek Harness可能会带来新的斩杀线。

2026年5月,DeepSeek Harness内部立项,独立组建专项核心团队,由崔添翼负责。8月2日,崔添翼面向全球公开征集Harness内测用户,优先筛选具备Agent Harness开源项目经验的开发者。8月11日,“DeepSeek Harness团队”微信公众号完成注册,认证主体是深度求索北京分公司。

在V4 Flash正式版的API文档中有这么一段内容,对于公开基准测试中的Code Agent任务,正式版用的是DeepSeek Harness极简模式作为框架进行测试。

也就是说,V4 Flash能拿下Terminal Bench 2.1的82.7分,严格来说是“DeepSeek模型+DeepSeek Harness测试框架”的组合成绩,不是纯模型裸分。

V4 Flash预览版在Terminal Bench 2.1上是61.8分,同期V4 Pro预览版是72.1分。显然,DeepSeek Harness在Agent任务上,给DeepSeek模型带来了质的飞跃。

82.7分其实是一个非常高的分数。Terminal Bench 2.1目前的SOTA是GPT-5.6 Sol的88.8分,Kimi K3是88.3分,Claude Opus 5是84.3分,所有参评模型的平均分是77.3分。

正如前文提到的,V4 Flash是一个轻量模型,和Fable 5、GPT-5.6 Sol对比的应该是旗舰模型V4 Pro。那么可想而知,一旦DeepSeek Harness和V4 Pro正式版上线,势必会迎来一个新的斩杀档位。

更值得注意的是,国内玩家已经全部挤进了这条赛道。

除了DeepSeek外,智谱的ZCode也是一款Coding Harness,只不过它针对的是智谱自家的GLM,8月11日一口气上线了Goal、Subagents、Remote Control、闲时任务四大功能。

在智谱自研的Code Bench中,在复杂跨文件任务上,GLM-5.2配合ZCode,要比GLM-5.2配合Claude Code,整体通过率高出2.39 %,缓存命中率超过98%,有效 token 量提升约30%。

西红柿在涨价、鸡蛋在涨价、糖在涨价,结果西红柿炒鸡蛋反而便宜了。可是我们都清楚,这个逻辑是有问题的,至于它会持续多久,没人说得明白。

  • Related Posts

    滔搏们悄悄“抛弃”耐克

    一纸公告,百亿生意化为泡沫。近日,港股运动零售两大龙头滔搏国…

    字节AI数据部门“升咖”,但还是没有交给科学家

    字节正在重新组织自己的AI数据团队。据《智能涌现》报道,字节…

    发表回复

    您的邮箱地址不会被公开。 必填项已用 * 标注

    bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak bokep anak
    xnxx porn xnxx porn xnxx porn xnxx porn xnxx porn xnxx porn xnxx porn xnxx porn xnxx porn xnxx porn xnxx porn