深度求索V4-Flash模型升级:性能超越旗舰版
2026年7月31日,深度求索(DeepSeek)将其V4-Flash模型从预览版升级为官方公测版。升级后的版本在深度求索公布的每一项智能体基准测试中,均超越了该公司更大、更昂贵的V4-Pro-Preview模型。关键在于:它采用了与之前相同的架构,深度求索只是对其进行了重新训练。
V4-Flash-0731保持了与预览版相同的2840亿参数混合专家设计以及130亿激活参数——深度求索的更新日志明确指出,这是一次训练后升级,而非全新模型。在衡量复杂命令行智能体任务的Terminal-Bench 2.1测试中,该模型得分为82.7,较预览版的61.8大幅提升,并领先于V4-Pro-Preview的72.1,与Anthropic的Claude Opus 4.8的85.0分仅相差几个百分点。DeepSWE得分从7.3跃升至54.4,Cybergym得分从38.7升至76.7。
你希望看到的对比,以及你不希望看到的
深度求索发布了一份与Opus 4.8的九项基准测试对比结果。Opus 4.8在所有九项测试中均领先,但部分差距很小——例如“智能体最后考试”(Agents' Last Exam)得分为25.2对25.7,基本属于四舍五入的差异。独立评测机构Artificial Analysis在7月27日的快照中测得,0731版本之前的终端在Terminal-Bench 2.1上得分为61.8,与深度求索自身的预览版数据精确匹配——这为基准线提供了坚实的独立确认。不过,某些媒体引用的令人瞩目的25.8分跃升,实际上是比较了两个不同版本的基准测试,而非纯粹的升级前后对比。
定价策略:低于所有竞争对手
V4-Flash-0731的定价为:缓存未命中时每百万输入令牌0.14美元(缓存命中时仅0.0028美元),每百万输出令牌0.28美元。这一价格与预览版相同,且远低于OpenAI新降价的GPT-5.6 Luna(0.20美元/1.20美元)。这一时间点很难被忽视:深度求索在OpenAI将Luna价格下调80%后的第二天发布了该版本,将V4-Flash-0731定位为同一价格战中的直接反击,而非巧合。
尚未验证的细节
截至发布时,-0731版本的权重文件尚未出现在Hugging Face上,且深度求索此前宣布的峰值/非峰值定价层级尚未生效——这意味着官方更新日志中的部分细节描述的是承诺,而非当前可用的实际情况。此外,Flash支持2500个并发请求,而Pro仅支持500个,这是五倍的容量优势,对于生产环境中的智能体集群而言,可能比任何单一基准测试分数都更为重要。
迁移成本为零
现有用户的迁移成本几乎为零:已经调用deepseek-v4-flash端点的开发者将自动获得升级后的检查点,使用相同的模型名称和API密钥,无需修改代码。深度求索将此描述为有意为之的设计选择——由于架构未变,仅进行了训练后优化,因此没有技术理由强制进行版本升级,导致用户群体分散在旧端点和新端点之间。
未来关注点
-0731版本权重是否如约上传至Hugging Face,从而支持自托管部署。
深度求索尚未发布的V4-Pro正式版能否进一步缩小与Opus 4.8的差距。
竞争对手实验室是否会以重新训练、价格不变的升级版来回应,而非推出全新模型。

资金费率
资金费率热力图
多空比
大户多空比
币安/欧易/火币大户多空比
Bitfinex杠杆多空比
账号安全
资讯收藏
自选币种