自选
我的自选
查看全部
市值 价格 24h%
  • 全部
  • 产业
  • Web 3.0
  • DAO
  • DeFi
  • 符文
  • 空投再质押
  • 以太坊
  • Meme
  • 比特币L2
  • 以太坊L2
  • 研报
  • 头条
  • 投资

免责声明:内容不构成买卖依据,投资有风险,入市需谨慎!

DeepSeek廉价模型在九项基准测试中击败自家旗舰

2026-08-02 09:16:58
收藏

深度求索V4-Flash模型升级:性能超越旗舰版

2026年7月31日,深度求索(DeepSeek)将其V4-Flash模型从预览版升级为官方公测版。升级后的版本在深度求索公布的每一项智能体基准测试中,均超越了该公司更大、更昂贵的V4-Pro-Preview模型。关键在于:它采用了与之前相同的架构,深度求索只是对其进行了重新训练。

V4-Flash-0731保持了与预览版相同的2840亿参数混合专家设计以及130亿激活参数——深度求索的更新日志明确指出,这是一次训练后升级,而非全新模型。在衡量复杂命令行智能体任务的Terminal-Bench 2.1测试中,该模型得分为82.7,较预览版的61.8大幅提升,并领先于V4-Pro-Preview的72.1,与Anthropic的Claude Opus 4.8的85.0分仅相差几个百分点。DeepSWE得分从7.3跃升至54.4,Cybergym得分从38.7升至76.7。

你希望看到的对比,以及你不希望看到的

深度求索发布了一份与Opus 4.8的九项基准测试对比结果。Opus 4.8在所有九项测试中均领先,但部分差距很小——例如“智能体最后考试”(Agents' Last Exam)得分为25.2对25.7,基本属于四舍五入的差异。独立评测机构Artificial Analysis在7月27日的快照中测得,0731版本之前的终端在Terminal-Bench 2.1上得分为61.8,与深度求索自身的预览版数据精确匹配——这为基准线提供了坚实的独立确认。不过,某些媒体引用的令人瞩目的25.8分跃升,实际上是比较了两个不同版本的基准测试,而非纯粹的升级前后对比。

定价策略:低于所有竞争对手

V4-Flash-0731的定价为:缓存未命中时每百万输入令牌0.14美元(缓存命中时仅0.0028美元),每百万输出令牌0.28美元。这一价格与预览版相同,且远低于OpenAI新降价的GPT-5.6 Luna(0.20美元/1.20美元)。这一时间点很难被忽视:深度求索在OpenAI将Luna价格下调80%后的第二天发布了该版本,将V4-Flash-0731定位为同一价格战中的直接反击,而非巧合。

尚未验证的细节

截至发布时,-0731版本的权重文件尚未出现在Hugging Face上,且深度求索此前宣布的峰值/非峰值定价层级尚未生效——这意味着官方更新日志中的部分细节描述的是承诺,而非当前可用的实际情况。此外,Flash支持2500个并发请求,而Pro仅支持500个,这是五倍的容量优势,对于生产环境中的智能体集群而言,可能比任何单一基准测试分数都更为重要。

迁移成本为零

现有用户的迁移成本几乎为零:已经调用deepseek-v4-flash端点的开发者将自动获得升级后的检查点,使用相同的模型名称和API密钥,无需修改代码。深度求索将此描述为有意为之的设计选择——由于架构未变,仅进行了训练后优化,因此没有技术理由强制进行版本升级,导致用户群体分散在旧端点和新端点之间。

未来关注点

-0731版本权重是否如约上传至Hugging Face,从而支持自托管部署。
深度求索尚未发布的V4-Pro正式版能否进一步缩小与Opus 4.8的差距。
竞争对手实验室是否会以重新训练、价格不变的升级版来回应,而非推出全新模型。

展开阅读全文
更多新闻