自选
我的自选
查看全部
市值 价格 24h%
  • 全部
  • 产业
  • Web 3.0
  • DAO
  • DeFi
  • 符文
  • 空投再质押
  • 以太坊
  • Meme
  • 比特币L2
  • 以太坊L2
  • 研报
  • 头条
  • 投资

免责声明:内容不构成买卖依据,投资有风险,入市需谨慎!

DeepSeek新模型在架构设计上几乎媲美GPT-6 Astra,成本仅为1.4%

2026-09-11 05:33:47
收藏

OpenDesign 基准测试:DeepSeek V4.1 Flash 以极具竞争力的性价比挑战行业标杆

本周,知名设计基准网站 OpenDesign Arena 的运营方 OpenDesign 公司,对 13 款主流 AI 模型进行了同一批设计任务的横向评测。最终,OpenAI 推出的 GPT-6 Astra 以最高分夺得榜首。然而,DeepSeek 的最新模型 V4.1 Flash 紧随其后,其得分达到了榜首分数的 98%,而成本仅为榜首模型的约 1.4%。

评测标准与核心目标

OpenDesign Arena 专注于评估日常设计工作场景,包括构建 Web 应用程序、仪表盘、移动端界面以及落地页等,总分为 100 分。其中,30 分用于考核输出内容是否真正符合需求简报;其余 70 分则从布局、层级结构、色彩搭配及风格契合度等方面对设计质量进行评分。

与大多数旨在展示通用能力的 AI 排行榜不同,该评测旨在回答一个更为具体且实际的问题:对于一线网页设计师而言,明天真正应该使用哪一款模型?

性能与成本数据对比

在该评测体系下,各主要模型的表现如下:

  • GPT-6 Astra:平均得分 82.7 分,耗时 11.1 分钟,单份设计成本为 $1.61。
  • DeepSeek V4.1 Flash:得分 81.2 分,耗时仅 5.3 分钟,成本低至 $0.023。
  • Claude Fable 5.1:得分 80.3 分,耗时 12.8 分钟,成本高达 $3.66。

在参与测试的 13 款模型中,除了 GPT-6 Astra 以微弱优势(领先 1.5 分)胜出外,其余 11 款模型(包括 Grok 4.6、Qwen 3.8-Max、Kimi K3、GLM-5.3 Flash 和 Gemini 3.8 Flash 等)在得分上均低于 DeepSeek V4.1 Flash,且运行成本更高。

技术解析:为何能实现低成本高性能?

DeepSeek 在其 V4.1 Flash 的技术报告中解释了其成本优势的来源。该模型虽然拥有总共 5520 亿个参数(即模型在训练过程中调整以存储知识的内部设置),但在处理输入提示时仅激活其中的 80 亿个参数,而在生成响应时仅激活 160 亿个参数。DeepSeek 将这种架构称为“因果编码器-解码器”设计,这也是其能够实现极速完成时间的关键技术所在。

这并非 DeepSeek 首次通过低成本策略缩小能力差距。此前,该公司的 V4 Pro 模型在另一项基准测试中,表现已接近 Claude Fable 5(差距仅在 5% 以内),而费用却仅为后者的一小部分。此外,DeepSeek 还在北京招募工程师构建自己的代码框架(Code Harness),旨在掌握完整的智能体栈(Agentic Stack),而非仅仅作为底层模型供应商。

评测局限性与交付率分析

需要指出的是,OpenDesign 的测试设置限制了这些数据的证明范围。只有当模型输出的结果能够渲染为可正常工作的网页时,才会获得评分;任何空白、损坏或截断的输出均计为零分且不予重测。因此,该基准测试衡量的是可靠且日常的设计输出能力,而非通用的推理或编码技能。

在交付率(即无需修改即可直接交付的使用比例)方面:

  • GPT-6 Astra:交付率为 60%。
  • DeepSeek V4.1 Flash:交付率为 57.7%。
  • Claude Fable 5.1:交付率为 56.7%。

尽管 OpenAI 于 9 月 3 日发布的 GPT-6 Astra 因具备广泛的能力(如电路板布局、税务草稿起草及 3D 场景构建)而享有盛誉,但早期测试者指出其在写作能力上弱于前代产品。在 OpenDesign 的图表中,GPT-6 Astra 体现了典型的“全能型”特征:相比 DeepSeek 更具性价比的入门级选择,它速度更慢、价格更高,但依然是综合得分最高的模型。

展开阅读全文
更多新闻