自选
我的自选
查看全部
市值 价格 24h%
  • 全部
  • 产业
  • Web 3.0
  • DAO
  • DeFi
  • 符文
  • 空投再质押
  • 以太坊
  • Meme
  • 比特币L2
  • 以太坊L2
  • 研报
  • 头条
  • 投资

免责声明:内容不构成买卖依据,投资有风险,入市需谨慎!

Alloy Compute 跨GPU和FPGA拆分AI模型,实现更快响应

2026-08-01 01:11:16
收藏

Alloy Compute 拆分推理工作负载

Alloy Compute 声称构建了一套 AI 推理系统,该系统能够在 AMD 图形芯片与可编程加速器之间拆分语言模型任务,从而缩短响应时间。

该公司于 7 月 31 日将这一设计描述为一种解耦合架构——即把模型执行的每个阶段发送给最适合的处理器。大多数推理系统会在单一芯片类型上运行所有阶段。AMD 图形处理器负责提示预填充和注意力机制,而 FPGA 加速器则处理令牌解码和混合专家层。

Alloy Compute 尚未公布基准测试结果,并表示仍在整合系统,同时测量延迟、吞吐量、能耗以及两种芯片之间的数据传输。客户评估项目尚未启动。

Nour De Vos 支持延迟保障

创始人兼首席执行官 Nour de Vos 表示,预填充、注意力机制和令牌生成对硬件提出了不同的要求,因此在单一架构上运行整个模型会浪费算力。该公司称,其准备保证首次令牌响应低于 200 毫秒,但这仅适用于在模型、输入长度和并发性方面严格遵守设定限制的部署场景。早期工作涵盖量化后的 Qwen 模型。

De Vos 从大规模加密货币挖矿领域进入 AI 基础设施,在那个领域,利润取决于保持机器繁忙和降低电费。他曾表示,正是这种将芯片、内存、网络和软件视为一个整体的系统级思维,塑造了当前的设计。

展开阅读全文
更多新闻