Alloy Compute 拆分推理工作负载
Alloy Compute 声称构建了一套 AI 推理系统,该系统能够在 AMD 图形芯片与可编程加速器之间拆分语言模型任务,从而缩短响应时间。
该公司于 7 月 31 日将这一设计描述为一种解耦合架构——即把模型执行的每个阶段发送给最适合的处理器。大多数推理系统会在单一芯片类型上运行所有阶段。AMD 图形处理器负责提示预填充和注意力机制,而 FPGA 加速器则处理令牌解码和混合专家层。
Alloy Compute 尚未公布基准测试结果,并表示仍在整合系统,同时测量延迟、吞吐量、能耗以及两种芯片之间的数据传输。客户评估项目尚未启动。
Nour De Vos 支持延迟保障
创始人兼首席执行官 Nour de Vos 表示,预填充、注意力机制和令牌生成对硬件提出了不同的要求,因此在单一架构上运行整个模型会浪费算力。该公司称,其准备保证首次令牌响应低于 200 毫秒,但这仅适用于在模型、输入长度和并发性方面严格遵守设定限制的部署场景。早期工作涵盖量化后的 Qwen 模型。
De Vos 从大规模加密货币挖矿领域进入 AI 基础设施,在那个领域,利润取决于保持机器繁忙和降低电费。他曾表示,正是这种将芯片、内存、网络和软件视为一个整体的系统级思维,塑造了当前的设计。

资金费率
资金费率热力图
多空比
大户多空比
币安/欧易/火币大户多空比
Bitfinex杠杆多空比
账号安全
资讯收藏
自选币种