AMD联手Cerebras拆解推理流水线:预填充归GPU,解码归晶圆级芯片
AMD和Cerebras Systems于7月23日宣布了一种「拆分式推理」架构:把大模型推理的预填充和解码两个阶段拆开,分别交给最擅长的硬件来干,号称每瓦吞吐量最高提升5倍。
三个关键信息
预填充归AMD,解码归Cerebras。 在大模型推理中,预填充阶段(处理用户输入的长上下文)是计算密集型任务,适合GPU并行处理;解码阶段(逐token生成回答)是内存带宽密集型任务,恰好是Cerebras晶圆级引擎(WSE)的强项。这套方案把AMD Helios机架的Instinct GPU用于预填充,Cerebras WSE负责解码,两者通过网络协同工作。
5倍效率提升有前提条件。 据AMD性能实验室和Cerebras在2026年7月的联合建模数据,在Kimi 2.6 1T模型上,Helios+WSE组合的每千瓦每秒token数(T/s/W)约为纯WSE方案的5倍。但这个数字来自建模而非实测,且对比基线是「纯WSE方案」而非英伟达GPU方案——换句话说,它证明的是「拆开比不拆好」,不是「比英伟达好」。
下半年上线Cerebras Cloud。 联合方案预计2026年下半年先在Cerebras Cloud上提供服务,目标场景包括编程助手、实时智能体、机器人控制和科学计算。AMD的EPYC处理器提供CPU算力,Instinct GPU负责预填充加速,Cerebras WSE完成解码——三种芯片各司其职。
王斗视角
这个合作最有意思的不是技术本身,而是它暴露的行业焦虑。AMD的GPU在推理市场一直被英伟达压着打,Cerebras的晶圆级芯片虽然解码快但预填充弱——两个各有短板的选手决定拼一把。思路是对的:大模型推理本来就是两个截然不同的工作负载,硬塞进同一种芯片确实浪费。但5倍的数字得看小字:建模数据、自己跟自己比、用的是月之暗面的模型。真正的考试是跟英伟达H200/B200正面打价格性能比,而这张成绩单他们还没交。不过话说回来,推理市场太大了,容得下不止一种架构——如果这套方案真能把每瓦成本压到足够低,云厂商会愿意试的。
