AI 圈大事记

Inferact为谷歌TPU定制内核,跑Kimi K3比英伟达GB200快57%

论文AI 评分 85/100量子位待复核
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

推理创业公司Inferact(vLLM原班人马)为谷歌TPU v7手写megakernel推理内核,配合DeepSeek的DSpark推测解码框架,在16卡同等条件下跑Kimi K3达到每秒709 token,比英伟达GB200快57%。megakernel将92层MoE计算合并为单次调用,消除kernel切换间隙,实现跨层权重预取,将内存带宽利用率逼至理论峰值。关闭推测解码,TPU单batch裸速近GB200两倍。该方案无精度损失,代码已开源。

为什么值得看

软件优化逆转硬件带宽劣势,为TPU在大模型推理场景提供显著性能优势,开源代码具实操参考价值。

英伟达DeepSeekMoE

信源1 家

  1. [1]量子位谷歌TPU跑Kimi比英伟达GPU快57%!用的还是DeepSeek推理框架

关键事实

  • 16块谷歌TPU v7跑Kimi K3达每秒709 token,比16块英伟达GB200快57%[1]

  • Inferact提出megakernel方案,将92层MoE计算合并为一个大程序,消除kernel切换间隙[1]

  • 配合DeepSeek的DSpark推测解码框架,acceptance length达6,单步decode约8.5毫秒[1]

  • TPU v7的HBM带宽为7380 GB/s,低于GB200的8000 GB/s,但靠软件优化实现反超[1]

  • 绕过XLA用Pallas手写内核,编译耗时从30分钟以上降至不到90秒[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。