Inferact为谷歌TPU定制内核,跑Kimi K3比英伟达GB200快57%
论文AI 评分 85/100量子位待复核
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
推理创业公司Inferact(vLLM原班人马)为谷歌TPU v7手写megakernel推理内核,配合DeepSeek的DSpark推测解码框架,在16卡同等条件下跑Kimi K3达到每秒709 token,比英伟达GB200快57%。megakernel将92层MoE计算合并为单次调用,消除kernel切换间隙,实现跨层权重预取,将内存带宽利用率逼至理论峰值。关闭推测解码,TPU单batch裸速近GB200两倍。该方案无精度损失,代码已开源。
为什么值得看
软件优化逆转硬件带宽劣势,为TPU在大模型推理场景提供显著性能优势,开源代码具实操参考价值。
英伟达DeepSeekMoE
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
