AI 圈大事记

是石科技自研推理引擎优化PCIe显卡,DeepSeek吞吐提升近7倍

工具AI 评分 75/100量子位待复核
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

是石科技推出Meta-Infer高效推理引擎,通过纯软件优化弥合框架与PCIe显卡间的适配缝隙。针对DeepSeek-V4.1-Flash模型,经内核补齐与通信重构两阶段优化,8卡PCIe环境输入吞吐从1932 tok/s升至13274 tok/s,提升6.87倍,并支持1M上下文。GLM5.3吞吐提升1.92倍,P95首Token时延从141.6秒降至46.6秒。1.5台6000D跑赢1台B300。

为什么值得看

纯软件优化让低成本PCIe显卡逼近高端卡推理能力,为算力受限团队提供低成本提效方案。

MetaDeepSeek

信源1 家

  1. [1]量子位PCIe显卡被低估了!内核补齐+通信重构,DeepSeek推理吞吐翻近7倍

关键事实

  • 8张PCIe显卡部署DeepSeek-V4.1-Flash,输入吞吐从1932 tok/s提升至13274 tok/s,提升6.87倍[1]

  • 优化后GLM5.3输入吞吐提升1.92倍,P95首Token时延从141.6秒降至46.6秒[1]

  • 优化分算模协同与通算重构两阶段,包含内核补齐、算子融合、通信重构等能力[1]

  • 1.5台6000D跑赢1台B300[1]

相关 · 工具

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。