D2K-Bench发布:评估LLM代理将专家设计转化为GPU内核的效率
论文AI 评分 68/100arXiv cs.AI
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
D2K-Bench是一个包含26个任务与85个工作负载的诊断基准,用于衡量LLM代理在专家指导下生成高效GPU内核的能力。指导涵盖高层算法、数据流设计与底层优化三个层级。在NVIDIA B200 GPU上对五个模型的测试表明,引入指导后,超130个模型-任务对的正确率从93.1%升至98.5%,全部任务的性能评分从1.46升至1.95。GPT-6-Astra等三个前沿模型在所有任务均提交正确时,几何平均加速比从1.69倍增至2.49倍,五模型平均综合实现得分从57分升至70分。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载基准设计与评估机制
D2K-Bench旨在诊断LLM代理生成GPU内核时与专家实现存在的性能差距,重点考察差距与设计发现及实现过程的关联。该基准涵盖26个任务及85个工作负载,将专家设计指导划分为三个层级:L1层级提供高层算法洞察,L2层级涉及数据流设计,L3层级包含底层优化技巧,并考虑各层级间的依赖关系。评估采用有无指导的配对运行,共享任务描述、工作负载、工具、硬件及350轮交互预算,同时独立评估代理提出的设计及生成代码中实现的设计属性。
模型测试与关键指标
研究在NVIDIA B200 GPU上对五个模型进行测试。引入专家指导后,超过130个模型-任务对的正确率由93.1%提升至98.5%,全部26个任务的性能评分从1.46增长至1.95。对于GPT-6-Astra、Claude-Opus-4.8和GPT-5.6-Sol这三个在有无指导运行中均能对所有任务提交正确结果的前沿模型,其几何平均加速比从1.69倍跃升至2.49倍。全部五个模型的平均综合实现得分也从57分提高至70分(满分100)。
结论与未实现属性
测试结果证实了专家设计指导对提升LLM代理生成GPU内核效率的显著价值。同时,基准评估也识别出在生成代码中仍然缺失的设计属性,揭示了当前代理在独立发现并实现部分优化设计方面的局限性,为后续改进代理的设计发现能力指明了方向。
为什么值得看
量化揭示了专家设计指导对LLM生成GPU内核的关键提升作用,指明当前代理未实现的优化属性。
GPTClaudeGPU
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
