D2K-Bench发布:评估LLM代理将专家设计转化为GPU内核的效率

论文AI 评分 68/100arXiv cs.AI
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

D2K-Bench是一个包含26个任务与85个工作负载的诊断基准,用于衡量LLM代理在专家指导下生成高效GPU内核的能力。指导涵盖高层算法、数据流设计与底层优化三个层级。在NVIDIA B200 GPU上对五个模型的测试表明,引入指导后,超130个模型-任务对的正确率从93.1%升至98.5%,全部任务的性能评分从1.46升至1.95。GPT-6-Astra等三个前沿模型在所有任务均提交正确时,几何平均加速比从1.69倍增至2.49倍,五模型平均综合实现得分从57分升至70分。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

基准设计与评估机制

D2K-Bench旨在诊断LLM代理生成GPU内核时与专家实现存在的性能差距,重点考察差距与设计发现及实现过程的关联。该基准涵盖26个任务及85个工作负载,将专家设计指导划分为三个层级:L1层级提供高层算法洞察,L2层级涉及数据流设计,L3层级包含底层优化技巧,并考虑各层级间的依赖关系。评估采用有无指导的配对运行,共享任务描述、工作负载、工具、硬件及350轮交互预算,同时独立评估代理提出的设计及生成代码中实现的设计属性。

模型测试与关键指标

研究在NVIDIA B200 GPU上对五个模型进行测试。引入专家指导后,超过130个模型-任务对的正确率由93.1%提升至98.5%,全部26个任务的性能评分从1.46增长至1.95。对于GPT-6-Astra、Claude-Opus-4.8和GPT-5.6-Sol这三个在有无指导运行中均能对所有任务提交正确结果的前沿模型,其几何平均加速比从1.69倍跃升至2.49倍。全部五个模型的平均综合实现得分也从57分提高至70分(满分100)。

结论与未实现属性

测试结果证实了专家设计指导对提升LLM代理生成GPU内核效率的显著价值。同时,基准评估也识别出在生成代码中仍然缺失的设计属性,揭示了当前代理在独立发现并实现部分优化设计方面的局限性,为后续改进代理的设计发现能力指明了方向。

为什么值得看

量化揭示了专家设计指导对LLM生成GPU内核的关键提升作用,指明当前代理未实现的优化属性。

GPTClaudeGPU

信源1 家

  1. [1]arXiv cs.AI一手信源D2K-Bench: Can LLM Agents Turn Expert Designs into Efficient GPU Kernels?

关键事实

  • D2K-Bench包含26个任务和85个工作负载,衡量LLM代理将专家设计指导转化为高效GPU内核的能力[1]

  • 专家指导分三个层级:L1高层算法、L2数据流设计和L3底层优化技巧[1]

  • 在NVIDIA B200 GPU上测试五个模型,引入指导后正确率从93.1%升至98.5%,性能评分从1.46升至1.95[1]

  • GPT-6-Astra、Claude-Opus-4.8和GPT-5.6-Sol三个前沿模型几何平均加速比从1.69倍增至2.49倍[1]

  • 五模型平均综合实现得分从57分升至70分(满分100)[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。