GPU-CFR 将反事实遗憾最小化加速 80 倍
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载解决 GPU 加速瓶颈
反事实遗憾最小化(CFR)通常在 CPU 上运行更快,因为其在 GPU 上执行时,每次迭代包含数百万个微小的相互依赖的收集和分散步骤。由于 GPU 内核完成时间极短,内核启动和框架调度占据了主要运行时间,导致此前的 GPU 实现输给了优化的 CPU 代码。研究者观察到,对于固定的博弈,除了数值之外,迭代的所有信息在第一次运行前就是已知的。基于此,GPU-CFR 将博弈编译为静态数据流,使用扁平化的边和信息集数组、预计算索引以及深度级批量传递来固定整个操作序列。
性能提升与优化手段
该技术通过静态机会折叠、深度级执行块和双车道到达缓冲区,将框架操作数量减少了多达 18.1 倍。由于形状、索引和缓冲区地址永不改变,CUDA Graph Replay 能够记录一次迭代并通过单次图启动来重放。测试覆盖了纸牌、骰子和棋盘游戏,结果显示,在单张 A100 显卡上,GPU-CFR 的运行速度比此前最快的 GPU CFR 方案快 29.8 至 80.4 倍。这种编译表示本身带来了大部分性能提升,即使在没有加速器的八线程 CPU 上,其速度也比 GPU 基线快 2.2 至 51.1 倍。
对比 CPU 基线表现
在与 CPU 实现的对比中,GPU-CFR 在测试套件中中大型游戏上的表现超越了所有 CPU 和 GPU 基线,且无需更改更新规则。具体而言,在四个最大的游戏中,其速度比最快的开源 CPU 实现 LiteEFG 快 14 至 258 倍。在 CPU 上,优化路径能够按位重现参考迭代,且树构建和图捕获的成本在首次求解中即可抵消。
为什么值得看
突破 CFR 算法在 GPU 上的性能瓶颈,大幅提升博弈论求解效率。
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
