FrugalEvo框架实现低成本LLM程序进化,圆打包任务刷新SOTA

论文AI 评分 75/100arXiv cs.AI
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

FrugalEvo是一种成本感知的LLM引导程序进化框架,通过强模型探索策略与廉价模型实现及迭代优化代码,并设计缓存高效进化过程以最大化前缀共享提升复用。引入BA-AUC指标衡量固定预算下解质量。在10项数学与系统优化任务上,最终解质量匹敌或超越OpenEvolve等基线,9项任务BA-AUC更高,10项ALE-Bench-Lite算法优化任务平均性能更优。圆打包任务中,用GPT-5.6组合仅花1.68美元、用GLM-5.3组合仅花0.55美元即达新SOTA,远超约50美元的多智能体基线。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

强弱模型协作与缓存优化

针对LLM引导进化方法(如AlphaEvolve)通常只优化固定迭代次数内性能增益而忽视开销的问题,FrugalEvo提出成本感知框架。其核心机制是将进化过程解耦:由能力更强但调用成本高的LLM负责探索解策略,而调用成本更低的廉价LLM负责将策略转化为代码并执行迭代细化。同时,框架设计了缓存高效的进化流程,通过优化运行组件与提示词,最大化不同进化步骤间前缀的共享程度,从而显著提升缓存复用率,降低实际推理开销。

BA-AUC评测指标与任务表现

为准确衡量在有限成本预算内随开销累积所能获取的最优解质量,研究引入了BA-AUC指标,计算截至预算上限时,当前最佳评估分数曲线下的面积。在10项数学与系统优化任务中,FrugalEvo在最终解质量上匹敌或超越OpenEvolve、ShinkaEvolve、AdaEvolve及EvoX等基线,并在其中9项任务取得更高BA-AUC。在ALE-Bench-Lite的10项算法优化任务上,其平均性能同样优于上述基线。

圆打包任务突破与极低开销

在极具挑战的圆打包任务上,FrugalEvo取得了新的最优性能。具体而言,采用GPT-5.6的Terra与Luna模型组合仅需1.68美元,采用GLM-5.3及其Flash变体组合仅需0.55美元,即可匹敌或超越所有对比基线。相比之下,CORAL和SwarmResearch等多智能体方法在该任务上的平均花费约为50美元。这表明FrugalEvo在解决复杂计算优化问题时,能以极低的成本实现与高开销方案相当甚至更优的效果。

为什么值得看

以极低推理成本实现LLM进化寻优,打破算力瓶颈,为计算优化提供高性价比新范式。

GPT智能体

信源1 家

  1. [1]arXiv cs.AI一手信源FrugalEvo: Towards Cost-Aware LLM-Guided Program Evolution

关键事实

  • FrugalEvo采用强弱模型分工:强模型探索策略,廉价模型实现并迭代优化代码[1]

  • 引入Budget-Aware Area Under the Curve (BA-AUC)指标衡量固定成本预算下的解质量[1]

  • 在圆打包任务中,使用GPT-5.6组合仅耗1.68美元、GLM-5.3组合仅耗0.55美元即达新SOTA[1]

  • 上述圆打包成本远低于CORAL等多智能体方法约50美元的平均开销[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。