AI 圈大事记

Stellar Colosseum 框架助力长程数学研究

论文AI 评分 75/100arXiv cs.AI
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手

Stellar Colosseum 是一个模型无关的测试框架,旨在解决数学和理论计算机科学中的长程研究问题。该框架通过在证明构建前探索策略、设置就绪门控、将证明计划分解为子问题以及回传验证结果来分配推理资源。在 TCS-Bench 基准测试中,结合 Gemini 3.1 Pro 和 Gemini 3.7 Flash 模型,该框架达到了 71.0% 的准确率;在 Codeforces 评估中,使用 Gemini 3.1 Pro 解决了 222 个问题中的 218 个。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

框架设计机制

Stellar Colosseum 被设计为一个模型无关的测试工具,专门用于处理数学和理论计算机科学领域的长程研究任务。这类任务通常依赖于一系列不确定且相互依赖的决策,传统语言模型在处理此类问题时往往不可靠。该框架通过在正式构建证明之前探索替代策略,并利用就绪门控机制来判断某一路径是否足够成熟以进行分解。此外,它将证明计划表示为相互依赖的章节级子问题,并能将验证器的发现反馈回论证的受影响部分。

性能评估表现

研究团队通过开放式研究和基准测试展示了该框架的能力。在 TCS-Bench 这一包含来自 FOCS、STOC 和 SODA 顶级会议论文的研究级定理证明任务基准中,Stellar Colosseum 结合使用 Gemini 3.1 Pro 和 Gemini 3.7 Flash 模型,实现了 71.0% 的准确率。在另一项针对 Codeforces 的评估中,使用 Gemini 3.1 Pro 的面向证明的管道结合执行反馈,成功解决了 222 个问题中的 218 个,显示出极高的解题效率。

集成与应用

Stellar Colosseum 的工作流程已被正式集成到 Google Antigravity 的 Teamwork 框架中,作为其中的 Long Proof 模式。该框架在各个阶段并行生成候选方案,利用针对性的证伪进行攻击,并通过重叠随机样本树聚合将候选方案及其批评合并为单一的研究产物。这一成果不仅解决了来自 FOCS 和 JMLR 等顶级期刊论文中的开放问题,也为利用多智能体系统进行复杂科学研究提供了新的范式。

为什么值得看

显著提升模型解决复杂长程数学问题的能力,已集成至 Google Antigravity。

GoogleGemini基准测试

信源1

  1. [1]arXiv cs.AI一手信源Stellar Colosseum: A Many-Agent Harness for Long-Horizon Research in Mathematics and Theoretical Computer Science

关键事实

  • Stellar Colosseum 是一个用于数学和理论计算机科学长程研究的模型无关框架。[1]

  • 在 TCS-Bench 基准测试中,结合 Gemini 3.1 Pro 和 Gemini 3.7 Flash 达到 71.0% 准确率。[1]

  • 在 Codeforces 评估中,使用 Gemini 3.1 Pro 解决了 222 个问题中的 218 个。[1]

  • 该工作流已集成到 Google Antigravity 的 Teamwork 框架中,作为 Long Proof 模式。[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。