AlphaEvolve:让模型去优化「有客观评分函数」的问题
alphaevolve
Google DeepMind 的编码代理式进化搜索:Gemini Flash 出量、Gemini Pro 出质地提出候选,自动评估器打分,高分候选留进种群当下一轮上下文,本质是 LLM 当变异算子的进化搜索;它只做有自动评估器的优化问题,本站因此归到 math 与 agents 两域。进化出的调度启发式已在 Google 数据中心(Borg)生产运行超过一年,持续回收 Google 全球算力的 0.7%(口径是 Google 全球算力,不是全人类算力),本站以它作卡片读数:全部结果里唯一经长期生产验证的一条。另有 matmul kernel 特定规模提速 23%;数学侧在 50 多个开放问题上约 20% 给出改进,含 4x4 复矩阵乘法用 48 次标量乘改进 Strassen 1969 年的 49 次记录。可验证性与证明器不同:Lean 通过是数学意义上的对,「提速 23%」是特定硬件下的经验读数。可用性接近零:无公开权重、Early Access 只有登记表,前提是你写得出便宜、快速、可信的评估器。置信度 B(有争议):Borg 那条经一年生产验证,本站未复现任何一条。
- 置信度
- 有争议
- 来源之间结论冲突(数据泄漏、协议不一致)
- 关键指标
- Google 全球算力回收(生产验证)
- 有争议 · 2025-05
- 成熟度
- 生产
- 研究 → 演示 → 产品 → 生产
我们的判断我们给它 B 档(有争议 / 部分独立可核验),这个判断需要解释清楚。B 档不是因为结果可疑,恰恰相反:它有一部分结果是本站收录的所有资产里证据等级最高的——4x4 复矩阵乘法的 48 次标量乘构造可以直接展开验证,不需要相信任何人的评测;Borg 调度启发式在生产环境持续运行一年多并回收 Google 全球算力的 0.7%,这是长期生产验证而非单次基准。真正让它停在 B 而不是升到 A 的是另一面:系统完全不开放,方法层面的普适性无人能独立检验,Early Access 只有一个登记表,外部团队连试一次的机会都没有。「结果可信,方法未经验证」就是 B 档在这里的准确含义。
它在 AGI 叙事里的位置比它的分数更重要。大多数「AI 加速科研」的说法都停在实验室读数上,AlphaEvolve 给出的是一个可运行的闭环:模型提候选、评估器打分、进化保留,然后产出的东西回去优化了训练这些模型所依赖的基础设施。matmul kernel 提速 23% 换来 Gemini 训练时间降 1%,这 1% 在旗舰模型的训练成本上是真金白银,而它的方向是自我强化的。这条闭环是当前最具体的「自我改进」实例,比任何关于递归自我提升的推测都更值得认真研究。
但方法论的适用边界必须读清楚,否则很容易被过度宣传。第一,它只对能写出自动评估器的问题成立,而写出一个便宜、快速、可信的评分函数往往比解决问题本身还难;需要人类判断质量的领域一律不在能力面内。第二,进化搜索会无情利用评估器的漏洞,一个只在特定分布上测量的评分函数很可能被刷分出实际无用的解——Borg 那条之所以硬,正因为评分来自真实生产。第三,改进幅度是个位数百分比量级(0.7% / 1% / 23% / 32.5%),每个数字在自己的上下文里都成立,但合起来不构成「AI 让计算快了 30%」这种说法。最后,社区那些受启发的开源复现不是 AlphaEvolve,把它们的水位挂到这条资产上是错误的。
它解决的问题:让模型去优化「有客观评分函数」的东西
大多数生成模型的任务是开放的:写一段代码好不好、画一张图像不像,都需要人来判。AlphaEvolve 刻意把自己限制在另一类任务上——存在自动评估器的优化问题:一段调度启发式跑出来省了多少算力、一个矩阵乘法算法用了多少次标量乘、一个数学构造的下界是多少,这些都能被机器直接打分。有了打分,进化就有了方向。
它的做法是把三件东西拼成一个闭环:Gemini Flash 与 Gemini Pro 两个模型负责提出候选(Flash 出量、Pro 出质),自动评估器负责打分,进化框架负责把高分候选保留进种群并作为下一轮的上下文。本质是「LLM 当变异算子的进化搜索」,不是让模型一次答对,而是让它在成千上万轮里被评分函数筛出来。
这也是本站把它归到 `math` 与 `agents` 两个能力域、而不是归到某个模型基准的原因:它衡量的不是「模型多聪明」,而是「模型 + 评估器 + 搜索」这个系统能在真实工程问题上产出多少可验证的改进。这条路径与 AGI 的关系最直接的一层是自我改进——如果一个系统能优化自己运行所依赖的基础设施,它就有了不完全依赖人类研究员的进步通道。
最有分量的一条证据:已经在生产里跑了一年多
AlphaEvolve 的结果里,大部分是实验室读数,但有一条不是:
- 它进化出的调度启发式已经在 Google 的数据中心(Borg)里生产运行超过一年,持续回收了 Google 全球算力的 0.7%。
这个 0.7% 要读准:它不是「效率提升 0.7%」这种模糊说法,而是在一个已经被人手工优化了十几年、规模是全球最大的调度系统之一上,持续多回收出 0.7% 的机器时间。本站把它选作这条资产的卡片读数,理由就是它是全部结果里唯一一个经过长期生产验证的,而不是跑一次基准得到的分数。
另外两条工程侧的读数:进化出的 matmul kernel 在特定规模上提速 23%,把 Gemini 训练时间降低了约 1%;对 FlashAttention 的改进最高 32.5%。第一条的意义在于它反哺了训练 AlphaEvolve 自己所用的那类模型——这是「自我改进」在基础设施层面最具体的形态,尽管 1% 这个数字看起来很小,但在旗舰模型的训练成本上,1% 是真实且可观的。
数学侧的读数:一处 1969 年以来的改进
AlphaEvolve 在 50 多个开放数学问题上跑过:大约 75% 重现了已知最优解,约 20% 给出了改进。其中最硬的一条是4x4 复矩阵乘法可以用 48 次标量乘完成,改进了 Strassen 算法在 1969 年给出的 49 次记录。
为什么这条比「20% 的问题改进了」更有分量:Strassen 的两层算法是数值线性代数的经典结果,4x4 复矩阵这个具体规格被无数人研究过、也被工程实现反复用到(GPU kernel 的分块尺寸正好落在这里),在这个规格上把一个保持了 56 年的记录推进一次,是可独立机械核验的——任何人把 48 次乘法的构造展开验证一遍就知道对不对,不需要相信任何人的评测。另一条常被引用的是 11 维 kissing number 的下界提升到 593,这类组合几何构造同样可以直接核验。
它为什么和「证明器」那条线不一样
本站同时收录 DeepSeek-Prover-V2 与 Kimina-Prover,它们做的是形式化证明:输出经 Lean 内核检查,真值二值且严格。AlphaEvolve 走的是另一条:输出是程序或构造,真值来自评估器的测量结果。两者的可验证性等级不同——Lean 检查通过是数学意义上的对,而「kernel 提速 23%」是在特定硬件、特定规模、特定测量方法下的经验读数,换一套环境数字就会变。
这个区别决定了本站对它的置信度判断:AlphaEvolve 记 B(有争议 / 部分独立可核验),比证明器那条 C 档高一档(因为 Borg 那条经过一年生产验证),但到不了 A(因为大部分读数无法在站外复现)。
可用性:目前几乎为零
- 没有公开模型权重:AlphaEvolve 依赖 Gemini Flash 与 Gemini Pro 的 API 内部访问,不是可下载的产物。
- Early Access 未开放:官方页面上只有一个登记表,截至本站核验时没有任何公开可用的接入通道。
- 没有官方开源复现:社区有若干受启发的开源实现(思路都是「LLM + 评估器 + 进化循环」),但它们不是 AlphaEvolve,能力水位没有对照关系,本站不把它们等同于这条资产。
- 使用前提是你能写出评估器:这是最实际的门槛。想在自己的问题上复现这套方法,必须先有一个便宜、快速、可信的自动评分函数;写不出评估器的问题,这套方法直接不适用。
边界
- 只对「可自动评分」的问题成立:需要人类判断质量的领域(产品设计、代码可维护性、科研品味)不在能力面内。评估器的质量就是结果的天花板。
- reward hacking 的风险由评估器承担:进化搜索会无情地利用评分函数里的任何漏洞。一个只在特定输入分布上测量的评估器,很可能被搜出一个在该分布上刷分、实际无用的解。Borg 那条之所以可信,正是因为它的评分是真实生产环境。
- 搜索成本极高:成千上万轮生成加评估,单轮还要跑真实的基准测量。这个成本结构决定了它适合「一次优化、长期复用」的基础设施问题,不适合每次请求都跑。
- 改进幅度多为个位数百分比:0.7%、1%、23%(单 kernel)、32.5%(单算子),这些数字在各自的上下文里都很硬,但不要读成「AI 让计算变快了 30%」。
- 数学改进集中在可穷举验证的构造类问题:矩阵乘法、kissing number 这类有明确目标函数的组合构造;定理证明、猜想生成不是它的战场。
我们的核验状态
事实来自 Google DeepMind 的 AlphaEvolve 官方发布页与技术博客(实读全文,含 Borg 生产运行、0.7% 算力回收、matmul 23% / 训练时间 1%、FlashAttention 32.5%、48 次标量乘、50+ 开放问题 75%/20%、11 维 kissing number 593、Early Access 登记表状态)。
置信度记 B(有争议),依据分三层:第一,部分结果可独立机械核验——48 次标量乘的矩阵乘法构造、593 的 kissing number 构造,任何人展开验证即可,不需要相信 DeepMind;第二,Borg 那条经过长期生产运行,不是单次基准,这是全部读数里证据等级最高的一条;第三,但本站没有复现任何一条,我们没有在自有硬件上重跑 matmul kernel 的 23%,也无法访问 Google 内部的 Gemini 与评估器管线。同时这个系统完全不开放,外部研究者无法独立评估其方法的普适性,所以「有争议」在这里的准确含义是「结果本身可信,普适性与可复现性未经验证」。
要升到 A 档,需要 DeepMind 开放系统或发布足够细节让外部团队在自有问题上复现同等量级的改进;以本站自身的能力,能做到的是独立核验那两条数学构造(把 48 次乘法的构造在符号计算里展开、把 593 的构造逐条检查),这是我们下一步可以真正落地的一步。