AlphaEvolve 评估框架必须通过确定性执行流水线系统地处理候选代码更新。测试框架不会一次性执行并评判解决方案,而是将流水线划分为三个渐进式测试门:
评估门
下图展示了候选程序如何流经三个不同的测试层,然后再将结构化元数据返回给 AlphaEvolve。

解决方案验证
评估循环首先会强制执行硬性结构约束,而不会运行代码的核心逻辑。该测试平台会检查候选解决方案是否存在基本的编译时语法正确性问题、解析 bug 和结构性安全违规问题。
成功途径:如果程序通过所有验证检查,代码会安全地向下推进到解决方案验证运行时循环。
失败途径(短路):如果任何验证测试失败,测试框架会立即中断执行。它完全绕过资源密集型验证和性能测试层,以保护系统基础架构。循环直接进入反馈生成阶段,断言存在巨大的平坦搜索惩罚(例如
-1e12)以及零值效果得分。
解决方案验证
一旦候选程序被验证为在语法上正确且可安全执行,测试框架就会在隔离的环境中启动该程序,以强制执行软功能约束。此阶段会运行标准单元测试和功能正确性检查。
该框架不会输出通过或失败的二元信号,而是根据通过的功能测试的确切数量或百分比来评估程序。这会纳入总体惩罚得分,从而为 AlphaEvolve 提供密集的数值搜索梯度,以便在连续的代际中逐步修正损坏的逻辑结构。
解决方案评估
当候选程序被证明在语法上安全且在算法上正确时,它会到达性能基准比较层。
该框架会运行实证测试、直接产品逻辑计算或分析模拟,以量化您的目标业务优化指标(例如算法执行速度、云基础设施内存占用空间或输出校准界限)。
全面评估反馈
在执行流水线的末尾,测试框架会将所有已完成阶段的数据汇总到结构化反馈载荷中。此载荷会直接返回给 AlphaEvolve,以指导后续突变的父级选择。
标准化反馈输出包含以下三个主要组成部分:
总体爬山得分:由测试框架确定性计算出的单个组合标量值,AlphaEvolve 在优化期间直接最大化该值。
精细的优化得分和惩罚:各个子指标、执行时间和软约束惩罚细分。这种明确的数据分布使引擎能够清楚地推断出潜在的工程权衡。
文本数据分析:将原始结构化日志和故障模式详细信息传递回未来的提示上下文,使 LLM 能够从其生成错误中明确学习。