AlphaEvolve 評価ハーネスは、決定論的実行パイプラインを通じて候補コードの更新を体系的に処理する必要があります。ハーネスは、ソリューションを一度に実行して評価するのではなく、パイプラインを 3 つのプログレッシブ テストゲートに分割します。
評価ゲート
次の図は、候補プログラムが 3 つの異なるテスト階層を通過して、構造化されたメタデータを AlphaEvolve に返す流れを示しています。

ソリューション検証
評価ループは、コードのコアロジックを実行せずに、厳格な構造制約を適用することから始まります。ハーネスは、候補ソリューションのコンパイル時の基本的な構文の正しさ、解析バグ、構造的なセキュリティ違反をチェックします。
成功パス: プログラムがすべての検証チェックに合格すると、コードはソリューション検証ランタイム ループに安全に進みます。
失敗パス(短絡): 検証テストが失敗すると、ハーネスはすぐに実行を中断します。リソースを大量に消費する検証とパフォーマンス テストの階層を完全にバイパスして、システム インフラストラクチャを保護します。ループはフィードバック生成に直接移行し、ゼロ値のパフォーマンス スコアとともに、大規模なフラット検索ペナルティ(
-1e12など)をアサートします。
ソリューションの確認
候補プログラムが構文的に正しく、実行しても安全であることが検証されると、ハーネスは隔離された環境内で候補プログラムを起動し、ソフトな機能制約を適用します。このフェーズでは、標準の単体テストと機能の正しさのチェックが実行されます。
ハーネスは、合格または不合格のバイナリ信号を出力する代わりに、合格した機能テストの正確な数または割合に基づいてプログラムを評価します。これは全体的なペナルティ スコアに加算され、AlphaEvolve に密度の高い数値検索グラデーションを提供して、世代を重ねるごとに壊れたロジック構造を段階的に修正します。
ソリューション評価
候補プログラムが構文的に安全で、アルゴリズム的に正しいことが証明されると、パフォーマンス ベンチマーク レイヤに到達します。
ハーネスは、経験的テスト、直接的なプロダクト ロジックの計算、分析シミュレーションを実行して、目標とするビジネス最適化指標(アルゴリズムの実行速度、クラウド インフラストラクチャのメモリ フットプリント、出力キャリブレーションの境界など)を定量化します。
総合的な評価のフィードバック
実行パイプラインの最後に、ハーネスは完了したすべてのフェーズのデータを集計して、構造化されたフィードバック ペイロードにします。このペイロードは AlphaEvolve に直接返され、後続の突然変異の親選択をガイドします。
標準化されたフィードバック出力は、次の 3 つの主要なコンポーネントで構成されます。
全体的なヒルクライミング スコア: AlphaEvolve が最適化中に直接最大化するハーネスによって決定論的に計算される単一の結合スカラー値。
詳細な最適化スコアとペナルティ: 個々のサブ指標、実行時間、ソフト制約ペナルティの内訳。この明示的なデータ分布により、エンジンは基盤となるエンジニアリングのトレードオフについて明確に推論できます。
テキストによる分析情報: 未加工の構造ログと障害モードの詳細が今後のプロンプト コンテキストに渡され、LLM が生成エラーから明示的に学習できるようになります。