Platform evaluasi AlphaEvolve harus memproses update kode kandidat secara sistematis melalui pipeline eksekusi deterministik. Daripada mengeksekusi dan menilai solusi sekaligus, harness membagi pipeline menjadi tiga gerbang pengujian progresif:
Gerbang evaluasi
Diagram berikut memetakan alur program kandidat melalui tiga tingkat pengujian yang berbeda sebelum menampilkan metadata terstruktur ke AlphaEvolve.

Validasi solusi
Loop evaluasi dimulai dengan menerapkan batasan struktural yang ketat tanpa menjalankan logika inti kode. Harness memeriksa solusi kandidat untuk kebenaran sintaksis waktu kompilasi dasar, bug parsing, dan pelanggaran keamanan struktural.
Jalur keberhasilan: Jika program lulus semua pemeriksaan validasi, kode akan berlanjut dengan aman ke loop runtime verifikasi solusi.
Jalur kegagalan (Short-circuit): Jika ada pengujian validasi yang gagal, harness akan segera menghentikan eksekusi. Hal ini sepenuhnya melewati tingkat pengujian performa dan verifikasi yang berat untuk melindungi infrastruktur sistem. Loop langsung turun ke produksi masukan, yang menegaskan penalti penelusuran datar besar (seperti
-1e12) bersama dengan skor performa bernilai nol.
Verifikasi solusi
Setelah program kandidat divalidasi sebagai program yang secara sintaksis baik dan aman untuk dieksekusi, harness akan meluncurkannya dalam lingkungan yang terisolasi untuk menerapkan batasan fungsional ringan. Fase ini menjalankan pemeriksaan kebenaran fungsional dan unit standar Anda.
Daripada menghasilkan sinyal biner lulus atau gagal, harness mengevaluasi program berdasarkan jumlah atau persentase yang tepat dari pengujian fungsional yang lulus. Hal ini dihitung dalam skor penalti keseluruhan, yang memberikan gradien penelusuran numerik padat kepada AlphaEvolve untuk memperbaiki struktur logika yang rusak secara bertahap selama generasi berturut-turut.
Evaluasi solusi
Jika terbukti aman secara sintaksis dan benar secara algoritma, program kandidat akan mencapai lapisan tolok ukur performa.
Harness menjalankan pengujian empiris, perhitungan logika produk langsung, atau simulasi analitis untuk mengukur metrik pengoptimalan bisnis target Anda (seperti kecepatan eksekusi algoritma, jejak memori infrastruktur cloud, atau batas kalibrasi output).
Masukan evaluasi komprehensif
Di akhir pipeline eksekusi, harness menggabungkan data dari semua fase yang telah selesai ke dalam payload masukan terstruktur. Payload ini ditampilkan langsung ke AlphaEvolve untuk memandu pilihan orang tua untuk mutasi berikutnya.
Output masukan standar terdiri dari tiga komponen utama berikut:
Skor pendakian bukit keseluruhan: Nilai skalar gabungan tunggal yang dihitung secara deterministik oleh harness yang dimaksimalkan AlphaEvolve secara langsung selama pengoptimalan.
Skor dan penalti pengoptimalan terperinci: Submetrik individual, waktu eksekusi, dan perincian penalti batasan ringan. Distribusi data eksplisit ini memungkinkan mesin untuk memahami dengan jelas kompromi teknik yang mendasarinya.
Insight tekstual: Log struktural mentah dan detail mode kegagalan dikirim kembali ke konteks perintah mendatang, sehingga LLM dapat belajar secara eksplisit dari kesalahan generasinya.