Architecture logique d'un harnais d'évaluation pour AlphaEvolve

Un harnais d'évaluation AlphaEvolve doit traiter les mises à jour du code candidat de manière systématique via un pipeline d'exécution déterministe. Au lieu d'exécuter et de noter une solution en une seule fois, le harnais divise le pipeline en trois étapes de test progressives :

  1. Validation de la solution

  2. Validation de la solution

  3. Évaluation de la solution

Jalons d'évaluation

Le diagramme suivant montre comment les programmes candidats passent par les trois niveaux de test distincts avant de renvoyer des métadonnées structurées à AlphaEvolve.

Flux logique dans le harnais d'évaluation

Validation de la solution

La boucle d'évaluation commence par appliquer des contraintes structurelles strictes sans exécuter la logique principale du code. Le harnais vérifie la syntaxe de compilation de base, les bugs d'analyse et les violations de sécurité structurelle de la solution candidate.

  • Parcours de réussite : si le programme réussit tous les contrôles de validation, le code progresse de manière sécurisée jusqu'à la boucle d'exécution de la validation de la solution.

  • Chemin d'échec (court-circuit) : si un test de validation échoue, le harnais interrompt immédiatement l'exécution. Il contourne complètement les niveaux de validation et de test des performances gourmands en ressources pour protéger l'infrastructure système. La boucle passe directement à la production de commentaires, en appliquant une pénalité de recherche forfaitaire massive (telle que -1e12) en plus des scores de performances nuls.

Validation de la solution

Une fois qu'un programme candidat est validé comme étant syntaxiquement correct et sûr à exécuter, le harnais le lance dans un environnement isolé pour appliquer des contraintes fonctionnelles souples. Cette phase exécute vos vérifications standard de correction fonctionnelle et unitaire.

Au lieu de générer un signal binaire de réussite ou d'échec, le harnais évalue le programme en fonction du nombre exact ou du pourcentage de tests fonctionnels réussis. Cette valeur est prise en compte dans le score de pénalité global, ce qui fournit à AlphaEvolve un gradient de recherche numérique dense pour corriger progressivement les structures logiques défaillantes au fil des générations successives.

Évaluation des solutions

Lorsqu'un programme candidat s'avère à la fois syntaxiquement sûr et algorithmiquement correct, il atteint la couche de benchmarking des performances.

Le harnais exécute des tests empiriques, des calculs directs de la logique produit ou des simulations analytiques pour quantifier vos métriques d'optimisation métier cibles (telles que la vitesse d'exécution algorithmique, l'espace mémoire utilisé de l'infrastructure cloud ou les limites de calibration de la sortie).

Commentaires sur l'évaluation exhaustive

À la fin du pipeline d'exécution, le harnais agrège les données de toutes les phases terminées dans une charge utile de commentaires structurée. Cette charge utile est renvoyée directement à AlphaEvolve pour guider la sélection des parents pour les mutations ultérieures.

Le résultat standardisé des commentaires se compose des trois principaux éléments suivants :

  1. Score global d'escalade : valeur scalaire unique et combinée, calculée de manière déterministe par le harnais qu'AlphaEvolve maximise directement lors de l'optimisation.

  2. Scores et pénalités d'optimisation précis : sous-métriques individuelles, temps d'exécution et répartition des pénalités liées aux contraintes souples. Cette distribution explicite des données permet au moteur de raisonner clairement sur les compromis d'ingénierie sous-jacents.

  3. Insights textuels : les journaux structurels bruts et les détails du mode d'échec sont renvoyés dans les futurs contextes de requête, ce qui permet au LLM d'apprendre explicitement de ses erreurs de génération.