Bonnes pratiques concernant les tests

Pour commencer rapidement à utiliser la plate-forme, suivez un workflow structuré en cinq étapes :

  1. Effectuez l'initialisation de l'environnement : utilisez la page Premiers pas pour remplir tous les prérequis et initialiser votre environnement.

  2. Effectuez une validation de base : accédez à la section Codelabs et exécutez le codelab Circle Packing au minimum. Cette étape permet de s'assurer que vos couches de transport, votre syntaxe de bloc et votre validation d'exécution locale s'exécutent correctement sans erreur avant de passer à des cibles spécifiques au domaine.

  3. Exécutez la conception de votre test : choisissez entre un chemin d'intégration agentique ou manuel :

    • Intégration agentique : si vous utilisez des outils de codage agentiques, exécutez le pipeline de compétences intégré pour parcourir votre configuration et concevoir votre test de manière programmatique.

    • Intégration manuelle : si vous n'utilisez pas d'outils agentiques, consultez les codelabs et créez manuellement votre test en effectuant les actions suivantes :

      • Préparez la référence du code de départ : créez le code de référence initial en suivant les consignes du programme et en plaçant des marqueurs de commentaires explicites EVOLVE-BLOCK autour des segments de logique ou des sous-routines spécifiques ciblés pour la refactorisation à l'aide de la stratégie de placement.

      • Créez la fonction de harnais de l'évaluateur : écrivez une boucle d'exécution côté client ou côté serveur pour recevoir les blocs de code mutés d'AlphaEvolve, exécutez-les de manière sécurisée et calculez les métriques commerciales. L'évaluateur doit renvoyer un dictionnaire structuré d'une ou plusieurs métriques pour fournir une direction de gradient de recherche explicite à AlphaEvolve. Utilisez les consignes de base listées sur la page de conception de l'évaluateur.

      • Documentez la définition du problème : définissez un énoncé précis du problème dans votre configuration, en spécifiant les détails d'arrière-plan, les règles de contexte de domaine pertinentes et les contraintes strictes du système opérationnel. Utilisez les consignes de la page Consignes de configuration du contexte et de l'invite.

      • Choisissez la configuration de votre test : spécifiez la configuration des hyperparamètres d'exécution, y compris les combinaisons de LLM ciblées, les limites maximales de génération de programmes et les seuils de simultanéité d'exécution optimaux. Utilisez les consignes de la page Données et simultanéité.

  4. Surveillez l'exécution et passez à la production.

    Lancez le test d'optimisation et suivez les scores de fitness en temps réel sur plusieurs générations successives. Les budgets d'évaluation recommandés commencent à environ 100 programmes et peuvent atteindre des milliers pour les problèmes difficiles. Si vos métriques d'évaluation ne montrent pas de trajectoire claire après environ 1 550 évaluations de programmes candidats, mettez en pause la boucle d'exécution pour affiner le contexte de définition de votre problème ou ajuster les contraintes de pénalité souples.

  5. Intégration en production

    Une fois la convergence de la recherche réussie, récupérez le programme candidat optimal (ou la n-ième meilleure variante en fonction des compromis opérationnels multi-métriques) dans les tables d'historique et implémentez-le directement dans l'architecture de votre système.

À mesure que la complexité de l'optimisation, les piles de dépendances et les exigences de mise à l'échelle augmentent, passez de votre espace de processus local à la configuration de l'infrastructure basée sur le kit d'outils de cluster pour répondre aux besoins informatiques avancés à l'échelle de l'entreprise.