Réponse rapide
Deux algorithmes de renforcement se comparent sur les mêmes environnements, budgets de calcul et critères de sécurité, avec plusieurs graines et des essais hors entraînement. Il faut mesurer robustesse et coût, pas seulement la récompense.
Rendre l’essai équitable
Scénarios, capteurs, durée, limite d’actions, puissance de calcul et données initiales sont fixés. Les graines et versions sont enregistrées pour reproduire les résultats.
Mesurer plusieurs dimensions
Récompense, réussite, variance, temps d’apprentissage, énergie, interventions et violations de contraintes sont comparés. Les intervalles et échecs rares sont visibles.
Vérifier le réel
La politique gagnante en simulation est testée sur perturbations et matériel réel avec limites renforcées. Un avantage moyen ne justifie pas le déploiement si le comportement est imprévisible.
Sources et références
- [1] Artificial intelligence and robotics — NIST