Comment comparer deux algorithmes de renforcement pour un robot ?

Réponse rapide

Deux algorithmes de renforcement se comparent sur les mêmes environnements, budgets de calcul et critères de sécurité, avec plusieurs graines et des essais hors entraînement. Il faut mesurer robustesse et coût, pas seulement la récompense.

Rendre l’essai équitable

Scénarios, capteurs, durée, limite d’actions, puissance de calcul et données initiales sont fixés. Les graines et versions sont enregistrées pour reproduire les résultats.

Mesurer plusieurs dimensions

Récompense, réussite, variance, temps d’apprentissage, énergie, interventions et violations de contraintes sont comparés. Les intervalles et échecs rares sont visibles.

Vérifier le réel

La politique gagnante en simulation est testée sur perturbations et matériel réel avec limites renforcées. Un avantage moyen ne justifie pas le déploiement si le comportement est imprévisible.

Sources et références

  1. [1] Artificial intelligence and robotics — NIST

Cette réponse vous a-t-elle été utile ?