Domaine
Algorithmes de renforcement
Questions et réponses classées dans ce domaine de la robotique et de l’intelligence artificielle.
-
Comment concevoir une récompense qui n’encourage pas un comportement dangereux ?
Une récompense sûre combine objectif utile, coût d’énergie, erreur, effort, proximité d’obstacle et pénalités d’action dangereuse sans laisser un seul score être contourné.
-
Quelle différence entre apprentissage par renforcement hors ligne et en ligne pour un robot ?
Hors ligne, le renforcement apprend sur des données enregistrées sans agir ; en ligne, il explore le monde réel ou simulé et doit gérer risque, coût et dérive immédiats.
-
Comment vérifier la robustesse d’une politique de renforcement entraînée en simulation ?
Une politique entraînée en simulation se vérifie par variation de dynamique, capteurs, météo, retard, friction, charge, pannes et essais progressifs sur matériel réel.
-
Comment interrompre proprement un apprentissage par renforcement qui dérive ?
Un apprentissage qui dérive s’interrompt par gel de politique, arrêt des actions, sauvegarde de l’état, comparaison à une référence et retour contrôlé à une version validée.
-
Qu’est-ce qu’un algorithme de renforcement pour un robot ?
Un algorithme de renforcement apprend une politique en reliant les actions du robot aux états et récompenses observés. Il cherche une conduite utile tout en respectant les contraintes de sécurité et d’exploration.
-
Comment définir une récompense pour l’apprentissage d’un robot ?
Une récompense doit représenter l’objectif utile, pénaliser les conséquences indésirables et rester mesurable sans encourager de raccourci dangereux. Elle se teste sur des comportements complets, pas sur un seul score.
-
Comment surveiller une politique de renforcement après son déploiement ?
Après déploiement, une politique de renforcement se surveille par ses actions, états, récompenses, limites franchies, interventions et performances par scénario. Toute dérive doit pouvoir déclencher une limitation ou un retour en arrière.
-
Comment comparer deux algorithmes de renforcement pour un robot ?
Deux algorithmes de renforcement se comparent sur les mêmes environnements, budgets de calcul et critères de sécurité, avec plusieurs graines et des essais hors entraînement. Il faut mesurer robustesse et coût, pas seulement la récompense.
-
Pourquoi l’exploration est-elle risquée sur un robot réel ?
L’exploration est risquée sur un robot réel car l’agent peut essayer une action inconnue qui provoque collision, chute, dommage, usure, perte d’énergie ou situation irréversible avant d’avoir appris.