Une récompense retardée est attribuée longtemps après les actions qui ont préparé le résultat. On conserve alors l’historique, on découpe la tâche ou l’on ajoute des signaux intermédiaires prudents pour relier la réussite finale…
Le triplet état-action-récompense décrit ce qu’un agent observe, ce qu’il fait et le signal qui indique si cette action rapproche ou éloigne l’objectif.
L’objectif décrit ce que le robot doit accomplir ; la récompense est le signal numérique utilisé pendant l’apprentissage pour favoriser progressivement les actions qui y mènent.
Tester un agent état-action-récompense avant un robot réel demande de vérifier observations, actions autorisées, fonction de récompense, limites, comportements rares et arrêt sûr.