Réponse rapide
Un processus de décision markovien modélise un robot par états, actions, transitions probabilistes, récompenses et horizon ou facteur d’actualisation afin de choisir une politique dans un environnement incertain.
Décrire ce que le robot sait
Position, objets, énergie, objectif et qualité de perception forment un état utile. Les informations non observées exigent une représentation de croyance ou une politique prudente.
Modéliser l’effet d’une action
Une action mène à plusieurs états possibles selon dynamique et perturbations. Le modèle est estimé, simulé ou appris, puis comparé aux transitions réelles.
Choisir sous objectif
La politique associe état et action en optimisant récompense, coût ou risque. Les limites du robot et l’arrêt sûr restent des contraintes externes.
Sources et références
- [1] Robotics and Autonomous Systems — NIST