Que signifie l’hypothèse de Markov pour un robot ?
L’hypothèse de Markov signifie que l’état courant contient toute l’information nécessaire pour prédire les transitions et récompenses futures, sans devoir conserver tout l’historique.
Domaine de connaissance
Affiner le parcours
Choisissez une branche plus précise ou continuez avec toutes les réponses ci-dessous.
Questions du domaine
19 résultats
L’hypothèse de Markov signifie que l’état courant contient toute l’information nécessaire pour prédire les transitions et récompenses futures, sans devoir conserver tout l’historique.
Une récompense MDP relie chaque transition au résultat utile, au coût et au risque de la tâche. Elle doit décourager les raccourcis dangereux et rester cohérente avec les critères mesurés sur le robot.
Une politique MDP devient utilisable sur un robot réel après validation hors ligne et en simulation, bornage des actions, contrôleur de sécurité, surveillance des états et progression par essais à énergie limitée.
Une décision par règles applique des conditions et priorités explicites ; une décision par coût compare plusieurs actions selon objectifs, contraintes, risques et préférences pondérées.
L’incertitude se représente par probabilité, intervalle, covariance, confiance, ensemble de scénarios ou état inconnu, puis influence action, marge, coût et besoin d’information.
Séparer actions admissibles et préférences garantit qu’une action interdite par sécurité, légalité ou capacité ne devient pas acceptable simplement parce qu’elle semble efficace ou peu coûteuse.
La modélisation décisionnelle décrit comment un robot transforme observations, objectifs, contraintes, coûts et incertitudes en choix d’action ou de repli.
Une récompense retardée est attribuée longtemps après les actions qui ont préparé le résultat. On conserve alors l’historique, on découpe la tâche ou l’on ajoute des signaux intermédiaires prudents pour relier la réussite finale…
Si une politique reçoit une observation inconnue, le robot doit la signaler, réduire son engagement et choisir un comportement de repli validé plutôt que d’inventer une interprétation.
On teste une politique de comportement avec des situations nominales, des conflits de règles, des observations manquantes, des changements de contexte et des interruptions.
On définit les priorités d’une politique de comportement en classant sécurité, obligations, objectif et confort, puis en précisant les conditions de résolution des conflits.
Une politique réactive répond directement aux observations courantes, tandis qu’une politique délibérative construit ou consulte un plan avant d’agir.
Une question plus précise ?