Comment résoudre un processus de décision markovien ?

Réponse rapide

On résout un MDP par programmation dynamique, recherche, optimisation ou apprentissage afin d’obtenir une valeur ou une politique, puis on vérifie la solution sur des transitions et contraintes représentatives.

Choisir selon la taille

Itération de valeur et de politique conviennent aux espaces discrets connus. Simulation ou apprentissage sont utilisés lorsque états et actions sont grands ou continus.

Contrôler la convergence

Critères d’arrêt, horizon, actualisation et estimation de transition sont documentés. Une valeur convergée ne garantit pas un comportement réaliste si le modèle est faux.

Rejouer les scénarios

La politique est testée sur perturbations, états inconnus, retards et pannes. Coût, réussite, refus et repli sont comparés à une référence.

Sources et références

  1. [1] Robotics and Autonomous Systems — NIST

Cette réponse vous a-t-elle été utile ?