Comment concevoir une récompense qui reflète vraiment une tâche robotique ?

Réponse rapide

Une récompense fidèle à une tâche robotique relie succès mesurable, contraintes, qualité et coût d’échec au comportement souhaité, puis est testée contre des stratégies indésirables.

Une récompense incomplète crée un raccourci

Un gain local peut sacrifier qualité, énergie ou sécurité. Testez stratégies alternatives et cas limites avant apprentissage.

Écrire le résultat attendu

Décrivez état final, tolérances, personnes, ressources, réversibilité et conditions qui comptent réellement pour l’usage.

Pondérer avec prudence

Valeurs, unités, horizon et fréquence évitent qu’un petit gain local domine sécurité, qualité ou mission complète.

Chercher les contournements

Comparez comportements, cas limites, scénarios cachés, simulation et référence et corrigez la mesure avant l’apprentissage.

Sources et références

  1. [1] Robotics and Autonomous Systems — NIST

Cette réponse vous a-t-elle été utile ?