Pourquoi quantifier ou compresser un réseau neuronal embarqué ?

Réponse rapide

Quantifier ou compresser un réseau neuronal embarqué réduit mémoire, transferts et énergie, parfois au prix d’une perte de précision ou de robustesse. Le choix de précision, pruning, distillation ou format doit être évalué sur le matériel et les données de mission. Une réduction n’est acceptable que si erreur, latence et comportement de repli restent dans les limites.

Mesurer gain et dégradation ensemble

Taille, bande passante, temps d’inférence, puissance, température, précision, rappel et calibration sont comparés avant et après compression. Cas rares, perturbations et valeurs extrêmes sont inclus. Les conversions de précision et opérateurs sont vérifiés.

Déployer avec marge et contrôle

Le modèle compressé est testé en simulation, banc et robot sur la cadence réelle. Seuils, abstention et voie de secours sont ajustés sans masquer une perte critique. Version, outil de conversion et paramètres restent liés au résultat.

Ne pas sacrifier une classe critique pour gagner quelques millisecondes

Une moyenne stable peut cacher manqués sur personne, bordure ou obstacle. Le budget est optimisé avec les conséquences physiques. La compression est réversible et l’ancienne version reste disponible.

Sources et références

  1. [1] Artificial intelligence and robotics — NIST

Cette réponse vous a-t-elle été utile ?