Réponse rapide
Le coût embarqué se réduit par modèle adapté, résolution et fréquence choisies, quantification, compilation, partage de calcul, cache et traitement local ciblé, sans perdre les critères critiques.
Mesurer
Profiliez mémoire, transferts, latence, énergie, température et précision par entrée et pire cas sur le matériel cible. Un modèle plus petit peut dégrader rareté ou calibration.
Optimiser
Comparez quantification, distillation, pruning, accélérateur, fenêtre et pipeline, avec validation après chaque changement. Ne supprimez pas surveillance ou repli pour gagner quelques millisecondes.
Déployer
Figez poids, prétraitement, runtime et seuils, puis pilotez et gardez version précédente. Une surcharge ou sortie hors domaine réduit fonction ou arrête.
Sources et références
- [1] AI RMF Core — NIST AI Resource Center