L’inférence locale pose une question de ressources et de service. Faire tenir les poids en mémoire ne garantit pas que contexte long, requêtes simultanées et latence cible soient compatibles.
Estimer d’abord le budget d’un appareil, puis choisir un moteur compatible. La quantification explique les changements numériques ; le cache KV explique la mémoire liée à la séquence. Le guide de performances suit chargement, préremplissage et génération.
Comment MHA, GQA, MLA, la quantification du cache et les méthodes de sélection de jetons arbitrent entre mémoire, complexité d’implémentation et risque sur la qualité.
Noter variante, précision, contexte, concurrence et matériel. Comparer qualité et performances à froid et à chaud avec le protocole d’évaluation ; modifier plusieurs réglages ensemble masque l’origine d’un gain.
Revenir aux parcours IA pour choisir un thème voisin.