Aller au contenu principal

Déploiement local et inférence

L’inférence locale pose une question de ressources et de service. Faire tenir les poids en mémoire ne garantit pas que contexte long, requêtes simultanées et latence cible soient compatibles.

Estimer d’abord le budget d’un appareil, puis choisir un moteur compatible. La quantification explique les changements numériques ; le cache KV explique la mémoire liée à la séquence. Le guide de performances suit chargement, préremplissage et génération.

Ordre de lecture

ÉtapeArticleQuestion traitée
1Déployer sur un appareil : poids, mémoire et contexteUne méthode centrée sur la mémoire pour décider quelle configuration de modèle local peut tenir et rester utile sur un GPU grand public.
2Runtimes d’inférence localeChoisir un runtime local selon la compatibilité des artefacts, le chemin matériel, la latence, le débit, l’observabilité et la sécurité.
3Quantification des modèles : précision numérique, taille et vitesseComprendre l’approximation à faible précision, distinguer poids, activations et cache KV, puis estimer le coût réel du déploiement.
4Variantes de l’attention et compression du cache KVComment MHA, GQA, MLA, la quantification du cache et les méthodes de sélection de jetons arbitrent entre mémoire, complexité d’implémentation et risque sur la qualité.
5Performance d’inférence : chargement, premier token, décodage et débitDécomposer les requêtes en étapes mesurables et relier concurrence, cache et traitement par lots au temps d’attente.

Mettre la lecture en pratique

Noter variante, précision, contexte, concurrence et matériel. Comparer qualité et performances à froid et à chaud avec le protocole d’évaluation ; modifier plusieurs réglages ensemble masque l’origine d’un gain.

Revenir aux parcours IA pour choisir un thème voisin.

Explorer les liensOuvrir le réseau