Modèles locaux sur un seul GPU
« Tourne sur un GPU » peut signifier poids avec offload CPU, une requête courte, ou contexte utile à vitesse interactive : trois affirmations différentes.
poids Gio ≈ paramètres × bits ÷ 8 ÷ 2^30
Un 7B à 4 bits vaut environ 3,3 Gio bruts, un 24B 11,2 Gio. Ajouter métadonnées, tensors non quantifiés, allocateur, workspace et buffers.
KV bytes ≈ 2 × couches × largeur KV × séquence × bytes × batch
Le vrai calcul dépend de l'architecture. Réserver sortie et concurrence. Pour MoE, actifs décrivent le calcul par token ; les experts totaux restent stockés.
| VRAM | Premier essai | Compromis |
|---|---|---|
| 8 Go | 3–4B 4/5 bits ; certains 7B courts | capacité/contexte/offload |
| 12 Go | 7–8B ; essais 12–14B | marge contexte/vitesse |
| 16 Go | 12–14B ; chemin MXFP4 gpt-oss-20b | template/KV/runtime |
| 24 Go | 20–24B ; certains MoE 30B | contexte/concurrence |
L'offload étend le placement, pas la VRAM, et peut rendre une boucle trop lente.
Faits candidats
Qwen3-4B : 4B, 32K, réflexion optionnelle et avertissement contre le greedy en réflexion. Phi-4-mini : 3,8B/128K annoncé, capacité factuelle limitée et code surtout Python. gpt-oss-20b : 21B/3,6B actifs, MXFP4 annoncé dans 16 Go et Harmony requis. Mistral Small 3.1 24B : quantifié annoncé sur RTX 4090/Mac 32 Go, contre environ 55 Go en BF16. Ces faits ne classent pas la qualité.
Définir tâche, concurrence, contexte, sortie et latence ; calculer le poids ; vérifier support ; commencer court à concurrence 1 ; mesurer mémoire, offload, premier token, débit et acceptation ; augmenter le contexte séparément ; garder 10–20 % de marge.
Un petit modèle aux outils fiables peut battre un grand modèle offloadé. Les tiers favorisent NVIDIA consommateur ; Apple, AMD, NPU et serveurs diffèrent. Écouter sur loopback, vérifier licences/télémétrie, et ne pas confondre local avec privé ou sûr.