Aller au contenu principal

Modèles locaux sur un seul GPU

« Tourne sur un GPU » peut signifier poids avec offload CPU, une requête courte, ou contexte utile à vitesse interactive : trois affirmations différentes.

poids Gio ≈ paramètres × bits ÷ 8 ÷ 2^30

Un 7B à 4 bits vaut environ 3,3 Gio bruts, un 24B 11,2 Gio. Ajouter métadonnées, tensors non quantifiés, allocateur, workspace et buffers.

KV bytes ≈ 2 × couches × largeur KV × séquence × bytes × batch

Le vrai calcul dépend de l'architecture. Réserver sortie et concurrence. Pour MoE, actifs décrivent le calcul par token ; les experts totaux restent stockés.

VRAMPremier essaiCompromis
8 Go3–4B 4/5 bits ; certains 7B courtscapacité/contexte/offload
12 Go7–8B ; essais 12–14Bmarge contexte/vitesse
16 Go12–14B ; chemin MXFP4 gpt-oss-20btemplate/KV/runtime
24 Go20–24B ; certains MoE 30Bcontexte/concurrence

L'offload étend le placement, pas la VRAM, et peut rendre une boucle trop lente.

Faits candidats

Qwen3-4B : 4B, 32K, réflexion optionnelle et avertissement contre le greedy en réflexion. Phi-4-mini : 3,8B/128K annoncé, capacité factuelle limitée et code surtout Python. gpt-oss-20b : 21B/3,6B actifs, MXFP4 annoncé dans 16 Go et Harmony requis. Mistral Small 3.1 24B : quantifié annoncé sur RTX 4090/Mac 32 Go, contre environ 55 Go en BF16. Ces faits ne classent pas la qualité.

Définir tâche, concurrence, contexte, sortie et latence ; calculer le poids ; vérifier support ; commencer court à concurrence 1 ; mesurer mémoire, offload, premier token, débit et acceptation ; augmenter le contexte séparément ; garder 10–20 % de marge.

Un petit modèle aux outils fiables peut battre un grand modèle offloadé. Les tiers favorisent NVIDIA consommateur ; Apple, AMD, NPU et serveurs diffèrent. Écouter sur loopback, vérifier licences/télémétrie, et ne pas confondre local avec privé ou sûr.