Modèles locaux pour agents de code
Vérifiés depuis les cartes le 2026-08-10. Poids, quantification, runtime, template, contexte et harness forment le système testé ; aucun « meilleur local universel » n'est affirmé.
| Candidat | Forme publiée | Rôle plausible à tester | Risque non résolu |
|---|---|---|---|
| Qwen3-4B | dense 4B, 32K, réflexion optionnelle | recherche, classification, petite édition | capacité, répétition, appels structurés |
| R1-Distill-Qwen-7B | dense 7B de raisonnement | diagnostic et algorithmes | sorties longues, prompting, outils |
| gpt-oss-20b | MoE 21B/3,6B actifs, MXFP4 | expérience agent local classe 16 Go | Harmony, KV restant, qualité tâche |
| Qwen3-Coder-30B-A3B | MoE 30,5B/3,3B actifs, 256K, non-thinking | implémentation quantifiée classe 24 Go | tous les poids, contexte, exactitude des edits |
Le rôle est une hypothèse. Les paramètres actifs décrivent le calcul, pas la taille totale des poids.
Choisir et router
Mesurer validité des patchs/outils, langues du dépôt, acceptation répétée, latence/mémoire/offload/contexte, licence de l'artefact, formats du runtime, multilingue et sûreté. Un score ne compense pas un appel illisible par le harness.
Petit modèle pour tri, requêtes, réduction de logs et édition mécanique vérifiée ; plus grand pour implémentation bornée ; tests indépendants ; escalade humaine/fort modèle pour architecture, sécurité, API inconnue ou échec répété. Conserver preuve et incertitude entre modèles.
Le rejeu minimal couvre JSON avec distracteur, défaut inconnu, changement multifichier, preuves insuffisantes, écriture hors portée et répétition. Garder run card, échecs, mémoire et temps humain.
Biais
La sélection favorise cartes accessibles, runtimes grand public, terminal et NVIDIA consommateur. De nombreux modèles généraux, linguistiques, multimodaux et affinés sont absents. Absence n'est pas infériorité ; l'adoption exige le même rejeu que le baseline hébergé.