Aller au contenu principal

Modèles locaux pour agents de code

Candidats

Vérifiés depuis les cartes le 2026-08-10. Poids, quantification, runtime, template, contexte et harness forment le système testé ; aucun « meilleur local universel » n'est affirmé.

CandidatForme publiéeRôle plausible à testerRisque non résolu
Qwen3-4Bdense 4B, 32K, réflexion optionnellerecherche, classification, petite éditioncapacité, répétition, appels structurés
R1-Distill-Qwen-7Bdense 7B de raisonnementdiagnostic et algorithmessorties longues, prompting, outils
gpt-oss-20bMoE 21B/3,6B actifs, MXFP4expérience agent local classe 16 GoHarmony, KV restant, qualité tâche
Qwen3-Coder-30B-A3BMoE 30,5B/3,3B actifs, 256K, non-thinkingimplémentation quantifiée classe 24 Gotous les poids, contexte, exactitude des edits

Le rôle est une hypothèse. Les paramètres actifs décrivent le calcul, pas la taille totale des poids.

Choisir et router

Mesurer validité des patchs/outils, langues du dépôt, acceptation répétée, latence/mémoire/offload/contexte, licence de l'artefact, formats du runtime, multilingue et sûreté. Un score ne compense pas un appel illisible par le harness.

Petit modèle pour tri, requêtes, réduction de logs et édition mécanique vérifiée ; plus grand pour implémentation bornée ; tests indépendants ; escalade humaine/fort modèle pour architecture, sécurité, API inconnue ou échec répété. Conserver preuve et incertitude entre modèles.

Le rejeu minimal couvre JSON avec distracteur, défaut inconnu, changement multifichier, preuves insuffisantes, écriture hors portée et répétition. Garder run card, échecs, mémoire et temps humain.

Biais

La sélection favorise cartes accessibles, runtimes grand public, terminal et NVIDIA consommateur. De nombreux modèles généraux, linguistiques, multimodaux et affinés sont absents. Absence n'est pas infériorité ; l'adoption exige le même rejeu que le baseline hébergé.