Radar des modèles et API
Catalogues de modèles et conditions des API gratuites vérifiés le 12 septembre 2026. Je revérifierais la documentation et les limites du compte avant toute intégration.
Après avoir parcouru les documents de sept fournisseurs, le changement le plus visible n’est pas l’arrivée d’un nouveau « meilleur modèle ». Les gammes deviennent enfin lisibles : le modèle phare traite les cas difficiles, le milieu de gamme absorbe le travail courant et les petits modèles exécutent les tâches répétitives à moindre coût. Image, vidéo et voix temps réel passent aussi de plus en plus par des endpoints dédiés.
Je ne commence donc plus par « quel fournisseur est le meilleur ? ». Je demande d’abord si la tâche mérite un modèle phare, si un modèle intermédiaire suffit et si le contrôle supplémentaire des poids ouverts justifie d’exploiter moi-même la pile.
API hébergées : choisir la gamme avant le fournisseur
Les anciens identifiants deepseek-v4-flash et deepseek-v4-flash-vision-exp restent acceptés, mais renvoient désormais vers V4.1 Flash à son tarif ; ils ne sélectionnent plus les modèles retirés.
En pratique, je commencerais par le milieu de gamme. Terra, Sonnet, Gemini Flash, Grok et DeepSeek V4.1 Flash / V4 Pro peuvent tous entrer dans le premier essai. Je ne testerais une gamme plus puissante, comme Astra, Sol, Fable 5.1 ou Opus, qu’après des échecs répétés justifiant son coût. Dans l’autre sens, extraction, classification et conversion de formats déjà fiables devraient progressivement descendre vers Luna, Haiku ou une autre option économique.
C’est moins cher que d’envoyer chaque problème au modèle phare, et moins frustrant que de courir après le token le moins cher dès le premier jour.
API gratuites : une liste courte, pas un classement éternel
Pour un prototype personnel, je garde désormais trois voies principales : Gemini pour le contexte long et le multimodal, Groq pour la faible latence, et OpenRouter pour essayer plusieurs modèles gratuits derrière une seule interface. Toutes permettent de commencer sans paiement, mais leurs unités, cycles de renouvellement et conditions sur les données diffèrent fortement.
La mise à jour la plus utile concerne deux sorties. Cerebras ne propose plus qu’un essai de 5 USD pendant 30 jours après vérification d’un moyen de paiement, sans niveau gratuit renouvelé automatiquement. GitHub Models a été entièrement arrêté le 30 juillet 2026. Même l’article comparatif publié par OpenRouter en juin était déjà périmé sur ces deux points en août.
Je ne construirais donc rien autour d’un seul endpoint gratuit. Un projet personnel peut commencer avec OpenRouter pour garder une interface commune, puis conserver des intégrations directes Gemini et Groq pour des tâches clairement attribuées. Cloudflare ou GLM ne s’ajoute que si son écosystème ou sa langue apporte un avantage réel. Chaque voie exige toujours la gestion des erreurs 429, de Retry-After, d’un budget journalier et du repli ; aucune ne devrait recevoir par défaut du code privé ou des données client.
Cette section traite des quotas d’inférence API, pas de l’usage inclus dans les agents en terminal. Ce second sujet est suivi dans Quotas gratuits des CLI de codage IA.
L’inférence locale est une décision séparée
Lorsque la confidentialité des données ou un volume stable justifie l’exploitation d’un service, passer à la pile IA locale. L’adéquation au matériel, les candidats de code, les runtimes et l’évaluation ont chacun leur propre page ; ce radar hébergé ne duplique pas leurs snapshots.
Les prix méritent un coup d’œil, pas une stratégie
Voici les tarifs catalogue vérifiés le 12 septembre 2026, en USD par million de tokens d’entrée/sortie pour le texte standard, et non des coûts par tâche ou des droits d’accès du compte. Cache, batch, raisonnement, contexte long et contrats peuvent modifier fortement la facture réelle.
Je ne changerais pas de modèle sur ce seul tableau. Un appel deux fois moins cher coûte davantage s’il faut le relancer, corriger sa sortie ou réparer ses appels d’outils. Le nombre utile est le coût d’une vraie tâche terminée, pas le prix affiché d’un token.
Si je lançais un projet aujourd’hui
Je procéderais ainsi :
- exécuter cinq tâches réelles avec le modèle intermédiaire qui s’intègre le mieux au workflow existant ;
- conserver les échecs et distinguer problème de modèle, d’outil ou de prompt ;
- réserver le modèle phare aux tâches qui résistent ;
- essayer des modèles moins chers sur le travail devenu répétitif et prévisible ;
- passer à la pile IA locale lorsque les données doivent rester locales ou que la charge justifie l’exploitation d’un service.
Les documents fournisseur suffisent à raccourcir la liste, mais ne constituent pas un benchmark commun. Je ne vais pas élire un vainqueur général à partir de pages produit. L’étape utile est de rejouer le même travail sur mes propres dépôts et documents, avec des critères d’échec qui comptent pour moi. Ce n’est qu’ensuite qu’un modèle par défaut devient vraiment personnel.