Aller au contenu principal

Radar des modèles et API

Catalogues de modèles et conditions des API gratuites vérifiés le 12 septembre 2026. Je revérifierais la documentation et les limites du compte avant toute intégration.

Après avoir parcouru les documents de sept fournisseurs, le changement le plus visible n’est pas l’arrivée d’un nouveau « meilleur modèle ». Les gammes deviennent enfin lisibles : le modèle phare traite les cas difficiles, le milieu de gamme absorbe le travail courant et les petits modèles exécutent les tâches répétitives à moindre coût. Image, vidéo et voix temps réel passent aussi de plus en plus par des endpoints dédiés.

Je ne commence donc plus par « quel fournisseur est le meilleur ? ». Je demande d’abord si la tâche mérite un modèle phare, si un modèle intermédiaire suffit et si le contrôle supplémentaire des poids ouverts justifie d’exploiter moi-même la pile.

API hébergées : choisir la gamme avant le fournisseur

FournisseurGamme actuelleMa lecture
OpenAIGPT-6 Astra ; GPT-5.6 Sol / Terra / LunaOpenAI présente Astra comme son modèle phare pour les tâches de bout en bout les plus difficiles. Sol reste disponible ; Terra et Luna couvrent les charges moins coûteuses. Tous les quatre annoncent 1,05M de contexte, sans garantie de fiabilité sur de longs documents.
AnthropicClaude Fable 5.1 / Opus 5 / Sonnet 5 / Haiku 4.5Anthropic destine Fable 5.1 au raisonnement exigeant et aux tâches agentiques de longue durée, Opus 5 au codage agentique complexe, Sonnet 5 à l’équilibre vitesse/intelligence et Haiku 4.5 à la faible latence.
GoogleGemini 3.8 Flash (stable) / Gemini 3.1 Pro (preview), plus modèles Live, image et vidéoLa séparation par modalité est très nette. Pour la voix temps réel ou les médias natifs, je testerais l’endpoint spécialisé au lieu de tout confier au modèle texte phare.
xAIGrok 4.6, plus API Imagine et VoiceGrok 4.6 vise code et conversation. L’actualité exige les outils de recherche ; elle n’est pas magiquement contenue dans les paramètres.
DeepSeekV4.1 Flash / V4 Pro (0813)deepseek-flash sert V4.1 Flash, avec vision ; deepseek-v4-pro sert V4 Pro-0813, sans vision. Les deux prennent en charge les modes thinking/non-thinking, Responses API et les formats OpenAI/Anthropic.

Les anciens identifiants deepseek-v4-flash et deepseek-v4-flash-vision-exp restent acceptés, mais renvoient désormais vers V4.1 Flash à son tarif ; ils ne sélectionnent plus les modèles retirés.

En pratique, je commencerais par le milieu de gamme. Terra, Sonnet, Gemini Flash, Grok et DeepSeek V4.1 Flash / V4 Pro peuvent tous entrer dans le premier essai. Je ne testerais une gamme plus puissante, comme Astra, Sol, Fable 5.1 ou Opus, qu’après des échecs répétés justifiant son coût. Dans l’autre sens, extraction, classification et conversion de formats déjà fiables devraient progressivement descendre vers Luna, Haiku ou une autre option économique.

C’est moins cher que d’envoyer chaque problème au modèle phare, et moins frustrant que de courir après le token le moins cher dès le premier jour.

API gratuites : une liste courte, pas un classement éternel

Pour un prototype personnel, je garde désormais trois voies principales : Gemini pour le contexte long et le multimodal, Groq pour la faible latence, et OpenRouter pour essayer plusieurs modèles gratuits derrière une seule interface. Toutes permettent de commencer sans paiement, mais leurs unités, cycles de renouvellement et conditions sur les données diffèrent fortement.

ServiceEntrée actuelle sans paiementUsage que j’en feraisLimite à vérifier d’abord
Gemini Developer APINiveau Free actuel ; AI Studio est gratuit dans les régions prises en chargeDocuments longs, multimodal et prototypes de rechercheLes quotas varient selon le modèle ; le contenu du niveau gratuit peut servir à améliorer les produits Google, donc pas de données sensibles
GroqFree Plan avec limites RPM, RPD, TPM et TPD par organisation et modèleChat, voix et workers d’outils à faible latenceLa page publique résume les règles ; la page Limits du compte donne les valeurs exactes
OpenRouter :freeModèles gratuits de plusieurs fournisseurs derrière une API compatibleEssais rapides et repli simpleLes variantes gratuites ont des plafonds par minute et par jour ; le solde et la saturation des fournisseurs comptent aussi
MistralLe mode Free active l’API sans carte bancairePrototypes de modèles MistralLa documentation promet un usage limité et des limites de débit, pas un quota numérique stable
Cloudflare Workers AI10 000 Neurons gratuits par jour, remise à zéro à 00:00 UTCTâches edge déjà hébergées chez CloudflareUn Neuron n’est pas un token ; certains modèles de pointe exigent un forfait payant ou des crédits prépayés
Zhipu GLM-4.7-FlashRépertorié dans le catalogue officiel gratuit avec un endpoint chat-completions de style OpenAIAlternative chinoise pour le développement agentiqueLa page annonce 200K de contexte et 128K de sortie maximale, sans quota journalier ou mensuel fiable
Hugging Face Inference ProvidersLes comptes gratuits reçoivent 0,10 USD de crédits mensuels, montant susceptible de changer, pour les requêtes routées par Hugging FaceValidation d’un client et expériences minusculesLes clés fournisseur personnalisées n’utilisent pas ces crédits ; c’est un micro-essai récurrent, pas un service principal réaliste

La mise à jour la plus utile concerne deux sorties. Cerebras ne propose plus qu’un essai de 5 USD pendant 30 jours après vérification d’un moyen de paiement, sans niveau gratuit renouvelé automatiquement. GitHub Models a été entièrement arrêté le 30 juillet 2026. Même l’article comparatif publié par OpenRouter en juin était déjà périmé sur ces deux points en août.

Je ne construirais donc rien autour d’un seul endpoint gratuit. Un projet personnel peut commencer avec OpenRouter pour garder une interface commune, puis conserver des intégrations directes Gemini et Groq pour des tâches clairement attribuées. Cloudflare ou GLM ne s’ajoute que si son écosystème ou sa langue apporte un avantage réel. Chaque voie exige toujours la gestion des erreurs 429, de Retry-After, d’un budget journalier et du repli ; aucune ne devrait recevoir par défaut du code privé ou des données client.

Cette section traite des quotas d’inférence API, pas de l’usage inclus dans les agents en terminal. Ce second sujet est suivi dans Quotas gratuits des CLI de codage IA.

L’inférence locale est une décision séparée

Lorsque la confidentialité des données ou un volume stable justifie l’exploitation d’un service, passer à la pile IA locale. L’adéquation au matériel, les candidats de code, les runtimes et l’évaluation ont chacun leur propre page ; ce radar hébergé ne duplique pas leurs snapshots.

Les prix méritent un coup d’œil, pas une stratégie

Voici les tarifs catalogue vérifiés le 12 septembre 2026, en USD par million de tokens d’entrée/sortie pour le texte standard, et non des coûts par tâche ou des droits d’accès du compte. Cache, batch, raisonnement, contexte long et contrats peuvent modifier fortement la facture réelle.

FournisseurGammes actuelles (entrée / sortie)
OpenAIAstra 10 / 50 ; Sol 4 / 20 ; Terra 2 / 12 ; Luna 0,20 / 1,20
AnthropicFable 5.1 : 10 / 50 ; Opus 5 : 5 / 25 ; Sonnet 5 : 2 / 10 ; Haiku 4.5 : 1 / 5
xAIGrok 4.6 : 2 / 6
DeepSeektarification par heures pleines/creuses et cache hit/miss ; un prix unique serait trompeur

Je ne changerais pas de modèle sur ce seul tableau. Un appel deux fois moins cher coûte davantage s’il faut le relancer, corriger sa sortie ou réparer ses appels d’outils. Le nombre utile est le coût d’une vraie tâche terminée, pas le prix affiché d’un token.

Si je lançais un projet aujourd’hui

Je procéderais ainsi :

  1. exécuter cinq tâches réelles avec le modèle intermédiaire qui s’intègre le mieux au workflow existant ;
  2. conserver les échecs et distinguer problème de modèle, d’outil ou de prompt ;
  3. réserver le modèle phare aux tâches qui résistent ;
  4. essayer des modèles moins chers sur le travail devenu répétitif et prévisible ;
  5. passer à la pile IA locale lorsque les données doivent rester locales ou que la charge justifie l’exploitation d’un service.

Les documents fournisseur suffisent à raccourcir la liste, mais ne constituent pas un benchmark commun. Je ne vais pas élire un vainqueur général à partir de pages produit. L’étape utile est de rejouer le même travail sur mes propres dépôts et documents, avec des critères d’échec qui comptent pour moi. Ce n’est qu’ensuite qu’un modèle par défaut devient vraiment personnel.

Explorer les liensOuvrir le réseau