Preuves et biais dans les notes sur l'IA
Une note n'est pas neutre parce qu'elle contient des liens et un tableau. Elle doit dire quel type d'affirmation elle avance, jusqu'où va la preuve et ce qui reste un jugement.
Échelle des affirmations
| Type | Preuve minimale | Ce qu'elle ne prouve pas |
|---|---|---|
| fait de protocole/API | spécification versionnée ou documentation actuelle | implémentation complète, sûre ou réellement interopérable |
| capacité produit/modèle | carte/documentation plus test lié à la tâche | supériorité générale hors du test |
| résultat de benchmark | version, modèle, harness, date, configuration et résultat | transfert à un autre dépôt, langage, matériel ou risque |
| observation personnelle | run card reproductible et échecs conservés | performance générale |
| recommandation | critères, alternatives, coûts et seuil d'échec | meilleur choix universel |
| prévision | hypothèses, scénarios et incertitude | fait futur vérifié |
Les sources officielles font autorité sur une interface et le comportement déclaré. Elles sont intéressées lorsqu'elles parlent de qualité. Un benchmark indépendant réduit ce biais mais conserve ses biais de tâche, configuration et publication.
Registre des biais
Vérifier au moins : sélection des modèles/outils/langues/échecs ; reprise du positionnement fournisseur ; contamination et métrique du benchmark ; instantané transformé en classement durable ; hypothèses NVIDIA/Apple/mémoire/réseau ; généralisation anglais/Python ; confiance dans une réponse fluide ou « terminé » ; préférence personnelle pour terminal, IDE ou équipe.
Rendre ces biais visibles ne les supprime pas, mais permet de les tester.
Exemple : fiche d'affirmation
claim: gpt-oss-20b peut être un agent local pratique sur une machine de 16 Go
kind: recommendation
as_of: 2026-08-10
facts:
- le fournisseur annonce que MXFP4 tient dans 16 Go
assumptions:
- Harmony et la quantification exacte sont pris en charge
- contexte et KV cache tiennent dans le reste
missing_evidence:
- taux de résultats acceptés sur mes tâches
- latence et pic mémoire sur mon matériel
alternatives: [modèle dense plus petit, modèle plus grand sur 24 Go, service hébergé]
falsifier: échecs d'outils ou de patchs au-dessus du seuil déclaré
Le fait, l'inférence de déploiement et la préférence restent séparés.
Procédure
Extraire les affirmations avant de polir ; les classer comme fait, résultat rapporté, observation, inférence, préférence ou prévision ; adapter la preuve aux conséquences ; chercher un contre-exemple crédible ; séparer durable et daté ; conserver les échecs ; écrire ce qui changerait la conclusion et fixer review_after.
Cette méthode sert de lentille pour Systèmes IA et le Radar. Elle aide à mieux contredire et vérifier, sans promettre une objectivité sans point de vue.