Aller au contenu principal

Preuves et biais dans les notes sur l'IA

Une note n'est pas neutre parce qu'elle contient des liens et un tableau. Elle doit dire quel type d'affirmation elle avance, jusqu'où va la preuve et ce qui reste un jugement.

Échelle des affirmations

TypePreuve minimaleCe qu'elle ne prouve pas
fait de protocole/APIspécification versionnée ou documentation actuelleimplémentation complète, sûre ou réellement interopérable
capacité produit/modèlecarte/documentation plus test lié à la tâchesupériorité générale hors du test
résultat de benchmarkversion, modèle, harness, date, configuration et résultattransfert à un autre dépôt, langage, matériel ou risque
observation personnellerun card reproductible et échecs conservésperformance générale
recommandationcritères, alternatives, coûts et seuil d'échecmeilleur choix universel
prévisionhypothèses, scénarios et incertitudefait futur vérifié

Les sources officielles font autorité sur une interface et le comportement déclaré. Elles sont intéressées lorsqu'elles parlent de qualité. Un benchmark indépendant réduit ce biais mais conserve ses biais de tâche, configuration et publication.

Registre des biais

Vérifier au moins : sélection des modèles/outils/langues/échecs ; reprise du positionnement fournisseur ; contamination et métrique du benchmark ; instantané transformé en classement durable ; hypothèses NVIDIA/Apple/mémoire/réseau ; généralisation anglais/Python ; confiance dans une réponse fluide ou « terminé » ; préférence personnelle pour terminal, IDE ou équipe.

Rendre ces biais visibles ne les supprime pas, mais permet de les tester.

Exemple : fiche d'affirmation

claim: gpt-oss-20b peut être un agent local pratique sur une machine de 16 Go
kind: recommendation
as_of: 2026-08-10
facts:
- le fournisseur annonce que MXFP4 tient dans 16 Go
assumptions:
- Harmony et la quantification exacte sont pris en charge
- contexte et KV cache tiennent dans le reste
missing_evidence:
- taux de résultats acceptés sur mes tâches
- latence et pic mémoire sur mon matériel
alternatives: [modèle dense plus petit, modèle plus grand sur 24 Go, service hébergé]
falsifier: échecs d'outils ou de patchs au-dessus du seuil déclaré

Le fait, l'inférence de déploiement et la préférence restent séparés.

Procédure

Extraire les affirmations avant de polir ; les classer comme fait, résultat rapporté, observation, inférence, préférence ou prévision ; adapter la preuve aux conséquences ; chercher un contre-exemple crédible ; séparer durable et daté ; conserver les échecs ; écrire ce qui changerait la conclusion et fixer review_after.

Cette méthode sert de lentille pour Systèmes IA et le Radar. Elle aide à mieux contredire et vérifier, sans promettre une objectivité sans point de vue.