Mise à jour bayésienne : de l'a priori à l'a posteriori
La mise à jour bayésienne permet de réviser un jugement incertain à mesure que de nouvelles données arrivent. Après l'observation d'un élément , la probabilité de l'hypothèse devient :
Cette forme pour des événements exige et découle des deux factorisations de . Une hypothèse de masse a priori nulle ne peut acquérir une masse a posteriori positive par multiplication par une vraisemblance finie. Pour des observations continues, on utilise des densités de vraisemblance plutôt que des probabilités de points exacts ; voir la présentation de Bayes par le NIST.
Les quatre termes de la formule
- est la probabilité a priori, c'est-à-dire l'évaluation de l'hypothèse avant l'observation actuelle.
- est la vraisemblance, soit la probabilité d'observer si est vraie. Elle répond à la question « Cette observation serait-elle courante sous cette hypothèse ? » Elle diffère de .
- est la probabilité marginale des données, parfois appelée évidence. Si les hypothèses sont mutuellement exclusives et couvrent tous les cas, alors . Ce terme normalise les résultats afin que la somme des probabilités a posteriori soit égale à 1.
- est la probabilité a posteriori, obtenue après intégration de l'observation.
Pour comparer plusieurs hypothèses, on peut écrire :
La compatibilité ne garantit pas une augmentation. Pour , l'a posteriori dépasse l'a priori exactement lorsque . Si les deux vraisemblances valent 0.8, l'observation convient aux deux explications et laisse l'a priori inchangé. Le rapport de vraisemblance détermine le sens de la mise à jour ; l'a priori influe aussi sur son ampleur finale.
Taux de base : l'exemple de 0,2 % et 99 %
Supposons qu’une affection touche d’une population. Le test a une sensibilité de : il donne un résultat positif chez des personnes atteintes. Sa spécificité est également de : il donne un résultat négatif chez des personnes non atteintes. Notons le fait d’avoir cette affection et un résultat positif. Pour une personne choisie au hasard dans cette population, la formule de Bayes donne :
Sur 10 000 personnes, 20 devraient avoir l'affection et 19,8 d'entre elles devraient obtenir un résultat positif. Parmi les 9 980 autres, 99,8 faux positifs sont attendus. Les vrais positifs représentent donc environ de tous les résultats positifs.
La sensibilité et la spécificité ne donnent pas directement la probabilité d'avoir une affection après un résultat positif. Celle-ci dépend aussi de la prévalence, de la population testée et des conditions du test. Il s'agit d'un exemple mathématique, sans référence à une maladie ou à un produit précis. Il ne remplace pas une évaluation médicale.
Mises à jour successives
Une probabilité a posteriori peut devenir l'a priori de la mise à jour suivante :
Ne pas trouver une cible dans une zone fouillée constitue également une information. Si la détection réussirait généralement lorsque la cible est présente, une recherche infructueuse réduit la probabilité a posteriori qu'elle se trouve dans cette zone. Le résultat dépend de l'étendue de la recherche, de la fiabilité de la détection et de la manière dont les échecs de détection sont modélisés.
LK-99 fournit un exemple compact. Les premières observations ont accru la plausibilité d'une explication par la supraconductivité à température et pression ambiantes. Les reproductions, mesures de résistance et analyses de matériaux ultérieures l'ont réduite. L'analyse concernait une impureté de Cu₂S, le sulfure de cuivre, et non du sulfure de fer. Cet exemple montre comment plusieurs séries d'observations peuvent modifier un jugement sans réécrire après coup l'incertitude initiale.
Les observations dépendantes ne s'additionnent pas librement
La vraisemblance conjointe de deux observations s'écrit en général :
Le second facteur devient uniquement si les observations sont conditionnellement indépendantes sachant . Plusieurs articles issus d'une même source, des indicateurs affectés par la même erreur de mesure ou des phénomènes produits par une cause latente commune sont dépendants. Traiter ces observations redondantes comme indépendantes peut compter plusieurs fois la même information et produire une confiance excessive. Pour une dépendance générale, le sens de l'erreur dépend des vraisemblances conjointes sous les hypothèses concurrentes.
Les classifieurs bayésiens naïfs supposent l'indépendance conditionnelle des caractéristiques afin de simplifier le calcul. C'est une approximation du modèle, pas une propriété réelle des mots d'une langue.
Ce que le modèle permet d'établir
Un modèle bayésien explicite ses a priori, ses hypothèses candidates, ses erreurs d'observation et les dépendances entre les données. Une hypothèse omise, un a priori mal choisi, une vraisemblance erronée ou une dépendance ignorée peut tout de même produire un résultat trompeur.
Les modèles bayésiens peuvent reproduire certains comportements de perception et de jugement. Cet ajustement ne prouve pas que le cerveau exécute des calculs bayésiens exacts. Certaines méthodes d'apprentissage automatique utilisent aussi le raisonnement bayésien, sans que toute forme d'intelligence artificielle se réduise à une procédure unique. L'analyse bayésienne est un outil d'étude de la cognition et de l'IA, pas une théorie unifiée démontrée de tous les esprits ou systèmes intelligents.
Lien avec les scénarios macroéconomiques
Cette page expose la structure probabiliste générale. Une méthode bayésienne pour les scénarios macroéconomiques l'applique à des scénarios mutuellement exclusifs, à des rapports de vraisemblance, à des prévisions vérifiables et à des scores de calibration. Le guide macroéconomique porte sur l'enregistrement et l'évaluation des prévisions sans reprendre les définitions présentées ici.
Sources
- NIST : formule de Bayes, a priori, vraisemblance et a posteriori
- CDC : prévalence, sensibilité, spécificité et valeur prédictive positive
- Nature : reproductions de LK-99 et analyse du Cu₂S
- Stanford : classification de texte par la méthode bayésienne naïve
- Vidéo Bilibili d'origine : 这个简单的公式,蕴含着直觉和智能的密码