Modèles multimodaux : alignement, fusion et questions visuelles
Distinguer recherche image–texte et questions visuelles pour comprendre patches, connecteurs, pertes d’information et évaluation.
Distinguer recherche image–texte et questions visuelles pour comprendre patches, connecteurs, pertes d’information et évaluation.