Aller au contenu principal

Recherche documentaire : découpage, rappel, reclassement et citations

Un système de questions-réponses doit retrouver les passages utiles avant de demander au modèle de rédiger sa réponse. Si les preuves n'atteignent jamais le contexte, un générateur plus puissant risque simplement de produire une supposition plus fluide. Cette page suit le chemin du document vers la preuve ; la mémoire des agents traite de ce qu'il faut conserver entre les tâches.

Choisir les passages en partant des questions

Imaginons un manuel fictif : une section explique le remplacement de la batterie, puis la suivante précise que l'étanchéité suppose un boîtier intact. À la question « Puis-je immerger l'appareil juste après avoir changé la batterie ? », un paragraphe contenant seulement « batterie » ne suffit pas.

Un passage doit conserver une idée complète sans noyer la preuve dans du texte secondaire. On peut commencer par les titres, paragraphes, fonctions ou limites des tableaux, puis plafonner les sections trop longues. Le chevauchement préserve parfois les phrases à cheval sur deux passages, mais crée des doublons. Une référence d'API, une conversation et un chapitre scientifique n'appellent pas le même découpage.

Chaque passage doit conserver l'identifiant du document, sa position, le chemin de ses titres et sa version. Une ligne de tableau doit permettre de retrouver ses en-têtes et ses unités. Un texte détaché de sa source complique les citations, la déduplication et les mises à jour. La suppression d'un document doit aussi invalider ses anciennes entrées d'index.

Distinguer rappel et reclassement

Le rappel sélectionne des passages plausibles dans le corpus ; le reclassement examine leur rapport précis avec la question. L'exemple de Sentence Transformers combine une recherche lexicale ou un bi-encodeur avec un reclassement par cross-encoder.

ÉtapeQuestion traitéePerte fréquente
Recherche lexicaleLes noms, identifiants ou codes d'erreur figurent-ils dans le texte ?Une reformulation ne partage aucun terme
Recherche vectorielleLe sens est-il proche ?La proximité du sujet masque négation, version ou valeur exacte
ReclassementCe passage répond-il à cette question ?La preuve manque déjà dans les candidats
Assemblage du contexteQuels passages et conditions tiennent dans le budget ?La déduplication ou la troncature retire une restriction

Une recherche hybride peut réunir les candidats lexicaux et vectoriels, mais leurs scores n'ont pas nécessairement la même échelle. La fusion par rang constitue une base simple : la fusion réciproque additionne 1 / (c + rank) dans chaque liste, où c règle l'avantage donné aux premières positions. Cette règle de classement ne produit pas une probabilité de justesse.

Localiser l'échec avant de changer de modèle

Pour la batterie, supposons que le rappel retienne 20 passages, le reclassement en sélectionne 4, et que le contexte puisse en contenir 2. Ces budgets servent à l'exemple et ne constituent pas des réglages conseillés.

Si la condition d'étanchéité arrive 30e, le rappel échoue. Si elle figure parmi les candidats mais descend à la 12e place, le classement échoue. Si elle est dans les 4 premières puis disparaît au profit de doublons, l'assemblage échoue. Si le modèle la reçoit mais l'ignore, la génération échoue. Conserver les identifiants et les positions à chaque étape permet de distinguer ces cas. La réponse finale ne dit pas à elle seule s'il faut modifier les embeddings, le découpage ou les instructions.

Pour une question qui traverse plusieurs sections, on peut retrouver un petit passage puis ajouter ses voisins ou sa section parente. Cette extension ajoute aussi du bruit : il faut la plafonner et préserver les conditions utiles. Les contraintes d'accès, de date et de version interviennent dès la sélection des candidats, avant qu'une réponse ne cite une source inapplicable.

Relier chaque citation à une affirmation

« Voir le manuel » ne suffit pas. Une phrase telle que « le joint doit être vérifié après remplacement » doit pointer vers son passage justificatif. Lorsque deux versions se contredisent, déterminer leurs dates et modèles d'appareil respectifs. Si le conflit persiste, le conserver dans la réponse plutôt que fabriquer une conclusion commune.

Un texte retrouvé fournit des preuves, pas des instructions d'exécution. Une phrase demandant d'ignorer les règles ou d'appeler un outil n'acquiert aucune autorité grâce à son classement. Les contrats d'outils détaillent cette frontière.

Situer les outils dans ce parcours

QMD recherche des notes Markdown, zvec-grep effectue une recherche sémantique dans le code et les documents d'un espace de travail, et Basic Memory expose des notes persistantes et leurs relations. Leurs mécanismes n'exigent pas une base unique. Leurs résultats doivent toutefois préciser la source, la position, la version, le passage utile et le périmètre d'accès.

Commencer par quelques questions dont les preuves sont connues, puis vérifier séparément leur présence dans les candidats, leur rang et leur utilisation dans la réponse. L'évaluation de la recherche et de la génération explique les mesures et les contre-exemples ; l'ingénierie du contexte explique comment répartir l'espace de travail du modèle.

Explorer les liensOuvrir le réseau