01Le problème de la démonstration
Un premier index construit à partir d'un export propre a toujours l'air impressionnant. Puis les tarifs changent, une politique est réécrite, trois PDF sont remplacés, et l'assistant continue de répondre avec le trimestre dernier, en toute confiance.
La précision n'est pas un indicateur de lancement. C'est une propriété de maintenance, et elle se dégrade tant que rien ne garde l'index synchronisé avec la source de vérité.
02Le découpage et les métadonnées font le plus gros du travail
Découper les documents sur un nombre de caractères arbitraire détruit le sens. Découpez selon la structure — sections, clauses, fiches produit — et associez des métadonnées : source, date d'effet, langue, audience.
Ce sont ces métadonnées qui permettent de filtrer avant de rechercher, pour qu'un client arabophone posant une question sur une politique aux Émirats ne reçoive jamais un brouillon en anglais datant de 2024.
03Le refus est une fonctionnalité
Un système qui répond à tout est un système qui invente. Fixez un seuil de pertinence : en dessous, l'assistant dit qu'il ne sait pas et propose un humain.
Journalisez chaque refus. Ce journal est le backlog à plus forte valeur que vous obtiendrez — il indique exactement quel contenu manque.
04Évaluer à chaque changement
Conservez un jeu fixe de vraies questions avec réponses et citations attendues. Exécutez-le à chaque changement de modèle, de prompt, de découpage ou de corpus, et traitez toute régression comme un échec de build.
