Reranker, l’étape qui manque à votre IA branchée sur vos documents
David Touzet15 août 20268 min de lectureVous avez branché une IA sur vos documents et elle rate des réponses que vous savez présentes. Ce n’est pas un problème de modèle, c’est un problème de tri. La recherche par le sens rapporte ce qui ressemble à votre question, pas ce qui y répond. Voici l’étape qui corrige ça, ce qu’elle coûte réellement, et les 2 situations où elle ne sert à rien.
- Ressemblant n’est pas pertinent, et c’est tout le problème
- Comment fonctionne un reranker, les 2 familles
- Le réglage qui décide de tout, sur-récupérer puis couper
- Ce qu’un reranker coûte vraiment, temps, argent et dépendance
- La mesure qui ne prouve rien, et comment mesurer vraiment
- Les 3 cas où un reranker ne sert à rien
- L’usage détourné, trier des outils plutôt que des documents
Ressemblant n’est pas pertinent, et c’est tout le problème
Commençons par le malentendu qui coûte le plus cher.
Quand vous branchez une IA sur vos documents, le système découpe vos textes en extraits et transforme chaque extrait en une longue liste de nombres censée capturer son sens. À la question posée, il applique le même traitement, puis il compare les nombres et rapporte les plus proches. C’est ce que nous décrivons dans RAG, brancher une IA sur vos propres documents.
Le défaut est structurel. Ces nombres ont été calculés avant que votre question existe. Ils décrivent un extrait en général, pas sa capacité à répondre à une demande précise. Résultat, le système remonte ce qui parle du même sujet, pas ce qui répond.
3 EXEMPLES OU LA RESSEMBLANCE SE TROMPE
QUESTION Quels sont les bienfaits de la
meditation pour la sante ?
REMONTE Kyoto est celebre pour ses temples
zen, ou l'on medite depuis des
siecles.
➜ Meme sujet. Zero reponse.
QUESTION Comment installer Python ?
REMONTE Le python reticule vit 20 a 30 ans
en captivite.
➜ Meme mot. Zero rapport.
QUESTION Combien coute une vidange chez le
garage Template ?
REMONTE La vidange, dans la liste des
services du garage Exemple.
➜ Meme prestation, MAUVAIS client. C'est le
cas le plus frequent en entreprise, et le
plus dangereux, parce que la reponse a
l'air juste.
Le 3e cas est celui que vous rencontrerez. Dans une base documentaire d’entreprise, les extraits ne se ressemblent pas vaguement, ils se ressemblent beaucoup. Même prestation, même formulation, client différent. Une machine qui trie par ressemblance n’a aucune raison de préférer le bon.
Comment fonctionne un reranker, les 2 familles
Le principe tient en une phrase. Au lieu de comparer 2 listes de nombres calculées séparément, on donne la question et le document au même modèle, en même temps, et on lui demande une note de pertinence.
Cette lecture conjointe est ce qui change tout. Le modèle peut voir que le mot méditation apparaît dans un contexte touristique et pas médical. Un calcul de distance entre 2 nombres ne le peut pas.
LES 2 FAMILLES, ET CE QUI LES SEPARE
1. LE CROISEMENT (cross-encoder)
Question + document passent ENSEMBLE dans
le modele, qui rend une note.
+ le plus precis
- il faut relancer le modele pour CHAQUE
paire question-document. Rien ne se
calcule a l'avance.
2. L'INTERACTION TARDIVE (ColBERT)
On stocke un vecteur par MOT, pas un par
extrait. A la question, chaque mot de la
question est compare a chaque mot du
document, on garde le meilleur score par
mot, et on additionne.
+ nettement plus rapide et moins gourmand
- MOINS precis que le croisement, les mesures
publiques donnent un ecart net
- la base occupe beaucoup plus de place
⚠ Un raccourci circule, le reranker serait « une
IA qui lit les documents ». Non. C'est un
modele de classement specialise, beaucoup plus
petit qu'un modele de conversation, entraine
uniquement a noter une pertinence.
La 2e famille est celle que la recherche donne comme le meilleur compromis. Elle est aussi la moins proposée par les fournisseurs, parce qu’elle se passe très bien d’un abonnement.
Le réglage qui décide de tout, sur-récupérer puis couper
Voici la partie opérationnelle, et elle se règle en 2 nombres.
Un système sans reranker remonte directement les 5 meilleurs extraits et les envoie au modèle. Avec un reranker, on change de logique. On sur-récupère volontairement, puis on coupe.
python3 <<'PY'
# Les 2 seuls reglages qui comptent.
# A ajuster sur VOS questions, pas sur un tutoriel.
EXTRAITS_ENVOYES = 5 # ce que le modele lira
FACTEUR = 3 # combien on en ramasse avant
ramasses = EXTRAITS_ENVOYES * FACTEUR
print(f" Etape 1, recherche par le sens : "
f"{ramasses} extraits")
print(f" Etape 2, reclassement des {ramasses}")
print(f" Etape 3, on garde les "
f"{EXTRAITS_ENVOYES} meilleurs")
print()
print(" Le facteur 3 est un point de depart.")
print(" Trop bas, la bonne reponse n'est jamais")
print(" ramassee. Trop haut, on paie du tri pour")
print(" rien et la reponse ralentit.")
PY
Les valeurs vues sur le terrain vont de 10 ramassés pour 5 gardés, jusqu’à 50 pour 5 sur des corpus littéraires. Le facteur 3 est le plus courant et le plus raisonnable pour commencer.
La raison de sur-récupérer est simple. Si la bonne réponse arrive en 7e position dans la recherche par le sens, et que vous ne prenez que les 5 premiers, aucun reclassement au monde ne la retrouvera. On ne trie que ce qu’on a ramassé.
Ce qu’un reranker coûte vraiment, temps, argent et dépendance
3 coûts, et le 3e est celui qu’on oublie.
Le temps. Comptez de quelques centaines de millisecondes à 1 ou 2 secondes de plus par question. Le temps monte à peu près proportionnellement au nombre d’extraits à trier. Un essai public donne environ un quart de seconde pour 10 extraits sur une machine ordinaire, ce qui met la centaine autour de 2 à 3 secondes.
L’argent. Chez un fournisseur, chaque question devient une requête facturée en plus. C’est peu à l’unité, beaucoup sur un assistant très utilisé.
La dépendance. Votre assistant cesse de répondre correctement si le service extérieur tombe. Prévoyez une porte de sortie qui renvoie simplement les résultats non triés plutôt que rien du tout.
⛔ LE PIEGE JURIDIQUE QUE LES TUTORIELS SAUTENT
Le fournisseur le plus recommande dans les
tutoriels distribue 2 types de cles.
CLE D'ESSAI gratuite, debit limite, et
INTERDITE D'USAGE COMMERCIAL
CLE DE PRODUCTION payante, apres examen
d'un formulaire
Un prestataire qui suit un tutoriel et laisse
une cle d'essai dans le systeme d'un client le
met en dehors des conditions du fournisseur.
➜ A verifier AVANT de brancher, pas au premier
courrier du fournisseur.
Il existe une sortie propre à ces 3 coûts. Des modèles de reclassement ouverts s’installent chez vous, en plusieurs tailles. Le plus gros demande une carte graphique sérieuse, le plus petit tourne sur un processeur ordinaire. Aucune requête ne sort de chez vous, ce qui règle aussi la question des données sensibles.
La mesure qui ne prouve rien, et comment mesurer vraiment
Voici le passage le plus instructif de tout ce que nous avons dépouillé, et c’est un aveu.
Un auteur mesure proprement son gain sur un jeu de 30 questions. 24 bonnes réponses sans reranker, 27 avec. Puis il ajoute, de lui-même, qu’il a dû modifier son jeu de questions pour y mettre le type de questions que le reclassement aide vraiment.
Sa mesure ne vaut donc plus rien, et il est assez honnête pour le dire dans la même minute. Un autre auteur conclut que le reclassement améliore les résultats après avoir comparé une seule question sur un roman, en jugeant lui-même les réponses.
MESURER UN RERANKER SANS SE MENTIR
1. ECRIRE LES QUESTIONS AVANT
30 a 50 vraies questions de vos
utilisateurs, ecrites AVANT de toucher au
systeme. Jamais apres.
2. NOTER LA BONNE REPONSE ATTENDUE
Pas « une bonne reponse », LA source
exacte qui devait remonter.
3. LANCER LES 2 FOIS
Meme jeu, meme jour, avec et sans. Un
seul reglage change a la fois.
4. REGARDER LES ECHECS, PAS LE SCORE
Un passage de 24 a 27 sur 30 ne dit rien
tant qu'on n'a pas lu les 3 questions
gagnees et verifie qu'aucune n'a ete
perdue au passage.
⚠ Le chiffre « 10 a 30 % d'amelioration » circule
partout sans reference. Ne le reprenez pas
devant un client.
Notre position est simple. Un reranker aide, c’est mesurable, et le gain dépend tellement de vos documents et de vos questions qu’aucun chiffre repris ailleurs ne vaut pour vous. Le seul chiffre utile est celui que vous mesurez sur vos propres questions.
Les 3 cas où un reranker ne sert à rien
Le conseil le plus utile du lot vient d’un auteur qui vient pourtant de passer 15 minutes à installer un reranker.
Cas 1, vos documents tiennent dans la fenêtre. Les modèles actuels lisent plusieurs centaines de milliers de mots d’un coup. Si votre base documentaire y tient, envoyez-la entière et regardez si la réponse est bonne. Vous venez d’économiser une étape, un abonnement et une seconde par question.
Cas 2, vos réponses sont déjà justes. Un reclassement ne crée pas d’information. Si la bonne source remonte déjà en première position, le trier une seconde fois ne changera rien d’autre que la facture.
L'ARBRE DE DECISION, DANS CET ORDRE
Vos reponses sont-elles deja bonnes ?
OUI -> ne touchez a rien.
NON -> continuez.
Vos documents tiennent-ils dans la fenetre
du modele ?
OUI -> envoyez tout, mesurez, et arretez-
vous la si ca suffit.
NON -> continuez.
La bonne source apparait-elle si vous
remontez 15 extraits au lieu de 5 ?
NON -> votre probleme est le DECOUPAGE de
vos documents, pas le tri. Un
reranker n'y changera rien.
OUI -> c'est la que le reranker sert.
La dernière branche est la plus importante. Si la bonne réponse n’apparaît jamais, même en remontant beaucoup d’extraits, le problème est en amont, dans la façon dont vos documents ont été découpés. C’est le sujet que nous traitons dans les 3 solutions miracles qui ont échoué, et aucun outil de tri ne le règle.
L’usage détourné, trier des outils plutôt que des documents
Terminons par ce qui nous a le plus intéressés, parce que personne n’en parle.
Un développeur n’utilise pas son reranker sur des documents. Il le branche sur une liste de plus de 100 connecteurs disponibles pour son agent, et lui demande de classer les outils selon la question posée. L’agent ne reçoit alors que les 3 ou 4 outils réellement utiles.
C’est la réponse la plus élégante à un problème bien connu, un agent noyé sous ses propres outils choisit mal. Le sujet des connecteurs est détaillé dans MCP, le protocole qui branche une IA sur vos outils.
Une génération récente de ces modèles accepte en plus une consigne en langage courant, ce qui ouvre une autre porte.
CE QU'ON PEUT DEMANDER A UN RERANKER RECENT
« prefere les documents les plus recents »
« prefere la source A a la source B »
« ignore tout ce qui date d'avant 2025 »
➜ Pourquoi c'est utile. Dans une entreprise, le
vrai probleme n'est presque jamais le hors-
sujet. C'est que 2 documents INTERNES se
contredisent, la fiche commerciale et la
fiche technique, la version de mars et celle
de fevrier. La pertinence ne suffit pas a
departager, il faut une regle d'autorite.
⚠ Et cette regle est une decision de direction,
pas un reglage technique. Personne chez le
prestataire ne peut decider a la place du
client quelle source fait foi.
C’est là que se joue l’essentiel, et c’est rarement un sujet d’outil. Avant d’ajouter une étape de tri, il faut savoir quelle source fait autorité dans l’entreprise. Cette question-là précède le choix entre un agent et une simple automatisation, et elle ne se sous-traite pas. La brique qui fournit ces extraits peut d’ailleurs vivre dans votre base habituelle, comme l’explique Postgres avale tout.
Les liens à garder sous la main
5 ressources pour aller plus loin.
Questions fréquentes
Un site pensé pour l’ère des agents IA
Comprendre les agents IA est un début, en tirer profit en est un autre. On conçoit et pilote votre présence web à Montpellier, prête pour l’IA.
Faire le point sur votre siteVotre équipe de 12 agents IA, prête à l’emploi
Pas un agent unique, mais 12 agents IA métier qui collaborent. Ils accueillent vos clients, écrivent, publient et vous rendent visible, pendant que vous gardez la main.
Voir les 12 agents