- Évaluez séparément la recherche, la qualité de la réponse et le respect des accès.
- La latence doit être mesurée sur tout le parcours, avec un protocole explicite.
- Un assistant doit savoir signaler une information absente ou insuffisante.
Ce que rapporte le cas KDDI
Le 8 septembre 2026, Google Cloud et KDDI présentent le travail réalisé sur Buffmee, une application RAG grand public. Le cas rapporte une baisse de 38 % de la latence totale et une amélioration proche de 18 % du délai avant le premier token. Ces résultats sont attribués à ce projet et publiés par le fournisseur ; ils ne constituent pas une prévision pour une autre entreprise.
L’intérêt opérationnel de cette publication est le lien entre évaluation et optimisation. Pour un assistant d’entreprise, nous proposons de rendre visibles trois dimensions : ce qui a été retrouvé, ce qui a été répondu et ce que l’utilisateur était autorisé à consulter. Une bonne impression générale ne permet pas de les distinguer.
Construire un corpus que l’on peut gouverner
La première tâche consiste à identifier les sources, leurs propriétaires et leurs règles de mise à jour. Une procédure approuvée, un brouillon et un ancien document ne doivent pas être traités comme des références équivalentes. Les métadonnées utiles comprennent la date, le statut, le périmètre métier et les droits d’accès.
Définissez comment un document entre, change et sort de la base. Si une procédure est remplacée, l’assistant doit pouvoir retrouver la version pertinente sans continuer à citer l’ancienne comme si elle était actuelle. L’ingestion est donc un processus suivi, pas un import unique au début du projet.
Créer un jeu d’évaluation représentatif
Rassemblez des questions réellement posées par les utilisateurs et des réponses attendues validées par le métier. Ajoutez des formulations ambiguës, des informations absentes et des documents contradictoires. Pour chaque question, indiquez les sources pertinentes et ce qui rend une réponse acceptable.
Une évaluation doit permettre de localiser le problème. Le bon document a-t-il été retrouvé ? La réponse respecte-t-elle son contenu ? La citation pointe-t-elle au bon passage ? L’assistant a-t-il ajouté une affirmation non étayée ? Ces observations orientent des corrections différentes : améliorer la recherche, la préparation du corpus ou la génération.
Mesurer le parcours complet
Le délai avant le premier signe de réponse et la durée jusqu’au résultat complet décrivent des expériences différentes. Une réponse qui commence vite peut encore être longue à terminer. Mesurez les étapes : authentification, recherche, éventuel reclassement, génération et affichage.
Comparez les variantes sur les mêmes questions, avec des conditions de test stables. Documentez le nombre de répétitions et les valeurs atypiques. Une optimisation de vitesse ne doit pas être retenue si elle dégrade la qualité au-delà du seuil accepté. Les coûts et la charge d’exploitation font également partie de l’arbitrage.
Vérifier les droits avant la réponse
L’assistant doit respecter les droits de l’utilisateur dans les sources et les index. Le contrôle ne peut pas dépendre uniquement d’une instruction textuelle demandant au modèle de ne pas divulguer certains contenus. Les documents autorisés doivent être sélectionnés avant d’être transmis à la génération.
Testez explicitement deux personnes ayant des droits différents, une permission retirée et un document déplacé. Vérifiez aussi les journaux, les caches et les exports éventuels. Une réponse correcte sur le fond reste incorrecte si elle expose une information que la personne n’aurait pas dû recevoir.
Prévoir le doute et la maintenance
Définissez les situations où l’assistant doit demander une précision, indiquer qu’il ne trouve pas de source suffisante ou orienter vers un interlocuteur. L’utilisateur doit pouvoir accéder aux éléments cités et signaler une réponse problématique. Cette remontée doit rejoindre un responsable identifié.
Un pilote utile réunit un corpus limité, des utilisateurs représentatifs et un ensemble de cas de référence. Après le lancement, réexécutez les évaluations lors des changements importants de modèle, d’index ou de documents. L’objectif est une qualité suivie dans le temps, avec des limites explicites et un chemin de correction.
| Dimension | Question de contrôle | Cas à inclure |
|---|---|---|
| Recherche | La bonne source est-elle trouvée ? | Synonyme, document récent, ambiguïté |
| Réponse | Chaque affirmation est-elle étayée ? | Source absente ou contradictoire |
| Accès | La personne a-t-elle le droit de voir la source ? | Permission retirée, utilisateurs distincts |
| Performance | Quelle durée observe l’utilisateur ? | Mesures répétées, premier token et réponse complète |
Sources & méthode
Cette perspective associe les publications citées à une analyse éditoriale. Les exemples illustratifs ne constituent pas des résultats clients. Les fonctionnalités et conditions des fournisseurs peuvent évoluer.