Aller au contenu
IA & RAG

Pourquoi la plupart des chatbots d’entreprise inventent des réponses — et comment nous en avons construit un qui cite ses sources

Les coulisses d’AIVCJ Knowledge : recherche hybride, planification des requêtes, contrôle d’ancrage sur chaque réponse et deux jeux de tests publics — dont un jeu à l’aveugle écrit comme écrivent les vraies personnes. Essayez-le en direct sur des documents RH, produit et GST d’exemple, ou sur votre propre PDF.

5 min de lecture
Des réponses qui citent le passage exact

Toutes les entreprises ont le même problème. Les réponses existent — dans une politique de congés, un PDF de garantie, une procédure de 2023 — mais personne ne les trouve, alors on demande à un collègue, on devine ou on ouvre un ticket. Un chatbot semble la solution évidente. La plupart déçoivent pour une raison : ils répondent avec assurance même quand ils ne savent pas, et personne ne peut vérifier d’où vient la réponse.

Nous avons créé AIVCJ Knowledge pour montrer à quoi ressemble l’alternative. C’est une démo en ligne que vous pouvez ouvrir dès aujourd’hui : choisissez une bibliothèque d’exemple, posez une vraie question, et chaque phrase de la réponse renvoie au passage exact dont elle provient.

Le problème : parler avec aisance n’est pas avoir raison

Un modèle de langage seul répond de mémoire. Interrogez-le sur votre règle de report des congés et il produira quelque chose de plausible tiré des politiques de milliers d’autres entreprises. Une recherche simple (RAG) aide, mais les versions naïves échouent de manière prévisible :

  • Les questions en plusieurs parties. « Je suis arrivé il y a deux mois en Finance — puis-je télétravailler deux jours par semaine ? » demande la politique de travail hybride et la règle de période d’essai. Une seule requête trouve rarement les deux.
  • Tableaux et titres sont séparés. Coupez un document tous les 900 caractères et le tableau des indemnités se retrouve séparé du titre qui dit de quoi il s’agit.
  • Pas de « je ne sais pas » honnête. Quand le bon passage n’est pas retrouvé, le modèle comble le vide.
  • Aucun moyen de vérifier. Sans citations, une mauvaise réponse ressemble exactement à une bonne.

Comment fonctionne AIVCJ Knowledge

  1. Une ingestion qui respecte la structure. Les documents (PDF, DOCX, TXT) sont découpés selon leur propre structure : les titres restent avec leur contenu, les tableaux restent entiers et chaque passage se souvient de son document et de sa section. Ce contexte est intégré avec le passage, si bien qu’une ligne de tableau « sait » encore qu’elle appartient à la section indemnités de la politique de déplacement.
  2. Planification des requêtes. Un petit modèle rapide décompose chaque question en faits nécessaires — la catégorie du salarié, le niveau de la ville, le tableau des indemnités — et chacun devient sa propre recherche.
  3. Recherche hybride. Chaque recherche s’exécute de deux façons dans PostgreSQL : par le sens (embeddings pgvector) et par les mots exacts (recherche plein texte). Les résultats sont fusionnés par reciprocal-rank fusion, et chaque partie de la question a une place garantie.
  4. Réponse uniquement à partir des sources. Claude rédige la réponse à partir des seuls passages retrouvés, en citant chaque affirmation [1], [2]… Si les documents ne couvrent pas le sujet, il le dit clairement.
  5. Contrôle d’ancrage. Une seconde passe compare la réponse finale à ses sources et la qualifie de entièrement justifiée, partiellement justifiée ou absente des documents — visible pour l’utilisateur.

Ce que vous voyez dans la démo

  • Des citations cliquables qui ouvrent la page source avec le passage exact surligné.
  • « Pourquoi cette réponse ? » — chaque passage retrouvé avec ses scores de sens, de mots-clés et de fusion, ceux qui ont été cités, le verdict d’ancrage, le temps passé et les tokens utilisés.
  • Votre propre document. Téléversez un PDF ou un fichier Word (privé, supprimé chaque nuit) et posez-lui des questions en quelques secondes.
  • Une page qualité avec les résultats complets des tests, question par question.

Mesuré, pas supposé — et honnête sur les limites

Chaque bibliothèque d’exemple a deux jeux de tests, et chaque réponse est évaluée sur sa fidélité aux sources et sa pertinence par rapport à la question.

  • Jeu de référence (45 questions). Écrit en même temps que les documents, avec des questions qui nécessitent plusieurs documents et des questions auxquelles les documents ne répondent volontairement pas. Nous l’avons utilisé pendant les réglages, il nous flatte donc. Notre première version — des fragments de taille fixe et une seule recherche par question — obtenait 40 sur 45 avec 91–93 % de fidélité ; toutes les erreurs portaient sur des questions en plusieurs parties. Le découpage selon la structure, les embeddings contextualisés et la planification des requêtes l’ont porté à 42–45 sur 45 selon les exécutions, avec 98–100 % de fidélité.
  • Jeu à l’aveugle (20 questions). Écrit ensuite par un autre auteur comme les gens écrivent vraiment — hinglish, fautes de frappe, formulations vagues, questions demandant deux documents — et jamais utilisé pour les réglages : 19–20 sur 20 selon les exécutions, avec 95–96 % de fidélité. L’erreur d’une exécution est instructive : à la question (en hinglish) de savoir quoi faire après avoir oublié un ordinateur portable de l’entreprise dans un taxi, il a indiqué le support informatique habituel au lieu de la ligne Sécurité informatique 24h/24 et oublié l’étape du dépôt de plainte — exactement le genre de lacune qu’un jeu à l’aveugle sert à détecter.

Deux réserves que nous préférons dire plutôt que cacher : l’évaluation est faite par un juge IA (Claude) à partir de réponses de référence, de la même famille de modèles que l’assistant, et les résultats ne sont pas vérifiés par des humains ; et nos documents d’exemple sont plus propres que la plupart des vrais fichiers d’entreprise. Considérez les chiffres comme indicatifs. Chaque question, réponse et note est publique sur la page qualité.

Tout aussi important : les questions que les documents ne couvrent pas reçoivent un honnête « Je n’ai pas trouvé cela dans les documents » — pas une invention.

C’est la discipline que nous apportons aux projets clients : un jeu de vraies questions dès le premier jour, relancé à chaque changement de prompt, de modèle ou de document, pour que la qualité soit un chiffre que l’on suit plutôt qu’une impression.

Le faire tourner sur vos données

La démo tourne sur la pile que nous déployons chez nos clients : Next.js, PostgreSQL avec pgvector et Claude, sur l’infrastructure de votre choix — y compris vos propres serveurs pour les documents sensibles. Un projet type commence par un flux à fort volume (questions RH, support produit ou procédures internes), cinquante vraies questions et un pilote mesuré en quelques semaines, pas en mois. Ajoutez des connecteurs (Google Drive, SharePoint, Notion), des droits par document et un canal WhatsApp au fil de votre croissance.

Essayez AIVCJ Knowledge en direct →

  • #RAG
  • #Case study
  • #pgvector
  • #Claude
  • #Evaluation
LinkedInWhatsApp
Questions fréquentes

Questions fréquentes

01Peut-il fonctionner sur nos propres documents ?
Oui. La démo vous permet de téléverser votre propre PDF ou fichier Word en privé. Pour un système en production, nous connectons vos espaces de stockage et bases de connaissances et respectons qui peut voir quel document.
02Que se passe-t-il quand la réponse n’est pas dans les documents ?
Il le dit. Les réponses sont rédigées uniquement à partir des passages retrouvés, et un contrôle d’ancrage qualifie chaque réponse de justifiée, partiellement justifiée ou introuvable.
03Peut-il être hébergé sur nos propres serveurs ?
Oui. La pile repose sur Next.js et PostgreSQL avec pgvector, et peut tourner sur vos serveurs ou un cloud privé pour les données sensibles.
Besoin de le faire développer ?

Applications IA & RAG

Des assistants qui répondent à partir de vos données — et les citent.

À lire aussi

Pose les congés dans le respect des règles — vous confirmezERP & opérations

6 min de lecture

Du chatbot au collègue : un assistant RH qui agit en toute sécurité

AIVCJ HR ne se contente pas de répondre aux questions sur les congés : il pose les congés, achemine les validations et rédige les courriers RH. Voici comment nous avons laissé une IA agir sans la laisser fixer les règles : un moteur de règles dans le code, une carte de confirmation avant chaque action, des droits par rôle et un journal d’audit. Mesuré sur un jeu de tests scénarisé et un jeu à l’aveugle.

Lire la suite
Owner dashboard: sales, margin, receivables ageing and what needs youERP & opérations

7 min de lecture

Des photos WhatsApp à un carnet de commandes en temps réel : un ERP et une application terrain hors ligne pour les distributeurs

AIVCJ ERP remplace la boucle Tally + Excel + WhatsApp : une application terrain qui prend les commandes sans réseau et ne synchronise jamais deux fois, des blocages pour encours client décidés dans le code, une préparation FEFO avec factures GST, et des questions en langage courant traitées par une requête en lecture seule que vous pouvez voir. Mesuré avec un test de synchronisation sur deux téléphones et un jeu de tests NL-vers-SQL à l’aveugle.

Lire la suite
IA & RAG

2 min de lecture

Qu’est-ce que le RAG — et quand votre entreprise en a-t-elle vraiment besoin ?

La génération augmentée par récupération permet à l’IA de répondre à partir de vos propres documents au lieu de deviner. Voici comment elle fonctionne, où elle excelle et les signes que vous êtes prêt.

Lire la suite