Blog · 24 septembre 2026 · 7 min de lecture
Comment connecter une IA locale aux documents de l'entreprise (RAG)
La vraie valeur d'une IA en entreprise apparaît quand elle répond avec les informations de l'entreprise : procédures, tarifs, contrats, manuels. La technique s'appelle le RAG. Voici comment elle fonctionne et comment bien la configurer sur une IA locale.
En bref : le RAG (retrieval-augmented generation) découpe les documents en petits morceaux, les indexe avec un modèle d'embedding et, à chaque question, ne transmet à l'IA que les morceaux pertinents. Dans Open WebUI, on crée une Knowledge (base de connaissances) que l'on associe à un modèle. Pour l'italien, mieux vaut remplacer le modèle d'embedding par défaut par un modèle multilingue, comme bge-m3 ou qwen3-embedding, et augmenter le contexte du modèle.
Comment ça marche, sans jargon
- Préparation : chaque document est découpé en blocs de texte (dans Open WebUI, par défaut, environ 1 000 caractères avec 100 de chevauchement).
- Indexation : un modèle d'embedding transforme chaque bloc en une « empreinte » numérique qui en représente le sens.
- Recherche : lorsque vous posez une question, le système cherche les blocs dont le sens est le plus proche (par défaut les 3 meilleurs).
- Réponse : le modèle reçoit la question avec ces blocs et répond en citant ses sources.
Tout se passe sur l'ordinateur de l'entreprise : ni les documents ni les questions ne sortent de l'entreprise.
Le configurer dans Open WebUI
- Téléchargez un modèle d'embedding multilingue :
ollama pull bge-m3(1,2 GB) ouollama pull qwen3-embedding:4b(2,5 GB). - Dans Panneau d'administration → Paramètres → Documents, choisissez Ollama comme moteur d'embedding et sélectionnez le modèle téléchargé. Le modèle par défaut d'Open WebUI est surtout conçu pour l'anglais.
- Dans Workspace → Knowledge, créez une base de connaissances par thème (par exemple « Procédures qualité », « Tarifs 2026 ») et chargez les documents.
- Associez la Knowledge à un modèle dans Workspace → Modèles, ou appelez-la dans le chat en tapant
#. - Augmentez le contexte du modèle (
num_ctx) : avec la valeur par défaut de 4 096 tokens sur les GPU de moins de 24 GB, les blocs récupérés risquent de ne pas tenir.
Important : si vous changez de modèle d'embedding après avoir chargé les documents, il faut les réindexer. Choisissez-le avant de charger vos archives.
Pourquoi les réponses sont parfois fausses
- PDF scannés : si le PDF est une image sans texte, l'IA ne lit rien. Il faut d'abord une reconnaissance de texte (OCR).
- Tableaux et tarifs : découpés en blocs, ils perdent leur structure. Pour les données tabulaires, une connexion directe au logiciel de gestion ou à la base de données est souvent préférable au RAG.
- Documents en double ou obsolètes : si les archives contiennent trois versions de la même procédure, l'IA peut citer la mauvaise. Ne chargez que les versions en vigueur.
- Trop de documents dans une seule base : des bases plus petites et thématiques donnent des réponses plus précises.
- Questions trop vagues : « dis-moi tout sur le client X » fonctionne moins bien que « quelles sont les conditions de paiement du contrat avec le client X ? ».
Permissions : qui peut voir quoi
Une IA connectée aux documents voit tout ce que vous lui donnez. Avant de charger des contrats, des données du personnel ou des informations confidentielles :
- créez des bases de connaissances séparées par service ou par niveau de confidentialité ;
- utilisez les groupes d'Open WebUI pour décider qui peut utiliser quelle base ;
- ne chargez pas de données personnelles inutiles : le principe de minimisation du RGPD s'applique aussi à l'IA.
Quand se faire aider
Vous voulez tout dans un PDF à imprimer ou à transmettre à vos collègues ? Téléchargez gratuitement le guide complet : matériel, modèles, installation, sécurité et checklist en 20 points.
Un essai sur un ordinateur se fait en un après-midi. Le passer en production pour une entreprise est un autre travail : comptes et permissions par service, accès sécurisé à distance, sauvegardes, mises à jour, connexion aux logiciels de gestion et formation du personnel (utile aussi pour l'AI Act).
Si l'essai vous a convaincu et que vous voulez une installation fiable, écrivez-nous : nous partirons de ce que vous avez déjà testé. Le conseil Dabryx démarre à 100 € de l'heure.
Questions fréquentes
Qu'est-ce que le RAG ?
C'est une technique qui permet à un modèle d'IA de répondre en utilisant des documents qu'il ne connaissait pas : le système cherche les passages pertinents dans les archives et les transmet au modèle avec la question.
Faut-il réentraîner le modèle sur les documents de l'entreprise ?
Non, dans la plupart des cas. Le RAG est plus simple, moins cher et se met à jour immédiatement lorsque vous modifiez les documents ; l'entraînement (fine-tuning) sert à des besoins spécifiques de style ou de format.
Combien de documents peut-on connecter ?
Même des milliers. La limite pratique, c'est la qualité : des bases thématiques, des documents à jour et un texte lisible comptent plus que la quantité.
Vous voulez une estimation pour votre entreprise ?
Dites-nous combien de personnes utiliseront l'IA et pour quoi faire : nous vous dirons quelle configuration il vous faut.
Délais de réponse
Sous 2 heures les jours ouvrés (9h00–18h00) pour les clients sous contrat d'assistance.
Conseil IA
À partir de 100 € de l'heure, sur les serveurs ou les Mac de votre entreprise.
Où nous travaillons
Dans toute l'Italie, à distance et sur site.