Blog · 24 septembre 2026 · 7 min de lecture

Comment connecter une IA locale aux documents de l'entreprise (RAG)

La vraie valeur d'une IA en entreprise apparaît quand elle répond avec les informations de l'entreprise : procédures, tarifs, contrats, manuels. La technique s'appelle le RAG. Voici comment elle fonctionne et comment bien la configurer sur une IA locale.

En bref : le RAG (retrieval-augmented generation) découpe les documents en petits morceaux, les indexe avec un modèle d'embedding et, à chaque question, ne transmet à l'IA que les morceaux pertinents. Dans Open WebUI, on crée une Knowledge (base de connaissances) que l'on associe à un modèle. Pour l'italien, mieux vaut remplacer le modèle d'embedding par défaut par un modèle multilingue, comme bge-m3 ou qwen3-embedding, et augmenter le contexte du modèle.

Gratuit Guide PDF · 9 pages · mis à jour en septembre 2026

Vous voulez une IA bien à vous, au sein de l'entreprise ? Nous vous expliquons comment.

  • Le matériel vraiment nécessaire (Mac ou serveur) et son coût
  • Les meilleurs modèles en italien et comment les installer pas à pas
  • Sécurité, RGPD et une checklist en 20 points
Télécharger le guide gratuit →

Vous le recevez par e-mail en quelques secondes. Pas de spam.

Comment ça marche, sans jargon

  1. Préparation : chaque document est découpé en blocs de texte (dans Open WebUI, par défaut, environ 1 000 caractères avec 100 de chevauchement).
  2. Indexation : un modèle d'embedding transforme chaque bloc en une « empreinte » numérique qui en représente le sens.
  3. Recherche : lorsque vous posez une question, le système cherche les blocs dont le sens est le plus proche (par défaut les 3 meilleurs).
  4. Réponse : le modèle reçoit la question avec ces blocs et répond en citant ses sources.

Tout se passe sur l'ordinateur de l'entreprise : ni les documents ni les questions ne sortent de l'entreprise.

Le configurer dans Open WebUI

  1. Téléchargez un modèle d'embedding multilingue : ollama pull bge-m3 (1,2 GB) ou ollama pull qwen3-embedding:4b (2,5 GB).
  2. Dans Panneau d'administration → Paramètres → Documents, choisissez Ollama comme moteur d'embedding et sélectionnez le modèle téléchargé. Le modèle par défaut d'Open WebUI est surtout conçu pour l'anglais.
  3. Dans Workspace → Knowledge, créez une base de connaissances par thème (par exemple « Procédures qualité », « Tarifs 2026 ») et chargez les documents.
  4. Associez la Knowledge à un modèle dans Workspace → Modèles, ou appelez-la dans le chat en tapant #.
  5. Augmentez le contexte du modèle (num_ctx) : avec la valeur par défaut de 4 096 tokens sur les GPU de moins de 24 GB, les blocs récupérés risquent de ne pas tenir.

Important : si vous changez de modèle d'embedding après avoir chargé les documents, il faut les réindexer. Choisissez-le avant de charger vos archives.

Pourquoi les réponses sont parfois fausses

  • PDF scannés : si le PDF est une image sans texte, l'IA ne lit rien. Il faut d'abord une reconnaissance de texte (OCR).
  • Tableaux et tarifs : découpés en blocs, ils perdent leur structure. Pour les données tabulaires, une connexion directe au logiciel de gestion ou à la base de données est souvent préférable au RAG.
  • Documents en double ou obsolètes : si les archives contiennent trois versions de la même procédure, l'IA peut citer la mauvaise. Ne chargez que les versions en vigueur.
  • Trop de documents dans une seule base : des bases plus petites et thématiques donnent des réponses plus précises.
  • Questions trop vagues : « dis-moi tout sur le client X » fonctionne moins bien que « quelles sont les conditions de paiement du contrat avec le client X ? ».

Permissions : qui peut voir quoi

Une IA connectée aux documents voit tout ce que vous lui donnez. Avant de charger des contrats, des données du personnel ou des informations confidentielles :

  • créez des bases de connaissances séparées par service ou par niveau de confidentialité ;
  • utilisez les groupes d'Open WebUI pour décider qui peut utiliser quelle base ;
  • ne chargez pas de données personnelles inutiles : le principe de minimisation du RGPD s'applique aussi à l'IA.

Quand se faire aider

Vous voulez tout dans un PDF à imprimer ou à transmettre à vos collègues ? Téléchargez gratuitement le guide complet : matériel, modèles, installation, sécurité et checklist en 20 points.

Un essai sur un ordinateur se fait en un après-midi. Le passer en production pour une entreprise est un autre travail : comptes et permissions par service, accès sécurisé à distance, sauvegardes, mises à jour, connexion aux logiciels de gestion et formation du personnel (utile aussi pour l'AI Act).

Si l'essai vous a convaincu et que vous voulez une installation fiable, écrivez-nous : nous partirons de ce que vous avez déjà testé. Le conseil Dabryx démarre à 100 € de l'heure.

Questions fréquentes

Qu'est-ce que le RAG ?

C'est une technique qui permet à un modèle d'IA de répondre en utilisant des documents qu'il ne connaissait pas : le système cherche les passages pertinents dans les archives et les transmet au modèle avec la question.

Faut-il réentraîner le modèle sur les documents de l'entreprise ?

Non, dans la plupart des cas. Le RAG est plus simple, moins cher et se met à jour immédiatement lorsque vous modifiez les documents ; l'entraînement (fine-tuning) sert à des besoins spécifiques de style ou de format.

Combien de documents peut-on connecter ?

Même des milliers. La limite pratique, c'est la qualité : des bases thématiques, des documents à jour et un texte lisible comptent plus que la quantité.

Vous voulez une estimation pour votre entreprise ?

Dites-nous combien de personnes utiliseront l'IA et pour quoi faire : nous vous dirons quelle configuration il vous faut.

Délais de réponse

Sous 2 heures les jours ouvrés (9h00–18h00) pour les clients sous contrat d'assistance.

Conseil IA

À partir de 100 € de l'heure, sur les serveurs ou les Mac de votre entreprise.

Où nous travaillons

Dans toute l'Italie, à distance et sur site.