Blog · 24 septembre 2026 · 9 min de lecture

Comment créer une IA locale en entreprise : guide pas à pas (2026)

Une IA locale n'est pas un projet de recherche : avec les outils open source d'aujourd'hui, on peut disposer d'un assistant similaire à ChatGPT sur un ordinateur de l'entreprise en quelques heures. Voici les étapes que nous utilisons nous-mêmes, avec les commandes et les pièges à éviter.

En bref : il faut trois éléments. 1) Ollama, le programme qui télécharge et exécute les modèles (version stable au 24 septembre 2026 : 0.34.4). 2) Un modèle open adapté à la mémoire de l'ordinateur, par exemple Gemma 4 12B (7,6 GB) ou Qwen3.8 27B (18 GB). 3) Open WebUI, l'interface de chat avec comptes personnels (version 0.11.4). On les installe dans cet ordre, et l'IA n'est rendue accessible aux collègues que depuis le réseau interne ou via VPN, jamais directement depuis internet.

Gratuit Guide PDF · 9 pages · mis à jour en septembre 2026

Vous voulez une IA bien à vous, au sein de l'entreprise ? Nous vous expliquons comment.

  • Le matériel vraiment nécessaire (Mac ou serveur) et son coût
  • Les meilleurs modèles en italien et comment les installer pas à pas
  • Sécurité, RGPD et une checklist en 20 points
Télécharger le guide gratuit →

Vous le recevez par e-mail en quelques secondes. Pas de spam.

Ce qu'il vous faut avant de commencer

La règle la plus utile : le modèle doit tenir entièrement en mémoire. Sur un Mac avec Apple Silicon, c'est la mémoire unifiée qui compte ; sur un PC ou un serveur avec carte graphique, c'est la mémoire du GPU (VRAM). En ordre de grandeur, avec les modèles compressés en 4 bits que télécharge Ollama :

Mémoire disponibleCe qui y tourne bienExemple
16 GBPetits modèles, tâches simples, testsGemma 4 12B (7,6 GB)
32 GBModèles moyens, bonne qualité en italienQwen3.8 27B (18 GB), Gemma 4 26B (19 GB)
64 GB et plusGrands modèles, longs documents, plusieurs utilisateursgpt-oss 120B (65 GB)

Gardez toujours une marge : en plus du modèle, il faut de la mémoire pour le système d'exploitation et pour le contexte (le texte que l'IA garde en tête pendant une conversation), qui augmente avec les longs documents et les utilisateurs simultanés. Pour choisir le modèle, vous trouverez un comparatif dans le guide des modèles pour l'italien.

Étape 1 – Installer Ollama

Ollama télécharge les modèles, les charge en mémoire et les expose via une interface de programmation (API) sur le port 11434.

  • macOS (14 Sonoma ou ultérieur) : téléchargez Ollama.dmg depuis ollama.com/download et faites glisser l'app dans Applications. Sur les Mac à puce M, il utilise le GPU intégré.
  • Windows (10 22H2 ou ultérieur) : téléchargez et exécutez OllamaSetup.exe depuis la même page.
  • Linux : le script officiel installe Ollama comme service système.
curl -fsSL https://ollama.com/install.sh | sh

Pour vérifier que cela fonctionne, ouvrez le terminal et tapez ollama --version.

Étape 2 – Télécharger et tester un modèle

Commencez par un modèle qui tient confortablement dans votre mémoire. Par exemple, sur un ordinateur avec 16 GB :

ollama pull gemma4:12b
ollama run gemma4:12b

Un chat s'ouvre dans le terminal : posez quelques questions en italien sur votre travail. Autres commandes utiles :

  • ollama list : les modèles téléchargés et l'espace qu'ils occupent.
  • ollama ps : les modèles chargés en mémoire en ce moment, et s'ils utilisent le GPU.
  • ollama rm nome-modello : supprime un modèle que vous n'utilisez pas.

Astuce : testez deux ou trois modèles sur les mêmes questions réelles (un e-mail à rédiger, un document à résumer). C'est le moyen le plus rapide de savoir quelle qualité il vous faut, et donc quel matériel.

Étape 3 – Installer l'interface de chat (Open WebUI)

Le chat dans le terminal convient pour tester, mais vos collègues ont besoin d'une interface comme ChatGPT, avec comptes personnels et historique. Open WebUI s'installe avec Docker ; avec Ollama déjà actif sur le même ordinateur, la commande de la documentation officielle est :

docker run -d -p 3000:8080 \
  --add-host=host.docker.internal:host-gateway \
  -v open-webui:/app/backend/data \
  -e WEBUI_SECRET_KEY=la-tua-chiave-segreta \
  --name open-webui --restart always \
  ghcr.io/open-webui/open-webui:main

Générez la clé secrète avec openssl rand -hex 32 au lieu de l'inventer. Ouvrez ensuite http://localhost:3000 dans le navigateur.

  1. Le premier compte créé devient administrateur : créez-le vous-même tout de suite, avant de communiquer l'adresse à qui que ce soit.
  2. Les comptes créés ensuite restent en attente jusqu'à ce qu'un administrateur les approuve.
  3. Avec les groupes, vous pouvez décider qui voit quels modèles et quelles bases documentaires.

Si vous ne voulez pas utiliser Docker, pour un usage personnel il existe aussi LM Studio, une application de bureau gratuite, y compris pour un usage professionnel interne.

Étape 4 – La rendre accessible aux collègues, en toute sécurité

C'est l'étape où l'on fait le plus d'erreurs. Trois règles :

  1. N'exposez jamais Ollama sur internet. Ollama n'a pas d'authentification : quiconque atteint le port 11434 peut utiliser vos modèles. En février 2026, les chercheurs de LeakIX ont trouvé environ 12 000 instances Ollama accessibles depuis internet. Si Open WebUI tourne sur le même ordinateur, Ollama peut n'écouter qu'en local (c'est le réglage par défaut).
  2. Faites passer vos collègues par Open WebUI, qui gère comptes et permissions, et non par l'API d'Ollama.
  3. Pour l'accès hors du bureau, utilisez un VPN (par exemple WireGuard ou Tailscale), et non une ouverture de ports sur le routeur.

Attention avec Docker sous Linux : les ports publiés par Docker peuvent contourner les règles du pare-feu système (comme ufw). Si le serveur a une adresse publique, publiez le port uniquement sur l'adresse interne, par exemple -p 127.0.0.1:3000:8080 derrière un reverse proxy, ou vérifiez soigneusement les règles.

Étape 5 – Sauvegardes, mises à jour et licences

  • Sauvegarde : comptes, conversations et documents d'Open WebUI se trouvent dans le volume Docker open-webui. Incluez-le dans la sauvegarde de l'entreprise.
  • Mises à jour : Ollama et Open WebUI publient de nouvelles versions toutes les quelques semaines. Mettez à jour après avoir lu les notes de version et avec une sauvegarde récente.
  • Licences : vérifiez la licence de chaque modèle avant tout usage commercial. Gemma 4, Qwen3.8 et gpt-oss sont sous Apache 2.0. Open WebUI a sa propre licence : au-delà de 50 utilisateurs par mois, vous ne pouvez pas retirer la marque « Open WebUI » sans licence enterprise.

Les erreurs les plus courantes

  • Modèle trop gros : s'il ne tient pas en mémoire, il devient extrêmement lent. Mieux vaut un modèle moyen et rapide qu'un grand modèle inutilisable.
  • Contexte trop court : sur les GPU de moins de 24 GB, Ollama utilise par défaut un contexte de 4 096 tokens, ce qui tronque les longs documents. Augmentez-le dans les paramètres du modèle (paramètre num_ctx), en gardant à l'esprit que cela consomme de la mémoire.
  • Attentes calquées sur ChatGPT : les modèles locaux excellent dans les tâches de bureau, mais les plus grands modèles cloud restent supérieurs pour les raisonnements très complexes. Choisissez vos cas d'usage en conséquence.
  • Aucune règle d'usage : décidez à l'avance quelles données peuvent être chargées et qui peut voir quoi, et communiquez-le à vos collègues.

Quand se faire aider

Vous voulez tout dans un PDF à imprimer ou à transmettre à vos collègues ? Téléchargez gratuitement le guide complet : matériel, modèles, installation, sécurité et checklist en 20 points.

Un essai sur un ordinateur se fait en un après-midi. Le passer en production pour une entreprise est un autre travail : comptes et permissions par service, accès sécurisé à distance, sauvegardes, mises à jour, connexion aux logiciels de gestion et formation du personnel (utile aussi pour l'AI Act).

Si l'essai vous a convaincu et que vous voulez une installation fiable, écrivez-nous : nous partirons de ce que vous avez déjà testé. Le conseil Dabryx démarre à 100 € de l'heure.

Questions fréquentes

Combien de temps faut-il pour créer une IA locale ?

Pour un essai sur un ordinateur, quelques heures suffisent : installation d'Ollama, téléchargement d'un modèle et d'Open WebUI. Une installation d'entreprise avec comptes, VPN, sauvegardes, documents connectés et formation demande généralement quelques jours de travail.

Faut-il savoir programmer ?

Pour l'essai, non : quelques commandes à copier suffisent. Pour un usage en entreprise, il faut des compétences système (Docker, réseau, sauvegardes, sécurité), disponibles en interne ou confiées à un prestataire.

Puis-je utiliser un ordinateur que j'ai déjà ?

Oui, s'il a assez de mémoire pour le modèle choisi. Un Mac à puce M avec 16 GB fait tourner de petits modèles ; pour des modèles de meilleure qualité en italien, il faut 32 GB ou plus.

Vous voulez une estimation pour votre entreprise ?

Dites-nous combien de personnes utiliseront l'IA et pour quoi faire : nous vous dirons quelle configuration il vous faut.

Délais de réponse

Sous 2 heures les jours ouvrés (9h00–18h00) pour les clients sous contrat d'assistance.

Conseil IA

À partir de 100 € de l'heure, sur les serveurs ou les Mac de votre entreprise.

Où nous travaillons

Dans toute l'Italie, à distance et sur site.