Blog · 24 settembre 2026 · 9 min di lettura

Come creare un'AI locale in azienda: guida passo passo (2026)

Un'AI locale non è un progetto di ricerca: con gli strumenti open source di oggi si può avere un assistente simile a ChatGPT su un computer dell'azienda in poche ore. Ecco i passaggi che usiamo anche noi, con i comandi e le trappole da evitare.

In breve: servono tre pezzi. 1) Ollama, il programma che scarica ed esegue i modelli (versione stabile al 24 settembre 2026: 0.34.4). 2) Un modello open adatto alla memoria del computer, per esempio Gemma 4 12B (7,6 GB) o Qwen3.8 27B (18 GB). 3) Open WebUI, l'interfaccia di chat con account personali (versione 0.11.4). Si installano in quest'ordine, e l'AI si rende raggiungibile ai colleghi solo dalla rete interna o tramite VPN, mai direttamente da internet.

Cosa ti serve prima di iniziare

La regola più utile: il modello deve stare tutto in memoria. Su un Mac con Apple Silicon conta la memoria unificata, su un PC o server con scheda video conta la memoria della GPU (VRAM). Come ordine di grandezza, con i modelli compressi a 4 bit che scarica Ollama:

Memoria disponibileCosa ci gira beneEsempio
16 GBModelli piccoli, compiti semplici, proveGemma 4 12B (7,6 GB)
32 GBModelli medi, buona qualità in italianoQwen3.8 27B (18 GB), Gemma 4 26B (19 GB)
64 GB e oltreModelli grandi, documenti lunghi, più utentigpt-oss 120B (65 GB)

Lascia sempre margine: oltre al modello servono memoria per il sistema operativo e per il contesto (il testo che l'AI tiene a mente in una conversazione), che cresce con documenti lunghi e utenti contemporanei. Per scegliere il modello trovi un confronto nella guida ai modelli per l'italiano.

Passo 1 – Installa Ollama

Ollama scarica i modelli, li carica in memoria e li espone tramite un'interfaccia di programmazione (API) sulla porta 11434.

  • macOS (14 Sonoma o successivo): scarica Ollama.dmg da ollama.com/download e trascina l'app in Applicazioni. Sui Mac con chip M usa la GPU integrata.
  • Windows (10 22H2 o successivo): scarica ed esegui OllamaSetup.exe dalla stessa pagina.
  • Linux: lo script ufficiale installa Ollama come servizio di sistema.
curl -fsSL https://ollama.com/install.sh | sh

Per verificare che funzioni apri il terminale e scrivi ollama --version.

Passo 2 – Scarica e prova un modello

Parti da un modello che sta comodamente nella tua memoria. Per esempio, su un computer con 16 GB:

ollama pull gemma4:12b
ollama run gemma4:12b

Si apre una chat nel terminale: fai qualche domanda in italiano sul tuo lavoro. Altri comandi utili:

  • ollama list: i modelli scaricati e quanto spazio occupano.
  • ollama ps: i modelli caricati in memoria in questo momento, e se usano la GPU.
  • ollama rm nome-modello: elimina un modello che non usi.

Tip: prova due o tre modelli sulle stesse domande reali (una mail da scrivere, un documento da riassumere). È il modo più rapido per capire quale qualità ti serve e quindi quale hardware.

Passo 3 – Installa l'interfaccia di chat (Open WebUI)

La chat nel terminale va bene per provare, ma i colleghi hanno bisogno di un'interfaccia come ChatGPT, con account personali e cronologia. Open WebUI si installa con Docker; con Ollama già attivo sullo stesso computer, il comando della documentazione ufficiale è:

docker run -d -p 3000:8080 \
  --add-host=host.docker.internal:host-gateway \
  -v open-webui:/app/backend/data \
  -e WEBUI_SECRET_KEY=la-tua-chiave-segreta \
  --name open-webui --restart always \
  ghcr.io/open-webui/open-webui:main

Genera la chiave segreta con openssl rand -hex 32 invece di inventarla. Poi apri http://localhost:3000 nel browser.

  1. Il primo account creato diventa amministratore: crealo subito tu, prima di dare l'indirizzo a chiunque.
  2. Gli account creati dopo restano in attesa finché un amministratore non li approva.
  3. Con i gruppi puoi decidere chi vede quali modelli e quali basi documentali.

Se non vuoi usare Docker, per un uso personale esiste anche LM Studio, un'app desktop gratuita anche per uso lavorativo interno.

Passo 4 – Rendila accessibile ai colleghi, in sicurezza

È il passaggio in cui si fanno più errori. Tre regole:

  1. Non esporre mai Ollama su internet. Ollama non ha autenticazione: chiunque raggiunga la porta 11434 può usare i tuoi modelli. Nel febbraio 2026 i ricercatori di LeakIX hanno trovato circa 12.000 istanze Ollama raggiungibili da internet. Se Open WebUI gira sullo stesso computer, Ollama può restare in ascolto solo in locale (è l'impostazione predefinita).
  2. Fai passare i colleghi da Open WebUI, che ha account e permessi, non dall'API di Ollama.
  3. Per l'accesso da fuori ufficio usa una VPN (per esempio WireGuard o Tailscale), non un'apertura di porte sul router.

Attenzione con Docker su Linux: le porte pubblicate da Docker possono aggirare le regole del firewall di sistema (come ufw). Se il server ha un indirizzo pubblico, pubblica la porta solo sull'indirizzo interno, per esempio -p 127.0.0.1:3000:8080 dietro un reverse proxy, oppure controlla le regole con attenzione.

Passo 5 – Backup, aggiornamenti e licenze

  • Backup: account, chat e documenti di Open WebUI stanno nel volume Docker open-webui. Includilo nel backup aziendale.
  • Aggiornamenti: Ollama e Open WebUI escono con nuove versioni ogni poche settimane. Aggiorna dopo aver letto le note di rilascio e con un backup fresco.
  • Licenze: controlla la licenza di ogni modello prima dell'uso commerciale. Gemma 4, Qwen3.8 e gpt-oss usano Apache 2.0. Open WebUI ha una licenza propria: sopra i 50 utenti al mese non puoi rimuovere il marchio "Open WebUI" senza una licenza enterprise.

Gli errori più comuni

  • Modello troppo grande: se non sta in memoria diventa lentissimo. Meglio un modello medio veloce che uno grande inutilizzabile.
  • Contesto troppo corto: sulle GPU con meno di 24 GB Ollama usa di default un contesto di 4.096 token, che taglia i documenti lunghi. Aumentalo nelle impostazioni del modello (parametro num_ctx), tenendo conto che consuma memoria.
  • Aspettative da ChatGPT: i modelli locali sono ottimi per i compiti d'ufficio, ma i modelli cloud più grandi restano superiori su ragionamenti molto complessi. Scegli i casi d'uso di conseguenza.
  • Nessuna regola d'uso: decidi prima quali dati si possono caricare e chi può vedere cosa, e comunicalo ai colleghi.

Quando conviene farsi aiutare

Vuoi tutto in un PDF da stampare o girare ai colleghi? Scarica gratis la guida completa: hardware, modelli, installazione, sicurezza e checklist in 20 punti.

Una prova su un computer si fa in un pomeriggio. Portarla in produzione per un'azienda è un altro lavoro: account e permessi per reparto, accesso sicuro da remoto, backup, aggiornamenti, collegamento ai gestionali e formazione del personale (utile anche per l'AI Act).

Se la prova ti ha convinto e vuoi un'installazione affidabile, scrivici: partiamo da quello che hai già provato. La consulenza Dabryx parte da €100 l'ora.

Domande frequenti

Quanto tempo serve per creare un'AI locale?

Per una prova su un computer bastano poche ore: installazione di Ollama, download di un modello e di Open WebUI. Un'installazione aziendale con account, VPN, backup, documenti collegati e formazione richiede di solito alcuni giorni di lavoro.

Serve saper programmare?

Per la prova no: bastano pochi comandi da copiare. Per l'uso in azienda servono competenze di sistemi (Docker, rete, backup, sicurezza), che si possono avere in casa o affidare a un fornitore.

Posso usare un computer che ho già?

Sì, se ha abbastanza memoria per il modello scelto. Un Mac con chip M e 16 GB fa girare modelli piccoli; per modelli di qualità più alta in italiano servono 32 GB o più.

Vuoi una stima per la tua azienda?

Raccontaci quante persone useranno l'AI e per cosa: ti diciamo quale configurazione serve.

Email

info@dabryx.com

Tempi di risposta

Entro 2 ore nei giorni feriali (9:00–18:00) per i clienti con contratto di assistenza.

Consulenza AI

A partire da €100 l'ora, su server o Mac della tua azienda.

Dove lavoriamo

In tutta Italia, da remoto e in sede dal cliente.