Blog · 24 settembre 2026 · 9 min di lettura
Come creare un'AI locale in azienda: guida passo passo (2026)
Un'AI locale non è un progetto di ricerca: con gli strumenti open source di oggi si può avere un assistente simile a ChatGPT su un computer dell'azienda in poche ore. Ecco i passaggi che usiamo anche noi, con i comandi e le trappole da evitare.
In breve: servono tre pezzi. 1) Ollama, il programma che scarica ed esegue i modelli (versione stabile al 24 settembre 2026: 0.34.4). 2) Un modello open adatto alla memoria del computer, per esempio Gemma 4 12B (7,6 GB) o Qwen3.8 27B (18 GB). 3) Open WebUI, l'interfaccia di chat con account personali (versione 0.11.4). Si installano in quest'ordine, e l'AI si rende raggiungibile ai colleghi solo dalla rete interna o tramite VPN, mai direttamente da internet.
Cosa ti serve prima di iniziare
La regola più utile: il modello deve stare tutto in memoria. Su un Mac con Apple Silicon conta la memoria unificata, su un PC o server con scheda video conta la memoria della GPU (VRAM). Come ordine di grandezza, con i modelli compressi a 4 bit che scarica Ollama:
| Memoria disponibile | Cosa ci gira bene | Esempio |
|---|---|---|
| 16 GB | Modelli piccoli, compiti semplici, prove | Gemma 4 12B (7,6 GB) |
| 32 GB | Modelli medi, buona qualità in italiano | Qwen3.8 27B (18 GB), Gemma 4 26B (19 GB) |
| 64 GB e oltre | Modelli grandi, documenti lunghi, più utenti | gpt-oss 120B (65 GB) |
Lascia sempre margine: oltre al modello servono memoria per il sistema operativo e per il contesto (il testo che l'AI tiene a mente in una conversazione), che cresce con documenti lunghi e utenti contemporanei. Per scegliere il modello trovi un confronto nella guida ai modelli per l'italiano.
Passo 1 – Installa Ollama
Ollama scarica i modelli, li carica in memoria e li espone tramite un'interfaccia di programmazione (API) sulla porta 11434.
- macOS (14 Sonoma o successivo): scarica
Ollama.dmgda ollama.com/download e trascina l'app in Applicazioni. Sui Mac con chip M usa la GPU integrata. - Windows (10 22H2 o successivo): scarica ed esegui
OllamaSetup.exedalla stessa pagina. - Linux: lo script ufficiale installa Ollama come servizio di sistema.
curl -fsSL https://ollama.com/install.sh | sh
Per verificare che funzioni apri il terminale e scrivi ollama --version.
Passo 2 – Scarica e prova un modello
Parti da un modello che sta comodamente nella tua memoria. Per esempio, su un computer con 16 GB:
ollama pull gemma4:12b
ollama run gemma4:12b
Si apre una chat nel terminale: fai qualche domanda in italiano sul tuo lavoro. Altri comandi utili:
ollama list: i modelli scaricati e quanto spazio occupano.ollama ps: i modelli caricati in memoria in questo momento, e se usano la GPU.ollama rm nome-modello: elimina un modello che non usi.
Tip: prova due o tre modelli sulle stesse domande reali (una mail da scrivere, un documento da riassumere). È il modo più rapido per capire quale qualità ti serve e quindi quale hardware.
Passo 3 – Installa l'interfaccia di chat (Open WebUI)
La chat nel terminale va bene per provare, ma i colleghi hanno bisogno di un'interfaccia come ChatGPT, con account personali e cronologia. Open WebUI si installa con Docker; con Ollama già attivo sullo stesso computer, il comando della documentazione ufficiale è:
docker run -d -p 3000:8080 \
--add-host=host.docker.internal:host-gateway \
-v open-webui:/app/backend/data \
-e WEBUI_SECRET_KEY=la-tua-chiave-segreta \
--name open-webui --restart always \
ghcr.io/open-webui/open-webui:main
Genera la chiave segreta con openssl rand -hex 32 invece di inventarla. Poi apri http://localhost:3000 nel browser.
- Il primo account creato diventa amministratore: crealo subito tu, prima di dare l'indirizzo a chiunque.
- Gli account creati dopo restano in attesa finché un amministratore non li approva.
- Con i gruppi puoi decidere chi vede quali modelli e quali basi documentali.
Se non vuoi usare Docker, per un uso personale esiste anche LM Studio, un'app desktop gratuita anche per uso lavorativo interno.
Passo 4 – Rendila accessibile ai colleghi, in sicurezza
È il passaggio in cui si fanno più errori. Tre regole:
- Non esporre mai Ollama su internet. Ollama non ha autenticazione: chiunque raggiunga la porta 11434 può usare i tuoi modelli. Nel febbraio 2026 i ricercatori di LeakIX hanno trovato circa 12.000 istanze Ollama raggiungibili da internet. Se Open WebUI gira sullo stesso computer, Ollama può restare in ascolto solo in locale (è l'impostazione predefinita).
- Fai passare i colleghi da Open WebUI, che ha account e permessi, non dall'API di Ollama.
- Per l'accesso da fuori ufficio usa una VPN (per esempio WireGuard o Tailscale), non un'apertura di porte sul router.
Attenzione con Docker su Linux: le porte pubblicate da Docker possono aggirare le regole del firewall di sistema (come ufw). Se il server ha un indirizzo pubblico, pubblica la porta solo sull'indirizzo interno, per esempio -p 127.0.0.1:3000:8080 dietro un reverse proxy, oppure controlla le regole con attenzione.
Passo 5 – Backup, aggiornamenti e licenze
- Backup: account, chat e documenti di Open WebUI stanno nel volume Docker
open-webui. Includilo nel backup aziendale. - Aggiornamenti: Ollama e Open WebUI escono con nuove versioni ogni poche settimane. Aggiorna dopo aver letto le note di rilascio e con un backup fresco.
- Licenze: controlla la licenza di ogni modello prima dell'uso commerciale. Gemma 4, Qwen3.8 e gpt-oss usano Apache 2.0. Open WebUI ha una licenza propria: sopra i 50 utenti al mese non puoi rimuovere il marchio "Open WebUI" senza una licenza enterprise.
Gli errori più comuni
- Modello troppo grande: se non sta in memoria diventa lentissimo. Meglio un modello medio veloce che uno grande inutilizzabile.
- Contesto troppo corto: sulle GPU con meno di 24 GB Ollama usa di default un contesto di 4.096 token, che taglia i documenti lunghi. Aumentalo nelle impostazioni del modello (parametro
num_ctx), tenendo conto che consuma memoria. - Aspettative da ChatGPT: i modelli locali sono ottimi per i compiti d'ufficio, ma i modelli cloud più grandi restano superiori su ragionamenti molto complessi. Scegli i casi d'uso di conseguenza.
- Nessuna regola d'uso: decidi prima quali dati si possono caricare e chi può vedere cosa, e comunicalo ai colleghi.
Quando conviene farsi aiutare
Vuoi tutto in un PDF da stampare o girare ai colleghi? Scarica gratis la guida completa: hardware, modelli, installazione, sicurezza e checklist in 20 punti.
Una prova su un computer si fa in un pomeriggio. Portarla in produzione per un'azienda è un altro lavoro: account e permessi per reparto, accesso sicuro da remoto, backup, aggiornamenti, collegamento ai gestionali e formazione del personale (utile anche per l'AI Act).
Se la prova ti ha convinto e vuoi un'installazione affidabile, scrivici: partiamo da quello che hai già provato. La consulenza Dabryx parte da €100 l'ora.
Fonti
- Ollama – release v0.34.4 (GitHub, 23 settembre 2026)
- Ollama – installazione su macOS (documentazione ufficiale)
- Ollama – installazione su Linux (documentazione ufficiale)
- Ollama – FAQ: porta 11434 e variabile OLLAMA_HOST
- LeakIX – Ollama exposed: migliaia di istanze raggiungibili da internet (febbraio 2026)
- Open WebUI – release v0.11.4 (GitHub, 21 settembre 2026)
- Open WebUI – Quick start con Docker (documentazione ufficiale)
- Open WebUI – ruoli, permessi e gruppi
- Open WebUI – licenza (clausola sul marchio)
- Open WebUI – RAG: impostazioni e limiti del contesto
- LM Studio – gratuito anche per uso lavorativo (8 luglio 2025)
- Ollama – Gemma 4 (dimensioni e varianti)
- Ollama – Qwen3.8
Domande frequenti
Quanto tempo serve per creare un'AI locale?
Per una prova su un computer bastano poche ore: installazione di Ollama, download di un modello e di Open WebUI. Un'installazione aziendale con account, VPN, backup, documenti collegati e formazione richiede di solito alcuni giorni di lavoro.
Serve saper programmare?
Per la prova no: bastano pochi comandi da copiare. Per l'uso in azienda servono competenze di sistemi (Docker, rete, backup, sicurezza), che si possono avere in casa o affidare a un fornitore.
Posso usare un computer che ho già?
Sì, se ha abbastanza memoria per il modello scelto. Un Mac con chip M e 16 GB fa girare modelli piccoli; per modelli di qualità più alta in italiano servono 32 GB o più.
Vuoi una stima per la tua azienda?
Raccontaci quante persone useranno l'AI e per cosa: ti diciamo quale configurazione serve.
Tempi di risposta
Entro 2 ore nei giorni feriali (9:00–18:00) per i clienti con contratto di assistenza.
Consulenza AI
A partire da €100 l'ora, su server o Mac della tua azienda.
Dove lavoriamo
In tutta Italia, da remoto e in sede dal cliente.