Come installare e configurare Ollama per eseguire modelli di intelligenza artificiale sul tuo PC

Ultimo aggiornamento: 25 agosto 2026

All'interno di un PC ad alte prestazioni con scheda grafica NVIDIA GeForce RTX, ideale per l'esecuzione di modelli di intelligenza artificiale locali.

Probabilmente hai già familiarità con strumenti come ChatGPT, Claude o Gemini. Sebbene siano fantastici, c'è un inconveniente: funzionano nel cloud. Ciò significa che ogni parola che digiti viaggia verso i server di un'azienda, il che può rappresentare un serio rischio per la privacy se gestisci dati sensibili o lavori in settori in cui la legge vieta la condivisione di informazioni al di fuori dell'azienda.

È qui che entra in gioco Ollama, un'applicazione che trasforma il tuo computer nel centro nevralgico dell'intelligenza artificiale . Dimentica gli abbonamenti mensili e la necessità di una connessione internet stabile; con questo strumento, puoi scaricare modelli open source ed eseguirli direttamente sul tuo hardware, mantenendo il controllo completo sui tuoi dati.

Cos'è esattamente Ollama e quali sono i suoi vantaggi?

Schermata del computer con l'icona di un lucchetto e la scritta "Protetto", a rappresentare la privacy dei dati all'interno dei locali aziendali.

Ollama è un software open-source che funge da client per la gestione di modelli linguistici di grandi dimensioni (LLM). Il suo principale vantaggio è la semplificazione della complessità tecnica , grazie all'ottimizzazione della GPU e alla gestione della memoria, che consentono di iniziare a chattare semplicemente eseguendo un comando.

I vantaggi sono evidenti. Innanzitutto, la privacy è assoluta poiché nulla esce dal tuo computer. In secondo luogo, risparmi sui costi dei token API o sulle tariffe mensili dei piani Plus. Infine, una volta che il template è sul tuo disco rigido, puoi utilizzarlo completamente offline , l'ideale quando sei in aereo o in luoghi con scarsa copertura di rete.

Tuttavia, non è tutto oro quel che luccica. Il principale svantaggio è la necessità di un hardware potente . Se si tenta di eseguire un modello complesso su un PC con poca RAM, la risposta sarà talmente lenta che avrete il tempo di prepararvi un caffè prima che la frase sia terminata. Inoltre, l'IA conosce solo ciò che ha appreso fino alla data di addestramento, quindi non ha accesso alle ultime notizie in tempo reale.

  Le migliori risorse Web per SQL Server: una guida completa

Requisiti di sistema e hardware consigliato

Ambiente di sviluppo professionale con più monitor che visualizzano codice e impostazioni API.

Per evitare un'esperienza frustrante, è consigliabile dare un'occhiata ai componenti. La risorsa più critica è la RAM e la VRAM della scheda grafica . In generale, un modello da 1.5 miliardi di BTU occupa circa 1 GB di spazio, ma necessita di più memoria per funzionare senza problemi.

  • Mini modelli (da 270M a 4B): Ideale per apparecchiature di piccole dimensioni o mobili.
  • Modelli di piccole dimensioni (da 4B a 14B): La soluzione ideale per un utente domestico.
  • Modelli di medie dimensioni (da 14B a 70B): Qui serve un hardware di alto livello.
  • Modelli di grandi dimensioni (oltre 70B): Adatto solo a macchine con risorse gigantesche.

Per quanto riguarda la GPU, avere una scheda NVIDIA con CUDA, una scheda AMD con ROCm o un Mac con Apple Metal fa un'enorme differenza, velocizzando la generazione del testo da 5 a 10 volte rispetto all'utilizzo della sola CPU. Se intendi acquistare dell'hardware, cerca schede grafiche con almeno 16 GB di VRAM per evitare di esaurirla rapidamente.

Guida all'installazione passo passo

L'installazione di Ollama è sorprendentemente semplice e può essere completata in pochi minuti, a seconda del sistema operativo utilizzato:

Su Windows , è sufficiente scaricare il file .exe dal sito Web ufficiale. In genere, verrà installato nella cartella AppData dell'utente. Per chi preferisce i container, è possibile distribuirlo anche tramite Docker Desktop eseguendo il comando di installazione ufficiale nel terminale.

Per gli utenti di LinuxIl modo più veloce è usare il terminale con il comando curl -fsSL https://ollama.com/install.sh | shUna volta installato, il servizio viene solitamente eseguito in background. Se è necessario modificare la posizione in cui vengono archiviati i modelli per evitare di riempire il disco principale, è possibile modificare la variabile d'ambiente. MODELLI DI FORNO nel file di configurazione del servizio systemd.

  Le migliori risorse web per .NET

En macOSL'installazione è semplice utilizzando il programma di installazione scaricato o anche utilizzando brew install ollamaIl sistema sfrutterà automaticamente il Accelerazione dei metalli dei chip Apple Silicon.

Come gestire ed eseguire modelli di intelligenza artificiale

Una volta che il server Ollam è attivo (lo vedrai nell'icona della barra delle applicazioni), puoi iniziare a scaricare i modelli. Il comando fondamentale è ollama pull [nombre-del-modelo]anche se si usa ollama runil sistema scaricherà automaticamente il modello se non ce l'hai ancora.

Esistono diverse categorie di modelli a seconda delle esigenze:

  • Conversazionale: Llama 3 o Mistral sono i re in questo caso grazie al loro equilibrio tra qualità e velocità.
  • Programmazione: CodeLlama o DeepSeek-Coder sono ideali per il debug del codice o la generazione di funzioni.
  • Multimodale (Visione): Modelli come LLaVA consentono di caricare immagini e chiedere all'intelligenza artificiale di descriverle.
  • Ragionamento (Pensiero): Modelli progettati per spiegare i processi passo dopo passo.

Per interagire, è sufficiente utilizzare ollama run llama3 e accederai a un prompt interattivo. All'interno di questa sessione, puoi utilizzare comandi come /? per aiuto o /bye Per uscire. Se vuoi vedere cosa hai installato, ollama list Ti darà l'elenco completo e con ollama ps Puoi verificare se il modello è caricato sulla GPU o sulla CPU.

Impostazioni avanzate e personalizzazione

Se sei uno sviluppatore, Ollama è una miniera d'oro perché espone un'API REST sulla porta 11434. Questo ti permette di connettere l'IA locale a qualsiasi applicazione. È compatibile con il formato OpenAI, quindi puoi integrarlo in VS Code tramite GitHub Copilot (utilizzando l'opzione BYOK) o utilizzare agenti come OpenCode.

Un'altra potente funzionalità è il Modelfile . È simile a un Dockerfile, ma per l'intelligenza artificiale. Permette di creare una versione personalizzata di un modello definendo uno specifico prompt di sistema (ad esempio, trasformando Llama in un esperto di diritto spagnolo), regolando la temperatura per renderlo più creativo o più preciso e salvando tale configurazione con un nome personalizzato.

  Come utilizzare l'intelligenza artificiale senza creare un account

Per chi cerca un'interfaccia grafica più simile a ChatGPT, consigliamo di installare Open WebUI . Si connette a Ollama come backend e offre un'esperienza web completa con cronologia delle chat e gestione dei documenti, il tutto in esecuzione sulla propria rete locale.

Suggerimenti per l'ottimizzazione e le prestazioni

Quando si nota che l'IA è lenta, il primo passo è controllare la quantizzazione . Questo processo riduce la precisione dei pesi del modello (da 16 bit a 4 o 8 bit, ad esempio), diminuendo drasticamente la RAM necessaria senza sacrificare eccessivamente la qualità. Un modello Q4_K_M rappresenta solitamente il compromesso ideale tra prestazioni e precisione.

Per evitare che Ollama consumi risorse quando non è in uso, è possibile disabilitare l'avvio automatico in Gestione attività di Windows. È inoltre utile monitorare l'utilizzo della VRAM in tempo reale per determinare se il modello sta scaricando la RAM di sistema, operazione che rallenta significativamente le prestazioni.

Avere il controllo dell'infrastruttura locale democratizza l'uso dell'intelligenza artificiale, eliminando le barriere economiche degli abbonamenti e i rischi per la sicurezza del cloud. Combinando la potenza di modelli come Llama 3 o Mistral con la facilità di gestione di Ollama, qualsiasi appassionato o azienda può costruire il proprio ecosistema di IA privato , ottimizzando l'hardware disponibile e personalizzando il comportamento dei modelli tramite file di modello e API integrati.