Questa guida è per chi ha già Ollama sul computer e vuole usare in locale un modello Llama di Meta, senza mandare le proprie domande a un servizio esterno. Il punto più delicato è scegliere la versione da scaricare, perché alcune occupano un paio di gigabyte e altre centinaia. Alla fine avrai Llama 3.2 funzionante e lo saprai usare sia nella chat da terminale sia con l’API locale di Ollama. Saprai anche controllare quali modelli sono sul disco e come toglierli. I comandi sono quelli della documentazione ufficiale di Ollama e delle pagine dei modelli, elencate in fondo.
Cosa serve
- Ollama installato. Se non l’hai ancora installato, segui la nostra guida per installare Ollama su Linux e usare un modello in locale. Secondo la guida rapida di Ollama, il programma esiste anche per macOS e Windows.
- Spazio su disco. Llama 3.2 occupa 1,3 GB nella versione 1B e 2,0 GB nella 3B. Per Llama 4 la pagina della libreria indica 67 GB per il tag
llama4:16x17be 245 GB perllama4:128x17b. - Una scheda video, se ce l’hai. La pagina Linux della documentazione di Ollama spiega come installare i driver CUDA per le GPU Nvidia e ROCm v7 per le GPU AMD. Tutti e due sono facoltativi.
Le pagine dei modelli riportano quanto pesano i file, ma non quanta RAM o VRAM serve per farli girare. Se non sai quanta memoria ti serve, parti dalla taglia più piccola.
Controllare che Ollama sia installato e attivo
Prima di scaricare un modello controlla due cose: che il programma risponda e che il server di Ollama sia in esecuzione. Questo comando stampa la versione installata:
ollama -v
Se il comando non viene trovato, Ollama non è installato: torna alla guida all’installazione. Se invece compare un numero di versione, su Linux controlla lo stato del servizio systemd:
sudo systemctl status ollama
Nell’output cerca la riga che dice se il servizio è attivo. Se è fermo, avvialo con il comando indicato nella documentazione per Linux:
sudo systemctl start ollama
Poi ricontrolla lo stato: il servizio deve risultare attivo.
Questi comandi funzionano solo se Ollama è installato come servizio. Con l’installazione manuale, se non hai creato il file di servizio, la documentazione per Linux dice di avviare il server con ollama serve e di aprire un altro terminale per il resto. Su macOS e Windows systemctl non serve: la guida rapida dice di aprire l’app di Ollama.
Scegliere la versione di Llama adatta al proprio computer
Nella libreria di Ollama ci sono più generazioni di Llama. Qui confrontiamo Llama 3.2 e Llama 4, due modelli con dimensioni molto diverse:
| Tag Ollama | Dimensione | Contesto | Input |
|---|---|---|---|
llama3.2:1b |
1,3 GB | 128K | Testo |
llama3.2:3b (anche latest) |
2,0 GB | 128K | Testo |
llama4:16x17b (anche latest) |
67 GB | 10M | Testo, immagini |
llama4:128x17b |
245 GB | 1M | Testo, immagini |
Su un PC normale conviene partire da Llama 3.2. La versione 3B è quella predefinita e, secondo la pagina del modello, supera Gemma 2 2.6B e Phi 3.5-mini nel seguire istruzioni, riassumere, riscrivere prompt e usare strumenti. La 1B è pensata per compiti più leggeri: gestire informazioni personali, recuperare informazioni in più lingue, riscrivere testi direttamente sul dispositivo. L’italiano è una delle otto lingue supportate ufficialmente.
Llama 4 funziona diversamente: usa un’architettura mixture-of-experts e accetta anche immagini in ingresso. Nella pagina, Scout ha 109 miliardi di parametri, di cui 17 miliardi attivi, e Maverick ne ha 400 miliardi, sempre con 17 miliardi attivi. La pagina dà le dimensioni per tag: 67 GB per llama4:16x17b e 245 GB per llama4:128x17b. Non dice quanta memoria serve per farli girare.
Scaricare e avviare Llama 3.2
Il comando ollama run scarica il modello e apre una chat nel terminale. Per la versione predefinita, quella da 3 miliardi di parametri, basta il nome del modello:
ollama run llama3.2
Se hai poca memoria o vuoi fare solo una prova veloce, usa la variante da 1 miliardo di parametri:
ollama run llama3.2:1b
La prima volta Ollama scarica i file del modello. Finito il download, compare il prompt della chat e puoi scrivere la prima domanda.
Provare il modello e uscire dalla chat
Scrivi una domanda e premi Invio. Per esempio puoi chiedere di riassumere un paragrafo in italiano o di riscrivere una frase in tono più formale. Per un testo su più righe, il riferimento della riga di comando di Ollama spiega che il blocco si apre e si chiude con tre virgolette doppie.
Quando hai finito, esci dalla chat con il comando indicato nella guida rapida:
/bye
Torni al normale prompt del terminale. Uscire dalla chat non cancella il modello: per toglierlo dal disco c’è un comando apposta, spiegato più avanti.
Vedere quali modelli sono scaricati e quali sono in memoria
Dopo qualche prova è facile perdere il conto di cosa c’è sul disco. Questo comando elenca i modelli scaricati:
ollama ls
Nell’elenco devi trovare llama3.2 oppure llama3.2:1b, secondo cosa hai scaricato. Un modello scaricato però non è per forza caricato in memoria. Per vedere quali modelli stanno girando in quel momento usa:
ollama ps
È utile soprattutto quando il computer rallenta e vuoi sapere se un modello sta ancora occupando memoria.
Usare Llama 3.2 con l’API locale di Ollama
La chat nel terminale va bene per le prove. Per collegare Llama a uno script o a un altro programma si usa l’API che Ollama espone in locale sulla porta 11434. La pagina di Llama 3.2 riporta questa richiesta di esempio con curl:
curl http://localhost:11434/api/chat \
-d '{
"model": "llama3.2",
"messages": [{"role": "user", "content": "Hello!"}]
}'
La richiesta manda al modello llama3.2 il messaggio «Hello!» come utente. Il campo model indica il tag da usare, quindi deve corrispondere a un modello che hai scaricato.
Negli esempi della guida rapida la risposta dell’API di Ollama si legge nel campo message.content. La pagina del modello ha anche esempi in Python e JavaScript con le librerie ufficiali di Ollama.
Solo per chi ha molta memoria: Llama 4 Scout
Se ti serve un modello che capisca anche le immagini e hai un computer con molta memoria, puoi provare Llama 4 Scout. Prima però leggi la restrizione della sua Acceptable Use Policy: per i modelli multimodali di Llama 4 i diritti della licenza non sono concessi a chi risiede nell’Unione europea né alle aziende con sede principale nell’UE (l’esclusione non vale per chi usa un prodotto o servizio che incorpora il modello). La pagina di Llama 4 lo descrive come multimodale: accetta testo e immagini e risponde con testo e codice. Nella sezione dei modelli si avvia così:
ollama run llama4:scout
La pagina non dice quanto pesa il tag llama4:scout. Per confronto, il tag latest di Llama 4, cioè llama4:16x17b, pesa 67 GB. Prima di lanciare il comando controlla di avere parecchio spazio libero sul disco. Secondo la stessa pagina, la comprensione delle immagini di Llama 4 è stata testata con al massimo 5 immagini in ingresso.
Fermare e rimuovere il modello
Il riferimento della riga di comando descrive due operazioni diverse. ollama stop seguito dal nome del modello ferma un modello in esecuzione. ollama rm seguito dal nome lo cancella dal disco. Negli esempi della documentazione il modello è un altro (gemma4): al suo posto scrivi il tag che hai scaricato.
Attenzione:
ollama rmcancella il modello dal disco. Per usarlo di nuovo dovrai riscaricarlo tutto: 1,3 o 2,0 GB per Llama 3.2, 67 GB perllama4:16x17b. Prima di cancellarlo, controlla conollama lsil nome esatto del tag da togliere.
- Per fermare il modello, scrivi
ollama stopseguito dal tag, per esempiollama3.2ollama3.2:1b. Poi controlla conollama psche non sia più tra i modelli in esecuzione. - Per liberare spazio, scrivi
ollama rmseguito dallo stesso tag. - Lancia di nuovo
ollama lse controlla che il modello non sia più nell’elenco.
Controlla bene il tag: se hai scaricato sia la 3B sia la 1B, sono due voci distinte e, se ne togli una, l’altra resta sul disco.
Licenza d’uso di Llama 4
La pagina di Llama 4 su Ollama nomina la «Llama 4 Community License» insieme a una Acceptable Use Policy, cioè le regole sugli usi consentiti. Secondo la pagina, Llama 4 è pensato per uso commerciale e di ricerca in più lingue. Sono esclusi gli usi che violano leggi e regolamenti, comprese le norme sul commercio internazionale, e quelli vietati dalla policy o dalla licenza.
Per chi è in Italia conta soprattutto un punto della Acceptable Use Policy di Llama 4: per i modelli multimodali, come Scout, i diritti di licenza non sono concessi alle persone residenti nell’Unione europea né alle aziende con sede principale nell’UE. Fanno eccezione gli utenti finali di prodotti o servizi che incorporano il modello.
La pagina di Llama 3.2 su Ollama non riporta i termini di licenza. Se vuoi usare Llama in un progetto di lavoro, leggi per intero la licenza della versione che hai scelto prima di cominciare.
Se qualcosa va storto
- Il server non risponde. Su Linux controlla il servizio con
systemctl statuse, se è fermo, avvialo consystemctl start, come nel primo passaggio. Se il servizio non esiste, avvia il server conollama serve. La pagina Linux spiega anche come leggere i log del servizio con journalctl. - Le risposte sono lente. Secondo la guida rapida, se la VRAM non basta Ollama può usare la RAM di sistema, ma le risposte possono essere più lente. Anche le finestre di contesto più ampie richiedono più memoria. In questi casi prova la variante
llama3.2:1b. - La GPU AMD non viene sfruttata bene. La documentazione per Linux avverte che il driver amdgpu incluso nel kernel è una versione più vecchia e potrebbe non supportare tutte le funzioni di ROCm. Per questo consiglia di installare il driver più recente dal sito di AMD.
Documentazione di riferimento
Pagine ufficiali consultate il 29 settembre 2026:
- Libreria Ollama — llama3.2
- Libreria Ollama — llama4
- Documentazione di Ollama — CLI Reference
- Documentazione di Ollama — Quickstart
- Documentazione di Ollama — Linux