Vai al contenuto
Pagina di Llama 3.2 sul sito di Ollama con i dettagli sul modello da 1B e 3B, dimensioni e comandi di download.

Schermata: ollama.com

Questa guida è per chi ha già Ollama sul computer e vuole usare in locale un modello Llama di Meta, senza mandare le proprie domande a un servizio esterno. Il punto più delicato è scegliere la versione da scaricare, perché alcune occupano un paio di gigabyte e altre centinaia. Alla fine avrai Llama 3.2 funzionante e lo saprai usare sia nella chat da terminale sia con l’API locale di Ollama. Saprai anche controllare quali modelli sono sul disco e come toglierli. I comandi sono quelli della documentazione ufficiale di Ollama e delle pagine dei modelli, elencate in fondo.

Cosa serve

Le pagine dei modelli riportano quanto pesano i file, ma non quanta RAM o VRAM serve per farli girare. Se non sai quanta memoria ti serve, parti dalla taglia più piccola.

Controllare che Ollama sia installato e attivo

Prima di scaricare un modello controlla due cose: che il programma risponda e che il server di Ollama sia in esecuzione. Questo comando stampa la versione installata:

ollama -v

Se il comando non viene trovato, Ollama non è installato: torna alla guida all’installazione. Se invece compare un numero di versione, su Linux controlla lo stato del servizio systemd:

sudo systemctl status ollama

Nell’output cerca la riga che dice se il servizio è attivo. Se è fermo, avvialo con il comando indicato nella documentazione per Linux:

sudo systemctl start ollama

Poi ricontrolla lo stato: il servizio deve risultare attivo.

Questi comandi funzionano solo se Ollama è installato come servizio. Con l’installazione manuale, se non hai creato il file di servizio, la documentazione per Linux dice di avviare il server con ollama serve e di aprire un altro terminale per il resto. Su macOS e Windows systemctl non serve: la guida rapida dice di aprire l’app di Ollama.

Scegliere la versione di Llama adatta al proprio computer

Nella libreria di Ollama ci sono più generazioni di Llama. Qui confrontiamo Llama 3.2 e Llama 4, due modelli con dimensioni molto diverse:

Tag Ollama Dimensione Contesto Input
llama3.2:1b 1,3 GB 128K Testo
llama3.2:3b (anche latest) 2,0 GB 128K Testo
llama4:16x17b (anche latest) 67 GB 10M Testo, immagini
llama4:128x17b 245 GB 1M Testo, immagini

Su un PC normale conviene partire da Llama 3.2. La versione 3B è quella predefinita e, secondo la pagina del modello, supera Gemma 2 2.6B e Phi 3.5-mini nel seguire istruzioni, riassumere, riscrivere prompt e usare strumenti. La 1B è pensata per compiti più leggeri: gestire informazioni personali, recuperare informazioni in più lingue, riscrivere testi direttamente sul dispositivo. L’italiano è una delle otto lingue supportate ufficialmente.

Llama 4 funziona diversamente: usa un’architettura mixture-of-experts e accetta anche immagini in ingresso. Nella pagina, Scout ha 109 miliardi di parametri, di cui 17 miliardi attivi, e Maverick ne ha 400 miliardi, sempre con 17 miliardi attivi. La pagina dà le dimensioni per tag: 67 GB per llama4:16x17b e 245 GB per llama4:128x17b. Non dice quanta memoria serve per farli girare.

Scaricare e avviare Llama 3.2

Il comando ollama run scarica il modello e apre una chat nel terminale. Per la versione predefinita, quella da 3 miliardi di parametri, basta il nome del modello:

ollama run llama3.2

Se hai poca memoria o vuoi fare solo una prova veloce, usa la variante da 1 miliardo di parametri:

ollama run llama3.2:1b

La prima volta Ollama scarica i file del modello. Finito il download, compare il prompt della chat e puoi scrivere la prima domanda.

Provare il modello e uscire dalla chat

Scrivi una domanda e premi Invio. Per esempio puoi chiedere di riassumere un paragrafo in italiano o di riscrivere una frase in tono più formale. Per un testo su più righe, il riferimento della riga di comando di Ollama spiega che il blocco si apre e si chiude con tre virgolette doppie.

Quando hai finito, esci dalla chat con il comando indicato nella guida rapida:

/bye

Torni al normale prompt del terminale. Uscire dalla chat non cancella il modello: per toglierlo dal disco c’è un comando apposta, spiegato più avanti.

Vedere quali modelli sono scaricati e quali sono in memoria

Dopo qualche prova è facile perdere il conto di cosa c’è sul disco. Questo comando elenca i modelli scaricati:

ollama ls

Nell’elenco devi trovare llama3.2 oppure llama3.2:1b, secondo cosa hai scaricato. Un modello scaricato però non è per forza caricato in memoria. Per vedere quali modelli stanno girando in quel momento usa:

ollama ps

È utile soprattutto quando il computer rallenta e vuoi sapere se un modello sta ancora occupando memoria.

Usare Llama 3.2 con l’API locale di Ollama

La chat nel terminale va bene per le prove. Per collegare Llama a uno script o a un altro programma si usa l’API che Ollama espone in locale sulla porta 11434. La pagina di Llama 3.2 riporta questa richiesta di esempio con curl:

curl http://localhost:11434/api/chat \
  -d '{
    "model": "llama3.2",
    "messages": [{"role": "user", "content": "Hello!"}]
  }'

La richiesta manda al modello llama3.2 il messaggio «Hello!» come utente. Il campo model indica il tag da usare, quindi deve corrispondere a un modello che hai scaricato.

Negli esempi della guida rapida la risposta dell’API di Ollama si legge nel campo message.content. La pagina del modello ha anche esempi in Python e JavaScript con le librerie ufficiali di Ollama.

Solo per chi ha molta memoria: Llama 4 Scout

Se ti serve un modello che capisca anche le immagini e hai un computer con molta memoria, puoi provare Llama 4 Scout. Prima però leggi la restrizione della sua Acceptable Use Policy: per i modelli multimodali di Llama 4 i diritti della licenza non sono concessi a chi risiede nell’Unione europea né alle aziende con sede principale nell’UE (l’esclusione non vale per chi usa un prodotto o servizio che incorpora il modello). La pagina di Llama 4 lo descrive come multimodale: accetta testo e immagini e risponde con testo e codice. Nella sezione dei modelli si avvia così:

ollama run llama4:scout

La pagina non dice quanto pesa il tag llama4:scout. Per confronto, il tag latest di Llama 4, cioè llama4:16x17b, pesa 67 GB. Prima di lanciare il comando controlla di avere parecchio spazio libero sul disco. Secondo la stessa pagina, la comprensione delle immagini di Llama 4 è stata testata con al massimo 5 immagini in ingresso.

Fermare e rimuovere il modello

Il riferimento della riga di comando descrive due operazioni diverse. ollama stop seguito dal nome del modello ferma un modello in esecuzione. ollama rm seguito dal nome lo cancella dal disco. Negli esempi della documentazione il modello è un altro (gemma4): al suo posto scrivi il tag che hai scaricato.

Attenzione: ollama rm cancella il modello dal disco. Per usarlo di nuovo dovrai riscaricarlo tutto: 1,3 o 2,0 GB per Llama 3.2, 67 GB per llama4:16x17b. Prima di cancellarlo, controlla con ollama ls il nome esatto del tag da togliere.

  1. Per fermare il modello, scrivi ollama stop seguito dal tag, per esempio llama3.2 o llama3.2:1b. Poi controlla con ollama ps che non sia più tra i modelli in esecuzione.
  2. Per liberare spazio, scrivi ollama rm seguito dallo stesso tag.
  3. Lancia di nuovo ollama ls e controlla che il modello non sia più nell’elenco.

Controlla bene il tag: se hai scaricato sia la 3B sia la 1B, sono due voci distinte e, se ne togli una, l’altra resta sul disco.

Licenza d’uso di Llama 4

La pagina di Llama 4 su Ollama nomina la «Llama 4 Community License» insieme a una Acceptable Use Policy, cioè le regole sugli usi consentiti. Secondo la pagina, Llama 4 è pensato per uso commerciale e di ricerca in più lingue. Sono esclusi gli usi che violano leggi e regolamenti, comprese le norme sul commercio internazionale, e quelli vietati dalla policy o dalla licenza.

Per chi è in Italia conta soprattutto un punto della Acceptable Use Policy di Llama 4: per i modelli multimodali, come Scout, i diritti di licenza non sono concessi alle persone residenti nell’Unione europea né alle aziende con sede principale nell’UE. Fanno eccezione gli utenti finali di prodotti o servizi che incorporano il modello.

La pagina di Llama 3.2 su Ollama non riporta i termini di licenza. Se vuoi usare Llama in un progetto di lavoro, leggi per intero la licenza della versione che hai scelto prima di cominciare.

Se qualcosa va storto

  • Il server non risponde. Su Linux controlla il servizio con systemctl status e, se è fermo, avvialo con systemctl start, come nel primo passaggio. Se il servizio non esiste, avvia il server con ollama serve. La pagina Linux spiega anche come leggere i log del servizio con journalctl.
  • Le risposte sono lente. Secondo la guida rapida, se la VRAM non basta Ollama può usare la RAM di sistema, ma le risposte possono essere più lente. Anche le finestre di contesto più ampie richiedono più memoria. In questi casi prova la variante llama3.2:1b.
  • La GPU AMD non viene sfruttata bene. La documentazione per Linux avverte che il driver amdgpu incluso nel kernel è una versione più vecchia e potrebbe non supportare tutte le funzioni di ROCm. Per questo consiglia di installare il driver più recente dal sito di AMD.

Documentazione di riferimento

Pagine ufficiali consultate il 29 settembre 2026:

Leggi anche