Vai al contenuto
Schermata della pagina del modello Gemma 4 sul sito di Ollama con i comandi e le taglie disponibili.

Schermata: ollama.com

Gemma è la famiglia di modelli aperti di Google DeepMind. I modelli Gemma 4 ricevono testo e immagini e rispondono con del testo. Con Ollama puoi scaricarli e usarli sul tuo computer. Questa guida è per chi ha già installato Ollama e vuole provare Gemma 4. Spiega come scegliere la taglia, come scaricarla, come usarla dal terminale e dall’API locale e come liberare memoria e disco quando hai finito. I comandi sono quelli della documentazione ufficiale di Ollama e di Google, elencata in fondo. Taglie e dimensioni sono quelle pubblicate da Ollama al 29 settembre 2026.

Cosa serve

  • Ollama installato. Se non lo hai ancora, segui la nostra guida per installare Ollama su Linux e usare un modello in locale. La pagina di Google su Gemma e Ollama spiega anche come installarlo su Windows e Mac.
  • Una connessione a internet per il download e spazio su disco a sufficienza. Le taglie principali pesano da 7,2 a 20 GB. Le varianti a precisione piena più grandi arrivano a 63-64 GB.
  • Linux con Ollama avviato come servizio systemd, ma solo per i comandi systemctl e journalctl. Tutti gli altri comandi sono quelli della CLI di Ollama.
  • La GPU non è obbligatoria. Google spiega che Ollama usa versioni quantizzate dei modelli, in formato GGUF, che girano anche su un portatile senza scheda grafica. In cambio, di solito le risposte sono un po’ meno buone.

Controllare che Ollama sia installato e in esecuzione

Prima di scaricare un modello, controlla che il terminale trovi il comando ollama. Questo comando stampa la versione installata:

ollama --version

Deve comparire una riga che comincia con «ollama version is», seguita dal numero di versione. Se non compare, Google consiglia di controllare che l’eseguibile di Ollama sia nel percorso del sistema.

Su Linux, Ollama può girare come servizio di sistema, come spiega la pagina Linux della documentazione di Ollama. Se il servizio è fermo, avvialo:

sudo systemctl start ollama

Poi controlla lo stato:

sudo systemctl status ollama

Il servizio deve risultare attivo. Se è in errore, vai alla sezione sui problemi più in basso.

Scegliere la taglia di Gemma 4

Nella libreria di Ollama ogni dimensione di Gemma 4 ha il suo tag. E2B ed E4B sono i modelli «edge», pensati per portatili e dispositivi piccoli. La «E» sta per parametri effettivi: circa 2,3 miliardi per E2B e 4,5 miliardi per E4B. Le taglie 12B, 26B e 31B sono i modelli «workstation». La 26B è un Mixture of Experts che attiva 3,8 miliardi di parametri su 25,2 miliardi totali. La 31B è un modello denso.

Tag Tipo Download Contesto
gemma4:e2b Edge 7,2 GB 128K
gemma4:e4b (è anche gemma4:latest) Edge 9,6 GB 128K
gemma4:12b Workstation 7,6 GB 256K
gemma4:26b Workstation, MoE 19 GB 256K
gemma4:31b Workstation, denso 20 GB 256K

Attenzione a un dettaglio della tabella: gemma4:12b pesa 7,6 GB, meno di gemma4:e4b, che ne pesa 9,6. Quindi il peso del download non ti dice quanto è grande il modello. Per capirlo, guarda il nome della taglia.

L’elenco completo dei tag contiene anche altre varianti:

  • Altre quantizzazioni. I tag principali corrispondono alle versioni q4_K_M: per esempio gemma4:e2b ha lo stesso identificativo di gemma4:e2b-it-q4_K_M. Le versioni -it-qat sono più leggere, con 4,3 GB per e2b e 6,1 GB per e4b. Le versioni q8_0 e bf16 pesano di più: gemma4:e2b-it-bf16 pesa 10 GB, gemma4:26b-a4b-it-bf16 52 GB e gemma4:31b-it-bf16 63 GB.
  • Varianti MLX, come gemma4:e2b-mlx, con pesi simili alle versioni corrispondenti.
  • Varianti cloud, cioè gemma4:cloud e gemma4:31b-cloud. Non hanno un peso di download perché girano sul servizio online di Ollama. La CLI prevede anche i comandi ollama signin e ollama signout per entrare e uscire dall’account Ollama. Queste varianti però non fanno al caso nostro, perché lo scopo della guida è usare il modello in locale.

Le pagine di Ollama non dicono quanta RAM o memoria video serve per ogni taglia. Conviene quindi cominciare dalla più piccola o dal tag predefinito, e passare a una più grande solo se il computer regge.

Scaricare Gemma 4 con il tag predefinito

Appena installato, Ollama non contiene nessun modello: vanno scaricati con pull. Se non indichi un tag, questo comando scarica la variante predefinita, gemma4:latest, che è la e4b da 9,6 GB:

ollama pull gemma4

Google indica i modelli nella forma <nome_modello>:<tag>. Per scaricare un’altra taglia, quindi, a ollama pull passi il nome completo di tag, per esempio gemma4:e2b invece di gemma4.

Verificare che il modello sia presente in locale

Finito il download, controlla che il modello sia disponibile. Google indica questo comando:

ollama list

La documentazione della CLI di Ollama riporta anche la forma breve, che fa la stessa cosa:

ollama ls

Nell’elenco deve esserci gemma4. Se non c’è, ripeti il download e guarda se il terminale mostra degli errori.

Avviare la chat interattiva con Gemma

Il modo più semplice per parlare con il modello è la chat nel terminale. Questo comando la apre con il tag predefinito che hai appena scaricato:

ollama run gemma4

Sulla pagina del modello, Ollama indica questo comando per la taglia più piccola, E2B, che va bene sui PC con poche risorse:

ollama run gemma4:e2b

E2B è un modello diverso da quello predefinito e occupa altri 7,2 GB. Puoi scaricarlo prima con ollama pull seguito dal tag gemma4:e2b, come spiegato nel passaggio sul download. Poi controlla con ollama list che compaia nell’elenco.

Quando vedi il prompt >>>, puoi scrivere le tue domande. Per un testo su più righe, aprilo e chiudilo con tre virgolette doppie ("""). Per fermare la chat scrivi /bye oppure premi Ctrl+D. Le pagine usate per questa guida non spiegano come uscire: queste due sono le scorciatoie di uso comune.

Gemma 4 capisce anche le immagini. Nella documentazione della CLI, il percorso del file va tra le virgolette insieme alla domanda, dopo il nome del modello: l’esempio ufficiale è ollama run gemma4 "What's in this image? /Users/jmorgan/Desktop/smile.png". Sostituisci quel percorso con quello di un’immagine sul tuo computer.

Fare una domanda secca da terminale

Se scrivi la domanda subito dopo il nome del modello, Ollama risponde e non apre la chat. Secondo Google, questo uso della riga di comando è comodo negli script. L’esempio della guida di Google:

ollama run gemma4 "roses are red"

Nel terminale deve comparire la risposta del modello, e poi torni al prompt della shell.

Usare Gemma dall’API REST locale

Oltre alla CLI, Ollama mette a disposizione un servizio web locale sulla porta 11434, che ti serve per collegare Gemma ai tuoi programmi. La pagina del modello riporta questo esempio di chat con curl:

curl http://localhost:11434/api/chat \
  -d '{
    "model": "gemma4",
    "messages": [{"role": "user", "content": "Hello!"}]
  }'

Se tutto funziona, ricevi la risposta del modello al messaggio «Hello!». Sulla pagina di gemma4 ci sono anche esempi equivalenti in Python e JavaScript.

Impostazioni consigliate e ragionamento

La scheda del modello consiglia gli stessi parametri di campionamento per ogni uso: temperature=1.0, top_p=0.95 e top_k=64. Tutti i modelli Gemma 4 possono ragionare prima di rispondere. Per attivare il ragionamento, metti il token <|think|> all’inizio del prompt di sistema. Per disattivarlo, toglilo. Se mandi un’immagine insieme al testo, mettila prima del testo.

Vedere i modelli in memoria e liberarla

Questo comando mostra i modelli in esecuzione:

ollama ps

Se la memoria ti serve per altro, puoi fermare Gemma. Il comando della documentazione usa il tag predefinito:

ollama stop gemma4

Se invece stai usando un altro tag, come gemma4:e2b, scrivi quello al posto di gemma4. Poi rilancia ollama ps e controlla che il modello non ci sia più. Fermare un modello non lo cancella dal disco: per quello c’è ollama rm, spiegato più avanti.

Se qualcosa va storto

Se Ollama gira come servizio, la pagina Linux di Ollama indica questo comando per leggerne i log:

journalctl -e -u ollama

La documentazione cita anche questi problemi:

  • Il comando ollama non viene trovato: l’eseguibile non è nel percorso del sistema, come visto nel primo passaggio.
  • Schede grafiche AMD Radeon: il driver amdgpu del kernel Linux ufficiale è una versione più vecchia e potrebbe non supportare tutte le funzioni ROCm. Ollama consiglia di installare il driver più recente dal sito di AMD.

Rimuovere Gemma dal disco

Se il modello non ti serve più, puoi cancellarlo e recuperare spazio. Il comando lo elimina dal disco: per usarlo di nuovo dovrai riscaricarlo. Prima controlla con ollama list il nome esatto del modello da rimuovere.

ollama rm gemma4

Questo comando rimuove il tag predefinito. Se hai scaricato anche gemma4:e2b, per rimuoverlo scrivi quel tag dopo ollama rm. Alla fine controlla con ollama list che il modello non sia più nell’elenco.

Documentazione di riferimento

Pagine consultate il 29 settembre 2026:

Leggi anche