Gemma è la famiglia di modelli aperti di Google DeepMind. I modelli Gemma 4 ricevono testo e immagini e rispondono con del testo. Con Ollama puoi scaricarli e usarli sul tuo computer. Questa guida è per chi ha già installato Ollama e vuole provare Gemma 4. Spiega come scegliere la taglia, come scaricarla, come usarla dal terminale e dall’API locale e come liberare memoria e disco quando hai finito. I comandi sono quelli della documentazione ufficiale di Ollama e di Google, elencata in fondo. Taglie e dimensioni sono quelle pubblicate da Ollama al 29 settembre 2026.
Cosa serve
- Ollama installato. Se non lo hai ancora, segui la nostra guida per installare Ollama su Linux e usare un modello in locale. La pagina di Google su Gemma e Ollama spiega anche come installarlo su Windows e Mac.
- Una connessione a internet per il download e spazio su disco a sufficienza. Le taglie principali pesano da 7,2 a 20 GB. Le varianti a precisione piena più grandi arrivano a 63-64 GB.
- Linux con Ollama avviato come servizio systemd, ma solo per i comandi
systemctlejournalctl. Tutti gli altri comandi sono quelli della CLI di Ollama. - La GPU non è obbligatoria. Google spiega che Ollama usa versioni quantizzate dei modelli, in formato GGUF, che girano anche su un portatile senza scheda grafica. In cambio, di solito le risposte sono un po’ meno buone.
Controllare che Ollama sia installato e in esecuzione
Prima di scaricare un modello, controlla che il terminale trovi il comando ollama. Questo comando stampa la versione installata:
ollama --version
Deve comparire una riga che comincia con «ollama version is», seguita dal numero di versione. Se non compare, Google consiglia di controllare che l’eseguibile di Ollama sia nel percorso del sistema.
Su Linux, Ollama può girare come servizio di sistema, come spiega la pagina Linux della documentazione di Ollama. Se il servizio è fermo, avvialo:
sudo systemctl start ollama
Poi controlla lo stato:
sudo systemctl status ollama
Il servizio deve risultare attivo. Se è in errore, vai alla sezione sui problemi più in basso.
Scegliere la taglia di Gemma 4
Nella libreria di Ollama ogni dimensione di Gemma 4 ha il suo tag. E2B ed E4B sono i modelli «edge», pensati per portatili e dispositivi piccoli. La «E» sta per parametri effettivi: circa 2,3 miliardi per E2B e 4,5 miliardi per E4B. Le taglie 12B, 26B e 31B sono i modelli «workstation». La 26B è un Mixture of Experts che attiva 3,8 miliardi di parametri su 25,2 miliardi totali. La 31B è un modello denso.
| Tag | Tipo | Download | Contesto |
|---|---|---|---|
gemma4:e2b |
Edge | 7,2 GB | 128K |
gemma4:e4b (è anche gemma4:latest) |
Edge | 9,6 GB | 128K |
gemma4:12b |
Workstation | 7,6 GB | 256K |
gemma4:26b |
Workstation, MoE | 19 GB | 256K |
gemma4:31b |
Workstation, denso | 20 GB | 256K |
Attenzione a un dettaglio della tabella: gemma4:12b pesa 7,6 GB, meno di gemma4:e4b, che ne pesa 9,6. Quindi il peso del download non ti dice quanto è grande il modello. Per capirlo, guarda il nome della taglia.
L’elenco completo dei tag contiene anche altre varianti:
- Altre quantizzazioni. I tag principali corrispondono alle versioni
q4_K_M: per esempiogemma4:e2bha lo stesso identificativo digemma4:e2b-it-q4_K_M. Le versioni-it-qatsono più leggere, con 4,3 GB per e2b e 6,1 GB per e4b. Le versioniq8_0ebf16pesano di più:gemma4:e2b-it-bf16pesa 10 GB,gemma4:26b-a4b-it-bf1652 GB egemma4:31b-it-bf1663 GB. - Varianti MLX, come
gemma4:e2b-mlx, con pesi simili alle versioni corrispondenti. - Varianti cloud, cioè
gemma4:cloudegemma4:31b-cloud. Non hanno un peso di download perché girano sul servizio online di Ollama. La CLI prevede anche i comandiollama signineollama signoutper entrare e uscire dall’account Ollama. Queste varianti però non fanno al caso nostro, perché lo scopo della guida è usare il modello in locale.
Le pagine di Ollama non dicono quanta RAM o memoria video serve per ogni taglia. Conviene quindi cominciare dalla più piccola o dal tag predefinito, e passare a una più grande solo se il computer regge.
Scaricare Gemma 4 con il tag predefinito
Appena installato, Ollama non contiene nessun modello: vanno scaricati con pull. Se non indichi un tag, questo comando scarica la variante predefinita, gemma4:latest, che è la e4b da 9,6 GB:
ollama pull gemma4
Google indica i modelli nella forma <nome_modello>:<tag>. Per scaricare un’altra taglia, quindi, a ollama pull passi il nome completo di tag, per esempio gemma4:e2b invece di gemma4.
Verificare che il modello sia presente in locale
Finito il download, controlla che il modello sia disponibile. Google indica questo comando:
ollama list
La documentazione della CLI di Ollama riporta anche la forma breve, che fa la stessa cosa:
ollama ls
Nell’elenco deve esserci gemma4. Se non c’è, ripeti il download e guarda se il terminale mostra degli errori.
Avviare la chat interattiva con Gemma
Il modo più semplice per parlare con il modello è la chat nel terminale. Questo comando la apre con il tag predefinito che hai appena scaricato:
ollama run gemma4
Sulla pagina del modello, Ollama indica questo comando per la taglia più piccola, E2B, che va bene sui PC con poche risorse:
ollama run gemma4:e2b
E2B è un modello diverso da quello predefinito e occupa altri 7,2 GB. Puoi scaricarlo prima con ollama pull seguito dal tag gemma4:e2b, come spiegato nel passaggio sul download. Poi controlla con ollama list che compaia nell’elenco.
Quando vedi il prompt >>>, puoi scrivere le tue domande. Per un testo su più righe, aprilo e chiudilo con tre virgolette doppie ("""). Per fermare la chat scrivi /bye oppure premi Ctrl+D. Le pagine usate per questa guida non spiegano come uscire: queste due sono le scorciatoie di uso comune.
Gemma 4 capisce anche le immagini. Nella documentazione della CLI, il percorso del file va tra le virgolette insieme alla domanda, dopo il nome del modello: l’esempio ufficiale è ollama run gemma4 "What's in this image? /Users/jmorgan/Desktop/smile.png". Sostituisci quel percorso con quello di un’immagine sul tuo computer.
Fare una domanda secca da terminale
Se scrivi la domanda subito dopo il nome del modello, Ollama risponde e non apre la chat. Secondo Google, questo uso della riga di comando è comodo negli script. L’esempio della guida di Google:
ollama run gemma4 "roses are red"
Nel terminale deve comparire la risposta del modello, e poi torni al prompt della shell.
Usare Gemma dall’API REST locale
Oltre alla CLI, Ollama mette a disposizione un servizio web locale sulla porta 11434, che ti serve per collegare Gemma ai tuoi programmi. La pagina del modello riporta questo esempio di chat con curl:
curl http://localhost:11434/api/chat \
-d '{
"model": "gemma4",
"messages": [{"role": "user", "content": "Hello!"}]
}'
Se tutto funziona, ricevi la risposta del modello al messaggio «Hello!». Sulla pagina di gemma4 ci sono anche esempi equivalenti in Python e JavaScript.
Impostazioni consigliate e ragionamento
La scheda del modello consiglia gli stessi parametri di campionamento per ogni uso: temperature=1.0, top_p=0.95 e top_k=64. Tutti i modelli Gemma 4 possono ragionare prima di rispondere. Per attivare il ragionamento, metti il token <|think|> all’inizio del prompt di sistema. Per disattivarlo, toglilo. Se mandi un’immagine insieme al testo, mettila prima del testo.
Vedere i modelli in memoria e liberarla
Questo comando mostra i modelli in esecuzione:
ollama ps
Se la memoria ti serve per altro, puoi fermare Gemma. Il comando della documentazione usa il tag predefinito:
ollama stop gemma4
Se invece stai usando un altro tag, come gemma4:e2b, scrivi quello al posto di gemma4. Poi rilancia ollama ps e controlla che il modello non ci sia più. Fermare un modello non lo cancella dal disco: per quello c’è ollama rm, spiegato più avanti.
Se qualcosa va storto
Se Ollama gira come servizio, la pagina Linux di Ollama indica questo comando per leggerne i log:
journalctl -e -u ollama
La documentazione cita anche questi problemi:
- Il comando
ollamanon viene trovato: l’eseguibile non è nel percorso del sistema, come visto nel primo passaggio. - Schede grafiche AMD Radeon: il driver amdgpu del kernel Linux ufficiale è una versione più vecchia e potrebbe non supportare tutte le funzioni ROCm. Ollama consiglia di installare il driver più recente dal sito di AMD.
Rimuovere Gemma dal disco
Se il modello non ti serve più, puoi cancellarlo e recuperare spazio. Il comando lo elimina dal disco: per usarlo di nuovo dovrai riscaricarlo. Prima controlla con ollama list il nome esatto del modello da rimuovere.
ollama rm gemma4
Questo comando rimuove il tag predefinito. Se hai scaricato anche gemma4:e2b, per rimuoverlo scrivi quel tag dopo ollama rm. Alla fine controlla con ollama list che il modello non sia più nell’elenco.
Documentazione di riferimento
Pagine consultate il 29 settembre 2026:
- Libreria di Ollama: gemma4, pagina del modello con tag e API
- Libreria di Ollama: gemma4, elenco completo dei tag
- Documentazione di Ollama: riferimento della CLI
- Documentazione di Ollama: Linux, servizio systemd e log
- Google AI for Developers: eseguire Gemma con Ollama