Gemma è la famiglia di modelli aperti di Google DeepMind. La versione attuale, Gemma 4, esiste in diverse taglie: le più piccole sono pensate per portatili e dispositivi mobili, le più grandi per le workstation. Questa guida è per chi vuole usare Gemma sul proprio computer senza passare da un servizio cloud. Prima si sceglie la taglia in base alla memoria, poi si usa uno di tre programmi: Ollama da terminale, LM Studio con la sua interfaccia grafica oppure LM Studio Bionic. Alla fine Gemma 4 risponde in chat sul PC e sapete come controllarla e rimuoverla. I comandi sono quelli della documentazione ufficiale, elencata in fondo.
Cosa serve
- Un programma per eseguire il modello, già installato: Ollama, LM Studio oppure LM Studio Bionic. Per Ollama c’è la nostra guida su come installare Ollama su Linux, per LM Studio quella su come installarlo e scaricare un modello e per Bionic la guida dedicata.
- Memoria: secondo il catalogo di LM Studio, la versione più piccola di Gemma 4 richiede almeno 4 GB di RAM e la più grande può arrivare a 19 GB. Il quickstart di Ollama dà un’indicazione solo per gemma4:e2b: consiglia 8 GB di VRAM disponibile, oppure di memoria unificata su Mac. Con meno VRAM Ollama può usare la RAM di sistema, ma le risposte possono essere più lente.
- Spazio su disco: il quickstart di Ollama indica per gemma4:e2b un download di circa 7,2 GB. Le dimensioni delle altre taglie sono nella tabella qui sotto.
Scegliere taglia e programma
Nelle sigle E2B ed E4B la «E» sta per parametri «effettivi»: sono i modelli pensati per i dispositivi edge. 12B, 26B e 31B sono invece i modelli da workstation. Il 26B è un Mixture of Experts che su 25,2 miliardi di parametri totali ne attiva 3,8, mentre il 31B è un modello denso. Tutti accettano testo e immagini; secondo le schede tecniche E2B ed E4B gestiscono anche l’audio.
La tabella mette insieme i dati della pagina di Gemma 4 nella libreria di Ollama e quelli del catalogo di LM Studio.
| Taglia | Tag Ollama | Dimensione su Ollama | Contesto | Variante LM Studio | Dimensione su LM Studio |
|---|---|---|---|---|---|
| E2B | gemma4:e2b | 4,6-7,5 GB | 128K | google/gemma-4-e2b | 4,20 GB |
| E4B | gemma4:e4b (anche latest) | 6,6-9,5 GB | 128K | google/gemma-4-e4b | 5,90 GB |
| 12B | gemma4:12b | 7,7-8,0 GB | 256K | google/gemma-4-12b | 7,40 GB |
| 26B A4B (MoE) | gemma4:26b | 16-19 GB | 256K | google/gemma-4-26b-a4b | 15,60 GB |
| 31B (denso) | gemma4:31b | 19-20 GB | 256K | google/gemma-4-31b | 19,00 GB |
Ollama offre anche le varianti con suffisso -mlx, in formato MLX, e quelle -cloud, che girano sul cloud di Ollama e non sul vostro computer. LM Studio aggiunge le varianti -qat, con le stesse dimensioni delle versioni normali. La pagina di Ollama non dice quanta memoria serve per ciascuna taglia, quindi conviene partire da e2b e salire solo se il computer regge. La scheda di LM Studio indica la licenza Apache 2.0 per tutta la famiglia.
Il programma si sceglie in base a come lavorate:
- Ollama: si usa tutto da terminale, con un server locale che risponde anche via API.
- LM Studio: offre un’interfaccia grafica per scaricare e usare i modelli, più la CLI
lmsper lavorare da terminale. - LM Studio Bionic: è un’app organizzata in sessioni, in cui si può scegliere un modello locale al posto di uno cloud.
Scaricare Gemma 4 e2b con Ollama
Si parte dalla taglia più piccola, che ha anche il download più leggero. Su Linux il server di Ollama deve essere in esecuzione: se non lo è, il quickstart indica di avviarlo con ollama serve. Il server resta attivo nel terminale in cui lo avete lanciato, quindi i comandi successivi vanno dati in un’altra finestra. Per scaricare il modello:
ollama pull gemma4:e2b
Per controllare che il download sia riuscito usate ollama ls, spiegato più avanti: nell’elenco deve comparire gemma4:e2b.
Provare Gemma 4 in chat da terminale
Questo comando apre una chat con il modello direttamente nel terminale. Se il modello non è ancora sul disco, Ollama prima lo scarica e poi avvia la chat.
ollama run gemma4:e2b
Scrivete una domanda e premete Invio. Per uscire dalla chat scrivete /bye.
Passare alle taglie più grandi di Gemma 4
Se e2b funziona bene e avete memoria libera, potete provare le altre taglie. Più la taglia è grande, più spazio occupa: controllate i valori in tabella prima di lanciarle. I comandi vengono dalla pagina ufficiale del modello e cambiano solo nel tag.
E4B, che corrisponde anche al tag latest:
ollama run gemma4:e4b
12B, il più piccolo dei modelli da workstation:
ollama run gemma4:12b
26B, il modello Mixture of Experts:
ollama run gemma4:26b
31B, il modello denso più grande:
ollama run gemma4:31b
Anche qui, se il tag non è sul disco Ollama lo scarica prima di avviare la chat.
Vedere quali modelli sono installati e quali sono in esecuzione
Quando avete scaricato più di una taglia, vi serve sapere cosa occupa il disco e cosa sta girando. La CLI Reference di Ollama prevede un comando per ciascuna delle due cose.
Per elencare i modelli presenti sul computer:
ollama ls
Qui trovate il nome esatto di ogni modello scaricato, per esempio gemma4:e2b. Per elencare invece i modelli in esecuzione:
ollama ps
Rimuovere Gemma 4 da Ollama
Ogni modello occupa parecchi gigabyte, quindi conviene togliere quelli che non usate. Un modello rimosso va poi riscaricato da zero, per cui controllate prima il nome con ollama ls.
Nel comando della documentazione il modello si chiama solo gemma4, senza taglia. Nella libreria di Ollama, al 30 settembre 2026, il tag latest corrisponde a e4b. Se avete scaricato e2b o un’altra taglia, scrivete ollama rm seguito dal nome esatto che mostra ollama ls, per esempio gemma4:e2b. Questo è il comando per il tag predefinito:
ollama rm gemma4
Dopo la rimozione lanciate di nuovo ollama ls: il modello non deve più comparire nell’elenco.
Scaricare Gemma 4 dal catalogo di LM Studio
Chi preferisce l’interfaccia grafica trova Gemma 4 nel catalogo di LM Studio. La pagina elenca le varianti con le loro dimensioni, ciascuna con il pulsante «Get». I modelli sono disponibili nei formati GGUF e MLX.
- Aprite la pagina di Gemma 4 nel catalogo di LM Studio.
- Scegliete una variante. Per cominciare va bene la più leggera, google/gemma-4-e2b da 4,20 GB.
- Premete «Get»: si apre la pagina di download del modello.
- Avviate il download nell’app, poi caricate il modello scaricato e aprite una chat.
Il download si può fare anche dal terminale. La pagina di download collegata dal catalogo indica per la variante più piccola il comando lms get google/gemma-4-e2b, e fra i comandi di lms elencati nella documentazione della CLI c’è proprio get, che serve a cercare e scaricare modelli. Per le altre varianti si parte dal pulsante «Get» della variante scelta.
Controllare il modello dal terminale con lms
lms è la CLI di LM Studio: arriva insieme all’app e non richiede altre installazioni. La documentazione di lms avverte che prima di usarla bisogna avviare LM Studio almeno una volta. Per controllare che la CLI risponda:
lms --help
Dovreste vedere l’elenco dei comandi disponibili, fra cui chat, get, ls e ps. Per vedere i modelli presenti sul disco:
lms ls
L’elenco segue la cartella dei modelli impostata nella scheda My Models dell’app, e la variante di Gemma 4 che avete scaricato deve comparire qui. Per vedere quali modelli sono caricati in memoria:
lms ps
Se avete caricato Gemma 4 nell’app per chattare, compare in questo elenco.
Usare Gemma 4 in LM Studio Bionic
La documentazione di Bionic sui modelli locali non nomina Gemma, ma descrive la procedura generale che vale per qualsiasi modello. I modelli scaricati girano sul computer senza consumare crediti di inferenza cloud.
- Aprite Settings e, sotto Local Models, scegliete Explore.
- Cercate Gemma 4. Per restringere i risultati potete usare i filtri per formato e le indicazioni su quali modelli sono adatti al dispositivo.
- Se sono disponibili più dispositivi, per esempio macchine remote collegate con LM Link, scegliete dove scaricare il modello.
- Selezionate formato e variante e avviate il download. Potete metterlo in pausa, riprenderlo, annullarlo o riprovare.
- Aprite Settings → Local Models → Library e controllate che il modello compaia fra quelli indicizzati sul dispositivo.
- Aprite una sessione Bionic e selezionate il modello dall’elenco.
Se qualcosa va storto
- Ollama risponde lentamente: con poca VRAM Ollama usa la RAM di sistema e le risposte possono rallentare. Il quickstart avverte anche che le finestre di contesto più ampie richiedono più memoria. Tornate a una taglia più piccola, come gemma4:e2b.
- Su Linux il server di Ollama non è in esecuzione: il quickstart indica di avviarlo con
ollama serve. Poi ripetete il comando da un’altra finestra del terminale. - lms non funziona: prima di usare la CLI bisogna aprire LM Studio almeno una volta.
Documentazione di riferimento
Pagine ufficiali consultate il 30 settembre 2026:
- Libreria di Ollama: Gemma 4 (tag, dimensioni, comandi)
- Documentazione di Ollama: Quickstart
- Documentazione di Ollama: CLI Reference
- Catalogo LM Studio: Gemma 4 (e la pagina di download collegata dal pulsante «Get»)
- Documentazione di LM Studio: lms, la CLI
- Documentazione di LM Studio Bionic: Download Local Models