gpt-oss è la famiglia di modelli a pesi aperti di OpenAI. È pensata per il ragionamento, i compiti agentici e il lavoro degli sviluppatori, ed è distribuita con licenza Apache 2.0. Questa guida è per chi ha già Ollama su un PC Linux e vuole usare gpt-oss sulla propria macchina. Per prima cosa si controlla il servizio e si sceglie la taglia. Poi si scarica il modello, lo si usa in chat da terminale e lo si interroga con l’API REST locale. Alla fine si vede come toglierlo per liberare spazio. I comandi sono quelli della documentazione ufficiale di Ollama e di OpenAI, elencata in fondo.
Cosa serve
- Un PC con Linux e Ollama installato come servizio systemd. Se non l’avete ancora, seguite la nostra guida all’installazione di Ollama su Linux.
- Per gpt-oss-20b servono 16GB di memoria, secondo il repository ufficiale di OpenAI e il blog di Ollama.
- Per gpt-oss-120b il blog di Ollama indica che il modello può stare in una singola GPU da 80GB, come una NVIDIA H100.
- Spazio su disco per il modello: nella libreria di Ollama la 20b pesa 14GB e la 120b 65GB.
Verificare che Ollama sia installato e il servizio attivo
Prima di scaricare il modello conviene controllare che Ollama risponda e che il servizio sia in esecuzione. Il primo comando stampa la versione installata.
ollama -v
Se il terminale risponde con un numero di versione, il programma è installato. Per gpt-oss serve però almeno Ollama 0.11.0, la versione che ha introdotto questi modelli: con una versione precedente aggiornate Ollama prima di proseguire. Il secondo comando viene dalla documentazione di Ollama per Linux e mostra lo stato del servizio systemd.
sudo systemctl status ollama
Il servizio deve risultare attivo. Se è fermo o non esiste, tornate alla guida di installazione: la parte sul servizio di avvio spiega come crearlo e avviarlo.
Scegliere la taglia del modello
gpt-oss ha due taglie. Secondo il repository di OpenAI, gpt-oss-20b ha 21 miliardi di parametri, di cui 3,6 miliardi attivi. È pensata per una latenza più bassa e per gli usi locali o specializzati. gpt-oss-120b ha 117 miliardi di parametri, di cui 5,1 miliardi attivi, ed è destinata alla produzione e ai compiti di ragionamento più impegnativi.
Il consumo di memoria resta contenuto grazie alla quantizzazione MXFP4 dei pesi mixture-of-experts, che sono oltre il 90% dei parametri totali. Ollama supporta questo formato in modo nativo, senza altre conversioni. Al 29 settembre 2026 la libreria di Ollama elenca questi tag:
| Tag | Dimensione nella libreria | Contesto | Dove gira |
|---|---|---|---|
gpt-oss:latest |
14GB | 128K | In locale (coincide con la 20b) |
gpt-oss:20b |
14GB | 128K | In locale |
gpt-oss:120b |
65GB | 128K | In locale |
gpt-oss:20b-cloud |
– | 128K | Cloud |
gpt-oss:120b-cloud |
– | 128K | Cloud |
Le varianti cloud non girano sul vostro computer e questa guida non le tratta. Su un PC normale la scelta sensata è la 20b. La 120b è pensata per macchine con molta memoria video, per esempio una singola GPU da 80GB.
Scaricare e avviare gpt-oss da terminale
Come indica la pagina ufficiale del modello, gpt-oss si può scaricare direttamente dal terminale. ollama run scarica il modello, se manca, e lo avvia. Senza tag si usa latest, che nella libreria corrisponde alla 20b da 14GB.
ollama run gpt-oss
Quando compare il prompt >>> potete scrivere la domanda e premere Invio. Come spiega la documentazione della CLI, per scrivere un testo su più righe basta racchiuderlo tra tre virgolette doppie (""").
Lasciate aperta la chat e, per i comandi dei passaggi successivi, aprite un secondo terminale: al prompt >>> si parla con il modello, non con la shell. Un comando scritto lì non viene eseguito: arriva al modello come se fosse una domanda.
In alternativa: scaricare e avviare una taglia esplicita
Se preferite indicare la taglia per nome, il repository di OpenAI propone due passaggi separati: prima si scarica il modello, poi lo si avvia. Separare le due operazioni è comodo se volete scaricare il modello subito e usarlo più tardi. Questi comandi vanno lanciati nella shell, non al prompt della chat. Per la 20b:
ollama pull gpt-oss:20b
ollama run gpt-oss:20b
Per la 120b, solo se avete l’hardware adatto e abbastanza spazio sul disco:
ollama pull gpt-oss:120b
ollama run gpt-oss:120b
Anche ollama run con il tag apre la chat interattiva, quindi vale la stessa regola di prima: per gli altri comandi usate un altro terminale. Attenzione ai nomi: la richiesta API d’esempio più sotto usa gpt-oss, cioè il tag latest. Se avete scaricato solo gpt-oss:20b, nella richiesta dovete scrivere quel nome.
Provare il modello via API REST
Oltre alla chat, Ollama espone un’API REST su localhost, alla porta 11434. Serve per collegare gpt-oss a script e programmi sulla stessa macchina. Il servizio deve essere attivo.
La richiesta va lanciata in un altro terminale, non al prompt >>> della chat. È la richiesta d’esempio della pagina ufficiale del modello e va incollata così com’è, anche se è su più righe.
curl http://localhost:11434/api/chat \
-d '{
"model": "gpt-oss",
"messages": [{"role": "user", "content": "Hello!"}]
}'
La richiesta manda all’endpoint /api/chat un messaggio dell’utente con il testo «Hello!». Se tutto funziona, nel terminale arriva la risposta del modello. Il campo model deve contenere il nome di un modello che avete scaricato: se avete solo la 20b con il tag esplicito, sostituite gpt-oss con gpt-oss:20b. La stessa pagina riporta anche esempi equivalenti per le librerie Python e JavaScript di Ollama.
Vedere i modelli scaricati e quelli in memoria
Due comandi della CLI di Ollama dicono cosa avete sul disco e cosa sta girando. Anche questi vanno lanciati nella shell. ollama ls elenca i modelli scaricati.
ollama ls
Nell’elenco dovrebbe comparire gpt-oss, con il nome che avete usato per scaricarlo. ollama ps elenca invece i modelli in esecuzione.
ollama ps
Serve per vedere se gpt-oss è ancora caricato.
Togliere il modello
Nella libreria la 20b pesa 14GB e la 120b 65GB. Se non vi servono più, conviene rimuoverle.
Attenzione: la rimozione cancella dal disco i file del modello indicato. Se sbagliate nome e togliete un altro modello, per riaverlo dovrete scaricarlo di nuovo per intero. Prima di procedere controllate il nome esatto nell’elenco.
Per prima cosa guardate l’elenco e copiate il nome esattamente com’è scritto, tag compreso: per esempio gpt-oss:latest, gpt-oss:20b o gpt-oss:120b.
ollama ls
Se il modello compare ancora tra quelli in esecuzione, fermatelo con il sottocomando stop di ollama, seguito dallo stesso nome. Poi rimuovetelo con il sottocomando rm, anche questo seguito dal nome completo. Nella documentazione della CLI i due sottocomandi compaiono solo con un altro modello d’esempio, per questo qui li descriviamo senza scrivere il comando completo. Alla fine lanciate di nuovo ollama ls: il modello non deve più comparire.
Se avete scaricato sia gpt-oss:latest sia gpt-oss:20b, ricordate che nella libreria corrispondono alla stessa taglia. Controllate nell’elenco quali voci ci sono e, se volete liberare tutto lo spazio, rimuovetele entrambe.
Fermare il servizio Ollama (facoltativo)
Se per un po’ non userete Ollama, potete fermare il servizio systemd con il comando della documentazione di Ollama per Linux. Finché non riavviate il servizio, l’API locale non risponde.
sudo systemctl stop ollama
Per controllare, rilanciate sudo systemctl status ollama: il servizio non deve più risultare attivo. Per disinstallare Ollama del tutto, seguite la sezione Uninstall della documentazione Linux oppure la nostra guida su Ollama. Tenete presente che la procedura di disinstallazione cancella anche i modelli scaricati.
Documentazione di riferimento
Pagine consultate il 29 settembre 2026:
- Ollama Library, gpt-oss (pagina del modello)
- GitHub openai/gpt-oss, repository ufficiale di OpenAI
- Blog di Ollama, OpenAI gpt-oss
- Documentazione di Ollama, CLI
- Documentazione di Ollama, Linux
La documentazione di Ollama per Linux è generica e non riguarda una distribuzione in particolare.