Vai al contenuto
Schermata dell'interfaccia di chat con il modello locale gpt-oss:20b selezionato.

Immagine: Ollama

gpt-oss è la famiglia di modelli a pesi aperti di OpenAI. È pensata per il ragionamento, i compiti agentici e il lavoro degli sviluppatori, ed è distribuita con licenza Apache 2.0. Questa guida è per chi ha già Ollama su un PC Linux e vuole usare gpt-oss sulla propria macchina. Per prima cosa si controlla il servizio e si sceglie la taglia. Poi si scarica il modello, lo si usa in chat da terminale e lo si interroga con l’API REST locale. Alla fine si vede come toglierlo per liberare spazio. I comandi sono quelli della documentazione ufficiale di Ollama e di OpenAI, elencata in fondo.

Cosa serve

Verificare che Ollama sia installato e il servizio attivo

Prima di scaricare il modello conviene controllare che Ollama risponda e che il servizio sia in esecuzione. Il primo comando stampa la versione installata.

ollama -v

Se il terminale risponde con un numero di versione, il programma è installato. Per gpt-oss serve però almeno Ollama 0.11.0, la versione che ha introdotto questi modelli: con una versione precedente aggiornate Ollama prima di proseguire. Il secondo comando viene dalla documentazione di Ollama per Linux e mostra lo stato del servizio systemd.

sudo systemctl status ollama

Il servizio deve risultare attivo. Se è fermo o non esiste, tornate alla guida di installazione: la parte sul servizio di avvio spiega come crearlo e avviarlo.

Scegliere la taglia del modello

gpt-oss ha due taglie. Secondo il repository di OpenAI, gpt-oss-20b ha 21 miliardi di parametri, di cui 3,6 miliardi attivi. È pensata per una latenza più bassa e per gli usi locali o specializzati. gpt-oss-120b ha 117 miliardi di parametri, di cui 5,1 miliardi attivi, ed è destinata alla produzione e ai compiti di ragionamento più impegnativi.

Il consumo di memoria resta contenuto grazie alla quantizzazione MXFP4 dei pesi mixture-of-experts, che sono oltre il 90% dei parametri totali. Ollama supporta questo formato in modo nativo, senza altre conversioni. Al 29 settembre 2026 la libreria di Ollama elenca questi tag:

Tag Dimensione nella libreria Contesto Dove gira
gpt-oss:latest 14GB 128K In locale (coincide con la 20b)
gpt-oss:20b 14GB 128K In locale
gpt-oss:120b 65GB 128K In locale
gpt-oss:20b-cloud – 128K Cloud
gpt-oss:120b-cloud – 128K Cloud

Le varianti cloud non girano sul vostro computer e questa guida non le tratta. Su un PC normale la scelta sensata è la 20b. La 120b è pensata per macchine con molta memoria video, per esempio una singola GPU da 80GB.

Scaricare e avviare gpt-oss da terminale

Come indica la pagina ufficiale del modello, gpt-oss si può scaricare direttamente dal terminale. ollama run scarica il modello, se manca, e lo avvia. Senza tag si usa latest, che nella libreria corrisponde alla 20b da 14GB.

ollama run gpt-oss

Quando compare il prompt >>> potete scrivere la domanda e premere Invio. Come spiega la documentazione della CLI, per scrivere un testo su più righe basta racchiuderlo tra tre virgolette doppie (""").

Lasciate aperta la chat e, per i comandi dei passaggi successivi, aprite un secondo terminale: al prompt >>> si parla con il modello, non con la shell. Un comando scritto lì non viene eseguito: arriva al modello come se fosse una domanda.

In alternativa: scaricare e avviare una taglia esplicita

Se preferite indicare la taglia per nome, il repository di OpenAI propone due passaggi separati: prima si scarica il modello, poi lo si avvia. Separare le due operazioni è comodo se volete scaricare il modello subito e usarlo più tardi. Questi comandi vanno lanciati nella shell, non al prompt della chat. Per la 20b:

ollama pull gpt-oss:20b
ollama run gpt-oss:20b

Per la 120b, solo se avete l’hardware adatto e abbastanza spazio sul disco:

ollama pull gpt-oss:120b
ollama run gpt-oss:120b

Anche ollama run con il tag apre la chat interattiva, quindi vale la stessa regola di prima: per gli altri comandi usate un altro terminale. Attenzione ai nomi: la richiesta API d’esempio più sotto usa gpt-oss, cioè il tag latest. Se avete scaricato solo gpt-oss:20b, nella richiesta dovete scrivere quel nome.

Provare il modello via API REST

Oltre alla chat, Ollama espone un’API REST su localhost, alla porta 11434. Serve per collegare gpt-oss a script e programmi sulla stessa macchina. Il servizio deve essere attivo.

La richiesta va lanciata in un altro terminale, non al prompt >>> della chat. È la richiesta d’esempio della pagina ufficiale del modello e va incollata così com’è, anche se è su più righe.

curl http://localhost:11434/api/chat \
  -d '{
    "model": "gpt-oss",
    "messages": [{"role": "user", "content": "Hello!"}]
  }'

La richiesta manda all’endpoint /api/chat un messaggio dell’utente con il testo «Hello!». Se tutto funziona, nel terminale arriva la risposta del modello. Il campo model deve contenere il nome di un modello che avete scaricato: se avete solo la 20b con il tag esplicito, sostituite gpt-oss con gpt-oss:20b. La stessa pagina riporta anche esempi equivalenti per le librerie Python e JavaScript di Ollama.

Vedere i modelli scaricati e quelli in memoria

Due comandi della CLI di Ollama dicono cosa avete sul disco e cosa sta girando. Anche questi vanno lanciati nella shell. ollama ls elenca i modelli scaricati.

ollama ls

Nell’elenco dovrebbe comparire gpt-oss, con il nome che avete usato per scaricarlo. ollama ps elenca invece i modelli in esecuzione.

ollama ps

Serve per vedere se gpt-oss è ancora caricato.

Togliere il modello

Nella libreria la 20b pesa 14GB e la 120b 65GB. Se non vi servono più, conviene rimuoverle.

Attenzione: la rimozione cancella dal disco i file del modello indicato. Se sbagliate nome e togliete un altro modello, per riaverlo dovrete scaricarlo di nuovo per intero. Prima di procedere controllate il nome esatto nell’elenco.

Per prima cosa guardate l’elenco e copiate il nome esattamente com’è scritto, tag compreso: per esempio gpt-oss:latest, gpt-oss:20b o gpt-oss:120b.

ollama ls

Se il modello compare ancora tra quelli in esecuzione, fermatelo con il sottocomando stop di ollama, seguito dallo stesso nome. Poi rimuovetelo con il sottocomando rm, anche questo seguito dal nome completo. Nella documentazione della CLI i due sottocomandi compaiono solo con un altro modello d’esempio, per questo qui li descriviamo senza scrivere il comando completo. Alla fine lanciate di nuovo ollama ls: il modello non deve più comparire.

Se avete scaricato sia gpt-oss:latest sia gpt-oss:20b, ricordate che nella libreria corrispondono alla stessa taglia. Controllate nell’elenco quali voci ci sono e, se volete liberare tutto lo spazio, rimuovetele entrambe.

Fermare il servizio Ollama (facoltativo)

Se per un po’ non userete Ollama, potete fermare il servizio systemd con il comando della documentazione di Ollama per Linux. Finché non riavviate il servizio, l’API locale non risponde.

sudo systemctl stop ollama

Per controllare, rilanciate sudo systemctl status ollama: il servizio non deve più risultare attivo. Per disinstallare Ollama del tutto, seguite la sezione Uninstall della documentazione Linux oppure la nostra guida su Ollama. Tenete presente che la procedura di disinstallazione cancella anche i modelli scaricati.

Documentazione di riferimento

Pagine consultate il 29 settembre 2026:

La documentazione di Ollama per Linux è generica e non riguarda una distribuzione in particolare.

Leggi anche