gpt-oss è la serie di modelli a pesi aperti di OpenAI. È pensata per il ragionamento, per i compiti agentici e per il lavoro degli sviluppatori. La licenza è Apache 2.0. Questa guida è per chi vuole usare gpt-oss sul proprio computer. Prima si sceglie la taglia in base alla memoria disponibile. Poi si scarica il modello con Ollama o con LM Studio, lo si prova dal terminale e alla fine si libera la memoria. Per LM Studio Bionic c’è il procedimento dall’interfaccia grafica. I comandi sono quelli della documentazione ufficiale, elencata in fondo e consultata il 30 settembre 2026.
Cosa serve
- Uno dei tre programmi già installato. Per Ollama c’è la nostra guida all’installazione su Linux, per LM Studio la guida a LM Studio e per Bionic la guida a LM Studio Bionic.
- Per gpt-oss-20b bastano 16 GB di memoria, secondo il README ufficiale di OpenAI.
- gpt-oss-120b sta in una singola GPU da 80 GB, secondo OpenAI (gli esempi citati sono NVIDIA H100 e AMD MI300X). Con meno memoria conviene la 20b.
- Spazio su disco: nella libreria di Ollama la 20b pesa 14 GB e la 120b 65 GB.
- Un terminale, per i passaggi con Ollama e con la riga di comando di LM Studio.
Scegliere la taglia di gpt-oss e il programma
OpenAI pubblica due modelli. Il più grande è pensato per la produzione e per gli usi generici che richiedono molto ragionamento. Il più piccolo punta su una latenza più bassa e sugli usi locali o specializzati. In tutti e due i pesi della parte mixture-of-experts sono quantizzati nel formato MXFP4: per questo occupano relativamente poca memoria.
| Modello | Parametri totali | Parametri attivi | Tag Ollama | Dimensione in Ollama | Memoria secondo OpenAI (con MXFP4) |
|---|---|---|---|---|---|
| gpt-oss-20b | 21 miliardi | 3,6 miliardi | gpt-oss:20b (anche gpt-oss:latest) |
14 GB | gira con 16 GB |
| gpt-oss-120b | 117 miliardi | 5,1 miliardi | gpt-oss:120b |
65 GB | sta in una GPU da 80 GB |
Ollama supporta il formato MXFP4 in modo nativo, senza altre quantizzazioni o conversioni. Su Ollama tutte e due le taglie hanno una finestra di contesto di 128K token. La pagina di gpt-oss nella libreria di Ollama elenca anche le varianti gpt-oss:20b-cloud e gpt-oss:120b-cloud, senza indicarne la dimensione. Questa guida usa solo le versioni da scaricare in locale. In tutti e due i modelli lo sforzo di ragionamento si regola su tre livelli: basso, medio e alto.
Il programma si sceglie in base a come si preferisce lavorare:
- Ollama ha gpt-oss nella sua libreria e si usa soprattutto dal terminale. È la strada che il README di OpenAI indica a chi ha hardware consumer.
- LM Studio scarica il modello con
lms, il suo strumento a riga di comando, e permette di chattare anche dal terminale. - LM Studio Bionic ha una documentazione che non nomina gpt-oss: spiega solo come scaricare e usare un modello locale in generale.
Avviare Ollama e scaricare gpt-oss-20b
Il download passa dal servizio di Ollama, che deve essere attivo. La guida all’installazione spiega come lo avvia il sistema. Se Ollama non è già in esecuzione, lo si avvia con il comando indicato nella documentazione della riga di comando di Ollama:
ollama serve
Su come gestire il terminale in cui lo si lancia rimandiamo alla stessa guida a Ollama su Linux. Con il servizio attivo si scarica la taglia piccola. Il comando è quello che il README di OpenAI indica per l’hardware consumer:
ollama pull gpt-oss:20b
Finito il download, si controlla l’elenco dei modelli installati:
ollama ls
Se è andato tutto bene, nell’elenco compare gpt-oss:20b.
Provare gpt-oss-20b nella chat di Ollama
Con il modello sul disco si apre una sessione interattiva. Secondo la pagina della libreria di Ollama, questo comando permette anche di scaricare il modello direttamente dal terminale.
ollama run gpt-oss:20b
Quando compare il prompt >>>, si scrive una domanda e si preme Invio. Un testo su più righe va racchiuso tra tre virgolette doppie ("""), all’inizio e alla fine.
Per controllare che il modello sia caricato, si lascia aperta la sessione e da un altro terminale si elencano i modelli in esecuzione:
ollama ps
Subito dopo una risposta, nell’elenco dovrebbe comparire gpt-oss:20b. Per impostazione predefinita Ollama libera la memoria dopo 5 minuti di inattività, anche se la sessione resta aperta. Se quindi il modello non compare dopo una lunga pausa, non è per forza un errore: alla richiesta successiva Ollama lo ricarica.
Le pagine consultate non riportano un comando per uscire dalla sessione interattiva. Per chiuderla basta chiudere la finestra del terminale in cui è aperta la chat.
Usare gpt-oss-120b se si ha la memoria per farlo
Nella libreria di Ollama la taglia grande pesa 65 GB. Secondo OpenAI la 120b sta in una singola GPU da 80 GB (per esempio una NVIDIA H100). Senza un hardware di questo tipo conviene restare sulla 20b. Anche LM Studio indica un ordine di grandezza simile: la sua pagina su lms load riporta come esempio una stima di 65,68 GB di memoria per gpt-oss-120b.
La taglia grande si avvia così:
ollama run gpt-oss:120b
La sessione funziona come quella della 20b: al prompt >>> si scrive la domanda e si preme Invio.
Fermare e cancellare gpt-oss da Ollama
Quando il modello non serve più lo si può fermare e, se non lo si vuole tenere, cancellare dal disco. La documentazione della CLI di Ollama prevede ollama stop per fermare un modello in esecuzione e ollama rm per rimuoverlo. A tutti e due si aggiunge il nome del modello: gpt-oss:20b, oppure gpt-oss:120b se si è scaricata la taglia grande. Nella documentazione questi comandi compaiono solo con un altro modello di esempio, quindi qui non li riportiamo già pronti.
ollama stopserve quando il modello compare tra quelli in esecuzione mostrati daollama ps.ollama rmrimuove il modello: per riusarlo bisognerà scaricarlo di nuovo, 14 GB per la 20b e 65 GB per la 120b.
Dopo la rimozione si controlla l’elenco:
ollama ls
Se gpt-oss:20b non compare più, il modello è stato tolto.
Scaricare gpt-oss-20b con LM Studio
Con LM Studio il download passa da lms, lo strumento a riga di comando del programma. Per la taglia piccola il README di OpenAI indica questo comando:
lms get openai/gpt-oss-20b
Per la taglia grande il README usa openai/gpt-oss-120b. Per la memoria necessaria vale quanto detto sopra.
Dopo il download il modello va caricato in memoria. Secondo la documentazione di lms load, si scrive lms load seguito dalla chiave del modello. La chiave si trova nell’elenco dei modelli scaricati mostrato da lms ls. Se non si indica nessun modello, lms load chiede quale caricare.
Tra le opzioni ci sono --gpu, che decide quanta parte del modello mettere sulla GPU, e --context-length, che fissa la lunghezza del contesto. Con --estimate-only si ottiene una stima della memoria necessaria senza caricare il modello: così si capisce in anticipo se il computer basta.
Chattare con gpt-oss dal terminale di LM Studio e liberare la memoria
Per una prova veloce non serve l’interfaccia grafica. La pagina di lms chat descrive una chat interattiva con un modello locale, direttamente nel terminale:
lms chat
Se non si indica un modello, lms chat chiede di sceglierne uno: si seleziona gpt-oss-20b dall’elenco e si comincia a scrivere.
Le pagine consultate non riportano un comando per uscire dalla chat: si chiude la finestra del terminale. Finita la chat, il modello resta caricato per 3600 secondi, il valore predefinito dell’opzione --ttl. Per togliere subito dalla memoria tutti i modelli caricati si apre un nuovo terminale e si lancia:
lms unload --all
Il comando libera la memoria ma non cancella il modello scaricato. Le pagine consultate non spiegano come cancellare un modello scaricato. Per la gestione dei modelli nell’app si può fare riferimento alla nostra guida a LM Studio.
Usare un modello locale in LM Studio Bionic
La pagina di Bionic sui modelli locali non nomina gpt-oss e non dice se il modello è nel catalogo. Descrive però il procedimento generale, valido per qualsiasi modello. I modelli scaricati girano sul computer senza consumare crediti di inferenza cloud.
- Aprire Settings e, sotto Local Models, scegliere Explore.
- Cercare il modello (per esempio scrivendo gpt-oss, se è disponibile) oppure sceglierne uno tra quelli elencati. I filtri per formato e le indicazioni sulla compatibilità con il dispositivo aiutano a restringere i risultati.
- Se ci sono più dispositivi disponibili (quelli remoti collegati con LM Link), scegliere dove scaricare il modello.
- Scegliere il formato e la variante, poi avviare il download. Il download si può mettere in pausa, riprendere, annullare o ritentare.
- Per usare il modello, aprire Settings → Local Models → Library, dove compaiono i modelli indicizzati sul dispositivo. Poi aprire una sessione di Bionic e scegliere il modello dall’elenco.
La pagina non spiega come rimuovere un modello scaricato in Bionic.
Documentazione di riferimento
Pagine ufficiali consultate il 30 settembre 2026:
- OpenAI — Repository openai/gpt-oss su GitHub (README)
- Libreria di Ollama — pagina del modello gpt-oss
- Documentazione di Ollama — riferimento della riga di comando
- Documentazione di LM Studio — lms load
- Documentazione di LM Studio — lms chat
- Documentazione di LM Studio Bionic — Download Local Models