Vai al contenuto
La pagina del modello Qwen 3.5 su Ollama con l'elenco di tutte le taglie disponibili per il download.

Schermata: ollama.com

Qwen3.5 è una famiglia di modelli multimodali open source. Ollama la distribuisce in sette taglie, con file che vanno da 1,0 GB a 81 GB. Questa guida è per chi ha già Ollama sul PC e vuole provare Qwen senza passare dal cloud. Alla fine saprete quale taglia scaricare, come usarla dal terminale, come interrogarla da uno script con l’API locale e come toglierla dal disco quando non vi serve più. I comandi sono quelli della documentazione ufficiale di Ollama e della pagina del modello, elencate in fondo.

Cosa serve

  • Un PC con Ollama già installato. Ollama esiste per macOS, Windows e Linux. Il controllo del servizio che trovate più avanti riguarda solo Linux, dove Ollama si può configurare come servizio di systemd.
  • Spazio su disco sufficiente per la taglia scelta: da 1,0 GB per la più piccola a 81 GB per la più grande (la tabella è più avanti).
  • Una connessione a Internet per scaricare il modello.
  • Il programma curl, se volete provare l’API.

Se Ollama non è ancora installato, partite dalla nostra guida su come installare Ollama su Linux e usare un modello in locale e poi tornate qui.

Controllare che Ollama sia installato e in esecuzione

Prima di scaricare un modello conviene verificare due cose: che il comando ollama risponda e che il server sia attivo. È il server a caricare i modelli e a esporre l’API. Il primo controllo, indicato nella documentazione di Ollama per Linux, chiede la versione del programma:

ollama -v

Se il terminale stampa un numero di versione, il programma c’è. Se la shell non trova il comando, dovete prima installare Ollama. Su macOS e Windows questo controllo basta.

Su Linux, se avete configurato Ollama come servizio di systemd, controllate anche che il servizio sia attivo:

sudo systemctl status ollama

Lo stato deve risultare attivo. Se il servizio è fermo, la stessa pagina della documentazione spiega come avviarlo e come consultarne i log.

Scegliere la taglia di Qwen3.5

La pagina di Qwen3.5 nella libreria di Ollama elenca sette taglie, indicate con il numero di parametri in miliardi. Tutte hanno una finestra di contesto di 256K e accettano sia testo sia immagini. Il modello supporta anche gli strumenti (tools) e il ragionamento (thinking).

Tag Dimensione del file Contesto Input
qwen3.5:0.8b 1,0 GB 256K Testo, immagini
qwen3.5:2b 2,7 GB 256K Testo, immagini
qwen3.5:4b 3,4 GB 256K Testo, immagini
qwen3.5:9b (latest) 6,6 GB 256K Testo, immagini
qwen3.5:27b 17 GB 256K Testo, immagini
qwen3.5:35b 24 GB 256K Testo, immagini
qwen3.5:122b 81 GB 256K Testo, immagini

Attenzione a come si legge la tabella: sono le dimensioni dei file da scaricare, non la memoria che serve per far girare il modello. La pagina di Qwen3.5 non indica requisiti di RAM o VRAM. La guida rapida di Ollama ricorda però, in generale, che finestre di contesto più ampie richiedono più memoria. Aggiunge che con poca VRAM Ollama può appoggiarsi alla RAM di sistema, ma le risposte possono essere più lente.

Conviene quindi partire dalla taglia più piccola, controllare che tutto funzioni e passare a una più grande solo se il PC regge. La pagina elenca anche alcune varianti con suffisso -mlx, con dimensioni diverse. Qui usiamo solo i tag standard.

Scaricare e avviare Qwen3.5 da 0.8b

Per cominciare va bene la taglia più piccola. Secondo la pagina del tag qwen3.5:0.8b ha 873 milioni di parametri e quantizzazione Q8_0, con un file da 1,0 GB. Basta un comando:

ollama run qwen3.5:0.8b

La prima volta che lo lanciate, Ollama scarica il modello e poi apre una chat nel terminale. Se il download si completa e compare il prompt della chat, il modello è pronto.

Avviare il tag predefinito o un’altra taglia

Nella pagina del modello il tag latest corrisponde alla taglia 9b, cioè a un file da 6,6 GB. È questa la versione che scaricate se usate il nome del modello senza indicare la taglia. Pensateci prima di lanciarlo su un portatile con poco spazio o poca memoria.

ollama run qwen3.5

Per le altre taglie il comando è lo stesso usato per la 0.8b. Dopo i due punti mettete il tag che vi interessa al posto di 0.8b, per esempio 4b o 27b. I nomi validi sono quelli della tabella.

Per le taglie grandi c’è anche la generazione successiva, Qwen3.6, già scaricabile con Ollama: qwen3.6:27b pesa 18 GB e la versione predefinita 23 GB. Le taglie piccole descritte qui restano quelle di Qwen3.5.

Chattare con Qwen dal terminale e uscire

Quando la chat è aperta, scrivete la domanda e premete Invio: la risposta compare direttamente nel terminale. La pagina del modello indica che Qwen3.5 supporta 201 lingue e dialetti.

Per un testo su più righe, la guida ai comandi di Ollama mostra come fare. Si scrivono tre virgolette doppie (""") seguite dal testo, si va a capo quante volte serve e si chiude con altre tre virgolette doppie ("""). La domanda parte solo dopo la chiusura.

Qwen3.5 accetta anche immagini in input. Come mostra la guida ai comandi, si può lanciare dalla shell ollama run seguito dal nome del modello (per esempio qwen3.5:0.8b) e poi, fra virgolette, dalla domanda con il percorso completo del file immagine. Anche nella chat già aperta, spiega il blog di Ollama sui modelli che leggono le immagini, basta scrivere nel messaggio il percorso del file insieme alla domanda.

Per chiudere la chat, come indica la guida rapida, si scrive:

/bye

Così tornate al prompt della shell. Il modello resta sul disco, come vedrete nella sezione successiva con ollama ls. Per riaprire la chat basta rilanciare lo stesso comando ollama run, e questa volta senza download.

Vedere quali modelli sono scaricati e quali sono in esecuzione

Dopo qualche prova è facile perdere il conto delle taglie scaricate. Questo comando elenca i modelli presenti sul disco, ognuno con il nome completo di tag:

ollama ls

Quest’altro mostra invece i modelli in esecuzione in quel momento:

ollama ps

La differenza è importante. Un modello scaricato compare sempre nel primo elenco. Nel secondo compaiono solo i modelli caricati in memoria e pronti a rispondere. I nomi che leggete in questi elenchi sono quelli da usare con i comandi della sezione sulla rimozione.

Usare Qwen tramite l’API locale

Il server di Ollama risponde anche via HTTP all’indirizzo localhost, porta 11434. Così potete usare Qwen da script e programmi senza aprire la chat. L’esempio della pagina del modello manda un messaggio all’endpoint /api/chat:

curl http://localhost:11434/api/chat \
  -d '{
    "model": "qwen3.5",
    "messages": [{"role": "user", "content": "Hello!"}]
  }'

Qualche dettaglio pratico:

  • il campo model vale qwen3.5, cioè il tag predefinito. Se avete scaricato solo la 0.8b e usate l’esempio così com’è, Ollama cercherà la taglia 9b da 6,6 GB. Sostituite quindi qwen3.5 con qwen3.5:0.8b nel campo model, come fa la pagina di quel tag;
  • la guida rapida di Ollama indica che la risposta si legge nel campo message.content, ma lo fa negli esempi che contengono il parametro "stream": false. L’esempio della pagina di Qwen non usa quel parametro, quindi la risposta che ricevete può avere un aspetto diverso;
  • la pagina del modello riporta anche esempi equivalenti in Python e JavaScript, fatti con le librerie di Ollama (pacchetto ollama).

Scaricare il modello dalla memoria o cancellarlo dal disco

Sono due operazioni diverse. Per liberare la memoria senza cancellare niente si usa ollama stop seguito dal nome del modello così come appare in ollama ps, per esempio qwen3.5:0.8b. Il modello resta sul disco e potete riavviarlo quando volete.

Per recuperare spazio su disco si usa invece ollama rm seguito dal nome del modello come compare in ollama ls. Il modello viene cancellato e, se vi serve di nuovo quella taglia, dovrete riscaricarla. Se avete più taglie di Qwen3.5, controllate bene il tag prima di dare il comando: cancellare per sbaglio la 27b, per esempio, significa riscaricare 17 GB.

Licenza

Qwen3.5 è distribuito con la Apache License, Version 2.0. Il testo della licenza si trova nella sezione license della pagina del tag qwen3.5:0.8b su Ollama. Per le condizioni d’uso fate riferimento a quel testo.

Documentazione di riferimento

Pagine consultate il 29 settembre 2026. Le istruzioni della documentazione di Ollama sul servizio riguardano Linux, mentre le pagine della libreria valgono per tutti i sistemi.

Leggi anche

Tags: Linux Ollama Qwen