Vai al contenuto
Grafica di anteprima di Hugging Face per il modello Qwen-Image-2.1-Turbo su sfondo sfumato

Foto: Hugging Face

Il 9 ottobre 2026 Qwen ha pubblicato su Hugging Face Qwen-Image-2.1-Turbo, un checkpoint accelerato di Qwen-Image-2.1 per generare immagini da testo e modificarle. Secondo la scheda ufficiale del modello su Hugging Face, lavora con 8 passi di denoising e si carica direttamente in Diffusers con la pipeline QwenImage21Pipeline.

Che cos’è Qwen-Image-2.1-Turbo

La scheda descrive il modello come una versione accelerata di Qwen-Image-2.1, che ha come modello di base. L’architettura di generazione visiva è la stessa, da 7 miliardi di parametri.

Il checkpoint include il proprio schema di campionamento consigliato, quindi non serve configurare lo scheduler a mano. La generazione usa CFG=1 per impostazione predefinita, e il prefix KV caching riutilizza il contesto di testo e delle immagini di riferimento lungo i passi di denoising.

Cosa serve per installarlo

I requisiti indicati nella scheda sono questi:

  • una build di PyTorch compatibile con CUDA;
  • l’ultima versione di Diffusers dai sorgenti, installata da GitHub;
  • transformers in versione 5.17.0 o successiva, più accelerate e pillow.

Serve la versione di Diffusers dai sorgenti perché il checkpoint richiede il supporto ai sigma di campionamento configurati nella pipeline, aggiunto con la PR #14950 di Diffusers.

Generazione da testo e modifica di immagini

Per il text-to-image si carica Qwen/Qwen-Image-2.1-Turbo con QwenImage21Pipeline.from_pretrained in bfloat16 e lo si sposta su GPU CUDA. L’esempio ufficiale genera un poster in formato verticale da 1680 × 2512 pixel con use_kv_cache=True.

Per l’editing si riusa la stessa pipeline passando un’immagine in ingresso. La scheda mostra come esempio la trasformazione di uno schizzo di yacht in una fotografia realistica a 2048 × 2048.

Secondo la scheda, il campionamento a 8 passi viene caricato in automatico. Impostare solo num_inference_steps non lo sovrascrive: per sperimentare si può passare un argomento sigmas esplicito, ma la scheda precisa che altri schemi non sono stati valutati per questo checkpoint.

Risoluzioni supportate

Il modello usa gli stessi preset di risoluzione di Qwen-Image-2.1:

Rapporto Risoluzione
1:1 2048 × 2048
4:3 2400 × 1792
3:4 1792 × 2400
3:2 2528 × 1696
2:3 1696 × 2528
16:9 2752 × 1536
9:16 1536 × 2752

Esempi, licenza e feedback

La sezione Showcase della scheda raccoglie esempi a 8 passi in diverse categorie: ritratti fotografici, pose e movimento del corpo, immagini trasparenti, tipografia e poster, interfacce e impaginazione di informazioni, trasformazione di una singola immagine, composizione da più riferimenti e composizione di interni da quattro immagini.

La licenza è la Qwen Research License Agreement, indicata nei metadati di Hugging Face come «other»: consente esclusivamente usi non commerciali per ricerca o valutazione. Per qualsiasi uso commerciale occorre ottenere una licenza separata, da richiedere a [email protected].

Per segnalare problemi la scheda rimanda a un modulo di feedback che arriva al team di ricerca Qwen Image, dove si possono condividere prompt, immagini o flussi di lavoro.

Leggi anche