Questa guida è per chi vuole usare Llama, il modello linguistico di Meta, sul proprio computer invece che attraverso un servizio cloud. Si parte dalla scelta della versione adatta a un PC comune e da quello che chiede la licenza. Poi si avvia Llama 3.2 con tre programmi: Ollama dal terminale, LM Studio con l’app e il comando lms, LM Studio Bionic dall’app. Alla fine avrete un modello che risponde in locale e saprete controllare quanto contesto sta usando. I comandi sono quelli della documentazione ufficiale, elencata in fondo.
Cosa serve
- Uno dei tre programmi già installato: Ollama, LM Studio oppure LM Studio Bionic. Se non li avete ancora, ci sono le nostre guide per installare Ollama su Linux, installare LM Studio e usare un modello locale in Bionic.
- Spazio su disco per il modello: 2,0 GB per Llama 3.2 3B e 1,3 GB per la versione 1B, secondo la libreria di Ollama.
- Almeno 2 GB di memoria di sistema per Llama 3.2 3B, il minimo indicato nel catalogo di LM Studio.
Scegliere la versione di Llama e il programma
Per un portatile o un desktop comune la scelta sensata è Llama 3.2, la versione piccola della famiglia. Esiste in due taglie, 3B e 1B parametri, e lavora solo con testo in ingresso e in uscita. È ottimizzata per il dialogo multilingue, i riassunti e il recupero di informazioni. L’italiano è fra le otto lingue supportate ufficialmente, insieme a inglese, tedesco, francese, portoghese, hindi, spagnolo e thailandese.
In Ollama la versione predefinita è la 3B. Nella scheda della libreria di Ollama la 3B è confrontata con Gemma 2 2.6B e Phi 3.5-mini e risulta migliore nel seguire le istruzioni, nei riassunti, nella riscrittura dei prompt e nell’uso di strumenti. La 1B è più leggera ed è pensata per compiti come la gestione di informazioni personali, il recupero di informazioni in più lingue e le riscritture su dispositivi poco potenti.
| Tag Ollama | Parametri | Dimensione | Finestra di contesto |
|---|---|---|---|
llama3.2:latest / llama3.2:3b |
3B | 2,0 GB | 128K |
llama3.2:1b |
1B | 1,3 GB | 128K |
La licenza
Llama 3.2 è distribuito con la Llama 3.2 Community License, con data di rilascio 25 settembre 2024. Sulla scheda Hugging Face di Llama-3.2-3B-Instruct l’accesso è controllato: per scaricare i file originali bisogna accettare la licenza.
Le clausole principali sono poche. Chi distribuisce il modello, o un prodotto o servizio che lo contiene, deve allegare una copia della licenza e mostrare in modo visibile la dicitura «Built with Llama». Chi usa Llama per creare o migliorare un altro modello e poi lo distribuisce deve mettere «Llama» all’inizio del nome. Le aziende che nel mese precedente alla data di rilascio di Llama 3.2 superavano i 700 milioni di utenti attivi mensili devono chiedere a Meta una licenza a parte. Vale anche la politica d’uso accettabile di Meta.
Quale programma usare
- Ollama: tutto da terminale, con un comando che avvia il modello.
- LM Studio: app con interfaccia grafica, più il comando
lmsper chattare dal terminale. - LM Studio Bionic: tutto dalle impostazioni dell’app, senza comandi.
Scaricare e avviare Llama 3.2 3B con Ollama
Con Ollama basta un comando. Il nome llama3.2 senza tag corrisponde a latest, cioè alla versione 3B da 2,0 GB. Se Ollama non è installato, partite dalla nostra guida all’installazione su Linux.
ollama run llama3.2
Il comando avvia il modello e apre una chat nel terminale. Funziona se potete scrivere una domanda, anche in italiano, e la risposta compare nel terminale.
In alternativa, la versione più leggera da 1B
Se il computer ha poca memoria, o vi basta un modello per compiti brevi, usate il tag 1b. Il modello occupa 1,3 GB e la finestra di contesto massima resta di 128K token.
ollama run llama3.2:1b
Anche qui si arriva alla chat nel terminale, dove potete scrivere la prima domanda.
Controllare il modello caricato e il contesto con Ollama
Llama 3.2 supporta fino a 128K token di contesto, ma Ollama non lo usa per forza tutto. La documentazione di Ollama sulla lunghezza del contesto spiega che il valore predefinito dipende dalla VRAM disponibile:
- meno di 24 GiB di VRAM: contesto da 4k;
- da 24 a 48 GiB: contesto da 32k;
- 48 GiB o più: contesto da 256k.
Per vedere quale valore viene applicato davvero, con il modello avviato aprite un altro terminale e usate:
ollama ps
Il comando elenca i modelli caricati in memoria, con le colonne NAME, ID, SIZE, PROCESSOR, CONTEXT e UNTIL. In NAME dovete trovare llama3.2 o llama3.2:1b. La colonna CONTEXT mostra i token di contesto assegnati: con meno di 24 GiB di VRAM aspettatevi il valore da 4k e non i 128K del modello. La colonna PROCESSOR indica come il modello è diviso fra GPU e CPU: per le prestazioni migliori conviene che non venga spostato in parte sulla CPU.
Un contesto più ampio fa crescere la memoria necessaria, quindi prima di alzarlo controllate di avere abbastanza VRAM. Per attività che lavorano su molto testo, come la ricerca web, gli agenti e gli strumenti di programmazione, Ollama consiglia almeno 64000 token. Nell’app di Ollama il valore si cambia con il cursore nelle impostazioni. Se non potete modificarlo così, si può impostare all’avvio del server (ollama serve) con la variabile d’ambiente OLLAMA_CONTEXT_LENGTH.
Scaricare Llama 3.2 3B in LM Studio
Nel catalogo di LM Studio il modello ha la chiave meta/llama-3.2-3b. È Llama 3.2 3B Instruct di Meta in formato GGUF, basato sui file del repository lmstudio-community/Llama-3.2-3B-Instruct-GGUF, con 128K di contesto e una memoria di sistema minima di 2 GB. La pagina del modello nel catalogo di LM Studio riporta questi dati e ha un pulsante «Use Model in LM Studio».
Per il download usate la ricerca modelli dell’app LM Studio: cercate Llama 3.2 3B e scaricatelo. Tutti i passaggi, dall’installazione dell’app al download di un modello, sono spiegati nella nostra guida a LM Studio. Il controllo che il download sia andato a buon fine si fa nel passaggio successivo, con lms chat.
Chattare con Llama 3.2 dal terminale con lms
Il comando lms chat apre una conversazione con un modello locale direttamente nel terminale, comoda per prove veloci o negli script. Come spiega la documentazione di lms chat, se non indicate un modello il programma vi chiede di sceglierne uno fra quelli locali.
lms chat
Questo è anche il modo per verificare il download: Llama 3.2 3B deve comparire nell’elenco dei modelli che il comando vi propone. Se non c’è, il download dall’app non è stato completato e va ripreso dalla ricerca modelli di LM Studio. Se c’è, sceglietelo e scrivete la prima domanda: quando la risposta arriva nel terminale, il modello è caricato.
Il comando ha anche alcune opzioni:
-pinvia una sola domanda, stampa la risposta ed esce;-simposta un prompt di sistema personalizzato;--statsmostra statistiche dettagliate dopo ogni risposta;--ttlstabilisce per quanti secondi il modello resta caricato dopo la fine della chat (il valore predefinito è 3600, cioè un’ora).
Usare Llama in LM Studio Bionic
La documentazione di Bionic non nomina Llama, ma descrive un procedimento che vale per qualsiasi modello locale. I modelli scaricati girano sul computer senza consumare crediti di inferenza cloud. Per i dettagli sull’app c’è la nostra guida a Bionic. La pagina di Bionic sui modelli locali indica questi passaggi:
- aprite Settings e, sotto Local Models, scegliete Explore;
- cercate il modello e restringete i risultati con i filtri per formato e con le indicazioni di compatibilità con il dispositivo;
- se avete più dispositivi collegati con LM Link, scegliete dove scaricarlo;
- selezionate formato e variante e avviate il download, che potete mettere in pausa, riprendere, annullare o ripetere;
- in Settings → Local Models → Library controllate che il modello compaia fra quelli indicizzati;
- aprite una sessione Bionic e selezionate il modello dall’elenco.
Se il modello compare nella Library e risponde nella sessione, è pronto.
Documentazione di riferimento
Pagine consultate il 30 settembre 2026:
- Libreria di Ollama — llama3.2
- Documentazione di Ollama — Context length
- Hugging Face — meta-llama/Llama-3.2-3B-Instruct e Llama 3.2 Community License
- Catalogo di LM Studio — meta/llama-3.2-3b
- Documentazione di LM Studio — lms chat
- Documentazione di LM Studio Bionic — Download Local Models