Vai al contenuto
Logo bianco di Kolibri con un colibrì stilizzato su sfondo verde smeraldo.

Foto: Aleph Alpha

Il 3 ottobre 2026 la tedesca Aleph Alpha ha rilasciato Kolibri, un modello linguistico Mixture-of-Experts per inglese e tedesco con 78 miliardi di parametri totali, di cui circa 3,46 miliardi attivi per token. Supporta contesti fino a 1 milione di token e i pesi completi sono scaricabili da Hugging Face con licenza Apache 2.0. Secondo il blog ufficiale di Aleph Alpha, è pensato per ambiti regolamentati come pubblica amministrazione, industria e aerospazio.

Che cos’è Kolibri e a chi si rivolge

Kolibri è un transformer MoE specializzato su tedesco, ragionamento, matematica e comportamento agentico. Aleph Alpha lo presenta come modello «sovrano»: sviluppato in Germania, addestrato su infrastrutture in Germania e Finlandia, sotto la legge europea e tedesca e, dice l’azienda, senza controllo estero.

La scheda del modello su Hugging Face, pubblicata dalla stessa Aleph Alpha, indica che l’azienda è firmataria del Codice di condotta UE per i modelli di uso generale (GPAI). Il blog aggiunge che il progetto tiene conto di AI Act, GDPR e diritto d’autore.

Le lingue dichiarate sono solo tedesco e inglese: l’azienda la descrive come una scelta deliberata di profondità rispetto all’ampiezza. L’italiano non è citato nelle fonti.

Architettura e addestramento

Il modello ha 50 livelli, tutti MoE, con 384 esperti per livello: 6 instradati e 1 condiviso. Solo 10 livelli usano l’attenzione sull’intero contesto; gli altri 40 lavorano su una finestra di 512 token, così calcolo e memoria in decodifica restano contenuti anche con contesti lunghi.

  • Pre-training su 20 trilioni di token in 21 giorni, su 768 GPU Nvidia B200; seguono 3,44 trilioni di token di mid-training e circa 200 miliardi per l’estensione del contesto.
  • Il tedesco pesa oltre un quinto del corpus di pre-training; per questo Aleph Alpha ha sviluppato un tokenizer bilingue con 128.000 voci.
  • Ottimizzatore Muon e un bilanciamento degli esperti chiamato «exact quantile balancing», che secondo l’azienda si calcola in modo esatto a costo fisso.
  • Post-training con fine-tuning supervisionato e apprendimento per rinforzo su oltre 1,2 milioni di task curati.
  • Quattro livelli di ragionamento (none, low, medium, high) per bilanciare costo e latenza con la qualità della risposta.
  • Knowledge cutoff al 18 giugno 2026 per inglese e tedesco.

Aleph Alpha spiega di aver scelto 78B invece di 123B per i costi di servizio: su due H100 la versione da 123B gestisce 3 richieste concorrenti da 256.000 token, quella da 78B ne gestisce 18 e decodifica il 28% più in fretta.

Dal prototipo Kolibri Origin a Kolibri

Kolibri è stato preceduto da Kolibri Origin, un modello da 30B totali che serviva a validare la pipeline di addestramento e che non è stato pubblicato. Il confronto, ricavato dal blog di Aleph Alpha, mostra quanto è cambiato in tre mesi.

Caratteristica Kolibri Origin Kolibri
Fine pre-training 11 giugno 2026 11 settembre 2026
Parametri totali 30,6B 78,1B
Parametri attivi per token 3,27B 3,46B
Token di pre-training 7,51T 20T
Esperti (totali / attivi) 128 / 8 384 / 6
Massima lunghezza addestrata 65.536 token 262.144 token
Modalità di ragionamento una sola none, low, medium, high

Il contesto di 1 milione di token, spiega la scheda su Hugging Face, è stato validato per qualità ed efficienza di servizio; per carichi sensibili a latenza e throughput e per compiti complessi Aleph Alpha raccomanda al massimo 262.144 token.

I benchmark dichiarati da Aleph Alpha

Secondo il blog, Kolibri si colloca sulla frontiera di Pareto tra qualità e costo di servizio, in inglese e in tedesco, e su matematica, codice, grounding e contesto lungo eguaglia modelli con fino a quattro volte i suoi parametri attivi. I numeri sono misurati dall’azienda stessa, con Kolibri a ragionamento «high».

Benchmark Kolibri Qwen3.6-35B-A3B Nemotron 3 Super 120B-A12B Mistral Small 4 119B-A6B
AIME 2025 96,9 84,6 91,7 79,8
GPQA Diamond 84,3 83,4 78,0 74,7
LiveCodeBench v6 85,9 82,5 82,0 71,2
BFCL v4 (overall) 61,4 67,2 61,0 58,0
AA-Omniscience Index -32,8 -15,3 -36,5 -24,0

Non sono tutti primati: su BFCL v4 e sull’indice AA-Omniscience Qwen3.6-35B-A3B fa meglio. Aleph Alpha ha poi costruito suite interne per settori come pubblico tedesco, aviazione e automotive: tra Kolibri Origin e Kolibri i punteggi passano ad esempio da 0,14 a 0,59 per l’aerospazio e da 0,54 a 0,75 per la pubblica amministrazione tedesca.

Il modello è inoltre addestrato a rispondere «I don’t know» quando la risposta non è nel contesto fornito, grazie ai dati di astensione e al protocollo Merlin-Arthur.

Requisiti hardware e come eseguirlo

Secondo la scheda su Hugging Face, i pesi in FP8 occupano circa 78 GB di memoria. Tutto il modello va tenuto in memoria anche se per ogni token ne è attiva solo una parte. Le configurazioni indicate sono queste:

  • minimo: 2 A100 da 80 GB, 2 H100 SXM5, 1 H200, 1 B200 oppure 1 B300;
  • consigliato: 2 H100 SXM5, 2 H200, 1 B200 oppure 1 B300.

Per l’esecuzione serve il pacchetto aleph-alpha-inference, che fornisce il plugin vLLM per Kolibri. Si può usare l’immagine ghcr.io/aleph-alpha/aleph-alpha-inference oppure installare con pip install 'aleph-alpha-inference>=1', che porta con sé la versione di vLLM supportata. Il server si avvia così:

vllm serve Aleph-Alpha/Kolibri-1 --kv-cache-dtype fp8 --reasoning-parser kolibri1 --tool-call-parser kolibri1 --enable-auto-tool-choice

Il server espone un’API compatibile con OpenAI. Per superare i 262.144 token vanno aggiunti --max-model-len 1048576 e --hf-overrides '{"max_position_embeddings": 1048576}'. I parametri di campionamento raccomandati sono temperature 1.0, top_p 0.97 e top_k 128; il ragionamento si regola con reasoning_effort nel chat template.

Uso previsto e limiti dichiarati

Aleph Alpha indica Kolibri per assistenti conversazionali, elaborazione di documenti, RAG su materiali interni e orchestrazione di strumenti tramite tool calling. La scheda precisa che l’output dovrebbe essere rivisto da una persona e che nei sistemi di supporto alle decisioni il modello deve restare sul lato consultivo, non essere il componente decisionale.

Sul fronte energetico, la scheda stima circa 950 MWh per pre-training, mid-training ed estensione del contesto, esclusi SFT, RL e modelli di prova. Prezzi e disponibilità commerciale non sono indicati nelle fonti: il rilascio riguarda i pesi aperti.

Leggi anche