Il 3 ottobre 2026 la tedesca Aleph Alpha ha rilasciato Kolibri, un modello linguistico Mixture-of-Experts per inglese e tedesco con 78 miliardi di parametri totali, di cui circa 3,46 miliardi attivi per token. Supporta contesti fino a 1 milione di token e i pesi completi sono scaricabili da Hugging Face con licenza Apache 2.0. Secondo il blog ufficiale di Aleph Alpha, è pensato per ambiti regolamentati come pubblica amministrazione, industria e aerospazio.
Che cos’è Kolibri e a chi si rivolge
Kolibri è un transformer MoE specializzato su tedesco, ragionamento, matematica e comportamento agentico. Aleph Alpha lo presenta come modello «sovrano»: sviluppato in Germania, addestrato su infrastrutture in Germania e Finlandia, sotto la legge europea e tedesca e, dice l’azienda, senza controllo estero.
La scheda del modello su Hugging Face, pubblicata dalla stessa Aleph Alpha, indica che l’azienda è firmataria del Codice di condotta UE per i modelli di uso generale (GPAI). Il blog aggiunge che il progetto tiene conto di AI Act, GDPR e diritto d’autore.
Le lingue dichiarate sono solo tedesco e inglese: l’azienda la descrive come una scelta deliberata di profondità rispetto all’ampiezza. L’italiano non è citato nelle fonti.
Architettura e addestramento
Il modello ha 50 livelli, tutti MoE, con 384 esperti per livello: 6 instradati e 1 condiviso. Solo 10 livelli usano l’attenzione sull’intero contesto; gli altri 40 lavorano su una finestra di 512 token, così calcolo e memoria in decodifica restano contenuti anche con contesti lunghi.
- Pre-training su 20 trilioni di token in 21 giorni, su 768 GPU Nvidia B200; seguono 3,44 trilioni di token di mid-training e circa 200 miliardi per l’estensione del contesto.
- Il tedesco pesa oltre un quinto del corpus di pre-training; per questo Aleph Alpha ha sviluppato un tokenizer bilingue con 128.000 voci.
- Ottimizzatore Muon e un bilanciamento degli esperti chiamato «exact quantile balancing», che secondo l’azienda si calcola in modo esatto a costo fisso.
- Post-training con fine-tuning supervisionato e apprendimento per rinforzo su oltre 1,2 milioni di task curati.
- Quattro livelli di ragionamento (none, low, medium, high) per bilanciare costo e latenza con la qualità della risposta.
- Knowledge cutoff al 18 giugno 2026 per inglese e tedesco.
Aleph Alpha spiega di aver scelto 78B invece di 123B per i costi di servizio: su due H100 la versione da 123B gestisce 3 richieste concorrenti da 256.000 token, quella da 78B ne gestisce 18 e decodifica il 28% più in fretta.
Dal prototipo Kolibri Origin a Kolibri
Kolibri è stato preceduto da Kolibri Origin, un modello da 30B totali che serviva a validare la pipeline di addestramento e che non è stato pubblicato. Il confronto, ricavato dal blog di Aleph Alpha, mostra quanto è cambiato in tre mesi.
| Caratteristica | Kolibri Origin | Kolibri |
|---|---|---|
| Fine pre-training | 11 giugno 2026 | 11 settembre 2026 |
| Parametri totali | 30,6B | 78,1B |
| Parametri attivi per token | 3,27B | 3,46B |
| Token di pre-training | 7,51T | 20T |
| Esperti (totali / attivi) | 128 / 8 | 384 / 6 |
| Massima lunghezza addestrata | 65.536 token | 262.144 token |
| Modalità di ragionamento | una sola | none, low, medium, high |
Il contesto di 1 milione di token, spiega la scheda su Hugging Face, è stato validato per qualità ed efficienza di servizio; per carichi sensibili a latenza e throughput e per compiti complessi Aleph Alpha raccomanda al massimo 262.144 token.
I benchmark dichiarati da Aleph Alpha
Secondo il blog, Kolibri si colloca sulla frontiera di Pareto tra qualità e costo di servizio, in inglese e in tedesco, e su matematica, codice, grounding e contesto lungo eguaglia modelli con fino a quattro volte i suoi parametri attivi. I numeri sono misurati dall’azienda stessa, con Kolibri a ragionamento «high».
| Benchmark | Kolibri | Qwen3.6-35B-A3B | Nemotron 3 Super 120B-A12B | Mistral Small 4 119B-A6B |
|---|---|---|---|---|
| AIME 2025 | 96,9 | 84,6 | 91,7 | 79,8 |
| GPQA Diamond | 84,3 | 83,4 | 78,0 | 74,7 |
| LiveCodeBench v6 | 85,9 | 82,5 | 82,0 | 71,2 |
| BFCL v4 (overall) | 61,4 | 67,2 | 61,0 | 58,0 |
| AA-Omniscience Index | -32,8 | -15,3 | -36,5 | -24,0 |
Non sono tutti primati: su BFCL v4 e sull’indice AA-Omniscience Qwen3.6-35B-A3B fa meglio. Aleph Alpha ha poi costruito suite interne per settori come pubblico tedesco, aviazione e automotive: tra Kolibri Origin e Kolibri i punteggi passano ad esempio da 0,14 a 0,59 per l’aerospazio e da 0,54 a 0,75 per la pubblica amministrazione tedesca.
Il modello è inoltre addestrato a rispondere «I don’t know» quando la risposta non è nel contesto fornito, grazie ai dati di astensione e al protocollo Merlin-Arthur.
Requisiti hardware e come eseguirlo
Secondo la scheda su Hugging Face, i pesi in FP8 occupano circa 78 GB di memoria. Tutto il modello va tenuto in memoria anche se per ogni token ne è attiva solo una parte. Le configurazioni indicate sono queste:
- minimo: 2 A100 da 80 GB, 2 H100 SXM5, 1 H200, 1 B200 oppure 1 B300;
- consigliato: 2 H100 SXM5, 2 H200, 1 B200 oppure 1 B300.
Per l’esecuzione serve il pacchetto aleph-alpha-inference, che fornisce il plugin vLLM per Kolibri. Si può usare l’immagine ghcr.io/aleph-alpha/aleph-alpha-inference oppure installare con pip install 'aleph-alpha-inference>=1', che porta con sé la versione di vLLM supportata. Il server si avvia così:
vllm serve Aleph-Alpha/Kolibri-1 --kv-cache-dtype fp8 --reasoning-parser kolibri1 --tool-call-parser kolibri1 --enable-auto-tool-choice
Il server espone un’API compatibile con OpenAI. Per superare i 262.144 token vanno aggiunti --max-model-len 1048576 e --hf-overrides '{"max_position_embeddings": 1048576}'. I parametri di campionamento raccomandati sono temperature 1.0, top_p 0.97 e top_k 128; il ragionamento si regola con reasoning_effort nel chat template.
Uso previsto e limiti dichiarati
Aleph Alpha indica Kolibri per assistenti conversazionali, elaborazione di documenti, RAG su materiali interni e orchestrazione di strumenti tramite tool calling. La scheda precisa che l’output dovrebbe essere rivisto da una persona e che nei sistemi di supporto alle decisioni il modello deve restare sul lato consultivo, non essere il componente decisionale.
Sul fronte energetico, la scheda stima circa 950 MWh per pre-training, mid-training ed estensione del contesto, esclusi SFT, RL e modelli di prova. Prezzi e disponibilità commerciale non sono indicati nelle fonti: il rilascio riguarda i pesi aperti.