Models

Kolibri: el model alemany que cap en una sola GPU

Aleph Alpha va datar el 3 d'octubre de 2026 la fitxa de Kolibri-1, un model bilingüe d'alemany i anglès que pesa 78.000 milions de paràmetres i només en posa en marxa 3.460 milions per token. Per això cap, segons la mateixa fitxa, en una única targeta gràfica H200, B200 o B300, i surt amb llicència Apache 2.0. No publica ni un resultat de banc de proves, i a qui el signa l'està absorbint la canadenca Cohere.

Rep el resum diari d'IA

Cada matí, l'essencial de la intel·ligència artificial al teu correu, sense fum. Al dia amb la IA.

Freqüència:

Vinyeta: en un terra de terra i grava, una targeta gràfica negra amb el logotip de Nvidia en relleu damunt la carcassa és tirada de cara amunt; al damunt, posat al cantell, un colibrí diminut de gola vermella i ales verdes que bat. A l'esquerra, una mà enguantada de cuir marró s'hi acosta per terra; a la dreta, un salabret de xarxa blanca i anella gran entra al quadre per dalt.
📷 Imatge generada amb IA

En resum

  • La fitxa porta data del 3 d'octubre de 2026 i es va difondre l'endemà: 78.103.074.560 paràmetres en total, 3.457.573.120 actius per token.
  • És una mescla d'experts de 50 capes amb 384 experts en cadascuna, dels quals s'activen 6 de triats més 1 de compartit.
  • La finestra de context són 262.144 tokens natius, ampliables fins a 1.048.576 per extrapolació. Són dues xifres diferents i la fitxa les distingeix.
  • Parla alemany i anglès, surt amb llicència Apache 2.0 i l'esforç de raonament es fixa per petició: low, medium, high o none.
  • No publica resultats de bancs de proves. Sí que declara els seus límits: coneixement tallat al juny de 2026, possibles biaixos sistèmics i polítics, i gens d'ús sense supervisió en risc alt.

Pesa 78.000 milions de paràmetres i en mou 3.460 milions

Aleph Alpha —laboratori alemany d'intel·ligència artificial sobirana nascut a Heidelberg el 2019 i amb el suport del Schwarz Group, propietari de Lidl, Kaufland i el núvol sobirà STACKIT— va datar la fitxa de Kolibri-1 el 3 d'octubre de 2026 i la va deixar a Hugging Face, el repositori públic on s'allotgen i es descarreguen els models. El llançament es va difondre el dia 4.

La xifra que manda és doble: el total és de 78.103.074.560 paràmetres i els que entren en joc per cada token són 3.457.573.120. Van repartits en 50 capes amb 384 experts cadascuna, dels quals l'encaminador tria 6 i hi afegeix un altre de compartit, i l'atenció alterna finestres lliscants i atenció causal completa en proporció de quatre a un.

A cada token, per tant, Kolibri fa servir poc més del 4 % de si mateix: aquest càlcul explica que un model de 78.000 milions arribi amb requisits d'una sola targeta gràfica.

Llegir-ne més: Hugging Face — Aleph-Alpha/Kolibri-1 (fitxa del model, 03-10-2026) ↗

Què cal tenir per fer-lo anar

La fitxa de Kolibri
Dada Valor
Paràmetres totals 78.000 milions
Paràmetres actius per token 3.460 milions
Arquitectura Mescla d'experts: 50 capes, 384 experts per capa, 6 actius més 1 de compartit
Finestra de context 262.144 tokens natius; fins a 1.048.576 per extrapolació
Idiomes Alemany i anglès
Llicència Apache 2.0
Format dels pesos float8_e4m3fn, amb parts en bfloat16
Maquinari mínim 2× A100 80 GB, 2× H100 SXM5, 1× H200, 1× B200 o 1× B300
Entrenament 20 bilions de tokens; 768 GPU Nvidia B200 durant 21 dies
Esforç de raonament Per petició: low, medium, high o none
Dades de la fitxa del model publicada per Aleph Alpha el 3 d'octubre de 2026. La fitxa no publica resultats de bancs de proves.

Kolibri surt amb els pesos oberts i llicència Apache 2.0, de les permissives, i parla dos idiomes: alemany i anglès. No n'hi ha un tercer.

El maquinari mínim són dues A100 de 80 GB, dues H100 SXM5, una H200, una B200 o una B300; el recomanat, dues H100 SXM5, dues H200, una B200 o una B300. El que importa d'aquesta llista és la paraula «una»: de la generació H200 de Nvidia cap amunt, el model sencer cap en una sola targeta gràfica.

Ho permet, a més de l'arquitectura, com estan guardats els pesos: en format float8_e4m3fn, per blocs de 128×128, amb les activacions quantitzades al vol. Les peces delicades es queden en bfloat16: els embeddings, el capçal de llenguatge, les normalitzacions i l'encaminador que tria els experts.

La finestra de context es diu amb dues xifres, perquè la fitxa les separa: 262.144 tokens natius i fins a 1.048.576 per extrapolació, estirant el mecanisme més enllà del que s'ha entrenat. L'esforç de raonament es decideix petició a petició des de la plantilla de conversa: low, medium, high o none.

Entrenar-lo va costar 20 bilions de tokens d'un corpus bilingüe filtrat, amb una part de codi, i el còmput el van posar 768 GPU Nvidia B200 durant 21 dies.

Llegir-ne més: Hugging Face — Aleph-Alpha/Kolibri-1 (fitxa del model, 03-10-2026) ↗

El que no diu i el que admet

No hi ha ni una xifra de banc de proves: la fitxa no publica resultats d'avaluació, i això ja és informació. D'un model nou es pot saber quant pesa, quant mou i en quina màquina cap, i continuar sense saber com se'n surt. Cap classificació que el situï davant d'un altre no té avui un número publicat al darrere.

El que sí que declara són els seus límits, i els escriu qui l'ha fet: el coneixement està tallat al juny de 2026, de manera que pot donar per vigent allò que ja no ho és; pot reproduir biaixos sistèmics i biaixos polítics de les dades amb què es va entrenar; i no és apropiat per a un ús sense supervisió en entorns de risc alt sense validacions addicionals.

Llegir-ne més: Hugging Face — Aleph-Alpha/Kolibri-1 (fitxa del model, 03-10-2026) ↗

Publica un model mentre l'absorbeixen

Aleph Alpha no és un laboratori qualsevol en aquest moment. El 16 de setembre de 2026 va signar un acord definitiu de fusió amb Cohere —laboratori canadenc de models fundacionals fundat a Toronto el 2019 per Aidan Gomez, orientat a l'empresa i al sector públic—, que a la pràctica és una absorció. El tancament s'espera abans que s'acabi l'any, continua subjecte a aprovacions regulatòries i a dia d'avui no s'ha produït.

Entre l'acord i un tancament que encara no ha arribat, la companyia de Heidelberg ha publicat un model bilingüe amb els pesos oberts, llicència permissiva i la fitxa de requisits completa. Europa no acumula models amb aquesta fitxa, i aquí hi ha l'interès: qui el signa està a mig absorbir.

La fitxa no esmenta l'operació, i no hi està obligada. Però de l'acord a la publicació van passar disset dies, i això canvia com es llegeix el llançament: és el que un laboratori ha deixat publicat abans de deixar de ser independent.

Llegir-ne més: MarkTechPost — Aleph Alpha Releases Kolibri (04-10-2026) ↗

Conclusió

Kolibri arriba amb la fitxa per endavant: se sap quant pesa, quant mou, en quina targeta gràfica cap i amb quina llicència es descarrega. No se sap com respon, perquè la seva pròpia fitxa no publica ni una avaluació, i això ho haurà de mesurar algú de fora. I cal anotar la data, que és la meitat que falta: el signa un laboratori que estan absorbint.

Fonts primàries

Comentaris

Sigues respectuós. Els comentaris es moderen.

    Rep el resum diari d'IA

    Cada matí, l'essencial de la intel·ligència artificial al teu correu, sense fum. Al dia amb la IA.

    Freqüència:

    ← Torna al blog