Aleph Alpha ha publicado Kolibri-1 con los pesos abiertos y licencia Apache 2.0. Antes de que lo leas como «ya tenemos un modelo europeo que puedo ejecutar en casa»: no, no lo vas a ejecutar en casa. Te cuento los números y dónde está el filo.
Qué ha pasado
El 3 de octubre de 2026, Aleph Alpha subió Kolibri-1 a Hugging Face. Es un modelo de mezcla de expertos —sólo se activa una parte de la red en cada token— con estas cifras:
- 78.103.074.560 parámetros totales, de los cuales 3.457.573.120 activos por token. Es decir: capacidad de un modelo grande, coste de cómputo de uno pequeño.
- 50 capas, 384 expertos por capa (1 compartido y 6 enrutados), atención con proporción 4:1 entre ventana deslizante y GQA.
- Pesos en FP8 por bloques de 128×128, con caché KV también en FP8. Huella en memoria: unos 78 GB sólo de pesos.
- Contexto nativo de 262.144 tokens, validado hasta 1.048.576. Ellos mismos recomiendan no pasar de 262.144 por eficiencia de servicio.
- Alemán e inglés, nada más. Corte de conocimiento el 18 de junio de 2026 para ambos.
- Licencia Apache 2.0, sin restricciones de uso pegadas encima.
El entrenamiento, también con detalle poco habitual: 20 billones de tokens de preentrenamiento —veinte millones de millones— repartidos en un 62,5 % de inglés, un 23,9 % de alemán y un 13,6 % de código; 3,44 billones más en entrenamiento intermedio y 201.000 millones en la fase de contexto largo. Todo sobre 768 GPUs B200 durante 21 días, 392.000 horas de GPU para el preentrenamiento y 6,4e23 FLOPS. Consumo energético estimado: unos 950 MWh, incluyendo overhead del centro de datos.
Los resultados que publican en la propia tarjeta: 84,3 en GPQA Diamond, 80 en MMLU-Pro, 96 en AIME 2026, 66,4 en SWE-bench Verified, 21,5 en HLE y 27,7 en Terminal-Bench 2.1.
Por qué importa
El coste por token y el coste de entrada son dos cosas distintas, y aquí se separan mucho. Con 3,46 mil millones de parámetros activos, cada token sale barato de calcular. Pero la memoria no se negocia: hay que tener los 78 GB cargados aunque sólo trabaje una fracción. El mínimo que indican son dos A100 de 80 GB, dos H100 SXM5, una H200, una B200 o una B300. Recomendado, dos H100 SXM5, dos H200, una B200 o una B300. Traducción práctica: esto no entra en una 4090 ni en tu portátil, y si lo piensas alojar tú, el presupuesto empieza por el hierro.
La licencia sí cambia la conversación. Apache 2.0 significa que lo despliegas donde quieras, lo versionas tú y nadie puede retirártelo ni cambiarte las condiciones a mitad de contrato. Eso es soberanía operativa de verdad, y es distinto de las licencias «abiertas» con cláusulas de uso que luego te obligan a leerte un PDF antes de firmar con un cliente.
No es enchufar y listo en vLLM. Hace falta el paquete aleph-alpha-inference, que trae un plugin propio, y hay que arrancar el servidor con parsers específicos para el modo razonamiento y para las llamadas a herramientas. Eso ata tu capa de servicio a una versión concreta de vLLM. Si tienes un stack con varios modelos detrás del mismo servidor, cuenta con el trabajo de mantener esa dependencia al día.
El contexto largo es el argumento serio. 262.144 tokens de contexto nativo, con posibilidad de estirarlo, es mucho para tareas de documentación interna, extracción estructurada y búsqueda sobre material propio. Ahí es donde un modelo así paga el hardware, no haciendo de chatbot general.
Qué no cambia
Todas las cifras de evaluación salen de la tarjeta del modelo y figuran como no verificadas por terceros. Son autoinformadas; trátalas como una hipótesis que tienes que confirmar con tus propios datos.
Sólo alemán e inglés. Si tu caso es en español, esto no es para ti —y, para ser justos, nadie ha dicho lo contrario: el tokenizador está ajustado a la estructura de palabras del alemán y la decisión de cubrir dos idiomas en vez de veinte es explícita.
Los 27,7 de Terminal-Bench dicen con claridad que como agente suelto en una terminal no está para delegarle nada sin mirar. La propia tarjeta lo asume: lo sitúan en flujos donde una persona revisa la salida antes de que se actúe sobre ella, y en soporte a la decisión, nunca como quien decide.
Y el dato de energía excluye el ajuste supervisado, el aprendizaje por refuerzo y los modelos de prueba. Es una estimación honesta, no la cifra total.
Nuestra lectura
Lo que más me ha gustado de este lanzamiento no es ningún benchmark: es la tarjeta del modelo. Dicen cuántas GPUs, cuántos días, cuántos megavatios hora, qué hardware mínimo hace falta, qué sesgos esperan y para qué no deberías usarlo. Eso vale más que medio punto en MMLU-Pro. Estoy harto de lanzamientos que son un gráfico de barras y un post en X, y luego descubres el consumo de VRAM a la tercera hora de pelea. Aleph Alpha además firma el código de buenas prácticas de IA de propósito general de la UE, que es exactamente el tipo de papel aburrido que te ahorra reuniones con el departamento legal de un cliente.
Dicho eso, la palabra «soberanía» me chirría un poco. El modelo se ha entrenado sobre 768 B200. La soberanía europea termina donde empieza el catálogo de Nvidia, y eso no lo arregla una licencia. Lo que sí hay, y no es poco, es soberanía de despliegue: los pesos son tuyos, el sitio donde corren lo eliges tú y nadie te puede deprecar el endpoint con tres meses de aviso. Para un contrato a tres años eso pesa más que cinco puntos de benchmark.
Creo que la apuesta bilingüe va a envejecer regular. Tiene sentido técnico —un tokenizador afinado para el alemán ahorra tokens de verdad—, pero el mercado compara contra modelos que hacen treinta idiomas de forma aceptable, y la ventaja en un idioma concreto se evapora en un año. Lo que no se evapora es tener los pesos.
Si me lo trajeran a una evaluación, no lo pondría como modelo generalista. Lo metería detrás de una tarea concreta y medible —documentación larga en alemán, extracción estructurada, RAG sobre material propio— y mediría dos cosas antes que la calidad: ocupación real de GPU y latencia con el contexto que vas a usar de verdad, no con el máximo del folleto. Y compararía a igualdad de hardware, no a igualdad de parámetros, que es donde los modelos de mezcla de expertos engañan la vista.
Esto es justo lo que nos pasa cuando alguien nos dice «esto no puede salir de nuestra red»: a los diez minutos la conversación ha dejado de ir del modelo y va de GPUs, de quién actualiza el servidor de inferencia y de quién se levanta si el servicio se cae un domingo. El modelo casi nunca es la parte difícil.
Cualquier duda me dices y lo vemos.
Un saludo, Vicente.
