IBM ha publicado sus modelos de lenguaje Granite 4.2 en tamaños de 3.000, 8.000 y 30.000 millones de parámetros. Los modelos se entrenaron desde cero con unos 15 billones de tokens.
Lo más destacable del lanzamiento es la licencia: todos los modelos se distribuyen bajo Apache 2.0. Se trata de una licencia permisiva que cubre el uso comercial, lo que para un comprador corporativo significa el derecho a ejecutar el modelo en su propia infraestructura, modificarlo e integrarlo en un producto.
Especificaciones técnicas
- Ventana de contexto: hasta 512.000 tokens.
- Modo de razonamiento: los modelos pueden alternar entre modos "pensante" y "no pensante" para controlar el cómputo por tarea. Existe además un modo de "bajo esfuerzo" que ahorra recursos en consultas sencillas.
- Entrenamiento con agentes: las variantes de 8B y 30B pasan por lo que IBM llama "aprendizaje por refuerzo con agentes": aprenden a usar herramientas, escribir y ejecutar código y buscar en la web en entornos aislados reales.
- Compatibilidad: todos los modelos admiten llamadas a herramientas en formato OpenAI y funcionan en las infraestructuras de servicio habituales.
La parte de voz
Los nuevos modelos de voz que acompañan al lanzamiento cuentan con apenas 470 millones de parámetros. Según IBM, duplican en velocidad a los líderes anteriores en la clasificación abierta de reconocimiento del habla y pueden transcribir tres horas de audio en un segundo.
La cifra impresiona, pero conviene situarla: el reconocimiento del habla es una tarea mucho más estrecha que la generación de lenguaje, y que modelos pequeños rindan bien ahí es lo esperable. Aun así, que un modelo de 470 millones de parámetros funcione a esa velocidad marca un umbral relevante para aplicaciones que se ejecutan en el propio dispositivo.
Por qué estos tamaños
Los tres tamaños no son arbitrarios. Cada uno corresponde a una clase de hardware distinta: el modelo de 3.000 millones de parámetros funciona en un portátil, el de 8.000 en una sola tarjeta gráfica de servidor y el de 30.000 en un grupo de servidores modesto.
Es una elección distinta del camino que siguen los modelos de frontera. Los laboratorios de frontera sacan un único modelo enorme y venden el acceso a través de una interfaz; IBM ofrece un abanico que la organización puede escoger según el hardware que ya posee. Responden a preguntas diferentes: una es "cuál es el mejor" y la otra "cuál es el mejor que funciona aquí".
Por qué importa
El lanzamiento llega en un momento de interés creciente por los modelos de lenguaje ejecutados en local, y el posicionamiento de IBM apunta directamente ahí.
Para un comprador corporativo la aritmética funciona así. Con un modelo cerrado se paga por token, los datos van al proveedor y el precio está bajo control del proveedor. Con un modelo de 8.000 millones de parámetros bajo Apache 2.0 ejecutándose en servidores propios, las tres cosas desaparecen. A cambio, el modelo es más débil que los sistemas de frontera, pero muchas tareas corporativas no requieren capacidad de frontera.
Los tamaños elegidos por IBM refuerzan esa lectura. 3B, 8B y 30B son escalas que funcionan, respectivamente, en un portátil, en una sola tarjeta gráfica de servidor y en un grupo de servidores modesto. La compañía no compite en la frontera: vende una capa pensada para funcionar dentro de los propios muros de la organización.