PrismML, una startup fundada por investigadores de Caltech y respaldada por Khosla Ventures, Cerberus y Google, ha anunciado Bonsai 27B, el primer modelo de inteligencia artificial con 27.000 millones de parámetros (27B) capaz de ejecutarse directamente en un teléfono móvil. Y no solo eso: lo hace con tan solo 3,9 GB de peso, una hazaña técnica que hasta ahora parecía imposible.
Dos versiones para dos escenarios
Bonsai 27B se basa en Qwen3.6 27B y llega en dos sabores:
- Ternary Bonsai 27B (5,9 GB): usa pesos ternarios {−1, 0, +1} con escalado por grupos FP16, ofreciendo 1,71 bits efectivos por peso. Es la variante orientada a calidad, ideal para portátiles, con capacidad de razonamiento multiturno, llamadas a herramientas y loops de agente.
- 1-bit Bonsai 27B (3,9 GB): usa pesos binarios {−1, +1}, con 1,125 bits efectivos por peso. Cabe dentro del presupuesto de memoria de un iPhone 17 Pro, llevando por primera vez un modelo de clase 27B a un teléfono.
Ambas variantes son multimodales (procesan texto, imágenes, documentos y cámara) y admiten un contexto de 262K tokens con speculative decoding para acelerar la generación.
¿Y qué tal funciona?
Los benchmarks hablan solos: la versión ternaria retiene el 95% del rendimiento del modelo original en precisión completa (FP16), y la versión de 1 bit retiene el 90%. En áreas críticas como matemáticas y código, la pérdida es mínima. En razonamiento agéntico y llamadas a herramientas, se mantiene a pocos puntos de distancia.Para ponerlo en perspectiva: Bonsai 27B en 1-bit alcanza hasta 163 tokens/segundo en una NVIDIA RTX 5090 y hasta 87 tokens/s en un Apple M5 Max. En el iPhone 17 Pro Max, el modelo corre completamente en el dispositivo.
La clave: densidad de inteligencia
PrismML lleva años refinando técnicas de compresión de redes neuronales sin sacrificar capacidad de razonamiento. Su fundador lo explica con una métrica propia: la «densidad de inteligencia» (intelligence per GB). Con Bonsai 27B de 1 bit, se consigue 0,53 por GB: más de 10 veces la densidad del modelo original en FP16, y unas 2,7 veces la mejor alternativa de baja precisión disponible.El modelo se distribuye bajo licencia Apache 2.0 y ya está disponible en Hugging Face. Funciona de forma nativa en Apple (Mac, iPhone, iPad) vía MLX y en GPUs NVIDIA vía CUDA. PrismML ofrece además una API gratuita de desarrollador por tiempo limitado.
Por qué es importante
Hasta ahora, un modelo de 27B en 16 bits ocupaba unos 54 GB, y en 4 bits unos 18 GB —demasiado para un móvil. Un iPhone 12 GB solo expone unos 6 GB utilizables para el modelo, y eso compartiendo con la caché KV y las activaciones. Ningún build convencional de un modelo 27B se acercaba siquiera. Bonsai 27B de 1 bit, con sus 3,9 GB, es el primero en pasar por esa puerta con margen de sobra.La inteligencia artificial de alto nivel deja de estar atada a la nube y a costosos servidores. Se lleva en el bolsillo. Y eso cambia las reglas del juego para la privacidad, la latencia y la accesibilidad de la IA.






