Magnitude, software que exprime tu GPU para agentes IA
Descargas un modelo abierto, lo arrancas con un motor genérico y va lento, come memoria y deja la máquina tiritando. Echarle la culpa al hardware es lo fácil, pero dos ingenieros llamados Anders y Tom creen que el problema está en el software intermedio. Su proyecto, Magnitude, conquistó la portada de Hacker News, con una votación de tres dígitos, defendiendo un motor de inferencia que se autoajusta a tu chip exacto.
La idea es sencilla y muy elegante. Los motores actuales eligen entre compatibilidad amplia con rendimiento tibio o rendimiento alto atado a un hardware concreto. Magnitude promete lo mejor de ambos mundos, kernels con parámetros flexibles que se compilan y afinan en tu propio dispositivo antes de ejecutar el modelo. El resultado, siempre según sus propios benchmarks, llega hasta duplicar la velocidad de llama.cpp en escenarios de agentes.
El contexto es una Y Combinator de verano de 2025 que apostó por ellos y un trabajo previo que les dio tablas. Ambos fundadores venían de construir un agente de navegador open source con miles de estrellas y cien mil descargas, y chocaron con que ningún motor servía para agentes locales. Sesiones largas, varias a la vez y con el ordenador en uso para otras cosas. Magnitude nace de esa cicatriz concreta, tal como recoge su ficha en Y Combinator.
Un motor de inferencia distinto
Piensa en un traje de confección frente a uno a medida. Los motores genéricos envían kernels precompilados que sientan regular a todos. Magnitude toma tus medidas primero y cose el kernel que mejor rinde en tu chip, todo está explicado en su web oficial. El ajuste tarda alrededor de un minuto por modelo.
El foco en arquitecturas populares afina el truco. En vez de generalizar para todos los modelos del mundo, el equipo escribe kernels eficientes para las familias abiertas más usadas. Esa concentración permite superar a motores generalistas sin encerrarse en un solo chip, porque modelos de la misma familia comparten arquitectura y reutilizan la optimización una sola vez.
La memoria dinámica es la segunda pata. El motor reserva al inicio solo lo necesario para los pesos y amplía el montón según crecen las sesiones. Tu máquina sigue usable para lo demás mientras los agentes trabajan. En sus mediciones, cada agente consume un 27% menos de memoria.
La atención paginada híbrida completa el cuadro. Toma ideas de motores de datacenter para que varias sesiones compartan cachés, pero coloca los datos con cercanía para que una sola sesión no sufra. Los agentes mezclan turnos largos con herramientas, y ese patrón es el que el equipo optimiza con más mimo.
Lo que el motor afina en tu chip
Los parámetros de cada kernel para tu GPU o CPU concreta.
El tamaño de la caché según la memoria disponible.
El modelo borrador que acelera la generación.
La colocación de datos cuando hay sesiones simultáneas.
Ese minuto de afinado se paga solo. A partir de ahí, cada sesión arranca con los kernels ya ajustados y la memoria dimensionada a tu máquina. Si cambias de GPU o actualizas el modelo, el proceso se repite una vez y listo.
Los números que presumen y cómo leerlos
Los benchmarks propios usan un Qwen 3.6 de 35B con 3B activos, en 4 bits y 64K de contexto, sin decodificación especulativa. En Metal sobre un Mac M4 Pro con 48 GB, la decodificación sube de 30 a 57 tokens por segundo, un 92% más, y el prefill mejora un 9%. En CUDA sobre un DGX Spark, la decodificación pasa de 49 a 58 y el prefill de 2.033 a 2.507, con un 27% menos de memoria por agente.
Conviene matizar que son cifras del fabricante, medidas en su laboratorio y con su configuración. La historia de los benchmarks está llena de victorias locales que se desinflan en hardware ajeno. El aviso honesto es tratar estos números como hipótesis de partida y repetir la medición en tu máquina antes de celebrar.
La comparación con la competencia ayuda a situar la apuesta. Los motores de datacenter priman el batch masivo a costa de la sesión individual. Los generalistas priman la compatibilidad a costa del techo. Magnitude quiere el techo de los especializados con la amplitud de los generalistas.
Para Europa hay un ángulo práctico. Miles de pymes y administraciones quieren IA sin mandar datos fuera, y el hardware disponible es un zoo de Macs, estaciones Windows y servidores variados. Un motor que se afina solo en cada máquina reduce el coste de ese despliegue heterogéneo. Menos memoria por agente significa además modelos capaces en equipos modestos, algo que los presupuestos ajustados agradecen.
Magnitude se distribuye como app de escritorio para Mac, Linux y Windows, y funciona con cualquier GPU de Apple, NVIDIA o AMD, o incluso solo con CPU. No hay mínimo fijo, las máquinas pequeñas corren modelos pequeños y más memoria permite modelos mayores. El catálogo de modelos indica qué cuantizaciones caben en tu memoria y a qué velocidad irán.
Magnitude ofrece una interfaz limpia y fácil de usar
La conexión con agentes es de un clic. Pi, OpenCode, Hermes, Codex, OpenClaw, Claude Code y Cline aparecen como destinos directos, y cualquier otra herramienta habla por API compatible con OpenAI. El motor arranca los modelos bajo demanda cuando el agente los necesita y los apaga tras un periodo de inactividad, sin que tengas que vigilar procesos.
El flujo típico es corto. Descargas un modelo del catálogo Discover, esperas el minuto de afinado, conectas tu agente en la pestaña de conexiones y a trabajar. La app evalúa qué variantes caben en tu hardware para que elijas con criterio entre velocidad e inteligencia, en vez de probar a ciegas hasta que algo encaje.
Un detalle técnico interesante es la decodificación especulativa con drafter asignado por modelo. Cada modelo del catálogo trae su modelo borrador recomendado, con métodos modernos de especulación que aceleran la generación sin cambiar el resultado. Es una de esas optimizaciones invisibles que se notan en la fluidez del día a día.
La cuantización de la caché KV sigue la misma filosofía. Las claves a 8 bits y los valores a 4 bits recortan más de la mitad la memoria de contexto largo, aceleran la decodificación y, según sus pruebas internas, no degradan la coherencia en contextos extensos. Para agentes que acumulan historial con herramientas, ese ahorro decide si la sesión cabe o no cabe.
La maravilla del Open Source
El proyecto se publica con licencia Apache 2.0 y está escrito en Rust, incluido un runtime propio de kernels GPU con autoafinado. Las ideas beben de la academia y de los mejores motores abiertos, con atención Flash, inferencia especulativa y atención radix adaptada. Nada de cajas negras, el código se puede leer y mejorar por cualquiera.
El modelo de negocio mira al futuro híbrido. Hoy el foco es el motor local gratuito, y mañana llegará una nube de inferencia para cargas mixtas, con cambio fluido entre local y nube sin romper la caché de prefijo. Cobrarán por token en esa nube, trasladando las eficiencias del motor al precio. Es un plan razonable, vender comodidad cuando la necesites sin cerrar el código.
La hoja de ruta pública menciona tres frentes. El streaming de expertos para correr modelos mixture of experts mayores que tu VRAM, cargando expertos desde RAM o disco justo a tiempo. Un compilador de kernels que fusione operaciones automáticamente. Y el uso multi dispositivo que reparta la carga entre CPU, GPUs, RAM y disco según la topología detectada.
La comunidad respondió con preguntas afiladas en el lanzamiento. Por Vulkan en AMD, por la comparación con ROCm, por el soporte de Backends nuevos y por si el afinado es un agente optimizando kernels. Los fundadores respondieron turno por turno, con benchmarks de Vulkan en marcha y la promesa de añadir Backends si Vulkan no alcanza el techo. Esa transparencia en horario de portada dice mucho del equipo.
La lectura de fondo es que la IA local dejó de ser un capricho de entusiastas. Con agentes que viven en tu máquina y modelos abiertos que mejoran cada trimestre, el cuello de botella ya no es el peso de los modelos sino el partido que el motor le saca a tu chip. Afinar en destino, en vez de promediar en origen, parece la dirección correcta para un parque de hardware tan diverso como el actual.
Habrá que ver si los números se sostienen fuera del laboratorio y si la nube híbrida llega sin encerrar el proyecto. El arranque, con portada en HN, código abierto real y fundadores que responden, invita al optimismo prudente. Si tienes un agente local tragón, esta es la semana de medirlo contra tu motor actual en tu propia máquina.