miércoles, 22 julio 2026 · Sem. 30 DE · EN · FR · ES Oscuro
IA

Soporte MTP en llama.cpp: modelos locales de 27B un 1,7 veces más rápidos en GPUs de consumo

El PR 22673 introduce la predicción de múltiples tokens en la línea principal de llama.cpp.

Por Alec Chizhik 27 mayo 2026 5 min de lectura
Soporte MTP en llama.cpp: modelos locales de 27B un 1,7 veces más rápidos en GPUs de consumo

7 Min. de lectura

El 16 de mayo de 2026, el PR #22673 se fusionó en llama.cpp. Desde entonces, la Predicción Multi-Token (MTP) se ejecuta en la rama principal. En una RTX 3090, Qwen3.6 27B aumenta así de 38 a 65 tokens por segundo, es decir, 1,7 veces más rápido. Esto no es una noticia

Qué significa la cifra de 1,7x en la práctica

La cifra de 1,7x, tan citada, proviene de un benchmark de RunPod con Qwen3.6 27B en una RTX 3090. Sin MTP, la configuración entrega 38 tokens por segundo en un solo flujo. Con el MTP-Head activado, son 65. Esto supone una diferencia de 27 tokens por segundo. Marca la diferencia entre una interacción que se siente agradable localmente y una que se arrastra como una máquina de escribir.

38 → 65 t/s
Qwen3.6 27B Single-Stream en RunPod RTX 3090, salto de rendimiento de 1,71x por la activación del MTP-Head.
Fuente: Benchmark de la comunidad, documentado en Hugging Face y en el PR #22673 de llama.cpp.

Quien quiera extrapolar esto a otro hardware, debe ser cauteloso. En una 4090, la curva se desplaza porque el forward-pass es de por sí más rápido y la proporción que MTP ahorra parece relativamente menor. Los primeros informes de la comunidad hablan de 1,4x a 1,6x. Para Gemma 4 26B, los informes sitúan el speedup en torno al 40 por ciento. Un corredor realista para las próximas semanas es de 1,4x a casi 2x, dependiendo del modelo, la tarjeta y el nivel de cuantificación.

Qué modelos incorporan MTP hoy y cuáles no

MTP no es un interruptor que se pueda aplicar a cualquier GGUF. El Head debe haber sido configurado en el preentrenamiento o fine-tuning, de lo contrario, simplemente no hay predicción que el modelo principal pueda consumir. A día de hoy, esto cubre una lista de modelos muy limitada.

MTP disponible de forma nativa

  • Qwen3.5 a partir de 7B en adelante
  • Qwen3.6 27B y variantes A3B-MoE
  • DeepSeek V3 y R1
  • Gemma 4 26B en la variante A4B

Sin MTP-Head, sin aceleración

  • Llama 3 en todos los tamaños
  • Familias Mistral y Mixtral
  • Versiones anteriores de Gemma previas a Gemma 4
  • Fine-tunes propios sin un Head explícitamente entrenado

Quien haya construido un setup con Llama-3-70B en los últimos meses, no ganará nada con la fusión por ahora. La cuestión no es si se activa MTP, sino si se está dispuesto a cambiar el modelo base. Para la generación de código y el tool-calling, actualmente hay muchas razones para considerar Qwen3.6. Para las pipelines RAG clásicas, que han funcionado de forma estable con Llama 3 durante un año, un cambio sería un mero ejercicio de ahorro que introduciría otros riesgos, desde el comportamiento del prompt hasta las diferencias del tokenizer.

Realidad del hardware entre 3090, 4090, 5090 y H100

La pregunta interesante no es si MTP sigue teniendo efecto en una H100. La respuesta allí es previsiblemente menos espectacular. La pregunta interesante es dónde se sitúa el umbral a partir del cual una GPU de consumo más MTP puede considerarse seriamente como un sustituto de inferencia para una hora de API.

En una RTX 3090 con 24 GB de VRAM, Qwen3.6 27B en cuantificación Q4 con MTP alcanza aproximadamente 65 tokens por segundo, con longitudes de contexto estables hasta 8k. Esto es suficiente para asistencia de código a nivel de equipo, para respuestas RAG de longitud media, para extracción estructurada. Lo que no es suficiente es el funcionamiento multiusuario simultáneo con alta concurrencia. Tan pronto como tres empleados consultan en paralelo, la aceleración experimentada disminuye de nuevo.

La 4090 solo lo resuelve parcialmente. Más ancho de banda, más potencia de cálculo, pero la misma clase de 24 GB. Quien quiera manejar seriamente varios streams en paralelo, acabará con la 5090 con 32 GB o directamente con H100/H200. Y aquí es exactamente donde reside lo que muchos equipos subestiman: MTP es una solución para el caso de un solo stream, no para el funcionamiento de alta carga con múltiples clientes. En el centro de datos, la H100 sigue siendo la solución más honesta. En la estación de trabajo del ingeniero o en un pequeño clúster interno, la 4090 con MTP se vuelve de repente más interesante de lo que era hace solo tres semanas.

Cuándo la inferencia local realmente compensa frente a los hiperescaladores

El cálculo obvio parece sencillo al principio. Una 4090 cuesta alrededor de 1.700 Euro en compra interna. Electricidad, mantenimiento, amortización a tres años. Si la configuración procesa varios millones de tokens al día, es más barato que cualquier hora de API de OpenAI, Anthropic o AWS Bedrock. Así lo dice la diapositiva. Pero no es tan honesta.

Lo que las diapositivas rara vez muestran es la realidad operativa. La inferencia local nunca es solo la tarjeta. También es el equipo que actualiza el modelo. Es la responsabilidad de las actualizaciones de cuantificación, de la pregunta de si Q4_K_M o Q8_0 es el nivel correcto para la necesidad del próximo trimestre. Es la pipeline de logging que debe ser apta para monitorización. Es la disposición de alguien que mantiene el stack de inferencia, en lugar de solo usarlo.

Ya he operado inferencia local seriamente demasiado pronto. Eso fue en 2024, con un modelo 13B en una 3090. La comparación de costes sobre el papel parecía buena, en la realidad, tres horas de ingeniería por semana en mantenimiento se comieron la ventaja de costes. Hoy, con MTP y con modelos que hacen su trabajo de forma más fiable en 27B, la cuenta cambia. Pero no cambia por sí sola.

Desde mi punto de vista, el corredor honesto es el siguiente. La inferencia local con un modelo 27B compatible con MTP vale la pena si el equipo puede invertir al menos un día trimestral al mes de tiempo de ingeniería para el stack, si las cargas de trabajo se concentran en pocos streams por hora y si las respuestas no tienen que competir en cada segundo del pico absoluto. No vale la pena si se espera la calidad de respuesta de GPT-5 o Claude 4, si se requiere concurrencia multi-tenant y si el equipo no está dispuesto a ver los GGUF como una tarea continua.

Preguntas frecuentes

¿Qué es concretamente la Predicción Multi-Token en llama.cpp?

MTP es una forma de Decodificación Especulativa, en la que un cabezal de salida adicional directamente en el modelo principal sugiere varios tokens simultáneamente. El modelo principal los verifica en el siguiente paso de forward-pass y los acepta o los descarta. A diferencia de la Decodificación Especulativa clásica, no se carga un segundo modelo de

También disponible en

MBF Media Newsletter

El briefing mensual para decisores

Una vez al mes, la newsletter de MBF Media reúne lo esencial de cloudmagazin, MyBusinessFuture, Digital Chiefs y SecurityToday, seleccionado por la redacción.

25 000 responsables de IT y negocio leen esta newsletter. Únase.

Suscríbase gratis
MBF Media Newsletter, aktuelle Ausgabe auf dem iPhone
Ein Magazin der Evernine Media GmbH