DGX Spark vs. Mac Mini: El prellenado cuenta
Los benchmarks comunitarios muestran: DGX Spark domina en Prefill, mientras que Mac Mini se mantiene en el Token-Decode.
Un benchmark comunitario con el mismo modelo 30B ha agudizado el debate sobre la IA local: en el prefill, la DGX Spark de NVIDIA juega en otra liga, mientras que en el decode de tokens, un Mac Mini considerablemente más económico se acerca de forma sorprendente. Quien compre mal, pagará cuatro mil euros por eliminar el cuello de botella equivocado.
Lo más importante en resumen
- Prefill ≠ Decode. Spark destaca en la lectura de contextos grandes. La velocidad de respuesta percibida suele depender del decode.
- Diferencia de precio. La DGX Spark se sitúa en el rango de los cuatro mil euros, mientras que un Mac Mini bien equipado queda claramente por debajo.
- Regla de compra. Historiales largos de RAG/agentes → hardware para prefill. Chat y bucles cortos → una caja Apple o una GPU local suele ser suficiente.
Relacionado:
Mac Studio M5: gestionar cargas de trabajo en la nube de forma eficiente /
MacStadium y Scaleway ponen al M5 a prueba
El benchmark que revela dos verdades
En una comparación muy compartida, un Mac Mini M4 Pro, una caja AMD Strix Halo y una DGX Spark ejecutaron el mismo modelo cuantizado de 30B. En el procesamiento de prompts (prefill), Spark se alejó con más de 2.000 tokens por segundo. En la generación de tokens -la parte que se observa al recibir respuestas-, los tres se movieron en un rango similar de entre 50 y 85 tokens por segundo.
Esto explica por qué las reseñas suenan tan contradictorias. Algunos elogian a Spark como un superordenador de escritorio. Otros encuentran que el Mac Mini es subjetivamente más rápido. Ambos pueden tener razón, dependiendo de si el cuello de botella es la entrada de contexto o el flujo de salida.
Cuándo justifica el presupuesto el prefill
El prefill se nota caro cuando los agentes introducen en el contexto grandes bases de código, historiales de chat extensos o fragmentos de RAG. Cada nuevo turno con un prompt enorme consume tiempo antes de que aparezca el primer token. Precisamente ahí se amortiza el hardware Spark: menos espera antes del primer output útil y mejor paralelismo en trabajos por lotes.
Para los equipos del sector medio alemán, austriaco y suizo (DACH), esto significa: si el caso de uso es «PDF de 30 páginas + repositorio + política», vale la pena la potencia de prefill. Si el caso de uso es «chat de codificación diario con 8k de contexto», están comprando un exceso.
El Mac Mini como modelo alternativo
El silicio de Apple destaca por su memoria unificada, su funcionamiento silencioso y su sencillez operativa. Para la inferencia en el día a día -Ollama, modelos locales de codificación, transcripción-, un Mini bien especificado suele ser suficiente, siempre que el modelo quepa en la memoria. La ventaja en el coste total de propiedad (TCO) reside en el precio de compra y, además, en el consumo eléctrico, el ruido y la menor sobrecarga administrativa.
Los entornos híbridos son el camino pragmático: una caja NVIDIA potente en prefill para contextos pesados y una caja Apple para el decode interactivo y la automatización cotidiana. Esto es arquitectónicamente más complejo, pero más honesto que la religión de una sola caja.
Decisión sin marketing
Tres preguntas antes de hacer el pedido: (1) ¿Qué tamaño tienen los prompts típicos? (2) ¿Con qué frecuencia se ejecutan varios trabajos en paralelo? (3) ¿Necesitamos el ecosistema CUDA o basta con Metal/MLX? Quien no pueda responder a estas tres preguntas, debería medir primero, no pedir.
Qué miden mal los equipos
Muchas adquisiciones comienzan con una única cifra de tokens por segundo. Es tan incompleto como comprar un coche solo por su velocidad máxima. Para la IA local, cuentan tres métricas: el prefill con contextos grandes, el decode en el chat interactivo y el rendimiento en trabajos paralelos. Quien optimiza solo una cifra, crea puntos ciegos en el día a día.
En la práctica, ayuda un protocolo de 48 horas en el propio stack: los mismos modelos, la misma cuantización, prompts reales de tickets y repositorios. Además, el consumo eléctrico y el ruido en el puesto de trabajo. Solo después queda claro si la ventaja en prefill de la clase DGX-Spark justifica el sobreprecio, o si un Mac Mini con suficiente Unified Memory ya resuelve el cuello de botella del equipo.
Para los equipos del sector medio alemán, austriaco y suizo (DACH), la compliance se suma a la ecuación. Una caja silenciosa en la oficina puede mantener localmente bases de código sensibles y datos de clientes. Esto no sustituye una política en la nube, pero reduce exportaciones innecesarias por API. Precisamente esta combinación de perfil de rendimiento y control de datos convierte la decisión de hardware en estratégica, no solo técnica.
Preguntas frecuentes
¿Qué es el prefill?
La fase en la que el modelo procesa el contexto de entrada antes de generar tokens. En prompts largos suele ser la parte más costosa.
¿Qué es el decode?
La generación de los tokens de respuesta. Es la velocidad que se percibe al leer la respuesta.
¿Para quién vale la pena DGX Spark?
Para equipos con contextos grandes, pipelines de agentes y necesidad del stack de software de NVIDIA, no para un chat ocasional.
¿Basta un Mac Mini para IA local?
Para muchos escenarios de modelos 7B-30B con RAM adecuada, sí. Para cargas extremas de prefill y herramientas solo CUDA, no.
¿Son fiables los benchmarks comunitarios?
Como señal de tendencia, sí; como garantía de compra, no. La cuantización, los controladores y el estado del software alteran mucho las cifras.
Recomendaciones de lectura de la redacción
- Mac Mini como servidor de flujos de trabajo de IA 24/7
- Mac Studio M5: gestionar cargas de trabajo en la nube de forma eficiente
- MSI Cubi NUC AI+: caja de IA bajo el monitor
Más del MBF Media Netzwerk
Más de la red MBF Media
MyBusinessFutureAtasco inversor: cómo la IA libera presupuestos ocultosDigital ChiefsLa TI decide si la escisión vale la penaSecurityTodayEl AI Act es en realidad una ley de seguridadFuente de la imagen: generada por IA (julio de 2026)

