miércoles, 22 julio 2026 · Sem. 30 DE · EN · FR · ES Oscuro
IA

Gemma 4 local: La ofensiva open source de Google y la nube

&8211; Google ha lanzado con Gemma 4 cuatro modelos de código abierto que funcionan en hardware de consumo y alcanzan en los benchmarks a modelos significativamente más grandes. Para las arquitecturas en …

Por Tobias Massow 3 abril 2026 6 min de lectura
Gemma 4 local: La ofensiva open source de Google y la nube

Google ha lanzado con Gemma 4 cuatro modelos de código abierto que funcionan en hardware de consumo y alcanzan en los benchmarks a modelos significativamente más grandes. Para las arquitecturas en la nube, esto desplaza el límite entre Edge y Cloud, haciendo por primera vez realista el despliegue híbrido de IA a gran escala.

Lo más importante en resumen

  • Gemma 4 incluye cuatro tamaños de modelo (de 2B a 31B de parámetros), ejecutables localmente en GPUs con al menos 16 GB de VRAM.
  • El modelo de 31B ocupa el puesto 3 entre todos los modelos abiertos en el Arena AI Text Leaderboard (ELO 1452).
  • La licencia Apache-2.0 permite el uso comercial sin restricciones, también On-Premise y en entornos Air-Gapped.
  • La función nativa de llamadas y la salida estructurada en JSON hacen que los modelos sean directamente utilizables en flujos de trabajo agente.
  • Para empresas del DACH surge una alternativa real a los servicios de IA basados en API de grandes proveedores estadounidenses y chinos.

Cuatro modelos, un objetivo: llevar la IA del centro de datos al escritorio

La familia Gemma de Google siempre estuvo orientada al funcionamiento local. Con la cuarta generación, Google continúa firmemente esta línea, ofreciendo modelos que marcan nuevos estándares en su categoría de tamaño.

Las cuatro variantes en resumen:

E2B
2B efectivos, Móvil/IoT

E4B
4B efectivos, Edge

26B MoE
4B activos, Estación de trabajo

31B
Denso, máxima calidad

Los dos modelos más pequeños (E2B, E4B) utilizan Per-Layer Embeddings (PLE), una técnica que asigna embeddings de tokens propios a cada capa del decodificador. El resultado: tablas de embeddings grandes, pero consumo mínimo de RAM en tiempo de inferencia. Google ha optimizado estos modelos junto con Qualcomm y MediaTek para su funcionamiento en smartphones, Raspberry Pi y Nvidia Jetson Orin Nano. Contexto de 128K tokens, multimodal incluyendo entrada de audio.

Los dos modelos más grandes apuntan a estaciones de trabajo y servidores locales. El modelo 26B-MoE activa solo 4 mil millones de parámetros por paso de inferencia, con una calidad casi equivalente al modelo denso de 31B. Ambos soportan un contexto de 256K tokens y procesan de forma nativa vídeo, imágenes y datos estructurados.

Benchmarks: ¿Dónde se sitúa realmente Gemma 4?

Los resultados de los benchmarks son notables para un modelo de este tamaño. En el Arena AI Text Leaderboard, Gemma 4 31B alcanza una puntuación ELO de 1452, ocupando el tercer puesto entre todos los modelos abiertos, detrás de GLM-5 y Kimi K2.5, que requieren múltiples veces más parámetros.

En detalle: MMLU 85,2%, AME 2026 en 89%, LiveCodeBench 80%, T2 Bench 86% y GPQA Diamond 84,3%. En Tool Calling, un criterio clave para flujos de trabajo automatizados, el modelo de 31B obtiene un resultado perfecto en pruebas independientes.

El punto de comparación relevante para despliegues locales: Qwen 3.5 de Alibaba ofrece valores similares en los benchmarks, pero requiere 397 mil millones de parámetros con 17 mil millones activos. Esto no es ejecutable en hardware de consumo. Gemma 4 31B funciona en una única GPU con 24 GB de VRAM, suficiente con una RTX 4090 o modelo comparable.

Funcionamiento local: ¿Qué se necesita concretamente?

Gemma 4 está disponible a través de todos los frameworks de inferencia habituales: Ollama, LM Studio, llama.cpp, MLX (para Apple Silicon), vLLM y Nvidia NIMs. Así, la barrera de entrada para su uso local es ahora más baja que nunca.

Para el modelo 31B en cuantización Q4, se debe contar con aproximadamente 18-20 GB de VRAM. El modelo E4B funciona sin problemas en una GPU con 8 GB o directamente en el smartphone. La velocidad de inferencia depende del framework elegido y del nivel de cuantización; primeras pruebas comunitarias reportan entre 15 y 25 tokens por segundo en una RTX 4090 para el modelo de 31B.

// Texto original

Los modelos de código abierto se vuelven más pequeños, mejores y más rápidos. Esta es la razón por la que soy tan optimista respecto al Edge Compute: este modelo híbrido entre modelos avanzados alojados para las tareas más difíciles y la inferencia local para la mayoría de las cargas de trabajo.

Matthew Berman · analista de IA (YouTube, abril 2026)

Un aspecto merece atención: la caché KV de los modelos Gemma es relativamente grande. Quien quiera usar ventanas de contexto largas necesitará más RAM. Para despliegues productivos con contexto completo de 256K, el modelo de 31B debería ejecutarse en hardware con al menos 48 GB de VRAM o memoria unificada.

Qué significa esto para las arquitecturas en la nube

La verdadera noticia no es que exista otro modelo de código abierto. Es que la brecha de calidad entre modelos locales y alojados se está cerrando para la mayoría de los casos de uso.

La implicación para arquitectos en la nube: no todos los procesos de IA deben ir a la nube. Clasificación, resúmenes, extracción de datos estructurados, asistencia en código, análisis de documentos: todo esto puede realizarse localmente con Gemma 4, sin que los datos sensibles abandonen la red empresarial.

El modelo híbrido que surge: modelos locales para la mayor parte de la inferencia diaria, modelos avanzados alojados (GPT-5, Claude Opus) para las tareas más complejas. La lógica de enrutamiento entre ambos se convierte en la nueva competencia clave para los equipos de MLOps.

Para empresas del DACH, hay un factor adicional: soberanía de datos. Quien opera procesos de IA exclusivamente mediante APIs estadounidenses o chinas, cede el control sobre el lugar de procesamiento y los flujos de datos. Los modelos locales bajo licencia Apache-2.0 eliminan completamente este riesgo. No es una cuestión ideológica, sino una decisión arquitectónica que facilita el cumplimiento del RGPD y reduce la latencia.

Valoración: Un punto de inflexión para la IA en el Edge

Gemma 4 no es un avance en el sentido de una tecnología completamente nueva. Es la confirmación consecuente de una tendencia: los mejores modelos abiertos son lo suficientemente pequeños para hardware local y lo suficientemente buenos para uso productivo. Google invierte fuertemente en este segmento, y con la licencia Apache 2.0 no hay trampas de licencias.

Quien hoy planifica estrategias de IA en la nube, debería considerar la inferencia local como un componente arquitectónico. No como sustituto de los modelos avanzados, sino como capa complementaria que puede absorber entre el 70 y el 80 % de las cargas de trabajo estándar de inferencia, más rápido, más económico y sin fugas de datos.

Ya no se trata de si la IA local está lista para producción. La pregunta es cuán rápido los equipos de infraestructura adaptarán sus procesos de adquisición de GPU y sus pipelines de MLOps a esto.

Preguntas frecuentes

¿Qué hardware necesito para Gemma 4 31B?

Para el modelo 31B en cuantización Q4 se necesitan aproximadamente 18-20 GB de VRAM. Una Nvidia RTX 4090 (24 GB), RTX 5090 o un Mac con Apple Silicon y 32 GB de memoria unificada son suficientes. Para el contexto completo de 256K, se recomiendan 48 GB o más.

¿Está Gemma 4 autorizado para uso comercial?

Sí. Gemma 4 está bajo la licencia Apache-2.0, una de las licencias de código abierto más permisivas. El uso comercial, la modificación y la redistribución están permitidas sin restricciones, incluso en entornos Air-Gapped y para productos propietarios.

¿Cómo se compara Gemma 4 con Qwen 3.5 y Llama?

Gemma 4 31B alcanza puntuaciones ELO similares a Qwen 3.5 (397B/17B activos), pero con 31B de parámetros es significativamente más pequeño y ejecutable en hardware de consumo. En comparación con los modelos Llama de Meta, Gemma 4 ofrece capacidades superiores de Tool Calling y multimodalidad nativa. La elección del modelo depende del caso de uso específico; actualmente, Gemma 4 lleva ventaja en flujos de trabajo agente.

¿Reemplaza la IA local a los servicios de IA en la nube?

No completamente. Modelos avanzados como Claude Opus o GPT-5 siguen siendo superiores para las tareas más complejas. Sin embargo, modelos locales como Gemma 4 son adecuados para la mayoría de las cargas de trabajo estándar: clasificación, resumen, extracción de datos, asistencia en código. El enfoque eficiente es un enrutamiento híbrido: local cuando sea posible, en la nube cuando sea necesario.

¿Qué frameworks de inferencia soportan Gemma 4?

Gemma 4 está disponible desde su lanzamiento en Ollama, LM Studio, llama.cpp, MLX (Apple Silicon), vLLM, Nvidia NIMs, HuggingFace y Unsloth. La integración en pipelines de MLOps existentes es posible sin adaptadores personalizados.

Fuente imagen principal: Pexels

También disponible en

FrançaisEnglishDeutsch
MBF Media Newsletter

El briefing mensual para decisores

Una vez al mes, la newsletter de MBF Media reúne lo esencial de cloudmagazin, MyBusinessFuture, Digital Chiefs y SecurityToday, seleccionado por la redacción.

25 000 responsables de IT y negocio leen esta newsletter. Únase.

Suscríbase gratis
MBF Media Newsletter, aktuelle Ausgabe auf dem iPhone
Ein Magazin der Evernine Media GmbH