lunes, 10 agosto 2026 · Sem. 33 DE · EN · FR · ES Oscuro
ActualidadIA

Claude Code ya ejecuta también Qwen de Alibaba

cloudmagazin clasifica Qwen3.8-Max: API compatible con Anthropic, conexión con Claude Code, benchmarks mixtos y la cuestión de alojamiento de la clase Max.

Por Alec Chizhik 3 agosto 2026 8 min de lectura
Claude Code ya ejecuta también Qwen de Alibaba

Alibaba ha lanzado Qwen3.8-Max como el modelo más capaz hasta la fecha de la familia Qwen y ha documentado oficialmente la conexión con las cadenas de herramientas de desarrollo occidentales. QwenCloud habla el protocolo de API de Anthropic y ofrece guías de configuración para Claude Code y Codex. Para los arquitectos, la cuestión se desplaza de la elección del modelo a la separación entre harness, backend y modelo operativo.

Lo más importante en resumen

  • Modelo Max: 2.400 mil millones de parámetros en total, 95 mil millones activos (MoE), 1 millón de tokens de contexto; primer modelo de pesos abiertos de la clase Max (pesos disponibles según promesa «la próxima semana»).
  • Compatible con Anthropic: QwenCloud admite los protocolos OpenAI y Anthropic; guías oficiales para Claude Code, Codex y otras herramientas.
  • Situación de los benchmarks: por delante en PaperBench y OSWorld, claramente por detrás de Fable 5 en SWE-bench Pro; la comparabilidad es limitada en algunos casos.

Relacionado: Antares: los SLM de pesos abiertos localizan archivos CVE

Lo que ha lanzado Alibaba

Alibaba Cloud publicó Qwen3.8-Max los días 2 y 3 de agosto de 2026. El fabricante lo describe como el modelo más capaz hasta la fecha de la familia Qwen y como el primer modelo de pesos abiertos de la clase Max. La arquitectura se basa en Qwen-3.5 y utiliza un diseño de mezcla de expertos (Mixture-of-Experts) con 2.400 mil millones de parámetros en total y 95 mil millones de parámetros activos por pasada. La ventana de contexto es de 1 millón de tokens, documentada en la configuración oficial de integración de Codex.

Se prevé que los pesos estén disponibles la próxima semana en Hugging Face y ModelScope. Es una promesa del fabricante. Todavía no se ha cumplido. En paralelo, TechNode anuncia Qwen3.8-27B como variante adicional de código abierto. Según Bloomberg, la acción de Alibaba subió cerca de un 6 por ciento el día del lanzamiento. Para el mercado europeo, lo que cuenta sobre todo es la conexión técnica: el modelo es accesible a través de QwenCloud y habla dos protocolos de API habituales.

En los casos de uso del blog destacan las tareas agénticas de larga duración. En el proyecto oh-my-cli, el modelo funcionó de forma prácticamente autónoma durante 16 días y generó, hasta el 30 de julio, 265 commits, 127 pull requests y 151 issues. Una reproducción de paper tardó unas 125 horas; en el proceso, el sistema mejoró su propio rendimiento en AIME24 en 2,7 puntos. En una ejecución de diseño de chips con unos 500 turnos, el número de puertas lógicas se redujo de 8.298 a 678. Estas demostraciones acreditan resistencia en condiciones controladas. No sustituyen las pruebas de carga en el propio stack.

La conexión compatible con Anthropic

El núcleo operativo del lanzamiento está en la capa de API. QwenCloud ofrece una interfaz compatible con OpenAI y otra compatible con Anthropic. El blog de lanzamiento incluye guías de configuración oficiales para Claude Code, Codex, Qoder, Qwen Code y OpenClaw. Los equipos pueden conservar sus harnesses existentes e intercambiar el endpoint de inferencia, siempre que las rutas de autenticación y enrutamiento estén claramente separadas.

Para Claude Code y Codex, esto significa en concreto lo siguiente: el modelo y las herramientas se tratan como decisiones de compra independientes. Quien utilice Claude Code como interfaz de agente puede conectar Qwen3.8-Max como backend, siempre que QwenCloud sirva correctamente el protocolo de Anthropic. Los niveles de reasoning_effort xhigh, medium y low controlan la profundidad de la planificación interna. Es una palanca de coste y latencia que los arquitectos deberían dejar registrada en los runbooks.

En la práctica surge una nueva lógica de aprovisionamiento. El harness define los flujos de trabajo, las llamadas a herramientas y la gestión de sesiones. El modelo aporta el razonamiento y la generación de código. Cuando ambos están desacoplados, se pueden construir cadenas de respaldo: un backend principal para el día a día, un segundo para picos de carga o aislamiento regulatorio. La condición sigue siendo una revisión cuidadosa de la residencia de datos, el registro y la persistencia de los prompts en la cuenta cloud del proveedor.

Para los responsables de desarrollo en la región DACH, este es el verdadero cambio. La cadena de herramientas ya no tiene que depender de un único modelo. Puede funcionar contra varios backends, siempre que el protocolo, el esquema de herramientas y la observabilidad sean correctos. Qwen3.8-Max se posiciona así como un backend de inferencia intercambiable en un panorama de agentes ya de por sí marcado por proveedores occidentales.

El panorama de los benchmarks es mixto

Las cifras oficiales del blog de Qwen muestran una imagen matizada. La fórmula de la agencia, según la cual Qwen3.8-Max está a la altura de Fable 5, solo se sostiene en tareas seleccionadas. Quien priorice agentes de codificación y reparación de repositorios ve una diferencia notable en SWE-bench Pro. Quien evalúe reproducción de papers y automatización de escritorio encuentra a Qwen3.8-Max en cabeza.

Benchmark Fable 5 GPT-5.6 Sol Qwen3.8-Max
Terminal Bench 2.1 84.6 88.8 86.6
SWE-bench Pro 80.0 64.6 67.7
PaperBench 88.8 90.5 93.0
GPQA Diamond 92.6 94.1 92.6
OSWorld-Verified 85.0 86.1
CoWorkBench 75.9 71.5 74.8

Fuente: blog de Qwen, a fecha de 3 de agosto de 2026, en parte con distintos harnesses

A modo de comparación: Opus 4.8 se sitúa en Terminal Bench 2.1 en 84,6, en SWE-bench Pro en 69,2, en PaperBench en 80,3, en GPQA Diamond en 92,0, en OSWorld-Verified en 83,4 y en CoWorkBench en 72,3. Una nota al pie del blog señala: «Fable5 results may involve fallbacks». Las comparaciones se ejecutan en parte sobre harnesses distintos. Los benchmarks son una orientación. No sustituyen una decisión de compra basada en las cargas de trabajo propias.

Pesos abiertos con 2.400 mil millones de parámetros: quién lo aloja

Un modelo de pesos abiertos de la clase Max con 2.400 mil millones de parámetros suena a soberanía. La realidad operativa es más estrecha. Incluso con 95 mil millones de parámetros activos por paso, la necesidad de memoria para todos los pesos de los expertos sigue siendo alta. A esto se suma una ventana de contexto de 1 millón de tokens, que somete la caché KV y el ancho de banda a una gran carga. Para la mayoría de los operadores europeos, el autoalojamiento de esta clase es hoy un proyecto de infraestructura con clústeres de GPU dedicados, software de servicio MoE especializado y un stack de observabilidad propio.

En la práctica se separan dos vías. Vía uno: la API de QwenCloud para agentes productivos y experimentos, con protocolo Anthropic u OpenAI y los niveles documentados de reasoning_effort. Vía dos: autoalojamiento solo para organizaciones con inferencia a gran escala ya existente, requisitos estrictos de aislamiento y capacidad para actualizaciones de pesos. La publicación anunciada en Hugging Face y ModelScope facilita la evaluación y la preparación del fine-tuning. Por sí sola no resuelve la operativa.

La línea de código abierto más pequeña, Qwen3.8-27B, que TechNode describe como planificada, se dirige a otro segmento: pruebas locales, configuraciones cercanas al edge y equipos sin GPU multi-nodo. Los arquitectos deberían separar ambas líneas en el modelo de cartera. La clase Max y la variante de 27B atienden perfiles distintos de coste, latencia y cumplimiento normativo.

Lo que esto significa ahora para los arquitectos

Hay tres decisiones pendientes. Primero, la estrategia de harness: tratar Claude Code, Codex y herramientas comparables como una capa que funciona sobre backends intercambiables. Segundo, el pipeline de evaluación: construir tareas internas a partir de escenarios de reparación tipo SWE, automatización de escritorio e investigación tipo paper, y medir a Qwen3.8-Max allí donde la ventaja o el retraso frente al blog resulte relevante. Tercero, la forma operativa: API-first con límites claros de gobernanza de datos, self-host solo con beneficio demostrado y capacidad de equipo.

Quien deja agentes funcionando durante días necesita barreras de protección para permisos de herramientas, límites de presupuesto y supervisión humana en los puntos de merge y despliegue. La demo de 16 días y la ejecución de 500 turnos muestran lo que es posible cuando el agente recibe margen. En entornos empresariales, los procesos de aprobación y las pistas de auditoría determinan si esas ejecuciones están permitidas.

Qwen3.8-Max amplía la lista de backends serios para toolchains occidentales. La integración técnica está documentada. Los benchmarks exigen una valoración selectiva. Los pesos abiertos de la clase Max siguen siendo realistas solo para unos pocos operadores. Para el resto, lo que cuenta es la separación limpia entre harness, modelo y contrato de hosting, y la capacidad de cambiar de backend sin reescribir la interfaz del agente.

Preguntas frecuentes

¿Qué es Qwen3.8-Max?

Qwen3.8-Max es el modelo más capaz hasta ahora de la familia Qwen de Alibaba, publicado en agosto de 2026. Utiliza una arquitectura Mixture-of-Experts con 2.400 mil millones de parámetros en total y 95 mil millones de parámetros activos. Es el primer modelo de pesos abiertos de la clase Max; se espera que los pesos se publiquen la próxima semana. La ventana de contexto es de 1 millón de tokens.

¿Cómo se integra Qwen3.8-Max con Claude Code o Codex?

A través de QwenCloud con protocolo API compatible con Anthropic o compatible con OpenAI. El blog oficial de Qwen incluye guías de configuración para Claude Code, Codex, Qoder, Qwen Code y OpenClaw. El parámetro reasoning_effort controla la profundidad de razonamiento en los niveles xhigh, medium y low. La autenticación, el enrutamiento y el registro corresponden a la documentación operativa propia.

¿Está Qwen3.8-Max sistemáticamente al nivel de Fable 5?

La situación depende de la tarea. En PaperBench y OSWorld-Verified, Qwen3.8-Max va por delante. En SWE-bench Pro, Fable 5 lidera con 80,0 frente a los 67,7 de Qwen3.8-Max. Una nota a pie de página en el blog señala posibles fallbacks en los resultados de Fable 5 y harnesses distintos. Los equipos deberían validar con sus propias tareas.

¿Pueden los operadores europeos hacer self-hosting de Qwen3.8-Max de forma razonable?

Solo unas pocas organizaciones con capacidad de GPU de gama alta y servicio apto para MoE. Los 2.400 mil millones de parámetros y la ventana de contexto de 1 millón de tokens exigen mucho a la memoria y al ancho de banda. La mayoría opera de forma más productiva a través de la API de QwenCloud y evalúa el self-hosting solo ante requisitos de aislamiento o soberanía, junto con una plataforma de inferencia ya existente.

Fuente de la imagen: generada por IA (agosto de 2026)

También disponible en

FrançaisEnglishDeutsch
MBF Media Newsletter

El briefing mensual para decisores

Una vez al mes, la newsletter de MBF Media reúne lo esencial de cloudmagazin, MyBusinessFuture, Digital Chiefs y SecurityToday, seleccionado por la redacción.

25 000 responsables de IT y negocio leen esta newsletter. Únase.

Suscríbase gratis
MBF Media Newsletter, aktuelle Ausgabe auf dem iPhone
Una revista de Evernine Media GmbH