Qwen3.8-Max se ha convertido rápidamente en uno de los lanzamientos de modelos de IA más comentados de 2026.
El equipo de Qwen de Alibaba lo presentó oficialmente como el “modelo con más capacidad” de la compañía hasta la fecha. Con aproximadamente 2,4 billones de parámetros en total, Qwen3.8-Max se posiciona como un modelo insignia para la codificación autónoma, el trabajo profesional, agentes de largo alcance y la inteligencia multimodal.
El anuncio oficial también incluye varios detalles que faltaban durante el periodo de vista previa. Qwen ya ha publicado precios de su API, resultados de benchmarks de lenguaje y visión, ejemplos de tareas de agentes de larga ejecución y un calendario para el lanzamiento de los pesos de modelo open.
El resultado es más que otra actualización de chatbot. Qwen3.8-Max refleja un cambio más amplio: pasar de modelos de IA que generan respuestas aisladas a agentes de IA capaces de planificar, usar herramientas, inspeccionar su propio trabajo y completar proyectos complejos.
¿Qué es Qwen3.8-Max?
Qwen3.8-Max es el último modelo insignia de Alibaba dentro de la familia Qwen. Está diseñado para razonamiento avanzado, desarrollo de software, análisis multimodal, flujos de trabajo profesionales y tareas de agentes autónomos.
El modelo estuvo disponible inicialmente bajo el identificador:
qwen3.8-max-preview
La vista previa dio a los desarrolladores acceso temprano, pero dejó varias preguntas sin respuesta, en particular sobre el precio estándar de la API, la disponibilidad de pesos open y el rendimiento completo en benchmarks.
Esos detalles quedaron más claros en el anuncio oficial de Qwen3.8-Max publicado el 3 de agosto.
Qwen describe el modelo como un nuevo referente para el “coding and cowork”, destacando cuatro áreas fundamentales:
- Desarrollo autónomo de software
- Entregables de calidad profesional
- Planificación y ejecución de largo horizonte
- Inteligencia nativa de agentes multimodales
Por lo tanto, Qwen3.8-Max no se plantea simplemente como un modelo conversacional más grande. Su objetivo es funcionar como el motor de razonamiento detrás de sistemas de IA que trabajan con código, documentos, interfaces visuales, herramientas externas e historiales de tareas extendidos.
Características clave de Qwen3.8-Max
Aproximadamente 2,4 billones de parámetros
La especificación principal de Qwen3.8-Max es su escala reportada de 2,4 billones de parámetros.
Eso lo convierte en uno de los modelos más grandes anunciados públicamente por el equipo de Qwen. Sin embargo, los parámetros totales no deben confundirse con la cantidad de parámetros que se usan en cada respuesta.
Si el modelo utiliza una arquitectura de mixture-of-experts, solo una parte de la red completa puede activarse para una solicitud individual. El rendimiento en el mundo real también depende de:
- La cantidad de parámetros activos
- La calidad de los datos de entrenamiento
- Los métodos de aprendizaje por refuerzo
- La precisión en el uso de herramientas
- La gestión del contexto
- La infraestructura de inferencia
- La latencia de la respuesta
- La fiabilidad en tareas repetidas
El conteo de parámetros demuestra la escala del modelo, pero no prueba que Qwen3.8-Max vaya a superar a cada modelo competidor en cada escenario.
Codificación autónoma
Según Qwen, Qwen3.8-Max puede mantener más de diez días de desarrollo de software que evoluciona por sí mismo.
La compañía presenta un ejemplo en el que el modelo pasa de una carpeta vacía a un proyecto listo para producción con una intervención humana limitada. El rastro público del proyecto está disponible a través del repositorio de GitHub vinculado en el anuncio oficial.
Se trata de una tarea más exigente que generar una función corta o corregir un único error. La codificación autónoma de larga duración puede requerir que el modelo:
- Comprenda el objetivo del producto.
- Diseñe una arquitectura adecuada.
- Cree y edite múltiples archivos.
- Instale o configure dependencias.
- Ejecute pruebas e interprete errores.
- Revise la aplicación resultante.
- Corrija problemas de implementación.
- Continúe iterando sin perder el objetivo original.
La demostración es un ejemplo proporcionado por el proveedor, en lugar de un benchmark independiente. Aun así, ilustra el tipo de flujo de desarrollo extendido que Qwen3.8-Max está diseñado para respaldar.
Trabajo de agentes de largo horizonte
Qwen también destaca dos escenarios de agente inusualmente largos:
- Más de 500 turnos de optimización para diseño de chips
- Una estrategia simulada de e-commerce de 365 días
Estos ejemplos buscan demostrar un aprendizaje adaptativo en circuito cerrado. En este tipo de flujo de trabajo, un agente no solo produce un plan de una sola vez. Observa repetidamente los resultados, actualiza su estrategia y decide qué hacer a continuación.
Un agente competente de largo horizonte debe conservar contexto importante mientras evita la acumulación de un historial irrelevante. También necesita memoria fiable, seguimiento del progreso, permisos de herramientas, reglas de validación y mecanismos de recuperación.
El modelo es solo una parte de ese sistema. El rendimiento del agente también depende del software circundante y del diseño del flujo de trabajo.
Inteligencia multimodal nativa
Qwen3.8-Max admite entradas de texto, imagen y video.
Qwen describe la visión como un bucle de retroalimentación continuo, en lugar de un único canal de entrada. Un agente visual puede repetir:
- Observar una interfaz
- Identificar el estado actual
- Decidir la siguiente acción
- Operar una herramienta
- Inspeccionar el resultado
- Detectar un error
- Corregir su acción previa
Esto es especialmente relevante para la automatización del navegador, las pruebas de software, el procesamiento de documentos, la revisión de interfaces y flujos de trabajo que combinan instrucciones escritas con información visual.
Contexto de un millón de tokens
Los registros de integración de Qwen Code publicados indican una ventana de contexto de aproximadamente un millón de tokens para Qwen3.8-Max.
Una ventana de contexto de este tamaño puede respaldar:
- Repositorios grandes de software
- Colecciones de artículos de investigación
- Documentos de negocio extensos
- Historias de agentes de larga duración
- Múltiples archivos y fuentes de datos
- Videos largos o transcripciones
Sin embargo, más contexto no produce automáticamente una mejor respuesta. Entradas muy grandes pueden aumentar la latencia y dificultar que el modelo se enfoque en la evidencia relevante.
Para obtener mejores resultados, los usuarios aún deben organizar sus materiales, eliminar información no relacionada, resumir etapas completadas y pedir al modelo que cite los archivos o fragmentos que respaldan conclusiones importantes.
Benchmarks de lenguaje y agentes de Qwen3.8-Max
Qwen publicó un gráfico de benchmark oficial que compara Qwen3.8-Max con Opus 4.8, Fable 5, GPT-5.6 Sol y Qwen3.7-Max.

Los resultados seleccionados de Qwen3.8-Max incluyen:
| Benchmark | Puntuación de Qwen3.8-Max |
|---|---|
| Terminal Bench 2.1 | 89.8 |
| FrontierSWE | 73.5 |
| PaperBench | 83.0 |
| AndroidBench | 75.1 |
| QwenSWEBench | 80.7 |
| QwenCoderBench | 58.4 |
| QwenReactBench | 1,724 |
| QwenSVGBench | 1,713 |
| CoWorkBench | 74.8 |
| WorkSpaceBench | 67.7 |
| JobBench | 53.4 |
| SkillsBench | 70.2 |
| GPQA Diamond | 92.6 |
| MMLU-Pro | 92.9 |
| LongBench v2 | 68.3 |
El gráfico indica ganancias sustanciales sobre Qwen3.7-Max en varias categorías.
Por ejemplo, la puntuación de Terminal Bench 2.1 reportada sube de 74.5 para Qwen3.7-Max a 89.8 para Qwen3.8-Max. El resultado de CoWorkBench aumenta de 64.8 a 74.8, mientras que WorkSpaceBench sube de 61.4 a 67.7.
El modelo también reporta resultados sólidos de razonamiento general, incluyendo 92.6 en GPQA Diamond y 92.9 en MMLU-Pro.
Qwen3.8-Max no lidera cada benchmark en la tabla. Otros modelos conservan puntuaciones más altas en algunas evaluaciones de ingeniería de software y de agentes profesionales. Por lo tanto, los resultados respaldan describir Qwen3.8-Max como altamente competitivo, pero no universalmente superior.
Estas cifras fueron publicadas por Qwen. Aún es necesario realizar pruebas independientes antes de sacar conclusiones sobre el rendimiento en producción.
Benchmarks multimodales de Qwen3.8-Max
Qwen lanzó un gráfico de benchmark separado que cubre el razonamiento multimodal, agentes visuales, inteligencia documental, comprensión espacial, anclaje visual y tareas de video.

Los resultados seleccionados incluyen:
| Benchmark | Puntuación de Qwen3.8-Max |
|---|---|
| MMMU-Pro | 82.3 |
| MathVision | 95.2 / 97.7 |
| LogicVista | 91.9 |
| SLAKE | 90.8 |
| OSWorld-Verified | 86.1 |
| AndroidWorld | 85.3 |
| Parametric CAD Bench | 91.5 |
| OmniDocBench 1.5 | 92.1 |
| RealWorldQA | 88.0 |
| MMStar | 85.9 |
| CountQA | 82.4 |
| Dense200 | 87.0 |
| VideoMME con subtítulos | 90.4 |
| VideoMMMU | 88.7 |
| MLVU | 90.8 |
Los resultados sugieren que Qwen3.8-Max no es simplemente un modelo de lenguaje con una función de carga de imágenes. Está optimizado para tareas en las que la información visual afecta la planificación y el uso de herramientas.
Benchmarks como OSWorld-Verified y AndroidWorld prueban partes de este flujo de trabajo de agentes. Requieren que el modelo entienda una interfaz y determine cómo interactuar con ella.
Qwen3.8-Max reporta un rendimiento sólido en muchas de estas evaluaciones, aunque no lidera cada benchmark de agente visual. Las puntuaciones altas en comprensión de documentos o en respuesta visual a preguntas tampoco garantizan automáticamente un control informático fiable.
Mira Qwen3.8-Max en acción
¿Quieres un vistazo más de cerca a Qwen3.8-Max y a cómo se compara con otros modelos open líderes? Mira el video a continuación para un desglose práctico de sus capacidades, el rendimiento en benchmarks y posibles aplicaciones en el mundo real.

Precios de API de Qwen3.8-Max
El anuncio oficial incluye los siguientes precios de API:
| Tipo de uso | Precio oficial |
|---|---|
| Entrada | $2.00 por millón de tokens |
| Salida | $6.00 por millón de tokens |
| Caché implícita | $0.25 por millón de tokens |
Esto es una actualización importante respecto al periodo de vista previa, cuando el precio estándar por token no estaba disponible de forma clara.
El precio de caché implícita puede ser útil para agentes que acceden repetidamente al mismo repositorio, instrucciones del sistema, documentos de la empresa o el historial de conversaciones.
Los costos reales del flujo de trabajo seguirán dependiendo de:
- Tamaño del contexto de entrada
- Longitud del razonamiento
- Salida generada
- Número de llamadas a herramientas
- Intentos fallidos y reintentos
- Comportamiento del almacenamiento en caché del contexto
- Requisitos de revisión humana
Por lo tanto, las empresas deberían calcular el costo por tarea completada en lugar de comparar modelos solo por las tarifas anunciadas por tokens.
Un modelo con tokens baratos aún puede resultar costoso si requiere correcciones repetidas. Un modelo más caro puede ofrecer mejor valor si completa la tarea correctamente en el primer intento.
¿Qwen3.8-Max es open source?
En su anuncio del 3 de agosto, Qwen indicó que los pesos open de Qwen3.8-Max se lanzarían la semana siguiente.
El equipo también anunció un modelo Qwen3.8-27B con pesos open.
Hasta que los pesos y la licencia se publiquen realmente, la descripción más precisa es:
Qwen ha anunciado oficialmente un lanzamiento inminente de pesos open para Qwen3.8-Max y Qwen3.8-27B. Los desarrolladores deberían verificar el repositorio final, la licencia, los checkpoints y los requisitos de despliegue cuando el lanzamiento esté disponible.
El despliegue local de un modelo con 2,4 billones de parámetros en total requeriría una infraestructura considerable. El modelo más pequeño de 27B puede ser más práctico para desarrolladores individuales, equipos de investigación y empresas con capacidad de GPU limitada.
¿Quién debería usar Qwen3.8-Max?
Equipos de desarrollo de software
Qwen3.8-Max puede ser útil para:
- Explorar repositorios desconocidos
- Planificar cambios en la arquitectura
- Editar múltiples archivos
- Depurar fallos complejos
- Ejecutar pruebas
- Construir aplicaciones completas
- Operar agentes de codificación de larga duración
Antes de permitir que el modelo modifique código de producción, los equipos deben probar si sigue las instrucciones del repositorio, usa el directorio de trabajo correcto, limita las ediciones al alcance solicitado y valida sus cambios.
Equipos de investigación y contenido
El contexto largo y las capacidades multimodales del modelo pueden respaldar:
- Síntesis de investigación
- Análisis competitivo
- Revisión de documentos
- Análisis de video
- Extracción de conocimiento
- Generación de informes
Una herramienta como iWeaver puede ayudar a los usuarios a recopilar y organizar PDFs, páginas web, videos y otros materiales antes de pedirle a un modelo avanzado que compare fuentes o genere un análisis estructurado.
La clave es preservar la trazabilidad. Las afirmaciones importantes deben permanecer conectadas a sus fuentes originales.
Equipos de automatización empresarial
Las empresas pueden evaluar Qwen3.8-Max para:
- Asistentes internos de conocimiento
- Flujos de trabajo de atención al cliente
- Procesamiento de documentos
- Automatización de oficina
- Operaciones de software
- Agentes de negocio que usan herramientas
La evaluación en producción debe cubrir seguridad, controles de acceso, retención de datos, auditabilidad, estabilidad de API, concurrencia, recuperación ante fallos y el costo total de las tareas.
¿Deberías cambiarte a Qwen3.8-Max?
Qwen3.8-Max vale la pena probarlo si tu flujo de trabajo implica codificación compleja, documentos largos, análisis multimodal o herramientas que requieren múltiples rondas de planificación y ejecución.
Sin embargo, pasar directamente de un gráfico de benchmarks a un despliegue en producción sería prematuro.
Un enfoque más fiable es crear un benchmark con 20 a 50 tareas de tu flujo de trabajo real. Compara Qwen3.8-Max con Qwen3.7-Max y al menos otro modelo insignia usando los mismos prompts, archivos fuente, herramientas y criterios de evaluación.
Haz seguimiento:
- Tasa de finalización de tareas
- Tasa de éxito en el primer intento
- Tiempo de respuesta
- Fallos en el uso de herramientas
- Tiempo de corrección humana
- Consumo de entrada y salida
- Consistencia en ejecuciones repetidas
- Calidad del entregable final
El mejor modelo no es necesariamente el que tiene más parámetros o la puntuación promedio más alta en benchmarks. Es el modelo que completa tus tareas específicas de forma fiable a un costo aceptable.
Idea final
Qwen3.8-Max combina una escala reportada de 2,4 billones de parámetros con codificación autónoma, planificación de largo horizonte, razonamiento multimodal, una ventana de contexto de un millón de tokens y precios competitivos de API.
Los benchmarks oficiales sugieren avances significativos sobre Qwen3.7-Max en agentes de codificación, flujos de trabajo profesionales, razonamiento general, comprensión de documentos y tareas visuales. Qwen también ha anunciado lanzamientos de pesos open tanto para Qwen3.8-Max como para Qwen3.8-27B.
La pregunta que queda no es si el modelo se ve impresionante en un anuncio. Es si las evaluaciones independientes y los usuarios reales en producción pueden reproducir su rendimiento reportado.
Por ahora, Qwen3.8-Max es uno de los modelos más importantes que seguir—y un fuerte candidato para pruebas controladas en codificación, investigación y flujos de trabajo basados en agentes.
Preguntas frecuentes
¿Qué es Qwen3.8-Max?
Qwen3.8-Max es el modelo insignia de IA de Alibaba para razonamiento avanzado, codificación autónoma, análisis multimodal y flujos de trabajo de agentes de larga duración. Tiene aproximadamente 2,4 billones de parámetros en total.
¿Cuál es el precio de la API de Qwen3.8-Max?
El precio oficial es de $2 por millón de tokens de entrada, $6 por millón de tokens de salida, y $0.25 por millón de tokens para caché implícita.
¿Qwen3.8-Max admite imágenes y videos?
Sí. Qwen3.8-Max admite entradas de texto, imagen y video. Qwen posiciona la visión como parte de un bucle continuo de planificación y auto-corrección para agentes de IA.
¿Qué tan grande es la ventana de contexto de Qwen3.8-Max?
La información de integración de Qwen Code publicada ha indicado una ventana de contexto de aproximadamente un millón de tokens. Los límites reales deben verificarse para la plataforma o endpoint de API específico que se esté usando.
¿Qwen3.8-Max es open source?
Qwen anunció que los pesos open de Qwen3.8-Max se lanzarían después del anuncio del 3 de agosto. Los desarrolladores deben verificar disponibilidad del repositorio final, la licencia y los checkpoints antes de planificar el despliegue local.
¿Qué es Qwen3.8-27B?
Qwen3.8-27B es un modelo más pequeño anunciado junto con Qwen3.8-Max. Qwen ha declarado que también se lanzará con pesos open, lo que potencialmente lo hace más práctico para despliegues locales o privados.

