El equipo de Alibaba de Qwen ha lanzado Qwen3.8-Flash-Next con pesos abiertos.
Este lanzamiento merece la pena por algo más que por la velocidad o el precio.
Qwen dice que Qwen3.8-Flash-Next es también una vista previa temprana de la arquitectura planificada para Qwen4. Introduce cambios en la atención, las conexiones residuales, los embeddings y la optimización del modelo, con un objetivo claro: hacer más trabajo con menos cómputo.
Para la mayoría de los usuarios, no es necesario entender cada detalle técnico.
Los cambios importantes se explican con más facilidad:
- Se activan alrededor de 6B parámetros por token
- El contexto puede escalar hasta ~1 millón de tokens
- Los benchmarks de programación y agentes son más sólidos
- Las capacidades multimodales y de uso de ordenador han mejorado
- QSA reduce el coste del procesamiento de contextos largos
- La fijación de precios de la API está diseñada para cargas de alto volumen
Qwen3.8 Flash no es simplemente otro modelo más rápido.
Parece estar cada vez más diseñado para tareas largas, agentes de IA y flujos de trabajo que necesitan procesar mucha información.
¿Qué es Qwen3.8 Flash?
Qwen3.8-Flash-Next es un modelo multimodal de Mixture-of-Experts (MoE).
El modelo principal tiene 125B parámetros, además de otros 51B parámetros para embeddings de N-gram.
Pero no activa todo el modelo para cada token.
Solo se activan alrededor de 6B parámetros por token.
La idea básica es sencilla:
El modelo es grande, pero solo usa las partes que necesita en cada paso.
Esa es una de las principales ventajas de una arquitectura MoE.
Qwen afirma que Qwen3.8-Flash-Next requiere solo alrededor de un noveno del coste de entrenamiento de Qwen3.7-Plus, y aun así ofrece resultados más sólidos en programación y tareas de oficina.
Para los usuarios, esto apunta a un cambio más grande en el desarrollo de IA.
Los modelos no siempre necesitan volverse más caros para ser más capaces.
Un uso más inteligente del cómputo puede importar tanto como el tamaño del modelo.

Qwen3.8-Flash-Next admite 262,144 tokens de forma nativa y puede ampliarse hasta alrededor de 1 millón de tokens con YaRN.
Eso lo hace útil para tareas como:
- PDFs y reportes largos
- bases de código grandes
- investigación a través de muchas fuentes
- agentes de IA de larga duración
- conversaciones extendidas
- análisis entre documentos
El contexto largo, sin embargo, normalmente conlleva un coste.
Cuanta más información necesita procesar un modelo, más caro puede volverse la atención.
Qwen lo aborda con Qwen Sparse Attention (QSA).
En lugar de dar la misma cantidad de atención a todo el contexto, QSA primero identifica las regiones más relevantes y centra allí más cómputo.
Una forma simple de pensarlo:
En vez de releer cada página de un libro de 500 páginas, el modelo primero encuentra los capítulos que probablemente contengan la respuesta.

Con una longitud de contexto de 1M tokens, el kernel de atención QSA entregó:
- hasta 7.6× más rápido en Prefill
- hasta 4.9× más rápido en Decode
En una prueba de servicio con una tasa de aciertos del 90% en Prefix Cache, Qwen3.8-Flash-Next alcanzó 8.6× el throughput de Prefill de Qwen3.7-Plus a 1M tokens.
Así que la ventana de contexto de 1M no solo se trata de admitir un número mayor.
Qwen también intenta hacer que la IA de contexto largo sea mucho más eficiente.
¿Cómo rinde Qwen3.8 Flash?
Qwen ha publicado un conjunto amplio de resultados de benchmarks que cubren programación, agentes, razonamiento y tareas profesionales.
Algunos de los resultados más destacables incluyen:
| Benchmark | Qwen3.8-Flash-Next |
|---|---|
| DeepSWE 1.1 | 58.7 |
| SWE-bench Pro | 62.5 |
| SWE-bench Multilingual | 81.0 |
| CoWorkBench | 73.9 |
| JobBench | 55.7 |
| Toolathlon Verified | 73.5 |
| GPQA Diamond | 91.7 |
| LiveCodeBench v6 | 91.9 |
Un punto importante destaca:
Qwen3.8 Flash no solo se centra en la programación.
También rinde con fuerza en trabajo de oficina, tareas de agentes, uso de herramientas y flujos de trabajo profesionales.
Por ejemplo, en CoWorkBench, que mide tareas de oficina y productividad de horizonte largo, Qwen informa:
| Model | CoWorkBench |
|---|---|
| Qwen3.8-Flash-Next | 73.9 |
| Qwen3.8-27B | 70.7 |
| Claude Opus 4.6 Max | 68.2 |
| Qwen3.7-Plus | 65.1 |
| DeepSeek-V4-Flash-0731 | 45.1 |
Estos resultados provienen de la tabla de benchmarks publicada por Qwen. Son útiles para comparar el rendimiento en pruebas específicas, más que para hacer una afirmación amplia de que un modelo es mejor en todo.
También mejora el rendimiento multimodal
Qwen3.8 Flash también es un modelo multimodal.
Sus resultados oficiales incluyen:
| Benchmark | Qwen3.8-Flash-Next |
|---|---|
| ClawEval-MM Pass@3 | 64.4 |
| RecreationBench | 49.9 |
| AndroidWorld | 84.5 |
| OSWorld 2.0 Partial | 52.3 |
| Vision2Web | 64.0 |
| ERQA | 72.3 |
La puntuación de 84.5 en AndroidWorld es especialmente interesante.
AndroidWorld mide qué tan bien un modelo puede interactuar con entornos de Android y completar tareas.
Esto muestra hacia dónde se dirige Qwen.
Los modelos de IA van más allá de:
responder a una pregunta
a:
comprender una tarea, usar herramientas y completar el trabajo.
Eso se está convirtiendo en una parte importante de la carrera por los agentes de IA.
¿Qué están observando los usuarios de Reddit y X?
Los benchmarks oficiales cuentan una parte de la historia.
Las discusiones en Reddit y X tienden a centrarse más en el uso cotidiano.
En los últimos días, varios temas han surgido una y otra vez:
¿Un modelo de 125B puede ejecutarse realmente de forma local?
¿Qué significa realmente que esté activo el 6B?
¿La tabla de embeddings de N-gram se puede descargar a la RAM del sistema?
¿Qué tan rápido es con un contexto largo?
En la comunidad LocalLLaMA de Reddit, gran parte de las primeras conversaciones se ha centrado en la cuantización, los requisitos de memoria y si los embeddings de N-gram hacen que esta arquitectura sea más fácil de ejecutar en hardware local.
También están apareciendo pruebas tempranas en X.
Una prueba con RTX 4090 usando 110GB de RAM del sistema informó alrededor de 21 tokens por segundo de velocidad de decode con una ventana de contexto de aproximadamente 250K tokens.
Los resultados variarán naturalmente según la cuantización, la GPU, la RAM, la configuración de offloading y el software de inferencia.
Pero el cambio interesante ya está claro.
Un modelo de 100B+ ya no significa automáticamente:
solo centro de datos.
Los usuarios de IA local ya están probando estos modelos en hardware de consumo de gama alta.
Qwen3.8 Flash es más que un modelo de programación
Es fácil mirar SWE-bench y describir Qwen3.8 Flash como otro modelo de programación.
Los resultados oficiales sugieren algo más amplio.
Qwen también está invirtiendo fuertemente en:
- tareas de oficina de larga duración
- uso de herramientas
- comprensión multimodal
- uso de ordenador
- agentes móviles
- análisis de contexto largo
Esto encaja con un cambio más grande en la forma en que la gente usa la IA.
La solicitud anterior a menudo era:
"Responde esta pregunta."
La solicitud más nueva se está volviendo:
"Termina esta tarea."
La segunda es mucho más difícil.
Un agente de IA puede necesitar leer archivos, entender una página web, inspeccionar una imagen, usar una herramienta y luego continuar en función del resultado.
Por eso la eficiencia y el contexto largo importan tanto.
Para documentos e investigación: prueba iWeaver
Los benchmarks son útiles, pero la mayoría de los usuarios no eligen herramientas de IA solo para comparar puntuaciones.
La pregunta más grande es:
¿Cómo se integran estas capacidades del modelo en un flujo de trabajo real?
Si trabajas con frecuencia con:
- PDFs
- documentos de Word
- páginas web
- imágenes
- audio
- video
- material de investigación
- varios archivos
también puedes probar iWeaver.
iWeaver está diseñado para el trabajo del conocimiento y contenidos complejos.
Reúne distintos tipos de información en un solo espacio de trabajo de IA, donde puedes avanzar por un flujo como:
Resumir → Comprender → Analizar → Organizar → Crear
Podrías subir un informe largo y extraer los puntos clave.
Luego añade varias páginas web y compara lo que dicen distintas fuentes.
O combina el audio de una reunión, PDFs e imágenes y conviértelo en notas estructuradas.
Estas son exactamente las clases de flujos de trabajo donde el contexto largo y la IA multimodal se vuelven útiles.
Porque a los usuarios realmente no les hace falta “1 millón de tokens”.
Lo que necesitan es:
una forma más rápida de convertir información compleja en algo útil.
Para la creación abierta: prueba XPT
No todos los flujos de trabajo de IA comienzan con un documento existente.
A veces empiezan con una idea.
Por ejemplo:
- lluvia de ideas
- escritura de historias
- roleplay
- creación de personajes
- generación de imágenes
- worldbuilding
- conversaciones abiertas
Para este tipo de tareas, puedes probar XPT para más sobre creación de IA abierta y conversaciones en curso.
El flujo de trabajo se parece más a:
Idea → Chat → Historia → Personaje → Imagen → Seguir explorando
Si iWeaver se centra principalmente en:
comprender y organizar información existente
XPT se centra más en:
llevar una idea nueva más lejos
A medida que Qwen, Claude, GPT, Gemini, DeepSeek y otras familias de modelos continúan mejorando, las diferencias entre los modelos subyacentes seguirán cambiando.
Para los usuarios cotidianos, otra pregunta se vuelve igual de importante:
¿El producto de IA realmente puede ayudarme a terminar la tarea?
Por qué importa Qwen3.8 Flash
La parte más interesante de Qwen3.8 Flash no es una puntuación de un solo benchmark.
Es la dirección que está detrás de todo el lanzamiento.
Más contexto largo.
Agentes más sólidos.
Mejores capacidades multimodales.
Menores costes de cómputo.
Y una arquitectura más eficiente.
Los resultados publicados por Qwen ya muestran mejoras claras en programación, trabajo de oficina, uso de herramientas, tareas multimodales y eficiencia de contexto largo.
Y Qwen3.8-Flash-Next también es una vista previa temprana de la arquitectura planificada para Qwen4.
Eso hace que esto sea más que una actualización normal de la serie Flash.
Nos ofrece una visión clara de hacia dónde va Qwen a continuación:
no solo una IA más grande, sino una IA más capaz que usa el cómputo de forma más eficiente.
