A equipa da Alibaba Qwen lançou Qwen3.8-Flash-Next com pesos abertos.
Este lançamento vale a pena ser acompanhado não só pela velocidade ou pelo preço.
A Qwen diz que o Qwen3.8-Flash-Next é também uma pré-visualização inicial da arquitetura planeada para o Qwen4. Introduz mudanças na atenção, nas conexões residuais, nos embeddings e na otimização do modelo, com um objetivo claro: fazer mais trabalho com menos computação.
Para a maioria dos utilizadores, não há necessidade de compreender todos os detalhes técnicos.
As mudanças importantes são mais fáceis de explicar:
- Cerca de 6B parâmetros são ativados por token
- O contexto pode escalar para cerca de 1 milhão de tokens
- Benchmarks de código e de agentes são mais fortes
- As capacidades multimodais e de uso de computador melhoraram
- O QSA reduz o custo do processamento de longo contexto
- O preço da API foi desenhado para workloads de alto volume
O Qwen3.8 Flash não é apenas mais um modelo mais rápido.
Parece cada vez mais concebido para tarefas longas, agentes de IA e fluxos de trabalho que precisam de processar muita informação.
O que é o Qwen3.8 Flash?
O Qwen3.8-Flash-Next é um modelo multimodal de Mixture-of-Experts (MoE).
O modelo principal tem 125B parâmetros, além de mais 51B parâmetros para embeddings de N-gram.
Mas não ativa todo o modelo para cada token.
Apenas cerca de 6B parâmetros são ativados por token.
A ideia base é simples:
O modelo é grande, mas usa apenas as partes de que precisa em cada etapa.
Esse é um dos principais benefícios de uma arquitetura MoE.
A Qwen diz que o Qwen3.8-Flash-Next tem um custo de treino de apenas cerca de um nono do custo de treino do Qwen3.7-Plus, enquanto entrega resultados mais fortes em programação e tarefas de escritório.
Para os utilizadores, isto aponta para uma mudança maior no desenvolvimento de IA.
Os modelos nem sempre precisam de ficar mais caros para se tornarem mais capazes.
Uma utilização mais inteligente da computação pode importar tanto quanto o tamanho do modelo.

O Qwen3.8-Flash-Next suporta 262.144 tokens nativamente e pode ser estendido para cerca de 1 milhão de tokens com YaRN.
Isso torna-o útil para tarefas como:
- PDFs e relatórios longos
- grandes bases de código
- pesquisa em muitas fontes
- agentes de IA de longa duração
- conversas estendidas
- análise entre documentos
No entanto, o longo contexto normalmente vem com um custo.
Quanto mais informação um modelo precisa de processar, mais cara a atenção pode ficar.
A Qwen aborda isso com Qwen Sparse Attention (QSA).
Em vez de dar a mesma quantidade de atenção a tudo no contexto, o QSA identifica primeiro as regiões mais relevantes e direciona mais computação para lá.
Uma forma simples de pensar nisso:
Em vez de reler todas as páginas de um livro de 500 páginas, o modelo encontra primeiro os capítulos mais prováveis de conter a resposta.

Em um contexto de 1M tokens, o kernel de Atenção do QSA entregou:
- até 7,6× mais rápido no Prefill
- até 4,9× mais rápido no Decode
Num teste de serving com taxa de acerto de Prefix Cache de 90%, o Qwen3.8-Flash-Next atingiu 8,6× a taxa de Prefill do Qwen3.7-Plus em 1M tokens.
Assim, a janela de contexto de 1M não é apenas sobre suportar um número maior.
A Qwen também está a tentar tornar a IA de longo contexto muito mais eficiente.
Como é o desempenho do Qwen3.8 Flash?
A Qwen publicou um conjunto amplo de resultados de benchmarks cobrindo programação, agentes, raciocínio e tarefas profissionais.
Alguns dos resultados mais notáveis incluem:
| Benchmark | Qwen3.8-Flash-Next |
|---|---|
| DeepSWE 1.1 | 58,7 |
| SWE-bench Pro | 62,5 |
| SWE-bench Multilingual | 81,0 |
| CoWorkBench | 73,9 |
| JobBench | 55,7 |
| Toolathlon Verified | 73,5 |
| GPQA Diamond | 91,7 |
| LiveCodeBench v6 | 91,9 |
Um ponto importante se destaca:
O Qwen3.8 Flash não foca apenas em programação.
Ele também se sai muito bem em trabalho de escritório, tarefas de agentes, uso de ferramentas e fluxos de trabalho profissionais.
Por exemplo, no CoWorkBench, que mede tarefas de escritório e produtividade de longo horizonte, a Qwen reporta:
| Modelo | CoWorkBench |
|---|---|
| Qwen3.8-Flash-Next | 73,9 |
| Qwen3.8-27B | 70,7 |
| Claude Opus 4.6 Max | 68,2 |
| Qwen3.7-Plus | 65,1 |
| DeepSeek-V4-Flash-0731 | 45,1 |
Estes resultados vêm da tabela de benchmarks publicada pela Qwen. São úteis para comparar desempenho em testes específicos, em vez de fazer uma afirmação ampla de que um modelo é melhor em tudo.
O desempenho multimodal também está a melhorar
O Qwen3.8 Flash também é um modelo multimodal.
Os resultados oficiais incluem:
| Benchmark | Qwen3.8-Flash-Next |
|---|---|
| ClawEval-MM Pass@3 | 64,4 |
| RecreationBench | 49,9 |
| AndroidWorld | 84,5 |
| OSWorld 2.0 Partial | 52,3 |
| Vision2Web | 64,0 |
| ERQA | 72,3 |
A pontuação de 84,5 no AndroidWorld é especialmente interessante.
O AndroidWorld mede o quão bem um modelo consegue interagir com ambientes Android e concluir tarefas.
Isto mostra para onde a Qwen está a caminhar.
Os modelos de IA estão a avançar além de:
responder a uma pergunta
ao:
entender uma tarefa, usar ferramentas e concluir o trabalho.
Isso está a tornar-se uma parte importante da corrida pelos agentes de IA.
O que os utilizadores do Reddit e do X estão a observar?
Os benchmarks oficiais contam um lado da história.
As discussões no Reddit e no X tendem a focar mais no uso do dia a dia.
Nos últimos dias, vários temas têm surgido repetidamente:
Um modelo de 125B consegue mesmo correr localmente?
O que significa, na prática, dizer que existem 6B ativos?
A tabela de embeddings de N-gram pode ser descarregada para a RAM do sistema?
Quão rápido é com um contexto longo?
Na comunidade LocalLLaMA do Reddit, grande parte da conversa inicial centrou-se em quantização, requisitos de memória e se os embeddings de N-gram tornam esta arquitetura mais fácil de correr em hardware local.
Também começam a aparecer testes iniciais no X.
Um teste com RTX 4090 usando 110GB de RAM do sistema reportou cerca de 21 tokens por segundo de velocidade no decode com uma janela de contexto de aproximadamente 250K tokens.
Os resultados naturalmente variam dependendo da quantização, GPU, RAM, configuração de offloading e software de inferência.
Mas a mudança interessante já está clara.
Um modelo de 100B+ já não significa automaticamente:
apenas data center.
Os utilizadores de IA local já estão a testar estes modelos em hardware consumer topo de gama.
O Qwen3.8 Flash é mais do que um modelo de programação
É fácil olhar para o SWE-bench e descrever o Qwen3.8 Flash como mais um modelo de programação.
Os resultados oficiais sugerem algo mais abrangente.
A Qwen também está a investir fortemente em:
- tarefas longas de escritório
- uso de ferramentas
- compreensão multimodal
- uso de computador
- agentes mobile
- análise de longo contexto
Isto corresponde a uma mudança maior na forma como as pessoas usam IA.
O pedido antigo era frequentemente:
"Responda a esta pergunta."
O pedido mais recente está a tornar-se:
"Conclua esta tarefa."
O segundo é muito mais difícil.
Um agente de IA pode precisar de ler ficheiros, entender uma página web, inspecionar uma imagem, usar uma ferramenta e, depois, continuar com base no resultado.
É por isso que a eficiência e o longo contexto importam tanto.
Para documentos e pesquisa: experimente o iWeaver
Benchmarks são úteis, mas a maioria dos utilizadores não escolhe ferramentas de IA apenas para comparar pontuações.
A pergunta maior é:
Como é que estas capacidades do modelo se encaixam num fluxo de trabalho real?
Se trabalha regularmente com:
- PDFs
- documentos Word
- páginas web
- imagens
- áudio
- vídeo
- material de pesquisa
- vários ficheiros
tente iWeaver.
iWeaver foi construído para trabalho de conhecimento e conteúdo complexo.
Ele reúne diferentes tipos de informação num único espaço de trabalho de IA, onde pode percorrer um fluxo de trabalho como:
Resumir → Entender → Analisar → Organizar → Criar
Pode carregar um relatório longo e extrair os pontos-chave.
Depois, adicione várias páginas web e compare o que diferentes fontes estão a dizer.
Ou combine áudio de reuniões, PDFs e imagens e transforme tudo em notas estruturadas.
Estes são exatamente os tipos de fluxos de trabalho em que o longo contexto e a IA multimodal se tornam úteis.
Porque os utilizadores não precisam mesmo de “1 milhão de tokens”.
Eles precisam de:
uma forma mais rápida de transformar informação complexa em algo útil.
Para criação aberta: experimente o XPT
Nem todo fluxo de trabalho de IA começa com um documento existente.
Às vezes começa com uma ideia.
Por exemplo:
- brainstorming
- escrita de histórias
- roleplay
- criação de personagens
- geração de imagens
- worldbuilding
- conversas abertas
Para este tipo de tarefas, pode experimentar XPT para saber mais sobre criação de IA aberta e conversas contínuas.
O fluxo de trabalho está mais perto de:
Ideia → Chat → História → Personagem → Imagem → Continuar a explorar
Se o iWeaver é principalmente sobre:
entender e organizar informação existente
o XPT é mais sobre:
levar uma nova ideia ainda mais longe
À medida que Qwen, Claude, GPT, Gemini, DeepSeek e outras famílias de modelos continuam a melhorar, as diferenças entre os modelos subjacentes vão continuar a mudar.
Para utilizadores do dia a dia, outra pergunta está a tornar-se tão importante quanto:
O produto de IA consegue mesmo ajudar-me a concluir a tarefa?
Por que o Qwen3.8 Flash importa
A parte mais interessante do Qwen3.8 Flash não é apenas uma pontuação de benchmark.
É a direção por trás de todo o lançamento.
Mais contexto.
Agentes mais fortes.
Melhores capacidades multimodais.
Menores custos de computação.
E uma arquitetura mais eficiente.
Os resultados publicados pela Qwen já mostram ganhos claros em programação, trabalho de escritório, uso de ferramentas, tarefas multimodais e eficiência de longo contexto.
E o Qwen3.8-Flash-Next é também uma pré-visualização inicial da arquitetura planeada para o Qwen4.
Isso torna este lançamento mais do que uma atualização normal da série Flash.
Dá-nos uma visão clara do próximo passo da Qwen:
não apenas IA maior, mas IA mais capaz que usa a computação de forma mais eficiente.
