阿里 Qwen 团队正式发布了 Qwen3.8-Flash-Next,并开放模型权重。
这次更新很值得关注。
原因不只是它更快、更便宜。
Qwen 官方明确表示,Qwen3.8-Flash-Next 也是 Qwen4 新架构的一次提前预览。它在 Attention、Residual、Embedding 和模型优化几个方向上都做了调整,目标很直接:用更少的计算成本完成更复杂的任务。
对普通用户来说,不需要理解每一个技术名词。
真正值得关注的是几个变化:
- 每个 Token 只激活约 6B 参数
- 支持最高约 100 万 Token 上下文
- 编程和 Agent Benchmark 表现明显提升
- 多模态和 Computer Use 能力更强
- QSA 大幅降低长上下文计算成本
- API 定价进一步下降
这些变化,也让 Qwen3.8 Flash 不只是一个“更快的模型”。
它更像是在为下一代 AI Agent 和长任务做准备。
Qwen3.8 Flash 是什么?
Qwen3.8-Flash-Next 是一个 多模态 MoE(Mixture-of-Experts,混合专家)模型。
它的主模型拥有 125B 参数,另外加入了 51B N-gram Embedding 参数。
不过,模型生成每个 Token 时,并不会调用全部参数。
实际激活参数大约只有 6B。
简单来说:
模型整体很大,但每次只使用当前任务真正需要的一部分。
这也是 MoE 架构的核心优势之一。
Qwen 官方表示,与 Qwen3.7-Plus 相比,Qwen3.8-Flash-Next 的训练成本只有大约 1/9,但在编程和办公任务上的表现反而更强。
对于用户来说,这意味着一件很实际的事:
AI 不一定要继续无限变大,才能继续变强。
更聪明地使用计算资源,同样可以提升模型能力。

Qwen3.8-Flash-Next 原生支持 262,144 Tokens,通过 YaRN 可以扩展到约 1,000,000 Tokens。
这类超长上下文特别适合:
- 长篇 PDF 和报告
- 大型代码库
- 多份研究资料
- 长时间 Agent 任务
- 多轮复杂对话
- 跨文件信息分析
但更大的 Context 也会带来一个问题:
内容越长,Attention 的计算成本通常越高。
Qwen 这次引入了 Qwen Sparse Attention(QSA)。
它不会让模型平均处理所有上下文,而是先找到更重要的信息区域,再重点计算。
可以简单理解成:
不是从头到尾反复阅读一本 500 页的书,而是先快速定位最相关的章节,再仔细阅读。

在 1M Token 上下文下,QSA 的 Attention Kernel:
- Prefill 最高加速 7.6×
- Decode 最高加速 4.9×
在一个 Prefix Cache 命中率为 90% 的测试环境中,Qwen3.8-Flash-Next 在 1M Context 下的 Prefill Throughput 达到 Qwen3.7-Plus 的 8.6×。
所以这次的 1M Context 并不只是把数字做大。
Qwen 同时在解决:
怎么让超长上下文跑得更快。
Benchmark 表现怎么样?
Qwen 官方已经公布了一批比较完整的测试结果。
其中几个比较值得关注:
| Benchmark | Qwen3.8-Flash-Next |
|---|---|
| DeepSWE 1.1 | 58.7 |
| SWE-bench Pro | 62.5 |
| SWE-bench Multilingual | 81.0 |
| CoWorkBench | 73.9 |
| JobBench | 55.7 |
| Toolathlon Verified | 73.5 |
| GPQA Diamond | 91.7 |
| LiveCodeBench v6 | 91.9 |
这里比较明显的一个变化是:
Qwen3.8 Flash 不只在做 Coding。
它在 Office Work、Agent、Tool Use 和 Professional Tasks 上也投入了很多。
例如在 CoWorkBench 上,Qwen3.8-Flash-Next 得到 73.9:
| 模型 | CoWorkBench |
|---|---|
| Qwen3.8-Flash-Next | 73.9 |
| Qwen3.8-27B | 70.7 |
| Claude Opus 4.6 Max | 68.2 |
| Qwen3.7-Plus | 65.1 |
| DeepSeek-V4-Flash-0731 | 45.1 |
这些结果来自 Qwen 官方公布的 Benchmark 表,因此更适合用来判断不同模型在特定任务上的表现,而不是简单得出“某个模型全面超过另一个模型”的结论。
多模态能力也在提升
Qwen3.8 Flash 不是纯文本模型。
它同时支持多模态任务。
官方测试中:
| Benchmark | Qwen3.8-Flash-Next |
|---|---|
| ClawEval-MM Pass@3 | 64.4 |
| RecreationBench | 49.9 |
| AndroidWorld | 84.5 |
| OSWorld 2.0 Partial | 52.3 |
| Vision2Web | 64.0 |
| ERQA | 72.3 |
其中 AndroidWorld 84.5 比较值得注意。
它测试的是模型操作 Android 环境完成任务的能力。
这说明 Qwen 的方向已经越来越清楚:
模型不只是负责“回答问题”。
它需要能够:
看懂内容 → 理解任务 → 调用工具 → 完成操作。
这也是现在 AI Agent 竞争的核心方向之一。
Reddit 和 X 用户更关心实际体验
相比官方 Benchmark,Reddit 和 X 上的讨论更直接。
最近几天,用户主要集中在几个问题:
这么大的模型能不能在本地跑?
6B Active 到底意味着什么?
N-gram Embedding 会不会让大模型更适合本地部署?
长上下文的实际速度怎么样?
Reddit 的 LocalLLaMA 社区中,很多讨论都集中在模型量化、内存占用以及 N-gram Embedding 能否 Offload 到系统内存。
X 上也已经出现消费级硬件测试。
一组使用 RTX 4090、110GB 系统内存的测试,在约 250K Context 下报告了约 21 Tokens/s Decode,说明这类 100B+ MoE 模型已经开始进入个人硬件用户的测试范围。
当然,不同 Quant、RAM、GPU 和 Offload 设置会产生明显差异。
但社区关注点已经发生变化:
过去大家看到 100B+ 模型,第一反应往往是“服务器才能跑”。
现在越来越多人开始问:
我的电脑能不能跑?
Qwen3.8 Flash 不只是 Coding Model
如果只看 SWE-bench,很容易把 Qwen3.8 Flash 理解成一个 Coding Model。
但从官方 Benchmark 来看,它明显在朝更完整的 Agent 方向发展。
Coding 只是其中一部分。
它还在强化:
- 长时间办公任务
- 工具调用
- 多模态理解
- Computer Use
- Mobile Agent
- 长上下文分析
这也符合现在 AI 产品的发展方向。
用户需要的已经不只是:
“帮我回答这个问题。”
而越来越接近:
“帮我把这件事做完。”
这两个需求对模型的要求完全不同。
第二种任务可能需要 AI 连续读取文件、分析网页、理解图片、调用工具,再根据前面的结果继续下一步。
这也是为什么低成本和长上下文越来越重要。
如果你经常处理文档,可以试试 iWeaver
对于普通用户来说,模型 Benchmark 并不是最终目的。
真正重要的是:
怎么把这些模型能力变成一个完整的工作流。
如果你平时需要处理:
- Word
- 网页
- 图片
- 音频
- 视频
- 研究资料
- 多份文件
可以试试 iWeaver。
iWeaver 更偏向知识工作和复杂内容处理。
你可以把不同格式的内容放进同一个 AI Workspace,然后继续:
Summarize → Understand → Analyze → Organize → Create
例如:
上传一份几十页的报告,让 AI 找出重点。
加入几个网页,对比不同来源的信息。
再把会议录音、PDF 和图片放在一起,整理成结构化笔记。
这类任务也是长上下文和多模态模型最适合发挥价值的地方。
因为用户最终需要的不是“100 万 Token”。
而是:
更快把复杂信息变成可以直接使用的结果。
想自由创作,可以试试 XPT
另一类 AI 使用场景并不是分析已有资料,而是从一个想法开始。
例如:
- Brainstorming
- Story Writing
- Roleplay
- Character Creation
- Image Generation
- Worldbuilding
- Open-ended Chat
这类任务可以试试 XPT。
XPT 更偏向开放式 AI 创作和持续对话。
它的工作方式更接近:
Idea → Chat → Story → Character → Image → Keep Exploring
如果说 iWeaver 更适合:
理解和整理已有信息
那么 XPT 更适合:
把一个想法继续发展下去
随着 Qwen、Claude、GPT、Gemini、DeepSeek 等模型不断更新,底层模型之间的差距会继续变化。
但对普通用户来说,一个越来越重要的问题是:
这个 AI 产品能不能真正帮我完成任务?
为什么 Qwen3.8 Flash 值得关注?
Qwen3.8 Flash 最值得关注的并不是某一项 Benchmark。
而是它展示出的整体方向。
更大的 Context。
更强的 Agent。
更好的多模态能力。
更低的计算成本。
以及更高效的模型架构。
官方数据已经证明,Qwen3.8-Flash-Next 在 Coding、Office Work、Tool Use、多模态和长上下文效率方面都有明显提升。
同时,它还是 Qwen4 架构的一次提前预览。
所以,Qwen3.8 Flash 并不只是 Flash 系列的一次常规升级。
它更像是在告诉我们:
下一代 Qwen,重点不只是做得更大,而是让强大的 AI 运行得更高效。
