Qwen3.8 Flash 发布:更快,也更省

qwen3-8-flash-next

阿里 Qwen 团队正式发布了 Qwen3.8-Flash-Next,并开放模型权重。

这次更新很值得关注。

原因不只是它更快、更便宜。

Qwen 官方明确表示,Qwen3.8-Flash-Next 也是 Qwen4 新架构的一次提前预览。它在 Attention、Residual、Embedding 和模型优化几个方向上都做了调整,目标很直接:用更少的计算成本完成更复杂的任务。

对普通用户来说,不需要理解每一个技术名词。

真正值得关注的是几个变化:

  • 每个 Token 只激活约 6B 参数
  • 支持最高约 100 万 Token 上下文
  • 编程和 Agent Benchmark 表现明显提升
  • 多模态和 Computer Use 能力更强
  • QSA 大幅降低长上下文计算成本
  • API 定价进一步下降

这些变化,也让 Qwen3.8 Flash 不只是一个“更快的模型”。

它更像是在为下一代 AI Agent 和长任务做准备。

Qwen3.8 Flash 是什么?

Qwen3.8-Flash-Next 是一个 多模态 MoE(Mixture-of-Experts,混合专家)模型

它的主模型拥有 125B 参数,另外加入了 51B N-gram Embedding 参数

不过,模型生成每个 Token 时,并不会调用全部参数。

实际激活参数大约只有 6B

简单来说:

模型整体很大,但每次只使用当前任务真正需要的一部分。

这也是 MoE 架构的核心优势之一。

Qwen 官方表示,与 Qwen3.7-Plus 相比,Qwen3.8-Flash-Next 的训练成本只有大约 1/9,但在编程和办公任务上的表现反而更强。

对于用户来说,这意味着一件很实际的事:

AI 不一定要继续无限变大,才能继续变强。

更聪明地使用计算资源,同样可以提升模型能力。

qwen-architecture
## 100 万 Token 上下文

Qwen3.8-Flash-Next 原生支持 262,144 Tokens,通过 YaRN 可以扩展到约 1,000,000 Tokens

这类超长上下文特别适合:

  • 长篇 PDF 和报告
  • 大型代码库
  • 多份研究资料
  • 长时间 Agent 任务
  • 多轮复杂对话
  • 跨文件信息分析

但更大的 Context 也会带来一个问题:

内容越长,Attention 的计算成本通常越高。

Qwen 这次引入了 Qwen Sparse Attention(QSA)

它不会让模型平均处理所有上下文,而是先找到更重要的信息区域,再重点计算。

可以简单理解成:

不是从头到尾反复阅读一本 500 页的书,而是先快速定位最相关的章节,再仔细阅读。

qwen-arch
官方也已经对这套方案进行了测试。

1M Token 上下文下,QSA 的 Attention Kernel:

  • Prefill 最高加速 7.6×
  • Decode 最高加速 4.9×

在一个 Prefix Cache 命中率为 90% 的测试环境中,Qwen3.8-Flash-Next 在 1M Context 下的 Prefill Throughput 达到 Qwen3.7-Plus 的 8.6×

所以这次的 1M Context 并不只是把数字做大。

Qwen 同时在解决:

怎么让超长上下文跑得更快。

Benchmark 表现怎么样?

Qwen 官方已经公布了一批比较完整的测试结果。

其中几个比较值得关注:

Benchmark Qwen3.8-Flash-Next
DeepSWE 1.1 58.7
SWE-bench Pro 62.5
SWE-bench Multilingual 81.0
CoWorkBench 73.9
JobBench 55.7
Toolathlon Verified 73.5
GPQA Diamond 91.7
LiveCodeBench v6 91.9

这里比较明显的一个变化是:

Qwen3.8 Flash 不只在做 Coding。

它在 Office Work、Agent、Tool Use 和 Professional Tasks 上也投入了很多。

例如在 CoWorkBench 上,Qwen3.8-Flash-Next 得到 73.9

模型 CoWorkBench
Qwen3.8-Flash-Next 73.9
Qwen3.8-27B 70.7
Claude Opus 4.6 Max 68.2
Qwen3.7-Plus 65.1
DeepSeek-V4-Flash-0731 45.1

这些结果来自 Qwen 官方公布的 Benchmark 表,因此更适合用来判断不同模型在特定任务上的表现,而不是简单得出“某个模型全面超过另一个模型”的结论。

多模态能力也在提升

Qwen3.8 Flash 不是纯文本模型。

它同时支持多模态任务。

官方测试中:

Benchmark Qwen3.8-Flash-Next
ClawEval-MM Pass@3 64.4
RecreationBench 49.9
AndroidWorld 84.5
OSWorld 2.0 Partial 52.3
Vision2Web 64.0
ERQA 72.3

其中 AndroidWorld 84.5 比较值得注意。

它测试的是模型操作 Android 环境完成任务的能力。

这说明 Qwen 的方向已经越来越清楚:

模型不只是负责“回答问题”。

它需要能够:

看懂内容 → 理解任务 → 调用工具 → 完成操作。

这也是现在 AI Agent 竞争的核心方向之一。

Reddit 和 X 用户更关心实际体验

相比官方 Benchmark,Reddit 和 X 上的讨论更直接。

最近几天,用户主要集中在几个问题:

这么大的模型能不能在本地跑?

6B Active 到底意味着什么?

N-gram Embedding 会不会让大模型更适合本地部署?

长上下文的实际速度怎么样?

Reddit 的 LocalLLaMA 社区中,很多讨论都集中在模型量化、内存占用以及 N-gram Embedding 能否 Offload 到系统内存。

X 上也已经出现消费级硬件测试。

一组使用 RTX 4090、110GB 系统内存的测试,在约 250K Context 下报告了约 21 Tokens/s Decode,说明这类 100B+ MoE 模型已经开始进入个人硬件用户的测试范围。

当然,不同 Quant、RAM、GPU 和 Offload 设置会产生明显差异。

但社区关注点已经发生变化:

过去大家看到 100B+ 模型,第一反应往往是“服务器才能跑”。

现在越来越多人开始问:

我的电脑能不能跑?

Qwen3.8 Flash 不只是 Coding Model

如果只看 SWE-bench,很容易把 Qwen3.8 Flash 理解成一个 Coding Model。

但从官方 Benchmark 来看,它明显在朝更完整的 Agent 方向发展。

Coding 只是其中一部分。

它还在强化:

  • 长时间办公任务
  • 工具调用
  • 多模态理解
  • Computer Use
  • Mobile Agent
  • 长上下文分析

这也符合现在 AI 产品的发展方向。

用户需要的已经不只是:

“帮我回答这个问题。”

而越来越接近:

“帮我把这件事做完。”

这两个需求对模型的要求完全不同。

第二种任务可能需要 AI 连续读取文件、分析网页、理解图片、调用工具,再根据前面的结果继续下一步。

这也是为什么低成本和长上下文越来越重要。

如果你经常处理文档,可以试试 iWeaver

对于普通用户来说,模型 Benchmark 并不是最终目的。

真正重要的是:

怎么把这些模型能力变成一个完整的工作流。

如果你平时需要处理:

  • PDF
  • Word
  • 网页
  • 图片
  • 音频
  • 视频
  • 研究资料
  • 多份文件

可以试试 iWeaver

iWeaver 更偏向知识工作和复杂内容处理。

你可以把不同格式的内容放进同一个 AI Workspace,然后继续:

Summarize → Understand → Analyze → Organize → Create

例如:

上传一份几十页的报告,让 AI 找出重点。

加入几个网页,对比不同来源的信息。

再把会议录音、PDF 和图片放在一起,整理成结构化笔记。

这类任务也是长上下文和多模态模型最适合发挥价值的地方。

因为用户最终需要的不是“100 万 Token”。

而是:

更快把复杂信息变成可以直接使用的结果。

想自由创作,可以试试 XPT

另一类 AI 使用场景并不是分析已有资料,而是从一个想法开始。

例如:

  • Brainstorming
  • Story Writing
  • Roleplay
  • Character Creation
  • Image Generation
  • Worldbuilding
  • Open-ended Chat

这类任务可以试试 XPT

XPT 更偏向开放式 AI 创作和持续对话。

它的工作方式更接近:

Idea → Chat → Story → Character → Image → Keep Exploring

如果说 iWeaver 更适合:

理解和整理已有信息

那么 XPT 更适合:

把一个想法继续发展下去

随着 Qwen、Claude、GPT、Gemini、DeepSeek 等模型不断更新,底层模型之间的差距会继续变化。

但对普通用户来说,一个越来越重要的问题是:

这个 AI 产品能不能真正帮我完成任务?

为什么 Qwen3.8 Flash 值得关注?

Qwen3.8 Flash 最值得关注的并不是某一项 Benchmark。

而是它展示出的整体方向。

更大的 Context。

更强的 Agent。

更好的多模态能力。

更低的计算成本。

以及更高效的模型架构。

官方数据已经证明,Qwen3.8-Flash-Next 在 Coding、Office Work、Tool Use、多模态和长上下文效率方面都有明显提升。

同时,它还是 Qwen4 架构的一次提前预览

所以,Qwen3.8 Flash 并不只是 Flash 系列的一次常规升级。

它更像是在告诉我们:

下一代 Qwen,重点不只是做得更大,而是让强大的 AI 运行得更高效。