Qwen3.8-Max:你需要了解的重点

qwen3-8-max-review

Qwen3.8-Max 是近期大模型领域关注度最高的新模型之一。

8月3日,阿里通义千问团队正式发布Qwen3.8-Max,并称其为“目前能力最强的Qwen模型”。该模型总参数规模约为 2.4万亿,重点面向自主编程、专业工作、长周期Agent任务和多模态理解。

相比此前的预览版本,这次官方公布了更多关键信息,包括API价格、语言与视觉能力测试、长时间运行的Agent案例,以及模型权重的开放计划。

Qwen3.8-Max的意义不只是模型变得更大。它反映出一个更明显的行业趋势:大模型正在从“回答问题”转向“完成工作”。模型不仅要给出答案,还要能够制定计划、调用工具、检查结果,并持续推进复杂任务。

Qwen3.8-Max是什么?

Qwen3.8-Max是阿里通义千问推出的新一代旗舰模型,主要面向复杂推理、软件开发、多模态分析、专业工作流和自主Agent任务。

该模型此前以预览版本开放体验,模型名称为:

qwen3.8-max-preview

预览版让部分开发者提前体验了模型,但当时仍有不少信息尚未明确,例如标准API价格、开源时间和完整的测试结果。

这些问题在8月3日发布的Qwen3.8-Max官方公告中有了更清楚的答案。

官方将Qwen3.8-Max定位为面向“编程与协作”的旗舰模型,并重点强调了四项能力:

  • 自主完成软件开发
  • 生成可直接用于实际工作的专业成果
  • 长周期规划与执行
  • 原生多模态Agent能力

换句话说,Qwen3.8-Max并不只是一个参数更大的聊天模型。它更像是一个面向复杂任务的智能中枢,可以处理代码、文档、视觉界面、外部工具和较长的任务记录。

Qwen3.8-Max有哪些核心能力?

约2.4万亿总参数

Qwen3.8-Max最受关注的参数是其约 2.4万亿的总参数规模

这是目前通义千问公开发布的最大模型之一。不过,总参数量并不等于模型每次回答问题时都会调用全部参数。

如果模型采用混合专家架构,每次推理通常只会激活其中一部分参数。模型在实际任务中的表现,还会受到以下因素影响:

  • 每次推理激活的参数数量
  • 训练数据的质量
  • 强化学习方法
  • 工具调用的准确性
  • 上下文管理能力
  • 推理基础设施
  • 响应速度
  • 多次执行同一任务时的稳定性

因此,2.4万亿参数说明Qwen3.8-Max的模型规模很大,但不能只凭这一项数据就认定它在所有任务中都领先。

自主编程能力

根据Qwen官方介绍,Qwen3.8-Max可以持续进行十天以上的自主软件开发。

官方展示的案例中,模型从一个空文件夹开始,在较少人工干预的情况下逐步完成了一个可用于生产环境的项目。相关开发过程已经通过官方公告中的GitHub链接公开。

这类任务远比生成一个函数或修复一处报错复杂。要连续完成一个软件项目,模型通常需要:

  1. 理解产品目标;
  2. 设计合适的技术架构;
  3. 创建并修改多个文件;
  4. 安装和配置依赖;
  5. 运行测试并分析错误;
  6. 检查应用的实际效果;
  7. 修复发现的问题;
  8. 在长时间执行过程中始终围绕原始目标推进。

需要注意的是,这仍然是官方展示的案例,并非独立第三方测试。不过,它能够说明Qwen3.8-Max希望解决的并不是单次代码生成,而是完整的软件开发流程。

长周期Agent任务

Qwen还公布了两个执行周期很长的Agent案例:

  • 完成500多轮芯片设计优化
  • 模拟执行365天的电商经营策略

这两个案例主要展示模型在闭环任务中的持续规划和调整能力。

在这类任务中,Agent不会只生成一份方案就结束。它需要反复查看结果、判断当前策略是否有效,再决定下一步如何调整。

一个能够长期运行的Agent,除了模型本身足够强,还需要配套的记忆管理、进度记录、工具权限、验证机制和错误恢复能力。

因此,长周期Agent的最终表现不只取决于底层模型,也与整个系统的设计有关。

原生多模态能力

Qwen3.8-Max支持文本、图片和视频输入。

Qwen官方对这项能力的描述并不是简单的“能够看图”,而是让视觉信息参与整个任务执行过程。

一个视觉Agent可能需要反复完成以下步骤:

  • 查看当前界面
  • 判断页面或应用所处的状态
  • 决定下一步操作
  • 调用工具执行操作
  • 检查操作结果
  • 发现错误
  • 调整并重新执行

这类能力适合用于浏览器自动化、软件测试、文档处理、界面检查,以及同时包含文字和视觉信息的复杂工作。

百万级上下文窗口

Qwen Code公开的模型配置信息显示,Qwen3.8-Max支持约100万tokens的上下文窗口。

这样的上下文长度可以用于处理:

  • 大型代码仓库
  • 多篇研究论文
  • 较长的商业资料
  • 长时间运行的Agent记录
  • 多个文件和数据来源
  • 较长的视频字幕或会议记录

不过,上下文越长并不代表结果一定越好。输入内容过多,可能增加响应时间,也可能让模型难以抓住真正重要的信息。

实际使用时,仍然建议先整理资料、删除无关内容、对已完成阶段进行摘要,并要求模型注明关键结论所依据的文件或原文。

Qwen3.8-Max语言与Agent性能测试

Qwen官方公布了一张性能对比图,将Qwen3.8-Max与Opus 4.8、Fable 5、GPT-5.6 Sol和Qwen3.7-Max进行了比较。

qwen-38-max-benchmark
图1:Qwen3.8-Max在语言、编程Agent、通用Agent和推理任务中的官方测试结果。图片来源:Qwen官方X帖子

Qwen3.8-Max在部分测试中的成绩如下:

测试项目 Qwen3.8-Max得分
Terminal Bench 2.1 89.8
FrontierSWE 73.5
PaperBench 83.0
AndroidBench 75.1
QwenSWEBench 80.7
QwenCoderBench 58.4
QwenReactBench 1,724
QwenSVGBench 1,713
CoWorkBench 74.8
WorkSpaceBench 67.7
JobBench 53.4
SkillsBench 70.2
GPQA Diamond 92.6
MMLU-Pro 92.9
LongBench v2 68.3

从官方数据来看,Qwen3.8-Max在多个项目上相比Qwen3.7-Max有明显提升。

例如,Terminal Bench 2.1的得分从Qwen3.7-Max的74.5提升至89.8;CoWorkBench从64.8提升至74.8;WorkSpaceBench则从61.4提升至67.7。

在通用推理任务中,Qwen3.8-Max的GPQA Diamond得分为92.6,MMLU-Pro得分为92.9。

不过,它并没有在表格中的每一项测试里都排名第一。部分软件工程和专业Agent测试仍由其他模型领先。

因此,更准确的说法是:Qwen3.8-Max已经进入当前旗舰模型的第一梯队,但不能简单概括为“所有能力都是第一”。

此外,这些数据来自Qwen官方。企业在决定是否使用之前,仍需结合自己的实际任务进行测试。

Qwen3.8-Max多模态性能测试

Qwen还发布了另一张测试图,涵盖多模态推理、视觉Agent、文档理解、空间理解、视觉定位和视频分析等任务。

qwen-38-max-benchmark
图2:Qwen3.8-Max在多模态和视觉语言任务中的官方测试结果。图片来源:Qwen官方X帖子

部分测试结果如下:

测试项目 Qwen3.8-Max得分
MMMU-Pro 82.3
MathVision 95.2 / 97.7
LogicVista 91.9
SLAKE 90.8
OSWorld-Verified 86.1
AndroidWorld 85.3
Parametric CAD Bench 91.5
OmniDocBench 1.5 92.1
RealWorldQA 88.0
MMStar 85.9
CountQA 82.4
Dense200 87.0
VideoMME(含字幕) 90.4
VideoMMMU 88.7
MLVU 90.8

这些数据说明,Qwen3.8-Max并不是简单增加了图片上传功能,而是在尝试让视觉信息真正参与Agent的判断和操作。

OSWorld-Verified和AndroidWorld等测试,考察的是模型能否理解软件界面,并判断下一步应该如何操作。

Qwen3.8-Max在多项测试中表现突出,但也并未在所有视觉Agent项目中领先。文档理解或图片问答成绩较高,也不代表模型在实际控制电脑或浏览器时一定同样稳定。

通过视频进一步了解Qwen3.8-Max

如果你想更直观地了解Qwen3.8-Max,以及它与其他主流开放模型之间的差异,可以观看下面的视频。视频详细介绍了该模型的核心能力、性能数据和可能的应用场景。

Qwen3.8 Max Is HERE – Is THIS the BEST Open Model Yet?
点击观看Qwen3.8-Max完整评测视频,进一步了解模型的性能和最新进展。

Qwen3.8-Max API价格

官方公告给出的API价格如下:

使用类型 官方价格
输入 每百万tokens 2美元
输出 每百万tokens 6美元
隐式缓存 每百万tokens 0.25美元

相比预览阶段,这次公布的价格更加清楚。

较低的隐式缓存价格,对于需要重复读取同一代码仓库、系统提示词、企业文档或历史对话的Agent比较有吸引力。

但模型的实际使用成本还取决于:

  • 输入内容的长度
  • 推理过程的长度
  • 最终输出量
  • 工具调用次数
  • 失败和重试次数
  • 上下文缓存机制
  • 人工检查与修改时间

因此,企业在比较不同模型时,更应该关注“完成一个任务需要多少钱”,而不是只比较每百万tokens的价格。

如果一个模型价格便宜,但需要多次返工,实际成本未必更低。相反,价格稍高但一次就能完成任务的模型,可能更划算。

Qwen3.8-Max开源了吗?

Qwen在8月3日的官方公告中表示,Qwen3.8-Max的开放权重将在随后一周发布。

与此同时,团队还宣布将开放 Qwen3.8-27B 的模型权重。

在权重文件和许可证正式发布前,更严谨的表述是:

Qwen已经正式公布Qwen3.8-Max和Qwen3.8-27B的开放权重计划。开发者仍需在正式发布后确认模型仓库、许可证、权重文件和部署要求。

如果在本地部署一个总参数规模达到2.4万亿的模型,所需的基础设施可能非常庞大。相比之下,27B版本对个人开发者、研究团队和算力有限的企业会更加友好。

哪些人适合使用Qwen3.8-Max?

软件开发团队

Qwen3.8-Max可以用于:

  • 阅读和理解陌生代码仓库
  • 规划架构调整
  • 修改多个文件
  • 排查复杂错误
  • 运行测试
  • 开发完整应用
  • 驱动长时间运行的编程Agent

在允许模型修改生产代码之前,开发团队需要确认它能否遵守项目规范、使用正确的工作目录、控制修改范围,并对结果进行完整验证。

研究和内容团队

Qwen3.8-Max的长上下文和多模态能力可以用于:

  • 研究资料整理
  • 竞品分析
  • 长文档阅读
  • 视频内容分析
  • 知识提取
  • 报告撰写

用户可以先通过iWeaver收集和整理PDF、网页、视频及其他资料,再让模型进行信息对比、内容总结或结构化分析。

在这个过程中,关键不是让模型写得更长,而是确保每个重要结论都能追溯到原始资料。

企业自动化团队

企业可以评估Qwen3.8-Max在以下场景中的表现:

  • 内部知识助手
  • 客服工作流
  • 文档处理
  • 办公自动化
  • 软件运维
  • 能够调用工具的业务Agent

正式用于生产环境前,还需要评估数据安全、访问权限、数据留存、操作记录、API稳定性、并发能力、错误恢复和整体成本。

现在应该切换到Qwen3.8-Max吗?

如果你的工作涉及复杂编程、长文档、多模态分析或需要多轮规划和工具调用的任务,Qwen3.8-Max值得测试。

但仅凭官方测试图就直接替换生产模型,并不是稳妥的做法。

更合理的方式是从真实工作中挑选20至50个任务,使用相同的提示词、源文件、工具权限和评分标准,将Qwen3.8-Max与Qwen3.7-Max及其他旗舰模型进行比较。

建议记录以下指标:

  • 任务完成率
  • 首次执行成功率
  • 响应时间
  • 工具调用失败次数
  • 人工修改时间
  • 输入与输出消耗
  • 多次执行时的稳定性
  • 最终成果是否可以直接使用

参数最多或平均测试分数最高的模型,不一定最适合你的业务。真正值得采用的模型,应该能够以合理的成本稳定完成实际任务。

总结

Qwen3.8-Max拥有约2.4万亿总参数,并结合了自主编程、长周期规划、多模态理解、百万级上下文和较有竞争力的API价格。

从官方公布的数据看,它相比Qwen3.7-Max在编程Agent、专业工作流、通用推理、文档理解和视觉任务上均有不同程度的提升。Qwen还公布了Qwen3.8-Max和Qwen3.8-27B的开放权重计划。

接下来真正值得关注的,不是官方发布中的数据有多亮眼,而是第三方测试和实际用户能否复现这些表现。

现阶段,Qwen3.8-Max已经进入最值得关注的旗舰模型名单,也适合编程、研究和Agent工作流团队进行一轮有针对性的测试。

常见问题

Qwen3.8-Max是什么?

Qwen3.8-Max是阿里通义千问推出的旗舰大模型,主要面向复杂推理、自主编程、多模态分析和长时间运行的Agent任务,总参数规模约为2.4万亿。

Qwen3.8-Max的API价格是多少?

官方价格为:输入每百万tokens 2美元,输出每百万tokens 6美元,隐式缓存每百万tokens 0.25美元。

Qwen3.8-Max支持图片和视频吗?

支持。Qwen3.8-Max可以处理文本、图片和视频,并能在Agent任务中利用视觉信息进行规划、执行和检查。

Qwen3.8-Max支持多长的上下文?

Qwen Code公开的配置信息显示,其上下文窗口约为100万tokens。不同平台或API接口的实际限制可能不同,使用前应查看对应服务的最新说明。

Qwen3.8-Max开源了吗?

Qwen已经公布Qwen3.8-Max的开放权重计划。开发者应以正式发布后的模型仓库、许可证和权重文件为准。

Qwen3.8-27B是什么?

Qwen3.8-27B是与Qwen3.8-Max一同公布的较小版本。Qwen表示该模型也会开放权重。相比2.4万亿参数的Max版本,27B模型更适合本地部署和算力有限的团队。