Qwen3.8-Max 是近期大模型领域关注度最高的新模型之一。
8月3日,阿里通义千问团队正式发布Qwen3.8-Max,并称其为“目前能力最强的Qwen模型”。该模型总参数规模约为 2.4万亿,重点面向自主编程、专业工作、长周期Agent任务和多模态理解。
相比此前的预览版本,这次官方公布了更多关键信息,包括API价格、语言与视觉能力测试、长时间运行的Agent案例,以及模型权重的开放计划。
Qwen3.8-Max的意义不只是模型变得更大。它反映出一个更明显的行业趋势:大模型正在从“回答问题”转向“完成工作”。模型不仅要给出答案,还要能够制定计划、调用工具、检查结果,并持续推进复杂任务。
Qwen3.8-Max是什么?
Qwen3.8-Max是阿里通义千问推出的新一代旗舰模型,主要面向复杂推理、软件开发、多模态分析、专业工作流和自主Agent任务。
该模型此前以预览版本开放体验,模型名称为:
qwen3.8-max-preview
预览版让部分开发者提前体验了模型,但当时仍有不少信息尚未明确,例如标准API价格、开源时间和完整的测试结果。
这些问题在8月3日发布的Qwen3.8-Max官方公告中有了更清楚的答案。
官方将Qwen3.8-Max定位为面向“编程与协作”的旗舰模型,并重点强调了四项能力:
- 自主完成软件开发
- 生成可直接用于实际工作的专业成果
- 长周期规划与执行
- 原生多模态Agent能力
换句话说,Qwen3.8-Max并不只是一个参数更大的聊天模型。它更像是一个面向复杂任务的智能中枢,可以处理代码、文档、视觉界面、外部工具和较长的任务记录。
Qwen3.8-Max有哪些核心能力?
约2.4万亿总参数
Qwen3.8-Max最受关注的参数是其约 2.4万亿的总参数规模。
这是目前通义千问公开发布的最大模型之一。不过,总参数量并不等于模型每次回答问题时都会调用全部参数。
如果模型采用混合专家架构,每次推理通常只会激活其中一部分参数。模型在实际任务中的表现,还会受到以下因素影响:
- 每次推理激活的参数数量
- 训练数据的质量
- 强化学习方法
- 工具调用的准确性
- 上下文管理能力
- 推理基础设施
- 响应速度
- 多次执行同一任务时的稳定性
因此,2.4万亿参数说明Qwen3.8-Max的模型规模很大,但不能只凭这一项数据就认定它在所有任务中都领先。
自主编程能力
根据Qwen官方介绍,Qwen3.8-Max可以持续进行十天以上的自主软件开发。
官方展示的案例中,模型从一个空文件夹开始,在较少人工干预的情况下逐步完成了一个可用于生产环境的项目。相关开发过程已经通过官方公告中的GitHub链接公开。
这类任务远比生成一个函数或修复一处报错复杂。要连续完成一个软件项目,模型通常需要:
- 理解产品目标;
- 设计合适的技术架构;
- 创建并修改多个文件;
- 安装和配置依赖;
- 运行测试并分析错误;
- 检查应用的实际效果;
- 修复发现的问题;
- 在长时间执行过程中始终围绕原始目标推进。
需要注意的是,这仍然是官方展示的案例,并非独立第三方测试。不过,它能够说明Qwen3.8-Max希望解决的并不是单次代码生成,而是完整的软件开发流程。
长周期Agent任务
Qwen还公布了两个执行周期很长的Agent案例:
- 完成500多轮芯片设计优化
- 模拟执行365天的电商经营策略
这两个案例主要展示模型在闭环任务中的持续规划和调整能力。
在这类任务中,Agent不会只生成一份方案就结束。它需要反复查看结果、判断当前策略是否有效,再决定下一步如何调整。
一个能够长期运行的Agent,除了模型本身足够强,还需要配套的记忆管理、进度记录、工具权限、验证机制和错误恢复能力。
因此,长周期Agent的最终表现不只取决于底层模型,也与整个系统的设计有关。
原生多模态能力
Qwen3.8-Max支持文本、图片和视频输入。
Qwen官方对这项能力的描述并不是简单的“能够看图”,而是让视觉信息参与整个任务执行过程。
一个视觉Agent可能需要反复完成以下步骤:
- 查看当前界面
- 判断页面或应用所处的状态
- 决定下一步操作
- 调用工具执行操作
- 检查操作结果
- 发现错误
- 调整并重新执行
这类能力适合用于浏览器自动化、软件测试、文档处理、界面检查,以及同时包含文字和视觉信息的复杂工作。
百万级上下文窗口
Qwen Code公开的模型配置信息显示,Qwen3.8-Max支持约100万tokens的上下文窗口。
这样的上下文长度可以用于处理:
- 大型代码仓库
- 多篇研究论文
- 较长的商业资料
- 长时间运行的Agent记录
- 多个文件和数据来源
- 较长的视频字幕或会议记录
不过,上下文越长并不代表结果一定越好。输入内容过多,可能增加响应时间,也可能让模型难以抓住真正重要的信息。
实际使用时,仍然建议先整理资料、删除无关内容、对已完成阶段进行摘要,并要求模型注明关键结论所依据的文件或原文。
Qwen3.8-Max语言与Agent性能测试
Qwen官方公布了一张性能对比图,将Qwen3.8-Max与Opus 4.8、Fable 5、GPT-5.6 Sol和Qwen3.7-Max进行了比较。

Qwen3.8-Max在部分测试中的成绩如下:
| 测试项目 | Qwen3.8-Max得分 |
|---|---|
| Terminal Bench 2.1 | 89.8 |
| FrontierSWE | 73.5 |
| PaperBench | 83.0 |
| AndroidBench | 75.1 |
| QwenSWEBench | 80.7 |
| QwenCoderBench | 58.4 |
| QwenReactBench | 1,724 |
| QwenSVGBench | 1,713 |
| CoWorkBench | 74.8 |
| WorkSpaceBench | 67.7 |
| JobBench | 53.4 |
| SkillsBench | 70.2 |
| GPQA Diamond | 92.6 |
| MMLU-Pro | 92.9 |
| LongBench v2 | 68.3 |
从官方数据来看,Qwen3.8-Max在多个项目上相比Qwen3.7-Max有明显提升。
例如,Terminal Bench 2.1的得分从Qwen3.7-Max的74.5提升至89.8;CoWorkBench从64.8提升至74.8;WorkSpaceBench则从61.4提升至67.7。
在通用推理任务中,Qwen3.8-Max的GPQA Diamond得分为92.6,MMLU-Pro得分为92.9。
不过,它并没有在表格中的每一项测试里都排名第一。部分软件工程和专业Agent测试仍由其他模型领先。
因此,更准确的说法是:Qwen3.8-Max已经进入当前旗舰模型的第一梯队,但不能简单概括为“所有能力都是第一”。
此外,这些数据来自Qwen官方。企业在决定是否使用之前,仍需结合自己的实际任务进行测试。
Qwen3.8-Max多模态性能测试
Qwen还发布了另一张测试图,涵盖多模态推理、视觉Agent、文档理解、空间理解、视觉定位和视频分析等任务。

部分测试结果如下:
| 测试项目 | Qwen3.8-Max得分 |
|---|---|
| MMMU-Pro | 82.3 |
| MathVision | 95.2 / 97.7 |
| LogicVista | 91.9 |
| SLAKE | 90.8 |
| OSWorld-Verified | 86.1 |
| AndroidWorld | 85.3 |
| Parametric CAD Bench | 91.5 |
| OmniDocBench 1.5 | 92.1 |
| RealWorldQA | 88.0 |
| MMStar | 85.9 |
| CountQA | 82.4 |
| Dense200 | 87.0 |
| VideoMME(含字幕) | 90.4 |
| VideoMMMU | 88.7 |
| MLVU | 90.8 |
这些数据说明,Qwen3.8-Max并不是简单增加了图片上传功能,而是在尝试让视觉信息真正参与Agent的判断和操作。
OSWorld-Verified和AndroidWorld等测试,考察的是模型能否理解软件界面,并判断下一步应该如何操作。
Qwen3.8-Max在多项测试中表现突出,但也并未在所有视觉Agent项目中领先。文档理解或图片问答成绩较高,也不代表模型在实际控制电脑或浏览器时一定同样稳定。
通过视频进一步了解Qwen3.8-Max
如果你想更直观地了解Qwen3.8-Max,以及它与其他主流开放模型之间的差异,可以观看下面的视频。视频详细介绍了该模型的核心能力、性能数据和可能的应用场景。

Qwen3.8-Max API价格
官方公告给出的API价格如下:
| 使用类型 | 官方价格 |
|---|---|
| 输入 | 每百万tokens 2美元 |
| 输出 | 每百万tokens 6美元 |
| 隐式缓存 | 每百万tokens 0.25美元 |
相比预览阶段,这次公布的价格更加清楚。
较低的隐式缓存价格,对于需要重复读取同一代码仓库、系统提示词、企业文档或历史对话的Agent比较有吸引力。
但模型的实际使用成本还取决于:
- 输入内容的长度
- 推理过程的长度
- 最终输出量
- 工具调用次数
- 失败和重试次数
- 上下文缓存机制
- 人工检查与修改时间
因此,企业在比较不同模型时,更应该关注“完成一个任务需要多少钱”,而不是只比较每百万tokens的价格。
如果一个模型价格便宜,但需要多次返工,实际成本未必更低。相反,价格稍高但一次就能完成任务的模型,可能更划算。
Qwen3.8-Max开源了吗?
Qwen在8月3日的官方公告中表示,Qwen3.8-Max的开放权重将在随后一周发布。
与此同时,团队还宣布将开放 Qwen3.8-27B 的模型权重。
在权重文件和许可证正式发布前,更严谨的表述是:
Qwen已经正式公布Qwen3.8-Max和Qwen3.8-27B的开放权重计划。开发者仍需在正式发布后确认模型仓库、许可证、权重文件和部署要求。
如果在本地部署一个总参数规模达到2.4万亿的模型,所需的基础设施可能非常庞大。相比之下,27B版本对个人开发者、研究团队和算力有限的企业会更加友好。
哪些人适合使用Qwen3.8-Max?
软件开发团队
Qwen3.8-Max可以用于:
- 阅读和理解陌生代码仓库
- 规划架构调整
- 修改多个文件
- 排查复杂错误
- 运行测试
- 开发完整应用
- 驱动长时间运行的编程Agent
在允许模型修改生产代码之前,开发团队需要确认它能否遵守项目规范、使用正确的工作目录、控制修改范围,并对结果进行完整验证。
研究和内容团队
Qwen3.8-Max的长上下文和多模态能力可以用于:
- 研究资料整理
- 竞品分析
- 长文档阅读
- 视频内容分析
- 知识提取
- 报告撰写
用户可以先通过iWeaver收集和整理PDF、网页、视频及其他资料,再让模型进行信息对比、内容总结或结构化分析。
在这个过程中,关键不是让模型写得更长,而是确保每个重要结论都能追溯到原始资料。
企业自动化团队
企业可以评估Qwen3.8-Max在以下场景中的表现:
- 内部知识助手
- 客服工作流
- 文档处理
- 办公自动化
- 软件运维
- 能够调用工具的业务Agent
正式用于生产环境前,还需要评估数据安全、访问权限、数据留存、操作记录、API稳定性、并发能力、错误恢复和整体成本。
现在应该切换到Qwen3.8-Max吗?
如果你的工作涉及复杂编程、长文档、多模态分析或需要多轮规划和工具调用的任务,Qwen3.8-Max值得测试。
但仅凭官方测试图就直接替换生产模型,并不是稳妥的做法。
更合理的方式是从真实工作中挑选20至50个任务,使用相同的提示词、源文件、工具权限和评分标准,将Qwen3.8-Max与Qwen3.7-Max及其他旗舰模型进行比较。
建议记录以下指标:
- 任务完成率
- 首次执行成功率
- 响应时间
- 工具调用失败次数
- 人工修改时间
- 输入与输出消耗
- 多次执行时的稳定性
- 最终成果是否可以直接使用
参数最多或平均测试分数最高的模型,不一定最适合你的业务。真正值得采用的模型,应该能够以合理的成本稳定完成实际任务。
总结
Qwen3.8-Max拥有约2.4万亿总参数,并结合了自主编程、长周期规划、多模态理解、百万级上下文和较有竞争力的API价格。
从官方公布的数据看,它相比Qwen3.7-Max在编程Agent、专业工作流、通用推理、文档理解和视觉任务上均有不同程度的提升。Qwen还公布了Qwen3.8-Max和Qwen3.8-27B的开放权重计划。
接下来真正值得关注的,不是官方发布中的数据有多亮眼,而是第三方测试和实际用户能否复现这些表现。
现阶段,Qwen3.8-Max已经进入最值得关注的旗舰模型名单,也适合编程、研究和Agent工作流团队进行一轮有针对性的测试。
常见问题
Qwen3.8-Max是什么?
Qwen3.8-Max是阿里通义千问推出的旗舰大模型,主要面向复杂推理、自主编程、多模态分析和长时间运行的Agent任务,总参数规模约为2.4万亿。
Qwen3.8-Max的API价格是多少?
官方价格为:输入每百万tokens 2美元,输出每百万tokens 6美元,隐式缓存每百万tokens 0.25美元。
Qwen3.8-Max支持图片和视频吗?
支持。Qwen3.8-Max可以处理文本、图片和视频,并能在Agent任务中利用视觉信息进行规划、执行和检查。
Qwen3.8-Max支持多长的上下文?
Qwen Code公开的配置信息显示,其上下文窗口约为100万tokens。不同平台或API接口的实际限制可能不同,使用前应查看对应服务的最新说明。
Qwen3.8-Max开源了吗?
Qwen已经公布Qwen3.8-Max的开放权重计划。开发者应以正式发布后的模型仓库、许可证和权重文件为准。
Qwen3.8-27B是什么?
Qwen3.8-27B是与Qwen3.8-Max一同公布的较小版本。Qwen表示该模型也会开放权重。相比2.4万亿参数的Max版本,27B模型更适合本地部署和算力有限的团队。

