Meta 发布了 Muse Spark 1.3。这次更新的重点,并不是单纯让聊天机器人“更聪明一点”。
而是让 AI 真正具备把工作做完的能力。
Muse Spark 1.3 于 9 月 2 日发布,重点提升了长时间运行的 AI Agent、编程、工具调用、长上下文以及复杂工作流等能力。
Meta 还表示,与 Muse Spark 1.2 相比,新模型的运行效率更高。根据其工程团队的测试,Muse Spark 1.3 大约可以减少 20% 的工具调用次数和 25% 的 Token 消耗。
这可能是此次升级中最实用的改进之一。
Muse Spark 1.3 是什么?
Muse Spark 1.3 是 Meta Muse Spark 系列的最新模型。
它主要面向那些无法通过一次提示词和一次回答完成的复杂任务,例如:
- 长时间运行的 AI Agent
- 软件工程
- 研究与网页浏览
- Computer Use
- 企业自动化
- 长上下文信息检索
- 复杂文档工作流
目前,Muse Spark 1.3 可以通过 Muse Code 和 Meta Model API 使用。
它还支持 100 万 Token 的上下文窗口,能够一次处理大型代码库、长文档、多份文件以及持续时间较长的 Agent 任务。
不过,更大的变化并不只是它能够“记住多少内容”。
而是它能否在长时间任务中,持续利用这些信息完成工作。
Muse Spark 1.3 更适合长时间 AI 工作流
AI Agent 面临的一个常见问题就是任务跑偏。
模型一开始可能完全理解目标,也能正确完成前几个步骤,但随着工作流越来越长,它可能会逐渐忘记某些重要要求。
Muse Spark 1.3 正在尝试改善这个问题。
Meta 表示,新模型在长任务中能够更好地保持复杂指令,处理混乱甚至互相冲突的信息,发现并修正计划中的缺口,同时持续记录自己已经获取的信息。
即使在同一个长对话中同时处理多个工作流,它也更不容易把新的任务和之前的要求混淆。
从源文件直接生成最终交付物
Meta 展示的案例,可以更直观地说明这种能力与普通聊天有什么不同。
在其中一项测试中,Muse Spark 1.3 收到了一份包含居民反馈的 Excel 文件,并被要求将这些数据整理成工作人员可以直接用于董事会会议的材料。
最终结果并不只是聊天窗口里的一段总结。
它直接生成了一份结构完整的 PDF,其中包括会议要点、关键数据、不同地区的具体建议、工作人员可以采用的表达方式,以及哪些内容不应该向居民承诺。

这更接近 AI Agent 未来的发展方向。
过去的模式可能是:
提示词 → 回答
现在则逐渐变成:
文件 → 理解 → 分析 → 整理 → 创建 → 交付
对于真实工作场景来说,这种差别非常重要。
Muse Spark 1.3 可以处理更复杂的多模态任务
长工作流并不只适用于表格和文档。
Meta 展示的另一个案例中,Muse Spark 1.3 被要求扮演一名机械工程师,参与实验型飞机组件的分析工作。
模型首先收到初步 CFD 流体仿真结果,以及一个包含 CAD 模型的 STEP 文件。
随后,它需要理解这些材料,解释仿真环境,提取工程指标,制作表格和示意图,分析空气动力学影响,最后生成一份完整的 PDF 报告。
最终文档中同时包含了技术说明、可视化内容、表格、图表以及工程背景信息。

这个案例也很好地解释了现在所谓的“多模态 Agent”到底意味着什么。
目标已经不只是识别一张图片,或者总结一份 PDF。
真正有用的 Agent,需要能够理解多种类型的输入,保留关键细节,在不同信息之间进行分析,并最终把结果整理成其他人可以直接使用的内容。
Muse Spark 1.3 基准测试表现
Meta 对 Muse Spark 1.3 的评测主要集中在此次升级最重要的三个方向:
- AI Agent
- 长上下文
- 编程
整体表现相当不错,不过 Muse Spark 1.3 并没有在所有基准测试中排名第一。

Agent 能力
在测试长流程 Computer Use 能力的 OSWorld 2.0 中,Muse Spark 1.3 得分为:
66.9
相比 Muse Spark 1.2 的 47.6 提升明显,同时超过 GPT-5.6 Sol 的 62.7,不过 Claude Opus 5 仍然略高,为 68.3。
此外,Muse Spark 1.3 还取得了:
- JobBench:64.9
- DeepSearchQA:89.4
- Meta Agentic IF Index:57.8
- AutomationBench:49.4
真正值得关注的并不是 Muse Spark 在每一个项目中都排名第一——实际上并不是这样。
更明显的是,与 Muse Spark 1.2 相比,1.3 在多种 Agent 工作类型中都实现了比较稳定的提升。
长上下文是一次明显升级
Muse Spark 1.3 在长上下文测试中的提升尤其明显。
在 MRCR 测试中:
| Benchmark | Muse Spark 1.3 | Muse Spark 1.2 | GPT-5.6 Sol |
|---|---|---|---|
| MRCR 256K–512K | 98.5 | 66.3 | 91.5 |
| MRCR 512K–1M | 98.1 | 55.5 | 73.8 |
相比 Muse Spark 1.2,这是非常大的提升。
100 万 Token 的上下文窗口本身并没有太大意义,真正重要的是:当关键信息被埋在超长上下文中时,模型能不能准确找到并使用它。
从这些结果来看,Meta 不只是单纯扩大了最大上下文长度,还明显加强了超长上下文中的信息检索能力。
对于大型代码库、研究资料集合、长对话以及文档密集型 Agent 来说,这可能会成为 Muse Spark 1.3 最重要的优势之一。
编程能力同样有所提升
Muse Spark 1.3 在多个编程测试中的表现也不错。
在测试长流程软件工程能力的 DeepSWE v1.1 中,Muse Spark 1.3 得分 75.4,对比:
- Muse Spark 1.2:55.0
- GPT-5.6 Sol:73.0
- Claude Opus 5:74.0
在 SWEAtlas CodeBase QnA 中,它还取得了 59.4 的成绩,高于 Meta 对比表中的其他模型。
而在 Terminal-Bench 2.1 中,Muse Spark 1.3 和 GPT-5.6 Sol 均获得 88.8,Claude Opus 5 则为 86.7。
这些结果也与此次更新的核心方向一致:
当编程任务不再只是一次生成代码,而是需要连续执行多个步骤时,Muse Spark 1.3 的能力明显增强。
不过,有一个细节值得注意。
Meta 发布的基准测试表中,Muse Spark 1.3 使用的是 Max Reasoning(最高推理)配置。
发布初期,Meta 表示此前已经提供的推理模式可以立即使用,而 Max Reasoning 还需要完成额外的安全测试后才会上线。
因此,官方基准测试中的表现,并不能直接等同于所有用户当前可以使用的每一种配置。
Muse Spark 1.3 减少了工具调用次数
基准测试很重要,但此次升级中最实用的变化之一,可能并不会直接体现在排行榜上。
Meta 表示,与 Muse Spark 1.2 相比,其工程团队发现 Muse Spark 1.3 大约可以减少:
- 20% 的工具调用
- 25% 的 Token 消耗
同时,新模型也更少进行没有必要的操作,生成的代码也更加简洁。
为什么这很重要?
假设一个编程 Agent 正在尝试修复 Bug。
效率较低的工作流可能是:
搜索 → 检查 → 再次搜索 → 修改 → 检查 → 撤销 → 搜索 → 修改 → 测试 → 再次修改
而一个效率更高的 Agent,则可能更早发现真正的问题,用更少的操作得到相同结果。
每一次不必要的工具调用都会增加时间和成本。
同时,也意味着工作流中多了一次出错的机会。
这种优势并不只适用于编程。
研究 Agent、浏览器 Agent、企业自动化工具以及个人 AI 助手,都能从“更早做出正确操作”中受益。
Muse Spark 1.3 价格
Muse Spark 1.3 在 Meta Model API 中提供两种价格差异比较明显的方案。
两者都支持 100 万 Token 上下文窗口。

标准版 Muse Spark 1.3
标准 muse-spark-1.3 模型的价格为:
| 用量 | 每 100 万 Token 价格 |
|---|---|
| 输入 | $1.25 |
| 缓存输入 | $0.15 |
| 输出 | $4.25 |
Meta 将这一版本标注为:
不会用于改进其产品。
Muse Spark 1.3 Contributor
Meta 还提供了一个便宜很多的版本:
muse-spark-1.3-contributor
价格如下:
| 用量 | 每 100 万 Token 价格 |
|---|---|
| 输入 | $0.10 |
| 缓存输入 | $0.002 |
| 输出 | $0.20 |
不过,这里的差别很重要。
Meta 将 Contributor 版本标注为:
会用于改进其产品。
因此,Contributor 版本的价格确实非常低,但并不适合所有场景,尤其是涉及数据处理、隐私或企业安全要求时。
对于开发者来说,选择具体模型版本时,不应该只看 Token 价格。
Muse Spark 1.3 vs Muse Spark 1.2
这次升级并没有依赖某一个特别吸引眼球的新功能。
更明显的变化,是整个工作流都得到了提升。
| 功能 | Muse Spark 1.2 | Muse Spark 1.3 |
|---|---|---|
| 长时间运行 Agent | 强 | 更可靠 |
| 长指令遵循 | 良好 | 提升 |
| 多任务处理 | 支持 | 任务区分更好 |
| 工具使用 | 强 | 效率更高 |
| 工具调用 | 基准 | Meta 测试中减少约 20% |
| Token 使用 | 基准 | Meta 测试中减少约 25% |
| 长上下文检索 | 良好 | 大幅提升 |
| 编程 | 强 | 长流程任务表现更好 |
| 主动澄清需求 | 支持 | 更主动 |
如果要用一句话概括这次变化,可以说:
Muse Spark 1.3 可以用更少的无效操作,完成更复杂的工作。
它也更清楚什么时候“不应该行动”
还有一个不那么吸引眼球的升级,对于真实的 Agent 应用来说可能非常重要。
Muse Spark 1.3 被训练得更加主动地与用户协作。
如果提示词存在歧义,它可以主动询问。
如果任务卡住,它可以请求用户帮助。
在执行可能产生重要影响的操作之前,它也更可能先确认用户真正想要什么。
Meta 还表示,新模型对自己的能力边界有了更好的判断。
它更清楚自己知道什么、不知道什么,以及什么时候已经达到能力极限,而不是直接编造一个结果。
一个知道什么时候应该停下来的 Agent,有时比试图自动完成所有事情的 Agent 更有价值。
Muse Spark 1.3 是开源模型吗?
目前还不是。
Muse Spark 1.3 目前主要通过 Meta 自己的服务提供,并没有发布 Open Weights 版本。
不过,Meta 已经确认,Muse Spark 开放权重版本已经在其路线图中。
目前还没有公布具体发布日期。
对于希望在 Meta 托管 API 之外运行、定制或微调 Muse Spark 的开发者来说,这将会是接下来最值得关注的进展之一。
Muse Spark 1.3 在哪里可以使用?
目前,Muse Spark 1.3 可以通过以下方式使用:
- Muse Code
- Meta Model API
如果你主要希望获得 Agent 式编程体验,Muse Code 是更直接的选择。
Meta Model API 则更适合希望把 Muse Spark 集成到自己产品和工作流中的开发者。
目前来看,它比较适合以下场景:
- 编程 Agent
- 研究 Agent
- Computer Use Agent
- 企业自动化
- 大型文档工作流
- 长时间运行任务
- 多模态分析
- 需要 100 万 Token 上下文窗口的应用
Muse Spark 1.3 对日常 AI 工作意味着什么?
Muse Spark 1.3 反映了整个 AI 行业正在发生的一个明显变化。
过去几年,我们判断一个模型好不好,往往只需要问一个问题:
它的回答质量怎么样?
但进入 Agentic AI 阶段之后,还需要回答更多问题:
它能理解这些文件吗?
它能记住所有要求吗?
它会选择正确的工具吗?
出现问题后,它能自己恢复吗?
它最终能交付一个真正可用的结果吗?
这也是为什么前面提到的工程报告和员工沟通材料案例很有代表性。
它们体现的是 AI 正在从单纯的生成文本,逐渐走向完成整个工作流。
如果你的工作经常从 PDF、报告、网页、视频以及其他资料开始,iWeaver 也采用了类似的工作流思路,可以帮助你将分散的信息整理成摘要、结构化笔记、思维导图以及可以继续使用的知识内容。
如果你更关注开放式头脑风暴、故事创作或创意对话,XPT 则关注 AI 体验的另一个方向,提供更加灵活的对话方式,并减少不必要的中断。
随着模型能力不断提升,选择合适的工作流,正在变得和选择模型本身一样重要。
Muse Spark 1.3 值得尝试吗?
如果你经常使用 AI 完成以下工作,Muse Spark 1.3 会比较值得关注:
- 软件工程
- 长上下文研究
- 复杂文档处理
- AI Agent
- 自动化
- Computer Use
- 涉及多个工具的工作流
它在基准测试中的提升比较明显,尤其是在长上下文和编程方面。
但更值得关注的,可能反而是那些不那么吸引眼球的变化:
更少的不必要工具调用、更低的 Token 消耗、更好的指令保持能力,以及更清楚什么时候应该向用户寻求帮助。
这些变化能够让 AI Agent 更容易被信任,也更适合大规模运行。
总结
Muse Spark 1.3 很好地展示了 AI 模型竞争正在走向什么方向。
下一代模型的评价标准,不会再只是“一次回答看起来有多厉害”。
人们还会关注它是否能够:
- 始终围绕任务目标工作
- 同时处理多份文件
- 高效使用工具
- 记住复杂且长期的要求
- 发现自己的错误
- 最终交付真正有用的结果
Muse Spark 1.3 在这些方向上都表现出了明显进步。
它并没有在所有基准测试中排名第一,而且 Meta 官方对比中使用的 Max Reasoning 配置,目前也还不是所有用户都能直接使用的默认体验。
但与 Muse Spark 1.2 相比,升级方向已经非常明确。
Meta 正在把 Muse Spark 从一个能力不错的 AI 模型,变成一个更适合真实工作场景的实用型 AI Agent。
