Grok 4.7 vs Claude Fable 5.1 对比

grok-4-7-vs-claude-fable-5-1

Grok 4.7 和 Claude Fable 5.1 是非常直接的竞争对手。

Anthropic 将 Fable 5.1 描述为其用于高要求推理与长视距(long-horizon)代理式工作的模型,在编码、多步骤研究、文档、电子表格和演示等方面具备更强的能力。

xAI 也用非常类似的表述来介绍 Grok 4.7:编码、代理式任务、更长时间的工作、自我验证,以及专业知识工作。

因此,与其纠结“哪个模型听起来更厉害”,更有价值的是比较它们在使用场景、编码方式、代理行为、基准测试以及成本上的差异。

首先查看 Grok 的完整规格:请见我们的 Grok 4.7 评测

Grok 4.7 vs Claude Fable 5.1 概览

Grok 4.7 Claude Fable 5.1
发布 2026 年 9 月 21 日 2026 年 9 月 1 日
上下文窗口 500K 1M
最大输出 无固定文本输出上限 128K
知识截止时间 2026 年 5 月 2026 年 6 月
输入 文本、图像 文本、图像
推理 低到 XHigh 自适应思考
起始输入价格 $2 / MTok $10 / MTok
起始输出价格 $6 / MTok $50 / MTok
主要定位 编码 + 知识工作 长视距推理 + 代理

Claude Fable 5.1 提供 1M-token 的上下文窗口、128K 的最大输出、自适应思考,以及 2026 年 6 月可靠的知识截止时间。Grok 4.7 提供 500K 的上下文窗口,并可从低(Low)到 XHigh 选择不同的推理投入程度。

编码性能

两种模型的核心都围绕编码。

xAI 的 Grok 4.7 发布内容,提供了两者之间最清晰的同表对比之一。

基准测试 Grok 4.7 Fable 5.1
CursorBench 4.0 46.3% 51.8%
DeepSWE v1.1 71.0% 70.0%
AA Briefcase v1.1 1,657 1,678
Terminal-Bench 4.0 38.0% 57.9%
HealthBench Professional 56.7% 62.1%
EEBench 64.0% 56.4%

这些数据来自 xAI 公布的评估设置。在那组测试里,模型会根据任务“互换领先位置”,而不是某一个模型在所有项目上都占优。

这里还有一个同样有用的启示:基准测试的实现方式很关键。

OpenAI 对 Fable 5.1 的评估报告显示,Terminal-Bench 4.0 为 55.8%,DeepSWE v1.1 为 67.4%,数值与 xAI 表中的结果略有不同。这就是为什么小型的跨供应商基准差异需要谨慎解读。

长时间的代理式工作

Fable 5.1 明确为长视距(long-horizon)的代理式任务而打造。

Anthropic 强调更强的长时间编码能力、多步骤研究,以及专业工件(artifact)的创建。它的自适应思考始终开启,同时可以控制投入的力度。

Grok 4.7 也面向长时间工作,但 xAI 强调了略有不同的改进:在困难任务上进行更长时间的强化学习、更好的自我验证、改进的上下文管理,以及对 Grok Bot 工具集的原生理解。

在实际应用中,二者都应在包含重复调用工具、修改与验证的任务上进行测试——而不仅仅是单次的编码提示。

上下文窗口

Fable 5.1 提供 100 万 tokens 的上下文。

Grok 4.7 提供 50 万 tokens

在极其庞大的代码库、研究论文合集、很长的法律文档,或会积累大量工具输出的代理会话中,这个差异可能会很重要。

但上下文窗口翻倍,并不意味着性能就会自动翻倍。

长上下文的质量同样取决于:模型是否能检索到正确信息、是否能察觉依赖关系、以及是否能在整个工作流中保持指令一致性。

定价

这里,两款模型的分歧非常明显。

Grok 4.7 起步为:

$2 / 1M 输入 tokens$6 / 1M 输出 tokens

Claude Fable 5.1 的费用为:

$10 / 1M 输入 tokens$50 / 1M 输出 tokens

Fable 的缓存读取价格要便宜得多,为每百万 tokens $0.25。Anthropic 表示,这能在复用大型提示词或运行高度代理化的会话等工作负载中,显著降低成本。

因此,仅看 token 的原始价格只能说明故事的一部分。

如果你的工作流会反复复用同一份大上下文,那么缓存行为就很关键。如果你处理大量彼此独立的请求,那么基础的输入与输出费率可能更重要。

文档与知识工作

Fable 5.1 对专业工件有着很强的关注。

Anthropic 特别强调处理文档、电子表格、幻灯片、研究内容以及编码等工作。

Grok 4.7 也改进了文档与演示的创建能力,同时 xAI 报告了其在覆盖办公工作、法律任务、医疗推理和工程等领域的专业基准中的提升。

对于与“源材料(source-heavy)”关系更紧密的团队,一个现实的测试可能包括:阅读多份文档、识别相互冲突的证据、撰写报告、在收到反馈后进行修订,并将最终结论与原始文件中的内容进行核对。

你应该先测试哪一个?

与其把选择简化成“看一个基准分数谁更高”,不如根据你工作流的需求来决定。

需求 最重要的是什么
超大输入上下文 Fable 5.1 的 1M 窗口
更低的基础 token 定价 Grok 4.7
长视距代理 用你的任务同时测试两者
复用大型提示词 对比缓存的经济性
以终端为主的编码 对比真实代码库与工具
文档与演示 评估最终工件质量
以搜索为主的工作流 考虑 Grok 的 Web 和 X 工具

实际差异可能比基准测试表格暗示的更大或更小。

如果 GPT-6 也在你的评估范围内,请参见 Grok 4.7 vs GPT-6 Astra

最终思考

Grok 4.7 和 Claude Fable 5.1 都面向许多同样高价值的任务,但它们做出了不同的取舍。

Fable 5.1 的上下文窗口是两倍,并且明确围绕高要求的长视距推理与代理式工作而设计。

Grok 4.7 的 token 起步价格显著更低,并将可选择的推理等级与 xAI 的搜索、代码执行以及代理生态系统结合起来。

因此,正确的比较方式并不是“哪个基准数字更大?”

关键在于:模型能否准确、稳定地完成你的编码、研究或知识工作流,并且成本是合理的。

如果你想直接测试 Grok,请看我们的 如何使用 Grok 4.7 指南,涵盖主要访问方式和设置选项。