Grok 4.7 和 Claude Fable 5.1 是非常直接的竞争对手。
Anthropic 将 Fable 5.1 描述为其用于高要求推理与长视距(long-horizon)代理式工作的模型,在编码、多步骤研究、文档、电子表格和演示等方面具备更强的能力。
xAI 也用非常类似的表述来介绍 Grok 4.7:编码、代理式任务、更长时间的工作、自我验证,以及专业知识工作。
因此,与其纠结“哪个模型听起来更厉害”,更有价值的是比较它们在使用场景、编码方式、代理行为、基准测试以及成本上的差异。
首先查看 Grok 的完整规格:请见我们的 Grok 4.7 评测。
Grok 4.7 vs Claude Fable 5.1 概览
| Grok 4.7 | Claude Fable 5.1 | |
|---|---|---|
| 发布 | 2026 年 9 月 21 日 | 2026 年 9 月 1 日 |
| 上下文窗口 | 500K | 1M |
| 最大输出 | 无固定文本输出上限 | 128K |
| 知识截止时间 | 2026 年 5 月 | 2026 年 6 月 |
| 输入 | 文本、图像 | 文本、图像 |
| 推理 | 低到 XHigh | 自适应思考 |
| 起始输入价格 | $2 / MTok | $10 / MTok |
| 起始输出价格 | $6 / MTok | $50 / MTok |
| 主要定位 | 编码 + 知识工作 | 长视距推理 + 代理 |
Claude Fable 5.1 提供 1M-token 的上下文窗口、128K 的最大输出、自适应思考,以及 2026 年 6 月可靠的知识截止时间。Grok 4.7 提供 500K 的上下文窗口,并可从低(Low)到 XHigh 选择不同的推理投入程度。
编码性能
两种模型的核心都围绕编码。
xAI 的 Grok 4.7 发布内容,提供了两者之间最清晰的同表对比之一。
| 基准测试 | Grok 4.7 | Fable 5.1 |
|---|---|---|
| CursorBench 4.0 | 46.3% | 51.8% |
| DeepSWE v1.1 | 71.0% | 70.0% |
| AA Briefcase v1.1 | 1,657 | 1,678 |
| Terminal-Bench 4.0 | 38.0% | 57.9% |
| HealthBench Professional | 56.7% | 62.1% |
| EEBench | 64.0% | 56.4% |
这些数据来自 xAI 公布的评估设置。在那组测试里,模型会根据任务“互换领先位置”,而不是某一个模型在所有项目上都占优。
这里还有一个同样有用的启示:基准测试的实现方式很关键。
OpenAI 对 Fable 5.1 的评估报告显示,Terminal-Bench 4.0 为 55.8%,DeepSWE v1.1 为 67.4%,数值与 xAI 表中的结果略有不同。这就是为什么小型的跨供应商基准差异需要谨慎解读。
长时间的代理式工作
Fable 5.1 明确为长视距(long-horizon)的代理式任务而打造。
Anthropic 强调更强的长时间编码能力、多步骤研究,以及专业工件(artifact)的创建。它的自适应思考始终开启,同时可以控制投入的力度。
Grok 4.7 也面向长时间工作,但 xAI 强调了略有不同的改进:在困难任务上进行更长时间的强化学习、更好的自我验证、改进的上下文管理,以及对 Grok Bot 工具集的原生理解。
在实际应用中,二者都应在包含重复调用工具、修改与验证的任务上进行测试——而不仅仅是单次的编码提示。
上下文窗口
Fable 5.1 提供 100 万 tokens 的上下文。
Grok 4.7 提供 50 万 tokens。
在极其庞大的代码库、研究论文合集、很长的法律文档,或会积累大量工具输出的代理会话中,这个差异可能会很重要。
但上下文窗口翻倍,并不意味着性能就会自动翻倍。
长上下文的质量同样取决于:模型是否能检索到正确信息、是否能察觉依赖关系、以及是否能在整个工作流中保持指令一致性。
定价
这里,两款模型的分歧非常明显。
Grok 4.7 起步为:
$2 / 1M 输入 tokens 和 $6 / 1M 输出 tokens。
Claude Fable 5.1 的费用为:
$10 / 1M 输入 tokens 和 $50 / 1M 输出 tokens。
Fable 的缓存读取价格要便宜得多,为每百万 tokens $0.25。Anthropic 表示,这能在复用大型提示词或运行高度代理化的会话等工作负载中,显著降低成本。
因此,仅看 token 的原始价格只能说明故事的一部分。
如果你的工作流会反复复用同一份大上下文,那么缓存行为就很关键。如果你处理大量彼此独立的请求,那么基础的输入与输出费率可能更重要。
文档与知识工作
Fable 5.1 对专业工件有着很强的关注。
Anthropic 特别强调处理文档、电子表格、幻灯片、研究内容以及编码等工作。
Grok 4.7 也改进了文档与演示的创建能力,同时 xAI 报告了其在覆盖办公工作、法律任务、医疗推理和工程等领域的专业基准中的提升。
对于与“源材料(source-heavy)”关系更紧密的团队,一个现实的测试可能包括:阅读多份文档、识别相互冲突的证据、撰写报告、在收到反馈后进行修订,并将最终结论与原始文件中的内容进行核对。
你应该先测试哪一个?
与其把选择简化成“看一个基准分数谁更高”,不如根据你工作流的需求来决定。
| 需求 | 最重要的是什么 |
|---|---|
| 超大输入上下文 | Fable 5.1 的 1M 窗口 |
| 更低的基础 token 定价 | Grok 4.7 |
| 长视距代理 | 用你的任务同时测试两者 |
| 复用大型提示词 | 对比缓存的经济性 |
| 以终端为主的编码 | 对比真实代码库与工具 |
| 文档与演示 | 评估最终工件质量 |
| 以搜索为主的工作流 | 考虑 Grok 的 Web 和 X 工具 |
实际差异可能比基准测试表格暗示的更大或更小。
如果 GPT-6 也在你的评估范围内,请参见 Grok 4.7 vs GPT-6 Astra。
最终思考
Grok 4.7 和 Claude Fable 5.1 都面向许多同样高价值的任务,但它们做出了不同的取舍。
Fable 5.1 的上下文窗口是两倍,并且明确围绕高要求的长视距推理与代理式工作而设计。
Grok 4.7 的 token 起步价格显著更低,并将可选择的推理等级与 xAI 的搜索、代码执行以及代理生态系统结合起来。
因此,正确的比较方式并不是“哪个基准数字更大?”
关键在于:模型能否准确、稳定地完成你的编码、研究或知识工作流,并且成本是合理的。
如果你想直接测试 Grok,请看我们的 如何使用 Grok 4.7 指南,涵盖主要访问方式和设置选项。
