Gemini 3.8 Flash 发布:更强的编程、AI Agent 与推理能力

gemini-3-8-flash

Google 正在加快 Gemini 的更新节奏。

9 月 2 日,Google 正式发布了 Gemini 3.8 Flash,距离 Gemini 3.7 Flash 推出仅过去三周。

这并不是一次简单的小版本更新。

Google 正在进一步强化 Gemini 3.8 Flash 在 长周期编程、自主 AI Agent、复杂推理和企业工作流 等场景中的能力,同时尽可能保留 Flash 系列一直以来在速度和成本方面的优势。

那么,Gemini 3.8 Flash 到底有哪些变化?值得用吗?

什么是 Gemini 3.8 Flash?

Gemini 3.8 Flash 是 Google 最新推出的通用型 Flash 模型。

它主要面向以下场景:

  • 软件工程
  • AI Agent
  • 多步骤推理
  • 知识工作
  • 多模态理解
  • 大规模 AI 应用

该模型支持 文本、图片、视频、音频和 PDF 作为输入。

同时,它支持 1,048,576 Token 的输入上下文窗口,最大输出长度可达 65,536 Token,因此比较适合大型代码库、长文档,以及需要在上下文中保留大量信息的复杂工作流。

Google 还提供低、中、高三档思考等级,让开发者可以根据实际需求,在推理质量、响应速度和成本之间进行调整。

Gemini 3.8 Flash 有哪些新变化?

如果用一句话概括这次升级:

Gemini 3.8 Flash 更愿意花时间处理复杂任务了。

面对复杂请求时,模型可以执行更多推理步骤,多次调用工具,检查当前任务进度,并根据结果继续调整答案,而不是急着给出一个结果。

对于无法通过一次 Prompt 完成的任务,这一点尤其重要。

更强的长周期编程能力

编程是 Gemini 3.8 Flash 本次升级最明显的方向之一。

Google 特别提到了 DeepSWE v1.1。这是一个专门测试真实、长周期软件工程任务的 Benchmark,而不是简单测试模型生成几段代码的能力。

根据 DataCurve 当前的排行榜,Gemini 3.8 Flash 在 High Effort 模式下,任务完成率约为 74%,平均每个任务的成本约为 2.36 美元

gemini-3-8-flash-cost-per-task
Gemini 3.8 Flash 在 DeepSWE V1.1 中兼顾了较高的任务表现和相对较低的单任务成本。来源:DataCurve AI。

它的成本与性能表现尤其值得关注。

Claude Opus 5 在当前排行榜中的成绩同样约为 74%,但平均每个任务成本约为 11.84 美元。GPT-5.6 Sol 的成绩约为 73%,平均成本约为 6.46 美元。

这并不意味着 Gemini 在所有编程场景下都会更便宜,但这些数据可以解释为什么 Google 正在将 Gemini 3.8 Flash 定位为适合大规模 Agent 编程的模型。

真实的软件开发,很少只是生成一个独立函数这么简单。

一个 AI 编程 Agent 可能需要:

  1. 检查已有代码仓库
  2. 理解项目依赖
  3. 修改多个文件
  4. 运行测试
  5. 找出失败原因
  6. 修改代码
  7. 确认最终结果能够正常运行

Gemini 3.8 Flash 正在针对这类更长、更复杂的工作流进行优化。

更强的 AI Agent 能力

同样的升级也体现在 AI Agent 上。

一个真正实用的 Agent,不能只正确回答一个问题。

它可能需要搜索信息、读取文件、调用 API、执行代码、比较不同结果,并在几十个操作步骤之后,依然记得最开始的任务目标。

Google 将 Gemini 3.8 Flash 描述为一款面向 自主 Agent 和复杂企业工作流 的模型。

它支持的工具包括:

  • Function Calling
  • 代码执行
  • 文件搜索
  • Google Search Grounding
  • URL Context
  • Computer Use(预览版)

这让 Gemini 3.8 Flash 更适合那些需要 AI 真正完成任务,而不仅仅是生成文本的工作流。

更强的多步骤推理能力

推理能力也是 Gemini 3.8 Flash 本次升级的重要部分。

在专门测试跨学科专家级推理能力的 HLE-Verified Benchmark 中,Gemini 3.8 Flash 获得了 54.9% 的成绩。

在 Google 公布的对比数据中,它略高于多款前沿模型:

  • Gemini 3.8 Flash:54.9%
  • GPT-5.6 Sol:54.5%
  • Claude Opus 5:54.4%
  • Gemini 3.7 Flash:53.6%
  • GPT-5.6 Terra:51.1%
  • Claude Sonnet 5:31.0%

gemini-3-8-hle-verified
Gemini 3.8 Flash 在 HLE-Verified 中获得 54.9% 的成绩,略高于 Gemini 3.7 Flash 和多款更大型的前沿模型。来源:Google DeepMind。

单独来看,从 53.6% 提升到 54.9%,差距可能并不算特别明显。

更值得注意的是,Google 正在一款以低延迟和大规模部署为目标的 Flash 模型上,实现这种级别的推理能力。

因此,Gemini 3.8 Flash 在研究、分析、金融、法律等需要连续执行多个推理步骤的场景中,也变得更有吸引力。

Gemini 3.8 Flash vs Gemini 3.7 Flash

如果只是处理简单问题,Gemini 3.7 和 3.8 之间的差异可能并不会特别明显。

任务越长、越复杂,升级带来的变化才越容易体现出来。

功能 Gemini 3.7 Flash Gemini 3.8 Flash
日常问答
长周期编程 更强
AI Agent 支持 持续执行能力更强
复杂推理 更强
工具调用 支持 更偏向 Agent 工作流
上下文窗口 1M 1M
最大输出 64K 64K
更适合 优先追求速度的任务 复杂 Agent 工作流

Google 的 Model Card 同样提到了一个比较重要的取舍。

在更高 Effort 等级下,为了获得更好的任务表现,Gemini 3.8 Flash 有时可能会消耗更多 Token。

因此,对于所有简单任务来说,3.8 并不一定都是更好的选择。

如果你的主要目标是在简单请求中尽可能减少 Token 消耗,那么较早的 Flash 模型依然可能更合适。

Gemini 3.8 Flash 价格是多少?

Gemini 3.8 Flash 上线时采用了和 Gemini 3.7 Flash 相同的 API 首发价格:

  • 输入: 每 100 万 Token 0.75 美元
  • 输出: 每 100 万 Token 3.75 美元

不过,每 Token 的价格只是整体成本的一部分。

因为 Gemini 3.8 Flash 在处理复杂任务时,可能会进行额外推理并调用更多工具,因此一个复杂任务消耗的 Token,可能比低 Effort 模型更多。

所以更值得关注的问题并不是:

哪个模型的 Token 单价最低?

而是:

成功完成整个任务到底需要多少钱?

DeepSWE 的测试结果在这方面很有参考价值,因为它比较的是实际任务表现与平均任务成本,而不仅仅是 API 单价。

此外,还有一次即将到来的价格调整需要注意。

Google 表示,目前的首发价格将在 2026 年 12 月 31 日到期。

从 2027 年 1 月 1 日开始,计划调整为:

  • 输入: 每 100 万 Token 1.50 美元
  • 输出: 每 100 万 Token 7.50 美元

对于计划进行大规模部署的开发者来说,这一点需要提前纳入长期成本计算。

什么是 Gemini 3.8 Flash Cyber?

除了 Gemini 3.8 Flash,Google 还同步推出了另一个模型:Gemini 3.8 Flash Cyber

这是一个专门针对网络安全场景设计的模型,主要面向:

  • 漏洞发现
  • 漏洞研究
  • 代码安全
  • 自动修复漏洞

与标准版 Flash 不同,目前 Gemini 3.8 Flash Cyber 仅通过 Google 的 Fairwind Program 向经过审批的可信安全防御人员开放。

它在 CyberGym 上的测试结果尤其值得关注。

在测试 C/C++ 代码自主漏洞发现能力的 CyberGym Pass@1 中,Gemini 3.8 Flash Cyber 获得了 86.2% 的成绩。

其他模型的成绩分别为:

  • Gemini 3.8 Flash Cyber:86.2%
  • GPT-5.5-Cyber:85.6%
  • Mythos 5:83.8%
  • GPT-5.6 Sol:83.6%
  • Gemini 3.5 Flash Cyber:77.5%

gemini-3-8-flash-cyber
Gemini 3.8 Flash Cyber 在测试自主漏洞发现能力的 CyberGym Pass@1 中获得 86.2% 的成绩。来源:Google DeepMind。

从 Gemini 3.5 Flash Cyber 的 77.5% 提升到 Gemini 3.8 Flash Cyber 的 86.2%,提升幅度相当明显。

Google 还在内部针对覆盖 20 种编程语言 的复杂代码库进行了测试,该模型的漏洞发现成功率超过 70%。

Cyber 版本并不是普通 Gemini 3.8 Flash 中的一个“安全模式”。

它是一款独立的专业模型,拥有更加开放的网络安全能力,同时也采用了更加严格的访问控制。

对于普通用户来说,更值得关注的是,网络安全训练似乎也在推动 Gemini 3.8 这一代模型整体编程和推理能力的提升。

Google 表示,这两个版本背后使用的是相同的基础智能能力。

在哪里可以使用 Gemini 3.8 Flash?

Gemini 3.8 Flash 目前已经正式开放使用。

开发者可以通过以下平台使用:

  • Gemini API
  • Google AI Studio
  • Google Antigravity
  • Android Studio

企业用户可以通过 Gemini Enterprise 使用该模型。

Google AI Pro 和 Ultra 订阅用户也可以在包括 Gemini App 和 Google Search AI Mode 在内的产品中使用 Gemini 3.8 Flash。

对于 API 用户,模型 ID 为:

gemini-3.8-flash

想自己试试看?你也可以直接在 iWeaver 免费体验 Gemini 3.8 Flash,看看它处理文档、研究资料以及日常 AI 任务时的实际表现。

谁适合尝试 Gemini 3.8 Flash?

如果你的工作涉及以下场景,Gemini 3.8 Flash 会比较值得尝试:

  • 处理大型代码仓库
  • 自主编程 Agent
  • 多步骤研究
  • 大型文档
  • 复杂分析
  • 大量工具调用的 AI 工作流
  • 多模态输入
  • 企业自动化

如果你主要使用 AI 做一些短文本改写、翻译或者简单问答,那么从 Gemini 3.7 Flash 升级到 3.8 后,体感差异可能不会特别大。

但对于耗时更长、步骤更多的任务来说,Gemini 3.8 Flash 就有意思得多。

这次升级的重点并不只是让模型第一次回答得更好。

而是让它变得更擅长 持续处理一个复杂任务,直到真正把事情做完

研究和知识工作场景怎么样?

一个强大的模型,只是完整 AI 工作流中的一部分。

如果你的工作主要从 PDF、研究论文、报告、网页、视频或大量资料 开始,像 iWeaver 这样的工具可以先帮你整理这些信息,再进行更深入的分析。

你不需要反复把相同的资料上传到不同的聊天窗口。

可以先把这些内容整理成摘要、结构化笔记、思维导图以及可重复利用的知识,然后继续在这个基础上完成后续工作。

如果你更关注开放式头脑风暴、故事创作、角色扮演,或者希望 AI 对话过程中减少不必要的打断,XPT 则采用了另一种思路,更强调灵活、开放的 AI 对话体验。

随着模型能力越来越强,问题已经不再只是“找一个什么都能做的 AI”。更重要的是,根据不同任务,选择合适的模型和工作流。

Gemini 3.8 Flash 值得用吗?

如果是编程和 AI Agent 场景,值得。Gemini 3.8 Flash 可以说是 Google 近几次 Flash 更新中比较值得关注的一次。

三个 Benchmark 基本传递出了相同的趋势:

  • DeepSWE 表明,它在长周期软件工程任务中的表现更强,同时单任务成本保持在较有竞争力的水平。
  • HLE-Verified 表明,Flash 级别模型在专家推理任务中的表现,正在逐渐接近更大型的前沿模型。
  • Gemini 3.8 Flash Cyber 则展示了这一代模型在专业编程和网络安全任务上的进步。

当然,Benchmark 永远不能完全代表真实使用体验。

Gemini 3.8 Flash 依然存在一些常见问题,例如幻觉、偶尔响应变慢,以及在更高推理等级下可能消耗更多 Token。但它的发展方向已经非常清楚。Flash 已经不再只是 Google 产品线中“速度快、模型轻”的选择。随着 Gemini 3.8 Flash 推出,它正逐渐变成一个真正面向 大规模、多步骤实际任务 的模型。