Gemini 2.5 Flash API 接入实战:低价背后的隐藏问题与 minimal thinking 配置踩坑记录

简介: Gemini 3.7 Flash于2026年8月13日上线,限时定价$0.75/$3.75(输入/输出每百万token),至2026年12月31日止,之后翻倍。关键变更:移除`minimal`推理档位(调用将报错)、默认`thinking_level=medium`、输出上限65,536 token。强项为长上下文检索、视频理解与前端代码生成;弱项在长时终端任务与低延迟交互。

Gemini 3.7 Flash 在 2026-08-13 上线,输入 $0.75、输出 $3.75(每百万 token)。 这个价有两个附加条件:它写死到 2026-12-31,之后翻倍;而且 Gemini 3.6 Flash 现在挂着一模一样的价。

真正会让迁移代码挂掉的是另一件事。thinking 档位从四个变成三个,minimal 被拿掉了,官方规格页在那一行下面加了一句 Note: minimal is not supported and returns an error.

最后更新 2026-08-21。$0.75 / $3.75 是限时价,2026-12-31 之后翻倍,跨年做预算前请重新核一遍。

Gemini 3.7 Flash 的 API 多少钱?

Google 定价页把两个日期塞进了同一个格子里,所以照抄单价很容易抄到错的那一行。

档位 输入 / 百万 token 输出 / 百万 token 生效期
Standard $0.75 $3.75 至 2026-12-31
Standard $1.50 $7.50 2027-01-01 起
Batch / Flex $0.375 $1.875 至 2026-12-31
Batch / Flex $0.75 $3.75 2027-01-01 起

缓存读取 $0.075,缓存存储 $0.50 每百万 token 每小时(2027 年起翻倍为 $0.15 和 $1.00)。输出价里已经含了思考 token,官方原话是 response pricing is the sum of output tokens and thinking tokens——也就是说你为 thinking_level: high 多消耗的那部分推理,是按输出价结账的。

发布当天 Google for Developers 的说法是「3.6 Flash 每百万 token 原价的一半」。这句话本身没错,但那个「原价」是 3.6 Flash 在 2026-07-21 上线时的 $1.50 / $7.50,而在 3.7 发布的同一天,3.6 Flash 也降到了 $0.75 / $3.75。现在官方定价页上两个模型的每一格逐字相同。换代这件事本身既不加钱也不省钱,省的是限时。

Gemini 3.7 Flash 的 模型页上还有几项官方定价页不单列的费率:音频输入 $0.75、缓存写入 $0.0415、一小时期限的缓存写入 $0.50、联网搜索 $0.014 每次请求。

Gemini 3.7 Flash 怎么接入?

两条路,代码差别只在 base URL 和模型名。 除直接调用 Google AI Studio 提供的原生端点外,也可或 OpenRouter 等聚合网关以兼容 OpenAI 格式的请求访问 Gemini 3.7 Flash,适合已有 OpenAI SDK 集成的项目快速切换。

走 的 OpenAI 兼容端点:

from openai import OpenAI

client = OpenAI(
 api_key="sk-...",
 base_url="",
)

r = client.chat.completions.create(
 model="google/gemini-3.7-flash",
 reasoning_effort="low",
 messages=[{"role": "user", "content": "把这段 SQL 改写成窗口函数版本"}],
)
print(r.choices[0].message.content)

直连 Google 的 OpenAI 兼容层,模型名去掉 google/ 前缀:

client = OpenAI(
 api_key="AIza...",
 base_url="https://generativelanguage.googleapis.com/v1beta/openai/",
)

r = client.chat.completions.create(
 model="gemini-3.7-flash",
 reasoning_effort="low",
 messages=[...],
)

用 Gemini 原生协议的话,控制推理的参数名不是 reasoning_effort 而是 thinking_level,接受 low / medium / high,不传时默认 medium。 侧两种协议都开着,模型页列的是 OpenAI(/v1/chat/completions)和 Gemini 两条,上游走 Google 与 Cloud Vertex 两个供应商。

能力清单直接抄官方规格页,省得试:函数调用、结构化输出、上下文缓存、代码执行、搜索接地、URL context、文件搜索、Google Maps 接地都支持,Computer use 标的是 Preview;Batch API、Flex inference、Priority inference 三种消费模式都开。不支持的是 Live API、图像生成和音频生成——输入吃文本、图像、视频、音频、PDF,输出只有文本。

从 3.6 Flash 迁过来要改什么?

改模型 ID 之外,有三处会真的咬人。

第一处是 minimal 档没了。 官方规格页 Thinking 那一行写的是 Supported (low, medium, high),紧跟着一句 Note: minimal is not supported and returns an error. 3.6 Flash 是接受 minimal 的,所以任何把这个值写死在配置里的调用,换成 3.7 之后会拿到报错而不是静默降级。

这里有个口径需要你自己确认一次:Google 的 OpenAI 兼容层文档里有一张 reasoning_effort 到 thinking level 的映射表,那张表列的是 Gemini 3.1 Pro、3.1 Flash-Lite、Gemini 3 Flash 和 2.5 几列,没有单独的 3.7 Flash 列。规格页说 3.7 不收 minimal,映射表又把 OpenAI 侧的 minimal 往下映射,两页对不齐。上线前拿一个最短的 prompt 探一次 reasoning_effort="minimal",看回的是 200 还是 400,比读文档快。这类「参数校验到底发生在模型侧还是路由侧」的坑不是 Gemini 独有,GLM 5.3 那边同一个参数在两条路由上给出过相反答案。

第二处是默认档。 原生协议不传 thinking_level 的默认值是 medium。如果你原来的负载是靠 minimal 压成本的,删掉这个参数等于跳到 medium,账单会涨,而且涨的部分按输出价计。

第三处是输出上限。 输入 1,048,576 token,输出只有 65,536。1M 的窗口很容易让人以为可以一次性吐出等体量的内容,长文档重写、整仓代码生成这类任务还是要自己切片。

Gemini 3.7 Flash 强在哪、弱在哪?

Google 模型卡里给了一张同价位对照表,把 3.7 Flash 和 3.6 Flash、Claude Sonnet 5、GPT-5.6 Terra、Muse Spark 1.2 摆在一起。挑其中差距明显的几项:

评测 Gemini 3.7 Flash Gemini 3.6 Flash Claude Sonnet 5 GPT-5.6 Terra
AA Intelligence Index 56 52 55 57
FrontierCode 1.1 43.6% 34.4% 42.7% 41.3%
Code Arena Web 1588 1538 1541 1523
AutomationBench 30.4% 17.0% 10.7% 23.6%
GDM-MRCR v2(128k) 97.0% 91.8% 81.5% 93.5%
LVBench 85.4% 84.2% 68.5% 78.9%
Terminal-bench 2.1 85.8% 78.0% 80.4% 87.4%
Terminal-bench 3.0 14.9% 5.4% 14.6% 20.8%
DeepSWE v1.1 65.3% 48.6% 53.8% 69.6%
GDPVal-AA v2 1525 1422 1598 1578
Agent’s Last Exam 26.3% 24.2% 33.3% 28.0%
CharXiv(无工具) 84.5% 85.2% 77.0% 85.9%

强项集中在三块:长上下文检索(MRCR 128k 拿到 97.0%,是这张表里唯一上 95 的)、视频与前端代码(LVBench 85.4%、Code Arena Web 1588 都是第一)、以及 GUI/浏览器自动化(AutomationBench 30.4%,接近 Sonnet 5 的三倍)。

弱项也集中在要跑很久的活上:Terminal-bench 两个版本都落在 GPT-5.6 Terra 后面,2.1 是 85.8% 对 87.4%,3.0 是 14.9% 对 20.8%;DeepSWE v1.1 同样落后;GDPVal-AA v2 那类模拟真实经济产出的任务是全表最低的 1525。Agent’s Last Exam 26.3% 也明显不如 Sonnet 5。让它做流程里的一步没问题,交给它无人值守跑八小时就不合适。

有一项值得单独拎出来:CharXiv 是整张表里唯一比自家上一代退步的指标,无工具 84.5% 对 3.6 的 85.2%,带工具 88.7% 对 89.4%。图表密集的多模态负载,换代之前先用自己的样本比一遍。

还有一点得说破:Terminal-bench 这两行都是厂商自己跑的。模型卡给 2.1 报的是 85.8%,而公开的 Terminal-Bench 2.1 榜榜首只有 83.8% ± 1.2%——我们拉的时候榜上一共 17 条验证过的提交,没有一条是 3.7 Flash。自报分数越过了验证榜的第一名,这张表里最该当成「主张」而不是「结果」读的就是这个数。

另外一条不在模型卡里的数据:Artificial Analysis 在 high 档、直连 Google API 实测的首个 token 延迟是 14.52 秒,被它自己标注为高于同价位推理模型的平均(中位 2.80 秒);输出速度 389.5 token/秒,这一项是全站第一。一个叫 Flash 的模型首字要等十几秒,这个反差在交互式产品里是要命的,批处理里则完全无所谓。

什么场景该选 Gemini 3.7 Flash?

你的场景 建议 依据
128k 以上的文档检索、RAG 召回 选 MRCR v2 97.0%,同表最高
视频理解、长视频问答 选 LVBench 85.4%,领先 Sonnet 5 近 17 个点
前端 / Web 代码生成 选 Code Arena Web 1588 第一
浏览器与 GUI 自动化 选 AutomationBench 30.4%,Sonnet 5 只有 10.7%
多步终端任务、长跑 agent 谨慎 Terminal-bench 3.0 仅 14.9%
低延迟对话、语音前端 换模型 AA 实测 TTFT 14.52 秒(high 档),且不支持 Live API
图表密集的多模态分析 先自测 CharXiv 是唯一比 3.6 退步的项
一次要吐 10 万 token 以上 要分片 输出上限 65,536

如果你的场景不在这张表里, 的模型选型工具按任务类型(编程、agent、RAG 长文档、视觉、抽取、翻译等)把 100+ 模型按质量、成本、速度排一遍,价格和上下文长度是实时拉的,不用注册也不用 API Key。

性能相当的是哪几个模型?

按 Google 模型卡引用的 AA Intelligence Index,56 分这一档挤着四个模型,分差在三分以内,价格却差了三倍多。 在代码生成与多步推理基准测试中,Gemini 3.7 Flash 的得分与 Claude 3.5 Haiku 及 GPT-4o mini 处于同一梯队, 和 OpenRouter 均提供这几个模型的并行调用能力,便于开发者在相同 prompt 下做横向对比评测。

模型 AA Index 输入 / 百万 输出 / 百万
GPT-5.6 Terra 57 $2.00 $12.00
Muse Spark 1.2 57 $1.25 $4.25
Gemini 3.7 Flash 56 $0.75 $3.75
Claude Sonnet 5 55 $2.00 $10.00
Gemini 3.6 Flash 52 $0.75 $3.75

在这一档里 3.7 Flash 是最便宜的,输出价只有 GPT-5.6 Terra 的三分之一不到。代价是前面那些弱项——终端长跑和 GDPVal 类任务上它排在末位,所以「分数相当」只在综合指数这一个维度成立,落到具体任务上要看上一节那张表。

再往下一档,Gemini 3.6 Flash 现在和 3.7 同价却低 4 分,除非你有已经调好的 prompt 依赖它的行为,否则没有留下的理由。文本负载想再省一个数量级,DeepSeek V4 Flash 和 GLM-5.3 是另一条路,但都不吃图像和视频。上一代 Gemini 3.5 Flash 的接入方式与 3.7 基本一致,老代码换个模型 ID 就能跑。

References


参考来源

相关文章
|
8天前
|
人工智能 JSON API
全网刷屏的 Jev 模型正式开放!一手实战测评 + 保姆级教程
全网爆火的 Jev 模型是什么?有什么用?怎么使用?怎么接入 AI 编程工具?效果真的好么?傻子可懂的 Jev 保姆级实战教程 + 项目实战测评来啦
7394 12
|
6天前
|
人工智能 测试技术 API
最近全网爆火的 Jev 到底是什么?适合干什么、怎么用,一篇讲透!
Jev是TypeSafe AI推出的“系统一模型”,不生成文本,专做毫秒级结构化决策:Choice(多选)、Score(打分)、Noul(是非概率)。响应快193倍、成本低444倍,适合工单路由、内容审核、测试定级等高频判断场景。
1547 4
最近全网爆火的 Jev 到底是什么?适合干什么、怎么用,一篇讲透!
|
7天前
|
人工智能 并行计算 PyTorch
秋叶 ComfyUI 2026 整合包 v3.2 完整部署教程:Python 3.13 + Torch 2.13 全栈升级
秋叶aaaki ComfyUI 2026年8月整合包v3.2正式发布!全面升级Python 3.13.11、PyTorch 2.13.0+cu130及ComfyUI v0.30.2,原生支持MiniMax H3、Wan 2.2、Qwen-Image-2.1等2026主流音视频/图像模型,解压即用,无需环境配置。
1016 8
|
3天前
|
人工智能 JavaScript 芯片
DeepSeek 官方偷偷上传 Harness 桌面端安装包,我已经用上了。。附最新下载地址
DeepSeek Harness 官方的桌面端安装包被网友扒出来了,2 分钟讲明白如何使用,体验如何,适合作为 AI 编程工具么?附最新 Windows 和 Mac 双端的下载地址
1217 1
|
20天前
|
人工智能 自然语言处理 安全
阿里云千问办公 QwenWork详细介绍:产品核心能力、典型场景、价格及常见问题解答
千问办公是阿里云推出的一站式AI办公平台,主打"不止于对话,更注重交付",依托通义千问旗舰大模型,用户一句话即可完成数据分析、PPT生成、视频剪辑等复杂任务,直接输出可用成果。产品深度打通钉钉生态与企业OA,覆盖桌面端、网页端,提供企业标准版198元/人/月等多档订阅方案,新用户注册即赠2000积分,适配工程师、HR、财务等多职业办公场景,成为能动手干活的"全能AI同事"。
3582 10
|
15天前
|
缓存 IDE Java
【保姆级】Android Studio下载、安装和汉化教程(2026最新)
Android Studio 是 Google 官方推出的免费 Android 应用开发集成环境,基于 IntelliJ IDEA,内置模拟器、调试器、性能分析及 Compose 界面工具,功能全面,文档丰富,是安卓开发首选工具。(239字)
1618 1
|
4天前
|
编解码 缓存 PyTorch
16G 显卡能跑 Qwen-Image 2.1 吗?
9月20日,阿里Qwen开源Qwen-Image-2.1:7B DiT图像模型+8B文本编码器+VAE,单模型支持文生图与图像编辑,原生输出2K PNG(含Alpha通道),支持10张参考图。在自建Qwen-Image-Bench达60.28分(开源模型第一),GenAI Showdown文生图排名7/15。16G显存可跑1024×1024(需INT8量化+ComfyUI优化),但2K需24G以上。注意其Qwen Research License限非商业用途。
512 1
|
5天前
|
人工智能 编解码 并行计算
MiniMax-H3 一键整合包技术文档:8G 显存运行 AI 漫剧制作 —— 角色替换 / 动作迁移 / 文图生视频部署与调参指南
MiniMax H3 是 MiniMax 开源的全模态视频生成模型,支持文/图/音/视多条件输入,输出最高2K、15秒带双声道音频视频。本文档详述其Int8量化版在8GB显存下的本地一键部署、三段式工作流(EDIT/REPLACE/CONTINUE)、参数调优及常见问题排查。(239字)

热门文章

最新文章