GLM-5.3-Flash 定价全解:标准价、缓存与单任务成本

2026 年 8 月 26 日,智谱以 ox-alpha 为匿名代号预热数周后,正式发布了 GLM-5.3-Flash。这是一款 320B 总参数、18B 激活参数的 MoE 原生多模态模型,支持 1M 上下文窗口和 128K 最大输出,权重以 MIT 许可证开放。发布后不久,它在 OpenRouter 的调用量迅速攀升至首位。推动这一结果的因素中,价格结构占据相当权重 —— 但这个结构比大多数定价页呈现的更为复杂。
一、两个价格口径:人民币与美元并非简单换算
智谱国内开放文档和海外定价页列出的费率,是两套并行的计价体系。
国内 API 文档显示,GLM-5.3-Flash 的标准费率为输入 0.8 元 / 百万 Tokens、输出 2.8 元 / 百万 Tokens、缓存命中 0.23 元 / 百万 Tokens,缓存存储限时免费。海外页面的美元标价则是输入 $0.15、缓存输入 $0.03、输出 $0.50。
这两套价格在设计上保持了对齐关系,但不应直接按汇率互算来验证。对于国内开发者,以人民币文档为准做预算更稳妥;对于使用海外 provider 的团队,以美元标价为准。
智谱官方在发布资料中明确了一个比例关系:GLM-5.3-Flash 的定价是旗舰版 GLM-5.3 的十分之一,仅为 Claude Opus 4.8 的四十分之一。同一张官方价目表中,GLM-5.3 的标准费率为输入 $1.40、缓存输入 $0.26、输出 $4.40。Flash 的输入和输出价格都低了约 89%,性价比优势极为突出。
二、模型标准计费明细
目前全网统一执行官方标准定价,不同第三方网关、服务商的定价基本对齐官方基准,仅存在渠道倍率差异,无通用限时促销活动。
表格
| 计费项目 | 海外标准价 | 国内人民币价 |
|---|---|---|
| 新输入 / 1M tokens | $0.15 | 0.8 元 |
| 缓存输入 / 1M tokens | $0.03 | 0.23 元 |
| 输出 / 1M tokens | $0.50 | 2.8 元 |
| 缓存存储 | 限时免费 | 限时免费 |
三、缓存定价:长上下文任务的成本杠杆
缓存输入 $0.03 / 1M tokens,是新鲜输入的 5 倍便宜。在 1M 上下文窗口的模型上,这个差值决定了长文档分析类任务的成本量级。
缓存的经济性取决于一个变量:稳定前缀的复用率。以标准价计算一个典型的长文档分类场景:1000 万新输入 token 加 200 万输出 token,费用为 $2.50(输入 $1.50 + 输出 $1.00)。如果其中 700 万 token 命中缓存,输入费用降至 $1.14(新输入 $0.45 + 缓存 $0.21),加上输出 $1.00,合计 $2.19。缓存节省约 12%。
输出量越大,缓存节省的占比越低。但对于输出量极小的分类和标签任务,缓存的影响会被显著放大。缓存存储限时免费这一点也值得利用 —— 它降低了评估缓存策略的启动门槛。
四、单任务成本:比单价更有参考价值
Artificial Analysis 不以 token 单价衡量模型成本,而是以完成一个 Intelligence Index 任务的实际花费计。GLM-5.3-Flash 的单任务成本约为 $0.09,而其旗舰版 GLM-5.3 为 $0.68,差距约 7.5 倍。在 Intelligence Index 上评测 GLM-5.3-Flash 的总成本为 $280.28,生成 180M token,属于 “回答非常冗长” 的档位。
真正需要区分的是 “标价低” 和 “单任务成本低” 这两个概念。Claude Opus 4.8 的输出单价是 GLM-5.3-Flash 的数十倍,但如果一个任务 Opus 一次完成、Flash 需要三次重试,结论可能反转。不过 Flash 在可编程验证的任务上,一次通过率有数据支撑:Terminal-Bench 2.1 得分 84.3(Claude Opus 4.8 为 85.0),DeepSWE v1.1 得分 63.4(前代 GLM-5.2 为 46.2)。这意味着即使偶尔需要重试,每次重试的边际成本也极低。
五、同档模型成本对比
表格
| 模型 | 输入 / 1M | 输出 / 1M | 缓存命中 / 1M | AA 单任务成本 |
|---|---|---|---|---|
| GLM-5.3-Flash(标准价) | $0.15 | $0.50 | $0.03 | ~$0.09 |
| GLM-5.3(旗舰版) | $1.40 | $4.40 | $0.26 | ~$0.68 |
| DeepSeek V4 Flash | $0.14 | $0.28 | $0.028 | — |
| Gemini 3.7 Flash | $0.75 | $3.75 | $0.08 | — |
DeepSeek V4 Flash 的官方费率是 $0.14 输入 / $0.28 输出,缓存命中 $0.028。它的输出价低于 GLM 的标准价,但缓存命中价略低。Gemini 3.7 Flash 的推广期费率为 $0.75 输入 / $3.75 输出,将于 2026 年 12 月 31 日到期,之后恢复至 $1.50 / $7.50。
“谁更便宜” 取决于三个变量:调用时段、缓存命中率、输出占比。对于输出量大的 agent 任务,GLM 的优势在输出行;对于输出量小的分类任务,DeepSeek 的缓存优势会主导成本。在说清楚这三件事之前,比较没有意义。
六、接入时的成本管理实践
在决定将 GLM-5.3-Flash 纳入生产路由之前,有几个变量需要先明确。
定价基准:统一以官方标准标价作为预算核算基准,第三方渠道仅存在倍率浮动,无通用限时折扣,可稳定规划长期成本。
Provider 选择。 同一模型在不同网关的费率可能存在差异。对于需要同时管理多个候选模型的团队,星链 API 的接入与计费规则可归纳为下表:
表格
| 维度 | 规则 | 对成本的影响 |
|---|---|---|
| 基础汇率 | 1:1 人民币官方 1 元对应平台 1 元额度 | |
| 分组倍率 | 0.8 倍率 | 官方 1 元扣 0.8 元 |
| 分组倍率 | 0.7 倍率 | 官方 1 元扣 0.7 元 |
| 接入方式 | 改一行 BaseURL | 100% 兼容 OpenAI SDK,无需重写代码 |
| 上线时间 | 约 3 分钟 | 减少迁移与调试开销 |
| 调用日志 | 同一面板对比延迟与 token | 便于成本归因 |
| 适用模型 | GLM-5.3-Flash、DeepSeek V4、Gemini 等 | 同一端点切换,只改 model 参数 |
具体分组倍率以控制台实时公示为准。对于 GLM-5.3-Flash 这类标准价本身较低的模型,低倍率分组的边际节省仍然可观。星链 API 的接入教程见 https://xinglianapi.apifox.cn/,其中覆盖了密钥获取、模型列表查询和最小请求示例。
缓存命中率。 用真实任务测一次命中率。如果稳定前缀不足 30%,缓存策略的收益有限;如果超过 70%,缓存节省可以显著改变长上下文任务的成本结构。
输出占比。 输出 token 占总支出的比例决定了价格敏感度。输出占比高的任务,GLM 的 $0.50 输出价相对 DeepSeek 有优势;输出占比低的任务,缓存价差的影响更大。
七、自托管:低 token 单价不等于低托管成本
GLM-5.3-Flash 以 MIT 许可证开放权重,完整 checkpoint 约 328 GB(FP8 safetensors,62 个分片)。从理论上看,自托管可以绕过 API 调用费。但需要区分 “18B 激活参数” 和 “总内存占用”—— 激活参数是每次推理实际参与计算的专家数量,KV cache、多模态处理模块和运行时开销仍然需要持续预留。
自托管的成本结构是固定成本加变动成本。API 模式下,空闲时不产生费用;自托管模式下,推理容量需要 24 小时预留,即使没有请求。对于流量有波峰波谷的团队,API 的按量计费通常更经济。对于调用量稳定且规模足够大的场景,自托管的边际成本优势才会显现。
GLM-5.3-Flash 的定价在轻量模型市场里建立了一个新的参照点:单任务成本可以低于 $0.10,同时 Terminal-Bench 得分逼近 Claude Opus 4.8。但低单价的可持续性取决于模型官方定价调整、通道倍率以及缓存策略是否被有效利用。把标价、缓存和 provider 价差分开记录,才是一个可复查的成本模型。用真实任务跑一轮单任务成本对比,比看任何定价页都更有决策价值。
了解更多: https://xinglianapi.com/
Related
相关文章推荐

Kimi K3 使用指南:从 KDA 架构到 API 接入
Kimi K3 接入教程:解析 KDA 架构、推理强度三档调节、缓存成本与多模型路由,附星链API 统一入口实践,帮开发者降低长上下文调用成本。

Pi接入自建模型全攻略:从配置规范到版本校验的完整路径
开发者必读!本文详解Pi接入自建模型(Ollama/vLLM)的完整流程,涵盖models.json配置、API密钥管理及DeepSeek/Kimi等模型的参数校验与版本对齐。

Kimi K3 KVV测评:预检不过,基准白跑
Kimi K3 KVV测评先预检API契约,再跑OCRBench等基准。附预检失败报告与命令。

MiniMax H3 API中转服务怎么选?统一API网关接入实践
解析MiniMax H3 API接入方式,从官方调用到API中转服务选型,介绍统一API网关如何管理多模型调用。