跳到主内容
星链API

GLM-5.3-Flash 定价全解:标准价、缓存与单任务成本

人工智能5,319
GLM-5.3-Flash 定价全解:标准价、缓存与单任务成本

2026 年 8 月 26 日,智谱以 ox-alpha 为匿名代号预热数周后,正式发布了 GLM-5.3-Flash。这是一款 320B 总参数、18B 激活参数的 MoE 原生多模态模型,支持 1M 上下文窗口和 128K 最大输出,权重以 MIT 许可证开放。发布后不久,它在 OpenRouter 的调用量迅速攀升至首位。推动这一结果的因素中,价格结构占据相当权重 —— 但这个结构比大多数定价页呈现的更为复杂。

一、两个价格口径:人民币与美元并非简单换算

智谱国内开放文档和海外定价页列出的费率,是两套并行的计价体系。

国内 API 文档显示,GLM-5.3-Flash 的标准费率为输入 0.8 元 / 百万 Tokens、输出 2.8 元 / 百万 Tokens、缓存命中 0.23 元 / 百万 Tokens,缓存存储限时免费。海外页面的美元标价则是输入 $0.15、缓存输入 $0.03、输出 $0.50。

这两套价格在设计上保持了对齐关系,但不应直接按汇率互算来验证。对于国内开发者,以人民币文档为准做预算更稳妥;对于使用海外 provider 的团队,以美元标价为准。

智谱官方在发布资料中明确了一个比例关系:GLM-5.3-Flash 的定价是旗舰版 GLM-5.3 的十分之一,仅为 Claude Opus 4.8 的四十分之一。同一张官方价目表中,GLM-5.3 的标准费率为输入 $1.40、缓存输入 $0.26、输出 $4.40。Flash 的输入和输出价格都低了约 89%,性价比优势极为突出。

二、模型标准计费明细

目前全网统一执行官方标准定价,不同第三方网关、服务商的定价基本对齐官方基准,仅存在渠道倍率差异,无通用限时促销活动。

表格

计费项目海外标准价国内人民币价
新输入 / 1M tokens$0.150.8 元
缓存输入 / 1M tokens$0.030.23 元
输出 / 1M tokens$0.502.8 元
缓存存储限时免费限时免费

三、缓存定价:长上下文任务的成本杠杆

缓存输入 $0.03 / 1M tokens,是新鲜输入的 5 倍便宜。在 1M 上下文窗口的模型上,这个差值决定了长文档分析类任务的成本量级。

缓存的经济性取决于一个变量:稳定前缀的复用率。以标准价计算一个典型的长文档分类场景:1000 万新输入 token 加 200 万输出 token,费用为 $2.50(输入 $1.50 + 输出 $1.00)。如果其中 700 万 token 命中缓存,输入费用降至 $1.14(新输入 $0.45 + 缓存 $0.21),加上输出 $1.00,合计 $2.19。缓存节省约 12%。

输出量越大,缓存节省的占比越低。但对于输出量极小的分类和标签任务,缓存的影响会被显著放大。缓存存储限时免费这一点也值得利用 —— 它降低了评估缓存策略的启动门槛。

四、单任务成本:比单价更有参考价值

Artificial Analysis 不以 token 单价衡量模型成本,而是以完成一个 Intelligence Index 任务的实际花费计。GLM-5.3-Flash 的单任务成本约为 $0.09,而其旗舰版 GLM-5.3 为 $0.68,差距约 7.5 倍。在 Intelligence Index 上评测 GLM-5.3-Flash 的总成本为 $280.28,生成 180M token,属于 “回答非常冗长” 的档位。

真正需要区分的是 “标价低” 和 “单任务成本低” 这两个概念。Claude Opus 4.8 的输出单价是 GLM-5.3-Flash 的数十倍,但如果一个任务 Opus 一次完成、Flash 需要三次重试,结论可能反转。不过 Flash 在可编程验证的任务上,一次通过率有数据支撑:Terminal-Bench 2.1 得分 84.3(Claude Opus 4.8 为 85.0),DeepSWE v1.1 得分 63.4(前代 GLM-5.2 为 46.2)。这意味着即使偶尔需要重试,每次重试的边际成本也极低。

五、同档模型成本对比

表格

模型输入 / 1M输出 / 1M缓存命中 / 1MAA 单任务成本
GLM-5.3-Flash(标准价)$0.15$0.50$0.03~$0.09
GLM-5.3(旗舰版)$1.40$4.40$0.26~$0.68
DeepSeek V4 Flash$0.14$0.28$0.028
Gemini 3.7 Flash$0.75$3.75$0.08

DeepSeek V4 Flash 的官方费率是 $0.14 输入 / $0.28 输出,缓存命中 $0.028。它的输出价低于 GLM 的标准价,但缓存命中价略低。Gemini 3.7 Flash 的推广期费率为 $0.75 输入 / $3.75 输出,将于 2026 年 12 月 31 日到期,之后恢复至 $1.50 / $7.50。

“谁更便宜” 取决于三个变量:调用时段、缓存命中率、输出占比。对于输出量大的 agent 任务,GLM 的优势在输出行;对于输出量小的分类任务,DeepSeek 的缓存优势会主导成本。在说清楚这三件事之前,比较没有意义。

六、接入时的成本管理实践

在决定将 GLM-5.3-Flash 纳入生产路由之前,有几个变量需要先明确。

定价基准:统一以官方标准标价作为预算核算基准,第三方渠道仅存在倍率浮动,无通用限时折扣,可稳定规划长期成本。

Provider 选择。 同一模型在不同网关的费率可能存在差异。对于需要同时管理多个候选模型的团队,星链 API 的接入与计费规则可归纳为下表:

表格

维度规则对成本的影响
基础汇率1:1 人民币官方 1 元对应平台 1 元额度
分组倍率0.8 倍率官方 1 元扣 0.8 元
分组倍率0.7 倍率官方 1 元扣 0.7 元
接入方式改一行 BaseURL100% 兼容 OpenAI SDK,无需重写代码
上线时间约 3 分钟减少迁移与调试开销
调用日志同一面板对比延迟与 token便于成本归因
适用模型GLM-5.3-Flash、DeepSeek V4、Gemini 等同一端点切换,只改 model 参数

具体分组倍率以控制台实时公示为准。对于 GLM-5.3-Flash 这类标准价本身较低的模型,低倍率分组的边际节省仍然可观。星链 API 的接入教程见 https://xinglianapi.apifox.cn/,其中覆盖了密钥获取、模型列表查询和最小请求示例。

缓存命中率。 用真实任务测一次命中率。如果稳定前缀不足 30%,缓存策略的收益有限;如果超过 70%,缓存节省可以显著改变长上下文任务的成本结构。

输出占比。 输出 token 占总支出的比例决定了价格敏感度。输出占比高的任务,GLM 的 $0.50 输出价相对 DeepSeek 有优势;输出占比低的任务,缓存价差的影响更大。

七、自托管:低 token 单价不等于低托管成本

GLM-5.3-Flash 以 MIT 许可证开放权重,完整 checkpoint 约 328 GB(FP8 safetensors,62 个分片)。从理论上看,自托管可以绕过 API 调用费。但需要区分 “18B 激活参数” 和 “总内存占用”—— 激活参数是每次推理实际参与计算的专家数量,KV cache、多模态处理模块和运行时开销仍然需要持续预留。

自托管的成本结构是固定成本加变动成本。API 模式下,空闲时不产生费用;自托管模式下,推理容量需要 24 小时预留,即使没有请求。对于流量有波峰波谷的团队,API 的按量计费通常更经济。对于调用量稳定且规模足够大的场景,自托管的边际成本优势才会显现。

GLM-5.3-Flash 的定价在轻量模型市场里建立了一个新的参照点:单任务成本可以低于 $0.10,同时 Terminal-Bench 得分逼近 Claude Opus 4.8。但低单价的可持续性取决于模型官方定价调整、通道倍率以及缓存策略是否被有效利用。把标价、缓存和 provider 价差分开记录,才是一个可复查的成本模型。用真实任务跑一轮单任务成本对比,比看任何定价页都更有决策价值。

了解更多: https://xinglianapi.com/

GLM-5.3-Flash价格分析开发者指南API成本智谱AI星链apiDeepSeek

Related

相关文章推荐