在 DigitalOcean Serverless Inference 上于 2026 年 8 月测量。
我们询问 GLM-5.3-Flash SSH 默认使用的端口。它花费了 625 个输出 token 得到 “22”。
这是五次运行的中位数,而非挑选的异常值。Qwen3.8-Max 回答同一问题仅用了 156 个 token。我们在 Flash 调用上支付的大部分费用都用于我们未看到的推理过程,而问题答案只有两个字符。
事实证明,只需一行修复。在请求中添加 reasoning_effort: "low",同样的问题只需 155 个 token。GLM-5.3-Flash 默认使用其最大思考预算,而请求中没有任何信息表明这一点。仅发送一个参数就使 Flash 在整个提示集上变得 6.3x 更便宜。
这一点很重要,因为您是按 token 计费的,而定价页面未说明模型通常会消耗多少 token。GLM-5.3-Flash 的标价为 Qwen3.8-Max’s 输出价的十二分之一,以及 Kimi K3’s 的三十分之一。我们在 DigitalOcean Serverless Inference 上测量了 2,700 次 API 调用,以了解在实际请求实际计费时这些比率的表现。
在默认情况下,Flash 相较于 Qwen 的优势为 2.3x,而非 12x。显式配置后,这一优势提升至 14.5x — — Kimi K3 甚至达到 106x。这些数字之间的差距仅在于一个参数,而本文其余部分将围绕寻找该参数展开,包括我们最初走错的路径。
本研究的总花费为 14.75 美元。以下内容均可从 the repository 复现 — — 包括提示词、测试 harness、原始日志以及重新生成所有图表的脚本。
GLM-5.3-Flash 是什么:320B 参数,18B 活跃,MIT 许可证

GLM-5.3-Flash 是 Z.ai GLM-5 系列中首个原生多模态模型,采用 MIT 许可证发布。它不是 GLM-5.2 的后训练更新。它从一个全新训练的基础模型出发,架构和训练配方围绕效率进行了重建。
The headline architectural number is the one that matters for cost: 320B total parameters with just 18B active per token. Z.ai 报告称,在基准测试中其性能优于 GLM-5.2,而价格仅十分之一;在编码和代理任务上,它接近 Claude Opus 4.8 —— 在 Terminal-Bench 2.1 上得分 84.3,在 DeepSWE 上得分 63.4。
两项架构变革是关键。第一是一种结合稀疏注意力和线性注意力的混合注意力设计,这是 GLM 系列首次采用,专门用于降低长上下文服务成本,同时保持长上下文能力不变。第二是流形约束超连接(Manifold-Constrained Hyper-Connections),Z.ai 使用它来提升缩放效率。两者均建立在 30T 令牌的多模态预训练语料库之上。
与 DigitalOcean 上其他最近发布的开放权重模型(Serverless Inference)相比,使其有趣的在于其计算特性。Qwen3.8-Max 是一个具有 2.4T 参数、每 token 活跃参数 95B 的模型。Kimi K3 规模更大。Flash 激活的参数为 18B —— 大约是 Qwen 活跃参数的五分之一,远低于 Kimi 的比例 —— 在 Artificial Analysis 的 Intelligence Index 上,其得分实际上与 Kimi K3 Max 相当。
这就是它的卖点:以极低的每 token 计算成本获得接近前沿的能力,这也是 DigitalOcean 能够以每百万输入 token 0.15 美元的价格提供服务,而 Kimi 的价格为 3.00 美元。
这是一个真实的卖点,其背后的基准数字均来自 Z.ai 自身的测试。鲜有厂商公布模型达到答案所消耗的 token 数量,而这正是其优势所在的重要部分。
我们在 DigitalOcean Serverless Inference 上如何测量成本
在 DigitalOcean Serverless Inference 上有三个开放权重模型可用:glm-5.3-flash、qwen3.8-max 和 kimi-k3。它们在 DigitalOcean 的费率(每百万 token):
| 模型 | 输入 | 输出 | 缓存输入 |
|---|---|---|---|
| glm-5.3-flash | $0.15 | $0.50 | $0.03 |
| qwen3.8-max | $2.00 | $6.00 | $0.20 |
| kimi-k3 | $3.00 | $15.00 | $0.30 |
有两组提示。第一组包含 24 个开放式问题,分为三个难度层次:类似 SSH 查找那样的简单查找、类似批处理如何在不降低每请求延迟的情况下提高吞吐量的中等分析问题,以及在固定预算下选择部署拓扑这样的硬多约束问题。没有格式说明,没有系统提示,也没有采样参数。第二组是 20 个具有确定性答案的任务,用于检查更低的输出成本是否会以正确性为代价。
每个提示对每个模型运行了五次,顺序随机化。
在呈现数字之前的一个说明:Artificial Analysis 将 Kimi K3 和 GLM-5.3-Flash 在其智能指数上均评为 57 分。这两个模型在同一独立复合指标上得分相同,但在输入价格上相差 20 倍,在输出价格上相差 30 倍。这是他人的测量结果,我们未进行验证。但这意味着有趣的问题不在于哪个模型更智能,而在于每个模型回答问题的成本。
GLM-5.3-Flash 在实践中比 Qwen3.8-Max 便宜 2.3 倍,而不是 12 倍
| 模型 | 列出输出价格 | 每请求测量成本 | 纸面比率 | 测量比率 |
|---|---|---|---|---|
| glm-5.3-flash | $0.50 / 1M | $0.00156 | 1x | 1x |
| qwen3.8-max | $6.00 / 1M | $0.00361 | 12x | 2.31x |
| kimi-k3 | $15.00 / 1M | $0.02661 | 30x | 17.01x |
Flash 明显胜出。差距不小。但如果你按照 Qwen 的每 token 价格除以十二来制定基础设施预算,你就会偏离超过五倍,而且是不利的方向。
Kimi 的溢价衰减较小:理论上 30 倍,实际为 17 倍。Qwen 的衰减更大:理论上 12 倍,实际降至 2.3 倍。这种不对称是线索,指向输出长度。
为什么:GLM-5.3-Flash 输出的 token 比 Qwen3.8-Max 多 4 倍

在相同提示下,未给任何模型格式化指令,中位数输出 token 如下:
| 模型 | 第 1 层(简单) | 第 2 层(中等) | 第 3 层(困难) |
|---|---|---|---|
| glm-5.3-flash | 625 | 3,141 | 5,018 |
| qwen3.8-max | 156 | 645 | 886 |
| kimi-k3 | 456 | 2,006 | 1,961 |
Flash 在简单问题上的输出 token 比 Qwen 多 4.0 倍,在困难问题上多 5.7 倍。这已经说明了大部分情况。一个每 token 便宜 12 倍却使用 5 倍更多 token 的模型,并不一定便宜 12 倍。
这些 token 去了哪里?Flash 和 Kimi 都在独立的 reasoning_content 字段中暴露了它们的思考过程,因此我们可以直接计算。用于推理的计费输出 token 的中位数占比:
| 模型 | 第 1 层 | 第 2 层 | 第 3 层 |
|---|---|---|---|
| glm-5.3-flash | 0.72 | 0.81 | 0.84 |
| kimi-k3 | 0.65 | 0.77 | 0.82 |
| qwen3.8-max | 默认关闭思考 |
输出账单中有三分之二到五分之三的内容是用户永远看不到的文本。Flash 在三个模型中,第 1 层和第 2 层的占比最高,且该占比随难度增加而上升,而不是保持平坦。
尾部情况比中位数所示更糟。Flash 的平均输出为 3,111 个 token,而中位数为 1,409 — — 变异系数超过 1.0。我们记录到的最长单次响应为 15,006 个 token,思考占比 94.7%,用于回答一个部署架构问题。该单次响应花费 0.00753 美元:是本研究中 Flash 平均请求的 4.8 倍,是中位数简单请求的 24 倍,以及在 reasoning_effort: low 下平均请求成本的 30 倍。
这就是为什么我们在整个报告中使用中位数。平均值只会掩饰问题并误导大家。
enable_thinking behaves differently on GLM-5.3-Flash, Qwen3.8-Max and Kimi K3
enable_thinking behaves differently on GLM-5.3-Flash, Qwen3.8-Max and Kimi K3DigitalOcean’s endpoint is OpenAI-compatible and forwards chat_template_kwargs, so you can pass enable_thinking: false and ask a model to skip deliberation. That is the switch most write-ups reach for. We reached for it too.
We ran the full prompt set three times against each model: once sending no thinking parameter at all, once with enable_thinking on, once with it off. The same flag produced three different behaviors.
On GLM-5.3-Flash, it is cosmetic. Setting it false empties the reasoning_content field, so your logs go quiet. Output tokens went up 20.9% and cost went up 11.1%.
The deliberation did not stop. It moved into the visible answer. Here is the beginning of a response to the deployment-topology question, with thinking supposedly disabled:
Let me analyze this problem carefully. The setup: - 70B model - Peak traffic: 40 requests/second…
And here is one for the trivial question about what TTFT stands for:
The user is asking about “TTFT” in the context of LLM inference… Let me think about what I know about TTFT:
We detected chain-of-thought left in the visible answer on at least 103 of 120 responses. The detection is a keyword heuristic, so treat that as a floor rather than a count. It fired on 38 of 40 trivial prompts and 31 of 40 hard ones.
On Kimi K3, the same flag works properly. Output fell 67.9% and cost fell 75.5%. Per-call input overhead dropped from 99 tokens to 32, because the reasoning scaffold in the chat template goes away too.
On Qwen3.8-Max, thinking is already off. DigitalOcean ships it that way. Turning it on raised output 429% and cost 508%.
So enable_thinking is not a portable parameter. On one model it is a 75% saving, on another a 5x cost increase, and on a third it changes nothing except your visibility.
But for GLM-5.3-Flash it is also simply the wrong parameter. The model card documents a different control, and we had not read it closely enough.
reasoning_effort 在 GLM-5.3-Flash 上默认为 max,将其设置为低可将成本降低 84%
reasoning_effort 在 GLM-5.3-Flash 上默认为 max,将其设置为低可将成本降低 84%GLM-5.3-Flash 通过 reasoning_effort 公开思考预算,其可取值为 low、high 或 max。模型卡指出,未传入时它 默认为 max。我们在同一组 24 个提示上测试了所有三个级别。
| 设置 | 中位数输出 | 每请求成本 | 相对默认 |
|---|---|---|---|
| 未发送 (默认) | 1,409 | $0.001564 | 1.00x |
reasoning_effort: max |
1,434 | $0.001526 | 0.98x |
reasoning_effort: high |
580 | $0.000384 | 0.25x |
reasoning_effort: low |
414 | $0.000250 | 0.16x |
这里有两个结果。
默认确实是 max。 在相同的提示和重复下,默认和显式 max 的中位数比率为 0.984。您发送到 GLM-5.3-Flash 的每个未配置请求都以最高可用设置运行。
降低它可节省 4x 到 6.3x。 low 相比默认将成本降低 84%。这远大于我们测量的任何其他因素,包括切换模型。
效果是自适应的而非均匀的,这正是你所期望的。按难度划分的中位数思考份额:
| 设置 | 第 1 层 (简单) | 第 2 层 (中等) | 第 3 层 (困难) |
|---|---|---|---|
| 默认 | 0.72 | 0.81 | 0.84 |
high |
0.04 | 0.18 | 0.47 |
low |
0.03 | 0.35 | 0.40 |
在 low 时,对简单问题的思考基本停止 — — 输出 token 的 3% 相比默认的 72%。在困难问题上,它仍然进行思考,大约为 40%。模型并未被进行前额叶切除;而是被告知不要对不需要思考的问题进行深入思考。
我们还测试了 clear_thinking: true,模型卡片建议在聊天场景中使用。它没有产生可测量的变化:配对比率为 0.99,成本略有增加。了解这一点很有用,以免你期望通过它节省成本而去使用。
在 enable_thinking 设置之间,每请求成本跨度达 18.5 倍;在考虑 reasoning_effort 后,跨度达到 106 倍
enable_thinking 设置之间,每请求成本跨度达 18.5 倍;在考虑 reasoning_effort 后,跨度达到 106 倍
九种配置 — 三种模型,三种思考模式 — 在每请求成本上跨度达 18.5 倍。
| 排名 | 配置 | 每请求成本 | 相较于最低成本 |
|---|---|---|---|
| 1 | glm-5.3-flash / default | $0.00156 | 1.00x |
| 2 | glm-5.3-flash / on | $0.00157 | 1.01x |
| 3 | glm-5.3-flash / off | $0.00174 | 1.11x |
| 4 | qwen3.8-max / off | $0.00359 | 2.29x |
| 5 | qwen3.8-max / default | $0.00361 | 2.31x |
| 6 | kimi-k3 / off | $0.00651 | 4.17x |
| 7 | qwen3.8-max / on | $0.02196 | 14.04x |
| 8 | kimi-k3 / default | $0.02661 | 17.01x |
| 9 | kimi-k3 / on | $0.02892 | 18.49x |
一起阅读第 6 行和第 7 行。配置良好的 Kimi K3 成本低于配置不佳的 Qwen3.8-Max,尽管其标价是 Qwen 输出价的 2.5 倍。一个布尔值将 Kimi 从 17.01 倍降至 4.17 倍 — — 这比切换到另一个模型所带来的变化更大。
Flash 的三个 enable_thinking 配置相互之间的差距仅为 11%。这并不是因为 Flash 没有杠杆,而是因为我们拉错了杠杆。加入 reasoning_effort 后,同样的梯度看起来就不同了:
| 配置 | 每请求成本 | 相对最低成本 |
|---|---|---|
glm-5.3-flash / reasoning_effort: low |
$0.000250 | 1.00x |
glm-5.3-flash / reasoning_effort: high |
$0.000384 | 1.54x |
| glm-5.3-flash / default | $0.001564 | 6.26x |
| qwen3.8-max / default | $0.003610 | 14.44x |
| kimi-k3 / off | $0.006510 | 26.04x |
| kimi-k3 / default | $0.026610 | 106.44x |
差距不再是 18.5 倍。它是 106 倍,而最大的贡献者只是一个模型上的一个参数。
值得一提的是,存在一个二阶后果。默认配置在不同模型之间并不统一 — — Qwen 出厂时思考功能关闭,Flash 出厂时使用最大努力 — — 因此,任何对多个模型进行“开箱即用”运行的比较,实际上是在比较配置而非模型本身。大多数已发表的比较恰恰是这样做的,包括我们在进行这些实验之前的这一篇。
降低推理强度会降低准确率吗?仅在困难问题上会

对以上内容的一个明显反驳是:也许昂贵的模型之所以昂贵,是因为它们更好,而你实际上是在衡量质量的价格。
于是我们构建了第二套数据:20 个具有确定性答案的任务 — — 成本算术,在重试策略下的期望值,一个组合学问题,一个延迟预算推导 — — 每个任务都需要以固定的 ANSWER: 格式给出最后一行,这样响应可以通过字符串提取而不是判断来评分。在三个模型、三种思考模式和两种降低的 effort 级别上各进行五次重复。共得到 1,099 条已评分的响应。
在默认设置下,所有三个模型均得分 100%。
| 模型 | 设置 | 通过@1 | 每个正确答案的成本 | 与最便宜相比 |
|---|---|---|---|---|
| glm-5.3-flash | effort: low |
92.0% | $0.00008 | 1.00x |
| glm-5.3-flash | effort: high |
98.0% | $0.00012 | 1.47x |
| glm-5.3-flash | enable_thinking: false |
100.0% | $0.00018 | 2.15x |
| glm-5.3-flash | 默认 | 100.0% | $0.00018 | 2.17x |
| glm-5.3-flash | enable_thinking: true |
100.0% | $0.00019 | 2.26x |
| qwen3.8-max | enable_thinking: false |
100.0% | $0.00226 | 26.64x |
| qwen3.8-max | 默认 | 100.0% | $0.00235 | 27.65x |
| kimi-k3 | enable_thinking: false |
98.0% | $0.00282 | 33.23x |
| qwen3.8-max | enable_thinking: true |
100.0% | $0.00383 | 45.14x |
| kimi-k3 | 默认 | 100.0% | $0.00565 | 66.47x |
| kimi-k3 | enable_thinking: true |
100.0% | $0.00601 | 70.78x |
在九个 enable_thinking 配置中,准确率普遍达到或接近 100%,而每个正确答案的成本相差 33 倍。在这一范围内,便宜的模型并不是因为更差而便宜。它并不更差。
但推理努力并非免费。 Flash 在默认设置下得分 100%,在 high 下得分 98%,以及 92% 在 low。节省有代价,我们可以确切地说明它发生在何处:每一次失败都发生在第三层任务上。第一层和第二层在所有努力级别下都是完美的。
| 设置 | 失败次数 | 哪些任务 |
|---|---|---|
| 默认 | 0/100 | — |
high |
2/100 | 概率 (1), 逻辑 (1) |
low |
8/100 | 成本建模 (3), 概率 (2), 逻辑 (3) |
在 low 下,模型在一个多步骤成本建模问题上五次中有三次错误 — 两次返回 0.6122,而正确答案是 61.22,这是单位错误而非推理错误。降低努力不会使模型在记忆或算术方面变差。它使模型在保持多步骤链条并检查自身工作方面变差。
每个正确答案的成本仍然偏向 low,因为 8% 的失败率无法抵消在这么简单的任务集上 84% 的折扣。对于更难的工作,我们不会得出这个结论。这就引出了最重要的注意事项:在十一种配置中,有六种的任务集已经饱和到 100%。如此简单的任务集能够检测到退化的存在,却无法告诉你退化有多严重。在真正困难的推理任务中,预期差距会进一步扩大。
结构化输出恢复了 GLM-5.3-Flash 的全部价格优势
两组提示在一个重要方面有所不同:可验证的任务要求固定的答案格式,而开放式提示则没有任何要求。这种偶然的对比结果被证明是研究中最有用的发现。
| 模型 | 开放式提示的中位输出 | 结构化输出的中位输出 | 降幅 |
|---|---|---|---|
| glm-5.3-flash | 1,409 | 276 | 80.4% |
| kimi-k3 | 1,133 | 248 | 78.1% |
| qwen3.8-max | 435 | 144 | 66.9% |
结构化输出对 Flash 的抑制强于对其他任何事物的抑制,而 Flash 的冗长正是导致其价格优势被削弱的原因。因此,优势会随工作负载而变化:
| GLM-5.3-Flash 相对于 | 开放式提示 | 结构化输出 |
|---|---|---|
| qwen3.8-max | 2.3x | 12.8x |
| kimi-k3 | 17.0x | 30.7x |
在结构化输出下,Flash 几乎完全实现了其标价所暗示的优势。在无约束的情况下,它相对于 Qwen 仅实现了大约五分之一的优势。
有一个限制条件使这并非免费午餐。我们还在八个琐碎的提示后附加了 “请用一句话回答”。在所有三个模型上,输出下降了 70%–91%——这一影响超过了思考参数在两个模型上的影响。但思考所占的比例没有变化:Flash 从 0.72 上升到 0.77,Kimi 保持在 0.65。
该指令压缩了答案,而不是思考过程。您仍需为看不见的推理支付相同比例的费用。只不过您是在更小的账单上支付这一费用。
为哪种工作负载选择哪种 reasoning_effort 设置
在 GLM-5.3-Flash 上显式设置 reasoning_effort。 未设置它意味着 max,这是可用的最昂贵设置。这是研究中的最大杠杆。
对于分类、提取、路由、格式化和查找,使用 reasoning_effort: low。相比默认设置,它在低于硬多步推理的任务上便宜 6.3 倍,且没有准确率损失。
对于混合工作负载,high 比默认设置更好。 相比 max,它便宜 4 倍,在我们的任务集上准确率为 98%(而默认设置为 100%)。如果您打算选择一个设置并保持不变,请选择这个。
对于真正困难的多步推理,保持在 max。我们在降低努力时看到的每一次失败都是第三层任务,而我们的任务集太简单,无法告诉您在更困难的工作中会变差多少。
如果您的输出是开放且无界的,根据实际测量的 token 数量进行预算,而不是参考列表价格。运行一百个具有代表性的请求并取平均值。
如果您已经在使用 Kimi K3,测试您的工作负载是否能容忍 enable_thinking: false。它带来了 75% 的节省,但在我们的数据集上准确率下降了 2 个百分点。
如果您在使用 Qwen3.8-Max 并考虑开启思考模式,其成本是默认的 5 倍。在启用之前,请确认它确实带来了收益。
不要 在 GLM-5.3-Flash 上使用 enable_thinking: false 期望节省成本。这实际上使我们的成本增加了 11%。此外,不要期望 clear_thinking: true 会产生任何变化;它没有产生影响。
所有三种模型今天均可在 DigitalOcean 的 无服务器推理 上获得。端点为 OpenAI 兼容,地址为 https://inference.do-ai.run/v1,因此在您自己的工作负载上测试这些内容只需更改基础 URL 和模型 ID——glm-5.3-flash、qwen3.8-max 或 kimi-k3。本文中的所有测试均通过该端点使用标准的 openai Python 客户端完成。
在 DigitalOcean 而非其他地方运行 GLM-5.3-Flash 的原因
诚实地说,因为本文中的价格并非 DigitalOcean 独有的数字。GLM-5.3-Flash 采用 MIT 许可证,且 Z.ai 发布了我们使用的同一份价目表,因此模型的每 token 成本本身并不是选择一家主机而非另一家的理由。任何人如果在相同权重下向你报出远低于市场的每 token 价格,要么是在打折,要么是在测量其他东西。
与众不同的在于 token 以外的一切。在进行此研究时,有三个因素很重要,而这三个因素在生产环境中同样重要。
其余技术栈位于同一地点。 token 价格仅是推理账单的一部分。如果您的向量数据库、对象存储和应用服务器位于一个提供商的网络中,而模型位于另一个提供商的网络中,则您需要为数据支付出站流量费用,并且在每次检索时都要等待往返延迟。对于每个请求需要进行多次检索的 RAG 流水线,这种跨提供商跳转可能会增加的延迟甚至超过模型自身的首 token 时间——而这些延迟在每 token 的比较中根本看不见。将推理与托管 Postgres、Spaces 和 App Platform 放在一起可以消除这种跳转。
一个账户,一张账单。 无服务器推理的使用会出现在与您其余基础设施相同的 DigitalOcean 账户和同一张发票上。这听起来像是行政工作,直到您尝试审计由三个供应商、三种计费模式和三种 token 记账方式分摊的推理账单。这也意味着测试新模型时不需要单独的采购周期。
有摆脱每 token 定价的路径。 这里的测量全部基于无服务器。如果您的工作负载超出了这一点——持续吞吐量、可预测的量或对隔离的需求——专用推理提供与 OpenAI 兼容的 API 表面以及预留容量,因此迁移只是配置变更而非重写。在此基础上,GPU Droplets 让您在自己的硬件上运行自有的服务栈;这确实是一次真正的重新架构,但它可以在同一账户下使用,而无需更换提供商。
这些都不会在每 token 的比较中体现出来,这正是重点。每 token 价格是易于比较的数字,也是最不可能决定您账单的因素,正如本文其余部分 hopefully 已经所示。
方法:这些数字是如何产生的
一切都在 DigitalOcean Serverless Inference 上运行,地址为 https://inference.do-ai.run/v1,该服务与 OpenAI 兼容。
未使用采样参数。 未发送 Temperature、top_p 和 penalties。Kimi K3 使用固定的采样值,若对其他模型也设置这些参数,将引入我们随后必须辩护的不对称性。所有模型均使用平台默认值运行。
非流式,max_tokens=32000。 之前以 8,000 为上限的一次运行导致 Flash 的第三层响应有 20% 被右删节 — — 模型在预算用尽时仍在 deliberation,根本未产生任何答案。本次报告的运行没有截断记录,且每个 finish_reason 均为 stop。
执行顺序随机化。 使用固定种子对完整的 model × prompt × repetition 矩阵进行了洗牌,这样平台漂移会分散到各个模型上,而不是仅影响最后运行的那个模型。
Token 计算。 DigitalOcean 的 usage 对象不区分推理 token — completion_tokens_details 返回为 null — 但模型在消息的 reasoning_content 字段中暴露了 deliberation。我们使用每个模型自身的分词器在本地对其进行分词,并将其与计费的 completion_tokens 进行对齐。剩余部分是每个模型的聊天模板常数偏移:Flash +2,Qwen +1,Kimi +13。常数偏移是正确分词器的表现;若偏移不稳定,则说明我们的计数有误。所有份额均相对于计费 token 报告,并保留该偏移。
投放了三种方式的 deliberation 控制,因为它们不可互换。enable_thinking 和 clear_thinking 放在 chat_template_kwargs 内;reasoning_effort 放在请求体根部。每个请求会记录其发送的确切 extra_body。我们通过行为验证这些参数确实生效,而不仅仅是相信返回 200:我们将 prompt 和 repetition 配对的臂(arms)配对起来,若某参数被忽略,则会得到无法区分的 token 分布。
使用中位数而非均值,原因如前所述。五次重复足以支持中位数和范围,而不是一个严格的置信区间。
本研究的局限性
本指标衡量的是每请求成本和每正确答案成本,而非每完成任务的成本。 没有沙箱,没有多轮智能体循环,也没有代码执行。智能体工作负载是显而易见的下一步测量,而我们尚未进行。
能力通过引用保持不变,而非通过测试。 Artificial Analysis 将 Kimi K3 和 GLM-5.3-Flash 在其智能指数上均评为 57 分。这些是他们的测量结果,不是我们的,我们也没有尝试复现。
可验证的任务集过于简单。 十一种配置中有六种得分 100%。它足够敏感,能够检测到降低推理 effort 会导致准确率下降 — — 在 low 下为 92% — — 但无法说明在真正困难的工作中准确率会下降多少。准确率的比较仅表明在此难度下此任务类别的等价性,而不具备更广泛的适用性。
我们最初测试了错误的参数。 我们的初始实验使用了 enable_thinking,这并不是 GLM-5.3-Flash 文档中的对照项。我们仅在重读模型卡后才发现 reasoning_effort,并且它显著改变了结论。enable_thinking 的结果按测量值报告,但应将其视为关于该参数的发现,而非关于模型减少思考能力的结论。
我们有一个答案键出错。 在延迟预算任务中,全部 45 个回答均为 43,而我们的答案键显示为 42。模型是正确的:第一个 token 在 TTFT 时到达,只有后续 token 才会增加总计。我们已更正答案键并予以披露,因为一个永远不会出错的固定答案键通常意味着没有人检查过它。
十二条 Kimi K3 响应出现未计入的计费 token,其中 completion_tokens 超过返回的推理加答案的 token 数在 85 到 391 之间。这大约占 Kimi 记录总数 1,000 条中的 12 条。我们无法解释这一差异。Flash 和 Qwen 未出现类似尾部情况。
在 2,700 次调用中,有一次失败。 伴随着在五次重试后返回 HTTP 429 错误。
提示缓存在 297 条记录中触发,始终恰好在 128 个 token 处,这是因为重复的相同提示在后续重复时命中了缓存。这仅影响输入成本,而输入成本仅占这些账单的一小部分。我们选择保留它而不是抑制它。
两组提示的 token 数不可比较。 可验证任务包含格式指令,而开放式提示则不包含。应在同一组内比较各模型的比率,而不应跨组比较绝对计数。
这些是当时的数字。 价格、服务默认值和模型版本会变化。定价快照日期在仓库中。
自行重现这些测量
该仓库包含冻结的提示集及其 SHA256、测量 harness、所有原始响应日志、评分器以及能够重新生成本文中每个数字和图表的分析脚本。模型 ID 为 glm-5.3-flash、qwen3.8-max 和 kimi-k3。
整个研究大约需要 14 美元和一个下午。
如果你重新运行后得到不同的结果,请提交 issue。我们很想知道。
进一步阅读:GLM-5.3-Flash 模型卡、DigitalOcean 无服务器推理文档,以及我们之前在 LLM 推理基准测试 上的工作。
常见问题
GLM-5.3-Flash 在 DigitalOcean 无服务器推理上是否是最便宜的模型? 在我们的测量中,答案是肯定的,在我们测试的每种配置下均为最便宜。在默认设置下,每请求成本为 0.00156 美元,而 Qwen3.8-Max 为 0.00361 美元,Kimi K3 为 0.02661 美元。使用 reasoning_effort: low 时,成本降至 0.00025 美元——比 Qwen 低 14.5 倍,比 Kimi 低 106 倍。
关闭思考模式是否能降低成本? 这取决于所使用的模型以及你使用的参数。在 Kimi K3 上,enable_thinking: false 使成本降低 75.5%。在 Qwen3.8-Max 上,思考模式默认已经关闭。在 GLM-5.3-Flash 上,enable_thinking: false 反而会使成本上升 11.1%,因为模型仍在可见答案内部继续 deliberation;起作用的参数是 reasoning_effort,可将成本降低最高达 84%。
GLM-5.3-Flash 的默认 reasoning_effort 是什么? 最大。如果您未发送 reasoning_effort,模型将以 max 运行。我们通过在相同提示上将未设置的请求与显式的 max 进行比较来验证这一点:中位数比率为 0.984。每个未配置的请求都在最高成本的设置下运行。
降低 reasoning effort 会损害准确率吗? 是的,在困难问题上。在 20 项可验证的任务中,GLM-5.3-Flash 在默认设置下得分 100%,在 high 下得分 98%,在 low 下得分 92%。所有失败都发生在多步骤推理任务上;较简单的任务在所有级别上均不受影响。
为什么我的 LLM 账单高于定价页所示的金额? 最可能是输出量。推理模型会输出大量计费但不显示的 token —— 在我们的测量中,这些 token 占输出账单的 65% 到 84%。每 token 价格只告诉您费率,而不告诉您数量。
LLM 账单中 reasoning token 所占的比例是多少? 对于 GLM-5.3-Flash 的默认设置,在简单问题上中位数为 72%,在困难问题上升至 84%。将 reasoning_effort: low 设置后,该比例在简单问题上降至 3%,在困难问题上降至 40%。对于 Kimi K3,该比例为 65%,在困难问题上升至 82%。Qwen3.8-Max 出厂时思考功能被禁用,默认情况下不产生任何此类费用。
更便宜的模型会给出更差的答案吗? 在默认设置下不是。在覆盖三种模型的三种 enable_thinking 模式的 899 条评分响应中,所有三种模型在确定性问题上的得分均在或接近 100% —— 最低的是思考功能被禁用的 Kimi K3,得分为 98% —— 而每个正确答案的成本相差 33 倍。降低 GLM-5.3-Flash 的 reasoning effort 会牺牲准确率,在 high 下为 98%,在 low 下为 92%,这就是为什么完整的评估集达到 1,099 条响应,覆盖十一种配置。
我在哪里可以运行 GLM-5.3-Flash?
权重采用 MIT 许可并在 Hugging Face 上提供,因此可以自行托管或通过任何提供该模型的主机运行。我们在 DigitalOcean 无服务器推理上进行了测量,今天它与 Qwen3.8-Max 和 Kimi K3 一起通过 OpenAI 兼容的端点 https://inference.do-ai.run/v1 提供,模型 ID 为 glm-5.3-flash。
GLM-5.3-Flash 在 DigitalOcean 上是否比其他地方更便宜? 每 token 的费率并不是区分因素:该模型是开放权重的,DigitalOcean 的费率与 Z.ai 公布的列表价格相匹配。影响总成本的因素是与您其余技术栈的距离,因为每次检索的出站流量和往返不在每 token 比较范围内,以及您是否能够在不重新平台化的情况下转移到专用容量。
如何降低输出 token 成本? 三个杠杆,按大小排序。在 GLM-5.3-Flash 上显式设置 reasoning_effort:low 比默认便宜 6.3 倍,而 high 比默认便宜 4 倍。限制输出格式:要求固定答案结构将 Flash 的中位数输出降低 80.4%。添加简洁指令:“用一句话回答” 在所有三个模型上将琐碎问题的输出降低 70–91%。只有第一个方法能降低 比例 中用于推理的账单部分;其他两种方法能降低账单,同时保持该比例不变。