批量推理 是一种一次性发送大量 AI 请求、稍后收集答案的方式,而不是实时等待每个请求完成。服务商通常会给出更低价,常约为半价,因为无截止时间的任务更易安排在繁忙时段。
如果你需要对一百万条支持工单分类、为整个目录生成产品描述、对数千条测试提示运行评估套件,或在夜间充实数据仓库,批量定价通常是购买 AI 推理最划算的方式。如果你正在构建聊天界面,则完全不是合适的工具。
本次比较涵盖六家提供批量或异步推理路径的服务商:DigitalOcean、Fireworks AI、Nebius Token Factory、Together AI、AWS Bedrock 和 Modal。随后解释为何人们常在此对话中提到的四家服务商——Vast.ai、RunPod、Thunder Compute 和 Lambda——实际上不应列入此列表。
TL;DR
- 批量折扣是真实存在的,通常恰好为 50%。 DigitalOcean、Fireworks AI、Nebius 和 AWS Bedrock 都将异步请求相对于其实时每 token 价格折扣 50%,以换取大约 24 小时的结果窗口。
- “最高可享 50% 折扣” 与 “您的模型享 50% 折扣” 并不相同。 Together AI 宣传最高可享 50% 的批量节省,但其文档仅列出两款折扣模型:
meta-llama/Llama-3.3-70B-Instruct-Turbo和openai/whisper-large-v3,并说明 “未列出的模型按标准费率计费。” 在假设能够节省之前,请先核对模型列表。 - 有保证的时间窗口胜过略微更好的价格。 DigitalOcean 承诺提供 24 小时结果窗口。AWS 明确表示 “批量推理 API 没有保证的 SLA”,而 Together 的窗口是尽力而为的。
什么是批量推理,以及为什么它更便宜?
批量推理意味着将大量请求作为单个作业提交,通常是一个 JSONL 文件,其中每行代表一个请求,并在定义的时间窗口内检索结果,而不是立即返回。
其成本较低的原因在于调度。实时请求必须在到达时立即得到服务,因此提供商需要预留 GPU 容量以应对可能永远不会出现的峰值。批量作业不承诺这一点,因此提供商可以将你的工作安排到任何空闲容量中,并将部分效率返还给你。DigitalOcean 直接说明:批量作业通过使用非高峰 GPU 容量运行。
虽然折扣很抢眼,但还有另一个好处。批量作业通常会与生产流量的独立速率限制池运行,因此 40,000 请求的作业不会让你的线上应用触发 429 Too Many Requests 错误。在若干提供商上,这已经足以让你在收支平衡时也选择使用批量作业。
批量推理适用于以下场景:
- 模型评估和提示基准测试
- 大规模分类、标注和情感分析
- 大规模内容生成,例如目录文案或摘要
- 文档处理和结构化数据提取
- 为你一次性索引的语料库生成嵌入向量
- 夜间或定时离线管道
它不适用于人们正在等待的任何场景:聊天、在线客服、边输入边搜索或交互式工具。这些场景需要实时推理。想了解各种模式何时适用的更详细对比,请参阅 DigitalOcean 推理模式比较。
一目了然的最便宜批量推理服务提供商
| 提供商 | 批量折扣 | 周转时间 | 每任务最大值 | 失败时计费 | 最适用于 |
|---|---|---|---|---|---|
| DigitalOcean | 实时价格五折,所有受支持模型 | 保证 24 小时窗口 | 50,000 请求,每文件 200 MB | 仅计费已完成请求 | 在 OpenAI 和 Anthropic 模型上可预测的节省 |
| Fireworks AI | 无服务器价格五折,缓存 token 再享五折 | 可选择 12、24、48 或 72 小时 | 80 GiB 输入数据集 | 已完成行计费并保存 | 超大开放权重作业及提示复用 |
| Nebius Token Factory | 实时基础价格五折 | 最高 24 小时窗口 | 基于数据集,支持 JSONL 或 Parquet | 未公开文档 | 具备欧盟或美国合规的开放权重目录 |
| Together AI | 五折,但仅限列出的模型 | 尽力 24 小时,不可调 | 50,000 请求,每文件 100 MB | 仅计费成功响应 | 排队 token 上限非常高 |
| AWS Bedrock | 按需价格五折,受支持模型 | 无 SLA | 100,000 条记录,每文件 1 GB | 未公开文档 | 已致力于使用 AWS 的团队 |
| Modal | 无。按秒计费 GPU | 立即,无队列 | 不适用 | 仅支付实际使用的计算时间 | 效率优于固定折扣的作业 |
快速推荐。折扣最可预期:DigitalOcean。大批量任务和提示词缓存叠加效果最好:Fireworks AI。开放权重模型目录最全、还提供数据驻留选项:Nebius。排队 token 上限最高:Together AI。已深度绑定 AWS:Bedrock。完全不用排队:Modal。
我们如何选出这五家
之所以选出这五家,是因为每家在批量推理上都有独到之处——要么提供专门的批量折扣计划,要么有特别契合批量工作负载的计费模式——而不是在一堆大同小异的实时按 token 计价方案里再添一家。其他厂商也曾纳入考察,但它们目前没有与标准定价区分开的批量折扣机制,因此未入选。下文所有数字均取自各厂商自己的定价页或文档页;批量推理的价格变动频繁,请把本文当作一份快照,在大规模使用前务必核实当前费率。
1. DigitalOcean——最简单直接的批量折扣
结论:如果你想要一个固定费率方便做预算,又想拿到有保障的批量折扣,这是最省事的途径。DigitalOcean 在其 Inference Engine 上提供的 Batch Inference(批量推理),对 OpenAI 和 Anthropic 模型的异步批量请求相比实时推理最高可享 5 折优惠,并且只按成功完成的请求计费——如果任务失败、被护栏拦截或中途过期,未处理的请求一律不予收费
实际成本案例:用 Claude Opus 4.6 处理 50,000 个请求,每个请求平均 1,000 个输入 token、500 个输出 token(合计 5000 万输入 token 和 2500 万输出 token)——实时推理要花 $875,同样规模走批量推理只需 $437.50,省下 $437.50,正好 50%。
- 优点:折扣简单、可预期,约 5 折;未完成的请求不计费;如果你本来就在 DigitalOcean 上跑工作负载,可以与现有算力自然搭配。
- 缺点: 确保模型目录包含您所需的模型
2. Together AI - 最适合高批量批处理作业
评价:每批 token 上限最高,适合真正大型作业。 Together AI 的 Batch API 将大多数无服务器模型请求相比实时定价最高折扣 50%,尽力交付周期 SLA 小于 24 小时(通常只需几小时即可完成),并支持每模型最多 300 亿入队 token(Together AI 批量推理)。
此折扣仅适用于选定的无服务器模型;在专用端点上运行的批处理作业按全价计费,而非折扣价(Together AI 推理定价文档)。
- 优点: 每批 token 上限非常高;批处理速率限制与实时使用分离,因此批处理作业不会与生产流量竞争。
- 缺点: 折扣不适用于专用端点部署。
3. Fireworks AI - 最适合分层、基于模型规模的定价
评价:在不同模型规模之间切换时,成本伸缩最清晰。 Fireworks AI 将批量推理按其无服务器每 token 费率的 50% 计费,适用于输入和输出 token。其未在命名模型列表中的基础无服务器费率按参数数量分层:低于 4B 参数时为每 1M token 0.10 美元,4B–16B 时为 0.20 美元,超过 16B 时为 0.90 美元——因此,实际批量成本会随所选模型而变化,而不是固定费率(Fireworks AI 无服务器定价文档)。
- 优点: 透明的分层使得在较小和较大模型之间切换时成本估算变得简单;整个目录中保持一致的 50% 批量折扣。
4. Nebius——最适合欧盟数据驻留与超大批次负载的场景
结论:当数据驻留要求或超大批次负载成为决定性因素时,Nebius 的契合度最高。Nebius 会在模型实时基础价格之上自动打五折收取批量请求费用(金额向上取整到分),单次请求最高支持 10GB 的批量负载,大多数任务都能在 24 小时内完成(Nebius 托管推理、Nebius Token Factory 批量推理操作参考)。
- 优点:折扣自动生效,无需单独申请开通;负载上限高,适合大体量离线任务;工作负载若有数据驻留要求,欧盟托管就是关键优势。
- 缺点:除非欧盟数据驻留正是刚需,否则它很少成为默认首选。
5. Modal——最适合按实际用量精细计费的场景
结论:当真正压低成本的是任务执行效率而非固定折扣时,Modal 是最佳选择。Modal 并没有针对 AI 推理推出专门的批量折扣计划。它按秒计收 GPU 算力费用(Nvidia T4 约为 $0.000164/秒,B200 最高约 $0.001736/秒),空闲时自动缩容到零,不产生任何闲置费用,其 Starter 计划每月还附带 30 美元免费算力额度——因此,它对批量工作负载的成本优势来自精确到秒的计费方式,而非固定的折扣比例(Modal 定价页)。
- 优点:无闲置费用;不足一分钟的计费粒度让高效的任务设计能真正省下成本;无需排队等待,也不必熬过 SLA 时限。
- 缺点: 没有保证的折扣百分比 - 总批处理成本完全取决于作业效率和所选的 GPU 级别。
批量推理定价:折扣 vs. 周转时间权衡
五家提供商分为两组,选择时的差异很重要:提供 固定折扣和明确的等待时间 的提供商(DigitalOcean、Together AI、Fireworks AI、Nebius)保证大约 50% 的实时定价折扣,但在一定的周转窗口内返回结果,通常最长可达 24 小时。Modal 提供 没有固定折扣且无需等待,按实际计算的每秒收费,无需排队,但不提供保证的百分比节省——实际成本取决于作业运行的效率。
如果工作负载可以容忍多小时的等待且可预测的折扣是优先考虑的,则第一组是更简单的选择。如果需要的结果比批处理 SLA 允许的更快,或者作业是短暂且突发的,细粒度的按秒计费可能最终更便宜,甚至根本不需要正式的“批处理”标签。
最便宜的提供商总是最佳选择吗?
不 - 价格是一个有用的起始过滤器,但它不应该是唯一的因素。周转 SLA 需要适应工作负载(24 小时窗口适合夜间作业,而不适合对时间敏感的任务);如果最便宜的提供商未托管特定模型,则模型目录很重要;速率限制或数据驻留要求可能会排除否则便宜的选项。应将批量定价与这些因素一起考虑,而不是仅凭成本来选择。
常见问题
哪家 AI 批量推理服务最便宜?
这取决于工作负载。DigitalOcean、Together AI、Fireworks AI 和 Nebius 都为批量作业提供大约 50% 的实时费率折扣,而 Modal 按秒计费的 GPU 时间在小型高效作业上可能更便宜,因为没有最低折扣层级需要考虑。
使用批量推理相比实时推理能节省多少?
大多数专用批量 API 会在实时每 token 价格基础上提供 40%–50% 的折扣,通常以换取一个周转窗口为条件——常常长达 24 小时——而不是立即返回结果。
批量推理和实时推理有什么区别?
实时推理会在聊天或实时代理等交互式场景中立即返回响应。批量推理则以异步方式处理大量请求,使提供商能够更高效地调度工作负载,并将部分节省的成本让渡给用户。
所有提供商都提供批量推理折扣吗?
不是。DigitalOcean、Together AI、Fireworks AI 和 Nebius 各自都有明确的批量折扣计划(通常约为实时价格的 50% 折扣)。Modal 改为按 GPU 秒计费,没有单独的折扣批量层级。
哪些使用场景最适合批量推理?
可以容忍延迟的工作负载:模型评估、批量分类、大规模内容生成、数据丰富以及夜间或计划的离线处理作业。
最便宜的批量推理提供商总是正确的选择吗?
不一定。周转 SLA、模型目录、速率限制和数据驻留要求与价格同样重要——如果纸面上最便宜的选项不符合工作负载的限制,那就没有用。
批量推理如何计费——按 token 还是按 GPU 小时?
两种计费模式都存在。DigitalOcean、Together AI、Fireworks AI 和 Nebius 对批量作业提供按 token 计费的折扣。Modal 按 GPU 时间的秒数计费,与请求量无关,因此其成本与计算时间而非 token 数量挂钩。
开始使用
运行作业的最短路径是 DigitalOcean 的 Batch Inference 指南:准备一个 JSONL 文件,请求预签名上传 URL,PUT 该文件,并使用 provider 和 24h 完成窗口创建作业。要了解包含分块、重试和大规模 reconciliation 的完整流水线,请参阅 处理一百万份文档 overnight。
在 DigitalOcean Inference Engine 上开始使用 Batch Inference 并以最高 50% 的折扣运行您的下一个高负载作业(相较于实时费率)。