中文 ▾
获取 API 密钥

你需要了解的 LLM API 定价:常见误区与事实

LLM API 定价通常将复杂性隐藏在简单的每 token 费率背后,但理解输入/输出拆分、上下文窗口成本和流式传输开销对于预算准确性至关重要。本指南分解了运行语言模型的真实成本,比较了主要供应商的结构,并展示了无审查、开放权重 API 如何提供透明、可预测的定价,且没有隐藏层级。

更新于

要点

  1. 输入和输出 token 的定价很少相等;输出通常比输入贵 2–4 倍。
  2. 上下文窗口限制影响成本效率;更长的上下文需要更多内存和更高的基础费率。
  3. 流式传输增加了可忽略不计的计算开销,但如果客户端处理不当,可能会使计费复杂化。
  4. 开放权重模型通常比频繁更改费率的专有供应商提供更可预测的定价。

输入/输出价格差距

在评估 llm api 定价 时,最重要的变量是输入和输出成本之间的比率。大多数提供商处理你的提示词的费用低于生成响应的费用。这不是任意的;生成 token 所需的每个 token 的计算周期比编码它们更多。例如,API 可能对每百万输入 token 收取 $0.25,而对每百万输出 token 收取 $1.00。这种 4:1 的比率意味着你的预算在很大程度上取决于模型回复的长度。

开发人员通常低估这一差距。如果你发送 1,000 个 token 的提示词并收到 500 个 token 的响应,你的输入成本可以忽略不计,但输出成本占主导地位。相比之下,如果你发送 10,000 个 token 并收到 1,000 个 token 的总结任务,情况就会反转。始终首先计算预期的输出量。如果你的用例生成较长的响应,请优先选择输出费率较低的 API。

一些模型提供固定费率,但在高性能层级中很少见。趋势是转向不对称定价以反映实际计算负载。比较提供商时,始终查看每百万 token 的输出价格,而不仅仅是平均值。这一单一指标决定了你的应用是成本效益地扩展还是迅速耗尽预付额度。

上下文窗口成本

上下文窗口定义了模型在单个请求中可以处理多少文本。虽然许多 API 提供 8k 或 32k 窗口,但新模型支持 100k 甚至 128k token。更大的上下文窗口会增加成本吗?通常是的。提供商可能会对超过特定阈值的 token 收取更高的费率,或者为了支持内存开销而简单地将所有 token 定价更高。

例如,提供 100k 上下文窗口的 API 可能保持相同的每 token 价格,但每个请求需要更多的 GPU 内存。这种效率提升允许你传递整个文档或长对话历史而无需截断。但是,你必须确保你的应用高效处理大负载。如果 API 按 token 而不是按请求计费,单个包含 60k token 的请求可能比十个包含 6k token 的请求更昂贵。

考虑你的数据结构。如果你正在构建聊天机器人,上下文会随着每次对话而增长。有了 100k 的限制,你可以保留更多历史记录,减少需要额外 token 和成本的复杂总结步骤。但是,如果你的平均对话只有 2k token,100k 窗口不提供定价优势。将上下文长度匹配到你的实际使用模式,以避免为未使用的容量付费。

流式与非流式定价

流式传输在生成时将 token 发送给客户端,从而改善感知延迟。流式传输会改变价格吗?在大多数情况下,不会。无论你是否流式传输输出,计算成本是相同的。但是,如果你的客户端库以不同方式计算 token,流式传输可能会影响你的计费方式。

一些旧的计费系统按连接或按块收费,这增加了流式传输的成本。现代 API 严格按 token 收费,无论交付方式如何。这意味着你可以流式传输响应而无需担心隐藏费用。唯一的成本差异可能在于网络带宽,这对于文本来说通常可以忽略不计。

一个技术权衡:流式传输要求你的客户端处理部分响应和潜在的中断。如果流在中间失败,你可能已经收到了 50% 的 token。确保你的计费逻辑只计算成功生成和交付的 token。这可以防止对从未到达用户的 token 收取“幽灵”费用。始终验证你选择的 API 提供商是在生成时而不是在交付时计算 token,以确保公平性。

隐藏费用详解

除了每 token 费率外,还有一些隐藏费用可能会让开发人员感到惊讶。首先,检查最低请求费。一些 API 每次调用收取最低金额,即使 token 数量很少。这会惩罚高频、低容量的使用。其次,查看速率限制超额费。如果你超过每分钟请求数,你是被收取双倍费用,还是请求被简单地丢弃?被丢弃的请求可能仍然会被计费,也可能不会,这取决于提供商的政策。

另一个隐藏成本是工具使用的“开销”。当模型调用函数时,它会生成额外的 token 来描述工具和其参数。这些 token 计入你的总使用量。如果你经常使用工具,这可能会显著增加你的账单。如果可能,请确保你的 API 密钥和计费仪表板单独跟踪工具使用 token。

最后,考虑重试的成本。如果请求因超时而失败,你需要再次付费吗?大多数提供商都会。如果你的应用在临时错误时积极重试,你的成本可能会成倍增加。实施指数退避并限制重试次数,以避免意外账单。始终阅读服务条款,以确切了解何时认为 token 已“计费”。

与 GPT 和 Claude 的比较

当将 llm api 定价 与 GPT 和 Claude 等主要供应商进行比较时,请记住他们的定价结构复杂且经常更新。例如,GPT-4o 对输入和输出有不同的费率,并且对高频使用有额外的层级。Claude 提供类似的不对称定价,但通常具有不同的比率。这些供应商还定期推出具有新价格点的新模型。

关键区别在于透明度。主要供应商通常捆绑功能或提供需要谈判或特定层级升级的批量折扣。相比之下,许多较小的无审查 API 提供直接的按量付费定价。例如,无审查 API 可能对每百万输入 token 收取 $0.25,对每百万输出 token 收取 $1.00,没有隐藏层级。这种简单性对于想要准确预测成本的开发人员来说是一个显着的优势。

另一个因素是模型独占性。像 OpenAI 和 Anthropic 这样的供应商只提供他们自己的模型。无审查 API 可能提供针对特定用例优化的单一高度优化模型。这可能导致针对利基任务的更好性能,但灵活性较低。如果你需要在不同任务之间切换模型,供应商生态系统可能更好。如果你需要针对一项任务保持一致、低成本的性能,单模型 API 通常更便宜。

批量折扣与奖励

大多数 API 提供商提供批量折扣,但结构各不相同。一些提供分层定价:使用量越多,每 token 费率越低。其他人提供预付额度奖励。例如,向你的账户添加 $100 可能会给你 $110 的额度。这实际上是 10% 的折扣。对于高容量用户,这可以节省大量资金。

将其与需要每年谈判折扣的企业合同进行比较。预付额度奖励通常更容易被小团队或个人开发人员获得。它们不需要承诺,可以立即使用。但是,请检查过期日期。一些预付额度在一年后过期,而另一些则永久有效。

此外,考虑机会成本。如果你预付 $1,000,你就锁定了这笔资金。如果 API 下个月提高价格,你已经支付了旧费率。这是一个好处,但前提是价格上涨显著。对于大多数中小用户,预付额度奖励提供了节省和灵活性的最佳平衡。始终在奖励后计算有效的每 token 费率以进行准确比较。

Token 估算指南

准确估算 token 使用量对于预算编制至关重要。一个常见的经验法则是 1,000 个 token 大约相当于 750 个英文单词。但是,这因语言和复杂性而异。特殊字符、代码和 JSON 结构可能有不同的 token 计数。始终使用你的特定数据类型进行测试。

在发送请求之前,使用 API 的 tokenizer 计算提示词中的 token。这允许你精确预测成本。例如,如果你的提示词是 500 个 token,你预计会有 200 个 token 的响应,你可以计算确切成本。将输入 token 乘以输入费率,将输出 token 乘以输出费率。

不要忘记考虑函数调用和系统消息。这些增加了用户经常忽略的 token。一个简单的系统消息“你是一个乐于助人的助手”可能是 10 个 token,但如果每次请求都发送,它会累积起来。根据预期的请求量和平均响应长度,估算你每月的总 token 使用量。这可以防止在计费周期结束时出现意外。

开放权重对成本的重要性

开放权重模型允许开发人员了解底层架构,这可能会影响成本效率。虽然 API 提供商托管模型,但知道它是开放权重的意味着定价通常更贴近实际计算成本,而不是专有利润率。专有模型可能包含品牌或独特功能的溢价。

此外,开放权重模型有时可以自行托管。如果你的使用量超过 API 能够负担的范围,你可以下载权重并在自己的 GPU 上运行它们。如果 API 价格上涨,这提供了一个清晰的退出路径。对于 API 而言,这种透明度建立了信任。用户知道他们不是在为“黑盒”溢价付费。

然而,自托管需要基础设施专业知识。对于大多数开发者而言,API 方式更具成本效益,因为存在规模经济。关键在于,开放权重性质确保了 API 定价具有竞争力且透明。你可以验证模型的功能和限制,确保其满足你的需求,且没有隐藏的限制。这种透明度在 LLM API 定价 格局中是一个显著优势。

问答

流式输出会改变 LLM API 请求的成本吗?

不,流式输出不会改变每 token 的成本。无论 token 是实时发送还是批量发送,计算负载是相同的。不过,请确保你的计费系统只统计成功交付的 token,以避免为丢失的流付费。

我如何估算 API 请求的 token 数量?

使用 API 提供商的 tokenizer 来计算你提示词和预期响应中的 token 数量。粗略估计约为每 750 个单词 1,000 个 token,但具体数值因语言和格式而异。务必使用你的特定数据类型进行测试以确保准确性。

LLM API 定价中是否有隐藏费用?

是的,常见的隐藏费用包括最低请求费用、突破速率限制时的超额费率,以及函数调用或系统消息的 token 计数。请务必阅读服务条款,以确切了解何时会对 token 进行计费。

为什么选择无审查 API 而不是 GPT 或 Claude?

无审查 API 通常提供更简单、更透明的定价,带有预付奖励且没有隐藏层级。它们还提供访问那些不会拒绝争议性话题的模型,这对于创意写作或研究等特定用例可能至关重要。

只差一张表单,即可获得密钥

创建账户,复制密钥,更改 Base URL。这就是全部设置。

获取 API 密钥