上新

Jev 现已推出

模型价格

如何比较包含提示缓存的 API 价格

输入 token 单价不等于整段对话的成本。应计入普通输入、缓存读取、缓存写入和输出。若一百万总 token 中普通输入占 40%、缓存读取占 40%、输出占 20%,场景成本为 0.4 × 输入费率 + 0.4 × 缓存读取费率 + 0.2 × 输出费率。这是明确假设的场景,不是实测平均用量。

开始之前

  • 使用所选模型当前的每百万 token 费率;缓存支持和价格因模型而异。
  • 采用 Logs 中互不重叠的普通输入、读取、写入和输出计数。检查客户端的总输入是否已包含缓存 token。
创建 API 密钥

操作步骤

  1. 计算费用

    费用 =(普通输入 token × 输入费率 + 缓存读取 token × 读取费率 + 缓存写入 token × 写入费率 + 输出 token × 输出费率)/ 1,000,000。不要重复计算缓存 token。

  2. 比较相同负载

    40/40/20 场景对应的无缓存基线为 0.8 × 输入费率 + 0.2 × 输出费率。两者都包含一百万总 token 和相同输出比例;缓存场景不计初次写入。

  3. 代入实际用量

    在有代表性的请求样本中计入初次写入、未命中和后续读取。每百万总 token 有效成本 = 总费用 / 总 token × 1,000,000。比较供应商时保持模型、token 比例和计费类别一致。

检查结果

查看文档 cache-pricing 部分的当前逐模型场景价格,再与 Logs 对照。较低的读取费率只会节省实际命中缓存的 token 成本。

常见问题

  • 不能把缓存输入单价当作所有 token 的价格;普通输入和输出仍需计费。
  • 忽略缓存写入会高估短会话的节省;写入可能比普通输入更贵。
  • 假设的缓存命中比例不是保证折扣,也不是实测平均值。
  • 只有在相同负载与能力的当前比较中,才能限定条件地判断哪个供应商更便宜。

兼容性与计费

该场景不含缓存写入、托管、客户端订阅和其他非 token 费用,也不保证缓存命中。实际费用由 ApiClo 当前费率与用量决定;公式不承诺任何任务都能获得最低价格。

全部文档