客服工单分流
从同一工单判断紧急程度、负责团队和严重性。
发送状态和类型化问题,在一个结构化响应中获得概率、选项或评分。
从同一工单判断紧急程度、负责团队和严重性。
选择下一队列或操作,并保留完整概率分布。
在工作流继续之前执行多个原子检查。
输入 token 单价不等于整段对话的成本。应计入普通输入、缓存读取、缓存写入和输出。若一百万总 token 中普通输入占 40%、缓存读取占 40%、输出占 20%,场景成本为 0.4 × 输入费率 + 0.4 × 缓存读取费率 + 0.2 × 输出费率。这是明确假设的场景,不是实测平均用量。
费用 =(普通输入 token × 输入费率 + 缓存读取 token × 读取费率 + 缓存写入 token × 写入费率 + 输出 token × 输出费率)/ 1,000,000。不要重复计算缓存 token。
40/40/20 场景对应的无缓存基线为 0.8 × 输入费率 + 0.2 × 输出费率。两者都包含一百万总 token 和相同输出比例;缓存场景不计初次写入。
在有代表性的请求样本中计入初次写入、未命中和后续读取。每百万总 token 有效成本 = 总费用 / 总 token × 1,000,000。比较供应商时保持模型、token 比例和计费类别一致。
查看文档 cache-pricing 部分的当前逐模型场景价格,再与 Logs 对照。较低的读取费率只会节省实际命中缓存的 token 成本。
该场景不含缓存写入、托管、客户端订阅和其他非 token 费用,也不保证缓存命中。实际费用由 ApiClo 当前费率与用量决定;公式不承诺任何任务都能获得最低价格。
全部文档