Token效率:花更少的钱从AI API获得更多
你的API账单太高了。使用这五种技术可以在不损失质量的情况下降低80%的成本。
API如何按Token计费
每个AI API调用都基于token收费。1个token约等于4个字符。
输入token:你发送给模型的内容 输出token:模型生成的内容
定价示例(Claude):输入每百万token $3,输出每百万token $15。
算笔账
你发送10,000个token。模型生成2,000个token。
成本:(10,000 * $3M) + (2,000 * $15M) = $0.03 + $0.03 = $0.06
每天做1000次:$60/天 = $1,800/月。
这很快就积累起来了。
减少Token的技术
1. 更短的提示
用简短的提示替代冗长的提示。两者效果相同。简短版本减少70%的token。
2. 缓存
如果你总是用不同的问题分析同一个文档,缓存该文档。
Claude支持提示缓存:相同的提示前缀 = 重复调用更便宜。
3. 更小的模型
Claude 3 Haiku(更便宜)vs Claude 3.5 Sonnet(更贵)。
对于简单任务,Haiku便宜75%但质量只低5%。
4. 批处理
一些API有批处理端点(便宜10%),适用于非紧急工作。
5. 微调模型
在支付了前期微调成本后,每个token更便宜。
真实案例:客户支持智能体
低效:完整客户档案(2000 token),完整工单记录(3000 token),系统提示(500 token)。每个工单成本:$0.28。处理100个工单:$28。
高效:档案摘要(200 token,通过缓存),相关工单部分(300 token),精简系统提示(100 token)。每个工单成本:$0.018。处理100个工单:$1.80。
节省:93%
趋势
API正在添加更好的缓存和批处理。随着模型变得更聪明(用更少的token达到相同效果),token使用量将持续下降。
到2028年,对于大多数应用来说,token效率比模型质量更重要。