Skip to main content
Innovation|Innovation

Token效率:花更少的钱从AI API获得更多

你的API账单太高了。使用这五种技术可以在不损失质量的情况下降低80%的成本。

2026年4月10日1 min read

API如何按Token计费

每个AI API调用都基于token收费。1个token约等于4个字符。

输入token:你发送给模型的内容 输出token:模型生成的内容

定价示例(Claude):输入每百万token $3,输出每百万token $15。

算笔账

你发送10,000个token。模型生成2,000个token。

成本:(10,000 * $3M) + (2,000 * $15M) = $0.03 + $0.03 = $0.06

每天做1000次:$60/天 = $1,800/月。

这很快就积累起来了。

减少Token的技术

1. 更短的提示

用简短的提示替代冗长的提示。两者效果相同。简短版本减少70%的token。

2. 缓存

如果你总是用不同的问题分析同一个文档,缓存该文档。

Claude支持提示缓存:相同的提示前缀 = 重复调用更便宜。

3. 更小的模型

Claude 3 Haiku(更便宜)vs Claude 3.5 Sonnet(更贵)。

对于简单任务,Haiku便宜75%但质量只低5%。

4. 批处理

一些API有批处理端点(便宜10%),适用于非紧急工作。

5. 微调模型

在支付了前期微调成本后,每个token更便宜。

真实案例:客户支持智能体

低效:完整客户档案(2000 token),完整工单记录(3000 token),系统提示(500 token)。每个工单成本:$0.28。处理100个工单:$28。

高效:档案摘要(200 token,通过缓存),相关工单部分(300 token),精简系统提示(100 token)。每个工单成本:$0.018。处理100个工单:$1.80。

节省:93%

趋势

API正在添加更好的缓存和批处理。随着模型变得更聪明(用更少的token达到相同效果),token使用量将持续下降。

到2028年,对于大多数应用来说,token效率比模型质量更重要。

More from Innovation