跳到主要内容

如何使用 Token

Token 是模型计费和上下文计算的基础单位。一次请求通常包含输入 Token、输出 Token,以及部分模型支持的缓存读写 Token。

Token 由什么组成

类型来源
输入 Token用户问题、历史对话、系统提示词、文件内容、工具返回内容
输出 Token模型生成的回答、代码、结构化 JSON 等
缓存写入 Token首次写入可复用上下文时产生
缓存读取 Token后续命中缓存时产生

不同模型的 Token 统计方式可能略有差异,最终以控制台记录为准。

查看用量

进入 控制台 查看请求日志和用量记录。排查成本时重点看:

  • 请求时间
  • API Key
  • 模型 ID
  • 输入 Token
  • 输出 Token
  • 最终费用
  • 错误状态和重试次数

设置额度

建议按项目和用途拆分 API Key,并设置额度上限。

Key 类型建议
本地开发较低额度,便于试错
第三方工具单独额度,避免插件异常消耗
生产业务按业务预算设置额度
临时测试用后及时停用或删除

成本控制建议

  • 不要把整个仓库无差别塞进上下文。
  • 长文档先分段摘要,再进行最终分析。
  • Agent 工具执行任务前,先明确范围。
  • 对批量任务设置并发限制。
  • 生产服务增加超时、重试和熔断。
  • 定期导出 Usage 明细。

常见高消耗原因

现象原因
输入 Token 很高工具读取了大量文件或历史对话太长
输出 Token 很高让模型生成了长报告、完整代码或大量 JSON
同一任务多次扣费Agent 自动重试或循环调用工具
费用集中在某个 Key多个工具共用了同一个 Key

处理异常消耗

  1. 立即停用异常 API Key。
  2. 查看请求日志,定位来源工具、IP 和模型。
  3. 为新 Key 设置更低额度和模型白名单。
  4. 检查代码仓库、环境变量、聊天记录中是否泄露 Key。
  5. 恢复业务前先用小额测试验证。