如何使用 Token
Token 是模型计费和上下文计算的基础单位。一次请求通常包含输入 Token、输出 Token,以及部分模型支持的缓存读写 Token。
Token 由什么组成
| 类型 | 来源 |
|---|---|
| 输入 Token | 用户问题、历史对话、系统提示词、文件内容、工具返回内容 |
| 输出 Token | 模型生成的回答、代码、结构化 JSON 等 |
| 缓存写入 Token | 首次写入可复用上下文时产生 |
| 缓存读取 Token | 后续命中缓存时产生 |
不同模型的 Token 统计方式可能略有差异,最终以控制台记录为准。
查看用量
进入 控制台 查看请求日志和用量记录。排查成本时重点看:
- 请求时间
- API Key
- 模型 ID
- 输入 Token
- 输出 Token
- 最终费用
- 错误状态和重试次数
设置额度
建议按项目和用途拆分 API Key,并设置额度上限。
| Key 类型 | 建议 |
|---|---|
| 本地开发 | 较低额度,便于试错 |
| 第三方工具 | 单独额度,避免插件异常消耗 |
| 生产业务 | 按业务预算设置额度 |
| 临时测试 | 用后及时停用或删除 |
成本控制建议
- 不要把整个仓库无差别塞进上下文。
- 长文档先分段摘要,再进行最终分析。
- Agent 工具执行任务前,先明确范围。
- 对批量任务设置并发限制。
- 生产服务增加超时、重试和熔断。
- 定期导出 Usage 明细。
常见高消耗原因
| 现象 | 原因 |
|---|---|
| 输入 Token 很高 | 工具读取了大量文件或历史对话太长 |
| 输出 Token 很高 | 让模型生成了长报告、完整代码或大量 JSON |
| 同一任务多次扣费 | Agent 自动重试或循环调用工具 |
| 费用集中在某个 Key | 多个工具共用了同一个 Key |
处理异常消耗
- 立即停用异常 API Key。
- 查看请求日志,定位来源工具、IP 和模型。
- 为新 Key 设置更低额度和模型白名单。
- 检查代码仓库、环境变量、聊天记录中是否泄露 Key。
- 恢复业务前先用小额测试验证。