新模型刚出现时,大家常问两个问题:每百万 Token 多少钱,是否比旧模型便宜。真正上线后,账单往往还会被缓存失效、失败重试、工具调用和人工返工改写,这两个数字远远不够。
真正需要预算的是一次任务从开始到验收通过花了多少资源。GPT-6 的官方价格在本文写作时未完成核验,下面提供一套不依赖具体单价的成本模型。
一、先定义任务级成本
如果模型失败后需要人工重做,单次调用价格再低也没有意义。
二、输入和输出分开记
至少记录:
| 字段 | 说明 |
|---|---|
| input_tokens | 本次输入 Token |
| output_tokens | 本次输出 Token |
| cached_tokens | 命中的缓存 Token |
| tool_calls | 工具调用次数 |
| retries | 重试次数 |
| human_minutes | 人工修正时间 |
不同模型的计费口径可能不同,不能把 Token 数直接当成价格。
三、缓存要记录命中条件
缓存是否生效,通常取决于前缀、时间窗、请求参数或提供方规则。
测试时记录:
如果只看到第二次更快,不能直接证明缓存命中。
四、重试成本经常被忽略
失败重试可能来自:
每类重试都要单独统计,因为有些属于基础设施,有些属于提示词或模型行为。
五、按任务路由,而不是按模型崇拜
可以把任务分成:
不同任务使用不同模型或推理档位,前提是每条路由都有通过率和失败处理证据。
六、预算要绑定成功标准
不要只写“每天最多调用 1000 次”。
更有用的预算规则是:
预算和质量必须同时约束。
七、用任务级指标比较模型
推荐比较:
“每 Token 便宜”不等于“每个结果便宜”。
八、建立成本记录表
| task_id | model | input | output | cache | retries | human_min | status | total_cost |
|---|---|---|---|---|---|---|---|---|
| T-001 | baseline | |||||||
| T-002 | candidate |
空白字段要从原始日志补齐,不要凭印象估算。
九、异常成本怎样排查
单日成本突然上升时,可以按顺序检查:
不要看到总账上涨就直接限制所有任务。
先定位异常任务、时间段和模型,再决定是修复缓存、调整重试还是暂停某条路由。
十、路由变更要走回归
改变模型、提示词、缓存策略或重试次数,都可能改变成本和质量。
建议把路由配置纳入版本控制,并在变更后运行固定任务集。
十一、结论
十二、给财务和工程各留一份账
成本表最好同时服务两类人:
两边使用同一个 task_id,就能把技术日志和费用账单对齐。
如果无法对齐,先把“成本归因不完整”写进报告,不要用平均值替代真实任务成本。
GPT-6 成本评估不能只等一张价格表,而应先把任务、Token、缓存、重试和人工修正纳入同一张账。
当官方价格和模型 ID 真正确认后,只需把单价填入记录表,再按通过一次验收的总成本比较。这样得到的结论才适合指导企业路由和预算,而不是停留在宣传页数字。




