返回博客

GPT-6 到底贵不贵:缓存、重试和路由后的真实成本算法

人工智能3078
GPT-6 到底贵不贵:缓存、重试和路由后的真实成本算法

新模型刚出现时,大家常问两个问题:每百万 Token 多少钱,是否比旧模型便宜。真正上线后,账单往往还会被缓存失效、失败重试、工具调用和人工返工改写,这两个数字远远不够。

真正需要预算的是一次任务从开始到验收通过花了多少资源。GPT-6 的官方价格在本文写作时未完成核验,下面提供一套不依赖具体单价的成本模型。

一、先定义任务级成本

text
任务成本 = 输入成本 + 输出成本 + 缓存成本 + 工具成本 + 重试成本 + 人工修正成本

如果模型失败后需要人工重做,单次调用价格再低也没有意义。

二、输入和输出分开记

至少记录:

字段说明
input_tokens本次输入 Token
output_tokens本次输出 Token
cached_tokens命中的缓存 Token
tool_calls工具调用次数
retries重试次数
human_minutes人工修正时间

不同模型的计费口径可能不同,不能把 Token 数直接当成价格。

三、缓存要记录命中条件

缓存是否生效,通常取决于前缀、时间窗、请求参数或提供方规则。

测试时记录:

text
缓存键或前缀版本。
第一次请求用量。
第二次请求用量。
缓存命中字段。
提示词和工具定义是否变化。

如果只看到第二次更快,不能直接证明缓存命中。

四、重试成本经常被忽略

失败重试可能来自:

text
网络超时。
限流。
工具参数错误。
结构化输出解析失败。
模型拒答后重新提问。

每类重试都要单独统计,因为有些属于基础设施,有些属于提示词或模型行为。

五、按任务路由,而不是按模型崇拜

可以把任务分成:

text
低复杂度格式转换。
普通问答和摘要。
长上下文分析。
高风险代码和决策任务。

不同任务使用不同模型或推理档位,前提是每条路由都有通过率和失败处理证据。

六、预算要绑定成功标准

不要只写“每天最多调用 1000 次”。

更有用的预算规则是:

text
每个任务最多重试 2 次。
一次验收未通过时转人工。
单任务成本超过阈值停止继续循环。
高风险任务不得因为超预算自动降级到未知模型。

预算和质量必须同时约束。

七、用任务级指标比较模型

推荐比较:

text
通过一次验收的平均成本。
通过样本的中位成本。
失败后的人工修正成本。
每个成功任务的总耗时。

“每 Token 便宜”不等于“每个结果便宜”。

八、建立成本记录表

task_idmodelinputoutputcacheretrieshuman_minstatustotal_cost
T-001baseline
T-002candidate

空白字段要从原始日志补齐,不要凭印象估算。

九、异常成本怎样排查

单日成本突然上升时,可以按顺序检查:

text
请求量是否变化。
输入上下文是否变长。
缓存是否失效。
重试次数是否增加。
路由是否切换到高成本模型。
人工修正是否变多。

不要看到总账上涨就直接限制所有任务。

先定位异常任务、时间段和模型,再决定是修复缓存、调整重试还是暂停某条路由。

十、路由变更要走回归

改变模型、提示词、缓存策略或重试次数,都可能改变成本和质量。

建议把路由配置纳入版本控制,并在变更后运行固定任务集。

十一、结论

十二、给财务和工程各留一份账

成本表最好同时服务两类人:

text
工程团队关注请求、缓存、重试和路由。
财务团队关注项目、周期、总额和预算偏差。

两边使用同一个 task_id,就能把技术日志和费用账单对齐。

如果无法对齐,先把“成本归因不完整”写进报告,不要用平均值替代真实任务成本。

GPT-6 成本评估不能只等一张价格表,而应先把任务、Token、缓存、重试和人工修正纳入同一张账。

当官方价格和模型 ID 真正确认后,只需把单价填入记录表,再按通过一次验收的总成本比较。这样得到的结论才适合指导企业路由和预算,而不是停留在宣传页数字。

标签:GPT-6成本核算缓存重试模型路由

推荐阅读

探索更多前沿洞察与行业干货。