AI API 缓存
大模型 API 缓存价格:命中、写入、TTL 与存储费怎么算
按同一成本式拆解 Prompt Caching 与 Context Caching:OpenAI 的缓存用量、Claude 的写入/读取倍率、Gemini 的显式存储与隐式命中。
核心主题:大模型 API 缓存价格 · 搜索意图:Semrush US 邻近词“llm api pricing”:商务;本篇细分意图未由 Semrush 单独验证
Keyword evidence
Semrush US 关键词研究记录
文章主题词:大模型 API 缓存价格。仅用于选词与意图;不把 US 指标写成中国需求,不推断趋势。 no_data 保持原样,不换算为 0;趋势未导出数值,因此不展示或推断趋势。
| 角色 | 查询词 | 数据库 / 日期 | Volume | KD | Intent | CPC |
|---|---|---|---|---|---|---|
| 选定记录 | llm api pricing | US · 2026-08-29 | 110 | 43 | 商务 | $5.52 |
| 原词 no_data | 大模型 API 缓存价格 | US · 2026-08-29 | no_data | no_data | no_data | no_data |
先把缓存拆成四个可计量成本桶
跨厂商比较缓存时,至少需要记录普通输入、缓存创建或写入、缓存读取或命中、缓存存储四个桶。某家没有独立存储费时该项为零,而不是从账本删除;这样同一公式才能覆盖 Prompt Caching 与 Context Caching。
建议使用 C = U×Rᵤ + W×R𝓌 + H×Rₕ + S×T×Rₛ,其中 U、W、H 是 token 数,S×T 是 token-hours。费率必须绑定模型、地区、处理层和核验日期,正文不复制会变化的货币单价。
证据边界:本节以 S1 支持“官方指南说明缓存依赖完全一致的前缀,并给出 cached_tokens、cache_write_tokens 等 usage 口径。”。
- 普通输入 U
- 写入 W
- 命中 H
- 存储 S×T
命中由前缀稳定性决定,不由开关决定
OpenAI 与 Claude 的缓存都强调稳定前缀:系统说明、工具定义和长公共材料应放在前面,把用户变量放在后面。前缀任何早期变化都会扩大未命中范围,因此命中率要按模板版本和调用类型分组观察。
Gemini 还需要区分隐式命中与显式缓存资源。显式缓存有 TTL 和存储周期,隐式缓存更省操作但不保证命中;二者都应以响应 usage 为准,而不是把“已启用缓存”直接当作节省。
证据边界:本节以 S2 支持“官方指南解释 cache_control、缓存写入与读取 usage、TTL 及前缀失效条件。”。
用回本次数和有效命中率做决策
一次缓存写入是否值得,取决于写入溢价、命中读取费率、预计复用次数与 TTL 内的请求分布。可用 N_break-even = 写入增量成本 ÷ 单次命中节省额估算门槛,再用历史有效命中率修正,而不是用理论最大复用次数。
对 Gemini 显式缓存还要加入 token-hours;对 Claude 要区分不同 TTL 的写入倍率;对 OpenAI 要核对 usage 中缓存相关 token。规则核验于 2026-08-29,实际倍率和支持模型应在部署前重新读取官方页。
证据边界:本节以 S3 支持“官方指南区分隐式缓存和显式缓存资源,并说明 TTL 与 token-hours 存储成本。”。
把缓存观测接入成本与容量看板
每次调用记录 template_hash、model、uncached_tokens、cache_write_tokens、cache_read_tokens、storage_token_hours 与 total_cost。命中率应同时展示 token 加权值和请求加权值,避免大量短请求掩盖少数长上下文未命中。
缓存也会改变限流容量:部分厂商对缓存读取 token 的限流处理不同,Batch 与缓存的价格修饰项也不一定以相同方式叠加。成本优化上线前应分别验证计费账单和 429 行为,并为前缀变更准备冷启动预算。
落地检查清单
工程落地时,为“大模型 API 缓存价格”建立独立 article_run_id,并保存 selected_semrush_record、database、measured_on、source_snapshot_ids、content_hash、reviewer 与 gate_status。Semrush 字段只参与选词和意图决策,不进入价格公式,也不把 US 指标解释成中文或中国市场需求。
论点账本必须逐条可回放:S1 对应 C1:“Prompt cache 命中依赖稳定且完全一致的前缀,不能把缓存描述成任意内容的自动折扣。”;S3 对应 C2:“显式缓存可能同时产生创建或写入、读取与按 TTL 的存储成本,回本分析必须拆开计算。”。编辑器在段落层写入 evidenceRefs,构建检查确认引用 ID 存在;来源页面发生结构变化时,只把对应论点退回复核,不让整篇文章静默继承旧快照。
动态复核字段包括:最低缓存 token、TTL、写入与读取倍率、Gemini 隐式/显式缓存可用模型与 token-hours 价格。发布任务应读取当前页面、保留原始单位和地区、与上一快照做字段级 Diff,并记录核验日期 2026-08-29。缺失、受限或无法确认的值保持 null 或“待复核”,不使用 0、均值或相邻产品代填。
独立 SVG 采用“命中率与复用次数对缓存回本点的影响”结构,输入维度为:写入单价、读取单价、存储单价、TTL、复用次数、有效命中率。图表只绘制有来源的数据,缺失项显示空缺;alt、caption、图内标题与正文使用同一术语,并在图注标明动态字段核验日期。
证据与来源链接
以下页面用于支持本文中的具体判断;价格、规则和产品状态可能变化,请按核验日期回到原始来源确认。
支持内容:官方指南说明缓存依赖完全一致的前缀,并给出 cached_tokens、cache_write_tokens 等 usage 口径。
支持内容:官方指南解释 cache_control、缓存写入与读取 usage、TTL 及前缀失效条件。
支持内容:官方指南区分隐式缓存和显式缓存资源,并说明 TTL 与 token-hours 存储成本。
相关文章
AI API 成本
AI API 价格对比:以 LLM API Pricing 证据统一 Token、缓存与工具费
不把厂商价目表机械拼在一起,而是统一 token 桶、缓存、Batch、工具费、错误重试和费率版本,再比较同一 AI 任务的可复核成本。
AI Token 成本
大模型 API Token 计费:从预估到 usage 对账的完整账本
把三家 AI API 的请求前估算与响应后 usage 映射为统一账本,避免用字符估算或单一每百万 token 价格替代真实任务成本。
AI Batch API
Batch API Pricing:大模型批处理折扣、状态机与失败重放
比较三家官方 Batch 的价格修饰、处理窗口、输入格式、队列限制和逐项失败,并把离线 AI 任务折算成每个成功结果的真实成本。
常见问题
大模型 API 开启缓存后一定更便宜吗?
不一定。低复用、频繁改前缀、TTL 过长或显式存储闲置都可能让写入与存储成本超过命中节省,应以实际 usage 和回本次数判断。
三家 AI API 的缓存命中率可以直接比较吗?
先统一为 token 加权命中率,并保留各家的写入、读取、存储和限流语义。只比较请求命中次数会丢失上下文长度差异。
大模型 API 缓存价格:命中、写入、TTL 与存储费怎么算中的动态价格或规则怎样保持可复核?
每次更新都重新读取“最低缓存 token、TTL、写入与读取倍率、Gemini 隐式/显式缓存可用模型与 token-hours 价格”,保存来源 URL、核验日期、原始单位、地区和快照哈希,并按 evidenceRefs 定位受影响段落。后续若字段消失或规则变化则进入更新复核,不用 0、旧数字或相邻产品自动补位。