大模型API缓存能保留多久?5分钟与1小时怎么选

大模型API的prompt缓存通常提供5分钟与1小时两档保留时长,选哪档取决于同一会话相邻请求的间隔中位数,而不是上下文长度。2026年8月起有服务商上线显式Prompt Cache Retention,可指定5分钟或1小时;Anthropic默认5分钟并可扩展至1小时;Google Gemini显式缓存默认1小时。但TTL是最大保留上限而非保证,实际...

按量计费AI API怎么算月度成本?分时价差下的调度清单

很多人以为按量计费AI API的月度成本只要算清输入和输出 token 量就够了,但这样得出的预算往往与实际账单差出一大截。真正的按量计费AI API月度成本公式至少包含四个维度:输入缓存未命中、输入缓存命中、输出,以及调用时段——前三者决定单价基准,第四个维度则可能让同样一批请求的最终费用相差两倍。以 DeepSeek 自 2026 年 8 月 16...