推理部署推理性能、量化与成本优化

上下文缓存

复用相同前缀内容的计算结果以降低重复输入的成本。

上下文缓存按命中率大幅折扣缓存区 Token(如 DeepSeek 缓存命中价约为未命中的 1/10),对多轮对话、固定系统提示与长文档问答尤其划算。

相关术语