线上的 LLM 调用看多了,会发现请求高度重复:客服机器人翻来覆去就那几问,RAG 内部问答也扎堆。 按 token 计费的上游对着重复问题一遍遍生成,钱白烧,延迟也压不下来。 传统精确匹配缓存在自然语言面前几乎无命中——「怎么退货」和「退货流程是什么」字面不同、语义相同。 把 prompt-cache 这个 Go 项目的源码通读了一遍,架构、每个模块的做法、以及它没说透的风险,都记在这里。 定位…
线上的 LLM 调用看多了,会发现请求高度重复:客服机器人翻来覆去就那几问,RAG 内部问答也扎堆。 按 token 计费的上游对着重复问题一遍遍生成,钱白烧,延迟也压不下来。 传统精确匹配缓存在自然语言面前几乎无命中——「怎么退货」和「退货流程是什么」字面不同、语义相同。 把 prompt-cache 这个 Go 项目的源码通读了一遍,架构、每个模块的做法、以及它没说透的风险,都记在这里。 定位…
讨论
登录后参与讨论
还没有评论,来说第一句吧。