大模型每生成一个 token,都会用到前面的内容。如果每一步都从头计算,回答会慢很多。做 Agent 时,同一套 system prompt、工具定义和对话历史还会被反复携带;如果每次都重新处理,延迟… The post KV Cache 与 Prompt Cache:区别在哪,又有什么关系 appeared first on Jake blog .…
大模型每生成一个 token,都会用到前面的内容。如果每一步都从头计算,回答会慢很多。做 Agent 时,同一套 system prompt、工具定义和对话历史还会被反复携带;如果每次都重新处理,延迟… The post KV Cache 与 Prompt Cache:区别在哪,又有什么关系 appeared first on Jake blog .…
讨论
登录后参与讨论
还没有评论,来说第一句吧。