长上下文服务里一次前缀缓存 miss 比 hit 贵几个数量级,所以整条路径都围着缓存转:块哈希的前缀缓存怎么复用,KV 在 GPU、DRAM、SSD 之间按 write-through 还是 write-back 搬,集群层面怎么让请求跟着缓存走、又不被长请求的突发拖垮。…
长上下文服务里一次前缀缓存 miss 比 hit 贵几个数量级,所以整条路径都围着缓存转:块哈希的前缀缓存怎么复用,KV 在 GPU、DRAM、SSD 之间按 write-through 还是 write-back 搬,集群层面怎么让请求跟着缓存走、又不被长请求的突发拖垮。…
讨论
登录后参与讨论
还没有评论,来说第一句吧。