Indi
Java不加糖's Blog blog.javazero.top

KV cache 的大小是三个量相乘:每条多大、每个 token 几条、多少层各存一份。前两个量 V4 已经压过,CSA2 压第三个。这一篇把一层全局注意力拆成四样东西,看哪些能跨层共用,由此得到 Full、Reindex、Reuse 三种模式;再讲压缩算子和 indexer 相对 V4 的两处简化,共享池里谁写谁读,以及 38 层为什么只需要 4 份全局 KV。…

讨论

还没有评论,来说第一句吧。

Java不加糖's Blog 的其他文章