Indi
Java不加糖's Blog blog.javazero.top

每四层一层的全局注意力。MLA 的低秩 KV 压缩按 K3 的真实维度走一遍,解释为什么 K3 敢让所有 MLA 层完全不带位置编码,满秩输出门是什么,3:1 这个比例怎么选出来的,以及 1M 上下文时 KV cache 和 KDA 状态各占多少。…

讨论

还没有评论,来说第一句吧。

Java不加糖's Blog 的其他文章