每四层一层的全局注意力。MLA 的低秩 KV 压缩按 K3 的真实维度走一遍,解释为什么 K3 敢让所有 MLA 层完全不带位置编码,满秩输出门是什么,3:1 这个比例怎么选出来的,以及 1M 上下文时 KV cache 和 KDA 状态各占多少。…
每四层一层的全局注意力。MLA 的低秩 KV 压缩按 K3 的真实维度走一遍,解释为什么 K3 敢让所有 MLA 层完全不带位置编码,满秩输出门是什么,3:1 这个比例怎么选出来的,以及 1M 上下文时 KV cache 和 KDA 状态各占多少。…
讨论
登录后参与讨论
还没有评论,来说第一句吧。