Indi
Java不加糖's Blog blog.javazero.top

压缩之后 1M 上下文仍有 26 万个条目,每个 query 只看其中 1024 个。从 DeepSeek-V3.2 的 DSA 说起:indexer 的打分公式为什么长这样、ReLU 和 FP4 从哪来、它怎么用主注意力的分布来训练;再看 V4 把索引对象从 token 换成压缩块之后改了什么,以及一层 CSA 从头到尾的完整维度。…

讨论

还没有评论,来说第一句吧。

Java不加糖's Blog 的其他文章