Indi
Java不加糖's Blog blog.javazero.top

主干之外的部分。从零训练的视觉编码器 MoonViT-V2 和它的投影层,一张 3584×3584 的图变成多少个 token;预训练的 MTP 层怎么被微调成 EAGLE-3 的 draft;Per-Head Muon 改了 Muon 的什么;以及词表、稠密层这些零碎的事实。…

讨论

还没有评论,来说第一句吧。

Java不加糖's Blog 的其他文章