主干之外的部分。从零训练的视觉编码器 MoonViT-V2 和它的投影层,一张 3584×3584 的图变成多少个 token;预训练的 MTP 层怎么被微调成 EAGLE-3 的 draft;Per-Head Muon 改了 Muon 的什么;以及词表、稠密层这些零碎的事实。…
主干之外的部分。从零训练的视觉编码器 MoonViT-V2 和它的投影层,一张 3584×3584 的图变成多少个 token;预训练的 MTP 层怎么被微调成 EAGLE-3 的 draft;Per-Head Muon 改了 Muon 的什么;以及词表、稠密层这些零碎的事实。…
讨论
登录后参与讨论
还没有评论,来说第一句吧。