主干之外的两头。输入端:从零训练的 DeepSeek-ViT,一张 1302 × 1302 的图怎么变成 994 个位置,文本和图像 token 为什么要各用一套负载均衡偏置。优化器:head-wise Muon 把 query 权重按头切开再正交化,用一个秩 1 的例子说明它改变了什么;Sinkhorn-balanced update 用行列交替归一化代替 Adam,只存一份动量就能训练 196…
主干之外的两头。输入端:从零训练的 DeepSeek-ViT,一张 1302 × 1302 的图怎么变成 994 个位置,文本和图像 token 为什么要各用一套负载均衡偏置。优化器:head-wise Muon 把 query 权重按头切开再正交化,用一个秩 1 的例子说明它改变了什么;Sinkhorn-balanced update 用行列交替归一化代替 Adam,只存一份动量就能训练 196…
讨论
登录后参与讨论
还没有评论,来说第一句吧。