Indi
李不言的博客 libuyan.top

阿里 8 月 26 日开源 Qwen3.8-Flash-Next:125B MoE 模型、每 token 仅激活 6B 参数,训练成本约为 Qwen3.7-Plus 的九分之一,却首次公开了 Qwen4 的核心架构——GDN+QSA 混合注意力、门控残差、N-gram 嵌入与 Muon 优化器。…

讨论

还没有评论,来说第一句吧。

李不言的博客 的其他文章