阿里 8 月 26 日开源 Qwen3.8-Flash-Next:125B MoE 模型、每 token 仅激活 6B 参数,训练成本约为 Qwen3.7-Plus 的九分之一,却首次公开了 Qwen4 的核心架构——GDN+QSA 混合注意力、门控残差、N-gram 嵌入与 Muon 优化器。…
阿里 8 月 26 日开源 Qwen3.8-Flash-Next:125B MoE 模型、每 token 仅激活 6B 参数,训练成本约为 Qwen3.7-Plus 的九分之一,却首次公开了 Qwen4 的核心架构——GDN+QSA 混合注意力、门控残差、N-gram 嵌入与 Muon 优化器。…
讨论
登录后参与讨论
还没有评论,来说第一句吧。