系统篇收尾。1M 上下文的 RL 和线上服务里,瓶颈从算力变成「状态放哪」:KV 块和 KDA 状态在 GPU 与 DRAM 池之间的 write-back,训练状态腾到 NVMe,参考模型权重借用梯度缓冲流进 GPU,沙箱的 pause / fork / snapshot,以及集群级的缓存亲和与预算准入。…
系统篇收尾。1M 上下文的 RL 和线上服务里,瓶颈从算力变成「状态放哪」:KV 块和 KDA 状态在 GPU 与 DRAM 池之间的 write-back,训练状态腾到 NVMe,参考模型权重借用梯度缓冲流进 GPU,沙箱的 pause / fork / snapshot,以及集群级的缓存亲和与预算准入。…
讨论
登录后参与讨论
还没有评论,来说第一句吧。