Indi
Java不加糖's Blog blog.javazero.top

系统篇收尾。1M 上下文的 RL 和线上服务里,瓶颈从算力变成「状态放哪」:KV 块和 KDA 状态在 GPU 与 DRAM 池之间的 write-back,训练状态腾到 NVMe,参考模型权重借用梯度缓冲流进 GPU,沙箱的 pause / fork / snapshot,以及集群级的缓存亲和与预算准入。…

讨论

还没有评论,来说第一句吧。

Java不加糖's Blog 的其他文章