mHC 的计算量很小,开销在读写残差流。这一篇从一个子层边界上最少要读写多少个数推出访存量的下界 (2n+2)d,算出 V4 的实现是下界的两倍,再一步步合并 kernel:先把归一化挪到投影之后,再让读算子改用上一个子层算好的权重。最后对照官方代码看这个改动落在哪三处。…
mHC 的计算量很小,开销在读写残差流。这一篇从一个子层边界上最少要读写多少个数推出访存量的下界 (2n+2)d,算出 V4 的实现是下界的两倍,再一步步合并 kernel:先把归一化挪到投影之后,再让读算子改用上一个子层算好的权重。最后对照官方代码看这个改动落在哪三处。…
讨论
登录后参与讨论
还没有评论,来说第一句吧。