稀疏矩阵向量乘法在申威众核架构上的性能优化 文章链接: 稀疏矩阵向量乘法在申威众核架构上的性能优化 - 中国知网 (cnki.net) 文章总结 固定划分方法 所有计算完再写回 子矩阵(任务)->子矩阵小块(核心计算) 将子矩阵小块中的非零元存储在一起,以适应申威处理器上的DMA操作。(Packing) 核心:寄存器通信->RMA 根据LDM大小提前计算,充分利用LDM空间,换句话说就是保证计算所…
稀疏矩阵向量乘法在申威众核架构上的性能优化 文章链接: 稀疏矩阵向量乘法在申威众核架构上的性能优化 - 中国知网 (cnki.net) 文章总结 固定划分方法 所有计算完再写回 子矩阵(任务)->子矩阵小块(核心计算) 将子矩阵小块中的非零元存储在一起,以适应申威处理器上的DMA操作。(Packing) 核心:寄存器通信->RMA 根据LDM大小提前计算,充分利用LDM空间,换句话说就是保证计算所…
讨论
登录后参与讨论
还没有评论,来说第一句吧。