在音频处理领域,WavLM是一个强大的预训练模型,可以提取高质量的音频特征表示。然而,在实际应用中,我们常常面临模型体积大、推理速度慢以及部署复杂等问题。本文将详细记录我对s3prl项目中的WavLM模型进行优化,包括简化推理过程、ONNX导出以及MNN转换(包括FP16和INT8量化)的过程,用于解决上面提到的问题。 代码仓库: https://github.com/vra/s3prl , RE…
在音频处理领域,WavLM是一个强大的预训练模型,可以提取高质量的音频特征表示。然而,在实际应用中,我们常常面临模型体积大、推理速度慢以及部署复杂等问题。本文将详细记录我对s3prl项目中的WavLM模型进行优化,包括简化推理过程、ONNX导出以及MNN转换(包括FP16和INT8量化)的过程,用于解决上面提到的问题。 代码仓库: https://github.com/vra/s3prl , RE…
讨论
登录后参与讨论
还没有评论,来说第一句吧。