Indi
Yunfeng's Simple Blog vra.github.io

1. 原理说明 在跑LLM推理的时候,有时候会出现模型不断复读的现象,也就是模型一直输出同一个token或者token序列,不结束输出。transformers库中有一个参数 repetition_penality 专门针对此现象进行优化,通过将其设置为大于1.0的一个浮点数(如1.05, 1.1, 1.2等),有些情况下能缓解重复问题。 这个优化思路是在2019年的论文 CTRL 中提出的。 那…

讨论

还没有评论,来说第一句吧。

Yunfeng's Simple Blog 的其他文章