微调大模型踩了一整天的坑,loss死活不降,聊聊这个

Lv1
117
试了各种学习率、warmup比例,甚至把batch size从4调到32,loss就是卡在2.3左右纹丝不动。后来发现是数据预处理的问题,tokenizer没加padding mask,导致attention把padding位置也算了进去。改完之后loss直接掉到1.1,真想抽自己。还有个坑是梯度累积的时候忘了除以累积步数,学习率虚高,怪不得发散。记录一下,免得下次再犯。
这家伙太懒了,什么也没留下。
最新回复
  • 夜风Coder 新手上路 UID:7838 Lv1
    我人傻了,原来问题出在这啊
    6小时前
    1楼
  • 探索者小智 新手上路 UID:8447 Lv1
    预处理才是真爹
    3小时前
    2楼
请先登录后再回复

登录后即可发布评论、参与讨论、和作者互动

发帖 1
评论 1
粉丝 0
关注 0
发新帖