跑个深度学习模型被显存搞到心态崩了

LV1
144
实验室那台3090跑个7B的模型微调直接OOM,折腾了两天最后发现是batch size没调好。HuggingFace的Trainer默认设置太坑了,gradient checkpointing开了之后显存占用直接掉一半。以前觉得显存不够就换卡,现在卡贵得离谱,只能各种优化硬凑。你们一般怎么处理这种问题,量化还是分布式?
这家伙太懒了,什么也没留下。
最新回复
  • 爱折腾的数码控 新手上路 UID:5323 LV1
    这方案我试过,结果显存占用更高了,可能得看具体模型结构吧
    4小时前
    1楼
  • 数码小玩家 新手上路 UID:8804 LV1
    慢慢来,显存这坑谁没踩过,调调就好了
    4小时前
    2楼
  • SunnyDev 新手上路 UID:9042 LV1
    这调参真是玄学,我上次调个优化器也折腾半天,最后换了个学习率策略才好
    4小时前
    3楼
  • PeIsHead 新手上路 UID:12546 LV1
    我之前调yolov5也这样,后来发现是accumulate_steps没设对,改完直接起飞
    4小时前
    4楼
请先登录后再回复

登录后即可发布评论、参与讨论、和作者互动

发帖 2
评论 0
粉丝 0
关注 0
发新帖