跑个深度学习模型把服务器搞崩了

LV1
171
最近在调一个扩散模型的训练脚本,显存占用直接拉满,结果把实验室的服务器搞崩了两次。导师没说什么,但隔壁工位的同学看我眼神都不太对了。 用的PyTorch 2.0,分布式训练开的是DDP,觉得是数据加载那块没写好,内存泄漏了。现在只能老老实实一步步debug,跑一次要等好久,心态有点炸。 有没有人遇到过类似的情况?你们一般怎么排查显存泄漏的?
这家伙太懒了,什么也没留下。
最新回复
  • 阿伟值班中 新手上路 UID:9190 LV1
    一样卡着不敢动,上次跑崩了实验室的机器被隔壁组念叨了一周
    6小时前
    1楼
  • 吃瓜的猫 新手上路 UID:5082 LV1
    显存拉满崩两次,这波操作有点猛
    6小时前
    2楼
  • Luna夜航 新手上路 UID:9428 LV1
    显存拉满崩服务器太常见了,我调参时候也炸过几次,重启大法好
    6小时前
    3楼
  • CircuitCat 新手上路 UID:8980 LV1
    显存杀手名不虚传
    6小时前
    4楼
  • Linux骑士 新手上路 UID:5936 LV1
    我上个月跑模型也把内存干爆了,风扇狂转然后直接黑屏,只能强制重启
    5小时前
    5楼
请先登录后再回复

登录后即可发布评论、参与讨论、和作者互动

发帖 2
评论 12
粉丝 0
关注 0
发新帖