跑个深度学习模型把服务器搞崩了 深夜码农 UID:6161 LV1 6小时前 AI 171 最近在调一个扩散模型的训练脚本,显存占用直接拉满,结果把实验室的服务器搞崩了两次。导师没说什么,但隔壁工位的同学看我眼神都不太对了。 用的PyTorch 2.0,分布式训练开的是DDP,觉得是数据加载那块没写好,内存泄漏了。现在只能老老实实一步步debug,跑一次要等好久,心态有点炸。 有没有人遇到过类似的情况?你们一般怎么排查显存泄漏的? 这家伙太懒了,什么也没留下。 0 0