本地跑模型卡成PPT,你们怎么优化的… Moonlight码农 UID:5872 Lv1 4小时前 AI 90 最近折腾本地推理,发现稍微大点的模型直接卡成幻灯片,CPU直接拉满,内存也快爆了。我试过量化,也调过参数,效果还是不行。看网上大佬说改一下线程数和批处理大小能好点,但我试了感觉没差多少。你们平时跑模型是不是也这样?还是说有什么黑科技我没get到?比如用CPU推理时候的加速库,或者干脆换轻量级模型?我主要是想跑个对话玩玩,不求多聪明,能流畅点就行。有经验的兄弟出来聊聊,救救孩子吧,整了一下午快崩溃了。 这家伙太懒了,什么也没留下。 0 0