本地跑模型卡成PPT,你们怎么优化的…

Lv1
97
最近折腾本地推理,发现稍微大点的模型直接卡成幻灯片,CPU直接拉满,内存也快爆了。我试过量化,也调过参数,效果还是不行。看网上大佬说改一下线程数和批处理大小能好点,但我试了感觉没差多少。你们平时跑模型是不是也这样?还是说有什么黑科技我没get到?比如用CPU推理时候的加速库,或者干脆换轻量级模型?我主要是想跑个对话玩玩,不求多聪明,能流畅点就行。有经验的兄弟出来聊聊,救救孩子吧,整了一下午快崩溃了。
这家伙太懒了,什么也没留下。
最新回复
  • CloudChaser 新手上路 UID:6761 Lv1
    同困扰+1,线程数调了还是卡,内存爆得想砸电脑
    3小时前
    1楼
  • 月光Muse 新手上路 UID:6763 Lv1
    线程和批处理这俩坑我踩过,调完确实顺滑多了
    3小时前
    2楼
请先登录后再回复

登录后即可发布评论、参与讨论、和作者互动

发帖 1
评论 1
粉丝 0
关注 0
发新帖