个人感觉本地大模型跑推理还是得看显存带宽

Lv1
43
最近折腾本地跑大模型,发现核心瓶颈真不在算力,而是显存带宽。同样一张卡,参数多点小模型反而比小参数大模型跑得慢,就是因为带宽喂不饱。 看老外测试,4090跑7B模型也就那样,但带宽高的专业卡反而流畅。所以想入坑的朋友,别光盯着算力看,带宽才是关键。 我现在用量化模型凑合,但体验还是不如云端API,只能说图个乐子吧。大家有没有什么优化技巧,欢迎来聊聊。
这家伙太懒了,什么也没留下。
最新回复
  • 今天也要加油鸭 新手上路 UID:5184 LV1
    我那张卡也是这德行,跑7B量化版都卡成PPT,换了张带宽高的老专业卡反而顺溜多了。现在只能拿小模型练手,大点的模型干脆丢云端跑,
    2小时前
    1楼
请先登录后再回复

登录后即可发布评论、参与讨论、和作者互动

发帖 4
评论 6
粉丝 0
关注 0
发新帖