本地跑大模型显存不够折腾半天 ClBrandTrend UID:13063 LV1 2小时前 AI 106 折腾了一下午把ollama部署好,结果发现显卡8G显存跑个7B模型都费劲,量化版倒是能跑但效果跟原版差挺多。后来看贴吧老哥说用llama.cpp的mmap模式可以硬扛,试了下真的能跑但速度感人,生成一个字要等好几秒。觉得本地跑大模型还是得等显卡降价,现在这行情普通打工人真玩不起,老老实实用在线API得了。 这家伙太懒了,什么也没留下。 0 0