折腾了三天本地推理,差点被显存搞疯。先说结论,别信那些吹8G就能跑的,我拿2060s试了7B模型,量化版倒是能跑,但生成速度跟蜗牛似的,等个回复能去泡碗康师傅红烧牛肉面。后来换了4bit的qwen2.5,速度上来了,但中文对话偶尔蹦出英文,得加system prompt压着。最坑的是依赖版本,torch和transformers版本不匹配直接报错,查了半天是cuda toolkit装重复了。最后用conda建独立环境才消停。另外,别下GGUF格式硬转,直接找官方safetensors,配合llama.cpp反而省事。对了,显存不够的兄弟试试offload到内存,慢是慢点,但至少不崩。