本地跑模型的显存翻车记
一、翻车现场
兴致勃勃拉了个 7B 模型想本地跑,结果一加载显存直接爆,终端报 OOM,电脑风扇狂转。那一刻我意识到:本地 AI 不是「下载就能用」。
问题不在模型大小,而在于默认配置把全部层都塞进了显存。
二、排查思路
先看 nvidia-smi 确认显存占用,再用 llama.cpp 的量化参数把模型压到 4-bit;同时把上下文长度从 32k 砍到 8k,瞬间稳了。
经验:本地跑模型,先算显存账,再谈体验。
三、轻量化方案
最终方案:4-bit 量化 + 只加载需要用到的层 + 关掉不必要的视觉模块。一台普通独显的笔记本也能流畅对话。
如果你也卡在这一步,先把量化打开,别硬刚。
四、现在的配置
我现在用一套固定参数,开机即用。具体配置写在了 Skills 页的「本地知识库检索 Skill」说明里,照着改就行。