我把 AI 搬回本地:一台只处理文字数据的低成本「第二大脑」
一、为什么我把本地 AI「砍」到最省
很多人以为本地 AI 就是拿来画画、剪视频。我一开始也这么玩——ComfyUI 出图、Wan 做视频、Hunyuan3D 建模型,确实爽。但后来发现,我每天真离不开的,不是这些「做内容」的活,而是另一件事:让 AI 帮我翻资料、理数据。于是我把本地 AI 砍到最省——不画图、不发声,只处理文字和数据。一条纯文本的流水线,成本几乎为零,却是我最离不开的「第二大脑」。你懂我,就是那种「东西攥自己手里、还不用花冤枉钱」的踏实。
砍掉图像和声音,省下的不只是显存,更是三笔账:成本——纯文字对算力要求低,我那台 M1 Max 跑 32B 的 Qwen Q4 绰绰有余,长期边际成本趋近于零,不像云端按 token 一直计费;隐私——文字数据里往往藏着合同、财务、客户聊天,这些最不能外传;刚需——我真正要 AI 干的,是「懂我的资料」,不是「给我生成一张图」。
二、这条流水线长啥样(极简版)
主干就两块:Ollama 管「说话和推理」,再加一个本地向量库管「记性和翻找」。它们之间不联网,纯本机串起来。你丢进去的是语料和数据——Word、PDF、笔记导出、Excel 表,出来的就是「基于你这些真材料」的回答。没有图像、没有声音,干净利落。
对比我那条「媒体流水线」(出图、剪片),这条文秘流水线便宜得多、私密得多,也更像一门能交付的生意。两条都是本地 AI,但今天聊后面这条——它更省、更稳、也更值钱。
三、RAG:给大脑装一个「外挂记忆」
这套文秘流水线的核心,叫 RAG。我喜欢用一个老比喻讲它:天一阁 + 文秘处。天一阁你知道的,宁波那座古老的私人藏书楼——书不借外人,自己藏着、自己读。我的本地知识库就是一座「数字天一阁」:不存书,存我的语料、我的数据。RAG 就是我雇的「大臣」:我问一句,他进藏书楼翻找、研读,再出来禀报。所以 AI 答的,不是它脑子里背的东西,而是从我自己的藏书里翻出来的真材料。
白话点说:普通 AI 靠「背过的东西」答题,叫闭卷考试,没背到就瞎编(幻觉);RAG 是「开卷考试」——你先给它一摞自己的资料,它答题时当场翻,不靠记忆硬编。所以答案贴着你的真材料走。
四、本地 RAG vs 云端 RAG
为什么我说 RAG 是本地和云端之间最难跨的那道墙?因为 RAG 最值钱的,恰恰是你那堆「不能外传的私房资料」。区别基本一张表:
| 维度 | 云端 RAG | 本地 RAG(我这套) |
|---|---|---|
| 资料放哪 | 上传到服务商服务器 | 留在自己这台 Mac |
| 断网能用吗 | 不能 | 能 |
| 长期成本 | 按量 / 按席位收费 | 一次硬件投入,近乎零 |
| 隐私 | 资料经第三方 | 一滴不出本机 |
| 上手难度 | 低(点几下) | 中(要搭一下) |
| 最适合 | 公开资料、demo | 合同 / 客户 / 内部知识 |
我的 Mac 接上 RAG,等于在书房养了个「只认你资料、嘴还严」的助理:你问「去年卖得最好的三款是啥」,它翻的是你自己的销售表,不是网上搜来的。
五、上云的第一反应:隐私是不是泄露了?
一说「把资料交给 AI」,普通人第一反应根本不是什么「加密、脱敏、解密」——那是技术人才绕得过来的弯。绝大多数人脑子里蹦出来的就一句话:「我把资料传上云,那我的隐私是不是就泄露了?」 这个担心太正常了,因为它戳到了最朴素的痛点:我的东西,交出去了,还是我的吗?
先给结论:你的直觉没错,把整本私密资料直接丢给公开云,确实等于交了出去。但 RAG 有个巧妙的地方——你不是把整座藏书楼搬去云上,而是先在自家书房里翻出「最相关的几页」,只把这几页 + 问题寄给云模型。大教授根本看不到你整本书。
那如果资料敏感、连「几页」都不想外传呢?答案就两个字:脱敏。在把资料喂给 AI 之前,先把人名、身份证、金额、密码换成占位符(比如「客户A」「金额X」),本机留一张对照表。后面检索的、发出去的,都是脱敏版;答案回来,再换回真名。这一步放在最前面,比你先转向量再洗更稳。顺便说,加密不负责「让云看不懂」——它负责「防丢防偷」:本地磁盘加密(笔记本丢了别人也打不开)+ 传输走 HTTPS(自动加密)。真正的护城河,是「敏感的活留本地,聪明的活交给云」。
完整顺序是这样的(本地全绿、数据不出门,只有生成那一步可越界):① 准备材料 → ② 脱敏(人名/金额/密码→占位符,本地留对照表)→ ③ 切段(长文拆小段)→ ④ 转向量(每段变成一串能比对的编号)→ ⑤ 向量库(本地磁盘加密存放)→ ⑥ 检索(本地找最像的几段)→ ⑦ 生成(只送脱敏片段+问题给云模型,HTTPS 加密)→ ⑧ 还原(答案回来换回真名,本地)。你可能会问:转向量、建向量库我得懂吗?说实话,不用。你把它当「给每段话生成一个能比对的编号」就行;真正要你拍板的就两件事:资料放本地、敏感信息先脱敏。剩下的交给工具。
六、谁真的离不开这套(刚需清单)
不是所有人都需要,但这几类人,它是刚需:
① 个人知识盘活:800G 素材、笔记、健康表、基金数据散落各处,问一句就翻出来,死资料变活知识。
② 隐私资料查询:合同、客户聊天、财务数据——不能上云,本地 RAG 家底不出门还能问。
③ 低成本持续用:纯文字算力要求低,长期成本近乎零,对比云端按 token 收费是「一次投入长期免单」。
④ 断网 / 内网 / 出差:信号差、客户内网、出国,云端不能用,本地照常。
⑤ 让 AI 真懂「我」:通用 AI 不懂你的基金策略、健康节奏、短剧分发数据;RAG 让 AI 基于你的真材料答。
⑥ 对外服务 / 咨询:很多人不懂 RAG 但手里有资料想用好——我能帮别人搭本地知识库、做 RAG 咨询。想聊的,去 商业合作 找我。
七、想上手?最低门槛起步
别追顶配。最低门槛:一台带神经网络引擎的 Mac(M1 及以上都行),先装 Ollama 跑个小模型感受「本地聊天」,再接一个本地向量库(Chroma / Qdrant 这类),把一两个文件夹的笔记丢进去,问它一句话试试。第一个小目标别设太大——「今天让本机基于我的笔记答我一题」,成了,第二大脑就算接通了。
八、为什么本地才是「真拥有」
云端 AI 像租车,本地 AI 像买房。租车方便但永远不是你的,涨价、停产、断服你都得认;买房一次投入,之后随便用。数据不出本机、断网照样干、长期算下来几乎零边际成本——AI 这时候才像你家的一件家电。RAG 把这条分水岭推到极限:它能让 AI 用你的私房资料答题,而这件事一旦上云,家底就先交了出去。所以我的第二大脑,始终留在自己这台 Mac 上。