本地跑AI模型的正确姿势——2026年轻量推理选型指南

2024年本地跑大模型的场景还处于「能跑就行」的阶段。2026年的今天,我们已经过了那个阶段——现在的问题是选哪个、怎么跑、跑多大

这两年我折腾了所有主流方案:从抱着显卡跑的 llama.cpp 到一键装的 Ollama,从 GGUF 到 AWQ 量化,从 0.5B 的玩具模型到能实际干活的 7B。这篇文章把踩过的坑和验证过的结论汇总成一张选型地图。

你不需要8张A100。你也不需要16GB显存。你只需要一台上网本的算力,就能跑出一个有用的本地AI服务。

核心结论前置:Ollama 是大多数人的答案,llama.cpp 是进阶玩家的工具箱,MLC-LLM 是移动端的未来,其余方案各有场景但我不会无脑推荐。

下面展开说为什么。

道德是强者的镣铐——谁最需要被约束,谁最容易被放过

这个世界上有一条很少有人愿意明说的潜规则:

道德这件事,从来不是给所有人准备的。

如果你是一个普通人——月薪五千、没背景、没资源、没什么影响力——你道德高尚,你是个好人;你道德败坏,你最多也就坑几个身边的人。你坑不出什么大动静,因为你手里没家伙。

但如果你手里有家伙——有权、有资源、有话语权——你道德完蛋,那完蛋的就是不知道多少人。

道德从来不是一视同仁的标尺。它是一副镣铐,用来锁住那些真正有能力造成大规模伤害的人。 但讽刺的是,社会舆论最喜欢把镣铐往普通人脖子上套,对那些真正需要被锁住的人,反而恭恭敬敬地说:您请,您随意。

今天拆一下这个逻辑——为什么道德的本质是权力制衡器,以及它怎么被偷换成了普通人的精神枷锁。

法律的真相:它不是正义的化身,只是最后一张底牌

我从不反对法律。我反对的是把法律当信仰

信仰不需要逻辑,不需要证据,不需要质疑。而法律——它是由一群不完美的人制定、由另一群不完美的人执行、在充满利益博弈的社会里运行的规则系统。把它当信仰,是你对自己的不负责。

这篇文章不讲法理学的书袋子,只拆一个简单的底层逻辑:法律什么时候真的在伸张正义,什么时候只是权力的体面外衣。

Go HTTP 框架选型:标准库就够了,你纠结的是伪命题

我从 Go 1.0 开始写。十年间经历了 net/http 从「勉强能用」到「大部分场景够了」的转变。

2012 年你用标准库写 REST API,每个路由都要手写正则匹配,路径参数要自己从 URL 里抠,方法判断要写 if r.Method == "GET"。那时候第三方框架不是选择,是必需品。

2026 年的今天,Go 1.22 的路由增强已经出来两年了。很多人还在惯性选框架,没停下来看一眼标准库现在长什么样。

这篇不劝你不用框架,而是算一笔账——加一个框架的真正代价是什么,你买到了什么,你付出的值不值。

自建子网:用 Headscale 替代商业 VPN,从 SOCKS 到 WireGuard

你的 VPS 是 SOCKS 代理?没错,我也是这么过来的。

SSH -D 1080 hk-vps,浏览器设代理,够用了。但你知道这个模式的问题——它是一个单点穿透,不是网络。你的笔记本和 VPS 之间只有一条隧道,你的手机连不上,你的其他服务器连不上,你想让两台机器直接互访?不行。

WireGuard 可以解决这个问题。但 WireGuard 是点到点的,你要组 mesh 全网状,得自己维护配置、密钥、IP 分配。每个节点加进来,你得改所有其他节点的配置。

这就是为什么 Tailscale 存在——它在 WireGuard 上加了一层控制平面,自动协调密钥交换、IP 分配、NAT 穿透。

但 Tailscale 的官方控制服务器是闭源的。你用别人的服务器管理你的网络,等于把你的网络拓扑交给第三方。

Headscale 就是 Tailscale 控制服务器的开源替代。

你自建一个控制服务器(在你已有的 HK VPS 上),所有设备安装 Tailscale 客户端指向你的服务器,然后它们自动组成一个私有子网。你在郑州用笔记本直连 HK VPS,在手机上 SSH 回家里的机器,在任何地方访问你 VPS 上的服务——都是直连 WireGuard 加密隧道,不经过任何第三方。

下面一步步来。