FreeToken:让游戏本跑 284B MoE 的本地推理引擎(安装使用 + vLLM/Ollama 对比)

你手里有一张 8GB 显存的笔记本显卡,想跑 DeepSeek-V4-Flash(284B 参数)——正常人告诉你别做梦。Ollama 直接说显存不够,llama.cpp 硬塞进去速度掉到没法用,vLLM 压根是给机房准备的。

FreeToken 换了个思路:不把显存当模型仓库,把它当工作台。完整权重躺在系统内存里,GPU 用到哪个专家就现取哪个。于是 8GB 笔记本能跑 35B MoE,游戏台式机能跑 284B,一张 RTX PRO 6000 能跑 753B 的 GLM-5.2。这不是 PPT,是 2026 年 8 月刚发的论文(arXiv:2608.16157)+ 能装的 PyPI 包(freetoken 0.1.2,Apache-2.0)。

下面先讲它是什么,重点给你安装和使用的完整流程,最后和 vLLM、Ollama 摆在一起对比——结论先放这:三个工具根本不抢同一批用户。

扶老人赔1.9万,官方认定店主无过错:善良如此艰难,和稀泥却赢了

8月24日,湖南祁东县司法局宣布介入调查「店主帮扶老人遭索赔」一事。店主儿子说,23日晚有关部门提出愿意把赔偿款补贴给他们,正在协商。

先把时间线摆清楚。8月17日,一位身体不适的老人进牌馆休息,晕倒。店主夫妻帮扶、打120、送医抢救。老人还是走了——糖尿病等多种基础疾病。然后家属索赔10万。派出所协商两次,降到1.9万,谈成。

再然后,官方说了三句话,一句比一句魔幻:店主无过错,不承担法律责任;有关部门愿意补贴店家;店家人道主义帮扶死者家属1.9万。

同一笔钱,三种说法。店主没罪,钱照赔。

这篇文章就说两件事:这钱该不该出,这案子会不会成为下一个彭宇案。

低配 CentOS 服务器初始化:别装宝塔,手动配置 firewalld + fail2ban

先给结论:1G 内存左右的低配服务器,不要装宝塔。 宝塔面板 + Nginx + PHP + MySQL 全家桶常驻,内存随便吃掉 300-500MB,低配机器直接喘不过气;而且面板是闭源的,出过不止一次安全事件。这套配置是我自己反复用的初始化流程:关 SELinux、换阿里云源、装基础工具、手动配 firewalld 开端口、fail2ban 防 SSH 爆破、再配一个 SSH 代理。全部命令贴出来就能用,没有图形界面,没有多余进程,每一行都知道在干什么。

适用对象:CentOS 7 的 VPS、1-2G 内存、跑博客/小服务/爬虫这类轻负载。跑生产大应用的出门右转,这篇文章帮不了你。

法律只保护体面人:社交博弈的第一课

公共场合有人吸烟,你上不上前制止?

这问题看着像道德题,其实是分类题。动手之前你得先搞清楚两件事:第一,你是体面人还是不体面人;第二,对方是体面人还是不体面人。顺序错了,或者判断错了,轻则挨骂挨打,影响几天心情,重则危及生命安全。这不是夸张,是成本账。

法律法规、道德规范这些东西,只能保护你免遭体面人的伤害,管不住不体面人。这不是谁坏谁好的问题,是威慑机制对两种人根本不生效的问题。想明白这一层,很多事你就不会再问「该不该」,只会问「是谁」。

SGLang 还是 vLLM?大模型推理框架选型,别只看 GitHub 星星

你要部署一个大模型服务。打开 GitHub,搜推理框架,跳出来两个项目:一个 89.8k 星,一个 32.3k 星。正常人第一反应:选星星多的。

先别急。这两个项目都是 UC Berkeley 出品——同一个学校,同一批方向的师兄弟。星星差三倍,不是因为差三倍,是因为一个出生早、一个定位野。

vLLM 靠 PagedAttention 起家,现在 89.8k 星,是生产部署的事实标准,Anyscale 在背后商业化。SGLang 靠 RadixAttention 出圈,现在 32.3k 星,性能上经常压着 vLLM 打,跟 DeepSeek、Qwen 绑得比谁都紧。

选哪个,取决于你的场景,不取决于星星数。这篇文章把两者的核心机制、实测性能、使用场景拆开讲清楚,最后给选型结论。