FreeToken:让游戏本跑 284B MoE 的本地推理引擎(安装使用 + vLLM/Ollama 对比)
你手里有一张 8GB 显存的笔记本显卡,想跑 DeepSeek-V4-Flash(284B 参数)——正常人告诉你别做梦。Ollama 直接说显存不够,llama.cpp 硬塞进去速度掉到没法用,vLLM 压根是给机房准备的。
FreeToken 换了个思路:不把显存当模型仓库,把它当工作台。完整权重躺在系统内存里,GPU 用到哪个专家就现取哪个。于是 8GB 笔记本能跑 35B MoE,游戏台式机能跑 284B,一张 RTX PRO 6000 能跑 753B 的 GLM-5.2。这不是 PPT,是 2026 年 8 月刚发的论文(arXiv:2608.16157)+ 能装的 PyPI 包(freetoken 0.1.2,Apache-2.0)。
下面先讲它是什么,重点给你安装和使用的完整流程,最后和 vLLM、Ollama 摆在一起对比——结论先放这:三个工具根本不抢同一批用户。