本地跑AI模型的正确姿势——2026年轻量推理选型指南
2024年本地跑大模型的场景还处于「能跑就行」的阶段。2026年的今天,我们已经过了那个阶段——现在的问题是选哪个、怎么跑、跑多大。
这两年我折腾了所有主流方案:从抱着显卡跑的 llama.cpp 到一键装的 Ollama,从 GGUF 到 AWQ 量化,从 0.5B 的玩具模型到能实际干活的 7B。这篇文章把踩过的坑和验证过的结论汇总成一张选型地图。
你不需要8张A100。你也不需要16GB显存。你只需要一台上网本的算力,就能跑出一个有用的本地AI服务。
核心结论前置:Ollama 是大多数人的答案,llama.cpp 是进阶玩家的工具箱,MLC-LLM 是移动端的未来,其余方案各有场景但我不会无脑推荐。
下面展开说为什么。