Ollama 在 GitHub 上的 star 数突破了 15 万。越来越多人开始在本地跑大模型了。
为什么选择本地
- 隐私:敏感数据不想上传到 OpenAI/Google
- 成本:API 调用积少成多,本地一次投入
- 离线:飞机上、没有网络的环境也能用
- 可控:可以微调、自由切换模型
M4 Ultra 的推动
苹果 M4 Ultra 的统一内存(256GB)让本地跑 400B 参数模型成为可能。而且在 MacBook 上跑完全静音——跟 Linux 服务器显卡风扇狂转的体验完全不同。
常见工具链
- Ollama:最方便的本地 LLM 运行器
- LM Studio:带 GUI,适合小白
- llama.cpp:性能最优,支持各种量化
- vLLM:生产级推理服务
局限
- 本地跑大模型还是慢(比 API 慢 3-5 倍)
- 笔记本跑 70B+ 模型会发烫
- 需要一定的技术门槛
但趋势很明显:AI 推理正在从「必须上云」变成「可以本地」。就像当年的个人电脑替代大型机一样。
参考来源:
评论
评论已关闭。