Ollama 和本地大模型:为什么越来越多人选择在笔记本上跑 AI

Ollama 在 GitHub 上的 star 数突破了 15 万。越来越多人开始在本地跑大模型了。

为什么选择本地

  1. 隐私:敏感数据不想上传到 OpenAI/Google
  2. 成本:API 调用积少成多,本地一次投入
  3. 离线:飞机上、没有网络的环境也能用
  4. 可控:可以微调、自由切换模型

M4 Ultra 的推动

苹果 M4 Ultra 的统一内存(256GB)让本地跑 400B 参数模型成为可能。而且在 MacBook 上跑完全静音——跟 Linux 服务器显卡风扇狂转的体验完全不同。

常见工具链

  • Ollama:最方便的本地 LLM 运行器
  • LM Studio:带 GUI,适合小白
  • llama.cpp:性能最优,支持各种量化
  • vLLM:生产级推理服务

局限

  • 本地跑大模型还是慢(比 API 慢 3-5 倍)
  • 笔记本跑 70B+ 模型会发烫
  • 需要一定的技术门槛

但趋势很明显:AI 推理正在从「必须上云」变成「可以本地」。就像当年的个人电脑替代大型机一样。


参考来源:

关于 Zihao Zhang

后端开发工程师。关注 Java/Spring Boot/Redis/MySQL 技术栈,分布式系统,OLAP 数据库,AI Agent 开发与应用。

评论

评论已关闭。