零基础本地跑大模型:Ollama 完整上手教程

把大模型跑在自己电脑上有三个实在的好处:数据不出本地、没有调用费用、断网也能用。Ollama 是目前门槛最低的方案,下面这套流程照着做就行。

一、能不能跑?先看配置

模型规模 最低内存 体验
1.5B ~ 3B 8GB 流畅,适合摘要、分类
7B ~ 8B 16GB 推荐档位,日常够用
14B 32GB 明显更聪明,速度变慢
32B 以上 64GB+ 或独显 需要显卡加速

有独立显卡(8GB 显存以上)会快很多,但纯 CPU 也能跑,只是每秒输出的字数少一些。

二、安装

Windows / macOS 直接去官网下安装包,双击装完即可。Linux 一行命令:

bash
curl -fsSL https://ollama.com/install.sh | sh

装完打开终端,敲:

bash
ollama --version

有版本号输出就成了。

三、拉模型并对话

以一个 7B 中文模型为例:

bash
ollama run qwen2.5:7b

第一次会自动下载(几个 GB,耐心等)。下完直接进入对话界面,输入问题回车即可。退出敲 /bye

常用命令:

bash
ollama list              # 看已下载的模型
ollama pull <模型名>      # 只下载不运行
ollama rm <模型名>        # 删除模型释放空间
ollama ps                # 看当前加载的模型

四、选哪个模型?

  • 中文通用qwen2.5:7b,中文最顺,综合最均衡
  • 写代码qwen2.5-coder:7b,补全和改 bug 明显更强
  • 轻量快速qwen2.5:3b,老笔记本也能跑
  • 英文推理llama3.1:8b

不确定就先装 7B 通用款,不合适再换,删除很方便。

五、用 API 调用(重点)

Ollama 启动后会在本地开一个服务,默认端口 11434。这才是它真正的价值——任何程序都能调

最简单的 curl 测试:

bash
curl http://localhost:11434/api/generate -d '{
  "model": "qwen2.5:7b",
  "prompt": "用一句话解释什么是向量数据库",
  "stream": false
}'

Python 调用(兼容 OpenAI 格式,这点很关键):

python
from openai import OpenAI

client = OpenAI(
    base_url="http://localhost:11434/v1",
    api_key="ollama",   # 随便填,本地不校验
)

resp = client.chat.completions.create(
    model="qwen2.5:7b",
    messages=[{"role": "user", "content": "帮我写一段清理日志的 shell 脚本"}],
)
print(resp.choices[0].message.content)

因为兼容 OpenAI 接口,你现有的代码基本改一行 base_url 就能切到本地。

六、给模型定制人格

新建一个文件 Modelfile

text
FROM qwen2.5:7b

PARAMETER temperature 0.3

SYSTEM """
你是一名严谨的技术文档助手。
回答必须简洁,能用列表就不用段落,不确定的地方要明确说明。
"""

然后:

bash
ollama create mydoc -f Modelfile
ollama run mydoc

以后 mydoc 就是你的专属模型了。

七、几个新手常踩的坑

  • 下载卡住:国内网络建议配置镜像或代理,别硬等
  • 内存爆了:换小一号的模型,或者关掉浏览器再跑
  • 回答很傻:多半是模型太小,7B 是体验分水岭
  • 端口冲突:设环境变量 OLLAMA_HOST=0.0.0.0:11435 换端口
  • 想让局域网访问:同样设 OLLAMA_HOST=0.0.0.0,注意安全

八、下一步可以做什么

跑通之后,最有价值的两个方向:

  1. 接一个本地知识库(RAG),让它读你的文档再回答
  2. 接进现有工具,比如浏览器插件、笔记软件、代码编辑器

本地模型不会替代云端旗舰,但它给了你一个永远在线、绝对私密、零边际成本的助手。对很多场景来说,这就够了。