本地大模型部署指南:Ollama 安装与 Python 调用
核心摘要: 工具:Ollama。目标:在本地电脑运行大模型并提供 API 给 Python 调用。方案:使用国内 ModelScope 替代 HuggingFace 实现极速下载。包含修改端口、显存计算公式及概念科普。
01. Ollama 介绍
官网地址:https://ollama.com/
Ollama 是目前最火的本地大模型部署工具。 简单来说,它能帮用户快速拉取模型文件,让模型在本地直接运行并进行对话。同时,它还能把模型打包成一个标准的接口,通过端口开放给用户写的 Python 脚本调用。
对于用户来说,它就是在大模型时代装在电脑里的'运行环境',必不可少。
02. 安装 Ollama
- 安装:打开下载好的安装包,选择一个合适的位置安装即可。
测试运行:按下 Win+R 打开运行窗口,输入 cmd 打开命令提示符。输入命令 ollama --version。如果看到版本号,就说明 Ollama 已经安装完毕,正在运行了。


验证:安装完毕后,开始菜单里会出现一个羊驼图标。

选择版本:点击 Download 按钮,根据操作系统(Windows/Mac/Linux)下载。

下载:登录官网 https://ollama.com/ 。

03. Ollama 常用命令速查
这些命令以后会经常用到:
| 场景 | 命令示例 | 备注 |
|---|---|---|
| 第一次下模型 | ollama run qwen3:7b | 会自动先 pull 再运行,一步到位 |
| 只下载不运行 | ollama pull llama3:8b | 适合提前囤模型 |
| 国内加速 | ollama pull modelscope.cn/Qwen/Qwen3-7B-GGUF | 推荐!下文会细讲 |
| 查看本地库存 | ollama list 或 ollama ls | 大小/ID/修改时间一目了然 |
| 删除省空间 | ollama rm llama2:latest | 支持通配符,可写 llama2:* |
| 给模型改短名 | ollama cp qwen3:7b q7 | 后面直接 ollama run q7 方便调用 |
| 查模型详情 | ollama show q7 | 参数量、量化层、标签全列出 |
04. 下载模型(解决网速慢的问题)
Ollama 官网收录了很多模型,可以通过详情页复制命令下载,但由于服务器在海外,在国内访问经常断连,速度也很慢。
主流的模型平台是 HuggingFace,但它也在海外,国内下载需要网络代理工具。 解决方案:使用阿里的 魔搭社区 (ModelScope)。
- HuggingFace 官网:https://huggingface.co/
- ModelScope (魔搭) 官网:https://modelscope.cn/
操作步骤:
- 进入 HuggingFace 点击 Models,或者进入魔搭点击模型库。
- 回到命令提示符,加上前缀进行下载,显著提升下载速度:
- 魔搭下载 (推荐):
ollama pull modelscope.cn/Qwen/Qwen3-0.6B-GGUF - HuggingFace 下载:
ollama pull hf.co/Qwen/Qwen3-0.6B-GGUF
- 魔搭下载 (推荐):
- 下载完毕后,运行
ollama list查看信息:
进入模型详情页,复制模型 ID,例如 Qwen/Qwen3-0.6B-GGUF。

在搜索框输入想要的模型,比如 Qwen3-0.6B-GGUF。
注意:Ollama 目前主要支持 GGUF 格式,搜索时一定要带上这个后缀。
NAME ID SIZE MODIFIED modelscope.cn/Qwen/Qwen3-0.6B-GGUF:latest xxxxxxx xxx MB x ago
05. 运行模型
在命令行工具输入 ollama run modelscope.cn/Qwen/Qwen3-0.6B-GGUF。
看到交互界面后,就可以顺利跟大模型对话了。

06. 更改服务端口(进阶)
Ollama 默认服务运行在端口 11434 上。如果在自己的服务器上部署,为了安全或避免端口冲突,可以修改它。
Windows 环境
- 设置环境变量:
- 按下
Win + S,搜索'编辑账户环境变量'并打开。 - 在'用户变量'部分,点击'新建'。
- 变量名:
OLLAMA_HOST
- 按下
- 重新启动:从开始菜单重新运行 Ollama 软件。
- 检验:在浏览器输入
http://localhost:5656,如果显示Ollama is running说明端口修改成功了。
变量值:0.0.0.0:5656 (假设想改到 5656 端口,0.0.0.0 表示允许所有网卡访问)。

退出 Ollama:在任务栏右下角的托盘图标上右键,选择 Quit Ollama。

Linux 环境
- 执行命令:
sudo systemctl edit ollama.service - 在打开的编辑器中(通常是空白或带注释),加入以下内容:
[Service] Environment="OLLAMA_HOST=0.0.0.0:5656"
- 保存并退出,然后重载并重启服务:
sudo systemctl daemon-reload
sudo systemctl restart ollama
07. 在 Python 脚本中使用模型
为了运行连接 Ollama 的 Python 脚本,需要准备以下环境:
- Python 版本:Python 3.8 以上
- OpenAI 库依赖:在命令行输入
pip install openai
Ollama 完美兼容 OpenAI 的 API 格式,所以直接用 OpenAI 的库就行:
from openai import OpenAI
# 初始化客户端
client = OpenAI(
# 这里的端口号要对应上面修改后的端口号,记得加上 /v1
base_url='http://localhost:5656/v1',
# Ollama 不需要真正的 Key,但这里随便填一个,不能留空
api_key='ollama'
)
# 发起对话请求
response = client.chat.completions.create(
# 填入在 ollama list 中看到的模型名称
model="modelscope.cn/unsloth/Qwen3-0.6B-GGUF",
messages=[
{"role":"system","content":"你是一个有用的助手。"},
{"role":"user","content":"你好,请简单介绍一下你自己。"}
]
)
print(response.choices[0].message.content)
08. 常见问题 (Q&A)
这里整理了入门时最关心的问题:
Q: 除了 Ollama 还有哪些方式可以部署,它们有什么差别? A:
- LM Studio / AnythingLLM:带有图形界面的部署工具。适合完全不懂代码或者不想碰代码的初学者,也可以一键建立知识库做 RAG。
- vLLM:高性能推理框架。通常用于服务器级别,速度极快,适合多人并发,工业级部署使用。
- 差别:Ollama 更轻量,适合开发;LM Studio 胜在可视化;vLLM 胜在极致性能。
Q: Ollama 开机自动启动,要怎么关闭?关闭后如何手动启动? A:
- Windows:右键点击任务栏图标 ->
Quit Ollama只是临时关闭。要彻底关闭自启,请在 任务管理器 -> 启动应用 中找到Ollama并设为禁用。 - Linux:使用命令
sudo systemctl disable ollama关闭自启。 - 手动启动:Windows 直接运行桌面图标;Linux 执行
ollama serve即可。
Q: HuggingFace 和魔搭 (ModelScope) 有什么区别? A:
- Hugging Face (HF):全球最大的

