跳到主要内容
极客日志极客日志面向AI+效率的开发者社区
首页博客我的书AI学习GitHub 精选镜像AI 生图工具UI配色美学关于
搜索内容 / 工具 / 仓库 / 镜像...⌘K搜索
注册
博客列表
PythonAI算法

本地大模型部署指南:Ollama 安装与 Python 调用

如何在本地部署 Ollama 大模型运行环境,并通过 Python 脚本进行调用。内容包括 Ollama 的安装步骤、常用命令速查、利用国内魔搭社区加速模型下载的方法、服务端口配置以及基于 OpenAI 库的 Python 调用示例。此外还涵盖了不同部署工具的对比、显存占用计算公式及常见问题解答,帮助用户快速上手本地大模型开发。

墨染流年发布于 2026/3/23更新于 2026/9/1210K 浏览
本地大模型部署指南:Ollama 安装与 Python 调用

本地大模型部署指南:Ollama 安装与 Python 调用

核心摘要: 工具:Ollama。目标:在本地电脑运行大模型并提供 API 给 Python 调用。方案:使用国内 ModelScope 替代 HuggingFace 实现极速下载。包含修改端口、显存计算公式及概念科普。

01. Ollama 介绍

官网地址:https://ollama.com/

Ollama 是目前最火的本地大模型部署工具。 简单来说,它能帮用户快速拉取模型文件,让模型在本地直接运行并进行对话。同时,它还能把模型打包成一个标准的接口,通过端口开放给用户写的 Python 脚本调用。

对于用户来说,它就是在大模型时代装在电脑里的'运行环境',必不可少。

02. 安装 Ollama

  1. 安装:打开下载好的安装包,选择一个合适的位置安装即可。

测试运行:按下 Win+R 打开运行窗口,输入 cmd 打开命令提示符。输入命令 ollama --version。如果看到版本号,就说明 Ollama 已经安装完毕,正在运行了。

run_cmd_command

check_ollama_version

验证:安装完毕后,开始菜单里会出现一个羊驼图标。

ollama_icon

选择版本:点击 Download 按钮,根据操作系统(Windows/Mac/Linux)下载。

download_ollama_via_platform

下载:登录官网 https://ollama.com/ 。

ollama_site

03. Ollama 常用命令速查

这些命令以后会经常用到:

场景命令示例备注
第一次下模型ollama run qwen3:7b会自动先 pull 再运行,一步到位
只下载不运行ollama pull llama3:8b适合提前囤模型
国内加速ollama pull modelscope.cn/Qwen/Qwen3-7B-GGUF推荐!下文会细讲
查看本地库存ollama list 或 ollama ls大小/ID/修改时间一目了然
删除省空间ollama rm llama2:latest支持通配符,可写 llama2:*
给模型改短名ollama cp qwen3:7b q7后面直接 ollama run q7 方便调用
查模型详情ollama show q7参数量、量化层、标签全列出

04. 下载模型(解决网速慢的问题)

Ollama 官网收录了很多模型,可以通过详情页复制命令下载,但由于服务器在海外,在国内访问经常断连,速度也很慢。

主流的模型平台是 HuggingFace,但它也在海外,国内下载需要网络代理工具。 解决方案:使用阿里的 魔搭社区 (ModelScope)。

  • HuggingFace 官网:https://huggingface.co/
  • ModelScope (魔搭) 官网:https://modelscope.cn/

操作步骤:

  1. 进入 HuggingFace 点击 Models,或者进入魔搭点击模型库。
  2. 回到命令提示符,加上前缀进行下载,显著提升下载速度:
    • 魔搭下载 (推荐): ollama pull modelscope.cn/Qwen/Qwen3-0.6B-GGUF
    • HuggingFace 下载:ollama pull hf.co/Qwen/Qwen3-0.6B-GGUF
  3. 下载完毕后,运行 ollama list 查看信息:

进入模型详情页,复制模型 ID,例如 Qwen/Qwen3-0.6B-GGUF。

click_to_copy_model_address

在搜索框输入想要的模型,比如 Qwen3-0.6B-GGUF。

注意:Ollama 目前主要支持 GGUF 格式,搜索时一定要带上这个后缀。

NAME ID SIZE MODIFIED modelscope.cn/Qwen/Qwen3-0.6B-GGUF:latest xxxxxxx xxx MB x ago 

05. 运行模型

在命令行工具输入 ollama run modelscope.cn/Qwen/Qwen3-0.6B-GGUF。 看到交互界面后,就可以顺利跟大模型对话了。

ollama_run_result

06. 更改服务端口(进阶)

Ollama 默认服务运行在端口 11434 上。如果在自己的服务器上部署,为了安全或避免端口冲突,可以修改它。

Windows 环境
  1. 设置环境变量:
    • 按下 Win + S,搜索'编辑账户环境变量'并打开。
    • 在'用户变量'部分,点击'新建'。
    • 变量名:OLLAMA_HOST
  2. 重新启动:从开始菜单重新运行 Ollama 软件。
  3. 检验:在浏览器输入 http://localhost:5656,如果显示 Ollama is running 说明端口修改成功了。

变量值:0.0.0.0:5656 (假设想改到 5656 端口,0.0.0.0 表示允许所有网卡访问)。

add_OLLAMA_HOST_to_env_vairable

退出 Ollama:在任务栏右下角的托盘图标上右键,选择 Quit Ollama。

quit_ollama

Linux 环境
  1. 执行命令:sudo systemctl edit ollama.service
  2. 在打开的编辑器中(通常是空白或带注释),加入以下内容:
[Service] Environment="OLLAMA_HOST=0.0.0.0:5656" 
  1. 保存并退出,然后重载并重启服务:
sudo systemctl daemon-reload
sudo systemctl restart ollama 

07. 在 Python 脚本中使用模型

为了运行连接 Ollama 的 Python 脚本,需要准备以下环境:

  • Python 版本:Python 3.8 以上
  • OpenAI 库依赖:在命令行输入 pip install openai

Ollama 完美兼容 OpenAI 的 API 格式,所以直接用 OpenAI 的库就行:

from openai import OpenAI

# 初始化客户端
client = OpenAI(
    # 这里的端口号要对应上面修改后的端口号,记得加上 /v1
    base_url='http://localhost:5656/v1',
    # Ollama 不需要真正的 Key,但这里随便填一个,不能留空
    api_key='ollama'
)

# 发起对话请求
response = client.chat.completions.create(
    # 填入在 ollama list 中看到的模型名称
    model="modelscope.cn/unsloth/Qwen3-0.6B-GGUF",
    messages=[
        {"role":"system","content":"你是一个有用的助手。"},
        {"role":"user","content":"你好,请简单介绍一下你自己。"}
    ]
)
print(response.choices[0].message.content)

08. 常见问题 (Q&A)

这里整理了入门时最关心的问题:

Q: 除了 Ollama 还有哪些方式可以部署,它们有什么差别? A:

  • LM Studio / AnythingLLM:带有图形界面的部署工具。适合完全不懂代码或者不想碰代码的初学者,也可以一键建立知识库做 RAG。
  • vLLM:高性能推理框架。通常用于服务器级别,速度极快,适合多人并发,工业级部署使用。
  • 差别:Ollama 更轻量,适合开发;LM Studio 胜在可视化;vLLM 胜在极致性能。

Q: Ollama 开机自动启动,要怎么关闭?关闭后如何手动启动? A:

  • Windows:右键点击任务栏图标 -> Quit Ollama 只是临时关闭。要彻底关闭自启,请在 任务管理器 -> 启动应用 中找到 Ollama 并设为禁用。
  • Linux:使用命令 sudo systemctl disable ollama 关闭自启。
  • 手动启动:Windows 直接运行桌面图标;Linux 执行 ollama serve 即可。

Q: HuggingFace 和魔搭 (ModelScope) 有什么区别? A:

  • Hugging Face (HF):全球最大的

目录

  1. 本地大模型部署指南:Ollama 安装与 Python 调用
  2. 01. Ollama 介绍
  3. 02. 安装 Ollama
  4. 03. Ollama 常用命令速查
  5. 04. 下载模型(解决网速慢的问题)
  6. 05. 运行模型
  7. 06. 更改服务端口(进阶)
  8. Windows 环境
  9. Linux 环境
  10. 07. 在 Python 脚本中使用模型
  11. 初始化客户端
  12. 发起对话请求
  13. 08. 常见问题 (Q&A)

更多推荐文章

查看全部
  • Gazebo 仿真环境搭建指南(Ubuntu 22.04)
  • 五大 AI 办公工具实战指南:豆包、即梦、剪映、飞书与扣子
  • Web 安全漏洞挖掘技巧指南
  • Raphael AI:用 Flux 模型驱动的免费图片生成器,无需注册无限制
  • 大模型核心面试题解析:Transformer、LoRA、RoPE 等关键技术
  • 基于 SpringBoot 的艺术展览网站设计与实现
  • MAVROS 安装配置与 ROS C++ 仿真实战指南
  • FPGA 实现高速数字信号处理的设计本质与实战
  • Windows 上安装 WSL Ubuntu 避坑指南:从报错到成功运行
  • GESP C++ 四级 2025 年 12 月真题深度解析
  • Java GUI 编程:Swing 与 JavaFX 入门实战
  • Python 到 AI 的完整成长路径:新手入门与实战指南
  • Kubernetes 调度 RTX 4090D 节点部署 PyTorch 2.8 运行 AIGC 任务
  • Python 爬虫自学指南:核心知识框架与实战思维导图
  • Windows Docker 安装与基础使用指南
  • 动态规划进阶:多状态模型与序列决策
  • Git 及 TortoiseGit 安装使用教程
  • Windows11 安装 Ubuntu 24.04.2 虚拟机教程(VMware 17.6.1)
  • 西门子 S7-1500 PLC 与 Fanuc 机器人焊装系统集成及 Profinet 通讯实现
  • 2024 第十六届蓝桥杯模拟赛第二期 Python 题解

相关免费在线工具

  • 加密/解密文本

    使用加密算法(如AES、TripleDES、Rabbit或RC4)加密和解密文本明文。 在线工具,加密/解密文本在线工具,online

  • RSA密钥对生成器

    生成新的随机RSA私钥和公钥pem证书。 在线工具,RSA密钥对生成器在线工具,online

  • Mermaid 预览与可视化编辑

    基于 Mermaid.js 实时预览流程图、时序图等图表,支持源码编辑与即时渲染。 在线工具,Mermaid 预览与可视化编辑在线工具,online

  • 随机西班牙地址生成器

    随机生成西班牙地址(支持马德里、加泰罗尼亚、安达卢西亚、瓦伦西亚筛选),支持数量快捷选择、显示全部与下载。 在线工具,随机西班牙地址生成器在线工具,online

  • Gemini 图片去水印

    基于开源反向 Alpha 混合算法去除 Gemini/Nano Banana 图片水印,支持批量处理与下载。 在线工具,Gemini 图片去水印在线工具,online

  • curl 转代码

    解析常见 curl 参数并生成 fetch、axios、PHP curl 或 Python requests 示例代码。 在线工具,curl 转代码在线工具,online