跳到主要内容
极客日志极客日志面向AI+效率的开发者社区
首页博客我的书AI学习GitHub 精选镜像AI 生图工具UI配色美学关于
搜索内容 / 工具 / 仓库 / 镜像...⌘K搜索
注册
博客列表
PythonAI算法

Ollama 本地 AI 大模型部署与使用指南

Ollama 是一款开源的本地大模型管理工具,支持在 Windows、macOS 和 Linux 上运行。 Ollama 的核心优势、系统要求及多平台安装步骤。内容涵盖常用命令详解、热门模型推荐(如 Llama 3、Qwen)、实战案例(编程助手、文档分析)以及进阶配置(Open WebUI、API 调用)。通过本地部署,可实现数据隐私保护、离线可用及零成本使用。

赛博行者发布于 2026/4/6更新于 2026/9/1280 浏览
Ollama 本地 AI 大模型部署与使用指南

为什么需要本地部署大模型?

在 AI 越来越普及的今天,ChatGPT、Claude 等云端 AI 工具虽然好用,但总面临以下问题:

问题说明
🔒 数据隐私公司代码、文档不敢随便传到云上,怕有泄露风险
🌐 网络依赖每次调用都要走网络,请求慢、还容易超时
💰 使用成本API 调用费用高,频繁使用成本惊人
🔑 管理复杂API Key 管理麻烦,团队协作容易乱

本地大模型(Local LLM)刚好解决这些问题:

  • ✅ 数据不出本机:代码、日志、业务文档都在本机里跑,隐私安全
  • ✅ 速度稳定:只要电脑性能够,不用担心网络波动
  • ✅ 成本清晰:除了机器本身,没有额外调用费用
  • ✅ 离线可用:断网也能正常使用

什么是 Ollama?

Ollama 是一个开源、免费的本地化大型语言模型管理工具,让普通用户也能在个人电脑上轻松运行先进的 AI 模型。

文章配图

核心特点
特点说明
📦 一键部署无需配置 Python 环境、CUDA、依赖库
🔄 自动量化自动下载 GGUF 4-bit 量化模型,节省显存
💻 跨平台Windows/macOS/Linux 全支持
🚀 简单易用一行命令即可运行大模型
🔌 API 支持提供标准 REST API,方便集成开发
📚 模型丰富支持 480+ 开源模型
工作原理

就像用 Docker 管理容器化应用一样,Ollama 把 AI 模型的权重、配置和运行环境打包成了"一站式解决方案"。你不需要写一行 Python 代码,只需要一行命令就能在本地跑起大模型。

传统部署方式Ollama 部署方式
❌ 安装 Python、配置 CUDA、下载权重文件、编写运行代码✅ 下载安装包、双击安装、一行命令

系统要求与前置准备

在开始前,花 10 秒检查你的设备是否满足最低要求,避免白忙活:

硬件要求
配置最低要求推荐配置说明
CPU4 核及以上8 核及以上现在的电脑基本都满足
内存8GB16GB+内存越大,能跑的模型越大
硬盘10GB 空闲50GB+模型文件需要占用空间
GPU非必需NVIDIA 显卡有 GPU 推理速度更快
模型大小与硬件对应关系
模型参数量内存需求适合场景
1B - 3B2-4GB简单对话、低配电脑
7B - 8B6-8GB日常使用、主流选择
14B - 32B12-24GB专业任务、高性能电脑
70B+48GB+企业级、多卡服务器
系统版本要求
  • Windows:Windows 10 或更高版本(推荐 Windows 11)
  • macOS:macOS 12 (Monterey) 或更高版本
  • Linux:Ubuntu 20.04+、Debian 11+、CentOS 7+

Ollama 安装教程(Windows/Mac/Linux)

Windows 安装步骤
方法一:官网下载安装(推荐)

步骤 1:下载安装包

访问 Ollama 官网下载页面:https://ollama.com/download

或者直接下载 Windows 安装包:OllamaSetup.exe

💡 国内用户提示:如果官网下载速度慢,可以使用镜像源或加速链接

步骤 2:运行安装程序

  1. 双击下载的 OllamaSetup.exe 文件
  2. 系统可能会弹出安全警告窗口,点击 "运行"
  3. 点击 "Install" 开始安装
  4. 等待安装完成(约 1-2 分钟)

步骤 3:验证安装

打开命令提示符(CMD)或 PowerShell,输入:

ollama --version 

如果显示版本号,说明安装成功!

方法二:命令行安装

以管理员身份打开 PowerShell,执行:

iwr -useb https://ollama.com/install.ps1 | iex 
macOS 安装步骤
方法一:DMG 安装包安装

步骤 1:下载安装包

访问官网下载 macOS 版本:Ollama.dmg(适配 macOS 14 Sonoma 及更高版本)

步骤 2:安装

  1. 双击下载的 .dmg 文件
  2. 将 Ollama 图标拖拽到 Applications 文件夹
  3. 在应用程序中打开 Ollama

步骤 3:验证安装

打开终端(Terminal),输入:

ollama --version 
方法二:命令行安装

打开终端,执行:

curl -fsSL https://ollama.com/install.sh | sh 
Linux 安装步骤
Ubuntu/Debian 系统

步骤 1:执行安装命令

curl -fsSL https://ollama.com/install.sh | sh 

步骤 2:验证安装

ollama --version 

步骤 3:检查服务状态

systemctl status ollama 
其他 Linux 发行版

也可以使用 Docker 方式安装:

docker run -d -v ollama:/root/.ollama -p 11434:11434 --name ollama ollama/ollama 
安装成功验证

安装完成后,执行以下命令验证:

# 1. 检查版本号
ollama --version 
# 2. 检查服务是否运行
curl http://localhost:11434 # 出现 "Ollama is running" 说明安装成功!

常用命令详解

Ollama 的命令非常简单,掌握以下几个核心命令就能轻松使用:

模型管理命令
# 下载并运行模型(最常用!)
ollama run <模型名>
# 示例:运行 Llama 3 模型
ollama run llama3

# 仅下载模型但不运行
ollama pull <模型名>
# 示例:下载 Qwen 模型
ollama pull qwen2.5

# 查看本地已安装的模型列表
ollama list

# 删除本地模型(释放空间)
ollama rm <模型名>
# 示例:删除 llama3 模型
ollama rm llama3
模型运行命令
# 运行模型并进入交互对话
ollama run <模型名>

# 运行模型并传入单条消息
ollama run <模型名> "你好,请介绍一下你自己"

# 运行模型并指定参数
ollama run <模型名> --num_ctx 4096 --temperature 0.7

# 后台运行模型服务
ollama serve
系统信息命令
# 查看 Ollama 版本
ollama --version

# 查看正在运行的模型
ollama ps

# 查看模型详细信息
ollama show <模型名>

# 复制模型(创建副本)
ollama cp <源模型> <目标模型>
常用参数说明
参数说明默认值
--num_ctx上下文长度(token 数)2048
--temperature生成温度(越高越随机)0.8
--num_predict最大生成 token 数128
--top_k采样时考虑的候选词数量40
--top_p核采样概率阈值0.9

2026 年热门模型推荐

Ollama 支持 480+ 开源模型,以下是 2026 年最值得推荐的模型:

综合推荐榜
模型名称参数量适合场景内存需求推荐指数
Llama 3.370B通用推理、英文任务48GB+⭐⭐⭐⭐⭐
Qwen3.532B中文场景、复杂推理24GB⭐⭐⭐⭐⭐
DeepSeek-R132B强推理、代码生成24GB⭐⭐⭐⭐⭐
Qwen2.5-Coder32B代码专用24GB⭐⭐⭐⭐
Llama 3.18B日常使用、低配电脑6GB⭐⭐⭐⭐
按场景选择模型
通用对话/日常使用
# 轻量级(低配电脑)
ollama run llama3.1:8b
# 平衡型(主流配置)
ollama run llama3.3:70b
# 中文优化
ollama run qwen3.5:32b
代码编程
# 代码专用模型
ollama run qwen2.5-coder:32b
# 通用代码能力
ollama run deepseek-coder:6.7b
复杂推理
# 强推理模型
ollama run deepseek-r1:32b
# 思考链模式
ollama run qwen3-max-thinking
多语言支持
# 多语言模型
ollama run gemma3:7b
# 中文优化
ollama run qwen2.5:14b
新手推荐入门模型

对于第一次使用 Ollama 的用户,推荐从以下模型开始:

# 入门首选:轻量、快速、效果好
ollama run llama3.2:3b
# 中文用户推荐
ollama run qwen2.5:7b
# 平衡性能和资源
ollama run mistral:7b

实战案例:打造你的私人 AI 助手

案例一:本地编程助手

场景:作为开发者,想要一个能理解项目代码、帮助写代码的 AI 助手,但担心代码泄露。

步骤 1:下载代码专用模型

ollama pull qwen2.5-coder:32b 

步骤 2:创建对话

ollama run qwen2.5-coder:32b 

步骤 3:开始使用

>>> 请帮我写一个 Python 函数,用于计算斐波那契数列
def fibonacci(n):
    if n <= 0:
        return []
    elif n == 1:
        return [0]
    fib_list = [0, 1]
    for i in range(2, n):
        fib_list.append(fib_list[i-1] + fib_list[i-2])
    return fib_list

# 使用示例
print(fibonacci(10)) # 输出:[0, 1, 1, 2, 3, 5, 8, 13, 21, 34]

优势:代码完全在本地处理,不用担心泄露到云端!


案例二:文档分析助手

场景:需要分析大量本地文档,但不想上传到云端。

步骤 1:下载适合长文本的模型

ollama pull qwen3.5:32b 

步骤 2:使用 Ollama API 读取文件

创建一个 Python 脚本 doc_analyzer.py:

import requests

def analyze_document(file_path, prompt):
    # 读取文件内容
    with open(file_path, 'r', encoding='utf-8') as f:
        content = f.read()
    
    # 调用 Ollama API
    response = requests.post(
        'http://localhost:11434/api/generate',
        json={
            'model': 'qwen3.5:32b',
            'prompt': f'{prompt}\n\n文档内容:\n{content}',
            'stream': False
        }
    )
    return response.json()['response']

# 使用示例
result = analyze_document('report.txt', '请总结这份文档的主要内容')
print(result)

步骤 3:运行脚本

python doc_analyzer.py 

案例三:离线翻译工具

场景:需要翻译敏感文档,不能联网。

# 下载多语言模型
ollama run gemma3:7b "请将以下内容翻译成英文:你好,今天天气很好"

进阶配置:可视化界面与 API 调用

安装可视化界面(Open WebUI)

Ollama 默认是命令行界面,如果想要类似 ChatGPT 的网页界面,可以安装 Open WebUI:

步骤 1:使用 Docker 安装

docker run -d -p 3000:8080 \ 
--add-host=host.docker.internal:host-gateway \ 
-v open-webui:/app/backend/data \ 
--name open-webui \ 
--restart always \ 
ghcr.io/open-webui/open-webui:main 

步骤 2:访问界面

浏览器打开:http://localhost:3000

步骤 3:配置 Ollama 连接

在设置中添加 Ollama 服务地址:http://host.docker.internal:11434

API 调用示例

Ollama 提供标准的 REST API,方便集成到其他应用:

Python 调用示例
import requests

# 简单对话
response = requests.post(
    'http://localhost:11434/api/generate',
    json={
        'model': 'llama3',
        'prompt': '你好,请介绍一下你自己',
        'stream': False
    }
)
print(response.json()['response'])
流式响应示例
import requests

response = requests.post(
    'http://localhost:11434/api/generate',
    json={
        'model': 'llama3',
        'prompt': '写一首关于春天的诗',
        'stream': True
    },
    stream=True
)
for line in response.iter_lines():
    if line:
        print(line.decode('utf-8'),)
自定义模型配置(Modelfile)

可以创建自定义的 Modelfile 来配置模型行为:

步骤 1:创建 Modelfile

FROM llama3
# 设置系统提示
SYSTEM """
你是一个专业的编程助手,擅长 Python、JavaScript 等编程语言。
请用简洁、清晰的代码回答问题。
"""
# 设置参数
PARAMETER temperature 0.7
PARAMETER num_ctx 4096

步骤 2:创建自定义模型

ollama create my-coder -f Modelfile 

步骤 3:运行自定义模型

ollama run my-coder 

常见问题与解决方案

问题 1:下载模型速度慢

解决方案:

# 方法 1:使用国内镜像源
export OLLAMA_HOST=https://ollama.ainews.cn
# 方法 2:配置代理
export HTTP_PROXY=http://proxy.example.com:8080
export HTTPS_PROXY=http://proxy.example.com:8080
# 方法 3:手动下载 GGUF 模型后导入
# 从魔搭社区下载 GGUF 格式模型
# 然后使用 ollama import 命令导入
问题 2:内存不足,模型无法运行

解决方案:

# 方法 1:选择更小的模型
ollama run llama3.2:3b # 代替 llama3:70b
# 方法 2:减少上下文长度
ollama run llama3 --num_ctx 2048
# 方法 3:配置模型存储路径到更大磁盘
# Windows
setx OLLAMA_MODELS "D:\ollama\models"
# macOS/Linux
echo 'export OLLAMA_MODELS=/data/ollama/models' >> ~/.bashrc
source ~/.bashrc
问题 3:GPU 加速不生效

解决方案:

# 1. 检查 NVIDIA 驱动
nvidia-smi
# 2. 确保安装 CUDA 工具包
# 3. 重启 Ollama 服务
ollama serve
# 4. 查看 GPU 使用情况
ollama ps
问题 4:中文输出乱码

解决方案:

# 方法 1:使用中文优化模型
ollama run qwen3.5
# 方法 2:设置正确的编码
# 在终端中设置 UTF-8 编码
export LANG=zh_CN.UTF-8
# 方法 3:在系统提示中指定语言
ollama run llama3 "请用中文回答所有问题"
问题 5:Ollama 服务无法启动

解决方案:

# 1. 检查端口是否被占用
netstat -ano | findstr 11434 # Windows
lsof -i :11434 # Mac/Linux
# 2. 重启服务
ollama serve
# 3. 检查日志
# Windows: 事件查看器
# Mac/Linux: journalctl -u ollama

总结与资源

快速回顾
步骤命令/操作
1️⃣ 安装官网下载安装包或使用命令行安装
2️⃣ 验证ollama --version
3️⃣ 下载模型ollama pull <模型名>
4️⃣ 运行模型ollama run <模型名>
5️⃣ 查看列表ollama list
推荐资源
资源类型链接
Ollama 官网https://ollama.com
模型库https://ollama.com/library
Open WebUIhttps://github.com/open-webui/open-webui
阿里魔搭社区https://modelscope.cn
Hugging Facehttps://huggingface.co
最佳实践建议
  1. 从轻量模型开始:先用 7B 以下模型熟悉流程
  2. 合理分配存储:模型文件较大,建议单独分区存储
  3. 定期清理:不用的模型及时删除,释放空间
  4. 关注更新:Ollama 和模型都在快速迭代,保持更新
  5. 社区交流:遇到问题可以在 GitHub 或社区寻求帮助

目录

  1. 为什么需要本地部署大模型?
  2. 什么是 Ollama?
  3. 核心特点
  4. 工作原理
  5. 系统要求与前置准备
  6. 硬件要求
  7. 模型大小与硬件对应关系
  8. 系统版本要求
  9. Ollama 安装教程(Windows/Mac/Linux)
  10. Windows 安装步骤
  11. 方法一:官网下载安装(推荐)
  12. 方法二:命令行安装
  13. macOS 安装步骤
  14. 方法一:DMG 安装包安装
  15. 方法二:命令行安装
  16. Linux 安装步骤
  17. Ubuntu/Debian 系统
  18. 其他 Linux 发行版
  19. 安装成功验证
  20. 1. 检查版本号
  21. 2. 检查服务是否运行
  22. 常用命令详解
  23. 模型管理命令
  24. 下载并运行模型(最常用!)
  25. 示例:运行 Llama 3 模型
  26. 仅下载模型但不运行
  27. 示例:下载 Qwen 模型
  28. 查看本地已安装的模型列表
  29. 删除本地模型(释放空间)
  30. 示例:删除 llama3 模型
  31. 模型运行命令
  32. 运行模型并进入交互对话
  33. 运行模型并传入单条消息
  34. 运行模型并指定参数
  35. 后台运行模型服务
  36. 系统信息命令
  37. 查看 Ollama 版本
  38. 查看正在运行的模型
  39. 查看模型详细信息
  40. 复制模型(创建副本)
  41. 常用参数说明
  42. 2026 年热门模型推荐
  43. 综合推荐榜
  44. 按场景选择模型
  45. 通用对话/日常使用
  46. 轻量级(低配电脑)
  47. 平衡型(主流配置)
  48. 中文优化
  49. 代码编程
  50. 代码专用模型
  51. 通用代码能力
  52. 复杂推理
  53. 强推理模型
  54. 思考链模式
  55. 多语言支持
  56. 多语言模型
  57. 中文优化
  58. 新手推荐入门模型
  59. 入门首选:轻量、快速、效果好
  60. 中文用户推荐
  61. 平衡性能和资源
  62. 实战案例:打造你的私人 AI 助手
  63. 案例一:本地编程助手
  64. 使用示例
  65. 案例二:文档分析助手
  66. 使用示例
  67. 案例三:离线翻译工具
  68. 下载多语言模型
  69. 进阶配置:可视化界面与 API 调用
  70. 安装可视化界面(Open WebUI)
  71. API 调用示例
  72. Python 调用示例
  73. 简单对话
  74. 流式响应示例
  75. 自定义模型配置(Modelfile)
  76. 设置系统提示
  77. 设置参数
  78. 常见问题与解决方案
  79. 问题 1:下载模型速度慢
  80. 方法 1:使用国内镜像源
  81. 方法 2:配置代理
  82. 方法 3:手动下载 GGUF 模型后导入
  83. 从魔搭社区下载 GGUF 格式模型
  84. 然后使用 ollama import 命令导入
  85. 问题 2:内存不足,模型无法运行
  86. 方法 1:选择更小的模型
  87. 方法 2:减少上下文长度
  88. 方法 3:配置模型存储路径到更大磁盘
  89. Windows
  90. macOS/Linux
  91. 问题 3:GPU 加速不生效
  92. 1. 检查 NVIDIA 驱动
  93. 2. 确保安装 CUDA 工具包
  94. 3. 重启 Ollama 服务
  95. 4. 查看 GPU 使用情况
  96. 问题 4:中文输出乱码
  97. 方法 1:使用中文优化模型
  98. 方法 2:设置正确的编码
  99. 在终端中设置 UTF-8 编码
  100. 方法 3:在系统提示中指定语言
  101. 问题 5:Ollama 服务无法启动
  102. 1. 检查端口是否被占用
  103. 2. 重启服务
  104. 3. 检查日志
  105. Windows: 事件查看器
  106. Mac/Linux: journalctl -u ollama
  107. 总结与资源
  108. 快速回顾
  109. 推荐资源
  110. 最佳实践建议

更多推荐文章

查看全部
  • 2024年大模型技术发展及治理实践报告
  • AIGC 在现代教育技术中的应用实践
  • Whisper.cpp 量化版本清单与 ggml 格式模型下载
  • LazyLLM 代码专家智能体实战与测评
  • Android Studio 零基础入门指南:环境搭建与核心组件详解
  • 牛客 NC221681 dd 爱框框 滑动窗口解法
  • JavaScript 简介:从网页脚本到全栈语言
  • OpenClaw 配置 Nginx 反向代理及 HTTPS 安全接入指南
  • 数据结构:二叉树初阶与链式实现
  • Python 实现开源 AI 模型引入及测试全过程
  • 大模型应用落地实践与提示工程分层解析
  • 医疗 AI 场景下模型融合与集成策略深度解析
  • FPGA 光通信:Aurora 64B/66B 开发使用
  • 使用 LLaMA-Factory 训练 LLM 大模型并用 Ollama 调用
  • Agent 入门前置:大模型基础与开发核心概念
  • 同事.skill 爆火:AI 如何复刻数字分身
  • B 树与 B+ 树详解:原理、实现及 MySQL 索引应用
  • Seedance 2.0 双分支扩散变换器架构解析与工程实现
  • 汇川 InoRoboLab 机器人软件常规操作要点
  • SpringBoot 整合 Neo4j 图数据库项目实战

相关免费在线工具

  • 加密/解密文本

    使用加密算法(如AES、TripleDES、Rabbit或RC4)加密和解密文本明文。 在线工具,加密/解密文本在线工具,online

  • RSA密钥对生成器

    生成新的随机RSA私钥和公钥pem证书。 在线工具,RSA密钥对生成器在线工具,online

  • Mermaid 预览与可视化编辑

    基于 Mermaid.js 实时预览流程图、时序图等图表,支持源码编辑与即时渲染。 在线工具,Mermaid 预览与可视化编辑在线工具,online

  • 随机西班牙地址生成器

    随机生成西班牙地址(支持马德里、加泰罗尼亚、安达卢西亚、瓦伦西亚筛选),支持数量快捷选择、显示全部与下载。 在线工具,随机西班牙地址生成器在线工具,online

  • Gemini 图片去水印

    基于开源反向 Alpha 混合算法去除 Gemini/Nano Banana 图片水印,支持批量处理与下载。 在线工具,Gemini 图片去水印在线工具,online

  • curl 转代码

    解析常见 curl 参数并生成 fetch、axios、PHP curl 或 Python requests 示例代码。 在线工具,curl 转代码在线工具,online