Ollama Windows 安装与使用指南：本地运行 Llama 等模型

Ollama Windows 安装与使用指南

Ollama 是一个开源工具，能让你在个人电脑上轻松运行 Llama、DeepSeek 等主流大语言模型。它无需复杂配置即可享受 AI 对话和内容生成能力，并确保数据完全私有化。下面我们将一步步带你完成从环境准备到进阶集成的全过程。

一、环境准备与系统要求

在开始之前，请确保你的 Windows 设备满足以下条件，这是顺利运行的基础。

组件	最低要求	推荐配置
操作系统	Windows 10/11 64 位	Windows 11 22H2 或更新版本
内存（RAM）	8 GB（可运行 1B-7B 参数模型）	16 GB 或以上（流畅运行 13B 参数模型）
存储空间	至少 10 GB 可用空间	50 GB 或更多（SSD 优先，用于存放模型文件）
显卡（GPU）	集成显卡（CPU 模式）	NVIDIA 独立显卡（显存 ≥ 8GB）

必要检查：

验证显卡驱动：按 Win + R 键，输入 cmd 打开命令提示符，然后输入 nvidia-smi。如果显示出显卡驱动和 CUDA 版本信息，说明驱动已就绪。
确认 Python：在命令提示符中输入 python --version，建议版本为 3.8 或以上。

二、安装 Ollama

你可以选择以下任意一种方法进行安装。

方法一：使用官方安装包（最简单，推荐新手）

这是最直接的方式，适合绝大多数用户。

下载安装程序：访问 https://ollama.com/download，选择 'Download for Windows'。这会下载一个名为 OllamaSetup.exe 的文件。
运行安装：双击下载的 .exe 文件，如果出现用户账户控制（UAC）提示，请点击'是'。安装程序将自动完成所有配置，包括将 Ollama 添加到系统路径。

验证安装：安装完成后，重新打开一个新的命令提示符（CMD）或 PowerShell 窗口，输入以下命令：

ollama --version

如果正确显示版本号（例如 ollama version 0.1.20），则说明安装成功。

方法二：通过命令行安装（可选）

如果你习惯使用命令行，或者遇到网络问题，可以尝试此方法。注意，这通常需要在 WSL 或 Git Bash 环境下执行。

以管理员身份打开 PowerShell 或 Git Bash。
执行以下命令一键安装：

curl -fsSL https://ollama.com/install.sh | sh

如果因网络问题下载缓慢，可以尝试使用国内镜像源加速。修改模型存储路径：默认情况下，模型会下载到 C 盘用户目录。如果 C 盘空间紧张，可以提前修改存储位置。右键点击'此电脑' -> '属性' -> '高级系统设置' -> '环境变量'，在'系统变量'中点击'新建'，创建一个名为 OLLAMA_MODELS 的新变量，将其值设置为您想要的路径，例如 D:\ollama\models。设置后需重启 Ollama 服务。

三、基础使用：快速开始

安装成功后，您就可以开始体验本地大模型了。

1. 拉取并运行您的第一个模型

在命令提示符中，使用 ollama run 命令。例如，要运行 Meta 发布的 Llama 3 模型：

ollama run llama3

Ollama 会自动从模型库下载所需的文件。下载完成后，会直接进入交互式对话界面，您可以开始输入问题。

2. 常用模型管理命令

掌握以下几个命令，就能高效管理您的本地模型：

命令	作用	示例
`ollama list`	列出本地已下载的所有模型	`ollama list`
`ollama pull`	仅下载模型，但不立即运行	`ollama pull deepseek-r1:7b`
`ollama rm`	删除本地不再需要的模型	`ollama rm llama2:13b`
`ollama ps`	查看当前正在运行的模型	`ollama ps`

3. 模型选择建议

根据您的硬件配置选择合适的模型，可以在性能和效果间取得良好平衡：

低配设备（8GB 内存）：建议运行 1.5B 或 7B 参数模型，如 deepseek-r1:1.5b。
中端设备（16GB 内存）：可流畅运行 7B 或 13B 参数模型，如 llama3:8b 或 qwen2:7b。
高性能设备（32GB+ 内存）：可尝试 34B 或 70B 参数的大型模型。

四、进阶应用

Ollama 不仅是一个命令行工具，更是一个本地 AI 服务器，支持多种集成方式。

1. 使用 API 接口

Ollama 在安装后会自动在后台启动一个服务，默认监听 http://localhost:11434。这意味着您可以通过任何编程语言来调用它。

Python 调用示例：Ollama 提供了官方的 Python 库，可以非常方便地集成到您的项目中。

首先安装 Python 库：

pip install ollama

然后编写代码：

import ollama

response = ollama.chat(
    model='llama3',
    messages=[{'role': 'user', 'content': '为什么天空是蓝色的？'}]
)
print(response['message']['content'])

测试 API：您也可以使用 curl 进行快速测试：

curl http://localhost:11434/api/generate -d '{ "model": "llama3", "prompt": "请用中文介绍一下你自己", "stream": false }'

2. 使用图形化界面（WebUI）

如果您不习惯命令行，可以部署 Open WebUI 等图形界面，获得类似 ChatGPT 的体验。使用 Docker 是启动 Open WebUI 最简单的方式：

docker run -d --network=host -v open-webui:/app/backend/data -e OLLAMA_BASE_URL=http://127.0.0.1:11434 --name open-webui --restart always ghcr.io/open-webui/open-webui:main

安装后，在浏览器中访问 http://localhost:3000 即可使用。首次使用需要创建账号，在设置中确保'Ollama Base Url'正确指向 http://127.0.0.1:11434。

五、常见问题与优化

问题	原因与解决方案
模型下载慢或失败	由于网络原因，可以尝试使用代理或多次重试命令。部分社区教程提供了通过国内镜像站手动下载模型文件的方法。
端口冲突	如果 11434 端口被占用，可以设置环境变量 `OLLAMA_HOST` 来更改端口，例如 `set OLLAMA_HOST=127.0.0.1:11435`，然后重启 Ollama 服务。
显存不足	尝试拉取参数更小或经过量化的模型版本（通常在模型名中带有 `q4_0`, `q6_k` 等后缀），或在运行命令时添加 `--num_gpu 1` 等参数限制 GPU 使用层数。