AI大模型的本地驯服——如何在自己电脑上训练一个专属大模型

Ne0inhk

22 Mar 2026 — 7 min read

文章目录

1.前言
2.训练模型
3. 致谢

1.前言

2025年3月12日记这是我第一次实现大模型的微调训练，电脑的配置是显卡NVIDIA GeForce RTX 3050 Ti Laptop GPU，三年前的笔记本了，不过还是能跑起来的，训练的是Deep Seek-r1 的 1.5B 模型，之前跑 7B 的直接卡死了。如果大家有更好的显卡，可以尝试一下。在此非常感谢ZEEKLOG的大佬，在他们的基础上，我的博客进一步完善一些细节，文末会附上大佬的原文链接。那么废话不多说，直接开始！（默认大家有一定的基础）

2.训练模型

2.1 基础配置

（具体的安装和使用教程网上有很多，在这里就不做过多的赘述了）

使用Anaconda（Python的环境管理工具），这样就不需要一个一个单独下载python的版本，并且使用起来很方便。
- Anaconda官网
使用PyCharm（Python的集成开发环境），可以在这里面编辑、运行.py文件等操作。
- PyCharm官网
使用Git（分布式版本控制系统），用于克隆GitHub上的优秀项目，不用也没事，可以直接下载.zip文件。
- Git官网
使用CUDA和cuDNN（用于GPU训练加速），需要注意这里面的版本关系，别下错了。
- CUDA 官网
- cuDNN官网
使用PyTorch（深度学习框架），这个版本要与你自己电脑的CUDA版本对应。
- PyTorch官网

以上就是环境配置需要的全部内容，接下来我们就进行项目复刻。

2.2 初始化环境

打开Anaconda Prompt（从Windows开始菜单找到），执行

创建新的虚拟环境

conda create -n llama python=3.10

激活虚拟环境

conda activate llama

安装PyTorch（我的CUDA是12.4，选择支持你们自己电脑的CUDA的版本）

conda installpytorch==2.5.1 torchvision==0.20.1 torchaudio==2.5.1 pytorch-cuda=12.4 -c pytorch -c nvidia

克隆GitHub项目

git clone https://github.com/hiyouga/LLaMA-Factory.git

或者直接下载压缩包，如图所示

下载完成后直接在PyCharm中打开项目

在使用大佬的安装指令时出现问题，AI教我加了一个镜像源，好用

pip install -e ".[torch,metrics]" -i https://pypi.tuna.tsinghua.edu.cn/simple/

验证安装（出现版本号就成功了）

llamafactory-cli version

2.3下载大模型

在终端输入如下指令，修改大模型存放位置（选择一个合适足够大的存储位置）

echo$env:HF_HOME ="E:\soft\Hugging-Face"

修改大模型下载位置（这个一般不需要修改）

echo$env:HF_ENDPOINT="https://hf-mirror.com"

安装huggingface_hub（如果第一个下载爆红，可以试试第二个镜像源）

pip install -U huggingface_hub

pip install -U huggingface_hub -i https://mirrors.tuna.tsinghua.edu.cn/pypi/web/simple

下载训练模型

huggingface-cli download --resume-download deepseek-ai/DeepSeek-R1-Distill-Qwen-1.5B

2.4制作训练集（json格式）

{"instruction":"你叫什么？是谁发明了你？","input":"","output":"您好，我名为 小白智能助手，是 AIOT工作室 发明的 AI 助手。我的任务是为用户提供有针对性的解答和支持。"},

配置训练集

2.5启动LLama-Factory 的可视化微调界面（http://localhost:7860/）

llamafactory-cli webui

选择自己的训练数据集

训练的超参数根据自己的需求调整，这些参数设置是AI告诉我的，并不是最好的，可以自己摸索一下

点击开始训练

在pycharm和网页可以查看训练进度

训练完毕

2.6在线使用

驯服成功 DeepSeek-R1-1.5B模型！！！

2.7模型导出

选择一个内存足够的盘符进行导出

2.8本地使用

创建一个新环境，跟之前的训练环境隔开，如果不使用python做前端界面可以省略这一步

新建deepspeekApi虚拟环境

conda create -n deepspeekApi python=3.10

激活虚拟环境deepspeekApi

conda activate deepspeekApi

下载所需依赖

conda install -c conda-forge fastapi uvicorn transformers pytorch

pip install safetensors sentencepiece protobuf

现在就可以使用python代码进行本地调用，效果如下

使用python编程实现上述功能，采用gradio框架进行快速开发部署（http://localhost:7860/）

from transformers import AutoModelForCausalLM, AutoTokenizer import torch import gradio as gr # 模型路径 model_path =r"E:\DeepSeek-merged"# 这里选择自己保存的路径# 加载模型和tokenizer tokenizer = AutoTokenizer.from_pretrained(model_path) device ="cuda"if torch.cuda.is_available()else"cpu" model = AutoModelForCausalLM.from_pretrained( model_path, torch_dtype=torch.float16 if device =="cuda"else torch.float32 ).to(device)defgenerate_response(message, history):try:# 将历史对话拼接成prompt prompt ="\n".join([f"用户：{h[0]}\n助手：{h[1]}"for h in history])+f"\n用户：{message}\n助手："# 编码输入 inputs = tokenizer(prompt, return_tensors="pt").to(device)# 生成回复 outputs = model.generate( inputs.input_ids, max_length=1000, min_length=30, top_p=0.85, temperature=0.6, repetition_penalty=1.2, no_repeat_ngram_size=3, num_beams=4, do_sample=True, early_stopping=True)# 解码并提取新生成的回复 response = tokenizer.decode(outputs[0][inputs.input_ids.shape[-1]:], skip_special_tokens=True)return response except Exception as e:returnf"生成回复时出错：{str(e)}"# 创建Gradio界面 demo = gr.ChatInterface( fn=generate_response, title="AI问答助手", description="AIOT工作室开发的智能助手", examples=["你好！你是谁？","你能做什么？"], theme="soft")if __name__ =="__main__":# demo.launch(server_name="0.0.0.0", server_port=7860) # 所有端口都可以访问 demo.launch(server_name="localhost", server_port=7860)# 本地访问

3. 致谢

参考大佬的博客进行一些优化，原文链接如下：

解锁DeepSpeek-R1大模型微调：从训练到部署，打造定制化AI会话系统_speek人工智能-ZEEKLOG博客

优选算法——位运算

👇作者其它专栏《数据结构与算法》《算法》《C++起始之路》 1.前要知识《位操作符的妙用》 2.相关题解 2.1判定字符是否唯一算法思路：利用【位图】的思想，每一个【比特位】代表一个【字符】，一个int类型的变量的32位足够表示所有的小写字母。比特位里若为0，表示这个字符没有出现过；若为1，表示该字符出现过。可以用一个【整数】来充当【哈希表】。 class Solution { public: bool isUnique(string astr) { //利用鸽巢原理优化 if(astr.size()>26) return false; int bitmap=0; for(auto i:

算法优化：提升Lite-Avatar实时性的关键数据结构

算法优化：提升Lite-Avatar实时性的关键数据结构 1. 引言实时数字人交互正成为AI应用的新趋势，但要做到真正的实时响应并不容易。想象一下，当你和数字人对话时，如果它的嘴型总是慢半拍，或者表情跟不上你的语音节奏，那种体验会有多糟糕。Lite-Avatar作为一款轻量级实时数字人引擎，面临着如何在有限计算资源下实现毫秒级响应的挑战。传统的数字人渲染往往需要大量的计算资源，导致延迟较高，难以满足实时交互的需求。Lite-Avatar通过精心设计的数据结构和算法优化，成功将渲染延迟控制在50毫秒以内，这背后有着怎样的技术奥秘？本文将带你深入探索那些让Lite-Avatar如此高效的关键数据结构。 2. 实时性挑战与优化思路 2.1 数字人渲染的实时性要求实时数字人交互对延迟有着极其严格的要求。根据人类感知研究，当延迟超过100毫秒时，用户就能明显感觉到音画不同步。而要实现自然的对话体验，延迟需要控制在50毫秒以内。这意味着从音频输入到画面输出的整个处理链路必须在极短时间内完成。 Lite-Avatar面临的挑战包括：音频特征提取、表情预测、口型同步、画面渲染等

优选算法——二分查找

👇作者其它专栏《数据结构与算法》《算法》《C++起始之路》二分查找相关题解 1.二分查找算法思路： a.定义left，right指针，分别指向数组的左右区间。 b.找到待查找区间的中间点mid，找到后分三种情况讨论： i.arr[mid]==target说明正好找到，返回mid的值； ii.arr[mid]>target说明[mid,right]这段区间都是大于target的，因此舍去右边区间，在左边[left,mid-1]的区间继续查找，即让right=mid-1，然后重复b过程； iii.arr[mid]<target说明[left,mid]这段区间的值都是小于target的，因此舍去左边区间，在右边区间[mid+1,right]

【算法通关指南：算法基础篇】二分算法：1.在排序树组中查找元素的第一个和最后一个位置 2.牛可乐和魔法封印

🔥小龙报：个人主页 🎬作者简介：C++研发，嵌入式，机器人方向学习者 ❄️个人专栏：《算法通关指南》 ✨ 永远相信美好的事情即将发生文章目录 * 前言 * 一、二分算法 * 二、在排序树组中查找元素的第一个和最后一个位置 * 2.1题目 * 2.2 算法原理 * 2.3代码 * 三、牛可乐和魔法封印 * 3.1题目 * 3.2 算法原理 * 3.3代码 * 总结与每日励志前言本专栏聚焦算法题实战，系统讲解算法模块：以《c++编程》，《数据结构和算法》《基础算法》《算法实战》等几个板块以题带点，讲解思路与代码实现，帮助大家快速提升代码能力ps:本章节题目分两部分，比较基础笔者只附上代码供大家参考，其他的笔者会附上自己的思考和讲解，希望和大家一起努力见证自己的算法成长一、