跳到主要内容
极客日志极客日志面向AI+效率的开发者社区
首页博客我的书AI学习GitHub 精选镜像AI 生图工具UI配色美学关于
搜索内容 / 工具 / 仓库 / 镜像...⌘K搜索
注册
博客列表
编程语言AI算法

手机与电脑部署 Phi3、Llama3 大模型指南

大模型基于缩放定律,参数越大能力越强。介绍 Meta 的 Llama 3 和微软的 Phi-3 两款开源小模型,重点讲解如何在电脑(Ollama)及手机(Termux+Ollama)上私有化部署。通过实测对比了两者在响应速度、中文能力、代码生成及数学推理上的表现,指出小模型推理成本低、适合本地定制的趋势。

芝士奶盖发布于 2025/2/6更新于 2026/9/1065 浏览
手机与电脑部署 Phi3、Llama3 大模型指南

大模型无疑是此次 AI 革命的主角,基于 Scaling Law(缩放定律)。简单来说,就是数据越多,参数越大,算力越强,模型最终的能力就越强。随着模型参数和预训练数据规模的增加,模型能力与任务效果不断改善,展示出了一些小规模模型所不具备的'涌现能力'。

随着大模型时代的逐步来临,以 ChatGPT 为代表的前沿大模型技术正逐步在经济、法律、社会等诸多领域展现其重要价值。与此同时,众多 AI 企业纷纷推出开源大模型,其规模正遵循扩展定律实现指数级增长。

然而,一个不可忽视的趋势是,大模型的体积正在逐渐精简,使得私有化部署成为可能。这一需求显得尤为重要,特别是在对个人隐私保护要求极高的场景中。想象一下,一个能够深入了解你各类数据的 AI 机器人,在无需联网传输数据的情况下,直接在你的设备上运行并为你提供决策支持,这无疑大大增强了用户的信任。而如果这种 AI 只存在企业的'云服务器'上,尽管性能更强,但安全性及可靠性就堪忧了。

本文在此会介绍几个适合私人部署的最新大模型,然后手把手部署到电脑及手机。不过,丑话说在前,现阶段不要对'本地私有部署的大模型'有过高的期待哈。那我们开始吧!

一、适合本地部署的开源大模型

目前备受欢迎的大模型,诸如 ChatGPT 和 Bard,都建立在专有的闭源基础之上,这无疑限制了它们的使用,并导致技术信息的透明度不足。

然而,开源 AI 大模型(LLMs)正逐渐崭露头角,它们不仅增强了数据的安全性和隐私保护,还为用户节省了成本,减少了对外部依赖,实现了代码的透明性和模型的个性化定制。这里我重点介绍下 Meta 推出的 Llama 3 和微软的 Phi-3,这两款算是开源大模型的顶流,是'小而美'的大模型,而且方便部署。

1. Llama 3

Meta 重磅发布两款开源 Llama 3 8B 与 Llama 3 70B 模型,供外部开发者免费使用。Meta 表示,Llama 3 8B 和 Llama 3 70B 是目前同体量下,性能最好的开源模型。

LLaMA 是开源模型的顶流,众多国内的大型模型均源于它的构建!它通过人类反馈的强化学习(RLHF)进行了微调。它是一种生成文本模型,可以用作聊天机器人,并且可以适应各种自然语言生成任务,包括编程任务。从其分享的基准测试可以看出,Llama 3 400B+ 的实力几乎媲美 Claude 超大杯以及新版 GPT-4 Turbo,虽然仍有一定的差距,但足以证明其在顶尖大模型中占有一席之地。

GitHub 项目地址:https://github.com/meta-llama/llama3

2. Phi-3

Phi 是微软 AI 研究院新推出的开源小型语言模型,适用于商业使用,其优势在于体积小、资源需求少。该模型包括 Phi-3-Mini、Phi-3-Small 和 Phi-3-Medium 三种规模。Phi-3-Mini 仅有 3.8B 参数,但在关键基准测试中表现出色,与大型模型如 Mixtral 8x7B 和 GPT-3.5 相当。更大的 Small 和 Medium 版本在扩展数据集的支持下表现更卓越。

《Phi-3 技术报告:一个能跑在手机上的大模型》:https://arxiv.org/abs/2404.14219

小结

从基准测试上看,Llama 3 8B 和 Phi3 3.8B 小模型都有较好的效果,它们不仅仅都是规模小,其实优化方法还有一定相似的。

决定大模型性能有三要素:框架,数据和参数。参数既然要固定是小规模的,框架在这么小参数下做 MOE 也没意义,因此他们主要是在数据这个要素上下功夫,通过提高数据的数量或质量,从而提升小模型的性能表现。这也为后面精简大模型提供了方向!

二、电脑部署的流程

这里首先介绍一个大模型部署的神器:Ollama,它可以支持 Llama 3、Mistral、Gemma 等大型语言模型的启动并运行。

通过 Ollama 在电脑上部署大模型,基本只要简单的两小步:1、下载安装 Ollama;2、运行大模型(完)。

具体以 Windows 为例,首先到官网下载。下载 Ollama 后,然后一路确认就安装好了。

官网下载链接:https://github.com/ollama/ollama

安装完 Ollama 后,然后打开命令行,运行命令 ollama run llama3,就可以下载并运行 llama3 大模型了(其他模型的运行命令如上),初次下载模型的会比较慢,下载完就可以愉快地对话了。

Ollama 还支持其他功能如,图片等多模态输入、传入提示词调教模型等,具体可以看下文档。

部署建议:

  • 确保系统内存至少 8GB,推荐 16GB 以上。
  • 如果使用 NVIDIA GPU,请确保已安装 CUDA 驱动,Ollama 会自动调用 GPU 加速推理。
  • 若网络环境受限,可尝试配置代理或使用镜像源加速模型下载。

三、手机部署的流程

相比于电脑,手机部署大模型其实意义更大,手机与大家的生活更为密切相关,而且手机上也有大量的个人数据更方便后续的交互。当下大家可能都有好几个闲置手机,如果手机性能不拉跨的话,跑个大模型还是很酷的。

但是手机上部署会麻烦一丢丢,与电脑部署差不多,但需要先在手机上安装配置 Linux 环境。虽然安卓手机的底层是基于 Linux 内核,但要重装个 Linux 难度可太大了。好在我发现了另外一个神器:Termux,它是一个 Android 上的终端模拟器,可以在 Android 设备上运行许多 Linux 命令和工具。

官网下载链接:https://github.com/termux/termux-app/releases

安装后打开 Termux 如下图。(如有要打开多个 Linux 窗口,左上角右滑点击 New session 就可以。)

接下来,通过 Termux + Ollama 就可以在手机上部署大模型了:

第一步,借助 Termux,在上面使用 proot-distro 安装个 Linux 系统。 (proot-distro 允许用户在 Termux 中安装、卸载和运行各种 Linux 发行版,包括 Ubuntu、Debian、Arch Linux 等。这样,用户就可以在他们的 Android 设备上使用完整的 Linux 环境,包括安装和运行 Linux 软件包。)

# 先来安装 proot-distro
pkg install proot-distro

# 使用 proot-distro 安装一个 debian
proot-distro install debian

# 安装成功后通过 login 命令就直接进入 debian,为发行版启动一个 root shell
proot-distro login debian

第二步,同电脑的流程,安装 Ollama,下载及运行大模型。

# 进入之后再来安装 ollama
curl -fsSL https://ollama.com/install.sh | sh

# 安装完毕可以查看 ollama 版本进行验证,出现版本号之后就可以使用 ollama
ollama -v

# 后台开启 ollama 服务
nohup ollama serve &

# 运行大模型(其他模型的命令如下图,可通过 ollama list 查看模型)
ollama run phi3

第一次要下载安装软件及运行大模型会比较慢,一小时左右吧。(安装完了,后面再次使用,只要运行上面的 login debian 系统、Ollama 服务、运行大模型后就可以使用了。)

感觉手机上跑代码,其实有种说不出来的趣味。手机上一行一行代码简陋地输入,然后看着屏幕一点点的输出,感觉实在太酷了。有兴趣的同学,可以装个远程软件 Tailscale、todesk 之类的,通过远程电脑上码代码,就更有味了。(不足就是手机算力跟不上,大模型回复太慢了,也比较耗电。)

手机端注意事项:

  • 确保手机存储空间充足,模型文件通常占用数 GB 空间。
  • 保持手机电量充足,推理过程功耗较高。
  • 建议使用散热背夹,防止长时间运行导致过热降频。

四、本地大模型的体验

模型表现: 大模型表现权威的数据可以看一些相关的测评。在这里我只是简单测试了下手机本地部署的大模型(llama3、Phi3),并谈谈个人的体验。总的来说,llama3 各项表现中更为稳定,Phi 可能有时会有差错,但是响应速度更快啊,综合感觉 Phi 更好用些。

响应速度: 受限于本地手机、电脑的性能,电脑如果有 GPU 可能响应还好点。但手机回复真的慢,等了几分钟就只能回几个字。比较明显的是 Phi3 回应的速度会比 llama3 来的快,而从模型规模上面 llama3 8B 也差不多是 phi3 3.8B 的两倍了。

中文能力: 中文肯定是这几个开源模型的弱项,问一些比较不常见的问题,中文说着说着,就开始飚起来英文了。很多中文表达不清,让它们讲个笑话内容也很尬。

但这也是没法避免的,毕竟归到底层原因,高质量的中文数据集远比不上英文,这个数据层面差异后面肯定也是会被不断放大。中文方面的任务,感觉 llama 内容会比 phi3 来的好一些。有兴趣还可以试试 llama 的中文变种 llama3-Chinese。

代码能力: 看着都有模有样的,但还是可以看出来 Phi3 有一些语法错误。

数学推理: 两个看着都还不错,Phi3 感觉更好些。

安全性: 两个都有不错的合规意识。

五、结语

文末简单说两句,虽然现在 AI 的落地的应用还比较少,但技术的发展需要时间,再者大模型的高昂推理成本限制了其实用性。然而,有了小模型如 Llama 3 和 Phi3,大模型实用化的道路变得更加清晰。虽然小模型的训练成本较高,但推理成本低,整体上更省钱,特别是在服务大量用户时,高性能的小模型使得 AI 更容易摆脱成本限制,更有效地应用于各种场景。一个能自己本地部署定制的 AI,别提能玩的会有多溜了~

相信后面,通过模型优化、定制 AI 芯片等带来的算力提升,越多'小而美'的 AI 大模型不久就会普及到我们生活!

目录

  1. 一、适合本地部署的开源大模型
  2. 1. Llama 3
  3. 2. Phi-3
  4. 小结
  5. 二、电脑部署的流程
  6. 三、手机部署的流程
  7. 先来安装 proot-distro
  8. 使用 proot-distro 安装一个 debian
  9. 安装成功后通过 login 命令就直接进入 debian,为发行版启动一个 root shell
  10. 进入之后再来安装 ollama
  11. 安装完毕可以查看 ollama 版本进行验证,出现版本号之后就可以使用 ollama
  12. 后台开启 ollama 服务
  13. 运行大模型(其他模型的命令如下图,可通过 ollama list 查看模型)
  14. 四、本地大模型的体验
  15. 五、结语

更多推荐文章

查看全部
  • GitHub 开源项目精选:AI 安全工具 Shannon 及热门项目汇总
  • 腾讯混元图像3.0图生图开源,LMArena评测跻身全球第一梯队
  • AIGC 周报:OpenAI 发布 Shap·E,企业动态与专家观点汇总
  • 12 篇必读的大模型前沿论文
  • 近五年体内微/纳米机器人赋能肿瘤精准治疗综述:聚焦 GBM
  • 前端开发必备技能:AI 设计优化、工程实践与硬件效率提升
  • Linux 网络编程:使用 C++ 实现 JSON 与 HTTP Web 服务器
  • TRAE、Qoder、Cursor 与 GitHub Copilot 深度对比:AI 编程工具选型指南
  • C++26 标准前瞻:std::future 取消机制与并发编程革命
  • C++ vector 动态数组容器详解与源码实现
  • TemporalKit 插件解决 Stable Diffusion 视频抖动问题
  • 开源 AI 桌面伴侣:从技术选型到核心实现详解
  • K 个一组反转链表:迭代解法详解
  • Ubuntu Server 24.04.3 LTS 安装教程
  • AI 魔术师:基于视觉的增强现实特效
  • PaddlePaddle 镜像运行 Stable Diffusion 的可行性分析
  • 2024 中国 AI 大模型行业前景分析及应用落地报告
  • Ubuntu 24.04 LTS 安装 NVIDIA 驱动、CUDA 12.5 及 Docker 容器工具包
  • Python 与 Scala 大数据预处理工具链深度对比评测
  • Windows 10/11 部署 OpenClaw 指南:环境搭建与机器人互联

相关免费在线工具

  • 加密/解密文本

    使用加密算法(如AES、TripleDES、Rabbit或RC4)加密和解密文本明文。 在线工具,加密/解密文本在线工具,online

  • RSA密钥对生成器

    生成新的随机RSA私钥和公钥pem证书。 在线工具,RSA密钥对生成器在线工具,online

  • Mermaid 预览与可视化编辑

    基于 Mermaid.js 实时预览流程图、时序图等图表,支持源码编辑与即时渲染。 在线工具,Mermaid 预览与可视化编辑在线工具,online

  • 随机西班牙地址生成器

    随机生成西班牙地址(支持马德里、加泰罗尼亚、安达卢西亚、瓦伦西亚筛选),支持数量快捷选择、显示全部与下载。 在线工具,随机西班牙地址生成器在线工具,online

  • Gemini 图片去水印

    基于开源反向 Alpha 混合算法去除 Gemini/Nano Banana 图片水印,支持批量处理与下载。 在线工具,Gemini 图片去水印在线工具,online

  • Base64 字符串编码/解码

    将字符串编码和解码为其 Base64 格式表示形式即可。 在线工具,Base64 字符串编码/解码在线工具,online