
LLaMAFactory 与 ModelScope 大模型部署及 GGUF 转换实战
微调后大模型的部署流程。首先使用 llama.cpp 将 HF 格式模型转换为 GGUF 格式。接着演示了通过 llama.app 进行命令行和服务模式部署,并指出 Ollama 对 Qwen3 的兼容问题。最后展示了如何在 ModelScope 平台上传和下载 GGUF 模型文件,提供了完整的本地轻量化部署方案。
博客作者
分布式追踪专家
351
已发布文章
16K
博客获赞
843K
博客浏览
第 6 页

微调后大模型的部署流程。首先使用 llama.cpp 将 HF 格式模型转换为 GGUF 格式。接着演示了通过 llama.app 进行命令行和服务模式部署,并指出 Ollama 对 Qwen3 的兼容问题。最后展示了如何在 ModelScope 平台上传和下载 GGUF 模型文件,提供了完整的本地轻量化部署方案。
在服务器环境下拉取 llama.cpp Docker 镜像时遇到的速度慢问题,并提供了解决方案。通过将官方镜像源 ghcr.io 替换为国内镜像源 ghcr.nju.edu.cn,可显著提升下载速度,节省等待时间。
介绍如何在低显存设备上部署 Flux 图像生成模型。通过安装 DiffSynth、Gradio 等依赖,使用预置镜像和 float8 量化技术降低显存占用。步骤包括环境检查、依赖安装、脚本编写及服务启动。支持本地访问及 SSH 隧道远程访问。提供种子、步数调节技巧及显存优化配置,解决 CUDA out of memory 等常见问题,实现本地 AI 绘图。

介绍无人机路径规划算法基础、目标约束及 A*、Dijkstra、RRT、蚁群算法原理与优劣。通过物流、测绘、救援实例展示应用,对比算法性能数据。探讨优化策略、AI 融合趋势及面临挑战与未来前景。
Janus-Pro-7B 是 DeepSeek 推出的统一多模态模型,支持图文理解与生成。介绍如何通过 Ollama 快速部署该模型,无需复杂环境配置。内容包括环境准备、模型拉取、API 验证、文生图与图文理解实测、提示词优化技巧及与其他方案的对比。适合希望轻量级运行 AI 绘画能力的开发者。

详细记录了基于立创·逻辑派 FPGA-G1 开发板的 6 层高速 PCB 设计全过程。内容涵盖资料准备、原理图导入、电源树分析、元件模块化布局、叠层设置、阻抗控制、差分对规则、扇孔处理、DDR3 及 HDMI 等高速信号布线、时序等长调节、DRC 检查、铺铜优化及 Gerber 文件导出。重点讲解了 FPGA 与 ARM 异构架构下的电源完整性设计、高速信号…
Stable Diffusion 模型下载常面临资源分散、文件校验复杂及存储管理混乱等难题。介绍基于 Docker 的自动化部署方案,通过 links.txt 集中管理链接,内置 SHA256 校验确保文件完整性,并自动创建标准化目录结构。支持断点续传和多线程下载,可快速完成环境准备与模型部署。用户可通过修改配置文件添加自定义模型,并结合网络优化策略提升下载…
Llama-3.2V-11B-COT 模型在 NVIDIA A10/A100/V100 GPU 上的部署方案。涵盖环境配置(Conda、CUDA、PyTorch)、模型加载(单卡/多卡、device_map 自动分配)、性能优化(FP16 精度、量化)及常见问题排查。重点讲解了利用 accelerate 库实现多卡并行推理的方法,以及针对不同显存容量的硬件策…

基于昇腾 NPU 环境对 Llama-2-7B 模型进行全流程部署与性能测评。内容涵盖环境配置、依赖安装、模型加载及多场景推理测试。实测显示单请求吞吐量稳定在 15.6-17.6 tokens/秒,Batch=4 时总吞吐量达 63.33 tokens/秒,显存占用约 16GB。高并发测试验证了 Batch 增至 70 时仍保持线性增长,延迟波动小。文章提供…

介绍使用 LLaMA-Factory 对 Qwen3-VL 多模态大模型进行微调的完整流程。内容包括环境搭建、模型下载、LoRA 微调配置、私有数据集构造、模型权重合并以及基于 vLLM 的高并发部署方案。通过命令行操作完成 SFT 任务,并提供 OpenAI 兼容接口的 Python 调用示例,适用于工业级落地场景。
MCP Document Reader 是基于模型上下文协议(MCP)的开源工具,解决大语言模型无法直接读取本地复杂文件的问题。它支持 Excel、Word、PDF 和文本等多种格式,通过 pip 安装即可在 Trae 或 Claude Desktop 等 AI 助手中启用。该工具已入驻 MCP 官方 Server 列表,允许 AI 像人类一样解析文档内容并…
通过博客设计稿实例,讲解 HTML5 语义化标签的核心作用。介绍了网页五大固定组件(头部、导航、主内容、侧边栏、底部)及其对应标签。详细区分了 main、header、footer 的页面级用法,以及 article 和 section 的内容级判断标准。同时说明了 nav 和 aside 的正确使用场景,并指出无语义元素 div 和 span 的归宿。旨在…

介绍检索增强生成(RAG)技术,涵盖其原理、Embedding 向量技术、LangChain 与 LlamaIndex 框架对比,以及基于 LlamaIndex 和 LangChain 的 RAG 系统搭建实践。内容包含环境配置、文档加载、索引构建、查询引擎使用及代码示例,旨在帮助开发者理解并落地 RAG 应用。

介绍工业无人机定位精度问题的根源及解决方案。涵盖定位漂移原理、天线安装规范、GPS/北斗多源融合标定流程(场地选择、静置收敛、磁罗盘校准、时间同步、坐标系校准)、精度优化方法(遮挡/电磁干扰/算法优化)以及工业级合格标准。强调高精度定位依赖规范安装与环境规避,而非单纯硬件升级,旨在解决定点飘、航线弯、信号弱等问题。
Gazebo 是由 Open Robotics 开发的开源 3D 机器人仿真平台,广泛应用于学术、工业及竞赛领域。其核心特性包括支持 ODE、Bullet 等多种物理引擎,OGRE 渲染,以及摄像头、激光雷达等传感器仿真。架构分为 GUI、Server、Transport 及物理引擎层。版本演进从 Classic 到 Gazebo Sim (Ignition…
OpenClaw 是一款开源自托管 AI 网关,支持连接微信、飞书、Telegram 等平台与 Claude、GPT 等模型。提供从安装配置到高级功能的全方位指南,涵盖多渠道管理、自动化任务(Cron)、长期记忆、浏览器自动化、插件开发及权限控制。包含 20 个实用 Shell 脚本示例,如价格监控、服务器资源监控等,并整理 30 个常见问题解答与故障排除手…
探讨 2026 年 RAG 技术向 GraphRAG 演进的趋势。传统向量 RAG 在复杂推理和上下文限制上存在不足,而图检索增强生成通过知识图谱实现多跳推理和可解释性。DeepSeek 等大模型赋能本体构建与信息抽取,支持动态 Schema 和零样本学习,结合 Neo4j 等图数据库,为企业决策提供高保真、可审计的智能解决方案。
对比了 TRAE、Qoder、Cursor 和 GitHub Copilot 四款主流 AI 编程工具。从核心理念、多语言支持、工程化能力、中文本地化及收费模式五个维度进行分析。TRAE 强调全自主开发与跨语言协同,适合全栈及系统编程;Qoder 在国产框架与性价比上表现突出;Cursor 适合个人开发者;Copilot 依赖 GitHub 生态。企业需根据…
利用 Coze 平台结合飞影数字人插件,解决创作者不敢出镜、成本高、效率低的问题。通过梳理自动化工作流,实现输入文案即可生成逼真的数字人口播视频。主要步骤包括选择插件、准备数字人与声音克隆素材、配置工作流节点(开始、生成、监控循环、输出)以及设置智能体人设与快捷指令。最终完成无需真人出镜的视频制作流程。

LangChain 是一个用于构建大语言模型(LLM)应用的开源框架,提供模块化组件以简化开发。 LangChain 的概念、定位及核心组件(如 Models、Prompts、Chains、Agents 等),并列举了知识库问答、智能对话机器人等应用场景。同时提供了学习路径及官方文档、API 参考、第三方集成包等资源链接,帮助开发者快速上手 LangChai…