LLaMA-Factory 微调至高通 NPU 部署:Qwen-0.6B 全链路移植指南
综述由AI生成介绍将 LLaMA-Factory 微调后的 Qwen-0.6B 模型部署至高通骁龙 NPU 的全流程。主要步骤包括:导出 Safetensors 格式权重并转换为 PyTorch;使用 Optimum 库导出带 KV Cache 的 ONNX 模型;针对 NPU 进行 Opset 版本和静态形状优化;利用 QNN SDK 编译生成.so 动态库及.bin 上下文二进制文件;最后在 Android 端通过 JNI 集成推理引擎。该方案实…













