1. 前言
近期,百度正式开源了文心大模型 4.5 多模态大模型。文心大模型 4.5 系列开源模型包含多款参数规模不同的混合专家模型及稠密参数模型,其中部分 VL 模型支持多模态特性,可理解图片、音频、视频等非文本内容。本次开源的多个参数模型在大模型基准测试中取得了突出效果。本文将对文心大模型 4.5 系列开源模型进行测评。
[图片]
2. 测评的软硬件环境
2.1 CPU
16 核 X86 架构 Intel 处理器
2.2 内存
64G 内存
2.3 GPU
Nvidia A100 80G 显存
2.4 软件环境
操作系统使用 Ubuntu 22.04,软件环境使用 Python 3.10、PyTorch 2.7。
[图片]
2.5 模型选择
因文心大模型 4.5 的核心能力是多模态,本次测评选用的模型是 ERNIE-4.5-VL-28B-A3B-Paddle。为展示对比效果,同步测试通义千问的多模态开源大模型 Qwen2.5-VL-32B-Instruct。
3. 模型部署
得益于 AI 框架的完善,模型部署已较为便捷。百度飞桨框架支持基于 Transformer 快速部署。资源占用上,文心大模型文件约 55GB,相比千问的 68GB 略小,显存消耗略有优势。
3.1 GPU 准备
需一台 80G 显存的英伟达 A100 显卡主机,可选择主流算力租赁平台。
[图片]
依次执行以下命令,完成相关工具和模型的下载、安装和推理。
3.2 安装 GPU 版本的 PaddlePaddle
python -m pip install paddlepaddle-gpu==3.1.0 -i https://www.paddlepaddle.org.cn/packages/stable/cu126/
[图片]
3.3 安装 A100 显卡专用的 FastDeploy
python -m pip install fastdeploy-gpu -i https://www.paddlepaddle.org.cn/packages/stable/fastdeploy-gpu-80_90/ --extra-index-url https://mirrors.tuna.tsinghua.edu.cn/pypi/web/simple
[图片]
注意如果使用的是 4090 显卡,需要更换安装命令,具体参考 PaddlePaddle 帮助文档:https://paddlepaddle.github.io/FastDeploy/get_started/installation/nvidia_gpu/。
[图片]
3.4 使用 FastDeploy 一键完成模型下载和推理
python -m fastdeploy.entrypoints.openai.api_server \
--model baidu/ERNIE-4.5-VL-28B-A3B-Paddle \
--port 8180 \
--metrics-port 8181 \
--engine-worker-queue-port 8182 \
--max-model-len 32768 \
--enable-mm \
--reasoning-parser ernie-45-vl \
--max-num-seqs 32
[图片]
如下图所示,看到 8180 端口成功启动之后,表示成功的把文心大模型 4.5 28b 模型部署运行起来了。
[图片]


