跳到主要内容
极客日志极客日志面向AI+效率的开发者社区
首页博客GitHub 精选镜像AI 生图工具UI配色美学隐私政策关于联系
搜索内容 / 工具 / 仓库 / 镜像...⌘K搜索
注册
博客列表
PythonAI算法

多模态大模型评测框架 LMMs-Eval 详解

南洋理工大学开源了 LMMs-Eval,提供一站式多模态模型评估方案。框架具备统一接口、一键启动及透明可复现特性。针对评测的覆盖广、成本低、零泄露“不可能三角”,提出了 LMMs-Eval-Lite 轻量级评估和 LiveBench 动态测试方案。Lite 版本通过聚类筛选显著点降低成本,LiveBench 通过持续更新数据防止污染。该框架有助于模型训练者聚焦优化而非评测对齐,推动多模态模型研究发展。

深海蔚蓝发布于 2025/2/7更新于 2026/7/1538 浏览
多模态大模型评测框架 LMMs-Eval 详解

前言

随着大模型研究的深入,如何将其推广到更多的模态上已经成为了学术界和产业界的热点。最近发布的闭源大模型如 GPT-4o、Claude 3.5 等都已经具备了超强的图像理解能力,LLaVA-NeXT、MiniCPM、InternVL 等开源领域模型也展现出了越来越接近闭源的性能。

在这个快速迭代的时代,简单易用、标准透明、可复现的多模态评估框架变得越来越重要。为解决这一问题,来自南洋理工大学 LMMs-Lab 的研究人员联合开源了 LMMs-Eval,这是一个专为多模态大型模型设计的评估框架,为多模态模型(LMMs)的评测提供了一站式、高效的解决方案。

自 2024 年 3 月发布以来,LMMs-Eval 框架已经收到了来自开源社区、公司和高校等多方的协作贡献。现已在 Github 上获得大量 Stars,包含 80 多个数据集和 10 多个模型,并且还在持续增加中。

  • 代码仓库:https://github.com/EvolvingLMMs-Lab/lmms-eval
  • 官方主页:https://lmms-lab.github.io/
  • 论文地址:https://arxiv.org/abs/2407.12772
  • 榜单地址:https://huggingface.co/spaces/lmms-lab/LiveBench

标准化测评框架

为了提供一个标准化的测评平台,LMMs-Eval 包含了以下核心特性:

统一接口

LMMs-Eval 在文本测评框架 lm-evaluation-harness 的基础上进行了改进和扩展,通过定义模型、数据集和评估指标的统一接口,方便了使用者自行添加新的多模态模型和数据集。这种设计降低了集成新模型的门槛,使得研究者可以专注于模型本身的创新而非评测基础设施的重建。

一键式启动

LMMs-Eval 在 HuggingFace 上托管了 80 多个(且数量不断增加)数据集,这些数据集精心从原始来源转换而来,包括所有变体、版本和分割。用户无需进行任何准备,只需一条命令,多个数据集和模型将被自动下载并测试,等待几分钟时间即可获得结果。这极大地简化了大规模基准测试的流程。

透明可复现

LMMs-Eval 内置了统一的 logging 工具,模型回答的每一题以及正确与否都会被记录下来,保证了可复现性和透明性。同时也方便比较不同模型的优势与缺陷。这种详细的日志记录对于调试模型错误和理解模型行为边界至关重要。

LMMs-Eval 的愿景是未来的多模态模型不再需要自行编写数据处理、推理以及提交代码。在当今多模态测试集高度集中的环境下,这种做法既不现实,测得的分数也难以与其他模型直接对比。通过接入 LMMs-Eval,模型训练者可以将更多精力集中在模型本身的改进和优化上,而不是在评测和对齐结果上耗费时间。

评测的「不可能三角」

LMMs-Eval 的最终目标是找到一种覆盖广、成本低、零数据泄露的方法来评估 LMMs。然而,即使有了 LMMs-Eval,作者团队发现想同时做到这三点困难重重,甚至是不可能的。

当将评估数据集扩展到 50 多个时,执行这些数据集的全面评估变得非常耗时。此外,这些基准在训练期间也容易受到污染的影响。为此,LMMs-Eval 提出了两种互补的方案来应对这一挑战:LMMs-Eval-Lite 来兼顾广覆盖和低成本,以及 LiveBench 来做到低成本和零数据泄露。

LMMs-Eval-Lite: 广覆盖轻量级评估

在评测大模型时,往往庞大的参数量和测试任务会使得评测任务的时间和成本急剧上升,因此大家往往会选择使用较小的数据集或是使用特定的数据集进行评测。然而,有限的评测往往会使得对于模型能力的理解有所缺失。为了同时兼顾评测的多样性和评测的成本,LMMs-Eval 推出了 LMMs-Eval-Lite。

LMMs-Eval-Lite 旨在构建一个简化的基准测试集,以在模型开发过程中提供有用且快速的信号,从而避免现在测试的臃肿问题。如果我们能够找到现有测试集的一个子集,在这上面的模型之间的绝对分数和相对排名与全集保持相似,那么我们可以认为修剪这些数据集是安全的。

为了找到数据集中的数据显著点,LMMs-Eval 首先使用 CLIP 和 BGE 模型将多模态评测数据集转换为向量嵌入的形式并使用 k-greedy 聚类的方法找到了数据显著点。在测试中,这些规模较小的数据集仍然展现出与全集相似的评测能力。随后 LMMs-Eval 使用了相同的方法制作了涵盖更多数据集的 Lite 版本,这些数据集旨在帮助人们节省开发中的评测成本,以便快速判断模型性能。

LiveBench: LMMs 动态测试

传统基准侧重于使用固定问题和答案的静态评估。随着多模态研究的进展,开源模型在分数比较往往优于商用模型,如 GPT-4V,但在实际用户体验中却有所不及。动态的、用户导向的 Chatbot Arenas 和 WildVision 在模型评估中越来越受欢迎,但是它们需要收集成千上万的用户偏好,评估成本极高。

LiveBench 的核心思想是在一个不断更新的数据集上评估模型的性能,以实现零污染且保持低成本。作者团队从网络上收集评估数据,并构建了一条 pipeline,自动从新闻和社区论坛等网站收集最新的全球信息。为了确保信息的及时性和真实性,作者团队从包括 CNN、BBC、日本朝日新闻和中国新华社等 60 多个新闻媒体,以及 Reddit 等论坛中选择来源。

具体步骤如下:

  1. 捕捉主页截图并去除广告和非新闻元素。
  2. 使用当前最强大的多模态模型(如 GPT4-V、Claude-3-Opus 和 Gemini-1.5-Pro)设计问题和答案集。由另一模型审查和修订问题,确保准确性和相关性。
  3. 人工审查最终的问答集,每月收集约 500 个问题,保留 100-300 个作为最终的 livebench 问题集。
  4. 采用 LLaVA-Wilder 和 Vibe-Eval 的评分标准 – 评分模型根据提供的标准答案评分,得分范围为 [1, 10]。默认评分模型为 GPT-4o,还包括 Claude-3-Opus 和 Gemini 1.5 Pro 作为备选。最终的报告结果将基于得分转换为 0 到 100 的准确率指标。

未来可以在动态更新的榜单里查看多模态模型在每个月动态更新的最新评测数据,以及在榜单上的最新评测的结果。这种动态机制有效防止了模型过拟合于特定静态数据集,确保了评测结果的时效性和真实性。

总结

LMMs-Eval 及其衍生方案为多模态大模型的研究提供了一个坚实的基础设施。通过解决评测成本高、数据泄露风险以及标准不统一的问题,它使得研究人员能够更公平、更高效地比较不同模型的能力。无论是追求全面覆盖的 Lite 版本,还是追求零泄露的 LiveBench,都为 AI 社区的进步提供了重要的参考依据。

目录

  1. 前言
  2. 标准化测评框架
  3. 统一接口
  4. 一键式启动
  5. 透明可复现
  6. 评测的「不可能三角」
  7. LMMs-Eval-Lite: 广覆盖轻量级评估
  8. LiveBench: LMMs 动态测试
  9. 总结
  • 免费图片AI生成工具免费生成了解详情
  • Magick API 一键接入全球大模型注册送1000万token查看
  • 免费图片视频在线生成30秒,将你的创意变成现实开始设计
  • X/Twitter免费视频下载器免登陆无限额度免费视频解析下载了解详情
  • 100+免费在线小游戏爽一把
极客日志微信公众号二维码

微信扫一扫,关注极客日志

微信公众号「极客日志V2」,在微信中扫描左侧二维码关注。展示文案:极客日志V2 zeeklog

更多推荐文章

查看全部
  • 即时通讯系统核心模块:从传输到存储的全链路设计
  • Spring Boot @ConditionalOnMissingBean 误判问题深度解析
  • Dev-C++ 下载与安装详细教程
  • 飞算 JavaAI 编程助手在 IDEA 中的安装教程:本地、离线及在线方法
  • 图寻路算法详解:基于深度优先搜索 (DFS) 实现
  • C++ 二叉搜索树(BST)核心实现与原理详解
  • OpenClaw 深度解析:构建从认知到行动的 AI 智能体框架
  • 前端国际化最佳实践:从硬编码到专业方案
  • Ubuntu 22.04 升级 Node.js 版本方法
  • 强化学习:PPO 算法的 Python 实现与解析
  • Python 列表:创建、操作与切片详解
  • 基于 Ant Design Vue 4.x 的然然管理系统前端架构实践
  • 规则引擎详解:概念、作用、场景、痛点与主流开源方案对比
  • Git 实战:首次将本地项目上传至 GitHub 仓库
  • VSCode 禁用 Copilot 代码自动补全
  • 李飞飞最新论文:我们需要什么样的 AI Agent
  • 融合手术导板与增强现实的椎弓根螺钉置入技术验证
  • Web前端基础入门:HTML、CSS与JavaScript核心知识
  • Hookshot:轻量级 GitHub Webhook 处理工具
  • 贪心算法实战:300.最长递增子序列

相关免费在线工具

  • 加密/解密文本

    使用加密算法(如AES、TripleDES、Rabbit或RC4)加密和解密文本明文。 在线工具,加密/解密文本在线工具,online

  • RSA密钥对生成器

    生成新的随机RSA私钥和公钥pem证书。 在线工具,RSA密钥对生成器在线工具,online

  • Mermaid 预览与可视化编辑

    基于 Mermaid.js 实时预览流程图、时序图等图表,支持源码编辑与即时渲染。 在线工具,Mermaid 预览与可视化编辑在线工具,online

  • 随机西班牙地址生成器

    随机生成西班牙地址(支持马德里、加泰罗尼亚、安达卢西亚、瓦伦西亚筛选),支持数量快捷选择、显示全部与下载。 在线工具,随机西班牙地址生成器在线工具,online

  • Gemini 图片去水印

    基于开源反向 Alpha 混合算法去除 Gemini/Nano Banana 图片水印,支持批量处理与下载。 在线工具,Gemini 图片去水印在线工具,online

  • curl 转代码

    解析常见 curl 参数并生成 fetch、axios、PHP curl 或 Python requests 示例代码。 在线工具,curl 转代码在线工具,online