跳到主要内容
极客日志极客日志面向AI+效率的开发者社区
首页博客我的书GitHub 精选镜像AI 生图工具UI配色美学关于
搜索内容 / 工具 / 仓库 / 镜像...⌘K搜索
注册
博客列表
PythonAI算法

13 个 SOTA 多模态大模型开源汇总(含论文与代码)

多模态大模型(MLLMs)在自然语言处理、计算机视觉和多模态理解方面取得显著进展。汇总了 13 个开源模型,包括 NExT-GPT、DreamLLM、LaVIT、MoE-LLaVA、LEGO、InternLM-XComposer2、mPLUG-PaperOwl、LION、PixelLM、Vary-toy、LLaVA 改进版、MobileVLM 及 CogAgent。内容涵盖任意对任意生成、协同理解创造、统一预训练、专家组合、语言增强定位、科学图表分析、双级视觉知识、像素推理、小型化优化、移动端应用及 GUI 代理等方向,提供各模型的核心特性与性能表现。

WenxuanMa发布于 2025/2/7更新于 2026/8/1746 浏览
13 个 SOTA 多模态大模型开源汇总(含论文与代码)

近年来,多模态大模型(Multimodal Large Language Models, MLLMs)在人工智能领域取得了显著的进展,特别是在自然语言处理、计算机视觉和多模态理解方面。这些模型能够理解和生成多种类型的数据,如文本、图像、音频和视频,为多模态学习和应用提供了强大的工具。

架构和创新

1. NExT-GPT: Any-to-Any Multimodal LLM(ICLR 2024)

简述: 本文提出了通用任意对任意 MM-LLM 系统 NExT-GPT,该系统将 LLM 与多模态适配器和不同解码器连接,使 NExT-GPT 能感知输入并以任意组合生成文本、图像、视频和音频输出。利用现有高性能编码器和解码器,NExT-GPT 仅需少量参数(1%)进行调优,有利于低成本训练和扩展。此外,研究人员引入模态切换指令调优(MosIT),并整理高质量数据集,使 NExT-GPT 具备复杂跨模态语义理解和内容生成能力。

2. DreamLLM: Synergistic Multimodal Comprehension and Creation(ICLR 2024)

简述: 本文提出了 DreamLLM,这是一个学习框架,它首先实现了多功能多模态大型语言模型(MLLM),该模型强调了多模态理解和创作之间的协同作用。DreamLLM 通过直接在原始多模态空间中采样来生成语言和图像,避免了外部特征提取器的局限性。此外,它能够生成原始交错文档,包括文本、图像和非结构化布局。DreamLLM 是首个能生成自由格式交错内容的 MLLM,实验证明,它作为零样本多模态通才表现出色,从增强的学习协同作用中获益。

3. Unified Language-Vision Pretraining in LLM with Dynamic Discrete Visual Tokenization(ICLR 2024)

简述: 本文提出了一种新的多模态大模型 LaVIT,它通过将视觉内容转换为可被语言模型处理的离散标记,实现了视觉和语言数据的统一处理。这种方法打破了传统方法中将视觉输入仅作为提示的局限性,使 LaVIT 能够无差别地处理图像和文本,提高了模型在视觉语言任务中的性能。实验结果表明,LaVIT 在处理大规模视觉语言任务方面优于现有模型。

4. MoE-LLaVA: Mixture of Experts for Large Vision-Language Models

简述: 本文提出了一种名为 MoE-tuning 的新的大型视觉语言模型(LVLM)训练策略,该策略构建了一个参数数量多但计算成本恒定的稀疏模型,解决了多模态学习和模型稀疏性相关的性能下降问题。还提出了 MoE-LLaVA 框架,一种基于 MoE 的稀疏 LVLM 架构,它在部署期间只激活部分专家,从而减少了计算成本。实验表明,MoE-LLaVA 在视觉理解方面表现出色,并减少了模型输出的幻觉。MoE-LLaVA 使用 30 亿个稀疏激活的参数,在各种视觉理解数据集上性能与 LLaVA-1.5-7B 相当,甚至在某些基准测试中超过了 LLaVA-1.5-13B。

5. LEGO: Language Enhanced Multi-modal Grounding Model

简述: 现有的多模态模型重点捕捉每个模态内的全局信息,但忽视了跨模态感知局部信息的重要性。为了解决这个问题,本文提出了 LEGO,一个语言增强的多模态定位模型,LEGO 不仅捕捉全局信息,还在需要细致理解输入数据内部细节的任务上表现出色,具有精确的识别和定位能力。

6. InternLM-XComposer2: Mastering Free-form Text-Image Composition and Comprehension in Vision-Language Large Models

简述: 本文提出了 InternLM-XComposer2,一种先进的视觉语言模型,擅长自由格式的文本图像合成和理解,该模型能从多输入创建定制内容,超越传统视觉语言理解。采用部分 LoRA 方法,专为图像标记调整参数,保持语言知识完整,平衡视觉理解和文本创作。实验显示,基于 InternLM2-7B 的 InternLM-XComposer2 在长文本多模态创作中表现优异,视觉语言理解能力超越现有模型,某些评估与 GPT-4V 和 Gemini Pro 相当或更佳,展现卓越多模态理解能力。

7. mPLUG-PaperOwl: Scientific Diagram Analysis with the Multimodal Large Language Model

简述: 本文提出了多模态图理解数据集 M-Paper,解析优质论文的 Latex 源文件,将图表与相关段落对齐,形成专业图表分析样本。M-Paper 是首个支持联合理解多个科学图表的数据集,包括图像或 Latex 格式的图形和表格。为确保副驾驶与用户意图一致,还引入'轮廓'作为控制信号,可由用户直接给出或修改。使用最先进的 Multimodal LLM 进行的综合实验表明,在这个数据集上进行训练显示出更强的科学图表理解性能,包括图表标题、图表分析和大纲推荐。

8. LION: Empowering Multimodal Large Language Model with Dual-Level Visual Knowledge

简述: 本文提出了 LION,一种双层次的视觉知识增强多模态大型语言模型,通过在细粒度和高级语义层面整合视觉知识来提高模型的性能。LION 使用视觉聚合器整合细粒度空间感知视觉知识,并采用阶段级指令调优策略减少任务间的冲突。此外,它还利用软提示方法结合图像标签的高级语义,以减轻不完美预测标签的影响。实验结果显示,LION 在多个多模态基准测试中优于现有模型。

9. PixelLM: Pixel Reasoning with Large Multimodal Model

简述: 本文提出了 PixelLM,这是一个用于像素级推理和理解的有效且高效的模型,它的核心是一个轻量级的像素解码器和全面的分割码本。PixelLM 通过解码器生成掩码来编码详细的目标信息,避免了需要额外昂贵分割模型的需求。研究人员还提出了一个目标细化损失来提高模型区分多个目标的能力。PixelLM 在多个像素级图像推理和理解任务中表现优异,超越了成熟的方法。

模型优化和特定场景应用

10. Small Language Model Meets with Reinforced Vision Vocabulary

简述: 本文提出了 Vary-toy,这是一个小型化的 Vary 和 Qwen-1.8B 模型,适合在消费级 GPU 上训练和部署。Vary-toy 通过改进的视觉词汇,不仅保留了 Vary 的特性,还增强了通用性。在实验中,Vary-toy 在多个基准测试中取得了不错的成绩,如 DocVQA 的 65.6% ANLS、ChartQA 的 59.1% 准确率、RefCOCO 的 88.1% 准确率和 MMVet 的 29% 准确率。

11. Improved Baselines with Visual Instruction Tuning

简述: 大型多模态模型(LMM)在视觉教学调优方面取得进展,LLaVA 的全连接视觉语言跨模态连接器表现出色,数据效率高。本文通过简单修改 LLaVA,使用 MLP 投影和 VQA 数据,建立更强大基线,在 11 个基准测试中实现最先进。最终的 13B 检查点仅使用 1.2M 数据,在单个节点上训练完成。这使得最先进的 LMM 研究更易获得。

12. MobileVLM: A Fast, Strong and Open Vision Language Assistant for Mobile Devices

简述: 本文提出了 MobileVLM,一个为移动设备设计的强大多模态视觉语言模型。它结合了专为移动设备设计的语言模型和预训练的多模态视觉模型,通过高效的投影仪实现跨模态交互。MobileVLM 在典型的视觉语言模型基准测试中表现出色,与更大模型相比毫不逊色,并且在高通骁龙 888 CPU 和 NVIDIA Jetson Orin GPU 上对其进行了性能评估,分别达到了每秒 21.5 个令牌和 65.3 个令牌的推理速度,这是行业领先的成绩。

13. CogAgent: A Visual Language Model for GUI Agents

简述: 本文介绍了 CogAgent,一个 180 亿参数的视觉语言模型(VLM),专门用于 GUI 理解和导航。CogAgent 使用低和高分辨率图像编码器,支持分辨率为 1120*1120 的输入,能识别微小页面元素和文本。作为通用 VLM,CogAgent 在多个基准测试上实现最先进技术,包括 VQAv2、OK-VQA 等。它仅使用屏幕截图作为输入,优于基于 LLM 的方法,这些方法使用提取的 HTML 文本。

目录

  1. 架构和创新
  2. 1. NExT-GPT: Any-to-Any Multimodal LLM(ICLR 2024)
  3. 2. DreamLLM: Synergistic Multimodal Comprehension and Creation(ICLR 2024)
  4. 3. Unified Language-Vision Pretraining in LLM with Dynamic Discrete Visual Tokenization(ICLR 2024)
  5. 4. MoE-LLaVA: Mixture of Experts for Large Vision-Language Models
  6. 5. LEGO: Language Enhanced Multi-modal Grounding Model
  7. 6. InternLM-XComposer2: Mastering Free-form Text-Image Composition and Comprehension in Vision-Language Large Models
  8. 7. mPLUG-PaperOwl: Scientific Diagram Analysis with the Multimodal Large Language Model
  9. 8. LION: Empowering Multimodal Large Language Model with Dual-Level Visual Knowledge
  10. 9. PixelLM: Pixel Reasoning with Large Multimodal Model
  11. 模型优化和特定场景应用
  12. 10. Small Language Model Meets with Reinforced Vision Vocabulary
  13. 11. Improved Baselines with Visual Instruction Tuning
  14. 12. MobileVLM: A Fast, Strong and Open Vision Language Assistant for Mobile Devices
  15. 13. CogAgent: A Visual Language Model for GUI Agents
  • 免费图片AI生成工具免费生成了解详情
  • Magick API 一键接入全球大模型注册送1000万token查看
  • 免费图片视频在线生成30秒,将你的创意变成现实开始设计
  • X/Twitter免费视频下载器免登陆无限额度免费视频解析下载了解详情
  • 100+免费在线小游戏爽一把
极客日志微信公众号二维码

微信扫一扫,关注极客日志

微信公众号「极客日志V2」,在微信中扫描左侧二维码关注。展示文案:极客日志V2 zeeklog

更多推荐文章

查看全部
  • OpenAkita:自我进化的开源 AI 助手框架
  • 自然语言处理在医疗领域的实战应用
  • Kubernetes 企业级云原生运维实战:AIGC 智能重构与实践
  • 大语言模型 LoRA 技术综述:原理、应用与训练指南
  • Ubuntu 内网自建 APT 源指南(基于 apt-mirror)
  • Bun 替代 Node.js:更快的 JavaScript 运行时与开发体验
  • 前端独立产品设计全流程:基于 AI 的 ASCII、Wireframe 与代码生成工作流
  • Web 可访问性最佳实践:确保所有用户平等访问
  • JadeAI:开源 AI 简历生成器,支持 50 套模板与 Docker 部署
  • Qwen3-VL-WEBUI 视频理解能力实测:256K 上下文部署实战
  • whisper.cpp 跨平台语音识别部署实战指南
  • 文心一言 4.5 开源版本地化部署实测与性能分析
  • 智能家居数据可视化:5 个维度构建专业级 Home Assistant 仪表板
  • 腾讯云开发 Copilot 低代码开发体验与技术分析
  • OpenClaw 30+ 真实场景全拆解:AI Agent 落地实践指南
  • ESP32 对话机器人:整合 Coze 大模型与百度千帆 ASR/TTS
  • AI 辅助 Android Studio 快速搭建 WebView 项目模板
  • Web 开发者转型 AI 实战:基于 Agent 的代码质量分析 Skill 开发指南
  • 单链表综合练习:删除指定节点、反转与查找中间节点
  • Microsoft 365 Copilot 与 Copilot Chat 详细对比

相关免费在线工具

  • 加密/解密文本

    使用加密算法(如AES、TripleDES、Rabbit或RC4)加密和解密文本明文。 在线工具,加密/解密文本在线工具,online

  • RSA密钥对生成器

    生成新的随机RSA私钥和公钥pem证书。 在线工具,RSA密钥对生成器在线工具,online

  • Mermaid 预览与可视化编辑

    基于 Mermaid.js 实时预览流程图、时序图等图表,支持源码编辑与即时渲染。 在线工具,Mermaid 预览与可视化编辑在线工具,online

  • 随机西班牙地址生成器

    随机生成西班牙地址(支持马德里、加泰罗尼亚、安达卢西亚、瓦伦西亚筛选),支持数量快捷选择、显示全部与下载。 在线工具,随机西班牙地址生成器在线工具,online

  • Gemini 图片去水印

    基于开源反向 Alpha 混合算法去除 Gemini/Nano Banana 图片水印,支持批量处理与下载。 在线工具,Gemini 图片去水印在线工具,online

  • curl 转代码

    解析常见 curl 参数并生成 fetch、axios、PHP curl 或 Python requests 示例代码。 在线工具,curl 转代码在线工具,online