跳到主要内容
极客日志极客日志面向AI+效率的开发者社区
首页博客我的书AI学习GitHub 精选镜像AI 生图工具UI配色美学关于
搜索内容 / 工具 / 仓库 / 镜像...⌘K搜索
注册
博客列表
PythonAI算法

DeepSeek 开源 Janus-Pro 统一多模态模型,7B 版本性能显著增强

DeepSeek 发布下一代统一多模态模型 Janus-Pro,包含 1B 和 7B 两个尺寸。该模型在架构上解耦了多模态理解与生成的视觉编码,通过优化的三阶段训练策略及扩展的训练数据,在多模态理解和文本到图像生成任务上取得了显著进步。7B 版本相比前代规模扩大,收敛速度提升,性能超越以往统一模型并匹配特定任务模型水平。

星星泡饭发布于 2025/2/7更新于 2026/9/1059 浏览
DeepSeek 开源 Janus-Pro 统一多模态模型,7B 版本性能显著增强

DeepSeek 开源 Janus-Pro 统一多模态模型

继 DeepSeek R1 之后,DeepSeek 正式开源下一代统一多模态模型 Janus-Pro。该系列包含两个尺寸:Janus-Pro-1B 和 Janus-Pro-7B。Janus-Pro 在架构、训练策略及数据规模上进行了全面升级,在多模态理解和文本到图像生成能力方面取得了显著进步。

性能表现

Janus-Pro 超越了以往的多模态统一模型,其性能与特定任务的专用模型相匹配甚至超越。在多项基准测试中,包括 Meta、Google、OpenAI 及 Stability AI 等厂商的模型对比中,Janus-Pro 展现了强大的竞争力。

Janus-Pro 性能对比图

在理解(Und.)和生成(Gen.)任务上,Janus-Pro 均表现出色。使用外部预训练扩散模型的模型用†标记,Janus-Pro 无需依赖此类外部模型即可达到同等效果。

Janus-Pro 理解与生成能力

架构设计

Janus-Pro 的核心设计原则是解耦多模态理解和生成的视觉编码。它采用独立的编码方法将原始输入转换为特征,随后由统一的自回归 Transformer 进行处理。

  • 多模态理解:使用 SigLIP-L 编码器从图像中提取高维语义特征。
  • 视觉生成:使用 VQ tokenizer 将图像转换为离散 ID。

这些特征序列被拼接后输入到 LLM 中进行处理,实现了理解与生成的统一架构。

Janus-Pro 架构图

优化的训练策略

Janus-Pro 对原有的三阶段训练过程进行了深度优化,以提升训练效率和最终性能:

  1. 第一阶段:增加训练步骤,充分训练 ImageNet 数据集。即使 LLM 参数固定,模型也能有效建模像素依赖并生成合理图像,为后续生成任务打下基础。
  2. 第二阶段:放弃 ImageNet 数据,直接使用正常的文本到图像数据训练模型生成图像。这一调整提高了训练效率,并直接提升了整体生成性能。
  3. 第三阶段:调整数据比例,减少文本到图像数据的比例。此举旨在维持强大的视觉生成能力的同时,显著提高多模态理解性能,实现两者的平衡。

数据扩展

为了进一步提升模型能力,Janus-Pro 在多模态理解和视觉生成方面大幅扩展了训练数据:

  • 多模态理解:增加了约 9000 万样本,涵盖图像字幕数据集以及表格、图表、文档理解数据。这增强了模型对复杂视觉信息的解析能力。
  • 视觉生成:增加了约 7200 万合成美学数据样本,使真实数据与合成数据的比例达到 1:1。这不仅提高了模型的收敛速度,还显著改善了输出图像的美学质量。

模型扩展

Janus-Pro 将模型规模从 1.5B 扩展到 7B。实验表明,使用更大规模的 LLM 时,多模态理解和视觉生成的损失收敛速度显著提高,验证了该方法的强可扩展性。更大的参数量使得模型能够捕捉更复杂的语义关系和生成细节。

资源下载

开发者可以通过以下链接获取模型权重及代码仓库:

https://hf-mirror.com/deepseek-ai/Janus-Pro-7B
https://hf-mirror.com/deepseek-ai/Janus-Pro-1B
https://github.com/deepseek-ai/Janus

总结

Janus-Pro 通过架构解耦、训练策略优化及大规模数据扩展,成功实现了多模态理解与生成能力的双重提升。7B 版本的推出标志着统一多模态模型向通用人工智能迈出了重要一步,为后续研究和应用提供了强有力的基座。

目录

  1. DeepSeek 开源 Janus-Pro 统一多模态模型
  2. 性能表现
  3. 架构设计
  4. 优化的训练策略
  5. 数据扩展
  6. 模型扩展
  7. 资源下载
  8. 总结

更多推荐文章

查看全部
  • 云开发 Copilot:AI 如何重塑低代码开发流程
  • 阿里 Qoder AI 编程插件评测:JetBrains 深度集成体验
  • Java 注解与反射实战:实现自定义日志与参数校验注解
  • RAG+AI 工作流与 Agent:主流 LLM 框架选型对比 MaxKB Dify FastGPT RagFlow
  • ProcessHacker 系统事件监控与日志分析技巧
  • 双延迟深度确定性策略梯度算法 (TD3) 详解
  • 网络安全人才供需严重失衡,预计 2027 年缺口将扩大到 300 万人
  • FPGA 基于 AD7606 的 8 通道高速同步采集系统设计与 Verilog 实现
  • C++ 哈希表原理及 unordered_set/map 实现
  • Python 虚拟环境管理工具 UV:从安装到高级用法详解
  • C++ 适配器模式实现 STL 的 stack 和 queue
  • 二叉树的顺序实现与堆结构详解
  • Spring Boot 2.7.18 版本概览与升级建议
  • Flutter 在 OpenHarmony 上适配 cached_network_image 与 path_provider 实现图片缓存优化
  • LRU 与 LFU 页面置换算法对比及 Golang 实现
  • 2024 AI 大模型常见面试问题及参考答案
  • KaiwuDB 3.1.0 在 Ubuntu 22.04 部署实战:TLS 配置与性能测试
  • OpenVLA 深度解析:基于 Prismatic VLM 的离散化动作预测
  • Linux 线程与进程的资源划分与内核实现全景解析
  • 8 大 AI 平台速度与 Token 消耗对比测试

相关免费在线工具

  • 加密/解密文本

    使用加密算法(如AES、TripleDES、Rabbit或RC4)加密和解密文本明文。 在线工具,加密/解密文本在线工具,online

  • RSA密钥对生成器

    生成新的随机RSA私钥和公钥pem证书。 在线工具,RSA密钥对生成器在线工具,online

  • Mermaid 预览与可视化编辑

    基于 Mermaid.js 实时预览流程图、时序图等图表,支持源码编辑与即时渲染。 在线工具,Mermaid 预览与可视化编辑在线工具,online

  • 随机西班牙地址生成器

    随机生成西班牙地址(支持马德里、加泰罗尼亚、安达卢西亚、瓦伦西亚筛选),支持数量快捷选择、显示全部与下载。 在线工具,随机西班牙地址生成器在线工具,online

  • Gemini 图片去水印

    基于开源反向 Alpha 混合算法去除 Gemini/Nano Banana 图片水印,支持批量处理与下载。 在线工具,Gemini 图片去水印在线工具,online

  • curl 转代码

    解析常见 curl 参数并生成 fetch、axios、PHP curl 或 Python requests 示例代码。 在线工具,curl 转代码在线工具,online