跳到主要内容
极客日志极客日志面向AI+效率的开发者社区
首页博客我的书AI学习GitHub 精选镜像AI 生图工具UI配色美学关于
搜索内容 / 工具 / 仓库 / 镜像...⌘K搜索
注册
博客列表
PythonAI算法

大模型前沿:8 篇必读论文

涵盖扩散模型推理时扩展、机器写作框架 OmniThink、增强型 tokenization ViT 架构、大推理模型 LRM 综述、视频物理原理理解基准 Physics-IQ、视觉 - 语言 - 动作模型 FAST 动作 tokenizer、人像重光照 SynthLight 以及阿里 AnyStory 个性化主体生成方法等八项前沿技术进展。

嘘发布于 2025/2/7更新于 2026/9/1077 浏览
大模型前沿:8 篇必读论文

谷歌提出「扩散模型的推理时扩展」

生成式模型在各个领域都产生了重大影响,这主要归功于它们在训练过程中通过增加数据、计算资源和模型大小来扩展的能力,即遵循 scaling laws。最近的研究已开始探索大语言模型(LLM)的推理时扩展,揭示了在推理过程中如何通过额外的计算进一步提高性能。与 LLM 不同,扩散模型本身具有灵活性,可以通过去噪步骤的数量来调整推理时的计算量,不过性能提升通常在几十步之后就会趋于平稳。

在这项工作中,谷歌团队探索了扩散模型在增加去噪步数后的推理时扩展,并研究了生成性能如何随着计算量的增加而进一步提高。具体来说,他们考虑了一个搜索问题,旨在为扩散采样过程确定更好的噪声。他们从两个方向构建设计空间:用于提供反馈的校验器,以及用于寻找更好候选噪声的算法。

通过在类约束和文本约束图像生成基准上进行大量实验,他们的研究结果表明,增加推理时的计算量可大幅提高扩散模型生成样本的质量,而且由于图像的复杂性,可以根据不同的应用场景,有针对性地选择框架中的组件组合。

论文链接: https://arxiv.org/abs/2501.09732

OmniThink:通过思考拓展机器写作知识边界

使用大语言模型(LLM)的机器写作通常依赖于检索增强生成(RAG)。然而,这些方法仍然局限于模型预定义的范围内,限制了具有丰富信息的内容的生成。具体来说,虚无的检索信息往往缺乏深度和实用性,并且存在冗余,这对生成文章的质量产生了负面影响,导致输出内容肤浅、重复和缺乏原创性。

为了解决这些问题,来自浙江大学和阿里的团队推出了一个模拟人类思维迭代扩展与反思过程的机器写作框架——OmniThink。OmniThink 背后的核心理念是模拟学习者在逐步加深对主题的了解时的认知行为。

实验结果表明,OmniThink 能够在不牺牲连贯性和深度等指标的情况下,提升生成文章的知识密度。人类评估和专家反馈进一步强调了 OmniThink 在解决长篇文章生成中实际问题方面的潜力。

论文地址: https://arxiv.org/abs/2501.09751 项目地址: https://zjunlp.github.io/project/OmniThink/

Meta 推出增强型 tokenization ViT 架构

通过自动编码技术进行视觉 tokenization,可以将像素压缩到潜在空间,从而增强 SOTA 图像和视频生成模型的能力。尽管对基于 transformer 的生成器进行扩展已经成为近期的研究重点,但 tokenizer 组件本身却很少进行扩展,这就给自动编码器的设计选择如何影响其重建目标和下游生成性能留下了未决的问题。

在这项工作中,来自得克萨斯大学奥斯汀分校和 Meta 的研究团队旨在对自动编码器的扩展进行探索,以填补这一空白。为了促进这一探索,他们用增强型 tokenization ViT 架构(ViTok)取代了典型的卷积骨干。他们在远超 ImageNet-1K 的大规模图像和视频数据集上训练 ViTok,消除了 tokenizer 扩展方面的数据限制。

他们首先研究了自动编码器瓶颈的扩展如何影响重构和生成,发现它虽然与重构高度相关,但与生成的关系更为复杂。接下来,他们探讨了分别扩展自动编码器的编码器和解码器对重构和生成性能的影响。重要的是,他们发现扩大编码器的规模对重构或生成的增益都很小,而扩大解码器的规模可提高重构性能,但对生成的增益则较为复杂。

在探索的基础上,他们将 ViTok 设计为轻量级自动编码器,其在 ImageNet-1K 和 COCO 重建任务(256p 和 512p)上的性能可与其他 SOTA 自动编码器相媲美,同时在 UCF-101 的 16 帧 128p 视频重建上的性能优于现有的自动编码器,同时减少了 2-5 倍的 FLOP。与扩散 transformer 集成后,ViTok 在 ImageNet-1K 的图像生成方面表现出极具竞争力的性能,并在 UCF-101 的类条件视频生成方面树立了 SOTA 基准。

论文链接: https://arxiv.org/abs/2501.09755 项目地址: https://vitok.github.io

综述:大推理模型 LRM

长期以来,语言一直被视为人类推理的重要工具。大语言模型(LLM)的突破引发了人们对利用这些模型解决复杂推理任务的兴趣。相关研究已经超越了简单的自回归 token 生成,引入了'思维'的概念,即代表推理过程中间步骤的 token 序列。这种创新范式使 LLM 能够模仿复杂的人类推理过程,如树搜索和反思性思维。

最近,一种新兴的推理学习趋势是应用强化学习(RL)来训练 LLM 掌握推理过程。这种方法可以通过试错搜索算法自动生成高质量的推理轨迹,通过提供更多的训练数据来显著提高 LLM 的推理能力。此外,最近的研究表明,鼓励 LLM 在测试时推理使用更多 token 进行'思考',可以进一步显著提高推理的准确性。因此,训练时和测试时的扩展相结合,展现出一个新的研究前沿——一条通往大推理模型的道路。OpenAI o1 系列的推出是这一研究方向的重要里程碑。

来自清华大学的研究团队及其合作者全面回顾了 LLM 推理的最新进展。他们首先介绍了 LLM 的基础背景,然后探讨了推动大推理模型发展的关键技术要素,包括自动数据构建、学习推理技术和测试时扩展等重点。他们还分析了构建大推理模型的流行开源项目,最后提出了公开挑战和未来研究方向。

论文链接: https://arxiv.org/abs/2501.09686

Google DeepMind:视频大模型可以通过观看视频学到物理原理吗?

人工智能视频生成正在经历一场革命,视频质量和真实感都迅速提升。这些进展引发了一场激烈的科学辩论:视频模型是可以像世界模型那样发现物理规律?还是仅仅是在不理解现实的物理原理的情况下实现视觉真实感的复杂像素预测器?

为了解决这个问题,来自索菲亚大学和 Google DeepMind 的研究团队开发了一个综合基准数据集——Physics-IQ,只有通过深入学习各种物理原理,如流体力学、光学、固体力学、磁学和热力学,数据集中所提出的挑战才能被正确解答。他们发现,目前的一系列模型(如 Sora、Runway、Pika、Lumiere、Stable Video Diffusion 和 VideoPoet),对物理原理的理解非常有限,而且与视觉真实感不相关。同时,有些测试案例已经可以成功解决。这表明,仅通过观察就能获得某些物理原理是可能的,但仍存在重大挑战。尽管他们预计未来会有快速进展,但研究表明,具备视觉真实感并不意味着具备物理理解。

论文链接: https://arxiv.org/abs/2501.09038 项目地址: https://physics-iq.github.io/

FAST:视觉 - 语言 - 动作模型的高效动作 tokenizer

自回归序列模型,例如基于 transformer 的视觉 - 语言 - 动作(VLA)策略,可以有效地捕捉复杂且可泛化的机器人行为。然而,这些模型要求对连续动作信号进行 tokenization 处理,这决定了模型预测的离散符号如何映射到连续的机器人动作上。

来自 Physical Intelligence、加州大学伯克利分校以及斯坦福大学的研究团队发现,目前的机器人动作 tokenization 方法只基于简单的按维度、按时间分箱方案,在从高频机器人数据中学习灵巧技能时通常表现不佳。为了解决这一问题,他们提出了一种基于离散余弦变换的新型机器人动作压缩 tokenization 方法。这一方法,即 Frequency-space Action Sequence Tokenization(FAST),能够训练适用于高度灵巧和高频任务的自回归 VLA,而传统的离散化方法在这些任务上完全失效。

在 FAST 的基础上,他们推出了通用机器人动作 tokenizer FAST+,它是在 100 万个真实机器人动作轨迹上训练出来的。它可以作为黑盒 tokenizer,用于具有不同动作空间和控制频率的各种机器人动作序列。最后,他们展示了当与 π0 VLA 结合使用时,他们的方法可以扩展到对 10k 小时的机器人数据进行训练,并与扩散 VLA 的性能相媲美,同时将训练时间最多缩短 5 倍。

论文链接: https://arxiv.org/abs/2501.09747 项目地址: https://www.pi.website/research/fast

SynthLight:利用扩散模型进行人像重光照

来自耶鲁大学和 Adobe 的研究团队推出了 SynthLight,这是一种用于人像重光照的扩散模型。他们的方法将图像重光照视为一个像素根据环境光照条件的变换而变化的重渲染问题。通过使用基于物理的渲染引擎,他们合成了一个数据集,模拟 3D 头部模型在不同光照条件下的光照变换。他们提出了两种训练和推理策略来弥合合成和真实图像领域之间的差距:(1)多任务训练,利用没有光照目标值的真实人像;(2)基于无分类器引导的推理时扩散采样过程,利用输入的人像来更好地保留细节。

他们的方法适用于各种真实照片,能在保留主体的身份特征的同时,产生逼真的光照效果,包括镜面高光和投射阴影。他们在 Light Stage 数据上进行的定量实验表明,其结果可与 SOTA 重光照方法相媲美。他们在实际图像上的定性结果展示了前所未有的丰富光照效果。

论文链接: https://arxiv.org/abs/2501.09756 项目地址: https://vrroom.github.io/synthlight/

阿里团队提出个性化主体生成方法 AnyStory

最近,大规模生成式模型展示了出色的'文生图'能力。然而,生成具有特定主题的高保真个性化图像仍然是一项挑战,尤其是在涉及多个主题的情况下。

在这项工作中,阿里通义实验室提出了一种统一的个性化主体生成方法 AnyStory,其不仅能实现单个主体的高保真个性化,还能实现多个主体的高保真个性化,而且不会牺牲主体的保真度。

具体来说,AnyStory 以'先编码后路由'的方式模拟主体个性化问题。在编码步骤中,AnyStory 利用通用且功能强大的图像编码器 ReferenceNet,结合 CLIP 视觉编码器,实现对主体特征的高保真编码。在路由步骤中,AnyStory 利用解耦的实例感知主体路由来准确感知和预测相应主体在潜空间中的潜在位置,并指导主体条件的注入。

详细的实验结果表明,这一方法在保留主体细节、调整文本描述以及为多个主体提供个性化服务方面表现出色。

论文链接: https://arxiv.org/abs/2501.09503 项目地址: https://aigcdesigngroup.github.io/AnyStory/

目录

  1. 谷歌提出「扩散模型的推理时扩展」
  2. OmniThink:通过思考拓展机器写作知识边界
  3. Meta 推出增强型 tokenization ViT 架构
  4. 综述:大推理模型 LRM
  5. Google DeepMind:视频大模型可以通过观看视频学到物理原理吗?
  6. FAST:视觉 - 语言 - 动作模型的高效动作 tokenizer
  7. SynthLight:利用扩散模型进行人像重光照
  8. 阿里团队提出个性化主体生成方法 AnyStory

更多推荐文章

查看全部
  • CSS 盒子模型详解及美化技巧
  • 即时通讯系统核心模块:从传输到存储的全链路设计
  • 多模态大模型 API 调用与本地部署成本对比分析
  • llama.cpp 使用过程中的常见问题与解决方案
  • 自然语言处理(NLP)核心原理与实战案例详解
  • GitHub 学生认证获取 Copilot Pro 使用指南
  • 政务热线智能分拨助手工作流的导出与导入实践
  • 【AI开发】—— OpenCode Superpowers 插件安装+使用全指南
  • 基于 Rokid AR 眼镜的聚会游戏助手开发实战
  • Spring IoC 与依赖注入详解
  • C++ 构造数据类型知识点梳理
  • GitHub 日榜热门项目精选 (2026-03-20)
  • React 结合 Microi 吾码实现低代码开发教程
  • 基于Vivado的AD9680 FPGA芯片测试程序开发
  • Gitea 安装配置及常用 Git 命令指南
  • 基于 Leaflet-Trackplayer 实现高速轨迹 WebGIS 可视化实战
  • FPGA DDR4 读写控制:MIG IP 核控制信号详解
  • 前端调试:使用浏览器开发者工具查看接口调用与参数
  • LLM 存储优化实战:解决大量 QA 与长对话记忆问题
  • Python 入门实战:从零编写你的第一个网络爬虫

相关免费在线工具

  • 加密/解密文本

    使用加密算法(如AES、TripleDES、Rabbit或RC4)加密和解密文本明文。 在线工具,加密/解密文本在线工具,online

  • RSA密钥对生成器

    生成新的随机RSA私钥和公钥pem证书。 在线工具,RSA密钥对生成器在线工具,online

  • Mermaid 预览与可视化编辑

    基于 Mermaid.js 实时预览流程图、时序图等图表,支持源码编辑与即时渲染。 在线工具,Mermaid 预览与可视化编辑在线工具,online

  • 随机西班牙地址生成器

    随机生成西班牙地址(支持马德里、加泰罗尼亚、安达卢西亚、瓦伦西亚筛选),支持数量快捷选择、显示全部与下载。 在线工具,随机西班牙地址生成器在线工具,online

  • Gemini 图片去水印

    基于开源反向 Alpha 混合算法去除 Gemini/Nano Banana 图片水印,支持批量处理与下载。 在线工具,Gemini 图片去水印在线工具,online

  • curl 转代码

    解析常见 curl 参数并生成 fetch、axios、PHP curl 或 Python requests 示例代码。 在线工具,curl 转代码在线工具,online