1. 文继荣团队:通过主动检索进行渐进式多模态推理
多步骤多模态推理任务给多模态大语言模型(MLLM)带来了巨大的挑战,而如何找到有效的方法来提高这些模型在此类场景中的性能仍然是一个难题。
在这项工作中,文继荣教授团队提出了一个通用框架 AR-MCTS,旨在通过主动检索(AR)和蒙特卡洛树搜索(MCTS)逐步提高 MLLM 的推理能力。该方法首先是开发一个统一的检索模块,从混合模式检索语料库中检索解决复杂推理问题的关键支持性见解。为了缩小自动多模态推理验证方面的差距,他们采用了 MCTS 算法与主动检索机制相结合的方法,从而能够自动生成分步注释。该策略可动态检索每个推理步骤的关键见解,超越了传统的波束搜索采样,提高了推理空间的多样性和可靠性。
此外,他们还提出了一个过程奖励模型,通过逐步对齐来支持多模态推理任务的自动验证。三个复杂多模态推理基准的实验结果证实了 AR-MCTS 框架在提高各种多模态模型性能方面的有效性。进一步的分析表明,AR-MCTS 可以优化采样多样性和准确性,从而产生可靠的多模态推理。
论文链接: https://arxiv.org/abs/2412.14835
2. 清华、智谱团队提出 LongBench v2:LLM 的长文本理解和推理评估
在这项工作中,来自清华大学和智谱的研究团队提出了 LongBench v2,这是一项旨在评估大语言模型(LLM)处理长上下文问题能力的基准测试,这些问题需要在现实世界的多重任务中进行深入理解和推理。
LongBench v2 由 503 道具有挑战性的选择题组成,上下文字数从 8k 到 2M 不等,涉及六大任务类别:单文档问答、多文档问答、长上下文学习、长对话历史理解、代码库理解和长结构化数据理解。为了确保数据的广泛性和实用性,他们从近 100 名具有不同专业背景的高学历人员那里收集数据。为了保证数据的高质量和高难度,他们同时采用了自动和人工审核流程,在 15 分钟的时间限制内,人类专家的准确率仅为 53.7%。
评估显示,即使是表现最好的模型,在直接回答问题时的准确率也仅为 50.1%。相比之下,包含长推理的 o1-preview 模型达到了 57.7%,比人类基线高出 4%。这些结果凸显了增强推理能力和扩大推理时计算的重要性,以应对 LongBench v2 中的长上下文挑战。
论文链接: https://arxiv.org/abs/2412.15204 项目地址: https://longbench2.github.io/
3. 哈佛团队提出掩码感知双扩散模型 MADD
作为一种常见的图像编辑操作,图像合成涉及将前景物体整合到背景场景中。
在这项工作中,来自哈佛大学的研究团队及其合作者将'Affordance'概念的应用从以人为本的图像合成任务扩展到更广泛的对象 - 场景合成框架,以解决前景对象与背景场景之间复杂的相互作用。根据 Affordance 原则,他们定义了 affordance-aware object insertion 任务,旨在通过各种位置提示将任何对象无缝插入任何场景中。为了解决数据有限的问题并将这项任务纳入其中,他们构建了 SAM-FB 数据集,其中包含 3000 多个对象类别的 300 多万个示例。此外,他们还提出了掩码感知双扩散(MADD)模型,该模型利用双流架构同时对 RGB 图像和插入掩码进行去噪。通过在扩散过程中对插入掩码进行明确建模,MADD 有效地促进了 Affordance 概念的实现。
广泛的实验结果表明,这一方法优于其他 SOTA 方法,并且在真实世界图像上表现出很强的泛化性能。
论文链接: https://arxiv.org/abs/2412.14462 GitHub 地址: https://github.com/KaKituken/affordance-aware-any
4. 英伟达团队推出 AceMath:通过后训练和奖励建模提升数学推理
在这项工作中,英伟达团队推出了 AceMath,这是一套能够出色解决复杂数学问题的前沿数学模型,以及能够评估生成的解决方案并可靠地识别正确解决方案的高效奖励模型。
为了开发经过指令微调的数学模型,他们提出了一个有监督微调(SFT)过程,首先在一般领域实现有竞争力的性能,然后使用精心策划的提示集和合成生成的响应,对数学领域进行有针对性的微调。由此产生的 AceMath-72B-Instruct 模型优于 Qwen2.5-Math-72B-Instruct、GPT-4o 和 Claude-3.5 Sonnet。为了开发数学专用奖励模型,他们首先构建了一个全面切鲁棒的基准 AceMath-RewardBench,用于评估不同问题和难度级别的数学奖励模型。他们还提出了一种建立数学奖励模型的系统方法。由此产生的模型 AceMath-72B-RM 优于 SOTA 奖励模型。
此外,将 AceMath-72B-Instruct 与 AceMath-72B-RM 结合使用时,他们在数学推理基准测试中获得了最高的 rm@8 平均分。
论文链接: https://arxiv.org/abs/2412.15084 项目地址: https://research.nvidia.com/labs/adlr/acemath/
5. 一文读懂 GUI 智能体
由大型基础模型驱动的图形用户界面(GUI)智能体已成为人机交互自动化的一种方法。这些智能体通过 GUI 与数字系统或软件应用程序自主交互,模拟人类的操作,如点击、输入和在不同平台上导航视觉元素。
在这篇综述中,来自马里兰大学的研究团队及其合作者对 GUI 智能体的基准、评估指标、架构和训练方法进行了分类。他们提出了一个统一的框架,划分了它们的感知、推理、规划和行动能力。此外,他们还确定了重要的公开挑战,并讨论了未来的主要方向。最后,这项工作可以作为从业人员和研究人员直观了解当前进展、技术、基准和有待解决的关键开放问题的基础。
论文链接: https://arxiv.org/abs/2412.13501
6. FashionComposer:合成时尚图像生成
在这项工作中,来自香港大学的研究团队及其合作者推出了用于合成时尚图像生成的 FashionComposer。与以往的方法不同,FashionComposer 具有高度灵活性,可以接受多模态输入(即文本提示、参数化人体模型、服装图像和面部图像),并支持对人体的外观、姿势和身材进行个性化设计,以及一次性分配多套服装。
他们首先开发了一个通用框架,能够处理各种输入模态。他们构建了扩展的训练数据,以增强模型的合成能力。为了无缝容纳多张参考图像(服装和人脸),他们将这些参考图像组织成一个资产库,并使用参考 UNet 提取外观特征。为了将外观特征注入生成结果中的正确像素,他们提出了主题绑定注意力。它将不同资产的的外观特征与相应的文本特征绑定在一起。这样,模型就能根据每种资产的语义理解它们,并支持任意数量和类型的参考图像。
作为一个综合解决方案,FashionComposer 还支持许多其他应用,如人体画册生成、各种虚拟试穿任务等。
论文链接: https://arxiv.org/abs/2412.14168 项目地址: https://sihuiji.github.io/FashionComposer-Page/
7. AniDoc:让动画创作更简单
2D 动画的制作遵循行业标准的工作流程,包括四个基本阶段:角色设计、关键帧动画、中间处理和上色。来自香港科技大学的研究团队及其合作者希望利用生成式人工智能降低上述流程中的人工成本。AniDoc 以视频扩散模型为基础,是一款视频线条艺术着色工具,可根据参考角色规范自动将素描序列转换为彩色动画。这一模型利用对应匹配作为明确的指导,对参考角色和每一帧艺术线条之间的变化(如姿势)具有很强的鲁棒性。此外,这一模型甚至可以自动完成中间处理过程,用户只需提供角色图像以及开始和结束草图,就能轻松制作出时间一致的动画。
论文链接: https://arxiv.org/abs/2412.14173 项目地址: https://yihao-meng.github.io/AniDoc_demo/
8. 上海 AI Lab:大语言模型有稳定的推理能力吗?
大语言模型(LLMs)在复杂推理任务中取得了显著进步。然而,基准性能与实际应用之间仍然存在巨大差距。
在这项工作中,上海 AI Lab 团队认为,这一差距主要源于当前的评估协议和衡量标准,它们未能充分捕捉到 LLM 的全部能力,尤其是在复杂的推理任务中,准确性和一致性都至关重要。这项工作有两大贡献。首先,他们提出了一个新的评估指标 G-Pass@k,其可以在多次采样尝试中对模型性能进行连续评估,同时量化模型的峰值性能潜力及其稳定性。其次,他们提出了一个动态基准 LiveMathBench,其包含具有挑战性的当代数学问题,旨在最大限度地降低评估过程中的数据泄漏风险。通过使用 LiveMathBench 对 SOTA LLM 进行的广泛实验,他们对 LLM 的能力上限和操作一致性有了全面的了解。
研究结果表明,LLM 的现实推理能力还有很大的提升空间,也亟需更强大的评估方法。
论文链接: https://arxiv.org/abs/2412.13147
9. 清华黄民烈团队:利用 agent 实现异常安全代码生成
在现实世界的软件开发中,异常处理不当或缺失会严重影响代码的鲁棒性和可靠性。异常处理机制要求开发人员按照高标准来检测、捕获和管理异常,但许多开发人员在执行这些任务时非常吃力,导致代码非常脆弱。这个问题在开源项目中尤为明显,影响了软件生态系统的整体质量。
为了应对这一挑战,清华大学黄民烈教授团队及其合作者探索使用大语言模型(LLM)来改进代码中的异常处理。通过大量分析,他们发现了三个关键问题:对脆弱代码的不敏感检测、对异常块的不准确捕捉以及扭曲的处理方案。这些问题在现实世界的资源库中普遍存在,表明鲁棒的异常处理方法经常被忽视或处理不当。
为此,他们推出了一个多智能体框架 Seeker,其灵感来自于专家开发人员的异常处理策略。Seeker 使用 Scanner、Detector、Predator、Ranker 和 Handler 智能体协助 LLM 更有效地检测、捕获和解决异常。这项工作是利用 LLM 在实际开发场景中增强异常处理实践的首次系统性研究,为未来提高代码可靠性提供了宝贵的见解。
论文链接: https://arxiv.org/abs/2412.11713
10. Adobe 提出零样本主体驱动视频定制方法 SUGAR
Adobe Research 团队提出了一种用于主体驱动视频定制的零样本方法——SUGAR。给定一幅输入图像,SUGAR 就可以为图像中的主体生成视频,并根据用户输入文本指定的风格和动作等任意视觉属性对生成的视频进行对齐。
以往的方法需要在测试时进行微调,或者无法生成与文本对齐的视频,而 SUGAR 无需在测试时进行额外工作,就能实现优秀的效果。为了实现零样本能力,他们提出了一个可扩展的管道来构建合成数据集,该数据集是专为主题驱动的定制化设计的,可生成 250 万个图像 - 视频 - 文本三元组。此外,他们还提出了几种方法来增强他们的模型,包括特殊注意力设计、改进的训练策略和精炼的采样算法。
广泛的实验证明了这一方法的有效性。与之前的方法相比,SUGAR 在主体驱动视频定制的身份保持、视频动态和视频文本对齐方面都取得了 SOTA。
论文链接: https://arxiv.org/abs/2412.10533 项目地址: https://yufanzhou.com/SUGAR/


