FlashRAG-Paddle:基于 PaddleNLP 的高效开发与评测 RAG 框架
论文标题:
FlashRAG: A Modular Toolkit for Efficient Retrieval-Augmented Generation Research
作者机构:
中国人民大学高瓴人工智能学院
论文链接:
https://arxiv.org/abs/2405.13576
项目链接 (Paddle 版本):
https://github.com/RUC-NLPIR/FlashRAG-Paddle
数据集链接:
https://huggingface.co/datasets/RUC-NLPIR/FlashRAG_datasets
产品亮点
1. FlashRAG-Paddle:组件化、模块化的 RAG 框架
全面且可定制的 RAG 框架,集成检索器、重排序器、生成器和压缩器等核心组件,提供 36 个基准数据集和 9 种先进算法,辅以高效预处理脚本,简化流程,轻松实现复杂 RAG 场景下的模型测试与验证。
2. PaddleNLP:超大 Batch 嵌入表示学习和多硬件高性能推理
PaddleNLP 提供一站式大语言模型解决方案,支持超大 Batch 嵌入学习,多硬件高性能推理,涵盖了 INT8/INT4 量化技术,以及 PageAttention、FlashDecoding 等高效的注意力机制优化和 TensorCore 深度优化,从而大幅提升训练与推理效率,全方位满足多样化的应用需求。
3. FlashRAG & PaddleNLP:检索增强生成结合高性能推理,更准更快,提升用户体验
基于飞桨框架 3.0 版本,PaddleNLP 内置了全环节算子融合等技术,使得 FlashRAG 推理性能相较于 transformers 动态图推理实现了 70% 以上的显著提升,结合检索增强知识,输出结果更加准确,为 FlashRAG 框架使用者带来了敏捷高效的使用体验。

背景介绍
在大语言模型时代,检索增强生成已成为缓解幻觉问题的有效解决方案。通过外接知识库,大模型可以在长尾问题、垂域问题上有良好的表现。检索增强生成(RAG)技术的广泛应用和巨大潜力吸引了大量研究关注。
然而,近年来随着大量 RAG 算法和模型的出现,如何在一致的环境下快速构建并比较评估这些方法变得越来越具有挑战性。同时,如何利用大语言模型为文本更快更好的构建准确嵌入表示、如何加速推理生成速度等方面也日益受到关注。
为解决上述问题,中国人民大学高瓴人工智能学院联合百度共同发布了 FlashRAG-Paddle 框架,其中内置 36 个经过预处理的 RAG 数据集以及 9 种预实现的 RAG 算法,能够帮助研究人员高效地在 RAG 领域进行复现、基准测试和开发新算法。
同时,借助基于飞桨框架 3.0 版本打造的 PaddleNLP 大语言模型套件,通过极致的全流程优化,为 RAG 中的检索器、生成器、重排器、精炼器提供从组网开发、预训练、精调对齐、模型压缩以及推理部署的一站式解决方案。












