交互式 PDF 问答:检索增强生成方法

简介: 交互式 PDF 问答:检索增强生成方法

通过提出问题和获取相关信息来与 PDF 进行交互。这个本地托管的应用程序使用 LangChain 和 Streamlit。

在信息时代,处理庞大的 PDF 每天都在发生。大多数时候,我发现自己淹没在文字的海洋中,努力寻找我想要或需要一页阅读的信息。但是,如果我可以询问有关 PDF 的问题,并且不仅可以恢复相关信息,还可以恢复页面内容,该怎么办?

这就是 检索增强生成 (RAG) 技术发挥作用的地方。通过结合这些尖端技术,我创建了一个本地托管的应用程序,允许您与 PDF 聊天、提出问题并接收所有必要的上下文。

让我带您完成构建此类应用程序的完整过程!

什么是检索增强生成 (RAG)?

检索增强生成 (RAG) 是一种旨在通过合并有关给定主题的额外信息来提高  LLM 性能的方法。这些信息减少了不确定性,并提供了更多的上下文,帮助模型以更好的方式回答问题。

在构建基本的检索增强生成 (RAG) 系统时,需要关注两个主要组件:数据索引和数据检索和生成领域。数据索引使系统能够在需要时存储和/或搜索文档。数据检索和生成是查询这些索引文档的地方,然后提取所需的数据,并使用这些数据生成答案。

数据索引 image.png


数据索引包括四个关键阶段:

数据加载:此初始阶段涉及将 PDF、音频文件、视频等摄取为统一格式,以供下一阶段使用。

数据拆分:下一步是将内容划分为可管理的片段:将文本分割成连贯的部分或块,以保留上下文和含义。

数据嵌入:在此阶段,文本块将转换为数值向量。此转换是使用捕获内容语义本质的嵌入技术完成的。

数据存储:最后一步是存储生成的嵌入,通常位于向量存储中。

数据检索和生成

image.png

检索

嵌入查询:将用户的查询转换为嵌入表单,以便将其与文档嵌入的相似性进行比较

搜索向量:向量存储包含不同文档块的向量。因此,通过将此查询嵌入与存储的查询嵌入进行比较,系统可以确定哪些块与查询最相关。这种比较通常是在计算余弦相似度或任何其他相似度指标的帮助下完成的。

选择 top-k 块:系统根据获得的相似性分数获取最接近查询嵌入的 k 块。

结合上下文和查询:top-k 块提供与查询相关的必要上下文。当与用户的原始问题相结合时,LLM 会收到一个全面的输入,该输入将用于生成输出。

现在我们有了更多的背景信息,让我们开始行动吧!

RAG for PDF 文档

先决条件

文件用于测试完整的应用程序。我使用过以下库:

LangChain:它是一个使用大型语言模型 (LLM) 开发应用程序的框架。它提供了正确的工具和方法来控制和协调 LLM,如果它们被应用。

PyPDF格式:这用于加载和处理 PDF 文档。虽然 PyMuPDF 以其速度而闻名,但我在设置 Docker 环境时遇到了几个兼容性问题。

FAISS 代表 Facebook AI 相似性搜索,是一个用于快速相似性搜索和密集向量聚类的库。FAISS 也适用于快速最近邻搜索,因此在处理 向量嵌入时,它的使用是完美的,例如文档块的情况。为了简单起见,我决定使用它而不是 矢量数据库。

Streamlit 用于构建应用程序的用户界面。Streamlit 允许快速开发交互式 Web 应用程序,使其成为创建无缝用户体验的绝佳选择。

数据索引

加载 PDF 文档。

from langchain_community.document_loaders import PyPDFLoader
loader = PyPDFLoader(pdf_docs)
pdf_data = loader.load()

将其拆分为块。我使用了 1000 个字符的块大小。

from langchain.text_splitter import CharacterTextSplitter
text_splitter = CharacterTextSplitter(
        separator="\n",
        chunk_size=1000,
        chunk_overlap=150,
        length_function=len
 )
docs = text_splitter.split_documents(pdf_data)

我使用了 OpenAI 嵌入模型并将它们加载到 FAISS 向量存储中。

from langchain_openai import OpenAIEmbeddings
from langchain_community.vectorstores import FAISS
embeddings = OpenAIEmbeddings(key = open_ai_key)
db = FAISS.from_documents(docs, embeddings)

我已将检索配置为仅前 3 个相关块。

retriever = db.as_retriever(search_kwargs={'k': 3})

数据检索和生成

使用LangChain的链,我创建了完整的检索和生成系统,该系统链接到之前配置的FAISS检索器。RetrievalQA

from langchain.chains import RetrievalQA
from langchain import PromptTemplate
from langchain_openai import ChatOpenAI
model = ChatOpenAI(key = open_ai_key)
custom_prompt_template = """Use the following pieces of information to answer the user's question.
If you don't know the answer, just say that you don't know, don't try to make up an answer.
Context: {context}
Question: {question}
Only return the helpful answer below and nothing else.
Helpful answer:
"""
prompt = PromptTemplate(template=custom_prompt_template,
                            input_variables=['context', 'question'])
qa = RetrievalQA.from_chain_type(llm=model,
                            chain_type="stuff",
                            retriever=retriever,
                            return_source_documents=True,
                            chain_type_kwargs={"prompt": prompt})

流线型

使用 Streamlit 创建了一个应用程序,您可以在其中上传自己的文档并使用它们开始 RAG 流程。

结论

在信息以大量形式提供并可供用户使用的时代,有机会与文档进行有意义的讨论可以大大节省从大型 PDF 文档中挖掘有价值信息的过程的时间。在检索增强一代的帮助下,我们可以过滤掉不需要的信息并关注实际信息。

此实现提供了一个朴素的 RAG 解决方案;然而,优化它的可能性是巨大的。通过使用不同的 RAG 技术,可以进一步完善嵌入模型、文档分块方法和检索算法等方面。  


目录
打赏
0
0
0
0
94
分享
相关文章
Python3,2行代码,多种方法,直接把网页内容转换成PDF文档和图片。
Python3,2行代码,多种方法,直接把网页内容转换成PDF文档和图片。
283 0
将word文档转换成pdf文件方法
在Java中,将Word文档转换为PDF文件可采用多种方法:1) 使用Apache POI和iText库,适合处理基本转换需求;2) Aspose.Words for Java,提供更高级的功能和性能;3) 利用LibreOffice命令行工具,适用于需要开源解决方案的场景。每种方法都有其适用范围,可根据具体需求选择。
Java将word文档转换成pdf文件的方法?
【10月更文挑战第13天】Java将word文档转换成pdf文件的方法?
1999 1
LangChain-20 Document Loader 文件加载 加载MD DOCX EXCEL PPT PDF HTML JSON 等多种文件格式 后续可通过FAISS向量化 增强检索
LangChain-20 Document Loader 文件加载 加载MD DOCX EXCEL PPT PDF HTML JSON 等多种文件格式 后续可通过FAISS向量化 增强检索
496 2
三种方法,Python轻松提取PDF中全部图片
三种方法,Python轻松提取PDF中全部图片
278 3
|
7月前
|
Form 中调用并发请求生成报表并输出PDF的方法
【9月更文挑战第11天】该文档介绍了在表单中通过并发请求生成报表并将其输出为PDF的方法,包括设置并发请求、配置输出选项、触发请求及处理结果。具体步骤涉及创建请求、配置参数、设置输出类型为PDF、添加触发按钮、调用请求API、等待请求完成、获取并显示PDF文件。需根据所用系统和技术调整实现细节。
【Python实用技能】建议收藏:自动化实现网页内容转PDF并保存的方法探索(含代码,亲测可用)
【Python实用技能】建议收藏:自动化实现网页内容转PDF并保存的方法探索(含代码,亲测可用)
377 0
办公技巧 | 免费的PDF转Word方法,从此不再求人!
这种可以直接选择文字的就是“文本型PDF”,通常是由word等文档导出的,还保留着文字、字形等格式,想要转换回word文档也相对简单。
318 0

热门文章

最新文章

下一篇
oss创建bucket
AI助理

你好,我是AI助理

可以解答问题、推荐解决方案等