懂色av浪潮av色欲av熟妇,能看不卡的一级片,亚洲凹凸无码免费观看

日日操夜夜添-日日操影院-日日草夜夜操-日日干干-精品一区二区三区波多野结衣-精品一区二区三区高清免费不卡

公告：魔扣目錄網為廣大站長提供免費收錄網站服務，提交前請做好本站友鏈：【網站目錄：http://www.ylptlb.cn 】，免友鏈快審服務（50元/站），

網站：51998
待審：31
小程序：12
文章：1030137
會員：747

首頁 > 新聞資訊 > IT業界 >正文

怎么用Python批量提取PDF中的信息

發布時間：2024-03-08 21:56:24 作者：網友整理

要使用python批量提取pdf中的信息，可以使用Python的一個庫叫做PyPDF2。下面是一個簡單的例子，可以幫助你開始提取PDF中的文本信息：

首先，你需要安裝PyPDF2庫。可以使用以下命令在終端或命令提示符中安裝該庫：

pip install PyPDF2

登錄后復制

然后，你可以使用以下代碼來提取PDF中的文本信息：

import PyPDF2

def extract_text_from_pdf(pdf_path):
with open(pdf_path, 'rb') as file:
pdf = PyPDF2.PdfFileReader(file)
text = ""
for page_number in range(pdf.getNumPages()):
page = pdf.getPage(page_number)
text += page.extractText()
return text

# 批量提取PDF中的文本信息
pdf_folder = "pdf文件夾路徑"
output_folder = "輸出文件夾路徑"

import os

for filename in os.listdir(pdf_folder):
if filename.endswith(".pdf"):
pdf_path = os.path.join(pdf_folder, filename)
text = extract_text_from_pdf(pdf_path)

output_path = os.path.join(output_folder, f"{filename}.txt")
with open(output_path, 'w', encoding='utf-8') as file:
file.write(text)

登錄后復制

在上面的代碼中，pdf_folder是包含PDF文件的文件夾的路徑，output_folder是將提取的文本輸出到的文件夾路徑。代碼將遍歷文件夾中的所有PDF文件，提取每個文件的文本內容，并將提取的文本保存到相應的文本文件中。

請注意，該代碼只能提取PDF中的純文本信息，如果PDF中包含圖像或表格等非文本內容，該代碼可能無法提取或正確提取。

分享到：

標簽：Python 精選