python3安裝pdfminer並使用

本文轉載自查看原文 2019-09-08 22:39 2189 python

1.python3不同與2版本不能使用pdfminer

pip install pdfminer3k

2.使用pdfminer解析相應文檔並保存到相應的文件夾中

# encoding : udf-8

"""
解析pdf文本保存到txt文件中
"""
from pdfminer.converter import PDFPageAggregator
from pdfminer.layout import LAParams, LTTextBoxHorizontal
from pdfminer.pdfinterp import PDFTextExtractionNotAllowed, PDFResourceManager, PDFPageInterpreter
from pdfminer.pdfparser import PDFDocument, PDFParser

path = 'E:\\force.pdf'


def parse():
    fp = open(path, 'rb')   # 以二進制讀模式打開
    praser = PDFParser(fp)
    # 創建一個PDF文檔
    doc = PDFDocument()
    # 連接分析器 與文檔對象
    praser.set_document(doc)
    doc.set_parser(praser)

    # 提供初始化密碼
    # 如果沒有密碼 就創建一個空的字符串
    doc.initialize()

    # 檢測文檔是否提供txt轉換，不提供就忽略
    if not doc.is_extractable:
        raise PDFTextExtractionNotAllowed
    else:
        # 創建PDf 資源管理器 來管理共享資源
        rsrcmgr = PDFResourceManager()
        # 創建一個PDF設備對象
        laparams = LAParams()
        device = PDFPageAggregator(rsrcmgr, laparams=laparams)
        # 創建一個PDF解釋器對象
        interpreter = PDFPageInterpreter(rsrcmgr, device)

        # 循環遍歷列表，每次處理一個page的內容
        for page in doc.get_pages():  # doc.get_pages() 獲取page列表
            interpreter.process_page(page)
            # 接受該頁面的LTPage對象
            layout = device.get_result()
            for x in layout:
                if isinstance(x, LTTextBoxHorizontal):
                    with open(r'E:\\pdf\1.txt', 'a') as f:
                        results = x.get_text()
                        print(results)
                        f.write(results + '\n')

if __name__ == '__main__':
    parse()

免責聲明！

本站轉載的文章為個人學習借鑒使用，本站對版權不負任何法律責任。如果侵犯了您的隱私權益，請聯系本站郵箱yoyou2525@163.com刪除。

猜您在找 python3使用pdfminer3k解析pdf文件 Python使用PDFMiner解析PDF python3用pdfminer3k在線讀取pdf文件 Python對pdf中的關鍵字過濾（pdfminer3k或pdfminer使用） python3的ExecJS安裝使用電腦同時安裝python2和python3 ，默認使用python3 Mac下python3的安裝和PyCharm中python3的使用 CentOS使用yum安裝python3 Python3 turtle安裝和使用教程 PDFMiner(搬運, 文章末尾有我寫的PDFMiner3K使用實例)