使用python讀取word文件里的表格信息


在企查查查詢企業信息的時候,得到了一些word文件,里面有些控股企業的數據放在表格里,需要我們將其提取出來。

word文件看起來很復雜,不方便進行結構化。實際上,一個word文檔中大概有這么幾種類型的內容:paragraph(段落),table(表格),character(字符)。我現在要解析的word文檔中,基本都是段落和表格,本文主要來講一下如何從word中解析出表格,並將表格信息進行結構化。

要想使用python解析word文件,我們可以使用包docx,首先我們需要安裝它。

安裝完成后,我們需要讀取word文件,代碼大致如下:

上面的代碼中,tables已經是word文件中所有的table構成的list,我要尋找的表格2.6是word文件中的第9個table,可以這樣讀取。

 

這里已經將表2.6的每一列每一行遍歷啦,之后可以將抽取出來的4個參數寫到CSV或插入數據庫中。

 來源:華為雲社區  作者:開飛機的大象


免責聲明!

本站轉載的文章為個人學習借鑒使用,本站對版權不負任何法律責任。如果侵犯了您的隱私權益,請聯系本站郵箱yoyou2525@163.com刪除。



 
粵ICP備18138465號   © 2018-2025 CODEPRJ.COM