本文目錄一覽:
- 1、一個用於合併pdf的簡單Python腳本
- 2、用python批量提取pdf的表格數據,保存為excel
- 3、Python利器:如何處理PDF表格數據
- 4、如何用python把pdf轉為cad?
- 5、python將pdf轉圖片
- 6、利用python去除pdf水印
一個用於合併pdf的簡單Python腳本
在學校打印店,有時會打印很多文件,因為文件數量多,過程會比較繁瑣。自己沒事動手寫了一個pdf合併的python腳本,方便將多個pdf文件合併為一。這樣打印時候只需點開一個文件打印即可。
需要 Python 和 PyPDF2 。Python安裝可在官網找到;PyPDF2可以通過pip安裝,可以利用命令行工具輸入一下命令
將需要合併的文件與本文後面的Python腳本放在同一目錄下,運行腳本得到 Merged.pdf 即為合併的pdf文件。
如果需要按照一定順序合併pdf文件,可以將pdf文件重命名,按順序將文件重命名為 1.pdf 、 2.pdf 以此類推。
如果需要將某一pdf文件在合併文件中重複多次,可以將該文件直接在當前目錄下拷貝成多個副本。
用python批量提取pdf的表格數據,保存為excel
pdfplumber 是一個開源 python 工具庫-,可以方便地獲取 pdf 的各種信息,包括文本、表格、圖表、尺寸等。完成我們本文的需求,主要使用 pdfplumber 提取 pdf 表格數據。
python 中還有很多庫可以處理 pdf,比如 PyPDF2、pdfminer 等,本文選擇pdfplumber 的原因在於能輕鬆訪問有關 PDF 的所有詳細信息,包括作者、來源、日期等,並且用於提取文本和表格的方法靈活可定製。大家可以根據手頭數據需求,再去解鎖 pdfplumber 的更多用法。
Python利器:如何處理PDF表格數據
大家好,我是Peter~
在很多情況下,我們都需要處理PDF格式的文件。尤其當我們遇到PDF表格數據需要進行提取,真的是一個令人頭疼的問題。
因為PDF文件不能像Word那樣直接複製,即使複製了再黏貼也可能會出現格式排版錯亂甚至亂碼問題。如何從一個PDF文件提取出表格數據?本文提供兩個解決方案:
首先提供的一種方法是從文字 PDF 中提取表格信息的工具:Camelot,它能夠直接將大部分表格轉換為 Pandas 的 Dataframe。
更多的詳細信息,請參考項目地址:
camelot的安裝有多種方式。如果有報錯,網上一般有解決方式:
1、通過conda安裝
2、使用pip進行安裝
3、通過GitHub進行安裝
首先將項目複製到本地:
然後進入文件中進行安裝:
下面通過一個案例來講解如何使用camelot。假設我們現在有一個只有一頁的PDF文件test.pdf:
1、先讀取文件
導出成csv格式的數據(方式1)
查看tables的相關信息:
導出方式2:
將數據轉換成DataFrame:
tabula的功能比camelot更加強大,可以同時對多個表格數據進行提取。項目的具體地址請參考:
tabula的安裝是非常簡單的:
安裝之後檢驗這個庫是否安裝成功:
通過tabula這個庫來讀取PDF文件:
然後我們發現列表中唯一的一個元素就是dataframe:
將讀取到的數據輸出成CSV格式的文件:
上面讀取的PDF文件是比較簡單的,只有一頁,而且剛好是一個很標準的表格形式的數據,下面看一個比較複雜的例子:
下面是第一頁,第一列可以看成是索引:
在第二頁中有兩份表格,而且中間有很多的空白行:
第三頁的數據比較標準:
這3頁是在同一個PDF文件中,這3頁是在同一個PDF文件中,這3頁是在同一個PDF文件中
上面的紅色提示中我們看到:當沒有指定pages參數的時候,只會默認讀取第一頁的數據,所以列表的長度為1。
轉成dataframe後將原來的索引變成新的一列 (部分數據)
通過pages來讀取全部數據:
通過指定pages=”all”:
同時獲取兩個表格的數據:
通過area參數來指定:
刪除在讀取的表格中我們不需要的字段信息
可以將得到的數據輸出成不同格式的文件,以json格式為例:
我們可以看到
如何用python把pdf轉為cad?
1.準備一款專業的CAD轉換器,如果你的電腦里有可以直接打開。
2.打開運行軟件,在軟件界面的左側我們找到「PDF轉CAD」功能。
3.選擇好了轉換類型,接下來就是添加文件,添加文件有兩個方法,一個是點擊界面中的「添加文件」,一個是直接把你的文件拖到軟件的指定區域;
4.文件添加好後,要是需要自定義選擇轉換後文件儲存的位置選擇「瀏覽」按鈕,選擇好儲存位置便可。
5.轉換界面可以進行轉換後文件格式的選擇,有「DWG、DXF」兩種格式進行選擇,可以根據自己的需求選擇輸出格式。
6.擊「批量轉換」按鈕開始文件的轉換,當所有的文件轉換狀態為百分百的時候就說明文件轉換完成了。
python將pdf轉圖片
方法1:打開pdf文件,選擇菜單命令「文件」 → 「另存為」 ,彈出另存為對話框,選擇保存類型為「jpg」,保存即可;
方法2:打開pdf文檔,選擇命令 「另存為其它」 → 「圖像」 → 「JPEG或JPEG2000」;
方法3:打開pdf文檔,選擇「編輯」菜單下的「拍快照」(註:選中後,在拍快照前面會有個√顯示),同時鼠標變成十字光標,此時拖動鼠標框選你要變換的區域,鬆開鼠標,彈出確認對話框,點擊確認,此時框選的部分已經保存到剪貼板,然後打開系統自帶的畫圖工具,粘貼後保存為jpg文檔。方法不適合圖片過多的情況,不建議使用!
方法4:試試在線PDF轉圖片共有以下幾個步驟:
• 點擊瀏覽按鈕選擇需要轉換的PDF文件。
輸入需要轉換的頁碼,以逗號分割開,如果轉換所有的頁面可以跳過這一步。
• 點擊按鈕上傳文件,然後等着就可以了。
• 點擊下載鏈接把做好的文件下載到本地就可以了。僅適合低於2MB的文件轉換!
方法5:藉助pdf轉換器。選中pdf轉圖片功能,然後右下角選擇「上傳文件或文件夾」,即可一鍵開始轉換,此外還支持轉word、excel、ppt等格式。
利用python去除pdf水印
去水印只針對pdf
通過給與的水印圖,找出相似水印並去除
本文參考資料:
Python操作PDF-文本和圖片提取(使用PyPDF2和PyMuPDF)
Python處理PDF的實用姿勢
使用PyPDF2在PDF上去除水印
原創文章,作者:小藍,如若轉載,請註明出處:https://www.506064.com/zh-hk/n/257330.html