本文目錄一覽:
- 1、python變形調整pdf文檔尺寸
- 2、python怎樣讀取pdf文件的內容
- 3、python pdf二進位讀取問題
- 4、Python利器:如何處理PDF表格數據
- 5、python如何讀取文件大小
python變形調整pdf文檔尺寸
把一個目錄下的所有Word文件,轉換為PDF文件。
1.打開要縮小的pdf文件,在打開的窗口中找到文件選項。2.點擊文件選項後,出現下拉菜單,在這裡找到另存為其他。3.滑鼠放到另存為其他選項後,出現新的菜單這裡選擇縮小大小的PDF。
Python語法和動態類型,以及解釋型語言的本質,使它成為多數平台上寫腳本和快速開發應用的編程語言,隨著版本的不斷更新和語言新功能的添加,逐漸被用於獨立的、大型項目的開發。
python怎樣讀取pdf文件的內容
pdfminer 庫
前幾天剛做完一個解析PDF的web應用,給你地址也可以參考一下
python pdf二進位讀取問題
可以使用numpy.fromfile(),也可以使用open(filename, ‘rb’),其中的’b’就是二進位的意思,然後使用文件類型的read方法,讀取一些位元組,再用struct.unpack()方法來解析二進位。
第一種方法是一次性讀入文件(或文件的前多少個連續位元組)到一個數組中,因此,靈活性差。
第二種方法靈活性很高,可以讀取任意位置(使用文件的seek()方法跳躍位置)的二進位數據,再使用struct.unpack()方法來進行各種二進位解析。
提示:二進位文件是不保留存儲方式的數據格式,因此,讀二進位文件時應該知道二進位文件的存儲格式。
Python利器:如何處理PDF表格數據
大家好,我是Peter~
在很多情況下,我們都需要處理PDF格式的文件。尤其當我們遇到PDF表格數據需要進行提取,真的是一個令人頭疼的問題。
因為PDF文件不能像Word那樣直接複製,即使複製了再黏貼也可能會出現格式排版錯亂甚至亂碼問題。如何從一個PDF文件提取出表格數據?本文提供兩個解決方案:
首先提供的一種方法是從文字 PDF 中提取表格信息的工具:Camelot,它能夠直接將大部分表格轉換為 Pandas 的 Dataframe。
更多的詳細信息,請參考項目地址:
camelot的安裝有多種方式。如果有報錯,網上一般有解決方式:
1、通過conda安裝
2、使用pip進行安裝
3、通過GitHub進行安裝
首先將項目複製到本地:
然後進入文件中進行安裝:
下面通過一個案例來講解如何使用camelot。假設我們現在有一個只有一頁的PDF文件test.pdf:
1、先讀取文件
導出成csv格式的數據(方式1)
查看tables的相關信息:
導出方式2:
將數據轉換成DataFrame:
tabula的功能比camelot更加強大,可以同時對多個表格數據進行提取。項目的具體地址請參考:
tabula的安裝是非常簡單的:
安裝之後檢驗這個庫是否安裝成功:
通過tabula這個庫來讀取PDF文件:
然後我們發現列表中唯一的一個元素就是dataframe:
將讀取到的數據輸出成CSV格式的文件:
上面讀取的PDF文件是比較簡單的,只有一頁,而且剛好是一個很標準的表格形式的數據,下面看一個比較複雜的例子:
下面是第一頁,第一列可以看成是索引:
在第二頁中有兩份表格,而且中間有很多的空白行:
第三頁的數據比較標準:
這3頁是在同一個PDF文件中,這3頁是在同一個PDF文件中,這3頁是在同一個PDF文件中
上面的紅色提示中我們看到:當沒有指定pages參數的時候,只會默認讀取第一頁的數據,所以列表的長度為1。
轉成dataframe後將原來的索引變成新的一列 (部分數據)
通過pages來讀取全部數據:
通過指定pages=”all”:
同時獲取兩個表格的數據:
通過area參數來指定:
刪除在讀取的表格中我們不需要的欄位信息
可以將得到的數據輸出成不同格式的文件,以json格式為例:
我們可以看到
python如何讀取文件大小
python讀取文件大小的代碼如下:
[python] view plaincopyimport os
from os.path import join, getsize
def getdirsize(dir):
size = 0L
for root, dirs, files in os.walk(dir):
size += sum([getsize(join(root, name)) for name in files])
return size
if ‘__name__’ == ‘__main__’:
filesize = getdirsize(r’c:\windows’)
print ‘There are %.3f’ % (size/1024/1024), ‘Mbytes in c:\\windows’
原創文章,作者:小藍,如若轉載,請註明出處:https://www.506064.com/zh-tw/n/256553.html