本文目錄一覽:
如何用python對文章中文分詞並統計詞頻
1、全局變數在函數中使用時需要加入global聲明
2、獲取網頁內容存入文件時的編碼為ascii進行正則匹配時需要decode為GB2312,當匹配到的中文寫入文件時需要encode成GB2312寫入文件。
3、中文字元匹配過濾正則表達式為ur'[\u4e00-\u9fa5]+’,使用findall找到所有的中文字元存入分組
4、KEY,Value值可以使用dict存儲,排序後可以使用list存儲
5、字元串處理使用split分割,然後使用index截取字元串,判斷哪些是名詞和動詞
6、命令行使用需要導入os,os.system(cmd)
用Python統計詞頻
def statistics(astr):
# astr.replace(“\n”, “”)
slist = list(astr.split(“\t”))
alist = []
[alist.append(i) for i in slist if i not in alist]
alist[-1] = alist[-1].replace(“\n”, “”)
return alist
if __name__ == “__main__”:
code_doc = {}
with open(“test_data.txt”, “r”, encoding=’utf-8′) as fs:
for ln in fs.readlines():
l = statistics(ln)
for t in l:
if t not in code_doc:
code_doc.setdefault(t, 1)
else:
code_doc[t] += 1
for keys in code_doc.keys():
print(keys + ‘ ‘ + str(code_doc[keys]))
如何用python和jieba分詞,統計詞頻?
#! python3
# -*- coding: utf-8 -*-
import os, codecs
import jieba
from collections import Counter
def get_words(txt):
seg_list = jieba.cut(txt)
c = Counter()
for x in seg_list:
if len(x)1 and x != ‘\r\n’:
c[x] += 1
print(‘常用詞頻度統計結果’)
for (k,v) in c.most_common(100):
print(‘%s%s %s %d’ % (‘ ‘*(5-len(k)), k, ‘*’*int(v/3), v))
if __name__ == ‘__main__’:
with codecs.open(’19d.txt’, ‘r’, ‘utf8’) as f:
txt = f.read()
get_words(txt)
原創文章,作者:小藍,如若轉載,請註明出處:https://www.506064.com/zh-tw/n/240544.html