python3.x提取中文的正則表達(dá)式示例代碼

系統(tǒng) 2019-09-27 17:48:50 1957 0

實例一：讀取txt文件中含有中文的字符

            
import re ##此處使用的編輯器是python3.x 
d="[\u4e00-\u9fa5]+" #中文匹配的符號
f=open('test.txt','rb') #這里以二進(jìn)制讀取，方便中文的轉(zhuǎn)義 ，不設(shè)置回報錯 這里的TXT文檔
#文檔內(nèi)容：
Hello world
China
你好，你好好
This is a txt File
s2f程序員雜志一2d3程序員雜志二2d3程序員雜志三2d3程序員雜志四2d3
#此處涉及到文本的讀取工作，先讀取文件，再進(jìn)行文檔行的識別匹配
L=[]#創(chuàng)建一個列表進(jìn)行存儲即將生成的中文
for i in f: #遍歷txt文檔中的行
  i=i.decode('utf-8')#轉(zhuǎn)意utf-8
  l=re.findall(d,i) #正則匹配中文
  L+=l #將中文放到列表中
print(L)
f.close()

***********************************************

實例二：讀取給定字符串的中文字符

            
import re ##此處使用的編輯器是python3.x 
s = "s2f程序員雜志一2d3程序員雜志二2d3程序員雜志三2d3程序員雜志四2d3".encode() #此處必須進(jìn)行字符串轉(zhuǎn)義
temp = s.decode('utf-8') 
pattern="[\u4e00-\u9fa5]+"#中文正則表達(dá)式
regex = re.compile(pattern) #生成正則對象 
results = regex.findall(temp) #匹配
for result in results : #迭代遍歷出內(nèi)容
  print (result)

總結(jié)

以上所述是小編給大家介紹的python3.x提取中文的正則表達(dá)式示例代碼,希望對大家有所幫助，如果大家有任何疑問請給我留言，小編會及時回復(fù)大家的。在此也非常感謝大家對腳本之家網(wǎng)站的支持！
如果你覺得本文對你有幫助，歡迎轉(zhuǎn)載，煩請注明出處，謝謝！

更多文章、技術(shù)交流、商務(wù)合作、聯(lián)系博主

微信掃碼或搜索：z360901061

微信掃一掃加我為好友

QQ號聯(lián)系： 360901061

您的支持是博主寫作最大的動力，如果您喜歡我的文章，感覺我的文章對您有幫助，請用微信掃描下面二維碼支持博主2元、5元、10元、20元等您想捐的金額吧，狠狠點擊下面給點支持吧，站長非常感激您！手機微信長按不能支付解決辦法：請將微信支付二維碼保存到相冊，切換到微信，然后點擊微信右上角掃一掃功能，選擇支付二維碼完成支付。

【本文對您有幫助就好】元

2元

5元

10元

20元

自定義

發(fā)表我的評論

最新評論總共0條評論