解決python3爬取網頁(GB2312編碼)中文亂碼問題


  爬取網頁時由於編碼格式的問題,導致中文亂碼,解決方法就是將原文件轉碼成latin1編碼(使用encode函數) ,再解碼成gbk編碼(使用decode函數) 

即可輸出正確中文。

  如下:

 1 # coding:UTF-8
 2 
 3 import requests
 4 
 5 headers={'User-Agent':'Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/63.0.3239.132 Safari/537.36',
 6          'Host':'www.dy2018.com'}
 7 
 8 url=('https://www.dy2018.com/1/')
 9  
10 r = requests.get(url,headers=headers)
11 
12 data = r.text.encode("latin1").decode("gbk")  ###將原文件轉碼成latin1編碼(使用encode函數) ,再解碼成gbk編碼(使用decode函數) 13 
14 with open('t1.txt','w',encoding='utf-8') as f:
15     f.write(data)
16     f.close

 


免責聲明!

本站轉載的文章為個人學習借鑒使用,本站對版權不負任何法律責任。如果侵犯了您的隱私權益,請聯系本站郵箱yoyou2525@163.com刪除。



 
粵ICP備18138465號   © 2018-2025 CODEPRJ.COM