爬取網頁時由於編碼格式的問題,導致中文亂碼,解決方法就是將原文件轉碼成latin1編碼(使用encode函數) ,再解碼成gbk編碼(使用decode函數)
即可輸出正確中文。
如下:
1 # coding:UTF-8 2 3 import requests 4 5 headers={'User-Agent':'Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/63.0.3239.132 Safari/537.36', 6 'Host':'www.dy2018.com'} 7 8 url=('https://www.dy2018.com/1/') 9 10 r = requests.get(url,headers=headers) 11 12 data = r.text.encode("latin1").decode("gbk") ###將原文件轉碼成latin1編碼(使用encode函數) ,再解碼成gbk編碼(使用decode函數) 13 14 with open('t1.txt','w',encoding='utf-8') as f: 15 f.write(data) 16 f.close