python爬取段子
爬取某個網頁的段子
第一步
不管三七二十一我們先導入模塊
#http://baijiahao.baidu.com/s?id=1598724756013298998&wfr=spider&for=pc 段子所在的網址
import re
import requests #如果沒這模塊運行CMD pip install requests
第二步
獲取網站的內容
#http://baijiahao.baidu.com/s?id=1598724756013298998&wfr=spider&for=pc 段子所在的網址
import re
import requests #如果沒這模塊運行CMD pip install requests
response = requests.get(http://baijiahao.baidu.com/s?id=1598724756013298998&wfr=spider&for=pc)
data = response.text
第三步
找到段子所在的位置
#http://baijiahao.baidu.com/s?id=1598724756013298998&wfr=spider&for=pc 段子所在的網址
import re
import requests #如果沒這模塊運行CMD pip install requests
response = requests.get('http://baijiahao.baidu.com/s?id=1598724756013298998&wfr=spider&for=pc') #這個編輯器的長度關系沒法放一行
data = response.text
#按F12選擇自己想要的內容所在的位置copy出來
new_list = re.findall('<span class="bjh-p">(.*?)</span></p><p>',data ) # (.*?)是我們要的內容
第四部
保存文件
#http://baijiahao.baidu.com/s?id=1598724756013298998&wfr=spider&for=pc 段子所在的網址
import re
import requests #如果沒這模塊運行CMD pip install requests
response = requests.get('http://baijiahao.baidu.com/s?id=1598724756013298998&wfr=spider&for=pc') #這個編輯器的長度關系沒法放一行
data = response.text
#按F12選擇自己想要的內容所在的位置copy出來
new_list = re.findall('<span class="bjh-p">(.*?)</span></p><p>',data ) # (.*?)是我們要的內容
for a in new_list:
with open(r'D:\圖片\段子.txt', 'a') as fw:
fw.write(a)
fw.flush()