使用scrapy-redis搭建分布式爬蟲環境


scrapy-redis簡介

scrapy-redis是scrapy框架基於redis數據庫的組件,用於scrapy項目的分布式開發和部署。

有如下特征:

 分布式爬取

  您可以啟動多個spider工程,相互之間共享單個redis的requests隊列。最適合廣泛的多個域名網站的內容爬取。

 分布式數據處理

  爬取到的scrapy的item數據可以推入到redis隊列中,這意味着你可以根據需求啟動盡可能多的處理程序來共享item的隊列,進行item數據持久化處理

 Scrapy即插即用組件

  Scheduler調度器 + Duplication復制 過濾器,Item Pipeline,基本spider

scrapy-redis架構

scrapy-redis整體運行流程如下:

 

1. 首先Slaver端從Master端拿任務(Request、url)進行數據抓取,Slaver抓取數據的同時,產生新任務的Request便提交給 Master 處理;

2. Master端只有一個Redis數據庫,負責將未處理的Request去重和任務分配,將處理后的Request加入待爬隊列,並且存儲爬取的數據。

Scrapy-Redis默認使用的就是這種策略,我們實現起來很簡單,因為任務調度等工作Scrapy-Redis都已經幫我們做好了,我們只需要繼承RedisSpider、指定redis_key就行了。

缺點是,Scrapy-Redis調度的任務是Request對象,里面信息量比較大(不僅包含url,還有callback函數、headers等信息),

可能導致的結果就是會降低爬蟲速度、而且會占用Redis大量的存儲空間,所以如果要保證效率,那么就需要一定硬件水平。

scrapy-redis安裝

通過pip安裝即可:pip install scrapy-redis

一般需要python、redis、scrapy這三個安裝包

官方文檔:https://scrapy-redis.readthedocs.io/en/stable/

源碼位置:https://github.com/rmax/scrapy-redis

參考博客:https://www.cnblogs.com/kylinlin/p/5198233.html

scrapy-redis常用配置

一般在配置文件中添加如下幾個常用配置選項:

1(必須). 使用了scrapy_redis的去重組件,在redis數據庫里做去重

DUPEFILTER_CLASS = "scrapy_redis.dupefilter.RFPDupeFilter"

 

 

2(必須). 使用了scrapy_redis的調度器,在redis里分配請求

SCHEDULER = "scrapy_redis.scheduler.Scheduler"

3(可選). 在redis中保持scrapy-redis用到的各個隊列,從而允許暫停和暫停后恢復,也就是不清理redis queues

SCHEDULER_PERSIST = True

4(必須). 通過配置RedisPipeline將item寫入key為 spider.name : items 的redis的list中,供后面的分布式處理item 這個已經由 scrapy-redis 實現,不需要我們寫代碼,直接使用即可

ITEM_PIPELINES = {
   'scrapy_redis.pipelines.RedisPipeline': 100 ,
}

5(必須). 指定redis數據庫的連接參數

REDIS_HOST = '127.0.0.1' 
REDIS_PORT = 6379

scrapy-redis鍵名介紹

scrapy-redis中都是用key-value形式存儲數據,其中有幾個常見的key-value形式:

1、 “項目名:items”  -->list 類型,保存爬蟲獲取到的數據item 內容是 json 字符串

2、 “項目名:dupefilter”   -->set類型,用於爬蟲訪問的URL去重 內容是 40個字符的 url 的hash字符串

3、 “項目名: start_urls”   -->List 類型,用於獲取spider啟動時爬取的第一個url

4、 “項目名:requests”   -->zset類型,用於scheduler調度處理 requests 內容是 request 對象的序列化 字符串

scrapy-redis簡單實例

在原來非分布式爬蟲的基礎上,使用scrapy-redis簡單搭建一個分布式爬蟲,過程只需要修改一下spider的繼承類和配置文件即可,很簡單。

原非分布式爬蟲項目,參見:https://www.cnblogs.com/pythoner6833/p/9018782.html

首先修改配置文件,在settings.py文件中添加代碼:

 

然后需要修改的文件,是spider文件,原文件代碼為:

修改為:

 

 只修改了兩個地方,一個是繼承類:由scrapy.Spider修改為RedisSpider

然后start_url已經不需要了,修改為:redis_key = "xxxxx",其中,這個鍵的值暫時是自己取的名字,

一般用項目名:start_urls來代替初始爬取的url。由於分布式scrapy-redis中每個請求都是從redis中取出來的,因此,在redis數據庫中,設置一個redis_key的值,作為初始的url,scrapy就會自動在redis中取出redis_key的值,作為初始url,實現自動爬取。

因此:來到redis中,添加代碼:

即:在redis中設置一個鍵值對,鍵為tencent2:start_urls , 值為:初始化url。即可將傳入的url作為初始爬取的url。

如此一來,分布式已經搭建完畢。

 


免責聲明!

本站轉載的文章為個人學習借鑒使用,本站對版權不負任何法律責任。如果侵犯了您的隱私權益,請聯系本站郵箱yoyou2525@163.com刪除。



 
粵ICP備18138465號   © 2018-2025 CODEPRJ.COM