scrapy的去重机制

本文转载自查看原文 2018-10-03 23:55 2210 scrapy

scrapy是通过hashlib算法转成长度一致的url，然后再通过set集合去重的，有兴趣看源码

去重的中间件在scrapy 的 dupefilters.py文件中：

--> #去重器

RFDupeFilter()

-->有个函数叫

request_seen()
#被scrapy/core/scheduler.py调用

这个是调度器

scheduler.py#文件中有个函数叫enqueue_request()的函数
每来一个url就是通过这个函数来执行的

每次执行之前都会调用到 request_seen(request) 这个方法

这个方法就会生成一个指纹，指纹下面的掉用的就比较复杂了，简单的说就是要去执行 hashlib.sha1() 这个算法来生成一个固定长度的哈兮值

再然后就是在那个去重器中的

self.fingerprints = set()

就是通过上句代码执行了set集合来去重了

本站转载的文章为个人学习借鉴使用，本站对版权不负任何法律责任。如果侵犯了您的隐私权益，请联系本站邮箱yoyou2525@163.com删除。

猜您在找 scrapy 去重 dont_filter=False Scrapy之dupefilters(去重)以及源码分析/depth Scrapy框架(持久化,去重,深度控制,cookie) scrapy暂停和重启，及url去重原理,telenet简单使用爬虫基础6(框架Scrapy中去重源码与自定义去重) Scrapy各部分运行机制?Xpath为None？多层Response如何编写？搞定Scrapy的坑排序与去重 Java去重 SQL去重 jquery去重