Scrapy爬虫的暂停和启动

本文转载自查看原文 2019-09-30 20:17 1043 爬虫

scrapy的每一个爬虫，暂停时可以记录暂停状态以及爬取了哪些url，重启时可以从暂停状态开始爬取过的URL不在爬取

实现暂停与重启记录状态

方法一：

1、首先cd进入到scrapy项目里（当然你也可以通过编写脚本Python文件直接在pycharm中运行）

2、在scrapy项目里创建保存记录信息的文件夹

3、执行命令：

　　scrapy crawl 爬虫名称 -s JOBDIR=保存记录信息的路径

　　如：scrapy crawl cnblogs -s JOBDIR=zant/001

　　执行命令会启动指定爬虫，并且记录状态到指定目录

爬虫已经启动，我们可以按键盘上的ctrl+c停止爬虫，停止后我们看一下记录文件夹，会多出3个文件，其中的requests.queue文件夹里的p0文件就是URL记录文件，这个文件存在就说明还有未完成的URL，当所有URL完成后会自动删除此文件

当我们重新执行命令：scrapy crawl cnblogs -s JOBDIR=zant/001  时爬虫会根据p0文件从停止的地方开始继续爬取。

方法二：

在settings.py文件里加入下面的代码：

JOBDIR='sharejs.com'

使用命令scrapy crawl 爬虫名，就会自动生成一个sharejs.com的目录，然后将工作列表放到这个文件夹里

免责声明！

本站转载的文章为个人学习借鉴使用，本站对版权不负任何法律责任。如果侵犯了您的隐私权益，请联系本站邮箱yoyou2525@163.com删除。

猜您在找 如何用脚本方式启动scrapy爬虫 [爬虫框架scrapy]scrapy的安装爬虫框架-scrapy的使用基于Scrapy的B站爬虫爬虫框架：scrapy python爬虫之scrapy安装（一）部署scrapy爬虫爬虫--Scrapy之Downloader Middleware 网页爬虫--scrapy进阶 python爬虫框架——scrapy