scrapy框架--新建调试的main.py文件

本文转载自查看原文 2018-08-17 21:34 1860 爬虫学习笔记

一.原因：

　　由于pycharm中没有scrapy的一个模板，所有没办法直接在scrapy文件中调试，所有我们需要写一个自己的main.py文件，在文件里面调用命令行，来实现scrapy的一个调试。（在scrapy中可以调试，可以让我们的开发效率高）

二.注意点：

　　字爬虫文件中设置断点，但是需要在自己写的main.py文件中用debug进行调试，然后返回到爬虫文件观看调试结果即可。

三.编写main.py文件:

from scrapy.cmdline import execute   #调用此函数可以执行scrapy的脚本

import sys
import os

# 用来设置工程目录，有了它才可以让命令行生效
sys.path.append(os.path.dirname(os.path.abspath(__file__)))

#os.path.abspath(__file__)  用来获取当前py文件的路径
#os.path.dirname()    用来获取文件的父亲的路径

#调用execute()函数执行scarpy的命令 scary crawl 爬虫文件名字
execute(['scarpy','crawl','jobbole'])

　　我们可以看一下scarpy命令行：scarpy crawl 爬虫文件名字（下图截取了部分运行之后的代码）

四.修改setting,py问价中的一个参数：因为scrapy默认会读取每个网站的root协议，会把不符合root协议的url过滤掉，所有我们需要设置scrapy不需要遵守root协议。

免责声明！

本站转载的文章为个人学习借鉴使用，本站对版权不负任何法律责任。如果侵犯了您的隐私权益，请联系本站邮箱yoyou2525@163.com删除。

猜您在找 解决：main.py: error: unrecognized arguments: --html 学习笔记GAN004:DCGAN main.py python3版本main.py执行产生中间__pycache__详解一篇文章教会你理解和定义Scrapy爬虫框架中items.py文件读取scrapy配置文件setting.py中的方法 Scrapy在 setting.py 文件中设置日志记录等级 Pycharm 新建py文件时自动添加基础信息 pycharm中为每个新建的.py文件添加模版信息 pycharm 新建py文件写时有作者和时间爬虫2.2-scrapy框架-文件写入