【Python爬虫必备—＞Scrapy框架快速入门篇——上】_scrpy框架教学-程序员宅基地

技术标签：爬虫框架万字博文快速入门原力计划 Scrapy框架从入门到实战 scrapy

相信不少小伙伴们在经历过我的上几篇关于爬虫技术的万字博文的轮番轰炸后，已经可以独立开发出属于自己的爬虫项目！！！——爬虫之路，已然开启！

第一篇之爬虫入坑文；一篇万字博文带你入坑爬虫这条不归路（你还在犹豫什么&抓紧上车）
第二篇之爬虫库requests库详解。两万字博文教你python爬虫requests库，看完还不会我把我女朋友都给你
第三篇之解析库Beautiful Soup库详解。Python万字博文教你玩透Beautiful Soup库【️建议收藏系列️】
第四篇之Selenium详解。【️爬虫必备-＞Selenium从黑铁到王者️】初篇——万字博文详解(建议收藏)

但是前几日有很多粉丝私聊我反馈说:"自己爬虫基础库已经学差不多了，实战也做了不少，但是好多自己接的爬虫单或者老板都要求使用scrapy框架来爬取数据，自己没有接触过scrapy框架不知道如何下手！"

其实我已经有一个scrapy一条龙教学的分栏，也有不少人订阅并且反响不错，【Scrapy框架详解】。但是呢？我又想了想，确实少了篇总结性的文章——来从总体上介绍Scrapy框架。

所以应粉丝们要求，本博主花了假期周六周日两天时间，肝出本文（共分上中下三篇），目的在于带领想要学习scrapy的同学走近scrapy的世界！并在文末附带一整套scrapy框架学习路线，如果你能认认真真看完这三篇文章，在心里对scrapy有个印象，然后潜心研究文末整套学习路线，那么，scrapy框架对你来说——手到擒来！！！
我会尽量把技术文写的通俗易懂/生动有趣，保证每一个想要学习知识&&认认真真读完本文的读者们能够有所获，有所得。当然，如果你读完感觉本文写的还可以，真正学习到了东西，希望给我个「赞」和「收藏」，这个对我很重要，谢谢了！

重点来啦！重点来啦！！下面就让我们一同走入scrapy的神奇世界！

第一部分：走近scrapy！

0.简介及安装

1️⃣简介：

scrapy设计目的：用于爬取网络数据，提取结构性数据的框架，其中，scrapy使用了Twisted异步网络框架，大大加快了下载速度！

官方文档地址！！！

2️⃣安装：

直接pip安装（一句命令&&一步到位）：

pip install scrapy

1.scrapy项目开发流程：

创建项目：scrapy startproject mySpider
生成一个爬虫：scrapy genspider baidu baidu.com
提取数据：根据网站结构在spider中实现数据采集相关内容
保存数据：使用pipeline进行数据后续处理和保存

2.scrapy框架运行流程：

在这里插入图片描述

说明——scrapy中每个模块的具体作用！

在这里插入图片描述
原理描述：

爬虫中起始url构造的url对象–>爬虫中间件–>引擎–>调度器
调度器把request–>引擎–>下载中间件–>下载器
下载器发送请求，获取response响应—>下载中间件—>引擎–>爬虫中间件—>爬虫
爬虫提取url地址，组装成request对象—>爬虫中间件—>引擎—>调度器，重复步骤2
爬虫提取数据—>引擎—>管道处理和保存数据

注意：爬虫中间件和下载中间件只是运行的逻辑的位置不同，作用是重复的：如替换UA等！

拓展——scrapy中三个内置对象：

三个内置对象：（scrapy框架中只有三种数据类型）

   request请求对象：由url，method，post_data，headers等构成；
   response响应对象：由url，body，status，headers等构成；
   item数据对象：本质是一个字典。

第二部分：创建&&运行你的第一个scrapy项目！

1.创建项目：

创建scrapy项目的命令：scrapy startproject <项目名字>
示例：

scrapy startproject myspider

生成的目录和文件结果如下：

在这里插入图片描述

2.爬虫文件的创建：

在项目根路径下执行：

 scrapy genspider <爬虫名字> <允许爬取的域名>

示例：

cd myspider
scrapy genspider itcast itcast.cn

讲解：

爬虫名字：作为爬虫运行时的参数；
允许爬的域名：为对于爬虫设置的爬取范围，设置之后用于过滤要爬取的url，如果爬取的url与允许的域名不同，则被过滤掉。

3.运行scrapy爬虫：

命令：在项目目录下执行：
scrapy crawl <爬虫名字>

示例：

scrapy crawl itcast

不过，在运行之前，我们先要编写itcast.py爬虫文件：

# -*- coding: utf-8 -*-
import scrapy


class ItcastSpider(scrapy.Spider):
    # 爬虫运行时的参数
    name = 'itcast'
    # 检查允许爬的域名
    allowed_domains = ['itcast.cn']
    # 1.修改设置起始的url
    start_urls = ['见评论区']

    # 数据提取的方法：接收下载中间件传过来的response，定义对于网站相关的操作
    def parse(self, response):
        # 获取所有的教师节点
        t_list = response.xpath('//div[@class="li_txt"]')
        print(t_list)
        # 遍历教师节点列表
        tea_dist = {
    }
        for teacher in t_list:
            # xpath方法返回的是选择器对象列表     extract()方法可以提取到selector对象中data对应的数据。
            tea_dist['name'] = teacher.xpath('./h3/text()').extract_first()
            tea_dist['title'] = teacher.xpath('./h4/text()').extract_first()
            tea_dist['desc'] = teacher.xpath('./p/text()').extract_first()
            yield teacher

然后再运行，会发现已经可以正常运行！
在这里插入图片描述

4.明确了爬虫所爬取数据之后，使用管道进行数据持久化操作：

修改itcast.py爬虫文件：

# -*- coding: utf-8 -*-
import scrapy
from ..items import UbuntuItem


class ItcastSpider(scrapy.Spider):
    # 爬虫运行时的参数
    name = 'itcast'
    # 检查允许爬的域名
    allowed_domains = ['itcast.cn']
    # 1.修改设置起始的url
    start_urls = ['见评论区']

    # 数据提取的方法：接收下载中间件传过来的response，定义对于网站相关的操作
    def parse(self, response):
        # 获取所有的教师节点
        t_list = response.xpath('//div[@class="li_txt"]')
        print(t_list)
        # 遍历教师节点列表
        item = UbuntuItem()
        for teacher in t_list:
            # xpath方法返回的是选择器对象列表     extract()方法可以提取到selector对象中data对应的数据。
            item['name'] = teacher.xpath('./h3/text()').extract_first()
            item['title'] = teacher.xpath('./h4/text()').extract_first()
            item['desc'] = teacher.xpath('./p/text()').extract_first()
            yield item

注意：

scrapy.Spider爬虫类中必须有名为parse的解析；
如果网站结构层次比较复杂，也可以自定义其他解析函数；
在解析函数中提取的url地址如果要发送请求，则必须属于allowed_domains范围内，但是start_urls中的url地址不受这个限制；
启动爬虫的时候注意启动的位置，是在项目路径下启动；
parse()函数中使用yield返回数据，注意：解析函数中的yield能够传递的对象只能是：BaseItem, Request, dict, None。

小知识点1——定位元素以及提取数据、属性值的方法：
（解析并获取scrapy爬虫中的数据: 利用xpath规则字符串进行定位和提取）

response.xpath方法的返回结果是一个类似list的类型，其中包含的是selector对象，操作和列表一样，但是有一些额外的方法；
额外方法extract()：返回一个包含有字符串的列表；
额外方法extract_first()：返回列表中的第一个字符串，列表为空没有返回None。

小知识点2——response响应对象的常用属性：

response.url：当前响应的url地址
response.request.url：当前响应对应的请求的url地址
response.headers：响应头
response.requests.headers：当前响应的请求头
response.body：响应体，也就是html代码，byte类型
response.status：响应状态码

5.管道保存数据

在pipelines.py文件中定义对数据的操作！

定义一个管道类；
重写管道类的process_item方法；
process_item方法处理完item之后必须返回给引擎。

️初级篇：

在这里插入图片描述

️进阶篇：

# Define your item pipelines here
#
# Don't forget to add your pipeline to the ITEM_PIPELINES setting
# See: https://docs.scrapy.org/en/latest/topics/item-pipeline.html
import json


class UbuntuPipeline(object):

    def __init__(self):
        self.file = open('itcast.json', 'w', encoding='utf-8')

    def process_item(self, item, spider):
        # 将item对象强制转为字典，该操作只能在scrapy中使用
        item = dict(item)
        # 爬虫文件中提取数据的方法每yield一次，就会运行一次
        # 该方法为固定名称函数
        # 默认使用完管道，需要将数据返回给引擎
        # 1.将字典数据序列化
        '''ensure_ascii=False 将unicode类型转化为str类型，默认为True'''
        json_data = json.dumps(item, ensure_ascii=False, indent=2) + ',\n'

        # 2.将数据写入文件
        self.file.write(json_data)

        return item

    def __del__(self):
        self.file.close()

6.settings.py配置启用管道：

在settings文件中，解封代码，说明如下：

在这里插入图片描述

7.scrapy数据建模与请求：

（通常在做项目的过程中，在items.py中进行数据建模！）

（1）为什么建模？

定义item即提前规划好哪些字段需要抓，防止手误，因为定义好之后，在运行过程中，系统会自动检查，值不相同会报错；
配合注释一起可以清晰的知道要抓取哪些字段，没有定义的字段不能抓取，在目标字段少的时候可以使用字典代替；
使用scrapy的一些特定组件需要Item做支持，如scrapy的ImagesPipeline管道类。

（2）本项目中实操：

在items.py文件中操作：

# Define here the models for your scraped items
#
# See documentation in:
# https://docs.scrapy.org/en/latest/topics/items.html

import scrapy


class UbuntuItem(scrapy.Item):
    # 讲师名字
    name = scrapy.Field()
    # 讲师职称
    title = scrapy.Field()
    # 讲师座右铭
    desc = scrapy.Field()

注意：

from …items import UbuntuItem这一行代码中注意item的正确导入路径，忽略pycharm标记的错误；
python中的导入路径要诀：从哪里开始运行，就从哪里开始导入。

8.设置user-agent：

# settings.py文件中找到如下代码解封，并加入UA:
# Override the default request headers:
DEFAULT_REQUEST_HEADERS = {
    
  'Accept': 'text/html,application/xhtml+xml,application/xml;q=0.9,*/*;q=0.8',
  'Accept-Language': 'en',
  'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/80.0.3987.162 Safari/537.36',
}

9.到目前为止，一个入门级别的scrapy爬虫已经OK了，基操都使用了！

如何run呢？

现在cd到项目目录下，输入

scrapy crawl itcast

即可运行scrapy！

在这里插入图片描述

10.开发流程总结：

创建项目：
scrapy startproject 项目名
明确目标：
在items.py文件中进行建模！
创建爬虫：

创建爬虫：
scrapy genspider 爬虫名允许的域名
完成爬虫：
修改start_urls；检查修改allowed_domains；编写解析方法！
保存数据：
在pipelines.py文件中定义对数据处理的管道
在settings.py文件中注册启用管道

结语：

通过上面的学习，你已经可以独立创建一个scrapy项目并使用此框架进行简单的爬虫项目编写。但是！任何一种功夫都不是一下就能学好学会学精的！所以跟着本专栏，只要你跟着潜心学完，那么！恭喜你！你已经是名优秀的scrapy框架使用者了！！！

第三部分——In The End！

请添加图片描述

从现在做起，坚持下去，一天进步一小点，不久的将来，你会感谢曾经努力的你！

本文链接：https://blog.csdn.net/qq_44907926/article/details/119531324

原作者删帖不实内容删帖广告或垃圾文章投诉

智能推荐

oracle 12c 集群安装后的检查_12c查看crs状态-程序员宅基地

文章浏览阅读1.6k次。安装配置gi、安装数据库软件、dbca建库见下：http://blog.csdn.net/kadwf123/article/details/784299611、检查集群节点及状态：[root@rac2 ~]# olsnodes -srac1 Activerac2 Activerac3 Activerac4 Active[root@rac2 ~]_12c查看crs状态

解决jupyter notebook无法找到虚拟环境的问题_jupyter没有pytorch环境-程序员宅基地

文章浏览阅读1.3w次，点赞45次，收藏99次。我个人用的是anaconda3的一个python集成环境，自带jupyter notebook，但在我打开jupyter notebook界面后，却找不到对应的虚拟环境，原来是jupyter notebook只是通用于下载anaconda时自带的环境，其他环境要想使用必须手动下载一些库：1.首先进入到自己创建的虚拟环境(pytorch是虚拟环境的名字)activate pytorch2.在该环境下下载这个库conda install ipykernelconda install nb__jupyter没有pytorch环境

国内安装scoop的保姆教程_scoop-cn-程序员宅基地

文章浏览阅读5.2k次，点赞19次，收藏28次。选择scoop纯属意外，也是无奈，因为电脑用户被锁了管理员权限，所有exe安装程序都无法安装，只可以用绿色软件，最后被我发现scoop，省去了到处下载XXX绿色版的烦恼，当然scoop里需要管理员权限的软件也跟我无缘了（譬如everything）。推荐添加dorado这个bucket镜像，里面很多中文软件，但是部分国外的软件下载地址在github，可能无法下载。以上两个是官方bucket的国内镜像，所有软件建议优先从这里下载。上面可以看到很多bucket以及软件数。如果官网登陆不了可以试一下以下方式。_scoop-cn

Element ui colorpicker在Vue中的使用_vue el-color-picker-程序员宅基地

文章浏览阅读4.5k次，点赞2次，收藏3次。首先要有一个color-picker组件 <el-color-picker v-model="headcolor"></el-color-picker>在data里面data() { return {headcolor: ’ #278add ’ //这里可以选择一个默认的颜色} }然后在你想要改变颜色的地方用v-bind绑定就好了，例如：这里的:sty..._vue el-color-picker

迅为iTOP-4412精英版之烧写内核移植后的镜像_exynos 4412 刷机-程序员宅基地

文章浏览阅读640次。基于芯片日益增长的问题，所以内核开发者们引入了新的方法，就是在内核中只保留函数，而数据则不包含，由用户（应用程序员）自己把数据按照规定的格式编写，并放在约定的地方，为了不占用过多的内存，还要求数据以根精简的方式编写。boot启动时，传参给内核，告诉内核设备树文件和kernel的位置，内核启动时根据地址去找到设备树文件，再利用专用的编译器去反编译dtb文件，将dtb还原成数据结构，以供驱动的函数去调用。firmware是三星的一个固件的设备信息，因为找不到固件，所以内核启动不成功。_exynos 4412 刷机

Linux系统配置jdk_linux配置jdk-程序员宅基地

文章浏览阅读2w次，点赞24次，收藏42次。Linux系统配置jdkLinux学习教程，Linux入门教程（超详细）_linux配置jdk

随便推点

matlab(4)：特殊符号的输入_matlab微米怎么输入-程序员宅基地

文章浏览阅读3.3k次，点赞5次，收藏19次。xlabel('\delta');ylabel('AUC');具体符号的对照表参照下图：_matlab微米怎么输入

C语言程序设计-文件(打开与关闭、顺序、二进制读写)-程序员宅基地

文章浏览阅读119次。顺序读写指的是按照文件中数据的顺序进行读取或写入。对于文本文件，可以使用fgets、fputs、fscanf、fprintf等函数进行顺序读写。在C语言中，对文件的操作通常涉及文件的打开、读写以及关闭。文件的打开使用fopen函数，而关闭则使用fclose函数。在C语言中，可以使用fread和fwrite函数进行二进制读写。‍ Biaoge 于2024-03-09 23:51发布阅读量：7 ️文章类型：【 C语言程序设计】在C语言中，用于打开文件的函数是____，用于关闭文件的函数是____。

Touchdesigner自学笔记之三_touchdesigner怎么让一个模型跟着鼠标移动-程序员宅基地

文章浏览阅读3.4k次，点赞2次，收藏13次。跟随鼠标移动的粒子以grid（SOP）为partical（SOP）的资源模板，调整后连接【Geo组合+point spirit（MAT)】，在连接【feedback组合】适当调整。影响粒子动态的节点【metaball(SOP)+force(SOP)】添加mouse in（CHOP)鼠标位置到metaball的坐标，实现鼠标影响。..._touchdesigner怎么让一个模型跟着鼠标移动

【附源码】基于java的校园停车场管理系统的设计与实现61m0e9计算机毕设SSM_基于java技术的停车场管理系统实现与设计-程序员宅基地

文章浏览阅读178次。项目运行环境配置：Jdk1.8 + Tomcat7.0 + Mysql + HBuilderX（Webstorm也行）+ Eclispe（IntelliJ IDEA,Eclispe,MyEclispe,Sts都支持）。项目技术：Springboot + mybatis + Maven +mysql5.7或8.0+html+css+js等等组成，B/S模式 + Maven管理等等。环境需要1.运行环境：最好是java jdk 1.8，我们在这个平台上运行的。其他版本理论上也可以。_基于java技术的停车场管理系统实现与设计

Android系统播放器MediaPlayer源码分析_android多媒体播放源码分析时序图-程序员宅基地

文章浏览阅读3.5k次。前言对于MediaPlayer播放器的源码分析内容相对来说比较多，会从Java-&amp;gt;Jni-&amp;gt;C/C++慢慢分析，后面会慢慢更新。另外，博客只作为自己学习记录的一种方式，对于其他的不过多的评论。MediaPlayerDemopublic class MainActivity extends AppCompatActivity implements SurfaceHolder.Cal..._android多媒体播放源码分析时序图

java 数据结构与算法 ——快速排序法-程序员宅基地

文章浏览阅读2.4k次，点赞41次，收藏13次。java 数据结构与算法 ——快速排序法_快速排序法