Python的Scrapy框架解析

 更新时间:2021-12-22 15:59:37   作者:佚名   我要评论(0)

目录一.为什么使用Scrapy框架?二.Scrapy框架每个组件介绍三.Scrapy框架工作原理总结一.为什么使用Scrapy框架?
Scrapy是一个快速、高

一.为什么使用Scrapy框架?

Scrapy是一个快速、高层次的屏幕抓取和web抓取的框架,可用于数据挖掘、监测和自动化检测,任何人都可以根据需要去进行修改。

二.Scrapy框架每个组件介绍

1.Scrapy引擎(Scrapy Engine):负责控制数据流在系统的所以组件中的流动,并在相应动作发生时触发事件。

2.调度器(Scheduler):从引擎接受reques并将其入队,便于以后请求它们提供给引擎。

3.下载器(Downloader):负责获取网页数据并且提供给引擎,然后提供给Spider。

4.Spiders: 指Scrapy用户编写用于分析response并且提取item或额外跟进的URL类人。每个Spider负责处理一些特定网站。

5.Item Pipeline:负责处理被Spider提取出来的item。典型的处理有清洁、验证及持久化

6.下载器中间件(Downloader Middlewares):指在引擎及下载器之间的特定钩子(specific hook),处理Downloader 传递给引擎的response。它提供一个简便的机制,通过插入自定义代码来扩展Scrapy功能。

7.Spiders中间件(Spider Middlewares):指在引擎及Spider之间的特定钩子(specific hook),处理Spider 的输入(response)和输出(itemsrequests)。它提供一个简便的机制,通过插入自定义代码来扩展Scrapy功能。

三.Scrapy框架工作原理

è?é?????è?°

1.引擎向spider要URL

2.引擎将要爬取的URL给调度器

3.调度器会将URL生成请求对象放入指定的队列中

4.从队列中出队一个请求

5.引擎将请求交给下载器进行处理

6.下载器发送请求获取互联网数据

7.下载器将数据返回给引擎

8.引擎将数据再次给到spiders

9.spiders通过xpath解析该数据,得到数据或URL

10.spiders将数据或URL给到引擎

11.引擎判断该数据是URL还是数据,交给管道处理,URL交给调度器处理

12.当调度器里没有任何数据之后,整个程序停止

下面是我根据工作原理画的可以结合去看:

总结

本篇文章就到这里了,希望能够给你带来帮助,也希望您能够多多关注脚本之家的更多内容!

您可能感兴趣的文章:
  • python爬虫scrapy框架的梨视频案例解析
  • python Scrapy框架原理解析
  • Python爬虫 scrapy框架爬取某招聘网存入mongodb解析

相关文章

  • Python的Scrapy框架解析

    Python的Scrapy框架解析

    目录一.为什么使用Scrapy框架?二.Scrapy框架每个组件介绍三.Scrapy框架工作原理总结一.为什么使用Scrapy框架? Scrapy是一个快速、高
    2021-12-22
  • python数据分析之文件读取详解

    python数据分析之文件读取详解

    目录前言:一·Numpy库中操作文件二·Pandas库中操作文件三·补充总结前言: 如果你使用的是Anaconda中的Jupyter,则不需要下载Pands和Numpy
    2021-12-22
  • C语言实现求最大公约数的三种方法

    C语言实现求最大公约数的三种方法

    目录题目描述问题分析代码实现方法一:穷举法方法二:辗转相除法方法三:更相减损法题目描述 求任意两个正整数的最大公约数 问题分析 最大公
    2021-12-22
  • 使用Log4j2代码方式配置实现线程级动态控制

    使用Log4j2代码方式配置实现线程级动态控制

    目录一 需求二 对外暴露的接口三 代码方式配置Log4j2日志对象四 线程级日志对象的设计五 标准日志头六 异常日志的堆栈信息打印七 测试一 需求
    2021-12-22
  • 浅谈Django Admin的初步使用

    浅谈Django Admin的初步使用

    目录创建管理员用户更改admin后台语言应用后端管理功能完善设置模型名设置显示的字段后端管理系统名称创建管理员用户 命令行输入python mana
    2021-12-22
  • MySQL count(1)、count(*)、count(字段)的区别

    MySQL count(1)、count(*)、count(字段)的区别

    目录1.初识COUNT2.COUNT(字段)、COUNT(常量)和COUNT(*)之间的区别3.COUNT(*)的优化MyISAM InnoDB 4.COUNT(*)和COUNT(1)5.COUNT(字段)6.总结
    2021-12-22
  • .Net6?winform?程序使用依赖注入

    .Net6?winform?程序使用依赖注入

    引入NuGet 注册Autofac 在Program的var app = builder.Build();前加上这段代码 builder.Host.UseServiceProviderFactory(new AutofacSe
    2021-12-22
  • C#实现将PDF转为线性化PDF

    C#实现将PDF转为线性化PDF

    目录程序环境方法步骤步骤1. 安装PDF插件。步骤2. 编辑如下代码实现转换。线性化PDF文件是PDF文件的一种特殊格式,可以通过Internet更快地进
    2021-12-22
  • Django利用LogEntry生成历史操作实战记录

    Django利用LogEntry生成历史操作实战记录

    在开发测试平台的时候,虽然对某些关键功能做了权限设置,但毕竟是公司多人使用,有些数据的配置可能不小心被他人修改但未告知其他使用者,造
    2021-12-22
  • 从log4j2到Disruptor详解

    从log4j2到Disruptor详解

    目录log4j2异步日志简要回顾Disruptor在log4j2中的应用异步日志Disruptor启动异步日志Disruptor写入架构及流程Disruptor为什么这么快?Log4j
    2021-12-22

最新评论