当前位置:

Scrapy Web爬虫框架 v2.11.1

收藏
举报
Scrapy 是一套基于基于Twisted的异步处理框架,纯python实现的爬虫框架,用户只需要定制开发几个模块就可以轻松的实现一个爬虫,用来抓取网页内容以及各种图片,非常之方便。
  • 作者:
    dangra
  • 演示网站:
    暂无
  • 当前版本:
    v2.11.1
  • 日期:
    2024-02-27
  • 相关链接:
    Home Page
  • 所属分类:
    web应用开发 Python
  • 软件评级:
  • 下载人气:
    3422
免费下载
求购此源码
应用截图
源码详情
免费下载
联系客服/入群
源码属性
作者 dangra
授权 开源
大小 1.52MB
语言 Python
运行环境 python
功能介绍

Scrapy 是一套基于基于Twisted的异步处理框架,纯python实现的爬虫框架,用户只需要定制开发几个模块就可以轻松的实现一个爬虫,用来抓取网页内容以及各种图片,非常之方便。


架构

Scrapy Engine(引擎):负责Spider、ItemPipeline、Downloader、Scheduler中间的通讯,信号、数据传递等。
Scheduler(调度器):它负责接受引擎发送过来的Request请求,并按照一定的方式进行整理排列,入队,当引擎需要时,交还给引擎。
Downloader(下载器):负责下载Scrapy Engine(引擎)发送的所有Requests请求,并将其获取到的Responses交还给Scrapy Engine(引擎),由引擎交给Spider来处理。
Spider(爬虫):它负责处理所有Responses,从中分析提取数据,获取Item字段需要的数据,并将需要跟进的URL提交给引擎,再次进入Scheduler(调度器)。
Item Pipeline(管道):它负责处理Spider中获取到的Item,并进行进行后期处理(详细分析、过滤、存储等)的地方。
Downloader Middlewares(下载中间件):一个可以自定义扩展下载功能的组件。
Spider Middlewares(Spider中间件):一个可以自定扩展和操作引擎和Spider中间通信的功能组件。

付费服务
模板/插件

联系客服

手机版

扫一扫进入手机版

返回顶部