Python爬虫之Scrapy框架的UA池和代理池

一 下载Scrapy的下载中间件

img

下载中间件(Downloader Middlewares) 位于scrapy引擎和下载器之间的一层组件。

下载中间件的作用:

(1)引擎请求传递给下载器的过程中,下载中间件可以对请求进行一系列处理。比如:设置User-Agent,设置代理等。

(2)在下载器完成将Response传递给引擎中,下载中间件可以对响应进行一系列的处理。

我们主要使用下载中间件处理请求,设置随机的代理IP,对请求设置随机的User-Agent。目的在于防止爬取网站时的反爬虫策略。

二 UA池:User-Agent

作用是:尽量将scrapy工程中的请求伪装成不同类型的浏览器身份。

步骤如下:

(1) 在下载中间件中拦截请求

(2)将拦截到的请求的请求信息中的UA进行篡改伪装

(3)在配置文件中开启下载中间件

middlewares.py中

1import random 2 3class MiddleproDownloaderMiddleware(object): 4 # Not all methods need to be defined. If a method is not defined, 5 # scrapy acts as if the downloader middleware does not modify the 6 # passed objects. 7 user_agent_list = [ 8 "Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.1 " 9 "(KHTML, like Gecko) Chrome/22.0.1207.1 Safari/537.1", 10 "Mozilla/5.0 (X11; CrOS i686 2268.111.0) AppleWebKit/536.11 " 11 "(KHTML, like Gecko) Chrome/20.0.1132.57 Safari/536.11", 12 "Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/536.6 " 13 "(KHTML, like Gecko) Chrome/20.0.1092.0 Safari/536.6", 14 "Mozilla/5.0 (Windows NT 6.2) AppleWebKit/536.6 " 15 "(KHTML, like Gecko) Chrome/20.0.1090.0 Safari/536.6", 16 "Mozilla/5.0 (Windows NT 6.2; WOW64) AppleWebKit/537.1 " 17 "(KHTML, like Gecko) Chrome/19.77.34.5 Safari/537.1", 18 "Mozilla/5.0 (X11; Linux x86_64) AppleWebKit/536.5 " 19 "(KHTML, like Gecko) Chrome/19.0.1084.9 Safari/536.5", 20 "Mozilla/5.0 (Windows NT 6.0) AppleWebKit/536.5 " 21 "(KHTML, like Gecko) Chrome/19.0.1084.36 Safari/536.5", 22 "Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/536.3 " 23 "(KHTML, like Gecko) Chrome/19.0.1063.0 Safari/536.3", 24 "Mozilla/5.0 (Windows NT 5.1) AppleWebKit/536.3 " 25 "(KHTML, like Gecko) Chrome/19.0.1063.0 Safari/536.3", 26 "Mozilla/5.0 (Macintosh; Intel Mac OS X 10_8_0) AppleWebKit/536.3 " 27 "(KHTML, like Gecko) Chrome/19.0.1063.0 Safari/536.3", 28 "Mozilla/5.0 (Windows NT 6.2) AppleWebKit/536.3 " 29 "(KHTML, like Gecko) Chrome/19.0.1062.0 Safari/536.3", 30 "Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/536.3 " 31 "(KHTML, like Gecko) Chrome/19.0.1062.0 Safari/536.3", 32 "Mozilla/5.0 (Windows NT 6.2) AppleWebKit/536.3 " 33 "(KHTML, like Gecko) Chrome/19.0.1061.1 Safari/536.3", 34 "Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/536.3 " 35 "(KHTML, like Gecko) Chrome/19.0.1061.1 Safari/536.3", 36 "Mozilla/5.0 (Windows NT 6.1) AppleWebKit/536.3 " 37 "(KHTML, like Gecko) Chrome/19.0.1061.1 Safari/536.3", 38 "Mozilla/5.0 (Windows NT 6.2) AppleWebKit/536.3 " 39 "(KHTML, like Gecko) Chrome/19.0.1061.0 Safari/536.3", 40 "Mozilla/5.0 (X11; Linux x86_64) AppleWebKit/535.24 " 41 "(KHTML, like Gecko) Chrome/19.0.1055.1 Safari/535.24", 42 "Mozilla/5.0 (Windows NT 6.2; WOW64) AppleWebKit/535.24 " 43 "(KHTML, like Gecko) Chrome/19.0.1055.1 Safari/535.24" 44 ] 45 46 47#拦截所有未发生异常的请求(正常的请求) 48def process_request(self, request, spider): 49 print('process_request') 50 # 使用UA池进行请求的UA伪装 51 #请求头信息 获取到的是字典 52 #这一步可有可无 因为你可以在settings中设置一个共同的User-Agent 53 request.headers['User-Agent'] = random.choice(self.user_agent_list) 54 print(request.headers['User-Agent']) 55 return None 56
三 代理池

作用是:将Scrapy工程中的请求中的IP设置成不同的

步骤:(与UA池基本上是一样的)

(1)在下载中间件中拦截请求

(2) 将拦截到的请求中的IP修改成某一个代理的IP

(3)在配置文件中开启下载中间件

middlewares.py

1 class MiddleproDownloaderMiddleware(object): 2 #写两个列表 原因是代理IP的类型中有 http 和 https两种类型 3 # 可被选用的代理IP 4 PROXY_http = [ 5 '153.180.102.104:80', 6 '195.208.131.189:56055', 7 ] 8 PROXY_https = [ 9 '120.83.49.90:9000', 10 '95.189.112.214:35508', 11 ] 12#拦截所有的异常请求 13def process_exception(self, request, exception, spider): 14 #这一步是必须要用的 因为当你访问一个网站次数过多的时候 你可以使用代理IP继续爬取该网站的数据 15 ## #使用代理池进行请求代理ip的设置 16 # request.url 返回的是请求对象所对应的URL 17 print('process_exception') 18 if request.url.split(':')[0] == 'http': 19 request.meta['proxy'] = random.choice(self.PROXY_http) 20 else: 21 request.meta['proxy'] = random.choice(self.PROXY_https) 22
在settings.py中将下载中间件打开即可
1#在第552DOWNLOADER_MIDDLEWARES = { 3 'middlePro.middlewares.MiddleproDownloaderMiddleware': 543, 4}
点赞
收藏

评论区

加载中...

相关推荐

MySQL:[Err] 1292 - Incorrect datetime value: ‘0000-00-00 00:00:00‘ for column ‘CREATE_TIME‘ at row 1

文章目录问题用navicat导入数据时,报错:原因这是因为当前的MySQL不支持datetime为0的情况。解决修改sql\mode:sql\mode:SQLMode定义了MySQL应支持的SQL语法、数据校验等,这样可以更容易地在不同的环境中使用MySQL。全局s

Oracle 分组与拼接字符串同时使用

SELECTT.,ROWNUMIDFROM(SELECTT.EMPLID,T.NAME,T.BU,T.REALDEPART,T.FORMATDATE,SUM(T.S0)S0,MAX(UPDATETIME)CREATETIME,LISTAGG(TOCHAR(

MySQL部分从库上面因为大量的临时表tmp_table造成慢查询

背景描述Time:20190124T00:08:14.70572408:00User@Host:@Id:Schema:sentrymetaLast_errno:0Killed:0Query_time:0.315758Lock_

皕杰报表之UUID

​在我们用皕杰报表工具设计填报报表时,如何在新增行里自动增加id呢?能新增整数排序id吗?目前可以在新增行里自动增加id,但只能用uuid函数增加UUID编码,不能新增整数排序id。uuid函数说明:获取一个UUID,可以在填报表中用来创建数据ID语法:uuid()或uuid(sep)参数说明:sep布尔值,生成的uuid中是否包含分隔符'',缺省为

手写Java HashMap源码

HashMap的使用教程HashMap的使用教程HashMap的使用教程HashMap的使用教程HashMap的使用教程22

2020年前端实用代码段,为你的工作保驾护航

有空的时候,自己总结了几个代码段,在开发中也经常使用,谢谢。1、使用解构获取json数据let jsonData  id: 1,status: "OK",data: 'a', 'b';let  id, status, data: number   jsonData;console.log(id, status, number )