爬虫中使用代理IP的一些误区

做为爬虫工作者在日常工作中使用爬虫多次爬取同一网站时,经常会被网站的IP反爬虫机制给禁掉,为了解决封禁 IP 的问题通常会使用代理IP。但也有一部分人在HTTP代理IP的使用上存在着误解,他们认为使用了代理IP就能解决一切问题,然而实际上代理IP不是万能的,它只是一个工具,如果使用不当,一样会被封IP。 如果是使用的透明代理IP自然会受到限制,但是使用的是高匿名代理则不会,所以在选择代理IP的时候,要注意这一点。还有就是在使用一个代理IP爬取目标网站,被封IP的因素也有很多,比如cookie,比如User Agent等等,或者IP的单次使用频率太高,IP就会被封;当访问目标网站的频率过快时,IP也会被封,因为人类正常访问远远达不到那个频率,自然会被目标网站的反爬虫策略识别。 这样的情况下我们只有尽量地模拟真实用户正常访问,才能最大程度地避免被封IP。而高匿代理IP也不难找,比如亿牛云(www.16yun.cn)提供电信家庭私密高匿代理ip就能满足大家的需求。并且针对代理的使用还提供了专业的文档,如果你的爬虫程序是使用的python,如果购买的是爬虫代理,那么正确的使用代理IP的过程如下: Plain Text 复制代码

#! -- encoding:utf-8 --

1import requests 2import random 3 4# 要访问的目标页面 5targetUrl = "http://httpbin.org/ip" 6 7# 要访问的目标HTTPS页面 8# targetUrl = "https://httpbin.org/ip" 9 10# 代理服务器(产品官网 www.16yun.cn) 11proxyHost = "t.16yun.cn" 12proxyPort = "31111" 13 14# 代理验证信息 15proxyUser = "username" 16proxyPass = "password" 17 18proxyMeta = "http://%(user)s:%(pass)s@%(host)s:%(port)s" % { 19 "host" : proxyHost, 20 "port" : proxyPort, 21 "user" : proxyUser, 22 "pass" : proxyPass, 23} 24 25# 设置 http和https访问都是用HTTP代理 26proxies = { 27 "http" : proxyMeta, 28 "https" : proxyMeta, 29} 30 31 32# 设置IP切换头 33tunnel = random.randint(1,10000) 34headers = {"Proxy-Tunnel": str(tunnel)} 35 36 37 38resp = requests.get(targetUrl, proxies=proxies, headers=headers) 39 40print resp.status_code 41print resp.text

还有其他的语言示例可以选择,有需要的可以在官网去了解 https://www.16yun.cn/help/ss_demo/#

点赞
收藏

评论区

加载中...

相关推荐

Python 快速验证代理IP是否有效

有时候,我们需要用到代理IP,比如在爬虫的时候,但是得到了IP之后,可能不知道怎么验证这些IP是不是有效的,这时候我们可以使用Python携带该IP来模拟访问某一个网站,如果多次未成功访问,则说明这个代理是无效的。代码如下:pythonimportrequestsimportrandomimporttimehttp_ip'118.

Oracle 分组与拼接字符串同时使用

SELECTT.,ROWNUMIDFROM(SELECTT.EMPLID,T.NAME,T.BU,T.REALDEPART,T.FORMATDATE,SUM(T.S0)S0,MAX(UPDATETIME)CREATETIME,LISTAGG(TOCHAR(

MySQL部分从库上面因为大量的临时表tmp_table造成慢查询

背景描述Time:20190124T00:08:14.70572408:00User@Host:@Id:Schema:sentrymetaLast_errno:0Killed:0Query_time:0.315758Lock_

Python爬虫代理池

爬虫代理IP池在公司做分布式深网爬虫,搭建了一套稳定的代理池服务,为上千个爬虫提供有效的代理,保证各个爬虫拿到的都是对应网站有效的代理IP,从而保证爬虫快速稳定的运行,当然在公司做的东西不能开源出来。不过呢,闲暇时间手痒,所以就想利用一些免费的资源搞一个简单的代理池服务。1、问题代理IP从何而来?

baidu spider IP 查询

baiduspider是的爬虫代理。有朋友经常问这个IP是不是baiduspider的IP地址?而对于只有一个IP的情况,我们应该如何去判断是不是baiduspider的IP地址呢?我们可以使用这个工具网站来查询具体的IP是baiduspider还是假baiduspider,下面是示例:例如我们查询这个IP地

网站反爬之封IP应对措施

作为爬虫工作者爬取数据是基本的技能,在日常获取数据的过程中遇到网站反爬也是家常事,网站的反爬方式有很多,今天我们重点来分析下封IP的行为。这种情况下大家都是很简单的使用代理IP就解决了,但是网上ip代理有很多家,到底选哪家好呢?这里推荐口碑很好的亿牛云