近日,多地优化疫情防控政策,居民通过互联网平台或药房购买退热、止咳、抗病毒、抗生素等“四类药”,不再查验核酸检测阴性证明,不再需要实名登记信息。成都、广州、北京、重庆等地也宣布不再按行政区域开展全员核酸检测,并鼓励家庭自备抗原试剂盒。在防疫政策优化调整的背景下,从“四类药”原料药到成品再到下游零售连锁药房,所涉及的上市公司都开启了“备货”模式。此外,各家连锁药房上市公司负责人均表示,目前新冠抗原检测试剂盒需求较大,正与供应商积极沟通加紧后备货源的补给。 很多人会在网上购买这四类药,一般京东大药房都是大家的首选,那么今天我们就通过pythoon爬虫技术来获取京东大药房数据分析下这几类药的销量。因为京东是是属于需要登录才能大量获取数据的网站,所以本次爬虫用到的核心技术使用使用 Selenium + 爬虫隧道代理IP ,Selenium 用于驱动浏览器对网页进行模拟访问,而且 Selenium 工具可以对于网页端的一些反爬措施能够达到一些有效的抑制,爬虫隧道代理IP的使用是因为京东是反爬比较严的网站。一般的代理效果很不理想,经过多次测试对比最后选择了亿牛云的隧道代理。爬虫实现过程如下:
1 import string 2 import zipfile 3 4 # 代理服务器(产品官网 www.16yun.cn) 5 proxyHost = "t.16yun.cn" 6 proxyPort = "3111" 7 8 # 代理验证信息 9 proxyUser = "username" 10 proxyPass = "password" 11 12 13 def create_proxy_auth_extension(proxy_host, proxy_port, 14 proxy_username, proxy_password, 15 scheme='http', plugin_path=None): 16 if plugin_path is None: 17 plugin_path = r'/tmp/{}_{}@t.16yun.zip'.format(proxy_username, proxy_password) 18 19 manifest_json = """ 20 { 21 "version": "1.0.0", 22 "manifest_version": 2, 23 "name": "16YUN Proxy", 24 "permissions": [ 25 "proxy", 26 "tabs", 27 "unlimitedStorage", 28 "storage", 29 "<all_urls>", 30 "webRequest", 31 "webRequestBlocking" 32 ], 33 "background": { 34 "scripts": ["background.js"] 35 }, 36 "minimum_chrome_version":"22.0.0" 37 } 38 """ 39 40 background_js = string.Template( 41 """ 42 var config = { 43 mode: "fixed_servers", 44 rules: { 45 singleProxy: { 46 scheme: "${scheme}", 47 host: "${host}", 48 port: parseInt(${port}) 49 }, 50 bypassList: ["localhost"] 51 } 52 }; 53 54 chrome.proxy.settings.set({value: config, scope: "regular"}, function() {}); 55 56 function callbackFn(details) { 57 return { 58 authCredentials: { 59 username: "${username}", 60 password: "${password}" 61 } 62 }; 63 } 64 65 chrome.webRequest.onAuthRequired.addListener( 66 callbackFn, 67 {urls: ["<all_urls>"]}, 68 ['blocking'] 69 ); 70 """ 71 ).substitute( 72 host=proxy_host, 73 port=proxy_port, 74 username=proxy_username, 75 password=proxy_password, 76 scheme=scheme, 77 ) 78 print(background_js) 79 80 with zipfile.ZipFile(plugin_path, 'w') as zp: 81 zp.writestr("manifest.json", manifest_json) 82 zp.writestr("background.js", background_js) 83 84 return plugin_path 85 86 87 proxy_auth_plugin_path = create_proxy_auth_extension( 88 proxy_host=proxyHost, 89 proxy_port=proxyPort, 90 proxy_username=proxyUser, 91 proxy_password=proxyPass) 92 93 option = webdriver.ChromeOptions() 94 95 option.add_argument("--start-maximized") 96 97 # 如报错 chrome-extensions 98 # option.add_argument("--disable-extensions") 99 100 option.add_extension(proxy_auth_plugin_path) 101 102 # 关闭webdriver的一些标志 103 # option.add_experimental_option('excludeSwitches', ['enable-automation']) 104 105 driver = webdriver.Chrome( 106 chrome_options=option, 107 executable_path="./chromdriver" 108 ) 109 110 # 修改webdriver get属性 111 # script = ''' 112 # Object.defineProperty(navigator, 'webdriver', { 113 # get: () => undefined 114 # }) 115 # ''' 116 # driver.execute_cdp_cmd("Page.addScriptToEvaluateOnNewDocument", {"source": script}) 117 118 119 driver.get("https://httpbin.org/ip")
尽管 selenium 对于网页端的一些反爬机制实现有效地破解,但对于一些网站时没有用的,例如拉勾网,当你用 Selenium 驱动浏览器在拉钩官网模拟翻页操作时,网站能识别出非人为操作,对你的 IP 进行暂时性封禁并警告。所以不管什么网站的数据获取IP的辅助是必不可少少的。关于本篇文章涉及到的完整源码,代理的获取方式可以私信或搜索亿牛云获取。
