爬取3万景点,分析十一哪里人从众从人?

作为一名普通上班族,每个星期都在无休止的上班(没准还加班)之中度过。几个月前一直心心念念的可就是这十一的“小长假”(还调班两天)。

朱小五这次爬取分析携程国内150个热点城市的景点数据,简单的分析一下哪些景点比较受欢迎。用来预计分析一下这个十一哪里最可能人从众从人?

让我们来分析一下。

获取数据

首先,我们来明确一下我们想要爬取的数据是哪些,这里为了方便起见,我们先以目前国内最热门的城市——杭州为例:

图中的景点名称,地址,评分,景区质量等级、点评数量就是我们本次要获取的数据。其中点评数量正是本次作为判断该景点是否人数会多的重要依据。

翻页即可发现页码变化的规律

这次采用requests+美丽的汤(BeautifulSoup)来爬取。

1`def get_list(urls,city):` `data = [] 2 for i in range(1,3): 3 #爬取n页 4 url = 'https://you.ctrip.com/sight/'+str(urls)+'/s0-p'+str(i)+'.html#sightname' 5 results = {} 6 doc = requests.get(url, headers=headers) 7 while (doc is None or doc == {'code': -460, 'msg': 'Cheating'}): 8 print('重新获取!') 9 time.sleep(random.random()) 10 doc = restaurant(url) 11 12 soup = BeautifulSoup(doc.text, features='lxml') 13 14 list_wide_mod2 = soup.find_all('div', class_='list_wide_mod2')[0] 15 for each1, each2 in zip(list_wide_mod2.find_all('dl'), list_wide_mod2.find_all('ul', class_='r_comment')): 16 name = each1.dt.a.text 17 addr = each1.find_all('dd')[0].text.strip() 18 level = each1.find_all('dd')[1].text.strip().split('|')[0].strip() 19 if '携程' in level: 20 level = '' 21 try: 22 price = each1.find_all('span', class_='price')[0].text.strip().replace('¥', '') 23 except: 24 price = '0' 25 score = each2.find_all('a', class_='score')[0].text.strip().replace('\xa0分', '') 26 comments = each2.find_all('a', class_='recomment')[0].text.strip()[1: -3].replace('条', '') 27 results = [city, name, addr, level, price, score, comments] 28 data.append(results) 29 30 final_result = pd.DataFrame(data) 31 final_result.columns=['city', 'name', 'addr', 'level', 'price', 'score', 'comments'] 32 final_result.to_csv("%s景点数据.csv"%city,encoding="utf_8",index = False) 33 return final_result`

依次爬取150个热门城市

汇总后就获得了3万余条景点数据。

数据分析

清洗填充一下。

1def data_cleaning(data): 2    cols = data.columns 3    for col in cols: 4        if data[col].dtype ==  'object': 5            data[col].fillna('缺失数据', inplace = True) 6        else: 7            data[col].fillna(0, inplace = True) 8    return(data)

按照评论数量排序,筛选前20的景点。

1#排序TOP20 2data['comments'] = data['comments'].astype('int') 3df = data.sort_values(by="comments",ascending=False) 4df.head(20)

以上这些景点城市是之前的热门,也是仍旧是这次十一最可能人挤人的地方,请注意。

详情数据分析报告请点击:

《国庆出去旅个游要过的关,比消消乐还多

数据可视化

首先我们将上面的Top20做个词云,更加直观地展示。

消费价格也是衡量景区的一个方面,所以打算区分一下景区的消费价格。

python中对列表以区间进行统计,可以使用下面这个方法:

1from itertools import groupby 2 3lst = [1, 1, 1, 2, 3, 4, 4, 5, 5, 6, 7, 7, 7, 7, 8, 9, 9, 9, 10, 99, 99, 99, 100, 101] 4dic = {} 5 6for k, g in groupby(lst, key=lambda x: (x-1)//10): 7    dic['{}-{}'.format(k*10+1, (k+1)*10)] = len(list(g)) 8 9print(dic)

根据得到的结果,我们可以绘制热门旅游景区消费价格区间分布饼图。

1from matplotlib import pyplot as plt  2 3#调节图形大小,宽,高 4plt.figure(figsize=(5,8)) 5 6#定义饼状图的标签,标签是列表 7labels = ['0-50元 ', '50-100元 ', '100-150元 ', '150-200元 ', '200及以上 '] 8#每个标签占多大 9sizes = [33660, 1542, 539, 289, 276] 10colors = ['red', 'orange', 'green', 'blue', 'gray', 'goldenrod'] 11 12explode = (0, 0, 0, 0, 0.1) 13 14patches,l_text,p_text = plt.pie(sizes,explode=explode,labels=labels,colors=colors, 15                                labeldistance = 1.1,autopct = '%3.1f%%',shadow = False, 16                                startangle = 90,pctdistance = 0.6) 17 18plt.title(u'热门旅游景区消费价格区间分布', fontsize=20) 19 20for t in l_text: 21    t.set_size=(30) 22for t in p_text: 23    t.set_size=(50) 24# 设置x,y轴刻度一致,这样饼图才能是圆的 25plt.axis('equal') 26plt.legend() 27plt.show()

其实国内大部分的景点门票费用并不贵,我们旅途中花销最大的是车票+酒店。

国庆出去玩一趟,实在太难了,每一个国庆去热门景区洗礼过的朋友,都是抱着关关难过关关过的悲壮心态,努力留下几张美好的照片,多吃几口当地的美食,以安慰自己,这一趟,值得。

无论你选择家里蹲七天享受难得的闲暇,还是出去走走见识更大的世界,都祝你国庆七天,跟随本心,快快乐乐~


转载请尽量带上二维码或者结尾注明来源,谢谢了。


本文转转自微信公众号凹凸数据原创https://mp.weixin.qq.com/s/IVSyG-3Mc2AVq3i8vXQYAA,可扫描二维码进行关注: 如有侵权,请联系删除。

点赞
收藏

评论区

加载中...

相关推荐

MySQL:[Err] 1292 - Incorrect datetime value: ‘0000-00-00 00:00:00‘ for column ‘CREATE_TIME‘ at row 1

文章目录问题用navicat导入数据时,报错:原因这是因为当前的MySQL不支持datetime为0的情况。解决修改sql\mode:sql\mode:SQLMode定义了MySQL应支持的SQL语法、数据校验等,这样可以更容易地在不同的环境中使用MySQL。全局s

Oracle 分组与拼接字符串同时使用

SELECTT.,ROWNUMIDFROM(SELECTT.EMPLID,T.NAME,T.BU,T.REALDEPART,T.FORMATDATE,SUM(T.S0)S0,MAX(UPDATETIME)CREATETIME,LISTAGG(TOCHAR(

MySQL部分从库上面因为大量的临时表tmp_table造成慢查询

背景描述Time:20190124T00:08:14.70572408:00User@Host:@Id:Schema:sentrymetaLast_errno:0Killed:0Query_time:0.315758Lock_

皕杰报表之UUID

​在我们用皕杰报表工具设计填报报表时,如何在新增行里自动增加id呢?能新增整数排序id吗?目前可以在新增行里自动增加id,但只能用uuid函数增加UUID编码,不能新增整数排序id。uuid函数说明:获取一个UUID,可以在填报表中用来创建数据ID语法:uuid()或uuid(sep)参数说明:sep布尔值,生成的uuid中是否包含分隔符'',缺省为

2020年前端实用代码段,为你的工作保驾护航

有空的时候,自己总结了几个代码段,在开发中也经常使用,谢谢。1、使用解构获取json数据let jsonData  id: 1,status: "OK",data: 'a', 'b';let  id, status, data: number   jsonData;console.log(id, status, number )

​一篇文章总结一下Python库中关于时间的常见操作

前言本次来总结一下关于Python时间的相关操作,有一个有趣的问题。如果你的业务用不到时间相关的操作,你的业务基本上会一直用不到。但是如果你的业务一旦用到了时间操作,你就会发现,淦,到处都是时间操作。。。所以思来想去,还是总结一下吧,本次会采用类型注解方式。time包importtime时间戳从1970年1月1日00:00:00标准时区诞生到现在