手把手教你用Python进行城市公交网络分析与可视化

一、数据查看和预处理


数据获取自高德地图API,包含了天津市公交线路和站点名称及其经纬度数据

1import pandas as pd 2 3df = pd.read_excel('site_information.xlsx') 4df.head() 5

字段说明:

  • 线路名称:公交线路的名称

  • 上下行:0表示上行;1表示下行

  • 站序号:公交线路上行或下行依次经过站的序号

  • 站名称:站点名称

  • 经度(分):站点的经度

  • 纬度(分):站点的纬度

数据字段少,结构也比较简单,下面来充分了解我们的数据和进行预处理。总的数据有 30396 条,站名称缺失了 5 条,纬度(分)缺失了 1 条,经度(分)缺失了 38 条,为了处理方便,直接把有缺失值的行删除。

经纬度数据是7031.982、2348.1016这样的,需要将其转换为以度为单位。

1df2 = df1.copy() 2df2['经度(分)'] = df1['经度(分)'].apply(float) / 60 3df2['纬度(分)'] = df1['纬度(分)'].apply(float) / 60 4df2.head() 5

处理后的数据里,共有 618 条公交线路,4851个站点数据。

重新保存为处理后数据

1df2.to_excel("处理后数据.xlsx", index=False) 2

二、数据分析

分析天津市公交站点的分布情况

1-*- coding: UTF-8 -*- 2""" 3@Author  :叶庭云 4@公众号  :修炼Python 5@CSDN    :https://yetingyun.blog.csdn.net/ 6""" 7import pandas as pd 8import matplotlib.pyplot as plt 9import matplotlib as mpl 10import random 11 12df = pd.read_excel("处理后数据.xlsx") 13x_data = df['经度(分)'] 14y_data = df['纬度(分)'] 15colors = ['#FF0000', '#0000CD', '#00BFFF', '#008000', '#FF1493', '#FFD700', '#FF4500', '#00FA9A', '#191970', '#9932CC'] 16colors = [random.choice(colors) for i in range(len(x_data))] 17mpl.rcParams['font.family'] = 'SimHei' 18plt.style.use('ggplot') 19# 设置大小 20plt.figure(figsize=(12, 6), dpi=200) 21# 绘制散点图  经度  纬度  传进去   设置 颜色  点的大小 22plt.scatter(x_data, y_data, marker="o", s=9., c=colors) 23 24# 添加描述信息 x轴 y轴 标题 25plt.xlabel("经度") 26plt.ylabel("纬度") 27plt.title("天津市公交站点分布情况") 28plt.savefig('经纬度散点图.png') 29plt.show() 30

结果如下:

通过 matplotlib 绘制散点图可视化天津市公交站点的分布情况,容易看出天津市的公交热点分布区域。为了能更形象地分析公交线路网络,我们还可以将数据可视化在实际地图上,利用 Pyecharts 的BMap

1-*- coding: UTF-8 -*- 2""" 3@Author  :叶庭云 4@公众号  :修炼Python 5@CSDN    :https://yetingyun.blog.csdn.net/ 6""" 7import pandas as pd 8from pyecharts.charts import BMap 9from pyecharts import options as opts 10from pyecharts.globals import CurrentConfig 11 12# 引用本地js资源渲染 13CurrentConfig.ONLINE_HOST = 'D:/python/pyecharts-assets-master/assets/' 14 15df = pd.read_excel('处理后数据.xlsx', encoding='utf-8') 16df.drop_duplicates(subset='站名称', inplace=True) 17longitude = list(df['经度(分)']) 18latitude = list(df['纬度(分)']) 19datas = [] 20= [] 21for i, j in zip(longitude, latitude): 22    a.append([i, j]) 23 24datas.append(a) 25print(datas) 26 27BAIDU_MAP_AK = "改成你的百度地图AK" 28 29= ( 30    BMap(init_opts=opts.InitOpts(width="1200px", height="800px")) 31    .add_schema( 32        baidu_ak=BAIDU_MAP_AK,     # 申请的BAIDU_MAP_AK 33        center=[117.20, 39.13],    # 天津市经纬度中心 34        zoom=10, 35        is_roam=True, 36    ) 37    .add( 38        "", 39        type_="lines", 40        is_polyline=True, 41        data_pair=datas, 42        linestyle_opts=opts.LineStyleOpts(opacity=0.2, width=0.5, color='red'), 43        # 如果不是最新版本的话可以注释下面的参数(效果差距不大) 44        progressive=200, 45        progressive_threshold=500, 46    ) 47) 48 49c.render('公交网络地图.html') 50

结果如下:

在实际地图上可以看到,和平区、南开区公交线路网络密集,交通便利。

公交线路网络中 i 节点代表第 i 条线路,其中节点 i 的度定义为与线路 i 可以经过换乘能够到达的线路的数目,线路网络中度的大小反映了该条公交线路与其他线路的连通程度,构建算法分析公交线路网络中节点度的分布。

1-*- coding: UTF-8 -*- 2""" 3@Author  :叶庭云 4@公众号  :修炼Python 5@CSDN    :https://yetingyun.blog.csdn.net/ 6""" 7import xlrd 8import matplotlib.pyplot as plt 9import pandas as pd 10import matplotlib as mpl 11 12 13df = pd.read_excel("site_information.xlsx") 14# 用pandas的操作去重   得到每条线路的名称 15loc = df['线路名称'].unique() 16# 得到每一条线路名称的列表 17line_list = list(loc) 18print(line_list) 19 20# 打开Excel表格 21data = xlrd.open_workbook("site_information.xlsx") 22print(data)   # <xlrd.book.Book object at 0x000001F1111C38D0> 在内存中 23# 获取特定Sheet  索引为0  也就是第一个表 24table = data.sheets()[0]  # 从零开始 25# 每条线路对应有哪些站点  字典推导式 26site_dic = {k: [] for k in line_list} 27site_list = [] 28for i in range(1, table.nrows): 29    # 每一行的数据   返回的是一个列表 30    x = table.row_values(i) 31    if x[1] == "0": 32        # 上行   站点数据  每条线路对应有哪些站点 添加进列表 33        site_dic[x[0]].append(x[3]) 34        site_list.append(x[3]) 35    else: 36        continue 37print(len(site_dic))   # 618条线路 38print(len(site_list))  # 15248条站点数据 39print(f"公交网络共有 {len(line_list)} 条线路")   # 618条线路 40 41# 先初始化一个统计每个节点的度的列表  与线路名称列表里的索引一一对应 42node_count = [* 0 for m in range(len(line_list))] 43# 以每条线路为一个节点  线路名称为键      值为一个列表  里面包含每条路线上行经过的所有站点 44sites = [site for site in site_dic.values()] 45print(sites) 46for j in range(len(sites)):  # 类似冒泡法排序  比较多少趟 47    for k in range(j, len(sites) - 1):  # 每趟比较后  往后推一个  直到比较完  和防止越界 48        if len(sites[j]) > len(sites[+ 1]): 49            for x in sites[j]: 50                if x in sites[j] and x in sites[+ 1]:   # 只要这两条线路有公共站点  节点度数加1 51                    node_count[j], node_count[+ 1] = node_count[j] + 1, node_count[+ 1] + 1 52                    break   # 两条线路对应在列表索引的值加1   这两条线的比较结束 53        else: 54            for x in sites[+ 1]: 55                if x in sites[j] and x in sites[+ 1]:   # 只要这两条线路有公共站点  节点度数加1 56                    node_count[j], node_count[+ 1] = node_count[j] + 1, node_count[+ 1] + 1 57                    break   # 两条线路对应在列表索引的值加1   这两条线的比较结束 58print(node_count) 59# 节点编号 与 节点的度数索引对应 60node_number = [for y in range(len(node_count))] 61# 线性网络度的最大值   175 62print(f"线路网络的度的最大值为:{max(node_count)}") 63print(f"线路网络的度的最小值为:{min(node_count)}") 64print(f"线路网络的度的平均值为:{sum(node_count) / len(node_count)}") 65# 设置大小  图的像素 66# 设置字体   matplotlib 不支持显示中文  自己本地设置 67plt.figure(figsize=(10, 6), dpi=150) 68mpl.rcParams['font.family'] = 'SimHei' 69 70# 绘制每个节点度的分布 71plt.bar(node_number, node_count, color="purple") 72 73# 添加描述信息 74plt.xlabel("节点编号n") 75plt.ylabel("节点的度数K") 76plt.title("线路网络中各节点的度的大小分布", fontsize=15) 77plt.savefig("线路网络中各节点的度的大小.png") 78plt.show() 79

结果如下:

1公交网络共有 618 条线路 2线路网络的度的最大值为:175 3线路网络的度的最小值为:0 4线路网络的度的平均值为:55.41423948220065 5

1import xlrd 2import matplotlib.pyplot as plt 3import pandas as pd 4import matplotlib as mpl 5import collections 6 7df = pd.read_excel("site_information.xlsx") 8# 用pandas的操作去重   得到每条线路的名称 9loc = df['线路名称'].unique() 10# 得到每一条线路名称的列表 11line_list = list(loc) 12print(line_list) 13 14# 打开Excel表格 15data = xlrd.open_workbook("site_information.xlsx") 16print(data)   # <xlrd.book.Book object at 0x000001F1111C38D0> 在内存中 17# 获取特定Sheet  索引为0  也就是第一个表 18table = data.sheets()[0]  # 从零开始 19# 每条线路对应有哪些站点  字典推导式 20site_dic = {k: [] for k in line_list} 21site_list = [] 22for i in range(1, table.nrows): 23    # 每一行的数据   返回的是一个列表 24    x = table.row_values(i) 25    if x[1] == "0": 26        # 上行   站点数据  每条线路对应有哪些站点 添加进列表 27        site_dic[x[0]].append(x[3]) 28        site_list.append(x[3]) 29    else: 30        continue 31print(len(site_dic))   # 618条线路 32print(len(site_list))  # 15248条站点数据 33# 先初始化一个统计每个节点的度的列表  与线路名称列表里的索引一一对应 34node_count = [* 0 for m in range(len(line_list))] 35# 以每条线路为一个节点  线路名称为键      值为一个列表  里面包含每条路线上行经过的所有站点 36sites = [site for site in site_dic.values()] 37print(sites) 38for j in range(len(sites)):  # 类似冒泡法排序  比较多少趟 39    for k in range(j, len(sites) - 1):  # 每趟比较后  往后推一个  直到比较完  和防止越界 40        if len(sites[j]) > len(sites[+ 1]): 41            for x in sites[j]: 42                if x in sites[j] and x in sites[+ 1]:   # 只要这两条线路有公共站点  节点度数加1 43                    node_count[j], node_count[+ 1] = node_count[j] + 1, node_count[+ 1] + 1 44                    break   # 两条线路对应在列表索引的值加1   这两条线的比较结束 45        else: 46            for x in sites[+ 1]: 47                if x in sites[j] and x in sites[+ 1]:   # 只要这两条线路有公共站点  节点度数加1 48                    node_count[j], node_count[+ 1] = node_count[j] + 1, node_count[+ 1] + 1 49                    break   # 两条线路对应在列表索引的值加1   这两条线的比较结束 50print(node_count) 51# 节点编号 与 节点的度数索引对应 52node_number = [for y in range(len(node_count))] 53# 线性网络度的最大值   175 54print(max(node_count)) 55 56# 设置大小  图的像素 57# 设置字体   matplotlib 不支持显示中文  自己本地设置 58plt.figure(figsize=(10, 6), dpi=150) 59mpl.rcParams['font.family'] = 'SimHei' 60 61# 分析节点的度K的概率分布 62# 统计节点的度为K的 分别有多少个 63node_count = collections.Counter(node_count) 64node_count = node_count.most_common() 65# 点 66node_dic = {_k: _v for _k, _v in node_count} 67# 按键从小到大排序   得到一个列表  节点的度 68sort_node = sorted(node_dic) 69# 按顺序得到键对应的值   即有相同节点的度的个数 70sort_num = [node_dic[q] for q in sort_node] 71# 概率分布中度平均值  总的度数加起来  / 个数 72print(sum(sort_node)/len(sort_node)) 73# 概率分布中最大的度值   也就个数最多那个 74print(f"概率分布中概率最大的度值为:{max(sort_num)}") 75 76probability = [s1 / sum(sort_num) for s1 in sort_num]   # 概率分布 77print(probability) 78 79# 天津市公交线路节点概率分布图像 80plt.bar(sort_node, probability, color="red") 81# 添加描述信息 82plt.xlabel("节点的度K") 83plt.ylabel("节点度为K的概率P(K)") 84plt.title("线路网络中节点度的概率分布", fontsize=15) 85 86plt.savefig("线路网络中节点度的概率分布.png") 87plt.show() 88

结果如下:

1概率分布中概率最大的度值为:16 2

天津市公交线路网络的度分布如上图所示,本文收集的天津市线路网络共有 618 条线路组成,线路网络的度的最大值为175。概率分布中概率最大的度值为16度平均值为55.41,表明天津市公交网络提供的换乘机会较多,使得可达性较高。其中概率较大的度值大多集中在 7~26 之间,使得节点强度分布相对来说不够均匀,造成天津市很多路段公交线路较少,少数路段经过线路过于密集,造成资源的浪费。

聚类系数是研究节点邻居之间的连接紧密程度,因此不必考虑边的方向。对于有向图,将其当成无向图来处理。网络聚类系数大,表明网络中节点与其附近节点之间的连接紧密度程度高,即与实际站点之间的公交线路连接密集。计算得到天津公交复杂网络的聚类系数为0.091,相对其他城市较低。

根据公式:同规模的随机网络聚集系数约为0.00044,进一步体现了网络的小世界特性

Python代码如下:

1import xlrd 2import matplotlib.pyplot as plt 3import pandas as pd 4import matplotlib as mpl 5 6 7# 读取数据 8df = pd.read_excel("site_information.xlsx") 9# 用pandas的操作去重   得到每条线路的名称 10loc = df['线路名称'].drop_duplicates() 11# 得到每一条线路名称的列表  按照Excel表里以次下去的顺序 12line_list = list(loc) 13print(line_list) 14 15# 打开Excel表格 16data = xlrd.open_workbook("site_information.xlsx") 17print(data)   # <xlrd.book.Book object at 0x000001F1111C38D0> 在内存中 18# 获取特定Sheet  索引为0  也就是第一个表 19table = data.sheets()[0]  # 从零开始 20# 每条线路对应有哪些站点  字典推导式 21site_dic = {k: [] for k in line_list} 22site_list = [] 23for i in range(1, table.nrows): 24    # 每一行的数据   返回的是一个列表 25    x = table.row_values(i) 26    if x[1] == "0": 27        # 只取上行站点数据  每条线路对应有哪些站点 添加进列表 28        site_dic[x[0]].append(x[3]) 29        site_list.append(x[3]) 30    else: 31        continue 32print(len(site_dic))   # 618条线路 33print(len(site_list))  # 15248条站点数据 34# 先初始化一个统计每个节点的度的列表  与线路名称列表里的索引一一对应 35node_count = [* 0 for m in range(len(line_list))] 36# 以每条线路为一个节点  线路名称为键      值为一个列表  里面包含每条路线上行经过的所有站点 37sites = [site for site in site_dic.values()] 38print(sites) 39# 统计各节点的度 40for j in range(len(sites) - 1):  # 类似冒泡法排序  比较多少趟 41    for k in range(j, len(sites) - 1):  # 每趟比较后  往后推一个  直到比较完  和防止越界 42        if len(sites[j]) > len(sites[+ 1]): 43            for x in sites[j]: 44                if x in sites[j] and x in sites[+ 1]:   # 只要这两条线路有公共站点  节点度数加1 45                    node_count[j], node_count[+ 1] = node_count[j] + 1, node_count[+ 1] + 1 46                    break   # 两条线路对应在列表索引的值加1   这两条线的比较结束 47        else: 48            for x in sites[+ 1]: 49                if x in sites[j] and x in sites[+ 1]:   # 只要这两条线路有公共站点  节点度数加1 50                    node_count[j], node_count[+ 1] = node_count[j] + 1, node_count[+ 1] + 1 51                    break   # 两条线路对应在列表索引的值加1   这两条线的比较结束 52 53# 找到该节点的邻居节点  邻居节点间实际的边数 54Ei = [] 55# 对每条线路进行找邻接节点  并统计其邻接节点点实际的边数 56for a in range(len(sites)): 57    neighbor = [] 58    if node_count[a] == 0: 59        Ei.append(0) 60        continue 61    if node_count[a] == 1: 62        Ei.append(0) 63        continue 64    for b in range(len(sites)): 65        if a == b:    # 自身  不比 66            continue 67        if len(sites[a]) > len(sites[b]):   # 从站点多的线路里选取站点   看是否有公共站点 68            for x in sites[a]: 69                if x in sites[a] and x in sites[b]:  # 找到邻居节点 70                    neighbor.append(sites[b]) 71                    break 72        else: 73            for x in sites[b]: 74                if x in sites[a] and x in sites[b]:  # 找到邻居节点 75                    neighbor.append(sites[b]) 76                    break 77    # 在邻居节点中判断这些节点的实际边数  又类似前面的方法  判断两两是否相连 78    count = 0 79    for c in range(len(neighbor) - 1): 80        for d in range(c, len(neighbor) - 1):  # 每趟比较后  往后推一个  直到比较完  和防止越界 81            try: 82                if len(sites[c]) > len(sites[+ 1]): 83                    for y in sites[c]: 84                        if y in sites[c] and y in sites[+ 1]:  # 邻居节点这两个也相连 85                            count += 1 86                            break 87                        else: 88                            continue 89                else: 90                    for y in sites[+ 1]: 91                        if y in sites[c] and y in sites[+ 1]:  # 邻居节点这两个也相连 92                            count += 1 93                            break 94                        else: 95                            continue 96            except IndexError: 97                break 98    Ei.append(count) 99 100# 每个节点的邻居节点间实际相连的边数 101print(Ei) 102# 节点编号 与 节点的度数索引对应 103node_number = [for y in range(len(node_count))] 104 105# 设置字体   matplotlib 不支持显示中文  自己本地设置 106mpl.rcParams['font.family'] = 'SimHei' 107# 设置大小  图的像素 108plt.figure(figsize=(10, 6), dpi=150) 109# 公交线路网络的聚类系数分布图像   相邻节点的连通程度 110Ci = [] 111for m in range(len(node_number)): 112    if node_count[m] == 0: 113        Ci.append(0) 114    elif node_count[m] == 1: 115        Ci.append(0) 116 117    else:  # 2 * 该节点邻居节点实际连接边数 / 最大边数 118        Ci.append(2 * Ei[m] / (node_count[m] * (node_count[m] - 1))) 119 120# 各节点邻居节点的连通程度 计算平均聚类系数 121print("天津市公交线路网络平均聚类系数为:{:.4f}".format(sum(Ci) / len(Ci))) 122plt.bar(node_number, Ci, color="blue") 123 124# 添加描述信息 125plt.xlabel("节点编号n") 126plt.ylabel("节点的聚类系数") 127plt.title("线路网络中各节点的聚类系数分布", fontsize=15) 128 129plt.savefig("聚类系数分布.png") 130plt.show() 131

结果如下:

1天津市公交线路网络平均聚类系数为:0.0906 2

参考论文:

基于天津市公共交通网络的复杂性研究

基于复杂网络的城市公交网络拓扑特征及线路连通性分析

-------------------********************************** End **********-------------**-----********-**********************************

往期精彩文章推荐:

欢迎各位大佬点击链接加入群聊【helloworld开发者社区】:https://jq.qq.com/?_wv=1027&k=mBlk6nzX进群交流IT技术热点。

本文转自 https://mp.weixin.qq.com/s/x4QmFeUMbpvPfs0QUHSmtQ,如有侵权,请联系删除。

点赞
收藏

评论区

加载中...

相关推荐

MySQL:[Err] 1292 - Incorrect datetime value: ‘0000-00-00 00:00:00‘ for column ‘CREATE_TIME‘ at row 1

文章目录问题用navicat导入数据时,报错:原因这是因为当前的MySQL不支持datetime为0的情况。解决修改sql\mode:sql\mode:SQLMode定义了MySQL应支持的SQL语法、数据校验等,这样可以更容易地在不同的环境中使用MySQL。全局s

Oracle 分组与拼接字符串同时使用

SELECTT.,ROWNUMIDFROM(SELECTT.EMPLID,T.NAME,T.BU,T.REALDEPART,T.FORMATDATE,SUM(T.S0)S0,MAX(UPDATETIME)CREATETIME,LISTAGG(TOCHAR(

MySQL部分从库上面因为大量的临时表tmp_table造成慢查询

背景描述Time:20190124T00:08:14.70572408:00User@Host:@Id:Schema:sentrymetaLast_errno:0Killed:0Query_time:0.315758Lock_

皕杰报表之UUID

​在我们用皕杰报表工具设计填报报表时,如何在新增行里自动增加id呢?能新增整数排序id吗?目前可以在新增行里自动增加id,但只能用uuid函数增加UUID编码,不能新增整数排序id。uuid函数说明:获取一个UUID,可以在填报表中用来创建数据ID语法:uuid()或uuid(sep)参数说明:sep布尔值,生成的uuid中是否包含分隔符'',缺省为

2020年前端实用代码段,为你的工作保驾护航

有空的时候,自己总结了几个代码段,在开发中也经常使用,谢谢。1、使用解构获取json数据let jsonData  id: 1,status: "OK",data: 'a', 'b';let  id, status, data: number   jsonData;console.log(id, status, number )

Python3:sqlalchemy对mysql数据库操作,非sql语句

Python3:sqlalchemy对mysql数据库操作,非sql语句python3authorlizmdatetime2018020110:00:00coding:utf8'''