Python爬虫——城市公交、地铁站点和线路数据采集

　　本篇博文为博主（whgiser）原创，转载请注明。

　　城市公交、地铁数据反映了城市的公共交通，研究该数据可以挖掘城市的交通结构、路网规划、公交选址等。但是，这类数据往往掌握在特定部门中，很难获取。互联网地图上有大量的信息，包含公交、地铁等数据，解析其数据反馈方式，可以通过Python爬虫采集。闲言少叙，接下来将详细介绍如何使用Python爬虫爬取城市公交、地铁站点和数据。

　　首先，爬取研究城市的所有公交和地铁线路名称，即XX路，地铁X号线。可以通过图吧公交、公交网、8684、本地宝等网站获取，该类网站提供了按数字和字母划分类别的公交线路名称。Python写个简单的爬虫就能采集，可参看WenWu_Both的文章，博主详细介绍了如何利用python爬取8684上某城市所有的公交站点数据。该博主采集了站点详细的信息，包括，但是缺少了公交站点的坐标、公交线路坐标数据。这就让人抓狂了，没有空间坐标怎么落图，怎么分析，所以，本文重点介绍的是站点坐标、线路的获取。

　　以图吧公交为例，点击某一公交后，出现该路公交的详细站点信息和地图信息。博主顿感兴奋，觉得马上就要成功了，各种抓包，发现并不能解析。可能博主技术所限，如有大神能从中抓到站点和线路的坐标信息，请不吝赐教。这TM就让人绝望了啊，到嘴的肥肉吃不了。

　　天无绝人之路，尝试找找某地图的API，发现可以调用，通过解析，能够找到该数据的后台地址。熟悉前端的可以试试，博主前端也就只会个hello world，不献丑了。这是一种思路，实践证明是可以的。

　　地图API可以，那么通过地图抓包呢？打开某图主页，直接输入某市公交名称，通过抓包，成功找到站点和线路信息。具体抓包信息如下图所示，busline_list中详细列出了站点和线路的信息，其中有两条，是同一趟公交不同方向的数据，略有差别，需注意。找到入口过后，接下来爬虫就要大显身手了。

　　主要爬取代码如下，其实也很简单，主函数如下。首先需要构建传入的参数，主要的包括路线名称，城市编码，地理范围，缩放尺度。地理范围可以通过坐标拾取器获取，参数经url编码后，发送请求，判断返回数据是否符合要求（注：可能该线路地图上停运或不存在，也可能是访问速度过快，反爬虫机制需要人工验证，博主爬取的时候碰到过，所以后面设置了随机休眠）。接下来，就是解析json数据了。代码中的extratStations和extractLine，就是提取需要的字段，怎么样，是不是很简单。最后，就是保存了，站点和路线分别存储。

 def main():

     df = pd.read_excel("线路名称.xlsx",)

     BaseUrl = "https://ditu.amap.com/service/poiInfo?query_type=TQUERY&pagesize=20&pagenum=1&qii=true&cluster_state=5&need_utd=true&utd_sceneid=1000&div=PC1000&addr_poi_merge=true&is_classify=true&"

     for bus in df[u"线路"]:

         params = {

             'keywords':'11路',

             'zoom': '',

             'city':'',

             'geoobj':'107.623|33.696|109.817|34.745'

         }

         print(bus)

         paramMerge = urllib.parse.urlencode(params)

         #print(paramMerge)

         targetUrl = BaseUrl + paramMerge

         stationFile = "./busStation/" + bus + ".csv"

         lineFile = "./busLine/" + bus + ".csv"

         req = urllib.request.Request(targetUrl)

         res = urllib.request.urlopen(req)

         content = res.read()

         jsonData = json.loads(content)

         if (jsonData["data"]["message"]) and jsonData["data"]["busline_list"]:

             busList = jsonData["data"]["busline_list"] ##busline 列表

             busListSlt = busList[0] ## busList共包含两条线，方向不同的同一趟公交,任选一趟爬取

             busStations = extratStations(busListSlt)

             busLine = extractLine(busListSlt)

             writeStation(busStations, stationFile)

             writeLine(busLine, lineFile)

             sleep(random.random() * random.randint(0,7) + random.randint(0,5)) #设置随机休眠

         else:

             continue

　　附上博主的解析函数：

 def extratStations(busListSlt):

     busName = busListSlt["name"]

     stationSet = []

     stations = busListSlt["stations"]

     for bs in stations:

         tmp = []

         tmp.append(bs["station_id"])

         tmp.append(busName)

         tmp.append(bs["name"])

         cor = bs["xy_coords"].split(";")

         tmp.append(cor[0])

         tmp.append(cor[1])

         wgs84cor1 = gcj02towgs84(float(cor[0]),float(cor[1]))

         tmp.append(wgs84cor1[0])

         tmp.append(wgs84cor1[1])

         stationSet.append(tmp)

     return stationSet

 def extractLine(busListSlt):

     ## busList共包含两条线，备注名称

     keyName = busListSlt["key_name"]

     busName = busListSlt["name"]

     fromName = busListSlt["front_name"]

     toName = busListSlt["terminal_name"]

     lineSet = []

     Xstr = busListSlt["xs"]

     Ystr = busListSlt["ys"]

     Xset = Xstr.split(",")

     Yset = Ystr.split(",")

     length = len(Xset)

     for i in range(length):

         tmp = []

         tmp.append(keyName)

         tmp.append(busName)

         tmp.append(fromName)

         tmp.append(toName)

         tmp.append(Xset[i])

         tmp.append(Yset[i])

         wgs84cor2 = gcj02towgs84(float(Xset[i]),float(Yset[i]))

         tmp.append(wgs84cor2[0])

         tmp.append(wgs84cor2[1])

         lineSet.append(tmp)

     return lineSet

　　爬虫采集原始数据如下：

　　以下是某一条公交站点和线路的处理后的数据展示。由于不同的地图商采用不同的坐标系，会有不同程度的偏差，需要坐标纠偏。下一步，博主将详细介绍如何批量将这些站点和坐标进行坐标纠正和矢量化。

Python爬虫——城市公交、地铁站点和线路数据采集的更多相关文章

python爬虫---污言污语网站数据采集
代码: import requests from lxml import etree headers = { "user-agent": "Mozilla/5.0 (Wi ...
利用python爬取城市公交站点
利用python爬取城市公交站点页面分析 https://guiyang.8684.cn/line1 爬虫我们利用requests请求,利用BeautifulSoup来解析,获取我们的站点数据.得 ...
python爬虫成长之路（一）：抓取证券之星的股票数据
获取数据是数据分析中必不可少的一部分,而网络爬虫是是获取数据的一个重要渠道之一.鉴于此,我拾起了Python这把利器,开启了网络爬虫之路. 本篇使用的版本为python3.5,意在抓取证券之星上当天所 ...
Python爬虫实战（4）：豆瓣小组话题数据采集—动态网页
1, 引言注释:上一篇<Python爬虫实战(3):安居客房产经纪人信息采集>,访问的网页是静态网页,有朋友模仿那个实战来采集动态加载豆瓣小组的网页,结果不成功.本篇是针对动态网页的数据 ...
Python爬虫之路——简单网页抓图升级版（添加多线程支持）
转载自我的博客:http://www.mylonly.com/archives/1418.html 经过两个晚上的奋斗.将上一篇文章介绍的爬虫略微改进了下(Python爬虫之路--简单网页抓图),主要 ...
Python 爬虫从入门到进阶之路（八）
在之前的文章中我们介绍了一下 requests 模块,今天我们再来看一下 Python 爬虫中的正则表达的使用和 re 模块. 实际上爬虫一共就四个主要步骤: 明确目标 (要知道你准备在哪个范围或者网 ...
Python 爬虫从入门到进阶之路（二）
上一篇文章我们对爬虫有了一个初步认识,本篇文章我们开始学习 Python 爬虫实例. 在 Python 中有很多库可以用来抓取网页,其中内置了 urllib 模块,该模块就能实现我们基本的网页爬取. ...
[python]爬虫学习（一）
要学习Python爬虫,我们要学习的共有以下几点(python2): Python基础知识 Python中urllib和urllib2库的用法 Python正则表达式 Python爬虫框架Scrapy ...
[python爬虫] Selenium定向爬取海量精美图片及搜索引擎杂谈
我自认为这是自己写过博客中一篇比较优秀的文章,同时也是在深夜凌晨2点满怀着激情和愉悦之心完成的.首先通过这篇文章,你能学到以下几点: 1.可以了解Python简单爬取图片的一些思路和方法 ...

随机推荐

windows环境Caffe安装配置步骤（无GPU）及mnist训练
在硕士第二年,义无反顾地投身到了深度学习的浪潮中.从之前的惯性导航转到这个方向,一切从头开始,在此,仅以此文记录自己的打怪之路. 最初的想法是动手熟悉Caffe,考虑到直接上手Ubuntu会有些难度, ...
【Win 10 应用开发】MIDI 音乐合成——音符消息篇
在上一篇中,老周介绍了一些乐理知识,有了那些常识后,进行 MIDI 编程就简单得多了.尽管微软已经把 API 封装好,用起来也很简单,但是,如果你没有相应的音乐知识基础,你是无法进行 MIDI 编程的 ...
Docker 运行Tensorboard 和 jupyter的正确方法
Docker 运行Tensorboard 和 jupyter的正确方法网上找了很多方法都是jupyter 运行正常但不知道如何打开Tensorboard.折腾了很久,实验很多中方法最终找到了一个正确 ...
orale 查询每年、每月、每日统计量的sql语句
每年 select to_char(createtime, 'YYYY') 年, count(*) from table group by to_char(createtime, 'YYYY'); ...
纯CSS实现图片
在Web开发中.通过CSS代码也能够实现一些简单的图片,当然,假设你有耐心,也能够实现较为复杂的图片噢. 那么请问为什么有图片不去用而须要用CSS来实现呢?一是由于性能的原因,图片带给server和c ...
Matlab 2014b For Mac安装破解
1.Matlab 2014b 的安装和破解文件下载: 安装文件:http://www.cncrk.com/downinfo/80718.html 破解文件:http://pan.baidu.com/s ...
F02 金融学第二定律资金的积聚
美国南北战争,北方取胜的关键在于发行了债券,从而积聚了资金,提升了北方军队战斗力. 纽约的逆袭,得益于伊利运河的修建,而伊利运河的建造需要的资金,全靠债券发行积聚的资金. 聚积起来的资金,往往决定了重 ...
XMind常用快捷方式汇总
快捷键(Windows) 快捷键(Mac) 描述 Ctrl+N Command+N 建立新工作簿 Ctrl+O Command+O 开启工作簿 Ctrl+S Command+S 储存目前工作簿 Ctr ...
用JAVA自己画一张二维码
我们都知道,最近2年移动支付在中国堪称新四大发明之一. 二维码无处不在,特别是最近的支付宝扫码领红包,微信,qq,到处在发,阿里有点攻占腾讯移动支付市场的势头啊~博主忽然就对二维码是怎么画的有了点好奇 ...
如何在MAC上安装SSHFS
找了半天,试了各种方法,最后一种可行的方法. macOS 版本 10.12.6 具体看下面的说明: 安装Fuse 下载 osxfuse-3.6.3.dmg 并且安装. 链接安装sshfs 下载ssh ...

Python爬虫——城市公交、地铁站点和线路数据采集

Python爬虫——城市公交、地铁站点和线路数据采集的更多相关文章

随机推荐

热门专题