python 爬虫系列07-天气爬虫

看天气

import requests

from bs4 import BeautifulSoup

ALL_DATA = []

def parse_page(url):

    headers = {

        'User-Agent': "Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/68.0.3440.84 Safari/537.36"

    }

    response = requests.get(url, headers=headers)

    text = response.content.decode('utf-8')

    soup = BeautifulSoup(text, 'html5lib')

    conMidtab = soup.find('div', class_='conMidtab')

    tables = conMidtab.find_all('table')

    for table in tables:

        trs = table.find_all('tr')[2:]

        for index,tr in enumerate(trs):

            tds = tr.find_all('td')

            city_td = tds[0]

            if index == 0:

                city_td = tds[1]

            city = list(city_td.stripped_strings)[0]

            temp_td = tds[-2]

            min_temp = list(temp_td.stripped_strings)[0]

            ALL_DATA.append({"城市 ":city,"温度 ":int(min_temp)})

          #  print("城市: %s ,温度%s℃ " % (city,int(min_temp)))

def main():

    urls = {

        'http://www.weather.com.cn/textFC/hb.shtml',

        'http://www.weather.com.cn/textFC/db.shtml',

        'http://www.weather.com.cn/textFC/hd.shtml',

        'http://www.weather.com.cn/textFC/hz.shtml',

        'http://www.weather.com.cn/textFC/hn.shtml',

        'http://www.weather.com.cn/textFC/xb.shtml',

        'http://www.weather.com.cn/textFC/xn.shtml',

        'http://www.weather.com.cn/textFC/gat.shtml'

    }

    for url in urls:

        parse_page(url)

    ALL_DATA.sort(key=lambda data:data['min_temp'])

    print(ALL_DATA)

if __name__ == "__main__":

    main()

python 爬虫系列07-天气爬虫的更多相关文章

java爬虫系列第一讲-爬虫入门
1. 概述 java爬虫系列包含哪些内容? java爬虫框架webmgic入门使用webmgic爬取 http://ady01.com 中的电影资源(动作电影列表页.电影下载地址等信息) 使用web ...
python爬虫系列之初识爬虫
前言我们这里主要是利用requests模块和bs4模块进行简单的爬虫的讲解,让大家可以对爬虫有了初步的认识,我们通过爬几个简单网站,让大家循序渐进的掌握爬虫的基础知识,做网络爬虫还是需要基本的前端的 ...
python 爬虫系列03--职位爬虫
职位爬虫 import requests from lxml import etree cookie = { 'Cookie':'user_trace_token=20181015184304-692 ...
爬虫系列(八) 用requests实现天气查询
这篇文章我们将使用 requests 调用天气查询接口,实现一个天气查询的小模块,下面先贴上最终的效果图 1.接口分析虽然现在网络上有很多免费的天气查询接口,但是有很多网站都是需要注册登陆的,过程比 ...
Python3爬虫系列：理论+实验+爬取妹子图实战
Github: https://github.com/wangy8961/python3-concurrency-pics-02 ,欢迎star 爬虫系列: (1) 理论 Python3爬虫系列01 ...
爬虫系列(三) urllib的基本使用
一.urllib 简介 urllib 是 Python3 中自带的 HTTP 请求库,无需复杂的安装过程即可正常使用,十分适合爬虫入门 urllib 中包含四个模块,分别是 request:请求处理模 ...
爬虫系列(九) xpath的基本使用
一.xpath 简介究竟什么是 xpath 呢?简单来说,xpath 就是一种在 XML 文档中查找信息的语言而 XML 文档就是由一系列节点构成的树,例如,下面是一份简单的 XML 文档: &l ...
爬虫系列(五) re的基本使用
1.简介究竟什么是正则表达式 (Regular Expression) 呢?可以用下面的一句话简单概括: 正则表达式是一组特殊的字符序列,由一些事先定义好的字符以及这些字符的组合形成,常常用于匹 ...
爬虫系列(七) requests的基本使用
一.requests 简介 requests 是一个功能强大.简单易用的 HTTP 请求库,可以使用 pip install requests 命令进行安装下面我们将会介绍 requests 中常用 ...

随机推荐

（转）自制AutoMapper实现DTO到持久层Entity的转换
原文地址:http://www.cnblogs.com/qidian10/p/3173907.html 项目中经常涉及到页面DTO更新,保存到数据库的操作,这就必然牵扯到DTO和持久层对象的转换,常见 ...
通过fork函数创建进程的跟踪，分析linux内核进程的创建
作者:吴乐山东师范大学 <Linux内核分析>MOOC课程http://mooc.study.163.com/course/USTC-1000029000 一.实验过程 1.打开gdb, ...
[转]windows7远程桌面连接失败:发生身份验证错误。要求的函数不受支持
转至:https://jingyan.baidu.com/article/d169e18604ca86436611d821.html 系统升级后出现远程连接报错,“发生身份验证错误.要求的函数不受支持 ...
【C#】LINQ
一.什么是LINQ 长期以来,开发社区形成以下的格局: 1.面向对象与数据访问两个领域长期分裂,各自为政. 2.编程语言中的数据类型与数据库中的数据类型形成两套不同的体系,例如: C#中字符串用str ...
EF Power Tools使用
转载:http://blog.csdn.net/planisnothing/article/details/8532316 1.可以很方便根据数据库生成Code First模式的代码,如果是已有项目转 ...
「HNOI2013」切糕
题目链接戳我 \(Solution\) 对于这道题,我们首先来看看没有\(D\)这个约束的该如何做. 我们考虑构造最小割模型. 其实直接贪心就好了,选出每条路径上的最小值就好了(路径就是将每层的同一 ...
C# LINQ（2）
前一章的代码LINQ都是以select结尾. 之前也说过可以group结尾. 那么怎么使用呢? 还是一样的条件,查询小于5大于0的元素代码: ,,,,,,,,, }; var list = from ...
C# 抽象
好多人将抽象类也作为多态的一种,其实我觉得并不是特别的好. 抽象在C#中是类的一种表现. 如果将类作为多态,那么前面所有的东西不就白费了吗? C#的抽象很简单. 那就是抽象. 基本就是高度抽象. 那 ...
NSUserDefaults数据存储
前言用来保存应用程序设置和属性.用户保存的数据.用户再次打开程序或开机后这些数据仍然存在. 如果往 userDefaults 里存了一个可变数组,取出来的时候这个数组对象就变成了不可变的. NSUs ...
kali linux之操作系统识别/SMB扫描
操作系统识别技术种类很多,好产品采用多种技术结合查看TTL值: linux:64(1-64) 某些unix:255 windows:128(65-128) nmap 被动操作系统识别 p0f ——— ...

python 爬虫系列07-天气爬虫

python 爬虫系列07-天气爬虫的更多相关文章

随机推荐

热门专题