3.15学习总结（Python爬取网站数据并存入数据库）

在官网上下载了Python和PyCharm，并在网上简单的学习了爬虫的相关知识。

结对开发的第一阶段要求：

网上爬取最新疫情数据，并存入到MySql数据库中
在可视化显示数据详细信息

项目代码：

import requests

from bs4 import BeautifulSoup

import json

import time

from pymysql import *

def mes():

    url = 'https://ncov.dxy.cn/ncovh5/view/pneumonia?from=timeline&isappinstalled=0'  #请求地址

    headers = {'user-agent':'Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/76.0.3809.87 Safari/537.36 SLBrowser/6.0.1.6181'}#创建头部信息

    resp =  requests.get(url,headers = headers)  #发送网络请求

    content=resp.content.decode('utf-8')

    soup = BeautifulSoup(content, 'html.parser')

    listA = soup.find_all(name='script',attrs={"id":"getAreaStat"})

    account =str(listA)

    mes = account.replace('[<script id="getAreaStat">try { window.getAreaStat = ', '')

    mes=mes.replace('}catch(e){}</script>]','')

    #mes=account[52:-21]

    messages_json = json.loads(mes)

    print(messages_json)

    times=time.strftime('%Y-%m-%d %H:%M:%S', time.localtime(time.time()))

    print(times)

    provinceList=[]

    cityList=[]

    lenth=total()

    con=len(messages_json)+lenth#算出数据库已有的条数+今天省份的条数，才是城市的开始id

    for item in messages_json:

        lenth+=1

        provinceName=item['provinceName']

        confirmedCount=item['confirmedCount']

        suspectedCount=item['suspectedCount']

        curedCount=item['curedCount']

        deadCount=item['deadCount']

        cities=item['cities']

        provinceList.append((lenth,times,provinceName,None,confirmedCount,suspectedCount,curedCount,deadCount))

        for i in cities:

            con+=1

            provinceName = item['provinceName']

            cityName=i['cityName']

            confirmedCount = i['confirmedCount']

            suspectedCount = item['suspectedCount']

            curedCount = i['curedCount']

            deadCount = i['deadCount']

            cityList.append((con,times,provinceName,cityName,confirmedCount,suspectedCount,curedCount,deadCount))

    insert(provinceList,cityList)

def insert(provinceList, cityList):

    provinceTuple=tuple(provinceList)

    cityTuple=tuple(cityList)

    cursor = db.cursor()

    sql = "insert into info values (%s,%s,%s,%s,%s,%s,%s,%s) "

    try:

        cursor.executemany(sql,provinceTuple)

        print("插入成功")

        db.commit()

    except Exception as e:

        print(e)

        db.rollback()

    try:

        cursor.executemany(sql,cityTuple)

        print("插入成功")

        db.commit()

    except Exception as e:

        print(e)

        db.rollback()

    cursor.close()

def total():

    sql= "select * from info"

    cursor = db.cursor()

    try:

        cursor.execute(sql)

        results = cursor.fetchall()

        lenth = len(results)

        db.commit()

        return lenth

    except:

        print('执行失败，进入回调1')

        db.rollback()

# 连接数据库的方法

def connectDB():

    try:

        db = connect(host='localhost', port=3306, user='root', password='156132', db='world',charset='utf8')

        print("数据库连接成功")

        return db

    except Exception as e:

        print(e)

    return NULL

if __name__ == '__main__':

    db=connectDB()

    mes()

效果展示：

代码询问的同学，博客园地址：https://www.cnblogs.com/Arisf/

两位学长有详细讲解：https://www.cnblogs.com/studya/p/13062641.html https://www.cnblogs.com/dazhi151/p/12461830.html

3.15学习总结（Python爬取网站数据并存入数据库）的更多相关文章

python爬取网站数据
开学前接了一个任务,内容是从网上爬取特定属性的数据.正好之前学了python,练练手. 编码问题因为涉及到中文,所以必然地涉及到了编码的问题,这一次借这个机会算是彻底搞清楚了. 问题要从文字的编码讲 ...
python爬取网站数据保存使用的方法
这篇文章主要介绍了使用Python从网上爬取特定属性数据保存的方法,其中解决了编码问题和如何使用正则匹配数据的方法,详情看下文编码问题因为涉及到中文,所以必然地涉及到了编码的问题,这一次借这 ...
Python 爬取网站数据
一.使用request库实现批量下载HTML 二.使用BeautifulSoup库实现html解析官网:https://beautifulsoup.readthedocs.io/zh_CN/v4.4 ...
毕设之Python爬取天气数据及可视化分析
写在前面的一些P话:(https://jq.qq.com/?_wv=1027&k=RFkfeU8j) 天气预报我们每天都会关注,我们可以根据未来的天气增减衣物.安排出行,每天的气温.风速风向. ...
Python爬取房产数据，在地图上展现！
小伙伴,我又来了,这次我们写的是用python爬虫爬取乌鲁木齐的房产数据并展示在地图上,地图工具我用的是 BDP个人版-免费在线数据分析软件,数据可视化软件 ,这个可以导入csv或者excel数据. ...
利用linux curl爬取网站数据
看到一个看球网站的以下截图红色框数据,想爬取下来,通常爬取网站数据一般都会从java或者python爬取,但本人这两个都不会,只会shell脚本,于是硬着头皮试一下用shell爬取,方法很笨重,但旨在 ...
如何使用Python爬取基金数据，并可视化显示
本文的文字及图片来源于网络,仅供学习.交流使用,不具有任何商业用途,版权归原作者所有,如有问题请及时联系我们以作处理以下文章来源于Will的大食堂,作者打饭大叔前言美国疫情越来越严峻,大选也进入 ...
Python学习-使用Python爬取陈奕迅新歌《我们》网易云热门评论
<后来的我们>上映也有好几天了,一直没有去看,前几天还爆出退票的事件,电影的主题曲由陈奕迅所唱,特地找了主题曲<我们>的MV看了一遍,还是那个感觉.那天偶然间看到Python中 ...
python入门学习之Python爬取最新笔趣阁小说
Python爬取新笔趣阁小说,并保存到TXT文件中我写的这篇文章,是利用Python爬取小说编写的程序,这是我学习Python爬虫当中自己独立写的第一个程序,中途也遇到了一些困难,但是最后 ...

随机推荐

git 强制放弃本地修改（新增、删除文件）
本地修改了一些文件,其中包含修改.新增.删除的. 不需要了,想要丢弃,于是做了git check -- .操作,但是只放弃了修改的文件,新增和删除的仍然没有恢复. 于是百度了下,使用如下命令: git ...
Golang语言系列-11-goroutine并发
goroutine 并发概念 package main import ( "fmt" "time" ) /* [Go语言中的并发编程 goroutine] [ ...
SpringBoot开发十四-过滤敏感词
项目需求-过滤敏感词利用 Tire 树实现过滤敏感词定义前缀树,根据敏感词初始化前缀树,编写过滤敏感词的方法代码实现我们首先把敏感词存到一个文件 sensitive.txt: 赌博嫖娼吸毒 ...
Pikachu-php反序列化、XXE、SSRF模块
一.PHP反序列化理解这个漏洞需要明白php中的两个函数,serialize(),unserialize() 1)序列化serialize()序列化说通俗点就是把一个对象变成可以传输的字符串,比如下 ...
Java - Enum 枚举类型
目录前言应用定义基本Enum特性 Enum的静态导入 Enum中添加新方法 Switch语句中的Enum Enum的继承 EnumSet的使用 EnumMap的使用常量相关方法枚举值向枚举 ...
SpringBoot开启异步方法
在启动类上加入@EnableAsync 异步方法 /** * 简单文本邮件 * @param to 收件人 * @param subject 主题 * @param content 内容 */ @As ...
Spring-Boot注入自定义properties文件配置
创建wzq.properties wzq.properties注入User实体类中 @PropertySource(value = "classpath:wzq.properties&quo ...
NGINX Ingress控制器1.0.0升级迁移文档(翻译)
Ingress 是什么 Ingress 是对k8s集群中服务的外部访问进行管理的 API 对象,典型的访问方式是 HTTP. Ingress 可以提供负载均衡.SSL 终结和基于名称的虚拟托管. 最近 ...
Spring详解（十）加载配置文件
在项目中有些参数经常需要修改,或者后期可能会有改动时,那我们最好把这些参数放到properties文件中,在源代码中读取properties里面的配置,这样后期只需要改动properties文件即可, ...
sizeof()和 strlen()的区别 --- 个人笔记
在学习C语言和linux的时候,遇到了一些常见问题.题目,有些很简单,有些容易出错,本人水平有限,未免会出错,今天有时间,就将以前做的笔记,一一拿出来,写写blog. sizeof()和 strlen ...

3.15学习总结（Python爬取网站数据并存入数据库）

3.15学习总结（Python爬取网站数据并存入数据库）的更多相关文章

随机推荐

热门专题