菜鸟学IT之python网页爬取多页爬取

作业来源：https://edu.cnblogs.com/campus/gzcc/GZCC-16SE1/homework/3002

0.从新闻url获取点击次数，并整理成函数

newsUrl
newsId(re.search())
clickUrl(str.format())
requests.get(clickUrl)
re.search()/.split()
str.lstrip(),str.rstrip()
int
整理成函数
获取新闻发布时间及类型转换也整理成函数

import re

url='http://news.gzcc.cn/html/2019/xiaoyuanxinwen_0320/11029.html'

clickurl='http://oa.gzcc.cn/api.php?op=count&id=11029&modelid=80'

re.match('http://news.gzcc.cn/html/2019/xiaoyuanxinwen_0320/(.*).html',url)

re.match('http://news.gzcc.cn/html/2019/xiaoyuanxinwen_0320/(.*).html',url).groups(0)

re.search('/(\d*).html',url).groups(1)

re.findall('(\d+)',url)

结果如下：

1.从新闻url获取新闻详情：字典,anews

import requests

from bs4 import BeautifulSoup

from datetime import datetime

import re

def click(url):

    id=re.findall('(\d{1,5})',url)[-1]

    clickUrl = 'http://oa.gzcc.cn/api.php?op=count&id=11029&modelid=80'.format(id)

    resClick = requests.get(clickUrl)

    newsClick = int(resClick.text.split('.html')[-1].lstrip("('").rstrip("');"))

    return newsClick

def newsdt(showinfo):

    newsDate = showinfo.split()[0].split(':')[1]

    newsTime = showinfo.split()[1]

    newsDT = newsDate+' '+newsTime

    dt = datetime.strptime(newsDT, '%Y-%m-%d %H:%M:%S')

    return dt

def anews(url):

    newsDetail = {}

    res = requests.get(url)

    res.encoding ='utf-8'

    soup = BeautifulSoup(res.text,'html.parser')

    newsDetail['nenewsTitle'] =soup.select('.show-title')[0].text

    showinfo = soup.select('.show-info')[0].text

    newsDetail['newsDT']=newsdt(showinfo)

    newsDetail['newsClick'] =click(newsUrl)

    return newsDetail

newsUrl='http://news.gzcc.cn/html/2005/xiaoyuanxinwen_0710/4.html'

anews(newsUrl)

结果：

2.从列表页的url获取新闻url：列表append(字典) alist

获取列表数据

listurl = 'http://news.gzcc.cn/html/xiaoyuanxinwen/'

res = requests.get(listurl)

res.encoding ='utf-8'

soupn = BeautifulSoup(res.text,'html.parser')  

# a=soupn.select('a')

soupn

2.过滤过滤数据，只获取列表的新闻信息

for news in soupn.select('li'):

    if news.select('.news-list-title'):

        print(news)

        newsUrl = news.a['href']

        print(news.a['href'])

3.获取整页信息

def alist(listUrl):

    res = requests.get(listurl)

    res.encoding ='utf-8'

    soup = BeautifulSoup(res.text,'html.parser')

    newsList =[]

    for news in soupn.select('li'):

        if len(news.select('.news-list-title'))>0:

            newsUrl = news.select('a')[0]['href']

            newsDesc = news.select('.news-list-description')[0].text

            newsDict = anews(newsUrl)

            newsDict['newsUrl'] = newsUrl

            newsDict['description'] = newsDesc

            newsList.append(newsDict)

    return newsList

listUrl = 'http://news.gzcc.cn/html/xiaoyuanxinwen/'

alist(listUrl)

3.生成所页列表页的url并获取全部新闻：列表extend(列表) allnews

*每个同学爬学号尾数开始的10个列表页

获取多页信息

截取以学号尾数开始的10个列表页

listUrl = 'http://news.gzcc.cn/html/xiaoyuanxinwen/'

allnews = alist(listUrl)

for i in range(7,17): #学号为7，截取10页

    listUrl = 'http://news.gzcc.cn/html/xiaoyuanxinwen/{}.html'.format(i)

    allnews.extend(alist(listUrl))

len(allnews)

4.设置合理的爬取间隔

import time

import random

time.sleep(random.random()*3)

import time

import random

listUrl = 'http://news.gzcc.cn/html/xiaoyuanxinwen/'

allnews = alist(listUrl)

for i in range(1,170): #学号为7，截取10页

    listUrl = 'http://news.gzcc.cn/html/xiaoyuanxinwen/{}.html'.format(i)

    allnews.extend(alist(listUrl))

    time.sleep(random.random()*3) #设置每3秒爬取一次

print(alist(listUrl)) len(allnews)

5.用pandas做简单的数据处理并保存

保存到csv或excel文件

newsdf.to_csv(r'F:\duym\爬虫\gzccnews.csv')

使用pandas函数整理爬取的数据

列表的形式打印数据

显示 “newsClick” 游览次数大于2337的新闻

生成csv文件

newsdf.to_csv(r'E:\gzcc.csv')

菜鸟学IT之python网页爬取多页爬取的更多相关文章

菜鸟学IT之python网页爬取初体验
作业来源:https://edu.cnblogs.com/campus/gzcc/GZCC-16SE1/homework/2881 1. 简单说明爬虫原理爬虫简单来说就是通过程序模拟浏览器放松请求站 ...
python实现一个栏目的分页抓取列表页抓取
python实现一个栏目的分页抓取列表页抓取 #!/usr/bin/env python # coding=utf-8 import requests from bs4 import Beautifu ...
菜鸟学IT之python词云初体验
作业来源:https://edu.cnblogs.com/campus/gzcc/GZCC-16SE1/homework/2822 1. 下载一长篇中文小说. 2. 从文件读取待分析文本. txt = ...
python网页爬虫开发之五-反爬
1.头信息检查是否频繁相同随机产生一个headers, #user_agent 集合 user_agent_list = [ 'Mozilla/5.0 (Windows NT 6.1; WOW64 ...
Python爬虫学习三------requests+BeautifulSoup爬取简单网页
第一次第一次用MarkDown来写博客,先试试效果吧! 昨天2018俄罗斯世界杯拉开了大幕,作为一个伪球迷,当然也得为世界杯做出一点贡献啦. 于是今天就编写了一个爬虫程序将腾讯新闻下世界杯专题的相关新 ...
初识python 之爬虫：使用正则表达式爬取“糗事百科 - 文字版”网页数据
初识python 之爬虫:使用正则表达式爬取"古诗文"网页数据的兄弟篇. 详细代码如下: #!/user/bin env python # author:Simple-Sir ...
初识python 之爬虫：使用正则表达式爬取“古诗文”网页数据
通过requests.re(正则表达式) 爬取"古诗文"网页数据. 详细代码如下: #!/user/bin env python # author:Simple-Sir # tim ...
Python网页解析库：用requests-html爬取网页
Python网页解析库:用requests-html爬取网页 1. 开始 Python 中可以进行网页解析的库有很多,常见的有 BeautifulSoup 和 lxml 等.在网上玩爬虫的文章通常都是 ...
python使用requests库爬取网页的小实例：爬取京东网页
爬取京东网页的全代码: #爬取京东页面的全代码 import requests url="https://item.jd.com/2967929.html" try: r=requ ...

随机推荐

Java数据结构和算法 - 高级排序
希尔排序 Q: 什么是希尔排序? A: 希尔排序因计算机科学家Donald L.Shell而得名,他在1959年发现了希尔排序算法. A: 希尔排序基于插入排序,但是增加了一个新的特性,大大地提高了插 ...
01 JVM 从入门到实战 | 什么是 JVM
什么是 JVM 先来看下百度百科的解释: JVM 是 Java Virtual Machine(Java 虚拟机)的缩写,JVM 是一种用于计算设备的规范,它是一个虚构出来的计算机,是通过在实际的计算 ...
LeetCode算法题-Robot Return to Origin（Java实现）
这是悦乐书的第281次更新,第298篇原创 01 看题和准备今天介绍的是LeetCode算法题中Easy级别的第149题(顺位题号是657).在2D平面上有一个从位置(0,0)开始的机器人.给定其移 ...
程序员从宏观、微观角度浅析JVM虚拟机！
1.问题 1.JAVA文本文件如何被翻译成CLASS二进制文件? 2.如何理解CLASS文件的组成结构? 3.虚拟机如何加载使用类文件的生命周期? 4.虚拟机系列诊断工具如何使用? 5.虚拟机内存淘汰 ...
消除点击连接或者按钮或者执行onclick事件时出现的边框
css中添加 *:not(input) { font-family: sans-serif; font-size-adjust: none; -webkit-user-select: none; -w ...
service相关
本篇仍以问题为驱动一.什么时Service? Service是Android程序中四大基础组件之一,它和Activity一样都是Context的子类,只不过它没有UI界面,是在后台运行的组件.Ser ...
接口自动化：HttpClient + TestNG + Java(二) - 第一个接口测试：get请求
在上一篇中,我们搭建好了HttpClient + TestNG + Java的自动化接口测试环境,这一篇我们就赶紧开始编写我们的第一个接口测试用例. 本篇会对问题解决的思路进行更详尽的阐述. 2.1 ...
Entity Framework 查漏补缺（一）
明确EF建立的数据库和对象之间的关系 EF也是一种ORM技术框架, 将对象模型和关系型数据库的数据结构对应起来,开发人员不在利用sql去操作数据相关结构和数据.以下是EF建立的数据库和对象之间关系关 ...
vs2017和vs2019专业版和企业版
步骤:打开vs2017,依次点击--->帮助----->注册产品专业版: Professional: KBJFW-NXHK6-W4WJM-CRMQB-G3CDH 企业版: Enterpr ...
## 本篇文章对linux常用的一些命令做一下总结,如有需要补充以及不懂得地方,请在下方留言适合于linux初学者,以及对命令掌握不牢的用来备忘
本篇文章对linux常用的一些命令做一下总结,如有需要补充以及不懂得地方,请在下方留言适合于linux初学者,以及对命令掌握不牢的用来备忘一,磁盘管理1.显示当前目录位置 pwd2.切换目录 cd ...

菜鸟学IT之python网页爬取多页爬取

菜鸟学IT之python网页爬取多页爬取的更多相关文章

随机推荐

热门专题