Python爬虫初识

本文章是对网易云课堂中的Python网络爬虫实战课程进行总结。感兴趣的朋友可以观看视频课程。课程地址

爬虫简介

一段自动抓取互联网信息的程序

非结构化数据

没有固定的数据格式，如网页资料。

必须通过ETL(Extract,Transformation,Loading)工具将数据转化为结构化数据才能使用。

工具安装

Anaconda

pip install requests

pip install BeautifulSoup4

pip install jupyter

打开jupyter

jupyter notebook

requests 网络资源截取插件

取得页面

import requests

url = ''

res = requests.get(url)

res.encoding = 'utf-8'

print (res.text)

将网页读进BeautifulSoup中

from bs4 import BeautifulSoup

soup  = BeautifulSoup(res.text, 'html.parser')

print (soup.text)

使用select方法找找出特定标签的HTML元素，可取标签名或id，class返回的值是一个list

select('h1')   select('a')

id = 'thehead' select('#thehead')

alink = soup.select('a')

for link in alink:

    print (link['href'])

例子

1、取得新浪陕西的新闻时间标题和连接

import requests

from bs4 import BeautifulSoup

res = requests.get('http://sx.sina.com.cn/')

res.encoding = 'utf-8'

soup = BeautifulSoup(res.text, 'html.parser')

for newslist in soup.select('.news-list.cur'):

    for news in newslist:

        for li in news.select('li'):

            title = li.select('h2')[0].text

            href = li.select('a')[0]['href']

            time = li.select('.fl')[0].text

            print (time, title, href)

2、获取文章的标题，来源，时间和正文

import requests

from bs4 import BeautifulSoup

from datetime import datetime

res = requests.get('http://sx.sina.com.cn/news/b/2018-06-02/detail-ihcikcew5095240.shtml')

res.encoding = 'utf-8'

soup = BeautifulSoup(res.text, 'html.parser')

h1 = soup.select('h1')[0].text

source = soup.select('.source-time span span')[0].text

timesource = soup.select('.source-time')[0].contents[0].text

date = datetime.strptime(timesource, '%Y-%m-%d %H:%M')

article = []

for p in soup.select('.article-body p')[:-1]:

    article.append(p.text.strip())

' '.join(article)

简写为：

' '.join([p.text.strip() for p in soup.select('.article-body p')[:-1]])

说明：

datatime 包用来格式化时间

[:-1]去除最后一个元素

strip() 移除字符串头尾指定的字符（默认为空格或换行符）

' '.join(article) 将列表以空格连接

3、获取文章的评论数，评论数是通过js写入，不能通过上面的方法获取到，在js下，找到文章评论的js

import requests

import json

comments = requests.get('http://comment5.news.sina.com.cn/cmnt/count?format=js&newslist=sx:comos-hcikcew5095240:0')

jd = json.loads(comments.text.strip('var data ='))

jd['result']['count']['sx:comos-hcikcew5095240:0']['total']

4、将获得评论的方法总结成一个函数

import re

import json

commenturl = 'http://comment5.news.sina.com.cn/cmnt/count?format=js&newslist=sx:comos-{}:0'

def getCommentCounts(url):

    m = re.search('detail-i(.+).shtml' ,url)

    newsid = m.group(1)

    comments = requests.get(commenturl.format(newsid))

    jd = json.loads(comments.text.strip('var data ='))

    return jd['result']['count']['sx:comos-'+newsid+':0']['total']

news = 'http://sx.sina.com.cn/news/b/2018-06-01/detail-ihcikcev8756673.shtml'

getCommentCounts(news)

5、输入地址得到文章的所有信息（标题、时间、来源、正文等）的函数（完整版）

import requests

import json

import re

from bs4 import BeautifulSoup

from datetime import datetime

commenturl = 'http://comment5.news.sina.com.cn/cmnt/count?format=js&newslist=sx:comos-{}:0'

def getCommentCounts(url):

    m = re.search('detail-i(.+).shtml' ,url)

    newsid = m.group(1)

    comments = requests.get(commenturl.format(newsid))

    jd = json.loads(comments.text.strip('var data ='))

    return jd['result']['count']['sx:comos-'+newsid+':0']['total']

def getNewsDetail(newsurl):

    result = {}

    res = requests.get(newsurl)

    res.encoding = 'utf-8'

    soup = BeautifulSoup(res.text, 'html.parser')

    result['title'] = soup.select('h1')[0].text

    result['newssource'] = soup.select('.source-time span span')[0].text

    timesource = soup.select('.source-time')[0].contents[0].text

    result['date'] = datetime.strptime(timesource, '%Y-%m-%d %H:%M')

    result['article'] = ' '.join([p.text.strip() for p in soup.select('.article-body p')[:-1]])

    result['comments'] = getCommentCounts(newsurl)

    return result

news = 'http://sx.sina.com.cn/news/b/2018-06-02/detail-ihcikcew8995238.shtml'

getNewsDetail(news)

Python爬虫初识的更多相关文章

孤荷凌寒自学python第六十七天初步了解Python爬虫初识requests模块
孤荷凌寒自学python第六十七天初步了解Python爬虫初识requests模块 (完整学习过程屏幕记录视频地址在文末) 从今天起开始正式学习Python的爬虫. 今天已经初步了解了两个主要的模块: ...
Python爬虫--初识爬虫
Python爬虫一.爬虫的本质是什么? 模拟浏览器打开网页,获取网页中我们想要的那部分数据浏览器打开网页的过程:当你在浏览器中输入地址后,经过DNS服务器找到服务器主机,向服务器发送一个请求,服务 ...
@1-2初识Python爬虫
初识Python爬虫 Python爬虫(入门+进阶) DC学院环境搭建: Python2与Python3的差异:python2与python3整体差异不大,大多是一些语法上的区别,考虑到py ...
初识python爬虫框架Scrapy
Scrapy,按照其官网(https://scrapy.org/)上的解释:一个开源和协作式的框架,用快速.简单.可扩展的方式从网站提取所需的数据. 我们一开始上手爬虫的时候,接触的是urllib.r ...
初识Python和使用Python爬虫
一.python基础知识了解: 1.特点: Python的语言特性: Python是一门具有强类型(即变量类型是强制要求的).动态性.隐式类型(不需要做变量声明).大小写敏感(var和VAR代表 ...
【Python爬虫】BeautifulSoup网页解析库
BeautifulSoup 网页解析库阅读目录初识Beautiful Soup Beautiful Soup库的4种解析器 Beautiful Soup类的基本元素基本使用标签选择器节点操作 ...
python爬虫系列序
关于爬虫的了解,始于看到这篇分析从数据角度解析福州美食,和上份工作中的短暂参与. 长长短短持续近一年的时间,对其态度越来越明晰,噢原来这就是我想从事的工作. 于是想要系统学习的心理便弥散开来…… 参考 ...
python 爬虫简介
初识Python爬虫互联网简单来说互联网是由一个个站点和网络设备组成的大网,我们通过浏览器访问站点,站点把HTML.JS.CSS代码返回给浏览器,这些代码经过浏览器解析.渲染,将丰富多彩的网页呈现 ...
Python正则表达式初识（二）
前几天给大家分享了Python正则表达式初识(一),介绍了正则表达式中的三个特殊字符“^”.“.”和“*”,感兴趣的伙伴可以戳进去看看,今天小编继续给大家分享Python正则表达式相关特殊字符知识点. ...

随机推荐

900. RLE Iterator
Write an iterator that iterates through a run-length encoded sequence. The iterator is initialized b ...
poj3233 Matrix Power Series（矩阵快速幂）
题目要求的是 A+A2+...+Ak,而不是单个矩阵的幂. 那么可以构造一个分块的辅助矩阵 S,其中 A 为原矩阵,E 为单位矩阵,O 为0矩阵将 S 取幂,会发现一个特性: Sk +1右上角 ...
二，windows下安装memcached服务
window下安装memcached服务的流程如下: 1. 下载memcache的windows稳定版,解压放某个盘下面,比如在c:\memcached 2. 在终端(也即cmd命令界面)下输入 ‘c ...
Sip协议
会话初始协议.SIP是IETF标准进程的一部分,它是在诸如SMTP(简单邮件传送协议)和HTTP(超文本传送协议)基础之上建立起来的(请求应答的通讯模式).微信采用了自主研发的SYNC协议,他通过“握 ...
CentOS7搭建FastDFS V5.11分布式文件系统-第二篇
1.CentOS7 FastDFS搭建前面已下载好了要用到的工具集,下面就可以开始安装了: 如果安装过程中出现问题,可以下载我提供的,当前测试可以通过的工具包: 点这里点这里 1.1 安装libfa ...
Code First 数据迁移转
一.为模型更改设置 Code First 数据迁移 1.工具—>库程序包管理器—>程序包管理器控制台—>输入“Enable-Migrations” 或者 Enable-Migrat ...
IIS 8 配置错误
1) ProtocolException: The remote server returned an unexpected response: (405) Method Not Allowed Th ...
Php开发银行接口之浦发银行
Php开发银行接口之浦发银行 (提示:下面的经验都是按照开发文档一步一步踩坑过来的,但是不能不看开发文档!!!) 第一步:开发准备 1,安装java,百度下载JDK很方便(我自己网盘有,然后配置环境变 ...
解析ASP.NET WebForm和Mvc开发的区别分类： ASP.NET 2013-12-29 01:59 11738人阅读评论(5) 收藏
因为以前主要是做WebFrom开发,对MVC开发并没有太深入的了解.自从来到创新工场的新团队后,用的技术都是自己以前没有接触过的,比如:MVC 和EF还有就是WCF,压力一直很大.在很多问题都是不清楚 ...
关于Class的invokeDynamic指令
(1)java7之Special Methods (2)invokedynamic指令 https://www.cnblogs.com/wade-luffy/p/6058087.html public ...

Python爬虫初识

爬虫简介

非结构化数据

工具安装

requests 网络资源截取插件

取得页面

将网页读进BeautifulSoup中

使用select方法找找出特定标签的HTML元素，可取标签名或id，class返回的值是一个list

例子

1、取得新浪陕西的新闻时间标题和连接

2、获取文章的标题，来源，时间和正文

3、获取文章的评论数，评论数是通过js写入，不能通过上面的方法获取到，在js下，找到文章评论的js

4、将获得评论的方法总结成一个函数

5、输入地址得到文章的所有信息（标题、时间、来源、正文等）的函数（完整版）

Python爬虫初识的更多相关文章

随机推荐

热门专题