初学爬虫,学习一下三方库的使用以及简单静态网页的分析。就跟着视频写了一个爬取豆瓣Top250排行榜的爬虫。

网页分析

我个人感觉写爬虫最重要的就是分析网页,找到网页的规律,找到自己需要内容所在的地方,细化到他在哪个div里面,在哪个class里面,在哪个a标签里面。

从上面的图中可以看出,有很多信息。包括电影名、英文名、简介、评价、评价人数、相关信息

当我们打开控制台,可以看到电影的链接、图片的链接。

可以看到电影名在一个span里面、概况在一个p标签里面、评价在一个div里面的一个span中等等。

找到我们需要信息的位置,其实每一个电影项的信息都是在相同的标签里面,每一页都25个项,一共有10页,每一页的链接后缀https://movie.douban.com/top250?start=25只需要更改start后面的数字,我们可以用一个循环来解决爬取多页。

爬取流程

一、引入第三方库

我们需要访问目的网址,进行正则分析,操作excel、保存到数据库等等都需要用到三方库。

from bs4 import BeautifulSoup  #网页解析
import re #正则表表达式文字匹配
import urllib.request,urllib.error #指定url,获取网页数据
import xlwt #进行excel操作
import sqlite3 #进行SQLite数据库操作
import pymysql.cursors #连接mysql数据库

二、访问目标网址

我们通过request库进行访问目标网页,并返回网页的全部源代码以字符串的形式保存。

访问的时候我们需要查看网页是通过什么方式返回的请求。

我们发现是get请求,只要url和请求头就可以。如果是post请求,需要封装data数据。

def askURL(url):
head = { #伪装请求头,模拟浏览器访问
"User-Agent":" Mozilla / 5.0(Linux;Android6.0;Nexus5 Build / MRA58N) AppleWebKit / 537.36(KHTML, likeGecko) Chrome / 99.0.4844.51Mobile Safari / 537.36"
}
request = urllib.request.Request(url,headers=head)
html = ""
try:
response = urllib.request.urlopen(request)
html = response.read().decode('utf-8')
#print(html)
except urllib.error.URLError as e:
if hasattr(e,"code"):
print(e.code)
if hasattr(e,"reason"):
print(e.reason)
return html #返回爬到所有的html数据

三、正则匹配数据

我们获取到全部网页源代码后还需要匹配到我们自己需要的数据,在标签中把数据提取出来。

正则表达式:

findlink = re.compile(r'a href="(.*?)">')   #电影链接
findImageSrc = re.compile(r'<img.*src="(.*?)"',re.S) #re.S让换行符包含着其中 #图片链接
findTitle = re.compile(r'<span class="title">(.*)</span>') #标题
findRating = re.compile(r'<span class="rating_num" property="v:average">(.*)</span>') #评分
findJudge = re.compile(r'<span>(\d*)人评价</span>') #人数
findInq = re.compile(r'<span class="inq">(.*)</span>') #概况
findBd = re.compile(r'<p class="">(.*?)</p>',re.S) #相关信息

提取匹配数据并保存到列表中。

def getdata(baseurl):
datalist = [] #2 解析数据
for i in range(0,10):
url = baseurl + str(i*25)
html = askURL(url)
soup = BeautifulSoup(html,"html.parser")
for item in soup.find_all('div',class_="item"):
#print(item)
data = []
item = str(item)
link = re.findall(findlink,item)[0]
data.append(link)
image = re.findall(findImageSrc,item)[0]
data.append(image) title = re.findall(findTitle,item)
if(len(title )==2):
ctitle = title[0]
data.append(ctitle)
otitle = title[1].replace("/","")
data.append(otitle.strip())
else:
data.append(title[0])
data.append(" ") rating = re.findall(findRating,item)[0] #添加评分
data.append(rating) judgeNum = re.findall(findJudge,item)[0] #添加评价人数
data.append(judgeNum) inq = re.findall(findInq,item)
if len(inq) != 0:
inq = inq[0].replace("。","")
data.append(inq)
else:
data.append("")
bd = re.findall(findBd,item)[0]
bd = re.sub('<br(\s+)?/>(\s+)?'," ",bd)
bd = re.sub('/'," ",bd)
bd = re.sub('\xa0', " ", bd)
bd = re.sub('\n', " ", bd)
data.append(bd.strip())
datalist.append(data)
print(datalist)
return datalist

四、保存数据到excel中

def saveData(datalist,savepath):
print("save...")
book = xlwt.Workbook(encoding="utf-8",style_compression=0)
sheet = book.add_sheet('豆瓣电影Top250',cell_overwrite_ok=True)
col = ("电影详情链接","图片链接","影片中文名","影片外国名","评分","评价数","概况","相关信息") #创建列
for i in range(0,8):
sheet.write(0,i,col[i])
for i in range(0,250): #保存数据
print("第%d条"%(i+1))
data = datalist[i]
for j in range(0,8):
sheet.write(i+1,j,data[j])
book.save(savepath)

五、保存到MYSQL中(附加,可以不用)

def conn(datalist):
conn = pymysql.connect(host='localhost',user='root',password='1767737316.',database='douban',cursorclass=pymysql.cursors.DictCursor)
cursor = conn.cursor() for i in range(0,250):
list = datalist[i]
data1 = tuple(list)
sql = 'insert into top250(电影详情链接,图片链接,影片中文名,影片外国名,评分,评价数,概况,相关信息) values(%s,%s,%s,%s,%s,%s,%s,%s)'
# (2)准备数据
# (3)操作
try:
cursor.execute(sql, data1)
conn.commit()
except Exception as e:
print('插入数据失败', e)
conn.rollback() # 回滚
# 关闭游标
# cursor.close()
# 关闭连接
# conn.close()

六、程序入口

if __name__ == "__main__":
main()
print("爬取完毕!")
print("保存到数据库!")

完整源代码

# -*- coding = utf-8 -*-
# @Time : 2022/4/24 16:08
# @Author :王敬博
# @File : spider.py
# @Software: PyCharm
from bs4 import BeautifulSoup #网页解析
import re #正则表表达式文字匹配
import urllib.request,urllib.error #指定url,获取网页数据
import xlwt #进行excel操作
import sqlite3 #进行SQLite数据库操作
import pymysql.cursors findlink = re.compile(r'a href="(.*?)">') #电影链接
findImageSrc = re.compile(r'<img.*src="(.*?)"',re.S) #re.S让换行符包含着其中 #图片链接
findTitle = re.compile(r'<span class="title">(.*)</span>') #标题
findRating = re.compile(r'<span class="rating_num" property="v:average">(.*)</span>') #评分
findJudge = re.compile(r'<span>(\d*)人评价</span>') #人数
findInq = re.compile(r'<span class="inq">(.*)</span>') #概况
findBd = re.compile(r'<p class="">(.*?)</p>',re.S) #相关信息 def main():
baseurl = "https://movie.douban.com/top250?start="
datalist = getdata(baseurl)
print(datalist)
#1 爬取网页
savepath = ".\\豆瓣电影Top250.xls"
saveData(datalist,savepath)
conn(datalist) def askURL(url):
head = {
"User-Agent":" Mozilla / 5.0(Linux;Android6.0;Nexus5 Build / MRA58N) AppleWebKit / 537.36(KHTML, likeGecko) Chrome / 99.0.4844.51Mobile Safari / 537.36"
}
request = urllib.request.Request(url,headers=head)
html = ""
try:
response = urllib.request.urlopen(request)
html = response.read().decode('utf-8')
#print(html)
except urllib.error.URLError as e:
if hasattr(e,"code"):
print(e.code)
if hasattr(e,"reason"):
print(e.reason)
return html #爬取网页
def getdata(baseurl):
datalist = [] #2 解析数据
for i in range(0,10):
url = baseurl + str(i*25)
html = askURL(url)
soup = BeautifulSoup(html,"html.parser")
for item in soup.find_all('div',class_="item"):
#print(item)
data = []
item = str(item)
link = re.findall(findlink,item)[0]
data.append(link)
image = re.findall(findImageSrc,item)[0]
data.append(image) title = re.findall(findTitle,item)
if(len(title )==2):
ctitle = title[0]
data.append(ctitle)
otitle = title[1].replace("/","")
data.append(otitle.strip())
else:
data.append(title[0])
data.append(" ") rating = re.findall(findRating,item)[0] #添加评分
data.append(rating) judgeNum = re.findall(findJudge,item)[0] #添加评价人数
data.append(judgeNum) inq = re.findall(findInq,item)
if len(inq) != 0:
inq = inq[0].replace("。","")
data.append(inq)
else:
data.append("")
bd = re.findall(findBd,item)[0]
bd = re.sub('<br(\s+)?/>(\s+)?'," ",bd)
bd = re.sub('/'," ",bd)
bd = re.sub('\xa0', " ", bd)
bd = re.sub('\n', " ", bd)
data.append(bd.strip())
datalist.append(data)
print(datalist)
return datalist #3 保存数据
def saveData(datalist,savepath):
print("save...")
book = xlwt.Workbook(encoding="utf-8",style_compression=0)
sheet = book.add_sheet('豆瓣电影Top250',cell_overwrite_ok=True)
col = ("电影详情链接","图片链接","影片中文名","影片外国名","评分","评价数","概况","相关信息")
for i in range(0,8):
sheet.write(0,i,col[i])
for i in range(0,250):
print("第%d条"%(i+1))
data = datalist[i]
for j in range(0,8):
sheet.write(i+1,j,data[j])
book.save(savepath) def conn(datalist):
conn = pymysql.connect(host='localhost',user='root',password='1767737316.',database='douban',cursorclass=pymysql.cursors.DictCursor)
cursor = conn.cursor() for i in range(0,250):
list = datalist[i]
data1 = tuple(list)
sql = 'insert into top250(电影详情链接,图片链接,影片中文名,影片外国名,评分,评价数,概况,相关信息) values(%s,%s,%s,%s,%s,%s,%s,%s)'
# (2)准备数据
# (3)操作
try:
cursor.execute(sql, data1)
conn.commit()
except Exception as e:
print('插入数据失败', e)
conn.rollback() # 回滚
# 关闭游标
# cursor.close()
# 关闭连接
# conn.close() if __name__ == "__main__":
main()
print("爬取完毕!")
print("保存到数据库!")

效果截图

到这里就结束了,如果有问题可以问我,如果觉得对你有帮助的话可以点个赞哦!

python爬取豆瓣电影Top250(附完整源代码)的更多相关文章

  1. 零基础爬虫----python爬取豆瓣电影top250的信息(转)

    今天利用xpath写了一个小爬虫,比较适合一些爬虫新手来学习.话不多说,开始今天的正题,我会利用一个案例来介绍下xpath如何对网页进行解析的,以及如何对信息进行提取的. python环境:pytho ...

  2. Python 爬取豆瓣电影Top250排行榜,爬虫初试

    from bs4 import BeautifulSoup import openpyxl import re import urllib.request import urllib.error # ...

  3. 一起学爬虫——通过爬取豆瓣电影top250学习requests库的使用

    学习一门技术最快的方式是做项目,在做项目的过程中对相关的技术查漏补缺. 本文通过爬取豆瓣top250电影学习python requests的使用. 1.准备工作 在pycharm中安装request库 ...

  4. Python爬取豆瓣电影top

    Python爬取豆瓣电影top250 下面以四种方法去解析数据,前面三种以插件库来解析,第四种以正则表达式去解析. xpath pyquery beaufifulsoup re 爬取信息:名称  评分 ...

  5. python 爬虫&爬取豆瓣电影top250

    爬取豆瓣电影top250from urllib.request import * #导入所有的request,urllib相当于一个文件夹,用到它里面的方法requestfrom lxml impor ...

  6. Python爬虫入门:爬取豆瓣电影TOP250

    一个很简单的爬虫. 从这里学习的,解释的挺好的:https://xlzd.me/2015/12/16/python-crawler-03 分享写这个代码用到了的学习的链接: BeautifulSoup ...

  7. scrapy爬虫框架教程(二)-- 爬取豆瓣电影TOP250

    scrapy爬虫框架教程(二)-- 爬取豆瓣电影TOP250 前言 经过上一篇教程我们已经大致了解了Scrapy的基本情况,并写了一个简单的小demo.这次我会以爬取豆瓣电影TOP250为例进一步为大 ...

  8. python2.7爬取豆瓣电影top250并写入到TXT,Excel,MySQL数据库

    python2.7爬取豆瓣电影top250并分别写入到TXT,Excel,MySQL数据库 1.任务 爬取豆瓣电影top250 以txt文件保存 以Excel文档保存 将数据录入数据库 2.分析 电影 ...

  9. 利用Python爬取豆瓣电影

    目标:使用Python爬取豆瓣电影并保存MongoDB数据库中 我们先来看一下通过浏览器的方式来筛选某些特定的电影: 我们把URL来复制出来分析分析: https://movie.douban.com ...

随机推荐

  1. Mosquitto安装和使用

    Mosquitto是一个实现了MQTT3.1协议的代理服务器,由MQTT协议创始人之一的Andy Stanford-Clark开发,它为我们提供了非常棒的轻量级数据交换的解决方案. 下载地址是: ht ...

  2. @Component, @Controller, @Repository, @Service 有何区别?

    @Component :这将 java 类标记为 bean.它是任何 Spring 管理组件的通 用构造型.spring 的组件扫描机制现在可以将其拾取并将其拉入应用程序环境 中. @Controll ...

  3. memcached 的多线程是什么?如何使用它们?

    线程就是定律(threads rule)!在 Steven Grimm 和 Facebook 的努力下, memcached 1.2 及更高版本拥有了多线程模式.多线程模式允许 memcached 能 ...

  4. Linux 中进程有哪几种状态?在 ps 显示出来的信息中, 分别用什么符号表示的?

    1.不可中断状态:进程处于睡眠状态,但是此刻进程是不可中断的.不可中断, 指进程不响应异步信号. 第 441 页 共 485 页2.暂停状态/跟踪状态:向进程发送一个 SIGSTOP 信号,它就会因响 ...

  5. 解释 Spring 框架中 bean 的生命周期?

    Spring 容器 从 XML 文件中读取 bean 的定义,并实例化 bean. Spring 根据 bean 的定义填充所有的属性. 如果 bean 实现了 BeanNameAware 接口,Sp ...

  6. Spring工作原理:初识SpringMVC

    1.SpringMVC简介 SpringMVC是Spring框架的一个模块.SpringMVC和Spring无需通过中间层进行整合.是一个轻量级的,基于请求响应的MVC框架. 2.1.什么是MVC? ...

  7. 15_伯德图,为什么是20logM?分贝又是什么?_Bode Plot_Part1

  8. html5网页录音和语音识别

    背景 在输入方式上,人们总是在追寻一种更高效,门槛更低的方式,来降低用户使用产品的学习成本.语音输入也是一种尝试较多的方式,有些直接使用语音(如微信语音聊天),有些需要将语音转化为文字(语音识别).接 ...

  9. ES6-11学习笔记--数组遍历

    ES5中数组遍历方式: for循环 forEach():没有返回值,只是针对每个元素调用func map():返回新的Array,每个元素为调用func的结果 filter():返回符合func条件的 ...

  10. python-使用函数求特殊a串数列和

    给定两个均不超过9的正整数a和n,要求编写函数fn(a,n) 求a+aa+aaa++⋯+aa⋯aa(n个a)之和,fn须返回的是数列和 函数接口定义: 1 fn(a,n) 2 其中 a 和 n 都是用 ...