2019-02-01 Python爬虫爬取豆瓣Top250

这几天学了一点爬虫后写了个爬取电影top250的代码，分别用requests库和urllib库，想看看自己能不能搞出个啥东西，虽然很简单但还是小开心。

import requests

import re

# https://movie.douban.com/top250?start=25&filter=

# <span class="title">勇士</span>

count = 1

def getdata(url):

    data = requests.get(url)

    return data.text

def showdata(data):

    global count

    regex = re.compile(r"<span class=\"title\">(.*?)</span>")

    data = regex.findall(data)

    newdata = data.copy()

    for dataa in newdata:

        if "nbsp" in dataa:

            data.remove(dataa)

    for i in data:

        print(count, i)

        count = count + 1

for i in range(0, 10):

    i = i * 25

    url = "https://movie.douban.com/top250?start={}&filter=".format(str(i))

    data = getdata(url)

    showdata(data)

# 用requests来实现,正则表达式解析网页

import urllib

import urllib.request

import re

#https://movie.douban.com/top250?start=25&filter=

#<span class="title">勇士</span>

count = 1

def getdata(url):

    data = urllib.request.urlopen(url).read().decode("utf-8")

    return data

def showdata(data):

    global count

    regex = re.compile(r"<span class=\"title\">(.*?)</span>")

    data = regex.findall(data)

    newdata = data.copy()

    for dataa in newdata:

        if "nbsp" in dataa:

            data.remove(dataa)

    for i in data:

        print(count,i)

        count = count+1

for i in range(0,10):

    i = i*25

    url = "https://movie.douban.com/top250?start={}&filter=".format(str(i))

    data = getdata(url)

    showdata(data)

#用urllib来实现，正则表达式解析网页

emmmmmmm

2019-02-01 Python爬虫爬取豆瓣Top250的更多相关文章

Python爬虫爬取豆瓣电影之数据提取值xpath和lxml模块
工具:Python 3.6.5.PyCharm开发工具.Windows 10 操作系统.谷歌浏览器目的:爬取豆瓣电影排行榜中电影的title.链接地址.图片.评价人数.评分等网址:https:// ...
python 爬虫&爬取豆瓣电影top250
爬取豆瓣电影top250from urllib.request import * #导入所有的request,urllib相当于一个文件夹,用到它里面的方法requestfrom lxml impor ...
Python爬虫-爬取豆瓣图书Top250
豆瓣网站很人性化,对于新手爬虫比较友好,没有如果调低爬取频率,不用担心会被封 IP.但也不要太频繁爬取. 涉及知识点:requests.html.xpath.csv 一.准备工作需要安装reques ...
python爬虫-爬取豆瓣电影数据
#!/usr/bin/python# coding=utf-8# 作者 :Y0010026# 创建时间 :2018/12/16 16:27# 文件 :spider_05.py# IDE :PyChar ...
Python爬虫爬取豆瓣读书
一,准备工作. 工具:win10+Python3.6 爬取目标:爬取图中红色方框的内容. 原则:能在源码中看到的信息都能爬取出来. 信息表现方式:CSV转Excel. 二,具体步骤. 先给出具体代码吧 ...
Python爬虫爬取豆瓣电影名称和链接，分别存入txt，excel和数据库
前提条件是python操作excel和数据库的环境配置是完整的,这个需要在python中安装导入相关依赖包: 实现的具体代码如下: #!/usr/bin/python# -*- coding: utf ...
Python爬虫-爬取豆瓣电影Top250
#!usr/bin/env python3 # -*- coding:utf-8-*- import requests from bs4 import BeautifulSoup import re ...
python定时器爬取豆瓣音乐Top榜歌名
python定时器爬取豆瓣音乐Top榜歌名作者:vpoet mail:vpoet_sir@163.com 注:这些小demo都是前段时间为了学python写的,现在贴出来纯粹是为了和大家分享一下 # ...
Python爬虫 - 爬取百度html代码前200行
Python爬虫 - 爬取百度html代码前200行 - 改进版, 增加了对字符串的.strip()处理源代码如下: # 改进版, 增加了 .strip()方法的使用 # coding=utf-8 ...

随机推荐

centOS 6.8下使用Gparted进行分区扩容
centOS 6.8下使用Gparted进行分区扩容机器环境:windows上运行的VMware虚拟机,系统为centOS 6.8. 由于前期分区分配空间过小,无法满足后续的数据存储预期,所 ...
MarkDown语法使用(效果版本)
function syntaxHighlighting() { var n = 33; var s = "hello, こんにちは"; console.log(s); } plai ...
go模板-代码生成器
能用程序去做的事,就不要用手,编写自己的代码生成器就是用来解放你的双手,替你做一些重复性的工作. 上篇帖子写了模板的基础 go模板详说 ,有了基础就要做点什么东西,把所学到的东西应用起来才能更好的进步 ...
[Python基础]002.语法(1)
语法(1) 变量基本数据类型空值布尔值数字字符串列表元组字典结构嵌套变量定义变量 i = 10 这样就定义了一个名为 i 的变量,它的值是 10 . 变量名必须是大小写英文.数字 ...
[Python基础]007.字符串
字符串内建操作字符串长度大小写变换去空格或其他连接字符串查找替换分割判断内建操作字符串长度 len 代码 s = 'abcd' print len(s) 大小写变换 lower 小 ...
Blazor WebAssembly 修仙之途 - 组件与数据绑定
一.前言在第一篇文章中,有提到过组件(Component)这个概念.组件在 Blazor 中是必不可少的,UI 全靠它组装起来,和前端的 JS 组件是一个意思,比如:vue component.re ...
Rocket - debug - SBA
https://mp.weixin.qq.com/s/eFOHrEhvq2PlEJ14j2vlhg 简单介绍SBA的实现. 1. SystemBusAccessState 系统总线访问状态: 分别是: ...
Rocket - tilelink - AtomicAutomata
https://mp.weixin.qq.com/s/O7VTHqpCFNJQi3EpucXkIw 简单介绍AtomicAutomata的实现.(细节问题太多,恕不完全表述.) 1. ...
PowerPC-MPC56xx Flash模式代码启动过程
https://mp.weixin.qq.com/s/iruM5VwKgnH_7nmIQxO0-g 参考第5章 In order for the e200z4d core to be able ...
Java 第十一届蓝桥杯省模拟赛元音字母辅音字母的数量
给定一个单词,请计算这个单词中有多少个元音字母,多少个辅音字母. 元音字母包括 a, e, i, o, u,共五个,其他均为辅音字母. 输入格式输入一行,包含一个单词,单词中只包含小写英文字母. 输 ...

2019-02-01 Python爬虫爬取豆瓣Top250

2019-02-01 Python爬虫爬取豆瓣Top250的更多相关文章

随机推荐

热门专题