记一次简单爬虫(豆瓣/dytt)

刹那灯火明 2024-10-15 04:34:10 原文

磕磕绊绊学python一个月，这次到正则表达式终于能写点有趣的东西，在此作个记录：

—————————————————————————————————————————————————

1.爬取豆瓣电影榜前250名单

运行环境：

pycharm-professional-2018.2.4

3.7.0 (v3.7.0:1bf9cc5093, Jun 27 2018, 04:59:51) [MSC v.1914 64 bit (AMD64)]

成品效果：

相关代码：

 from urllib.request import urlopen

 import re

 # import ssl  # 若有数字签名问题可用

 # ssl._create_default_https_context = ssl._create_unverified_context

 # 写正则规则

 obj = re.compile(r'<div class="item">.*?<span class="title">(?P<name>.*?)</span>.*?导演:(?P<daoyan>.*?)&nbsp;.*?'

                  r'主演:(?P<zhuyan>.*?)<br>\n                            (?P<shijian>.*?)&nbsp;/&nbsp;(?P<diqu>.*?)&nbsp;'

                  r'/&nbsp;(?P<leixing>.*?)\n.*?<span class="rating_num" property="v:average">(?P<fen>.*?)</span>.*?<span>'

                  r'(?P<renshu>.*?)评价</span>.*?<span class="inq">(?P<jianping>.*?)</span>',re.S)  # re.S 干掉换行

 # 转码 获取内容

 def getContent(url):

     content = urlopen(url).read().decode("utf-8")

     return content

 # 匹配页面内容 返回一个迭代器

 def parseContent(content):

     iiter = obj.finditer(content)

     for el in iiter:

         yield {

             "name":el.group("name"),

             "daoyan":el.group("daoyan"),

             "zhuyan":el.group("zhuyan"),

             "shijian":el.group("shijian"),

             "diqu":el.group("diqu"),

             "leixing":el.group("leixing"),

             "fen":el.group("fen"),

             "renshu":el.group("renshu"),

             "jianping":el.group("jianping")

         }

 for i in range(10):

     url = "https://movie.douban.com/top250?start=%s&filter=" % (i*25)  # 循环页面10

     print(url)

     g = parseContent(getContent(url))  # 匹配获取的内容返回给g

     f = open("douban_movie.txt",mode="a",encoding="utf-8")

     for el in g:

         f.write(str(el)+"\n")  # 写入到txt 注意加上换行

     # f.write("==============================================")  # 测试分页

     f.close()

2.爬取某站最新电影和下载地址

运行环境：

pycharm-professional-2018.2.4

3.7.0 (v3.7.0:1bf9cc5093, Jun 27 2018, 04:59:51) [MSC v.1914 64 bit (AMD64)]

成品效果：

相关代码：

 from urllib.request import urlopen

 import json

 import re

 # 获取主页面内容

 url = "https://www.dytt8.net/"

 content = urlopen(url).read().decode("gbk")

 # print(content)

 # 正则

 obj = re.compile(r'.*?最新电影下载</a>]<a href=\'(?P<url1>.*?)\'>', re.S)

 obj1 = re.compile(r'.*?<div id="Zoom">.*?<br />◎片　　名(?P<name>.*?)<br />.*?bgcolor="#fdfddf"><a href="(?P<download>.*?)">', re.S)

 def get_content(content):

     res = obj.finditer(content)

     f = open('movie_dytt.json', mode='w', encoding='utf-8')

     for el in res:

         res = el.group("url1")

         res = url + res  # 拼接子页面网址

         content1 = urlopen(res).read().decode("gbk")  # 获取子页面内容

         lst = obj1.findall(content1)  # 匹配obj1返回一个列表

         # print(lst)  # 元组

         name = lst[0][0]

         download = lst[0][1]

         s = json.dumps({"name":name,"download":download},ensure_ascii=False)

         f.write(s+"\n")

     f.flush()

     f.close()

 get_content(content)  # 调用函数 执行

记一次简单爬虫(豆瓣/dytt)的更多相关文章

放养的小爬虫--豆瓣电影入门级爬虫(mongodb使用教程~)
放养的小爬虫--豆瓣电影入门级爬虫(mongodb使用教程~) 笔者声明:只用于学习交流,不用于其他途径.源代码已上传github.githu地址:https://github.com/Erma-Wa ...
Python做简单爬虫（urllib.request怎么抓取https以及伪装浏览器访问的方法）
一:抓取简单的页面: 用Python来做爬虫抓取网站这个功能很强大,今天试着抓取了一下百度的首页,很成功,来看一下步骤吧首先需要准备工具: 1.python:自己比较喜欢用新的东西,所以用的是Pyt ...
python 简单爬虫（beatifulsoup)
---恢复内容开始--- python爬虫学习从0开始第一次学习了python语法,迫不及待的来开始python的项目.首先接触了爬虫,是一个简单爬虫.个人感觉python非常简洁,相比起java或 ...
Python 简单爬虫案例
Python 简单爬虫案例 import requests url = "https://www.sogou.com/web" # 封装参数 wd = input('enter a ...
Python简单爬虫入门三
我们继续研究BeautifulSoup分类打印输出 Python简单爬虫入门一 Python简单爬虫入门二前两部主要讲述我们如何用BeautifulSoup怎去抓取网页信息以及获取相应的图片标题等信 ...
[Java]使用HttpClient实现一个简单爬虫，抓取煎蛋妹子图
第一篇文章,就从一个简单爬虫开始吧. 这只虫子的功能很简单,抓取到”煎蛋网xxoo”网页(http://jandan.net/ooxx/page-1537),解析出其中的妹子图,保存至本地. 先放结果 ...
简单爬虫，突破IP访问限制和复杂验证码，小总结
简单爬虫,突破复杂验证码和IP访问限制文章地址:http://www.cnblogs.com/likeli/p/4730709.html 好吧,看题目就知道我是要写一个爬虫,这个爬虫的目标网站有 ...
Python简单爬虫入门二
接着上一次爬虫我们继续研究BeautifulSoup Python简单爬虫入门一上一次我们爬虫我们已经成功的爬下了网页的源代码,那么这一次我们将继续来写怎么抓去具体想要的元素首先回顾以下我们Bea ...
GJM : Python简单爬虫入门（二） [转载]
感谢您的阅读.喜欢的.有用的就请大哥大嫂们高抬贵手"推荐一下"吧!你的精神支持是博主强大的写作动力以及转载收藏动力.欢迎转载! 版权声明:本文原创发表于 [请点击连接前往] ,未经 ...

随机推荐

Python中获取当前时间获取当前时间前几天的代码
当然需要引入 datetime import datetime 获取当前日期:datetime.datetime.now().strftime('%Y-%m-%d') 获取当前日期前七天日期: no ...
java 中什么是aop
AOP AOP(Aspect Oriented Programming),即面向切面编程,可以说是OOP(Object Oriented Programming,面向对象编程)的补充和完善.OOP引入 ...
Java基础之断言
断言是在Java 1.4中引入的.它能让你验证假设.如果断言失败(即返回false),就会抛出AssertionError(如果启用断言). 什么时候使用断言? 断言不应该用于验证输入数据到一个pub ...
python3 内置函数详解
内置函数详解 abs(x) 返回数字的绝对值,参数可以是整数或浮点数,如果参数是复数,则返回其大小. # 如果参数是复数,则返回其大小. >>> abs(-25) 25 >&g ...
【NOIP2017】逛公园最短路+DP
诶,去年场上不会处理$0$的环,只拿了$60$有点可惜. 我们先不管边边权为$0$的边. 我们先跑一次最短路,令$dis[u]$表示从$1$至$u$的最短路的长度. 那么根据题目的要求,从起点走到$u ...
A Node Influence Based Label Propagation Algorithm for Community detection in networks 文章算法实现的疑问
这是我最近看到的一篇论文,思路还是很清晰的,就是改进的LPA算法.改进的地方在两个方面: (1)结合K-shell算法计算量了节点重重要度NI(node importance),标签更新顺序则按照NI ...
获取dictionary 值连续相同的索引，
; i < ;) { , i]; var rangType = companyScheme[i]; string txtCell = ""; switch (rangType ...
.NET 如何隐藏Console Application的窗口
1)创建Console Application工程 2)修改Output type 为Windows Application即可
多维标度法（MDS）的Python实现
多维标度法(multidimensional scaling,MDS)是一种在低维空间展示“距离”数据结构的多元数据分析技术,是一种将多维空间的研究对象( 样本或变量 ) 简化到低维空间进行定位. ...
(转)linux如何让历史记录不记录敏感命令
有时候为了服务器安全,防止别人窥探我们输入的命令,我们可以清空历史记录,而更多的时候,我们选择的是在输入特殊命令时候,强制历史记录不记住该命令.实验方法:先执行export HISTCONTROL=i ...