bs4抓取糗事百科

抓取糗事百科内容及评论，不包含图片信息。user-agent填入浏览器的即可。user-agent对应的value，360极速浏览器的话，可以在地址栏输入about:version，回车，用户代理后面的一长串就是需要填入''里面的内容。其他的可以自行百度

import urllib.request

import re

from urllib import request

from bs4 import BeautifulSoup

#1.获取网页源代码

def get_html(url):

    headers = {

        'User-Agent': '',

    }

    req = request.Request(headers=headers,url=url)

    response = urllib.request.urlopen(req)

    content = response.read().decode('utf-8')

    return content

#获取评论链接

def get_comment_link(content,comment_url_base):

    soup = BeautifulSoup(content,'html.parser')

    articleFloor = 1

    for string in soup.find_all(attrs=re.compile(r"article block untagged mb15.*?")):

        comment = str(string.get('id')).strip().split("_")[2]

        comment_url = comment_url_base % comment#评论链接

        get_comment_content(comment_url,articleFloor)#获取评论内容

        articleFloor += 1

#获取糗事内容及评论内容

def get_comment_content(comment_url,articleFloor):

    commentPage = get_html(comment_url)

    commentFloor = 1

    soupComment = BeautifulSoup(commentPage,'html.parser')

    for item in soupComment.find_all('div',class_='content'):

        print(articleFloor,".",item.get_text().strip())#获取糗事内容

    for comment in soupComment.find_all(attrs="body"):

        print("      ",commentFloor,"楼回复：",comment.get_text())#获取评论内容

        commentFloor += 1

def command():

    while True:

        raw = input("点击enter查看或者输入exit退出，请输入你的选择：")

        if raw=='enter':

            main()

            break

        else:

            break

def main():

    article_url_base = 'https://www.qiushibaike.com/8hr/page/%d/'#文章地址

    comment_url_base = 'https://www.qiushibaike.com/article/%s'#评论地址

    article_url = article_url_base % 2

    content = get_html(article_url)

    get_comment_link(content,comment_url_base)

if __name__ == '__main__':

    command()

bs4抓取糗事百科的更多相关文章

Python爬虫--抓取糗事百科段子
今天使用python爬虫实现了自动抓取糗事百科的段子,因为糗事百科不需要登录,抓取比较简单.程序每按一次回车输出一条段子,代码参考了 http://cuiqingcai.com/990.html 但该 ...
python 抓取糗事百科糗图
1 首先看下要抓取的页面这是糗事百科里面的糗图页面,每一页里面有很多的图片,我们要做的就是把这些图片抓取下来. 2 分析网页源代码发现源代码里面的每张图是这样储存的,所以决定使用正则匹配出图片的u ...
Python抓取糗事百科成人版图片
最近开始学习爬虫,一开始看的是静觅的爬虫系列文章,今天看到糗事百科成人版,心里就邪恶了一下,把图片都爬下来吧,哈哈~ 虽然后来实现了,但还是存在一些问题,暂且不提,先切入正题吧,没什么好说的,直接上代 ...
python_爬虫一之爬取糗事百科上的段子
目标抓取糗事百科上的段子实现每按一次回车显示一个段子输入想要看的页数,按 'Q' 或者 'q' 退出实现思路目标网址:糗事百科使用requests抓取页面 requests官方教程使用 ...
Python爬取糗事百科
import urllib import urllib.request from bs4 import BeautifulSoup """ 1.抓取糗事百科所有纯 ...
Python爬虫爬取糗事百科段子内容
参照网上的教程再做修改,抓取糗事百科段子(去除图片),详情见下面源码: #coding=utf-8#!/usr/bin/pythonimport urllibimport urllib2import ...
芝麻HTTP：Python爬虫实战之爬取糗事百科段子
首先,糗事百科大家都听说过吧?糗友们发的搞笑的段子一抓一大把,这次我们尝试一下用爬虫把他们抓取下来. 友情提示糗事百科在前一段时间进行了改版,导致之前的代码没法用了,会导致无法输出和CPU占用过高的 ...
8.Python爬虫实战一之爬取糗事百科段子
大家好,前面入门已经说了那么多基础知识了,下面我们做几个实战项目来挑战一下吧.那么这次为大家带来,Python爬取糗事百科的小段子的例子. 首先,糗事百科大家都听说过吧?糗友们发的搞笑的段子一抓一大把 ...
5 使用ip代理池爬取糗事百科
从09年读本科开始学计算机以来,一直在迷茫中度过,很想学些东西,做些事情,却往往陷进一些技术细节而蹉跎时光.直到最近几个月,才明白程序员的意义并不是要搞清楚所有代码细节,而是要有更宏高的方向,要有更专 ...

随机推荐

老男孩python学习自修第四天【字典的使用】
dict = {key1:value1, key2:value2} 定义字典 dict[key] = value 设置字典中指定健的值 dict.pop(key) 删除字典中指定健 dict.popi ...
cuda编程-并行规约
利用shared memory计算,并避免bank conflict:通过每个block内部规约,然后再把所有block的计算结果在CPU端累加代码: #include <cuda_runti ...
Introduction to Dynamic SQL
The idea of using dynamic SQL is to execute SQL that will potentially generate and execute another S ...
spring的作用是减低耦合,从编译器降低,例如不直接通过new方式而是通过工厂方式获取对象
spring的作用是减低耦合,从编译器降低,例如不直接通过new方式而是通过工厂方式获取对象
Matplotlib学习---用matplotlib画折线图（line chart）
这里利用Jake Vanderplas所著的<Python数据科学手册>一书中的数据,学习画图. 数据地址:https://raw.githubusercontent.com/jakevd ...
MySql的CURRENT_TIMESTAMP
在创建时间字段的时候 DEFAULT CURRENT_TIMESTAMP表示当插入数据的时候,该字段默认值为当前时间 ON UPDATE CURRENT_TIMESTAMP表示每次更新这条数据的时候, ...
C#版本和.NET版本以及VS版本的对应关系
C#版本和.NET版本以及VS版本的对应关系版本 .NET Framework版本 Visual Studio版本发布日期特性 C# 1.0 .NET Framework 1.0 Visual ...
PHP获取网络图片并保存在本地目录
PHP获取网络图片并保存在本地目录思路: 代码如下: function file_exists_S3($url) { $state = @file_get_contents($url,0,null,0 ...
Linux 多网卡绑定bond
mode=0:负载均衡模式,增加带宽,两块网卡使用的是同一个MAC地址,所以必须配置网卡相连的交换机,这两个端口应采用聚合方式. mode=1:主备模式,一个线断了,另一条自动备援. mode=6:负 ...
【转】VMware 全屏显示
首先解决一个问题:配置虚拟机,发现屏幕大小太小需要安装vmware tools ,屏幕就会自适应但是安装vmware tools 的按钮是灰的,所以我首先就是安装它 [来源]

bs4抓取糗事百科

bs4抓取糗事百科的更多相关文章

随机推荐

热门专题