bs4抓取糗事百科

抓取糗事百科内容及评论，不包含图片信息。user-agent填入浏览器的即可。user-agent对应的value，360极速浏览器的话，可以在地址栏输入about:version，回车，用户代理后面的一长串就是需要填入''里面的内容。其他的可以自行百度

import urllib.request

import re

from urllib import request

from bs4 import BeautifulSoup

#1.获取网页源代码

def get_html(url):

    headers = {

        'User-Agent': '',

    }

    req = request.Request(headers=headers,url=url)

    response = urllib.request.urlopen(req)

    content = response.read().decode('utf-8')

    return content

#获取评论链接

def get_comment_link(content,comment_url_base):

    soup = BeautifulSoup(content,'html.parser')

    articleFloor = 1

    for string in soup.find_all(attrs=re.compile(r"article block untagged mb15.*?")):

        comment = str(string.get('id')).strip().split("_")[2]

        comment_url = comment_url_base % comment#评论链接

        get_comment_content(comment_url,articleFloor)#获取评论内容

        articleFloor += 1

#获取糗事内容及评论内容

def get_comment_content(comment_url,articleFloor):

    commentPage = get_html(comment_url)

    commentFloor = 1

    soupComment = BeautifulSoup(commentPage,'html.parser')

    for item in soupComment.find_all('div',class_='content'):

        print(articleFloor,".",item.get_text().strip())#获取糗事内容

    for comment in soupComment.find_all(attrs="body"):

        print("      ",commentFloor,"楼回复：",comment.get_text())#获取评论内容

        commentFloor += 1

def command():

    while True:

        raw = input("点击enter查看或者输入exit退出，请输入你的选择：")

        if raw=='enter':

            main()

            break

        else:

            break

def main():

    article_url_base = 'https://www.qiushibaike.com/8hr/page/%d/'#文章地址

    comment_url_base = 'https://www.qiushibaike.com/article/%s'#评论地址

    article_url = article_url_base % 2

    content = get_html(article_url)

    get_comment_link(content,comment_url_base)

if __name__ == '__main__':

    command()

bs4抓取糗事百科的更多相关文章

Python爬虫--抓取糗事百科段子
今天使用python爬虫实现了自动抓取糗事百科的段子,因为糗事百科不需要登录,抓取比较简单.程序每按一次回车输出一条段子,代码参考了 http://cuiqingcai.com/990.html 但该 ...
python 抓取糗事百科糗图
1 首先看下要抓取的页面这是糗事百科里面的糗图页面,每一页里面有很多的图片,我们要做的就是把这些图片抓取下来. 2 分析网页源代码发现源代码里面的每张图是这样储存的,所以决定使用正则匹配出图片的u ...
Python抓取糗事百科成人版图片
最近开始学习爬虫,一开始看的是静觅的爬虫系列文章,今天看到糗事百科成人版,心里就邪恶了一下,把图片都爬下来吧,哈哈~ 虽然后来实现了,但还是存在一些问题,暂且不提,先切入正题吧,没什么好说的,直接上代 ...
python_爬虫一之爬取糗事百科上的段子
目标抓取糗事百科上的段子实现每按一次回车显示一个段子输入想要看的页数,按 'Q' 或者 'q' 退出实现思路目标网址:糗事百科使用requests抓取页面 requests官方教程使用 ...
Python爬取糗事百科
import urllib import urllib.request from bs4 import BeautifulSoup """ 1.抓取糗事百科所有纯 ...
Python爬虫爬取糗事百科段子内容
参照网上的教程再做修改,抓取糗事百科段子(去除图片),详情见下面源码: #coding=utf-8#!/usr/bin/pythonimport urllibimport urllib2import ...
芝麻HTTP：Python爬虫实战之爬取糗事百科段子
首先,糗事百科大家都听说过吧?糗友们发的搞笑的段子一抓一大把,这次我们尝试一下用爬虫把他们抓取下来. 友情提示糗事百科在前一段时间进行了改版,导致之前的代码没法用了,会导致无法输出和CPU占用过高的 ...
8.Python爬虫实战一之爬取糗事百科段子
大家好,前面入门已经说了那么多基础知识了,下面我们做几个实战项目来挑战一下吧.那么这次为大家带来,Python爬取糗事百科的小段子的例子. 首先,糗事百科大家都听说过吧?糗友们发的搞笑的段子一抓一大把 ...
5 使用ip代理池爬取糗事百科
从09年读本科开始学计算机以来,一直在迷茫中度过,很想学些东西,做些事情,却往往陷进一些技术细节而蹉跎时光.直到最近几个月,才明白程序员的意义并不是要搞清楚所有代码细节,而是要有更宏高的方向,要有更专 ...

随机推荐

织梦后台如何生成站点地图sitemap.xml
第一步在网站根目录建立sitemap.php文件内容如下: 写一个计划任务文件命名为generate_sitemap.php,放在/plus/task目录里,文件内容如下: <?php//定时 ...
如何在mac下安装php
步骤如下: 1.下载php源码并解压 2.进入php源码并configure 3.安装openssl 4.sudo make及make test 5.sudo make install 具体命令如下: ...
git放弃修改，强制覆盖本地代码
$ git fetch --all $ git reset --hard origin/master $ git pull
flask 保存文件到七牛云
上篇文章队长讲述了如何把前端上传的文件保存到本地项目目录本篇讲述一下把前端上传的文件保存到第三方存储(七牛云) 七牛云相关步骤思路: 首先进去七牛云官网,注册并实名认证来获取一个七牛云账号和存 ...
解决post、get端中文乱码问题
在web.xml中配置: <filter> <filter-name>CharacterEncodingFilter</filter-name> <filte ...
OPENQUERY (Transact-SQL)
Syntax Copy OPENQUERY ( linked_server ,'query' ) Arguments linked_serverIs an identifier representin ...
HTML5获取地理位置信息
<!DOCTYPE html> <html> <head> <title>Location</title> <meta charset ...
基于 __new__ 方法的单例模式
单例模式定义首次实例化创建实例化对象之后的每次实例化都用最初的实例化对象即单实例模式 __new__ 的原理 __new__ 方法可以在 __init__ 方法执行这样可以在初始化之前进行一系 ...
Google Apps的单点登录-谷歌使用的单点登录
简述: Customer :客户 Google:谷歌 Identity Provider:身份提供者安全断言标记语言(英语:Security Assertion Markup Language,简称S ...
ATR102E Stop. Otherwise... [容斥]
第一道容斥 \(ans[i] = \sum_{j = 0}^{min(cnt, n / 2)} (-1)^j \tbinom{cnt}{j} \tbinom{n - 2*j + k - 1}{k - ...

bs4抓取糗事百科

bs4抓取糗事百科的更多相关文章

随机推荐

热门专题