python requests、xpath爬虫增加博客访问量

这是一个分析IP代理网站，通过代理网站提供的ip去访问CSDN博客，达到以不同ip访同一博客的目的，以娱乐为主，大家可以去玩一下。

首先，准备工作，设置User-Agent:

#1.headers

headers={'User-Agent':'Mozilla/5.0 (Windows NT 10.0; Win64; x64; rv:68.0) Gecko/20100101 Firefox/68.0'}

然后百度一个IP代理网站，我选用的是https://www.kuaidaili.com/free，解析网页，提取其中的ip、端口、类型，并以list保存：

#1.获取IP地址

html=requests.get('https://www.kuaidaili.com/free').content.decode('utf8')

tree = etree.HTML(html)

ip = tree.xpath("//td[@data-title='IP']/text()")

port=tree.xpath("//td[@data-title='PORT']/text()")

model=tree.xpath("//td[@data-title='类型']/text()")

接着分析个人博客下的各篇文章的url地址，以list保存

#2.获取CSDN文章url地址   ChildrenUrl[]

url='https://blog.csdn.net/weixin_43576564'

response=requests.get(url,headers=headers)

Home=response.content.decode('utf8')

Home=etree.HTML(Home)

urls=Home.xpath("//div[@class='article-item-box csdn-tracking-statistics']/h4/a/@href")

ChildrenUrl=[]

然后通过代理ip去访问个人博客的各篇文章，通过for循环，一个ip将所有文章访问一遍，通过解析"我的博客"网页，获取总浏览量，实时监控浏览量是否发生变化，设置任务数，实时显示任务进度，通过random.randint()设置sleep时间，使得spider更加安全。全代码如下：

import os

import time

import random

import requests

from lxml import etree

#准备部分

#1.headers

headers={'User-Agent':'Mozilla/5.0 (Windows NT 10.0; Win64; x64; rv:68.0) Gecko/20100101 Firefox/68.0'}

#1.获取IP地址

html=requests.get('https://www.kuaidaili.com/free').content.decode('utf8')

tree = etree.HTML(html)

ip = tree.xpath("//td[@data-title='IP']/text()")

port=tree.xpath("//td[@data-title='PORT']/text()")

model=tree.xpath("//td[@data-title='类型']/text()")

#2.获取CSDN文章url地址   ChildrenUrl[]

url='https://blog.csdn.net/weixin_43576564'

response=requests.get(url,headers=headers)

Home=response.content.decode('utf8')

Home=etree.HTML(Home)

urls=Home.xpath("//div[@class='article-item-box csdn-tracking-statistics']/h4/a/@href")

ChildrenUrl=[]

for i in range(1,len(urls)):

    ChildrenUrl.append(urls[i])

oldtime=time.gmtime()

browses=int(input("输入需要访问次数："))

browse=0

#3.循环伪装ip并爬取文章

for i in range(1,len(model)):

    #设计代理ip

    proxies={model[i]:'{}{}'.format(ip[i],port[i])}

    for Curl in ChildrenUrl:

        try:

            browse += 1

            print("进度：{}/{}".format(browse,browses),end="\t")

            #遍历文章

            response=requests.get(Curl,headers=headers,proxies=proxies)

            #获取访问人数

            look=etree.HTML(response.content)

            Nuwmunber=look.xpath("//div[@class='grade-box clearfix']/dl[2]/dd/text()")

            count=Nuwmunber[0].strip()

            print("总浏览量：{}".format(count),end="\t")

            '''

            重新实现

            #每个IP进行一次查询

            if Curl==ChildrenUrl[5]:

                ipUrl='http://www.ip138.com/'

                response=requests.get(ipUrl,proxies=proxies)

                iphtml=response.content

                ipHtmlTree=etree.HTML(iphtml)

                ipaddress=ipHtmlTree.xpath("//p[@class='result']/text()")

                print(ip[i],ipaddress)

            '''

            i = random.randint(5, 30)

            print("间隔{}秒".format(i),end="\t")

            time.sleep(i)

            print("当前浏览文章地址:{}".format(Curl))

            if browse == browses:

                print("已完成爬取任务,共消耗{}秒".format(int(time.perf_counter())))

                os._exit(0)

        except:

            print('error')

            os._exit(0)

    #打印当前代理ip

    print(proxies)

实际运行效果图：

python requests、xpath爬虫增加博客访问量的更多相关文章

Python爬虫小实践：爬取任意CSDN博客所有文章的文字内容（或可改写为保存其他的元素），间接增加博客访问量
Python并不是我的主业,当初学Python主要是为了学爬虫,以为自己觉得能够从网上爬东西是一件非常神奇又是一件非常有用的事情,因为我们可以获取一些方面的数据或者其他的东西,反正各有用处. 这两天闲 ...
python之刷博客访问量
通过写刷访问量学习正则匹配说明信息说明:仅仅是为了熟悉正则表达式以及网页结构,并不赞成刷访问量操作. 1.刷访问量第一版 1.1 确定网页url结构,构造匹配模式串首先是要确定刷的网页.第一版实 ...
python编写的自动获取代理IP列表的爬虫-chinaboywg-ChinaUnix博客
python编写的自动获取代理IP列表的爬虫-chinaboywg-ChinaUnix博客 undefined Python多线程抓取代理服务器 | Linux运维笔记 undefined java如 ...
用Python和Django实现多用户博客系统（二）——UUBlog
这次又更新了一大部分功能,这次以app的形式来开发. 增加博客分类功能:博客关注.推荐功能(ajax实现) 增加二级频道功能更多功能看截图及源码,现在还不完善,大家先将就着看.如果大家有哪些功能觉的 ...
Orchard官方文档翻译(八) 为站点增加博客
原文地址:http://docs.orchardproject.net/Documentation/Adding-a-blog-to-your-site 想要查看文档目录请用力点击这里最近想要学习了 ...
这几天有django和python做了一个多用户博客系统（可选择模板）
这几天有django和python做了一个多用户博客系统(可选择模板) 没完成,先分享下断断续续2周时间吧,用django做了一个多用户博客系统,现在还没有做完,做分享下,以后等完善了再慢慢说做的 ...
python环境变量配置 - CSDN博客
一.下载: 1.官网下载python3.0系列(https://www.python.org/) 2.下载后图标为: 二.安装: Window下: 1.安装路径: 默认安装路径:C:\python35 ...
(最新)使用爬虫刷CSDN博客访问量——亲测有效
说明:该篇博客是博主一字一码编写的,实属不易,请尊重原创,谢谢大家! 1.概述前言:前两天刚写了第一篇博客https://blog.csdn.net/qq_41782425/article/deta ...
Python网络数据采集（1）：博客访问量统计
前言 Python中能够爬虫的包还有很多,但requests号称是“让HTTP服务人类”...口气不小,但的确也很好用. 本文是博客里爬虫的第一篇,实现一个很简单的功能:获取自己博客主页里的访问量. ...

随机推荐

client,offset,scroll系列
client(客户端),offset(偏移),scroll(滚动)1.client系列 clientTop 内容区域到边框顶部的距离 ,说白了,就是边框的高度 clientLeft 内容区域到边框左部 ...
Python自学day-5
电影推荐: 阿甘正传辛德勒名单肖申克的救赎勇敢的心角斗士美国丽人教父指环王钢琴师血钻战争之王 ...
SSM(五)Mybatis配置缓存
1.在没有配置的情况下,mybatis默认开启一级缓存. Object object=mapper.getXxx(object); Object object2=mapper.getXxx(objec ...
前端js倒计时（精确到毫秒）
话不多说,直接上代码: 有需要直接拿走, <html> <head> <style> div{ width:100%; text-align:center; fon ...
vSphere Client克隆虚拟机
免费的VMWare ESXi5.5非常强大,使用ESXi经常会遇到这样的问题,我需要建立多个虚拟机,系统一个一个安装很麻烦.VMware ESXi.VMware vCenter Server 和 vS ...
趣解 ceph rgw multisite data sync 机制
multisite是ceph rgw对象数据异地容灾备份的一个有效方案,笔者希望深入理解该技术,并应用于生产环境中,然而rgw的这部分代码晦涩难懂,笔者多次尝试阅读,仍云里雾里不解其意,最终流着泪咬着 ...
数据库root密码删除
1 打开mysql.exe和mysqld.exe所在的文件夹,复制路径地址 2 打开cmd命令提示符,进入上一步mysql.exe所在的文件夹. 3 输入命令 mysqld --skip-g ...
leadcode的Hot100系列--78. 子集--回溯
上一篇说了使用位运算来进行子集输出,这里使用回溯的方法来进行排序. 回溯的思想,我的理解就是: 把解的所有情况转换为树或者图,然后用深度优先的原则来对所有的情况进行遍历解析. 当然,因为问题中会包涵这 ...
Spring Boot 最流行的 16 条实践解读，你值得收藏！
Spring Boot是最流行的用于开发微服务的Java框架.在本文中,我将与你分享自2016年以来我在专业开发中使用Spring Boot所采用的最佳实践.这些内容是基于我的个人经验和一些熟知的Sp ...
orm的操作
ORM的对应关系类 —— > 表对象 ——> 记录(数据行) 属性 ——> 字段 class Book(model.Model): title=models.Char ...

python requests、xpath爬虫增加博客访问量

python requests、xpath爬虫增加博客访问量的更多相关文章

随机推荐

热门专题