项目代码

from bs4 import BeautifulSoup

import requests

url_prefix = 'https://knewone.com/discover?page='

infos = []

# 获取单个页面数据

def getAPage(url,data = None):

    web_data = requests.get(url)

    soup = BeautifulSoup(web_data.text,'lxml')

    # print(soup)

    images = soup.select('header > a > img')

    titles = soup.select('section > h4 > a')

    links = soup.select('a.cover-inner')

    likes = soup.select('span.fanciers_count')

    if data == None:

        for image,title,link,like in zip(images,titles,links,likes):

            data = {

                'image':image.get('src'),

                'title':title.get_text(),

                'link':'https://knewone.com' + link.get('href'),

                'like':int(like.get_text())

            }

            print(data)

            infos.append(data)

# 获取多个加载的数据

def getMorePages(start,end):

    for url_suffix in range(start,end):

        getAPage(url_prefix + str(url_suffix))

        print('---------------已经获取{}条数据---------------'.format(len(infos)), sep='\n')

# 获取点赞排名前几的数据

def getInfosByLikes(order,infos =infos):

    infos = sorted(infos,key= lambda info:info['like'],reverse = True)

    for info in infos[:order]:

        print(info['like'],info['title'],info['image'],info['link'])

getMorePages(1,4)

getInfosByLikes(5)

项目特点：

【转载】同步加载、异步加载、延迟加载

爬取的网站链接

KnewOne

-Web-Crawler-training 如果觉得可以，请给我颗star鼓励一下，谢谢！

Python 爬虫练习项目——异步加载爬取的更多相关文章

Python爬虫之JS异步加载
一.判断异步加载方式(常用的JS库) 1. jQuery(70%) # 搜索 jquery 茅塞顿开 <script src="http://ajax.googleapis.com/a ...
[Python爬虫] 使用 Beautiful Soup 4 快速爬取所需的网页信息
[Python爬虫] 使用 Beautiful Soup 4 快速爬取所需的网页信息 2018-07-21 23:53:02 larger5 阅读数 4123更多分类专栏: 网络爬虫版权声明: ...
Python爬虫教程-13-爬虫使用cookie爬取登录后的页面(人人网)（下）
Python爬虫教程-13-爬虫使用cookie爬取登录后的页面(下) 自动使用cookie的方法,告别手动拷贝cookie http模块包含一些关于cookie的模块,通过他们我们可以自动的使用co ...
python爬虫之图片懒加载、selenium和phantomJS
一.什么是图片懒加载在网页中,常常需要用到图片,而图片需要消耗较大的流量.正常情况下,浏览器会解析整个HTML代码,然后从上到下依次加载<img src="xxx"> ...
Python爬虫之图片懒加载技术、selenium和PhantomJS
一.引入 2.概要图片懒加载 selenium phantomJs 谷歌无头浏览器 3.回顾验证码处理流程一.今日详情动态数据加载处理 1.图片懒加载什么是图片懒加载? 案例分析:抓取站长素 ...
Python爬虫-05：Ajax加载的动态页面内容
1. 获取AJAX加载动态页面的内容 1.1. Introduction 如果所爬取的网址是通过Ajax方式加载的,就直接抓包,拿他后面传输数据的文件有些网页内容使用AJAX加载,只要记得,AJAX ...
PYTHON 爬虫笔记八:利用Requests+正则表达式爬取猫眼电影top100（实战项目一）
利用Requests+正则表达式爬取猫眼电影top100 目标站点分析流程框架爬虫实战使用requests库获取top100首页: import requests def get_one_pag ...
Python爬虫实战（2）：爬取京东商品列表
1,引言在上一篇<Python爬虫实战:爬取Drupal论坛帖子列表>,爬取了一个用Drupal做的论坛,是静态页面,抓取比较容易,即使直接解析html源文件都可以抓取到需要的内容.相反 ...
Python爬虫小白入门（六）爬取披头士乐队历年专辑封面-网易云音乐
一.前言前文说过我的设计师小伙伴的设计需求,他想做一个披头士乐队历年专辑的瀑布图. 通过搜索,发现网易云音乐上有比较全的历年专辑信息加配图,图片质量还可以,虽然有大有小. 我的例子怎么都是爬取图片? ...

随机推荐

Hibernate中Query.list()方法报IllegalArgumentException异常
最近在使用Hibernate开发项目,在写好hql语句,并初始化Query对象,执行Query.list()方法时,应用报IllegalArgumentException异常.经网上查询,现已经基本决 ...
leetcode2：线性表
/********************************************** Function:input two array and find the kth value the ...
http请求数据封装
package com.wdm.utils; import java.io.ByteArrayOutputStream; import java.io.IOException; import java ...
存储过程中拼写sql并执行
直接上代码吧,根据不同的条件拼写sql后并执行 ALTER PROCEDURE [dbo].[usp_Statistic_WJB_DZSK_ZT] ( @year int, @half int,--0 ...
CUBA Platform —— 开源的、可靠的企业级应用开发利器
原文:CUBA Platform: An Open-Source Java Framework for Rapid Application Development 翻译:CUBA China CUBA ...
vue做的简单购物车
<code><!DOCTYPE html><html><head lang="en"> <meta charset=" ...
获取访问MySQL的应用
接到业务需求,要我统计哪个应用访问了哪些表,一般来讲可以通过: 1.show full processlist; 2.SELECT HOST FROM information_schema.proce ...
AJAX 教程
AJAX AJAX = Asynchronous JavaScript and XML(异步的 JavaScript 和 XML). AJAX 不是新的编程语言,而是一种使用现有标准的新方法. AJA ...
WCF 创建WCF
一.概述 Windows Communication Foundation(WCF)是由微软发展的一组数据通信的应用程序开发接口,可以翻译为Windows通讯接口,它是.NET框架的一部分.由 .NE ...
Linux多进程之间的文件锁
之前对于文件的操作通常在一个进程中完成,最近需要在两个进程中对同一个文件进行操作.故想到了文件锁. Linux下可以使用flock()函数对文件进行加锁解锁等操作.简单介绍下flock()函数: 表头 ...

Python 爬虫练习项目——异步加载爬取

需要下载代码的可以到我的GitHub上下载 https://github.com/FightingBob/-Web-Crawler-training 如果觉得可以，请给我颗star鼓励一下，谢谢！

Python 爬虫练习项目——异步加载爬取的更多相关文章

随机推荐

热门专题