大规模数据爬取 -- Python

Python书写爬虫，目的是爬取所有的个人商家商品信息及详情，并进行数据归类分析

整个工作流程图：

第一步：采用自动化的方式从前台页面获取所有的频道

from bs4 import BeautifulSoup

import requests

#1、找到左侧边栏所有频道的链接

start_url = 'http://hz.58.com/sale.shtml'

url_host = 'http://hz.58.com'

def get_channel_urls(url):

    wb_data = requests.get(start_url)

    soup = BeautifulSoup(wb_data.text,'lxml')

    links = soup.select('ul.ym-mainmnu > li > span > a["href"]')

    for link in links:

        page_url = url_host + link.get('href')

        print(page_url)

    #print(links)

get_channel_urls(start_url)

channel_list = '''

    http://hz.58.com/shouji/

    http://hz.58.com/tongxunyw/

    http://hz.58.com/danche/

    http://hz.58.com/diandongche/

    http://hz.58.com/diannao/

    http://hz.58.com/shuma/

    http://hz.58.com/jiadian/

    http://hz.58.com/ershoujiaju/

    http://hz.58.com/yingyou/

    http://hz.58.com/fushi/

    http://hz.58.com/meirong/

    http://hz.58.com/yishu/

    http://hz.58.com/tushu/

    http://hz.58.com/wenti/

    http://hz.58.com/bangong/

    http://hz.58.com/shebei.shtml

    http://hz.58.com/chengren/

'''

第二步：通过第一步获取的所有频道去获取所有的列表详情，并存入URL_list表中，同时获取商品详情信息

from bs4 import BeautifulSoup

import requests

import time

import pymongo

client = pymongo.MongoClient('localhost',27017)

ceshi = client['ceshi']

url_list = ceshi['url_list']

item_info = ceshi['item_info']

def get_links_from(channel,pages,who_sells=0):

    #http://hz.58.com/shouji/0/pn7/

    list_view = '{}{}/pn{}/'.format(channel,str(who_sells),str(pages))

    wb_data = requests.get(list_view)

    time.sleep(1)

    soup = BeautifulSoup(wb_data.text,'lxml')

    links = soup.select('td.t > a[onclick]')

    if soup.find('td','t'):

        for link in links:

            item_link = link.get('href').split('?')[0]

            url_list.insert_one({'url':item_link})

            print(item_link)

    else:

        pass

        # Nothing

def get_item_info(url):

    wb_data = requests.get(url)

    soup = BeautifulSoup(wb_data.text,'lxml')

    no_longer_exist = '商品已下架' in soup

    if no_longer_exist:

        pass

    else:

        title = soup.title.text

        price = soup.select('span.price_now > i')[0].text

        area = soup.select('div.palce_li > span > i')[0].text

        #url_list.insert_one({'title':title,'price':price,'area':area})

        print({'title':title,'price':price,'area':area})

#get_links_from('http://hz.58.com/pbdn/',7)

#get_item_info('http://zhuanzhuan.58.com/detail/840577950118920199z.shtml')

第三步：采用多进程的方式的main主函数入口

from multiprocessing import Pool

from channel_extract import channel_list

from page_parsing import get_links_from

def get_all_links_from(channel):

    for num in range(1,31):

        get_links_from(channel,num)

if __name__ == '__main__':

    pool = Pool()

    pool.map(get_all_links_from,channel_list.split())

第四步：实时对获取到的数据进行监控

from time import sleep

from page_parsing import url_list

while True:

    print(url_list.find().count())

    sleep(5)

具体运行效果：

大规模数据爬取 -- Python的更多相关文章

模拟登陆+数据爬取 (python+selenuim)
以下代码是用来爬取LinkedIn网站一些学者的经历的,仅供参考,注意:不要一次性大量爬取会被封号,不要问我为什么知道 #-*- coding:utf-8 -*- from selenium impo ...
python实现人人网用户数据爬取及简单分析
这是之前做的一个小项目.这几天刚好整理了一些相关资料,顺便就在这里做一个梳理啦~ 简单来说这个项目实现了,登录人人网并爬取用户数据.并对用户数据进行分析挖掘,终于效果例如以下:1.存储人人网用户数据( ...
芝麻HTTP：JavaScript加密逻辑分析与Python模拟执行实现数据爬取
本节来说明一下 JavaScript 加密逻辑分析并利用 Python 模拟执行 JavaScript 实现数据爬取的过程.在这里以中国空气质量在线监测分析平台为例来进行分析,主要分析其加密逻辑及破解 ...
Python爬虫股票数据爬取
前一篇提到了与股票数据相关的可能几种数据情况,本篇接着上篇,介绍一下多个网页的数据爬取.目标抓取平安银行(000001)从1989年~2017年的全部财务数据. 数据源分析地址分析 http://m ...
人人贷网的数据爬取（利用python包selenium）
记得之前应同学之情,帮忙爬取人人贷网的借贷人信息,综合网上各种相关资料,改善一下别人代码,并能实现数据代码爬取,具体请看我之前的博客:http://www.cnblogs.com/Yiutto/p/5 ...
用Python介绍了企业资产情况的数据爬取、分析与展示。
前言文的文字及图片来源于网络,仅供学习.交流使用,不具有任何商业用途,版权归原作者所有,如有问题请及时联系我们以作处理. 作者:张耀杰 PS:如有需要Python学习资料的小伙伴可以加点击下方链接自 ...
Python爬虫入门教程 15-100 石家庄政民互动数据爬取
石家庄政民互动数据爬取-写在前面今天,咱抓取一个网站,这个网站呢,涉及的内容就是网友留言和回复,特别简单,但是网站是gov的.网址为 http://www.sjz.gov.cn/col/14900 ...
quotes 整站数据爬取存mongo
安装完成scrapy后爬取部分信息已经不能满足躁动的心了,那么试试http://quotes.toscrape.com/整站数据爬取第一部分项目创建 1.进入到存储项目的文件夹,执行指令 scra ...
python3编写网络爬虫13-Ajax数据爬取
一.Ajax数据爬取 1. 简介:Ajax 全称Asynchronous JavaScript and XML 异步的Javascript和XML. 它不是一门编程语言,而是利用JavaScript在 ...

随机推荐

mysql过滤复制
【Spring】XML方式实现（无参构造有参构造）和注解方式实现 IoC
文章目录 Spring IoC的实现方式 XML方式实现通过无参构造方法来创建 1.编写一个User实体类 2.编写我们的spring文件 3.测试类 UserTest.java 4.测试结果通过 ...
【Oracle】增量备份和全库备份怎么恢复数据库
1差异增量实验示例 1.1差异增量备份为了演示增量备份的效果,我们在执行一次0级别的备份后,对数据库进行一些改变. 再执行一次1级别的差异增量备份: 执行完1级别的备份后再次对数据库进行更改: 再执 ...
Upload - Labs (上)
Pass - 01: 1.尝试上传一个php文件:aaa.php,发现只允许上传某些图片类型,用bp抓包,发现http请求都没通过burp就弹出了不允许上传的提示框,这表明验证点在前端,而不在服务端 ...
入门OJ：扫雪
扫雪1 题目描述大雪履盖了整个城市,市政府要求冬季服务部门尽快将一些街道(列在一份清单中)的积雪清除掉以恢复交通,整个城市由许多交叉路口和街道构成,当然任意两个交叉路口都是直接或间接连通的,清单给出 ...
2020年12月18号--21号人工智能（深度学习DeepLearning）python、TensorFlow技术实战
深度学习DeepLearning(Python)实战培训班时间地点: 2020 年 12 月 18 日-2020 年 12 月 21日 (第一天报到授课三天:提前环境部署电脑测试) 一.培训方式 ...
请谨慎使用 avaliable 方法来申请缓冲区
问题今天开始尝试用 Java 写 http 服务器,开局就遇到 Bug. 我先写了一个多线程的.BIO 的 http 服务器,其中接收请求的部分,会将请求的第一行打印出来. 下面是浏览器发出的请求和 ...
Java Optional使用指南
提到NullPointerException(简称NPE)异常,相信每个Java开发人员都不陌生,从接触编程的第1天起,它就和我们如影随形,最近处理的线上bug中,有不少都是对象没判空导致的NullP ...
删除HDFS中指定的文件。
1 import java.text.SimpleDateFormat; 2 import java.util.Scanner; 3 4 import org.apache.hadoop.fs.Fil ...
扩展PE头属性说明
CRC检测的算法就是checksum 以下是DllCharacteristics的参数说明

大规模数据爬取 -- Python

Python书写爬虫，目的是爬取所有的个人商家商品信息及详情，并进行数据归类分析

大规模数据爬取 -- Python的更多相关文章

随机推荐

热门专题