盖得化工----requests/bs4---采集二级网址

Python爬虫视频教程零基础小白到scrapy爬虫高手-轻松入门

https://item.taobao.com/item.htm?spm=a1z38n.10677092.0.0.482434a6EmUbbW&id=564564604865


# -*- coding: utf-8 -*-

"""

Created on Mon May  9 09:14:32 2016

@author: Administrator

"""

import requests,bs4,csv,time,selenium,random

from selenium import webdriver

from selenium.webdriver.common.keys import Keys

site_hubei="http://china.guidechem.com/suppliers/list_catid-21_area-%E6%B9%96%E5%8C%97"

pages_hubei=31

#所有公司的链接网址_存储列表

list_corporation_link=[]

def Get_sites(site,pages):

    list_pages=[]

    for page in range(1,pages+1):

        thePage=site+"-"+"p"+str(page)+".html"

        list_pages.append(thePage)

    return list_pages

#采集一页所有公司的二级网址

def Get_secondLinks(pageSite):

    res=requests.get(pageSite)

    soup=bs4.BeautifulSoup(res.text,"lxml")

    linkElems=soup.select(".dblue")

    secondLinks=[i.get("href") for i in linkElems]

    return secondLinks

#了正确格式写入网页到csv，  row内容添加一个索引号

#'http://show.guidechem.com/hbsthcsales/'处理为[1,'http://show.guidechem.com/hbsthcsales/']

def List_process(list1):

    len_list1=len(list1)

    list2=[]

    for i in range(len_list1):

        content=(i+1,list1[i])

        list2.append(content)

    return list2    

#把一页内容写入csv文档 ,list_tableContent为二维列表[[a],[b],[c]]

def Write_table_to_csv(fileName,list_tableContent):

    #对列表格式修改，字符串写入的格式不对

    file=open(fileName,'w',newline='')

    writer1=csv.writer(file)

    writer1.writerows(list_tableContent)

    file.close()         

#构造所有湖北页面网址

list_pages_hubei=Get_sites(site_hubei,pages_hubei)

#首页

firstPage=list_pages_hubei[0]

#获取所有二级网址，先测试前十，所有页数：len(list_pages_hubei)

#正常语句for i in range(len(list_pages_hubei))：

for i in range(20,len(list_pages_hubei)):

    pageSite=list_pages_hubei[i]

    secondLinks=Get_secondLinks(pageSite)

    secondLinks1=List_process(secondLinks)

    fileName=str(i+1)+".csv"

    Write_table_to_csv(fileName,secondLinks1)

    list_corporation_link.append(secondLinks1)

    time.sleep(random.randint(5,10))

成功采下来，但网站有反爬虫设置，翻页时间要延长

更换ip就搞定了，但有一个网址采集失败，延长时间10-15秒翻页更准确

盖得化工----requests/bs4---采集二级网址的更多相关文章

盖得化工--selenium翻页测试
Python爬虫视频教程零基础小白到scrapy爬虫高手-轻松入门 https://item.taobao.com/item.htm?spm=a1z38n.10677092.0.0.482434a6E ...
python 网络爬虫全流程教学，从入门到实战（requests+bs4+存储文件）
python 网络爬虫全流程教学,从入门到实战(requests+bs4+存储文件) requests是一个Python第三方库,用于向URL地址发起请求 bs4 全名 BeautifulSoup4, ...
requests bs4 爬取资讯图片
#!/usr/bin/env python # Version = 3.5.2 # __auth__ = '无名小妖' import requests from bs4 import Beautifu ...
requests + bs4 爬取豌豆荚所有应用的信息
1.分析豌豆荚的接口的规律 - 获取所有app的接口url 2.往每一个接口发送请求,获取json数据解析并提取想要的数据 app_data: 1.图标 app_img_url 2.名字 app_n ...
Python+Requests+Bs4（解析）爬取某诗词信息（数据分析二）
1.环境安装 - 需要将pip源设置为国内源,阿里源.豆瓣源.网易源等 - windows (1)打开文件资源管理器(文件夹地址栏中) (2)地址栏上面输入 %appdata% (3)在这里面新建一个 ...
requests+bs4爬取豌豆荚排行榜及下载排行榜app
爬取排行榜应用信息爬取豌豆荚排行榜app信息 - app_detail_url - 应用详情页url - app_image_url - 应用图片url - app_name - 应用名称 - ap ...
采集化工内容写入TXT文本
Python爬虫视频教程零基础小白到scrapy爬虫高手-轻松入门 https://item.taobao.com/item.htm?spm=a1z38n.10677092.0.0.482434a6E ...
requests+django+bs4实现一个web微信的功能
前言: 今天我们利用requests模块+django+bs4浏览器来实现一个web微信的基本功能,主要实现的功能如下 a.实现返回二维码 b.实现手机扫码后二维码变成变成头像 c.实现手机点击登陆成 ...
使用requests爬取梨视频、bilibili视频、汽车之家，bs4遍历文档树、搜索文档树，css选择器
今日内容概要使用requests爬取梨视频 requests+bs4爬取汽车之家 bs4遍历文档树 bs4搜索文档树 css选择器内容详细 1.使用requests爬取梨视频 # 模拟发送http ...

随机推荐

《linux内核设计与分析》内核模块编程
内核模块编程一.准备工作虚拟机:VMware Workstation 12操作系统:ubuntu当前内核版本:linux-headers-4.4.0-22-generic 二.有关于内核模块的知识 ...
Daily Scrum 12.8
Member Task on 12.08 Task on 12.09 仇栋民参与M2阶段第二次决策会议开始Task964 : 活动评论功能雏形康家华开始Task982 : 完成活动界面的设计稿 ...
ABP框架用Dapper实现通过SQL访问数据库
ABP的框架(2) - 访问数据库为了防止不提供原网址的转载,特在这里加上原文链接:http://www.cnblogs.com/skabyy/p/7517397.html 本篇我们实现数据库的 ...
CENTOS7修改ip
编辑网卡设置 vi /etc/sysconfig/network-scripts/ifcfg-ens33 编辑内容 vi /etc/sysconfig/network-scripts/ificg-en ...
软件工程_9th weeks
PSP DATE START_TIME END_TIME EVENT TYPE TIME 4.30-5.3 5:30 4:00 旅游娱乐 72h 5.3 14:00 17:0 ...
loadrunner报错
Action.c(1516): Error -27727: Step download timeout (120 seconds) has expired when downloading resou ...
微软开放 6 万项 Linux 专利，有哪些是我们该注意的？
导读上周,微软宣布正式加入 Open Invention Network (“OIN”) 社区,开放其 6 万多项 Linux 专利.消息一出,许多人疑惑微软为什么要这么做?作为普通开发者,是否能使 ...
C++ 日期时间使用
#include <time.h> #include <stdio.h> #include <iostream> #include <string> # ...
MySQL 5.7双主同步部分表
参考:http://www.jb51.net/article/122892.htm?pc 前言: 我们要配置双主同步的mysql服务器. 暂时叫做,mysql1和mysql2吧. 一 mysql的配 ...
MT【238】内心轨迹
已知$F_1,F_2$为椭圆$C:\dfrac{x^2}{4}+\dfrac{y^2}{3}=1$的左右焦点,点$P$在椭圆$C$上移动时,$\Delta{F_1PF_2}$的内心$I$的轨迹方程为_ ...

盖得化工----requests/bs4---采集二级网址

盖得化工----requests/bs4---采集二级网址的更多相关文章

随机推荐

热门专题