爬取http://bj.58.com/pbdn/0/pn2/中除转转、推广商品以外的产品信息,因为转转和推广的详情信息不规范,需要另外写一个方法存放,后期补上,详情页如下

这周学习了爬虫,但是遇到一些js,requests方法无法渲染,比如浏览量,所以结合selenium+phantomjs渲染网页,获取信息

上代码,注释中详细解释:

from selenium import webdriver
from bs4 import BeautifulSoup
import re class GetPageInfo(object):
‘这个类主要是定义爬网页的方法,定义一个规范,以后爬取网页方法就重写这个类就行’
def index_page(self):
'获取所有每个网页的url'
        ‘这周暂时只爬取一页的所有记录详细信息,所以该方法暂时不用’
pass
def detail_page(self):
'从每个index_page中,获取每个网页的每条记录的url'
pass
def domain_page(self):
'从每个detail_page中,获取每条记录的详细信息' class TongChengFirstHomework(GetPageInfo):
#传入一个浏览器
def __init__(self,browser=None):
self.browser= browser #初始化一个浏览器
def detail_page(self,whoshell=0,page=1):
'woshell:0代表个人销售,1代表商家销售;page当前页'
#http://sz.58.com/pbdn/0/pn1/
url= 'http://sz.58.com/pbdn/{}/pn{}/'.format(str(whoshell),str(page))
        #此处使用了format函数,详细用法可以找找百度
browser.get(url) #打开网页
html = browser.page_source #获取网页的所有内容
soup = BeautifulSoup(html,'lxml') #用BeautifulSoup解析网页,转回我们平时熟悉的爬虫方法
detail_urls = soup.select('#infolist a.t') #获取某一页下的所有记录
detail_url_list=[]
for row in detail_urls:
detail_url = row.get('href')
if ('Mzhuanzhuan' not in str(detail_url)) and ('jump' not in detail_url):
#获取每一条记录的url
detail_url_list.append(detail_url)
print(detail_url_list)
return detail_url_list def domain_page(self,detail_url):
detail = {} #用来存放详细信息的字典 browser.get(detail_url)
html = browser.page_source
soup = BeautifulSoup(html,'lxml')
desc_product = soup.select('div.col_sub.sumary > ul > li:nth-of-type(2) > div.su_con > span')
detail={
"provice":soup.select('.crb_i > a')[0].get_text(),
"title":soup.select('#content > div.person_add_top.no_ident_top > div.per_ad_left > div.col_sub.mainTitle > h1')[0].get_text(),
"date":soup.select('.time')[0].get_text(),
"views":soup.select('#totalcount')[0].get_text(),
"price":soup.select('span.price.c_f50')[0].get_text(),
"condition":list(desc_product[0].stripped_strings) if '-' not in str(soup.select('div.col_sub.sumary > ul > li:nth-of-type(2) > div.su_con > span')) else None,
"area":list(soup.select('.c_25d')[0].stripped_strings) if soup.find_all('span','c_25d') else None,
#这里是可以直接在字典里使用if函数,类似列表解析式
"seller":soup.select('#divContacter > ul > ul > li > a')[0].get_text(),
}
print(detail)
return detail #返回所有详细信息 try:
cap = webdriver.DesiredCapabilities.PHANTOMJS #DesiredCapabilities是一个字典,可以对浏览器进行设置 cap['phantomjs.page.settings.loadImages']=False #设置浏览器不加载图片
cap['phantomjs.page.settings.userAgent ']="Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/45.0.2454.101 Safari/537.36" #设置useragent
cap['phantomjs.page.settings.diskCache'] =True #设置浏览器开启缓存
browser = webdriver.PhantomJS(desired_capabilities=cap) #使用desired_capabilities初始化浏览器
tongcheng=TongChengFirstHomework(browser) #实例一个tongchengfirskhomework对象
for detail_page in tongcheng.detail_page(page=2):
tongcheng.domain_page(detail_page)
print(detail_page) finally:
browser.close() #记得要关掉浏览器
 

python3.4+selenium爬58同城(一)的更多相关文章

  1. python3.4+pyspider爬58同城(二)

    之前使用python3.4+selenium实现了爬58同城的详细信息,这次用pyspider实现,网上搜了下,目前比较流行的爬虫框架就是pyspider和scrapy,但是scrapy不支持pyth ...

  2. Python 爬58同城 城市租房信息

    爬取完会自动生成csv电子表格文件,含有房价.押付.链接等信息 环境 py2.7 pip install lxml pip install cssselect   #coding:utf-8 impo ...

  3. 使用Python3.x抓取58同城(南京站)的演出票的信息

    #!/usr/bin/env python #-*-coding: utf-8 -*- import re import urllib.request as request from bs4 impo ...

  4. python3爬虫-爬取58同城上所有城市的租房信息

    from fake_useragent import UserAgent from lxml import etree import requests, os import time, re, dat ...

  5. scrapy爬取58同城二手房问题与对策

    测试环境: win10,单机爬取,scrapy1.5.0,python3.6.4,mongodb,Robo 3T 其他准备: 代理池:测试环境就没有用搭建的flask抓代理,因为我找到的几个免费网站有 ...

  6. 用Python写爬虫爬取58同城二手交易数据

    爬了14W数据,存入Mongodb,用Charts库展示统计结果,这里展示一个示意 模块1 获取分类url列表 from bs4 import BeautifulSoup import request ...

  7. 养只爬虫当宠物(Node.js爬虫爬取58同城租房信息)

    先上一个源代码吧. https://github.com/answershuto/Rental 欢迎指导交流. 效果图 搭建Node.js环境及启动服务 安装node以及npm,用express模块启 ...

  8. 利用python爬取58同城简历数据

    利用python爬取58同城简历数据 利用python爬取58同城简历数据 最近接到一个工作,需要获取58同城上面的简历信息(http://gz.58.com/qzyewu/).最开始想到是用pyth ...

  9. Python+Selenium爬取动态加载页面(1)

    注: 最近有一小任务,需要收集水质和水雨信息,找了两个网站:国家地表水水质自动监测实时数据发布系统和全国水雨情网.由于这两个网站的数据都是动态加载出来的,所以我用了Selenium来完成我的数据获取. ...

随机推荐

  1. windows下给用非exe格式的文件安装网卡驱动

    之前我只知道用驱动精灵来给新机器装网卡驱动,或者用下载好的exe格式文件给非新机器装网卡驱动. 今天下载了一个非exe格式的文件,就不知道怎么装了,百度了一下才知道,可以通过:”设备管理器“-> ...

  2. 实验八 sqlite数据库操作

    实验报告 课程名称 基于Android平台移动互联网开发 实验日期 2016年5月3日 实验项目名称 SQLite数据库操作 实验地点 S30010 实验类型 □验证型    √设计型    □综合型 ...

  3. XJOI网上同步训练DAY3 T1

    思路:看来我真是思博了,这么简单的题目居然没想到,而且我对复杂度的判定也有点问题.. 首先我们选了一个位置i的b,那一定只对i和以后的位置造成改变,因此我们可以这样看: 我们从前往后选,发现一个位置的 ...

  4. BZOJ 1502 月下柠檬树(simpson积分)

    题目链接:http://61.187.179.132/JudgeOnline/problem.php?id=1502 题意:给出如下一棵分层的树,给出每层的高度和每个面的半径.光线是平行的,与地面夹角 ...

  5. android批量文件上传(android批量图片上传)

    项目中多处用到文件批量上传功能,今天正好解决了此问题,在此写出来,以便日后借鉴. 首先,以下架构下的批量文件上传可能会失败或者不会成功:   1.android客户端+springMVC服务端:服务端 ...

  6. lazy load 图片延迟加载 跟随滚动条

    http://plugins.jquery.com/lazyload/ Jquery.LazyLoad.js插件参数详解: 1,用图片提前占位 placeholder : "img/grey ...

  7. Womany女人迷 | 氪加

    Womany女人迷 | 氪加 Womany女人迷

  8. Linux Security模块

    一.Linux Security Modules Linux Security Modules (LSM) 是一种 Linux 内核子系统,旨在将内核以模块形式集成到各种安全模块中.在 2001 年的 ...

  9. SpringMVC+easyUI CRUD 添加数据C

    接一篇文章,今天上午实现了添加数据.以下是Jsp.里面主要是看newUser()和saveUser().注意这函数里的url,newUser()里面去掉url属性.还要注意的一个问题 <div ...

  10. 【Struts2】新建一个Struts2工程,初步体验MVC

    实现目标 地址栏输入http://localhost:88/Struts2HelloWorld/helloworld.jsp 输入用户名,交由http://localhost:88/Struts2He ...