python爬虫基础之一（爬淘宝）

没想到python如此强大，

今天看一会视频学会了一段python爬虫

这就是我今天学到的内容爬去淘宝网关于书包的一些信息，包括价格，

#coding=utf-8

import requests#导入requests模块

import re#导入re模块

#提取网页代码通用表达式

def getHTMLText(url):

    try:

        r = requests.get(url,timeout=30)#获取页面的url链接

        r.raise_for_status()

        r.encoding = r.apparent_encoding

        return r.text

    except:

        return ""

#提取Html中的主要信息

def parseHtml(ilt,html):

    try:#下面是正则表达式处理文字信息

        plt = re.findall(r'\"view_price\"\:\"[\d\.]*\"',html)

        flt = re.findall(r'\"raw_title\"\:\".*?\"',html)

        for i in range(len(plt)):

            price =  eval(plt[i].split(":")[1])#eval 可以将前后的”“去掉

            name = eval(flt[i].split(":")[1])#split 可以分割字符串到列表红

            ilt.append([price,name])

    except:

        print("")

#将格式打印出来

def printGoodsPrice(ilt):

    try:#让排版更清晰

        tplt = "{:4}\t{:8}\t{:16}"

        print(tplt.format("序号","价格","商品名称"))

        count = 0;

        for g in ilt:

            count = count+1

            print(tplt.format(count,g[0],g[1]))

    except:

        print("")

def main():

    goods = '书包'#提取的商品

    depth = 2 #提取的深度

    url = 'https://s.taobao.com/search?q='+goods

    ilt = []

    i = 0

    for i in range(depth):

        try:

            irl = url + '&s=' +  str(i*44)#这个地方的改动可以影响提取内容

            html = getHTMLText(irl)

            parseHtml(ilt,html)

        except:

            continue

    printGoodsPrice(ilt)#打印处理

main()

python爬虫基础之一（爬淘宝）的更多相关文章

python爬虫-基础入门-爬取整个网站《3》
python爬虫-基础入门-爬取整个网站<3> 描述: 前两章粗略的讲述了python2.python3爬取整个网站,这章节简单的记录一下python2.python3的区别 python ...
python爬虫-基础入门-爬取整个网站《2》
python爬虫-基础入门-爬取整个网站<2> 描述: 开场白已在<python爬虫-基础入门-爬取整个网站<1>>中描述过了,这里不在描述,只附上 python3 ...
python爬虫-基础入门-爬取整个网站《1》
python爬虫-基础入门-爬取整个网站<1> 描述: 使用环境:python2.7.15 ,开发工具:pycharm,现爬取一个网站页面(http://www.baidu.com)所有数 ...
Python爬虫之定时抢购淘宝商品
Python爬虫之定时抢购淘宝商品 import time from selenium import webdriver import datetime class Spider: def __ini ...
python爬虫基础应用----爬取校花网视频
一.爬虫简单介绍爬虫是什么? 爬虫是首先使用模拟浏览器访问网站获取数据,然后通过解析过滤获得有价值的信息,最后保存到到自己库中的程序. 爬虫程序包括哪些模块? python中的爬虫程序主要包括,re ...
Python爬虫基础--分布式爬取贝壳网房屋信息(Client)
1. client_code01 2. client_code02 3. 这个时候运行多个client就可以分布式进行数据爬取.
Python爬虫基础--分布式爬取贝壳网房屋信息(Server)
1. server_code01 2. server_code02 3. server_code03
【转载】教你分分钟学会用python爬虫框架Scrapy爬取心目中的女神
原文:教你分分钟学会用python爬虫框架Scrapy爬取心目中的女神本博文将带领你从入门到精通爬虫框架Scrapy,最终具备爬取任何网页的数据的能力.本文以校花网为例进行爬取,校花网:http:/ ...
Python爬虫基础
前言 Python非常适合用来开发网页爬虫,理由如下: 1.抓取网页本身的接口相比与其他静态编程语言,如java,c#,c++,python抓取网页文档的接口更简洁:相比其他动态脚本语言,如perl ...
python爬虫-基础入门-python爬虫突破封锁
python爬虫-基础入门-python爬虫突破封锁 >> 相关概念 >> request概念:是从客户端向服务器发出请求,包括用户提交的信息及客户端的一些信息.客户端可通过H ...

随机推荐

springmvc错误集锦-dubbo包含低版本的spring包，依赖的时候应该排除Caused by: java.lang.reflect.MalformedParameterizedTypeException
dubbo 常见错误 1. Caused by: java.lang.reflect.MalformedParameterizedTypeException 启动时报错,原因是dubbo 依赖 spr ...
NopCommerce 3.4中商品详情页面单选框、复选框的美化
先上图给大家看看效果,点这里打开网站(后期可能会找不到这个商品,现在再测试阶段) 现在你能看到的这个页面中,尺寸.文本描述是单选框(属性是我乱写的名字),上门安装是复选框.效果就看到这里,请君跳过图片 ...
hadoop-2.2.0 HA配置
采用的是4台真实机器: namenode:qzhong node27 datanode:qzhong node27 node100 node101 操作系统环境:qzhong(Ubuntu-14.0 ...
Oracle中常用的语句
1.查询锁表 SELECT a.object_name,b.session_id,c.serial#,c.program,c.username,c.command,c.machine,c.lockwa ...
forEach for...in for...of
forEach orEach 方法为数组中含有有效值的每一项执行一次 callback 函数,那些已删除(使用 delete 方法等情况)或者从未赋值的项将被跳过(不包括那些值为 undefined ...
简单几行代码使用百度地图API接口分页获取信息
首发于: 万能助手扩展开发:使用百度地图API接口分页获取信息_电脑计算机编程入门教程自学 http://jianma123.com/viewthread.aardio?threadid=426 使用 ...
实现一个shell程序
实现一个自己的shell程序,这个程序有这些功能:解释执行命令,支持输入输出重定向,支持管道,后台运行程序.当运行该程序后,它支持以下的命令格式: 1.单个命令,如:ls.2.带l到多个参数的命令, ...
Java实现“睡排序”——线程池Executors的使用
前提之前在知乎上看见一个有意思的排序算法——睡排序. 睡排序最早好像是4chan上一个用户用shell脚本实现的: 算法思想简洁明了:利用进程的sleep来实现越大的数字越迟输出. 虽然像2L说的 ...
Linq 综合写法
var queryCount = (from pv in db.Province join pc in (from cc in ((from v in db.ERPStockProdu ...
帝国cms教程父栏目和子栏目都能在当前栏目高亮
首先在/e/class/userfun.php这个文件里面加上下面代码.上面父栏目的,下面子栏目的.红色代表css样式.自定义吧 function currentPage($classid,$this ...

python爬虫基础之一（爬淘宝）

python爬虫基础之一（爬淘宝）的更多相关文章

随机推荐

热门专题