python爬取商品信息

老严要爬某网购网站的商品信息，正好我最近在学python，就一起写了一个简单的爬虫程序。

需求：某网的商品信息，包括商品名，市场价和售价

工具：python2.7.8，urllib2，re

#coding = utf-8

import urllib2

import re

path = "aaa.txt"

f = open(path, 'w+')

for i in range(4980, 4991):

    print i

    # get webpage content

    url = "http://*" + str(i) + "*"

    page = urllib2.urlopen(url).read()

    # Regular matching

    matchTitle = re.search(r'<dt>(.*?)</dt>', page)

    matchMarketPrice = re.search(r'<del.*?>(.*?)</del>', page)

    matchCurrentPrice = re.search(r'<b>(.*?)</b>', page)

    # save result

    if matchTitle and matchMarketPrice and matchCurrentPrice:

        f.write(matchTitle.group(1) + '\t' + matchMarketPrice.group(1) + '\t' + matchCurrentPrice.group(1) + '\n')

f.close()

　　部分结果显示：

欧莱雅奇焕光感粉嫩透亮修颜霜30ml ¥120.00 109.00

欧莱雅复颜洁面乳125ml	¥130.00	105.00

欧莱雅复颜抗皱紧致滋润眼霜15ml	¥210.00	179.00

欧莱雅复颜清漾柔肤水175ml	¥160.00	138.00

python爬取商品信息的更多相关文章

Python爬取招聘信息，并且存储到MySQL数据库中
前面一篇文章主要讲述,如何通过Python爬取招聘信息,且爬取的日期为前一天的,同时将爬取的内容保存到数据库中:这篇文章主要讲述如何将python文件压缩成exe可执行文件,供后面的操作. 这系列文章 ...
Python爬取网页信息
Python爬取网页信息的步骤以爬取英文名字网站(https://nameberry.com/)中每个名字的评论内容,包括英文名,用户名,评论的时间和评论的内容为例. 1.确认网址在浏览器中输入初 ...
python爬取酒店信息练习
爬取酒店信息,首先知道要用到那些库.本次使用request库区获取网页,使用bs4来解析网页,使用selenium来进行模拟浏览. 本次要爬取的美团网的蚌埠酒店信息及其评价.爬取的网址为“http:/ ...
(转)python爬取拉勾网信息
学习Python也有一段时间了,各种理论知识大体上也算略知一二了,今天就进入实战演练:通过Python来编写一个拉勾网薪资调查的小爬虫. 第一步:分析网站的请求过程我们在查看拉勾网上的招聘信息的时候 ...
配置scrapy-splash+python爬取医院信息（利用了scrapy-splash）
北京艾丽斯妇科医院(http://fuke.fuke120.com/) 首先先说一下配置splash 1.利用pip安装scrapy-splash库 pip install scrapy-splash ...
python爬取微信信息--显示性别/地域/词云（附代码）
看到一篇有意思的博客利用微信开放的接口itchat 可以获取登录的微信好友信息并且利用图像工具显示分析结果非常的有意思记录下实现过程并提供可执行代码首先要 import itchat 库 ...
[python] 常用正则表达式爬取网页信息及分析HTML标签总结【转】
[python] 常用正则表达式爬取网页信息及分析HTML标签总结转http://blog.csdn.net/Eastmount/article/details/51082253 标签: pytho ...
常用正则表达式爬取网页信息及HTML分析总结
Python爬取网页信息时,经常使用的正则表达式及方法. 1.获取<tr></tr>标签之间内容 2.获取<a href..></a>超链接之间内容 3 ...
Python爬虫之selenium爬虫，模拟浏览器爬取天猫信息
由于工作需要,需要提取到天猫400个指定商品页面中指定的信息,于是有了这个爬虫.这是一个使用 selenium 爬取天猫商品信息的爬虫,虽然功能单一,但是也算是 selenium 爬虫的基本用法了. ...

随机推荐

Java并发编程之CountDownLatch的用法
一.含义 CountDownLatch类位于java.util.concurrent包下,利用它可以实现类似计数器的功能.CountDownLatch是一个同步的辅助类,它可以允许一个或多个线程等待, ...
制作RPM包
RPM包制作过程 1.1 前期工作 1)创建打包用的目录rpmbuild/{BUILD,SPECS,RPMS, SOURCES,SRPMS} 建议使用普通用户,在用户家目录中创建 2)确定好制作的对象 ...
RocEDU.阅读.写作《乌合之众》（二）
第二卷群体的意见与信念决定着群体意见与信念的因素分为两类:直接因素与间接因素. 直接因素:使观念采取一定形式并且使它能够产生一定结果的因素. 间接因素:能够使群体接受某些信念并使其难以接受别的信念 ...
尝试编辑java程序
尝试编译java程序之前在用软件eclipse编译过简单的hello java程序,因为软件操作简单,后来学会了用命令符来编译程序.代码如下 public class abc { ...
Oracle查询一个表的数据插入到另一个表
1. 新增一个表,通过另一个表的结构和数据 create table XTHAME.tab1 as select * from DSKNOW.COMBDVERSION 2. 如果表存在: insert ...
入手sm961
测速: 发现这个测速软件不同版本测试还不一样下面是我的intel750的,用最新版本测试软件测的淘宝买了一个散热片
iOS开发进阶 - 项目的本地化处理(多语言开发)
移动端访问不佳,请访问我的个人博客最近项目本地化,需要支持多国语言,下面将本地化的步骤记录下来,方便查找使用,步骤很简单,有些地方也有坑,希望大家看后少走弯路~~ 什么是本地化本地化说直白点就是多 ...
scrapy之Pymongo
用Pymongo保存数据爬取豆瓣电影top250movie.douban.com/top250的电影数据,并保存在MongoDB中. items.py class DoubanspiderItem( ...
spring boot2.1读取 apollo 配置中心2
第二篇:创建spring boot2.1项目引用apollo的java客户端jar包 <dependency> <groupId>com.ctrip.framework.ap ...
Gogeos安装
环境要求: Windows64,Go,minGW(统一64位) 1.安装geos 下载GEOS 3.3.8源码,解压后,按readme文件编译(基于VS2010的64位编译工具执行的nmake编译命令 ...

python爬取商品信息

python爬取商品信息的更多相关文章

随机推荐

热门专题