Python抓取双色球数据

　　数据来源网站http://baidu.lecai.com/lottery/draw/list/50?d=2013-01-01

　　HTML解析器http://pythonhosted.org/pyquery/ (可以像JQuery那样使用)

　　源码:

 import MySQLdb as mysql

 from pyquery import PyQuery as pq

 create_table_sql = '''

 create table union_lotto(

     issue int  primary key,

     lottery_date   date,

     lottery_number varchar(30)

 )'''

 sql = "insert into union_lotto values(%(issue)s, %(date)s, %(number)s)"

 conn = mysql.connect(host='localhost', db='caipiao', user='root', passwd='')

 cur = conn.cursor()

 def inserts(rows):

     cur.executemany(sql, rows)

     conn.commit()

 def close():

     conn.close()

 def handler_row(row):

     children = row.getchildren()

     date =  children[0].text_content()

     issue = children[1].getchildren()[0].text_content()

     spans = children[2].getchildren()[0].getchildren()

     numbers = []

     for span in spans:

         numbers.append(span.text_content())

     lottery_number = '-'.join(numbers)

     return {'issue': int(issue.strip()), 'date': date, 'number': lottery_number}

 def grab_data(url):

     d = pq(url=url)

     rows = d("#draw_list > tbody > tr")

     result = []

     for row in rows:

         result.append(handler_row(row))

     return result

 def main():

     years = [(2003 + i) for i in range(0, 11)]

     url = 'http://baidu.lecai.com/lottery/draw/list/50?d=%d-01-01'

     print '.......star.........'

     for year in years:

         result = grab_data(url % year)

         inserts(result)

     close()

     print '.......end..........'

 if __name__ == '__main__':

     main()

Python抓取双色球数据的更多相关文章

python 抓取金融数据，pandas进行数据分析并可视化系列 (一)
终于盼来了不是前言部分的前言,相当于杂谈,算得上闲扯,我觉得很多东西都是在闲扯中感悟的,比如需求这东西,一个人只有跟自己沟通好了,总结出某些东西了,才能更好的和别人去聊,去说. 今天这篇写的是明白需求 ...
利用python抓取页面数据
1.首先是安装python(注意python3.X和python2.X是不兼容的,我们最好用python3.X) 安装方法:安装python 2.安装成功后,再进行我们需要的插件安装.(这里我们需要用 ...
python 抓取alexa数据
要抓取http://www.alexa.cn/rank/baidu.com网站的排名信息:例如抓取以下信息: 需要微信扫描登录因为这个网站抓取数据是收费,所以就利用网站提供API服务获取json信息 ...
记录使用jQuery和Python抓取采集数据的一个实例
从现成的网站上抓取汽车品牌,型号,车系的数据库记录. 先看成果,大概4w条车款记录一共建了四张表,分别存储品牌,车系,车型和车款大概过程: 使用jQuery获取页面中呈现的大批内容能通过页面一次 ...
使用python抓取App数据
App接口爬取数据过程使用抓包工具手机使用代理,app所有请求通过抓包工具获得接口,分析接口反编译apk获取key突破反爬限制需要的工具:夜神模拟器FiddlerPycharm实现过程首先下载夜神模拟 ...
网络爬虫－使用Python抓取网页数据
搬自大神boyXiong的干货! 闲来无事,看看了Python,发现这东西挺爽的,废话少说,就是干准备搭建环境因为是MAC电脑,所以自动安装了Python 2.7的版本添加一个库 Beauti ...
使用 Python 抓取欧洲足球联赛数据
Web Scraping在大数据时代,一切都要用数据来说话,大数据处理的过程一般需要经过以下的几个步骤数据的采集和获取数据的清洗,抽取,变形和装载数据的分析,探索和预测 ...
如何用python抓取js生成的数据 - SegmentFault
如何用python抓取js生成的数据 - SegmentFault 如何用python抓取js生成的数据 1赞踩收藏想写一个爬虫,但是需要抓去的的数据是js生成的,在源代码里看不到,要怎么才能抓 ...
Python抓取百度百科数据
前言本文整理自慕课网<Python开发简单爬虫>,将会记录爬取百度百科"python"词条相关页面的整个过程. 抓取策略确定目标:确定抓取哪个网站的哪些页面的哪部分 ...

随机推荐

EasyUI-增删改操作
最近公司要用easyui,这里自己看了官网几篇文章,遇到些问题,大多数的问题都是敲代码的时候笔误,其他有些地方确实需要注意一下,这里做些笔记. 1.在mysql中建好表之后修改id字段为递增字段,发现 ...
nginx lua 开发笔记
获取在lua代码中获取 location 正则的参数对应的变量 // location location ~/lua_http_2/(\w*.+) { } // lua local vars=ngx ...
STM32的优先级NVIC_PriorityGroupConfig的理解及其使用
写作原由:因为之前有对stm32 优先级做过研究,但是没时间把整理的东西发表,最近项目需要2个串口,但是不是两个串口同时使用,只是随机使用其中一个,程序对2个串口的优先级需要配置: 此文思路:“中断优 ...
(转)Java Ant build.xml详解
1,什么是ant ant是构建工具2,什么是构建概念到处可查到,形象来说,你要把代码从某个地方拿来,编译,再拷贝到某个地方去等等操作,当然不仅与此,但是主要用来干这个3,ant的好处跨平台 --因 ...
iOS创建界面方法的讨论
以前在入门的时候,找的入门书籍上编写的 demo 都是基于 Storyboards 拖界面的.后来接触公司项目,发现界面都是用纯代码去写复杂的 autoLayout 的.再然后,领导给我发了个 Mas ...
【原】个人对win7开机黑屏只有鼠标排障总结
个人对win7开机黑屏只有鼠标排障总结文:铁乐猫第一种情况是explorer.exe进程丢失或损坏有关: 判断方法是按Ctrl+Alt+Del键能呼出任务管理器,结束explorer.exe进程, ...
compareTo()
从字面意思可知这个方法就是比较的意思. 所以该方法有如下两种情况: 1.比较前后的两个字符不相同: (1) String str = "Hello World"; Stri ...
CEO、COO、CFO、CTO
CEO.COO.CFO.CTO是什么意思? 网站里的各种职位: CEO(Chief executive officer)首席执行官类似总经理.总裁,是企业的法人代表. COO(Chief opera ...
（转）Hibernate 的应用（Hibernate 的结构）？
//首先获得 SessionFactory 的对象 SessionFactory sessionFactory = new Configuration().configure(). buildSess ...
C++话题
1.多态地实现 A:C++中多态的实现原理是怎样的? Q:通过迟邦定技术(late binding)实现. 具体实现原理如下: 1. 基类中函数带virtual关键字,表示该方法为虚函数. 2. 子类 ...

Python抓取双色球数据

Python抓取双色球数据的更多相关文章

随机推荐

热门专题