第一次用python 写的简单爬虫记录在自己的博客

#python.py

from bs4 import BeautifulSoup

import urllib.request

from MySqlite import MySqlite

global g_intid

g_intid=0

def GetBlogTileAndName(url):

    res = urllib.request.urlopen(url)

    html = res.read()

    res.close()

    str(html, 'utf-8')

    soup=BeautifulSoup(html)

    divs=soup.find_all(attrs={"class":"postTitle"})

    for divname in divs:

        print("title:=",divname.a.string,"href:=",divname.a["href"])

        global  g_intid

        g_intid+=1

        x=MySqlite()

        x.InsertDate(g_intid,divname.a["href"],divname.a.string)

def GetBlogPage(url):

    res = urllib.request.urlopen(url)

    html = res.read()

    res.close()

    str(html, 'utf-8')

    soup=BeautifulSoup(html)

    divPager=soup.find(attrs={"class":"pager"})

    print(divPager.string)

for i in range(1,8) :
url=r"http://www.cnblogs.com/FCoding/default.html?page="+str(i)
GetBlogTileAndName(url)

#MySqlite.py

class MySqlite(object):

    """description of class"""

    def __init__(self, *args):

        return super().__init__(*args)

    def callstr(self,str):

        print(str)

    def InsertDate(self,id,url,title):

        conn = sqlite3.connect(r"d:\123.db")

        c=conn.cursor()

        #try:

        #    c.execute('create table blog (ID intergeer,url text,title text , PRIMARY KEY(ID))')

        #except ValueError:

        #    print("error My")

        strExe="insert into blog values ({0}, \"{1}\",\"{2}\")".format(id,url,title)

        print(id)

        #c.execute('insert into blog values (last_insert_rowid(),url,title)')

        c.execute(strExe)

        conn.commit()

        c.close()

        conn.close()

    def GetDate(self):

        import sqlite3

        conn = sqlite3.connect(r"d:\123.db")

        c=conn.cursor()

        res=c.execute("select count(*) from blog")

        res=c.fetchone()

        print(res[0])

        data=c.execute("select * from blog")

        for item in data:

            for ite in item:

                print(ite)

        conn.commit()

        c.close()

        conn.close()

　简述一下功能：

通过urllib 下载网页使用BeautifulSoup 解析

调用find_all(attrs={"class":"postTitle"})

找到HTML 中所有class=posttitle 的tag

然后遍历取出title 和href 保存到数据库中

此程序无容错。新手无笑！

第一次用python 写的简单爬虫记录在自己的博客的更多相关文章

用node.js写一个简单爬虫，并将数据导出为 excel 文件
引子最近折腾node,最开始像无头苍蝇一样到处找资料,然而多数没什么卵用,都在瞎比比.在一阵瞎搞后,我来分享一下初步学习node的三个过程: 1 撸一遍NODE入门,对其有个基本的了解: 2 撸一遍 ...
Python爬虫，看看我最近博客都写了啥，带你制作高逼格的数据聚合云图
转载请标明出处: http://blog.csdn.net/forezp/article/details/70198541 本文出自方志朋的博客今天一时兴起,想用python爬爬自己的博客,通过数据 ...
用Python写一个简单的Web框架
一.概述二.从demo_app开始三.WSGI中的application 四.区分URL 五.重构 1.正则匹配URL 2.DRY 3.抽象出框架六.参考一.概述在Python中,WSGI( ...
[Python爬虫笔记][随意找个博客入门(一)]
[Python爬虫笔记][随意找个博客入门(一)] 标签(空格分隔): Python 爬虫 2016年暑假来源博客:挣脱不足与蒙昧 1.简单的爬取特定url的html代码 import urllib ...
利用爬虫将Yuan先生的博客文章爬取下来
由于一次巧遇,我阅读了Yuan先生的一篇博客文章,感觉从Yuan先生得博客学到很多东西,很喜欢他得文章.于是我就关注了他,并且想阅读更多出自他手笔得博客文章,无奈,可能Yuan先生不想公开自己得博客吧 ...
Python简单爬虫记录
为了避免自己忘了Python的爬虫相关知识和流程,下面简单的记录一下爬虫的基本要求和编程问题!! 简单了解了一下,爬虫的方法很多,我简单的使用了已经做好的库requests来获取网页信息和Beauti ...
用python写个简单的小程序，编译成exe跑在win10上
每天的工作其实很无聊,早知道应该去IT公司闯荡的.最近的工作内容是每逢一个整点,从早7点到晚11点,去查一次客流数据,整理到表格中,上交给素未蒙面的上线,由他呈交领导查阅. 人的精力毕竟是有限的,所以 ...
【Python项目】简单爬虫批量获取资源网站的下载链接
简单爬虫批量获取资源网站的下载链接项目链接:https://github.com/RealIvyWong/GotDownloadURL 1 由来自己在收集剧集资源的时候,这些网站的下载链接还要手动 ...
用Python写的简单脚本更新本地hosts
这两天Google墙得严重,于是就产生了做个一键更新hosts的脚本的想法. 由于正在学习Python,理所当然用Python来写这个脚本了. 接触比较多的就是urllib2这个库,习惯性的impor ...

随机推荐

Django的rest_framework的权限组件和频率组件源码分析
前言: Django的rest_framework一共有三大组件,分别为认证组件:perform_authentication,权限组件:check_permissions,频率组件:check_th ...
.net like模糊查询参数化
List<SqlParameter> paras = new List<SqlParameter>(); if (!string.IsNullOrEmpty(ciName)) ...
利用travis自动化构建与部署（文档项目）
背景保持网站上文档的最新性有比较重要的意义, travis ci 提供了免费的解决方案,本文基于 latex 构建+ aliyun oss 部署对此作了尝试. 项目链接为 https://travi ...
微信小程序之----制作视频弹幕
1. 文件目录使用微信, 长度单位使用 rpx 可以避免不同设备的样式调试问题经验总结,之前一直使用px ,发现换了测试机就崩了 2. index.wxml页面设置v ...
UVA 10534 Wavio Sequence
题目链接:https://uva.onlinejudge.org/index.php?option=com_onlinejudge&Itemid=8&category=17&p ...
Kali proxychains
1.什么是proxychains 在linux系统中有很多软件是不支持代理的,但是proxychains 却可以让不支持代理的软件也能走代理通道,支持HTTP,HTTPS,SOCKS4,SOCKS5 ...
2019.02.16 bzoj5466: [Noip2018]保卫王国（链分治+ddp）
传送门题意简述: mmm次询问,每次规定两个点必须选或者不选,求树上的带权最小覆盖. 思路: 考虑链分治+ddpddpddp 仍然是熟悉的套路,先考虑没有修改的状态和转移: 令fi,0/1f_{i, ...
解决刚刚安装完mysql 远程连接不上问题
解决远程连接mysql错误1130 远程连接Mysql服务器的数据库,错误代码是1130,ERROR 1130: Host xxx.xxx.xxx.xxx is not allowed to con ...
ABP框架系列之五十二：(Validating-Data-Transfer-Objects-验证数据传输对象)
Introduction to validation Inputs of an application should be validated first. This input can be sen ...
python_day1_变量
一.变量定义: 通俗来讲可变化的量称之为变量,专业的解释为:把程序运算的中间结果临时存到内存里,以备后面的代码继续调用,这几个名字的学名就叫做“变量” 用法: name = 'zzx' 其中name ...

第一次用python 写的简单爬虫 记录在自己的博客

第一次用python 写的简单爬虫 记录在自己的博客的更多相关文章

随机推荐

热门专题

第一次用python 写的简单爬虫记录在自己的博客

第一次用python 写的简单爬虫记录在自己的博客的更多相关文章