python爬取网业信息案例

需求：爬取网站上的公司信息

代码如下：

import json

import os

import shutil

import requests

import re

import time

requests.packages.urllib3.disable_warnings()

#通过url请求接口，获取返回数据

def getPage(url,headers):

    try:

        response = requests.get(url=url, headers=headers, verify=False)

        response.encoding = 'utf-8'

        if response.status_code == 200:

            #print (response.text)

            return response.text

        else:

            print('请求异常：{} status:{}'.format(url, response.status_code))

    except Exception as e:

            print('请求异常： {} error: {}'.format(url, e))

            return None

#删除文件的重复行

def file2uniq(file,destpath):

    sum = 0

    sum_pre = 0

    addrs = set()

    with open(file, 'r',encoding='utf8') as scan_file:

        for line in scan_file.readlines():

            sum_pre += 1

            # addr = get_addr(line)

            # line.decode('utf8')

            addrs.add(line)

    scan_file.close()

    with open(destpath, 'w',encoding='utf8') as infile:

        while len(addrs) > 0:

            sum += 1

            infile.write(addrs.pop())

    infile.close()

    if (os.path.exists(file)):

        os.remove(file)

    try:

        os.rename(destpath, file)

    except Exception as e:

        print (e)

        print ('rename file fail\r')

    else:

        print ('rename file success\r')

    #print(addrs)

    print("去重之前文本条数: "+str(sum_pre))

    print("去重之后文本条数: "+str(sum))

    return sum_pre,sum

#通过正则表达式提取页面内容

def parseHtml(html):

    #pattern = re.compile(r'<tr> <td class="tx">.+\s(.+)', re.I)  # 不区分大小写 匹配股票名称

    # 不区分大小写  获取完整公司名

    pattern = re.compile(r'<td class="text-center">.+</td> <td> <a href="/firm_.+">\s(.+)', re.I)

    # 获取证券公司

    #pattern = re.compile(r'\t(.+)[\s]+</a> </td> <td class="text-center">.+</td> <td class="text-center">.+</td> </tr>', re.I)

    #pattern = re.compile(r'\t(.+)\s\t\t\t\t\t\t\t  </a> </td> <td class="text-center">.+</td> <td class="text-center">.+</td> </tr> <tr> <td class="tx">', re.I)  # 不区分大小写

    #pattern = re.compile(r'</a>\s</td>\s<td class="text-center">.+</td> <td> <a href="/firm_.+.html">\s(.+)[\s]+</a> </td> <td> <a href="/firm_.+.html">\s(.+)', re.I)  # 不区分大小写 匹配股票名称

    items = re.findall(pattern, html)

    #print (items)

    for item in items:

        yield {

            'orgName': item.strip(),

        }

def write2txt(content):

    with open(file, 'a', encoding='utf-8') as f:

        f.write(json.dumps(content, ensure_ascii=False) + '\n')

def removeStr(old_str,new_str):

    """

    with open('sanban.txt', 'a', encoding='utf-8') as fpr:

        content = fpr.read()

    content = content.replace(r'{"orgName": "', '')

    content = content.replace(r'"}', '')

    """

    file_data = ""

    with open(file, 'r', encoding='utf-8') as f:

        for line in f:

            if old_str in line:

                line = line.replace(old_str,new_str)

            file_data += line

    with open(file, 'w', encoding='utf-8') as f:

        f.write(file_data)

def main(page):

    #url = 'https://www.qichacha.com/elib_sanban.html?p=' + str(page)

    url = 'https://www.qichacha.com/elib_ipo.html?p=' + str(page)  # https://www.qichacha.com/elib_ipo.html?p=2

    headers = {

        'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/75.0.3770.100 Safari/537.36',

    }

    print (url)

    html = getPage(url,headers)

    #print (html)

    for item in parseHtml(html):

        print(item)

        write2txt(item)

    removeStr(r'{"orgName": "','')

    removeStr(r'"}', '')

    file2uniq(file, destpath)

if __name__ == '__main__':

    file = r'orgName.txt'

    #file = r'midOrg.txt'

    #sourcepath = r'sanban.txt'

    destpath = r'temp.txt'

    for page in range(1,2):

        main(page)

        time.sleep(1)

python爬取网业信息案例的更多相关文章

Python爬取网易云音乐歌手歌曲和歌单
仅供学习参考 Python爬取网易云音乐网易云音乐歌手歌曲和歌单,并下载到本地很多人学习python,不知道从何学起.很多人学习python,掌握了基本语法过后,不知道在哪里寻找案例上手.很多已经做 ...
用Python爬取网易云音乐热评
用Python爬取网易云音乐热评本文旨在记录Python爬虫实例:网易云热评下载由于是从零开始,本文内容借鉴于各种网络资源,如有侵权请告知作者. 要看懂本文,需要具备一点点网络相关知识.不过没有关 ...
Python爬取网易云热歌榜所有音乐及其热评
获取特定歌曲热评: 首先,我们打开网易云网页版,击排行榜,然后点击左侧云音乐热歌榜,如图: 关于如何抓取指定的歌曲的热评,参考这篇文章,很详细,对小白很友好: 手把手教你用Python爬取网易云40万 ...
Python 爬取网易云歌手的50首热门作品
使用 requests 爬取网易云音乐 Python 代码: import json import os import time from bs4 import BeautifulSoup impor ...
Python爬取网易云歌单
目录 1. 关键点 2. 效果图 3. 源代码 1. 关键点使用单线程爬取,未登录,爬取网易云歌单主要有三个关键点: url为https://music.163.com/discover/playl ...
爬虫实战(二) 用Python爬取网易云歌单
最近,博主喜欢上了听歌,但是又苦于找不到好音乐,于是就打算到网易云的歌单中逛逛本着 "用技术改变生活" 的想法,于是便想着写一个爬虫爬取网易云的歌单,并按播放量自动进行排序这篇 ...
Python爬取拉勾网招聘信息并写入Excel
这个是我想爬取的链接:http://www.lagou.com/zhaopin/Python/?labelWords=label 页面显示如下: 在Chrome浏览器中审查元素,找到对应的链接: 然后 ...
python爬取豆瓣视频信息代码
目录一:代码二:结果如下(部分例子) 这里是爬取豆瓣视频信息,用pyquery库(jquery的python库). 一:代码 from urllib.request import quote ...
python爬取网易云音乐歌曲评论信息
网易云音乐是广大网友喜闻乐见的音乐平台,区别于别的音乐平台的最大特点,除了“它比我还懂我的音乐喜好”.“小清新的界面设计”就是它独有的评论区了——————各种故事汇,各种金句频出.我们可以透过歌曲的评 ...

随机推荐

北京国际机场T3行李运维平台开发记录
说明该项目是一个后台管理型网站项目,供北京国际机场T3航站楼行李调度运维部门使用,开发时间一个半月,我负责所有的前端开发.后端开发.API接口文档设计与编写.服务部署和交付. 整个网站具备的功能有: ...
c++-继承的学习
继承的基本概念继承和派生继承概念派生类的访问控制(继承三种方式.类三种访问控制.三看原则)综合训练继承中的构造和析构类型兼容性原则继承中的构造和析构继承中同名成员函数.成员变量处理方法 ...
修改HTML元素
通过HTML DOM,JavaScript能够访问并修改HTML文档中的每个元素修改元素文本内容 document.getElementById("p1").innerHTML= ...
Node.js / Python 日志
一.Node.js 日志 1.原生 Node.js 原生方法其实很简单,就四个: // 输出到 stdout console.log() console.info() = console.log() ...
Android PopupWindow增加半透明蒙层
先看效果图: BasePopupWindowWithMask.class package com.example.popupwindowwithmask; import android.content ...
分析Android APK-砸壳-Fdex2
砸壳的工具千千万,但是FDex2 是最有能耐的,我尝试过各种壳,都是秒砸的.特别说明一下,360的壳,oncreated 方法还是空的,但是其他大部分内容还是有的,反正是可以参考一下的. 安装环境: ...
Python输出16进制不带0x补零，整数转16进制，字符串转16进制
Python输出16进制不带0x补零,整数转16进制,字符串转16进制在开发中,我们偶尔会遇到需要将数据通过控制台打印出来,以检查数据传输的准确性.例如调试服务端刚接到的二进制数据(里面包含很多 ...
47-准备 Overlay 网络实验环境
为支持容器跨主机通信,Docker 提供了 overlay driver,使用户可以创建基于 VxLAN 的 overlay 网络.VxLAN 可将二层数据封装到 UDP 进行传输,VxLAN 提供与 ...
C# $插值符号
概述 $ 符是在C#6.0出现的一个新特性,本质就是C#的一个语法糖,作用在于替代当前的String.format(),简化其过程.他们的作用都在于为字符串提供占位符,并为字符串传入变量. 用法关于 ...
[C]链接和生存周期
链接和生存周期的区别: 链接是标识符的属性: 生存周期是对象的属性: 链接可以是外部(external),内部(internal)或没有(none): 生存周期可以是自动的.静态的,或已分配的(all ...

python爬取网业信息案例

python爬取网业信息案例的更多相关文章

随机推荐

热门专题