直接请求json文件爬取天眼查企业信息（未解决验证码问题）—

　　几个月前。。。省略一堆剧情。。。直接请求json文件爬取企业信息未成功，在知乎提问后，得到解决，有大佬说带上全部headers和cookie是可以的，我就又去试了下，果然可以（之前自己试的时候不行，没搞清楚为什么突然可以了、、、）。但是即使sleep几秒后，爬虫还是会死掉，会浏览器再次访问，会发现需要验证才可以继续浏览。咨询了一些大佬，又查了查资料，看来是要用代理了，没有深入去研究。听说天眼查本事就是搞爬虫的。。。这里就贴下未解决验证码的半成品吧，代码写的很烂，也没有清洗数据，凑活着看看吧先。

当中尝试换UA避开验证，不过失败了。大佬们有新的办法欢迎告知。有错误欢迎指出，共同学习。

import requests

import MySQLdb

import time

import random

#打开数据库链接

db = MySQLdb.connect(host="localhost", user="root", passwd="你的密码",db="test",use_unicode=True,charset="utf8")

cursor = db.cursor()

# 如果数据已经存在，使用excute()方法删除表

cursor.execute("DROP TABLE IF EXISTS tianyancha")

#创建数据表	SQL语句

sql = """CREATE TABLE tianyancha(

        industry VARCHAR(20),

        base VARCHAR(10),

        id VARCHAR(20),

		 name VARCHAR(50) NOT NULL,

		 legalPersonName VARCHAR(50),

		 regStatus VARCHAR(10),

		 score VARCHAR(10)

		 )

		 """

cursor.execute(sql)

urls=["http://www.tianyancha.com/search/%E7%BB%9F%E8%AE%A1.json?&pn="+str(i) for i in range(38,51)]

UA = ["Mozilla/5.0 (Windows NT 10.0; WOW64; rv:49.0) Gecko/20100101 Firefox/49.0","Mozilla/5.0 (Windows NT 6.1) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/53.0.2785.143 Safari/537.36"]

headers={

    "Accept":"application/json,text/plain, */*",

    "Accept-Encoding":"gzip, deflate",

    "Accept-Language":"zh-CN,zh;q=0.8,en-US;q=0.5,en;q=0.3",

    "CheckError":"check",

    "Cookie":"TYCID=79ecda1ebc7243bb8e0e61001fa62e45; tnet=219.217.246.3; Hm_lvt_e92c8d65d92d534b0fc290df538b4758=1478185016,1478185105; Hm_lpvt_e92c8d65d92d534b0fc290df538b4758=1478185127; RTYCID=f6052f4746504a92a9449adf8c1aad4d; aliyungf_tc=AQAAAIi4rlRU9QIAA/bZ26bXAnGDUsL8; _pk_id.1.4c4c=ff85a162bc61332e.1478185118.1.1478185128.1478185118.; _pk_ref.1.4c4c=%5B%22%22%2C%22%22%2C1478185118%2C%22http%3A%2F%2Fwww.tianyancha.com%2F%22%5D; _pk_ses.1.4c4c=*; token=70f49be8c16c4cb290fa7d05c8a60638; _utm=-24s2tr4st24-9n8d32849t38sk97hh8",

    "Referer":"http://bj.tianyancha.com/search",

    "Tyc-From":"normal",

    "User-Agent":random.choice(UA),

    "loop":"null"

}

def get_data(url):

    data = requests.get(url=url,headers=headers).json()

    data = data["data"]

    # print(data)

    for i in range(len(data)):

        score = data[i]["score"]

        base = data[i]["base"]

        regStatus = data[i]["regStatus"]

        industry = data[i]["industry"]

        legalPersonName = data[i]["legalPersonName"]

        name = data[i]["name"]

        id = data[i]["id"]

        sql_save = """INSERT INTO tianyancha\

        SET industry=%s,base=%s, id=%s, name=%s, legalPersonName=%s,regStatus=%s,score=%s"""

        cursor.execute(sql_save,(industry,base, id, name, legalPersonName, regStatus, score))

        db.commit()

        print(name)

for url in urls:

    time.sleep(3)

    try:

        get_data(url)

    except:

        print(url)

        pass

#关闭数据库连接

db.close()

　　输出：

直接请求json文件爬取天眼查企业信息（未解决验证码问题）——python3实现的更多相关文章

python+selenium+xpath 爬取天眼查工商基本信息
# -*- coding:utf-8 -*-# author: kevin# CreateTime: 2018/8/16# software-version: python 3.7 import ti ...
python应用：selenium之爬取天眼查信息
inform_table.py # -*-coding:utf8-*- from selenium import webdriver from selenium.webdriver.common.pr ...
Python反爬：利用js逆向和woff文件爬取猫眼电影评分信息
首先:看看运行结果效果如何! 1. 实现思路小编基本实现思路如下: 利用js逆向模拟请求得到电影评分的页面(就是猫眼电影的评分信息并不是我们上述看到的那个页面上,应该它的实现是在一个页面上插入另外一 ...
<day003>登录+爬取淘宝商品信息+字典用json存储
任务1:利用cookie可以免去登录的烦恼(验证码) ''' 只需要有登录后的cookie,就可以绕过验证码登录后的cookie可以通过Selenium用第三方(微博)进行登录,不需要进行淘宝的滑动 ...
利用 Scrapy 爬取知乎用户信息
思路:通过获取知乎某个大V的关注列表和被关注列表,查看该大V和其关注用户和被关注用户的详细信息,然后通过层层递归调用,实现获取关注用户和被关注用户的关注列表和被关注列表,最终实现获取大量用户信息. 一 ...
爬虫（十六）：scrapy爬取知乎用户信息
一:爬取思路首先我们应该找到一个账号,这个账号被关注的人和关注的人都相对比较多的,就是下图中金字塔顶端的人,然后通过爬取这个账号的信息后,再爬取他关注的人和被关注的人的账号信息,然后爬取被关注人的账 ...
scrapy-redis + Bloom Filter分布式爬取tencent社招信息
scrapy-redis + Bloom Filter分布式爬取tencent社招信息什么是scrapy-redis 什么是 Bloom Filter 为什么需要使用scrapy-redis + B ...
scrapy-redis分布式爬取tencent社招信息
scrapy-redis分布式爬取tencent社招信息什么是scrapy-redis 目标任务安装爬虫创建爬虫编写 items.py 编写 spiders/tencent.py 编写 pip ...
【nodejs 爬虫】使用 puppeteer 爬取链家房价信息
使用 puppeteer 爬取链家房价信息目录使用 puppeteer 爬取链家房价信息页面结构爬虫库 pupeteer 库实现打开待爬页面遍历区级页面方法一方法二遍历街道页面遍 ...

随机推荐

未找到导入的项目，请确认 <Import> 声明中的路径正确
当使用vs出现下列情况: D:\xxxx\Web\Web.csproj : error : 无法读取项目文件“Web.csproj”. D:\xxxx\WebServiceManager\Web\W ...
img标签加载FTP的图片 C#
好吧,我是菜鸟,这是我今天遇到的问题,什么也不会,得高人指点 1.使用FtpWebRequest下载图片,以流存贮 2.在ashx文件里面直接已流方式(HttpContext.Current.Resp ...
[转]Bat脚本处理ftp超强案例解说
Bat脚本处理ftp超强案例解说转自:http://369369.blog.51cto.com/319630/842341 前言: 公司有几百台windows服务器,每次程序更新,如果是一台 ...
滑动式折叠菜单－ Slashdot's Menu
折叠菜单让你在尽可能小的地方放置尽可能多的内容,同时加大了操作的简便性,因此,深受前台设计师的喜爱.随着大家对动画效果的钟爱,折叠菜单也开始“动”起来了,本文介绍的就是 DimX 制作的滑动式折叠菜单 ...
DataTable数据导出CSV文件
public static void SaveAsExcel(DataTable dt1) { //System.Windows.Forms.SaveFileDialog sfd = new Syst ...
mpu
#include "mpu.h" #include "mem.h" #include "my_errno.h" #include " ...
算法练习之leetcode系列1-3
1.Reverse Words in a String public class Solution { public String reverseWords(String s) { String re ...
js动态添加行
<script> $(function() { //增加上传 var addli = function() { var linum = parseInt($(".pic-wrap ...
Coding源码学习第四部分(Masonry介绍与使用(二))
接上篇,本篇继续对Masonry 进行学习,接上篇示例: (6)Masonry 布局实现iOS 计算器 - (void)exp4 { WS(weakSelf); // 申明区域,displayView ...
Bootstrap<基础六> 表单
Bootstrap 通过一些简单的 HTML 标签和扩展的类即可创建出不同样式的表单. 表单布局 Bootstrap 提供了下列类型的表单布局: 垂直表单(默认) 内联表单水平表单垂直或基本表单 ...

直接请求json文件爬取天眼查企业信息（未解决验证码问题）——python3实现

直接请求json文件爬取天眼查企业信息（未解决验证码问题）——python3实现的更多相关文章

随机推荐

热门专题