CVPR顶会论文爬取存入MySQL数据库（标题、摘要、作者、PDF链接和原地址)

main.py

import pymysql

import re

import requests

# 连接数据库函数

from bs4 import BeautifulSoup

def insertCvpr(value):

    try:

        db = pymysql.connect(host="localhost", user="root", password="password", database="article",charset="utf8")

        print("数据库连接成功!")

        cur = db.cursor()

        sql = 'INSERT INTO cvpr(title,ab,author,hotword,pdf,path) VALUE (%s,%s,%s,%s,%s,%s)'

        cur.execute(sql, value)

        db.commit()

        print("增加数据成功!")

    except pymysql.Error as e:

        print("增加数据失败:  " + str(e))

        db.rollback()

    db.close()

#主函数

print("1")

url = "https://openaccess.thecvf.com/CVPR2020.py?day=2020-06-16"

headers = {"User-Agent":"Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/81.0.4044.92 Safari/537.36"}

res = requests.get(url,headers=headers)

res.encoding = "utf-8"

# 先爬取每个论文的网址

web = re.findall("""<dt class="ptitle"><br><a href="(.*?)">.*?</a></dt>""", res.text, re.S)

print("2")

for each in web:

    try:

        each = "http://openaccess.thecvf.com/" + each

        print("3")

        print(each)

        res = requests.get(each, headers=headers, timeout=(3, 7))

        paper = BeautifulSoup(res.text)

        res.encoding = "utf-8"

        # 在各各论文网站中爬取详细信息

        title = re.findall("""<div id="papertitle">(.*?)</div>""", res.text, re.S)#标题

        ab = re.findall("""<div id="abstract" >(.*?)</div>""", res.text, re.S)#摘要

        author = paper.find("div", {"id": "authors"}).find("b").find("i").text#作者

        pdf = re.findall("""\[<a href="\.\./\.\./(.*?)">pdf</a>\]""", res.text, re.S)#pdf下载地址

        path = each#论文简述页面

        if (len(title) > 0):

            title = title[0].replace("\n", "")

            ab = ab[0].replace("\n", "")

            pdf = "http://openaccess.thecvf.com/" + pdf[0]

            print(title)

            print(author)

            value = (title, ab, author, "", pdf, path)

            insertCvpr(value)

    except:

        print("异常")

2.数据库

遇到的问题：

注意varchar最大长度为255，数据长度可能不够，使用longtext类型存储。

MySQL中tinytext、text、mediumtext和longtext等各个类型详解

CVPR顶会论文爬取存入MySQL数据库（标题、摘要、作者、PDF链接和原地址)的更多相关文章

个人作业——CVPR顶会论文爬取
main.py #保存单个界面数据 def getInfo(url): # url='https://openaccess.thecvf.com/WACV2021' header={ 'User-Ag ...
论文爬取 & 词频统计2.0
一.Github地址课程项目要求队友博客二.具体分工 031602225 林煌伟 :负责C++部分主要功能函数的编写,算法的设计以及改进优化 031602230 卢恺翔 : 爬虫 ...
用Python获取沪深两市上市公司股票信息，提取创近10天股价新高的、停牌的、复牌不超过一天或者新发行的股票，并存入mysql数据库
#该脚本可以提取沪深两市上市公司股票信息,并按以下信息分类:(1)当天股价创近10个交易日新高的股票:(2)停牌的股票:(3)复牌不超过一个交易日或者新发行的股票 #将分类后的股票及其信息(股价新高. ...
JSON文件存入MySQL数据库
目标:将不同格式的JSON文件存入MySQL数据库涉及的点有: 1. java处理JSON对象,直接见源码. 2. java.sql.SQLException: Incorrect string v ...
tensorflow利用预训练模型进行目标检测（三）：将检测结果存入mysql数据库
mysql版本:5.7 : 数据库:rdshare:表captain_america3_sd用来记录某帧是否被检测.表captain_america3_d用来记录检测到的数据. python模块,包部 ...
mysql数据库可以远程连接或者说用IP地址可以访问
mysql数据库可以远程连接或者说用IP地址可以访问一般情况不建议直接修改root的权限, 先看下,自己mysql数据库的用户级权限 mysql -u root -p----->用root登陆 ...
操作服务器及MySQL数据库可以使其远程链接
转自原文操作服务器及MySQL数据库可以使其远程链接一般情况分三个地方准备,MySQL数据库,防火墙,还有你的服务器主机的准备操作系统为centos6.5.其他系统大致差不多. 1:在服务器中安装 ...
<爬虫>利用BeautifulSoup爬取百度百科虚拟人物资料存入Mysql数据库
网页情况: 代码: import requests from requests.exceptions import RequestException from bs4 import Beautiful ...
Python+Scrapy+Crawlspider 爬取数据且存入MySQL数据库
1.Scrapy使用流程 1-1.使用Terminal终端创建工程,输入指令:scrapy startproject ProName 1-2.进入工程目录:cd ProName 1-3.创建爬虫文件( ...

随机推荐

MIT Scheme Development on Ubuntu
sudo apt-get mit-scheme; run "scheme" then you enter the command line scheme repl; sudo ap ...
STM32启动代码分析及其汇编学习-ARM
STM32 启动代码 Author By YuCloud 边看启动文件边学汇编汇编 see ARM: Assembler User Guide see: https://blog.csdn.net/ ...
MySQL记录之间是单向链表还是双向链表？
前言本文的观点是基于MySQL使用Innodb存储引擎的情况下进行的! 很多渠道说:MySQL数据按照主键大小依次排列,记录之间是双向链表连起来.如果说我告诉你这种说法很大程度上是错的,你肯定说我在 ...
寻找写代码感觉（二）之 Spring Boot 项目属性配置
一.前言写代码就和恋爱一样,有反馈就要趁热打铁,搞完了项目搭建,接下来就来搞搞项目配置. 二.IDEA设置 1.编码配置这里所说的就是代码的编码格式,你可以不设置,但是可能要面临的是,很多未知的麻 ...
WinForm嵌入Web网页的解决方案
企业级信息化系统绝大部分采用BS架构实现,如门户网站.OA系统.电商网站等,通过浏览器输入Web网址即可访问,对于使用者来说非常便捷,对于开发维护者来说也非常方便,程序维护只需更新服务器即可,使用者无 ...
idea打断点后发现被标记的断点处那一行整行被标记了其他颜色，前面没有断点标识的红点
问题如下: 最后发现有两种解决办法吧,直接走起! 第一种方法: 在View====>Active Editor====>Show Gutter Icons,勾选此选项,发现小红点出来了: ...
reduce使用技巧
一.使用reduce同时执行map(循环)和filter(过滤) 例如,将数组中的项的值加倍,然后只选择那些大于50的项 const numbers = [10, 20, 30, 40]; const ...
Vue 插槽 slot的简单实用
【springcloud】springcloud与springboot的版本对应关系
官方网址:https://start.spring.io/actuator/info 更新时间:2019-12-01 spring-cloud: "Finchley.M2": &q ...
Centos7 安装 redis4.x
一.安装redis 第一步:下载redis安装包 wget http://download.redis.io/releases/redis-4.0.6.tar.gz [root@iZwz991stxd ...

CVPR顶会论文爬取存入MySQL数据库（标题、摘要、作者、PDF链接和原地址)

CVPR顶会论文爬取存入MySQL数据库（标题、摘要、作者、PDF链接和原地址)的更多相关文章

随机推荐

热门专题