一、爬虫协议

　　与其它爬虫不同，全站爬虫意图爬取网站所有页面，由于爬虫对网页的爬取速度比人工浏览快几百倍，对网站服务器来说压力山大，很容易造成网站崩溃。为了避免双输的场面，大家约定，如果网站建设者不愿意爬虫访问某些页面，他就按照约定的格式，把这些页面添加到 robots.txt 文件中，爬虫应该主动避免访问这些页面。除此之外，作为爬虫编写者也应该主动控制爬虫访问速度。

　　访问 robots 协议的方式是：网站域名＋'/robots.txt'。

二、处理爬虫协议

import urllib.robotparser

url = 'https://ai.baidu.com'

rp = urllib.robotparser.RobotFileParser()

rp.set_url(url + '/robots.txt')

rp.read()

info = rp.can_fetch("*", 'https://ai.baidu.com/product/minos')

print(info)

三、全站爬虫的基本架构

　　爬虫从一个 URL 开始访问，通常是网站的域名，并将获得网页中的链接提取出来，去重后放入待访问列表。重复此操作，知道访问完网站内全部网页。

　　需要注意的是，全站爬虫通常只爬取网站的内部链接

四、网页链接提取

from requests_html import HTMLSession

session = HTMLSession()

origin = 'https://ai.baidu.com'

r = session.get(origin)

print(r.html.links)

五、链接过滤

　　使用 urllib 库过滤所有非内部链接，继续运行下面的代码，观察结果：

from urllib.parse import urlparse

from requests_html import HTMLSession

session = HTMLSession()

origin = 'https://ai.baidu.com'

r = session.get(origin)

print(r.html.links)

domain = 'ai.baidu.com'

def is_inner_link(link):

    netloc = urlparse(link).netloc

    return (not netloc) or (netloc == domain)

for link in r.html.links:

    print(is_inner_link(link), link)

　　除了过滤非内部链接外，还需要把已经访问过的链接、爬虫协议不允许的链接和你不想访问的链接都过滤掉。

六、百度AI爬虫实现

from requests_html import HTMLSession

import urllib.robotparser

from urllib.parse import urlparse

session=HTMLSession()

origin= 'https://www.xuexi.cn/'

domain=urlparse(origin).netloc

def is_inner_link(link):

    netloc=urlparse(link).netloc

    return (not netloc) or (netloc==domain)

visited = []  # 已访问链接列表

unvisited = [origin]  # 待访问链接列表

# 解析爬虫协议

rp = urllib.robotparser.RobotFileParser()

rp.set_url(origin + '/robots.txt')

rp.read()

def add_unvisited(link):

    # 过滤1：判断爬虫协议是否允许

    allow = rp.can_fetch('*', link)

    if not allow:

        return

    # 过滤2：判断是否为内链

    if not is_inner_link(link):

        return

    # 过滤3：去掉非法链接

    path = urlparse(link).path

    if not path.startswith('/'):

        return

    # 过滤4：自定义过滤

    if urlparse(link).path.startswith(('/file', '/docs', '/support', '/forum', '/broad', '/paddlepaddle', '/market',

                                       '/download', '/facekit', '/sdk', '/customer', '/easydl', '//')):

        return

    # 将 /tech/123 转换为 https://ai.baidu.com/tech/123 的形式

    if link.startswith('/'):

        link = origin + link

    # 过滤5：判断是否访问过，或已经添加到待访问列表

    if (link in visited) or (link in unvisited):

        return

    unvisited.append(link)

while len(unvisited):

    link=unvisited.pop()    #用于移除列表中的一个元素

    r=session.get(link)

    visited.append(link)

    if r.html and r.html.links and len(r.html.links):

        for url in r.html.links:

            add_unvisited(url)

    if r.html.find('head title')[0]:

        print(r.html.find('head title')[0].text,link)

print('共爬取{}个链接'.format(len(visited)))

百度AI搜索引擎的更多相关文章

百度AI认为最漂亮的中国女星是----范冰冰
一.程序说明 1.1 程序说明之前写调用百度AI接口的程序,然后刷到了两条明星的新闻,就想到了写个给明星颜值排下名的程序. 程序的关键点是两个,第一个是百度AI接口的调用这点其实直接使用早前实现的类 ...
百度AI开放平台- API实战调用
百度AI开放平台- API实战调用一. 前言首先说一下项目需求. 两个用户,分别上传了两段不同的文字,要计算两段文字相似度有多少,匹配数据库中的符合条件的数据,初步估计列出来会有60-1 ...
百度AI技术QQ群
百度语音QQ群 648968704 视频分析QQ群 632473158 DuerOSQQ群 604592023 图像识别QQ群 649285136 文字识别QQ群 631977213 理解与交互技术U ...
初探机器学习之使用百度AI服务实现图片识别与相似图片
一.百度云AI服务最近在调研一些云服务平台的AI(人工智能)服务,了解了一下阿里云.腾讯云和百度云.其中,百度云提供了图像识别及图像搜索,而且还细分地提供了相似图片这项服务,比较符合我的需求,且百度 ...
基于百度AI开放平台的人脸识别及语音合成
基于百度AI的人脸识别及语音合成课题课题需求 (1)人脸识别在Web界面上传人的照片,后台使用Java技术接收图片,然后对图片进行解码,调用云平台接口识别人脸特征,接收平台返回的人员年龄.性别.颜 ...
人工智能-调百度AI接口+图灵机器人
1.登陆百度AI的官网 1.注册:没有账号注册 2.创建应用 3.创建应用 4.查看应用的ID 5.Python代码 from aip import AipSpeech APP_ID = " ...
PHP百度AI的OCR图片文字识别
第一步可定要获取百度的三个东西要到百度AI网站(http://ai.baidu.com/)去注册然后获得 -const APP_ID = '请填写你的appid'; -const API_KEY ...
Python通过百度Ai识别图片中的文字
版本:python3.7 工作中有需要识别图片中的汗字,查看了半天大神们的博客,但没找到完全可以用的源码,经过自己的实践,以下源码可以实现: 创建应用首先你需要登录百度AI,选择文字识别,创建一个应 ...
java通过百度AI开发平台提取身份证图片中的文字信息
废话不多说,直接上代码... IdCardDemo.java package com.wulss.baidubce; import java.io.BufferedReader; import jav ...

随机推荐

laravel安装一直报错
laravel安装一直报错原因: 1.找到php版本是否对应 2.缺少第三方扩展库vendor 需要composer update 解决链接:https://learnku.com/docs/lar ...
关于 systemctl --user status 报错的问题
关于 systemctl --user enable mpd 报错: Failed to connect to bus: No such file or directory 因为arch脚本中,sys ...
执行效率做比较，Go、python、java、c#、delphi、易语言等
比较环境,在win7 64位,比较各种语言的整数型运算,下面的比较只作为单项比较.具体方式,40000*40000遍历相加.为了防止编译器优化,生成一个随机数. 1:c#,在NET2.0框架下作为 ...
mysql学习【第6篇】：权限和数据库设计
狂神声明 : 文章均为自己的学习笔记 , 转载一定注明出处 ; 编辑不易 , 防君子不防小人~共勉 ! mysql学习[第6篇]:权限和数据库设计用户和权限管理 /* 用户和权限管理 */ ---- ...
Mac下搭建solr搜索引擎与PHP扩展开发（上）
首先需要安装jdk,前往 https://www.oracle.com/technetwork/java/javase/downloads/jdk12-downloads-5295953.html 自 ...
用python写多线程
import threading #首先导入threading 模块,这是使用多线程的前提 from time import ctime,sleep def music(func): ): print ...
虚拟机与Docker有何不同
http://www.techug.com/post/comparing-virtual-machines-vs-docker-containers.html 译者按: 各种虚拟机技术开启了云计算时代 ...
make pycaffe时候报错：Makefile:501: recipe for target 'python/caffe/_caffe.so' failed
安装caffe-ssd编译环境的时候报错: python/caffe/_caffe.cpp:10:31: fatal error: numpy/arrayobject.h: No such file ...
usermod - linux修改用户帐户信息
usermod - 修改用户帐户信息 modify a user account usermod [options] user_name usermod 命令修改系统帐户文件来反映通过命令行指定的变化 ...
Sitecore Aliases
Sitecore别名出于各种原因,有时您希望页面URL简短且易于记忆.例如,如果您在网站上运行任何广告系列或某些广告,则需要轻松记住该网址.在Sitecore中,有一种方法可以为名为Sitecore ...

百度AI搜索引擎