pycharm初爬虫

今天尝试使用pycharm+beautifulsoup进行爬虫测试。我理解的主要分成了自己写的HTML和百度上的网页两种吧。第一种，读自己写的网页（直接上代码）：

（主要参考博客：https://blog.csdn.net/Ka_Ka314/article/details/80999803）

from bs4 import BeautifulSoup

file = open('aa.html', 'rb')

html = file.read()

bs = BeautifulSoup(html,"html.parser")

# 缩进格式

print(bs.prettify())

# 获取title标签的所有内容

print(bs.title)

# 获取title标签的名称

print(bs.title.name)

# 获取title标签的文本内容

print(bs.title.string)

# 获取head标签的所有内容

print(bs.head)

# 获取第一个div标签中的所有内容

print(bs.div)

# 获取第一个div标签的id的值

print(bs.div["id"])

# 获取第一个a标签中的所有内容

print(bs.a)

# 获取所有的a标签中的所有内容

print(bs.find_all("a"))

# 获取id="u1"

print(bs.find(id="u1"))

# 获取所有的a标签，并遍历打印a标签中的href的值

for item in bs.find_all("a"):

    print(item.get("href"))

# 获取所有的a标签，并遍历打印a标签的文本值

for item in bs.find_all("a"):

    print(item.get_text())

　　HTML代码：

<!DOCTYPE html>

<!--STATUS OK-->

<html>

 <head>

  <meta content="text/html;charset=utf-8" http-equiv="content-type"/>

  <meta content="IE=Edge" http-equiv="X-UA-Compatible"/>

  <meta content="always" name="referrer"/>

  <link href="https://ss1.bdstatic.com/5eN1bjq8AAUYm2zgoY3K/r/www/cache/bdorz/baidu.min.css" rel="stylesheet" type="text/css"/>

  <title>

   百度一下，你就知道

  </title>

 </head>

 <body link="#0000cc">

  <div id="wrapper">

   <div id="head">

    <div class="head_wrapper">

     <div id="u1">

      <a class="mnav" href="http://news.baidu.com" name="tj_trnews">

       新闻

      </a>

      <a class="mnav" href="https://www.hao123.com" name="tj_trhao123">

       hao123

      </a>

      <a class="mnav" href="http://map.baidu.com" name="tj_trmap">

       地图

      </a>

      <a class="mnav" href="http://v.baidu.com" name="tj_trvideo">

       视频

      </a>

      <a class="mnav" href="http://tieba.baidu.com" name="tj_trtieba">

       贴吧

      </a>

      <a class="bri" href="//www.baidu.com/more/" name="tj_briicon" style="display: block;">

       更多产品

      </a>

     </div>

    </div>

   </div>

  </div>

 </body>

</html>

　　项目目录：

第二种是爬取在线网页内容，使用URL解析，这里我使用时出现了问题，就是URLopen。因为没有找到python27和python36区别，所以这里直接上结果（我用的python36）,下载urllib.request的包。网上个别教程直接使用urllib,这里我把urllib3、5进行了下载，会报一个错误，显示连接网页超时。下下载这个urllib没问题

pycharm初爬虫的更多相关文章

解决pycharm的爬虫乱码问题（初步了解各种编码格式）
Ascii码(American Standard Code for Information Interchange,美国信息互换标准代码):最初计算机只在美国使用时,只用8位的字节来组合出256(2的 ...
Python开发之---PyCharm初体验
PyCharm 的初始设置(知道) 目标恢复 PyCharm 的初始设置第一次启动 PyCharm 新建一个 Python 项目设置 PyCharm 的字体显示 PyCharm 的升级以及其他 ...
【Django】用pycharm初学习使用Django
开发框架流程 M V C(99%的开发都是这种流程.) 1.URL控制器 2.Views 视图 3.models 库 1.首先创建一个Django 2.创建成功后里面几个模块的功能用它来 ...
爬虫系列----scrapy爬取网页初始
一基本流程创建工程,工程名称为(cmd):firstblood: scrapy startproject firstblood 进入工程目录中(cmd):cd :./firstblood 创建爬虫 ...
scrapy框架修改单个爬虫的配置,包括下载延时，下载超时设置
在一个框架里面有多个爬虫时,每个爬虫的需求不相同,例如,延时的时间,所以可以在这里配置一下custom_settings = {},大括号里面写需要修改的配置,然后就能把settings里面的配置给覆 ...
Python Scrapy爬虫速成指南
序本文主要内容:以最短的时间写一个最简单的爬虫,可以抓取论坛的帖子标题和帖子内容. 本文受众:没写过爬虫的萌新. 入门 0.准备工作需要准备的东西: Python.scrapy.一个IDE或者随便 ...
python爬虫出现ProxyError: HTTPSConnectionPool错误
在今天刚刚打开pycharm运行爬虫时,发现所有的爬虫都不能运行,会出现如下的错误: 错误出现的主要原因是;代理错误(其实自己根本没有设置代理) 解决方法: 在网上查阅了许多类似的错误解决方法,试过后 ...
python爬虫1
1 网页结构 html:超文本标记语言------->类似人的鼻子耳朵,长在那里,大体骨架就是那个样子 css:层叠样式表------->这个是外观的深化,比如贴个双眼皮,橙色眼睛... ...
附: Python爬虫数据库保存数据
原文 1.笔记 #-*- codeing = utf-8 -*- #@Time : 2020/7/15 22:49 #@Author : HUGBOY #@File : hello_sqlite3.p ...

随机推荐

Linux应试技巧
前言:此文是为了CSP-S第二轮认证所用系统NOI-Linux的写的,但其他的Linux系统也可以按照相同或类似的方法进行配置. 配置NOI-Linux 我大约是一个月以前由于比赛的原因才开始接触NO ...
家用环境下部署wifidog认证服务器(java版)
本文所讲的是基于一个java版wifidog认证服务器的开源项目,在windows环境下搭建wifidog认证服务器配合apfree固件实现用户名密码的认证. 大致步骤如下: 一,准备 1.搭建硬件及 ...
lograotate 配置常用配置
目录 lograotate 配置说明 nginx php-fpm tomcat 配置各种参数说明 lograotate 配置说明 Linux系统默认安装logrotate工具,它默认的配置文件在: ...
【shell脚本】定时备份日志===logBackup.sh
定时备份日志设置执行权限 [root@VM_0_10_centos shellScript]# chmod a+x logBackup,sh 脚本内容 [root@VM_0_10_centos sh ...
iOS性能优化-数组、字典便利时间复杂
上图是几种时间复杂度的关系,性能优化一定程度上是为了降低程序执行效率减低时间复杂度. 如下是几种时间复杂度的实例: O(1) return array[index] == value; 复制代码 O( ...
移动端rem布局，用户调整手机字体大小或浏览器字体大小后导致页面布局出错问题
一.用户修改手机字体设置大小,影响App里打开的web页面. 手机字体设置大小,影响App的页面.Android的可以通过webview配置webview.getSettings().setTextZ ...
【转】Visual Studio 2008 可扩展性开发（二）：Macro和Add-In初探
前言在VS概览中,我们简单回顾了一下VS的历史.本文将通过两个简单的例子来说明Macro和Add-In的开发.通过Macro我们把VS中的一些重复操作录制下来,之后可以多次运行,节省时间并保持好的心 ...
conda opencv cv2.imshow无法使用
error: -------src-dir-------/opencv-2.4.10/modules/highgui/src/window.cpp:501: error: (-2) The funct ...
ASP.NET Core快速入门（第6章：ASP.NET Core MVC）--学习笔记
课程链接:http://video.jessetalk.cn/course/explore 良心课程,大家一起来学习哈! 任务40:介绍 1.Individual authentication 模板 ...
升级GCC
1. wget http://ftp.gnu.org/gnu/gcc/gcc-4.9.4/gcc-4.9.4.tar.gz 2. tar -zxvf gcc-4.9.4.tar.gz 3. cd gc ...

pycharm初爬虫

pycharm初爬虫的更多相关文章

随机推荐

热门专题