CSS选择器使用

今天要对CSS选择器的使用方法做一个全面的总结（几乎全部是从这篇文章摘抄的 https://blog.csdn.net/qq_39241986/article/details/82185697）

CSS选择器常用类型

常用的5大CSS选择器：

# 1.元素选择器：又称为标签选择器，根据标签名来固定样式作用范围。

eg.对页面所有p标签样式限定：

p{

font-size:12px;  # 字体大小

background:#900;  # 背景颜色

}

# 2.类选择器：即根据元素(标签)的class属性来固定样式作用范围。（class不是唯一的）

eg.设置class为demoDiv的div块颜色

.demoDiv{color:#FF0000;}

# 3.ID选择器:即根据元素(标签)的id属性来固定样式作用范围。（ID是唯一的）

eg.设置id为demoDiv的div块颜色

#demoDiv{color:#FF0000; }

# 4.后代选择器：又称为包含选择器，用来选择特定元素或元素组的后代，将对父元素的选择放在前面，对子元素的选择放在后面，中间加一个空格分开。

eg.设置id为links的后代中标签a为红色

#links a {color:red;}

# 5.子选择器：子选择器（child selector）仅是指它的直接后代，或者你可以理解为作用于子元素的第一个后代，通过“>”进行选择。

eg.设置id为links的后代中第一个a标签为蓝色

#links > a {color:blue;}

当然还有很多css选择器，比如伪类选择器、通用选择器、群组选择器等，我就不赘述了，大家要用百度谷歌

一下就可以了嘿嘿。

举例练习，爬取 http://python.jobbole.com/89196/ 网页的内容

# -*- coding: utf-8 -*-

import scrapy

import re

class JobboleSpider(scrapy.Spider):

    name = 'jobbole'

    allowed_domains = ['blog.jobbole.com']

    start_urls = ['http://python.jobbole.com/89196/']

    def parse(self, response):

        # CSS选择器实战

        # 文章标题

        title = response.css(".entry-header h1 ::text").extract()[0]

        # 发布日期

        data_r = response.css(".entry-meta-hide-on-mobile::text").extract()[0].strip()

        data_time = data_r.replace('·','').strip()

        # 文章分类

        type_01 = response.css(".entry-meta-hide-on-mobile > a:nth-child(1)::text").extract()[0]

        type_02 = response.css(".entry-meta-hide-on-mobile > a:nth-child(2)::text").extract()[0]

        article_type = type_01 + "·" + type_02

        # 文章简介

        summary = response.css(".entry > blockquote:nth-child(2) > p:nth-child(1)::text").extract()[0]

        # 点赞数

        praise_number = int( response.css("#89196votetotal::text").extract()[0])

        # 收藏数

        collection_str = response.css("span.btn-bluet-bigger:nth-child(2)::text").extract()[0]

        reg_02 = '.*?(\d+).*'

        collection_number = int(re.findall(reg_02,collection_str)[0])

        print("文章标题："+title)

        print("发布日期："+data_time)

        print("文章分类："+article_type)

        print("文章简介："+summary)

        print("点赞数："+str(praise_number))

        print("收藏数："+str(collection_number))

>>> response.css(".entry-header h1").extract()

['<h1>爬虫进阶：反反爬虫技巧</h1>']

我们发现文章标题并没被完全取出，还是被h1标签包裹着，有两种方法获取文字：
方法一：正则表达式获取（麻烦）

>>> title = response.css(".entry-header h1").extract()[0]

>>> reg_01 = "<h1>(.*?)</h1>"

>>> title = re.findall(reg_01,title)[0]

>>> title

'爬虫进阶：反反爬虫技巧'

方法二：伪类选择器（简单）

>>> title = response.css(".entry-header h1 ::text").extract()[0]

>>> title

'爬虫进阶：反反爬虫技巧’

获取文章发布时间

'''

预备小知识：

1.str.strip():可以去除str里左右两端的空格和\n,\r。

2.str.replace("a","b"):将str里所有的a由b代替。

'''

# 文章发布时间

>>> data_r = response.css(".entry-meta-hide-on-mobile::text").extract()[0]

>>> data_r

'\r\n\r\n            2018/06/28 ·  '

>>> data_r = data_r.strip()

>>> data_r

'2018/06/28 ·'

>>> data_time = data_r.replace('·','').strip()

>>> data_time

'2018/06/28'

获取文章点赞数、收藏数、评论数

# 点赞数：h10下id为89196votetotal，因为页面内该id值唯一，故可以直接用id选择器

>>> response.css("#89196votetotal::text").extract()[0]

''

# praise_number = int(response.css("#89196votetotal::text").extract()[0])

# 收藏数：a:nth-child(2)表示选取a标签的第二个元素

>>> response.css("span.btn-bluet-bigger:nth-child(2)::text").extract()[0]

' 6 收藏'

>>> import re

>>> reg_02 = '.*(\d+).*'

>>> collection_str = response.css("span.btn-bluet-bigger:nth-child(2)::text").extract()[0]

>>> re.findall(reg_02,collection_str)[0]

''

或用collection_str = collection_str[0:3].strip()

# collection_str = response.css("span.btn-bluet-bigger:nth-child(2)::text").extract()[0]

#  reg_02 = '.*(\d+).*'

# collection_number = int(re.findall(reg_02,collection_str)[0])

# 评论数：X先生这次选择的又是没有评论的，可谓良苦用心，只为了让大家自己多动动脑袋，多想想，

# 哈哈哈

>>> response.css("span.hide-on-480::text").extract()[0]

'  评论'

# 如果有评论的话，和收藏数一样，用正则表达式匹配数字即可，自己找篇有评论的试试吧~

文章简介

>>> response.css(".entry > blockquote:nth-child(2) > p:nth-child(1)::text").extract()[0]

'主要针对以下四种反爬技术：Useragent过滤；模糊的Javascript重定向；验证码；请求头一致性检查。'

文章分类

>>> response.css(".entry-meta-hide-on-mobile > a:nth-child(1)::text").extract()[0]

'实践项目'

>>> response.css(".entry-meta-hide-on-mobile > a:nth-child(2)::text").extract()[0]

'爬虫'

CSS选择器使用的更多相关文章

前端极易被误导的css选择器权重计算及css内联样式的妙用技巧
记得大学时候,专业课的网页设计书籍里面讲过css选择器权重的计算:id是100,class是10,html标签是5等等,然后全部加起来的和进行比较... 我只想说:真是误人子弟,害人不浅! 最近,在前 ...
css选择器
常用css选择器,希望对大家有所帮助,不喜勿喷. 1.*:通用选择器 * { margin: 0; padding: 0; } 选择页面上的全部元素,通常用于清除浏览器默认样式,不推荐使用. 2.#i ...
dynamic-css 动态 CSS 库，使得你可以借助 MVVM 模式动态生成和更新 css，从 js 事件和 css 选择器的苦海中脱离出来
dynamic-css 使得你可以借助 MVVM 模式动态生成和更新 css,从而将本插件到来之前,打散.嵌套在 js 中的修改样式的代码剥离出来.比如你要做元素跟随鼠标移动,或者根据滚动条位置的变化 ...
CSS选择器的权重与优先规则？
我们做项目的时候,经常遇到样式层叠问题,被其他的样式覆盖,或者写的权重不高没效果,对权重没有具体的分析,做了一个总结. css继承是从一个元素向其后代元素传递属性值所采用的机制.确定应当向一个元素应用 ...
css选择器的使用详解
-.css选择器的分类: 二.常用选择器详解: 1.标签选择器: 语法: 标签名 { 属性:属性值; } 代码示例: h1 { color: #ccc; font-size: 28px; } 2.类选 ...
js,jq,css选择器
js获取节点: var chils= s.childNodes; //得到s的全部子节点 var par=s.parentNode; //得到s的父节点 var ns=s.nextSbiling; / ...
CSS系列：CSS选择器
选择器(selector)是CSS中很重要的概念,所有HTML语言中的标记样式都是通过不同的CSS选择器来控制的.用户只需要通过选择对不同的HTML标签进行选择,并赋予各种样式声明,即可实现各种效果. ...
细说CSS选择器
众所周知,CSS的一个核心特征就是能向文档中的一组元素类型应用某些规则.每个规则都有两个基本部分:选择器(selector)和声明块(declaration block).下图显示了规则的各个部分. ...
CSS选择器转
来自于:http://www.cnblogs.com/webblog/archive/2009/08/07/1541005.html 最近在研究jQuery的选择器,大家知道jQuery的选择器和cs ...
HTML5 -入门 (---css样式-------------（css基础与css选择器）---------------------—）
---恢复内容开始--- 一css基础入门与css选择器 CSS英文全拼:cascading style sheet 层叠样式表. 在html中使用:要在head中写style标签,所有样式放在sty ...

随机推荐

【HBase】rowkey、索引表设计
总订单数1亿条 ->订单id,用户id,商品id集合,订单时间,订单完成时间,订单状态: HBase表设计: 主表 -> Rowkey: 用户ID_时间戳列簇:info 索引表 -> ...
Java实现 LeetCode 699 掉落的方块（线段树？）
699. 掉落的方块在无限长的数轴(即 x 轴)上,我们根据给定的顺序放置对应的正方形方块. 第 i 个掉落的方块(positions[i] = (left, side_length))是正方形,其 ...
Java实现蓝桥杯算法训练排序
算法训练排序时间限制:1.0s 内存限制:512.0MB 问题描述编写一个程序,输入3个整数,然后程序将对这三个整数按照从大到小进行排列. 输入格式:输入只有一行,即三个整数,中间用空格隔开. ...
Java实现 LeetCode 445 两数相加 II
445. 两数相加 II 给定两个非空链表来代表两个非负整数.数字最高位位于链表开始位置.它们的每个节点只存储单个数字.将这两数相加会返回一个新的链表. 你可以假设除了数字 0 之外,这两个数字都不会 ...
Java实现P2102 -- 正整数序列
P2102 – 正整数序列给定正整数n, 你的任务是用最少的操作次数把序列1,2,-,n中的所有数都变成0.每次操作可从序列中选择一个或多个整数, 同时减去一个相同的正整数.比如,1,2,3可以把2 ...
Java中List,Set,Map的区别以及API的使用
1.面试题:你说说collection里面有什么子类. (其实面试的时候听到这个问题的时候,你要知道,面试官是想考察List,Set) 正如图一,list和set是实现了collection接口的. ...
Java实现蓝桥杯算法提高 Monday-Saturday质因子
试题算法提高 Monday-Saturday质因子资源限制时间限制:1.0s 内存限制:256.0MB 问题描述这个问题是个简单的与数论有关的题目,看起来似乎是"求正整数的所有质因子 ...
温故知新-快速理解Linux网络I/O
文章目录摘要阻塞.非阻塞.同步.异步 Linux下的I/O模型阻塞I/O模型非阻塞I/O模型 I/O复用模型 select poll epoll 信号驱动I/O模型异步I/O 参考你的鼓励 ...
程序员实用JDK小工具归纳，工作用得到
在JDK的安用装目录bin下,有一些有非常实用的小工具,可用于分析JVM初始配置.内存溢出异常等问题,我们接下来将对些常用的工具进行一些说明. JDK小工具简介在JDK的bin目录下面有一些小工具, ...
UniRx精讲（一）：UniRx简介&定时功能实现
1.UniRx 简介 UniRx 是一个 Unity3D 的编程框架.它专注于解决时间上异步的逻辑,使得异步逻辑的实现更加简洁和优雅. 简洁优雅如何体现? 比如,实现一个"只处理第一次鼠标点 ...

CSS选择器使用

CSS选择器使用的更多相关文章

随机推荐

热门专题