伯乐在线资讯URL

伯乐资讯URL

# encoding: utf-8

import requests

from bs4 import BeautifulSoup

import csv

import time

base_url = 'http://top.jobbole.com/page/'

session = requests.session()

inum=0

def zhuqu(page):

    url_list = []

    url = base_url+str(page)+"/"

    # print(url)

    res = session.get(url=url)

    soup = BeautifulSoup(res.text, 'html.parser')

    post_nodes = soup.select(".list-posts .media .media-body h3 a")

    for post_node in post_nodes:

        post_url = post_node.get("href")

        url_list.append([post_url])

        # i+=1

        # print(i,post_url)

    print(url_list)

    return url_list

# zhuqu(2)

with open("伯乐资讯", 'w', newline="", encoding='utf-8') as csv_out:

        writer = csv.writer(csv_out)

        for i in range(355):

            if i%10==0:

                time.sleep(1)

            row =zhuqu(i)

            if not row:

                print("有错误")

                continue

            else:

                writer.writerows(row)

                print(inum,"成功")

                inum+=1

代码如上

问题：把广告也抓进来了，不知道怎么用css选择来避免抓取这种情况，懂的朋友给提示下。

伯乐在线资讯URL的更多相关文章

伯乐在线文章URL
一段代码,可以跑出所有文章的url # encoding: utf-8 import requests from bs4 import BeautifulSoup base_url = 'http:/ ...
【伯乐在线】最值得阅读学习的 10 个 C 语言开源项目代码
原文出处: 平凡之路的博客欢迎分享原创到伯乐头条伯乐在线注:『阅读优秀代码是提高开发人员修为的一种捷径』http://t.cn/S4RGEz .之前@伯乐头条曾发过一条微博:『C 语言进阶有 ...
爬虫实战——Scrapy爬取伯乐在线所有文章
Scrapy简单介绍及爬取伯乐在线所有文章一.简说安装相关环境及依赖包 1.安装Python(2或3都行,我这里用的是3) 2.虚拟环境搭建: 依赖包:virtualenv,virtualenvwr ...
python爬虫scrapy框架——爬取伯乐在线网站文章
一.前言 1. scrapy依赖包: 二.创建工程 1. 创建scrapy工程: scrapy staratproject ArticleSpider 2. 开始(创建)新的爬虫: cd Artic ...
Scrapy分布式爬虫打造搜索引擎- (二)伯乐在线爬取所有文章
二.伯乐在线爬取所有文章 1. 初始化文件目录基础环境 python 3.6.5 JetBrains PyCharm 2018.1 mysql+navicat 为了便于日后的部署:我们开发使用了虚拟 ...
初识Scrapy——1—scrapy简单学习，伯乐在线实战、json数据保存
Scrapy——1 目录什么是Scrapy框架? Scrapy的安装 Scrapy的运行流程 Scrapy的使用实战:伯乐在线案例(json文件保存) 什么是Scrapy框架? Scrapy是用纯 ...
Scrapy爬取伯乐在线的所有文章
本篇文章将从搭建虚拟环境开始,爬取伯乐在线上的所有文章的数据. 搭建虚拟环境之前需要配置环境变量,该环境变量的变量值为虚拟环境的存放目录 1. 配置环境变量 2.创建虚拟环境用mkvirtualen ...
我常用的 Python 调试工具 - 博客 - 伯乐在线
.ckrating_highly_rated {background-color:#FFFFCC !important;} .ckrating_poorly_rated {opacity:0.6;fi ...
python爬虫实战（七）--------伯乐在线文章（模版）
相关代码已经修改调试成功----2017-4-21 一.说明 1.目标网址:伯乐在线 2.实现:如图字段的爬取 3.数据:存放在百度网盘,有需要的可以拿取链接:http://pan.baidu.co ...

随机推荐

前端基础-html（1）
写在前面: 前端后端 C(client) S(server) B(browser) S(server) 以用户为出发点一.web标准 1)web ...
java.sql.SQLException: The user specified as a definer ('root'@'%') does not exist
权限问题,授权给 root 所有sql 权限在Navicat for MySQL中按F6进入命令列界面 mysql> grant all privileges on *.* to root@& ...
python常用模块——sys模块
sys模块的功能很多,下面介绍几个常用的模块. 1.sys.argv:从外部向程序内部传递参数 #!/usr/bin/env python import sys print(sys.argv[0]) ...
Android开发问题：ActivityNotFoundException: Unable to find explicit activity class
http://blog.csdn.net/debuglog/article/details/7236013 原因:AndroidManifest.xml未添加对应Activity配置. 解决办法:在A ...
SpringMVC:学习笔记(7)——验证器(JSR303)
JSR 303(Bean Validation ) 说明: 在任何时候,当你要处理一个应用程序的业务逻辑,数据校验是你必须要考虑和面对的事情.应用程序必须通过某种手段来确保输入进来的数据从语义上来讲是 ...
DEC VT100 terminal
【HackerRank】Coin on the Table
题目链接:Coin on the Table 一开始想用DFS做的,做了好久都超时. 看了题解才明白要用动态规划. 设置一个三维数组dp,其中dp[i][j][k]表示在时间k到达(i,j)所需要做的 ...
Android相机实时自动对焦的完美实现
https://zhidao.baidu.com/question/873328177698804372.html Android相机实时自动对焦的完美实现 http://blog.csdn.net/ ...
ES6 随记（1）-- let 与 const
1. const(声明一个只读的常量) 这个是很好理解的,且声明时就必须赋值而不能以后再赋,不然会报错. 而个人认为它最大的用处还是在于 {} 和 [] 上,const 保证了它的内存地址(指针)不变 ...
Linux静默安装weblogic
本实验安装weblogic10系列版本 #创建weblogic用户组. [root@admin /]# groupadd weblogic[root@admin /]# useradd -g webl ...

伯乐在线资讯URL

伯乐在线资讯URL的更多相关文章

随机推荐

热门专题