scrapy爬取极客学院全部课程

 # -*- coding: utf-8 -*-

 # scrapy爬取极客学院全部课程

 import scrapy

 from pyquery import PyQuery as pq

 from jike.items import JikeItem

 class JikespiderSpider(scrapy.Spider):

     name = "jikespider"

     allowed_domains = ["www.jikexueyuan.com"]

     base_url = 'http://www.jikexueyuan.com/course/?pageNum='

     def start_requests(self):

         for page_num in range(1,96):

             url = self.base_url + str(page_num)

             yield scrapy.Request(url, callback=self.parse_index)

     def parse_index(self, response):

         doc = pq(response.text)

         lis = doc('.lesson-list .cf li').items()

         # pyquery心得, 以为pyquery有点问题而导致无法遍历数据结构,

         # 研究发现是'http:' + item('.lessonimg-box a').attr('href')

         # 的问题, href是相对路径没有得到一个有效的请求链接

         for item in lis:

             detail_url = 'http:' + item('.lessonimg-box a').attr('href')

             yield scrapy.Request(url=detail_url,callback=self.parse_detail)

     def parse_detail(self, response):

         item = JikeItem()

         doc = pq(response.text)

         item['title'] = doc('.lesson-teacher .bc-box h2').text()

         item['time'] = doc('.lesson-teacher .bc-box .timebox').text()

         item['content'] = doc('.lesson-teacher .infor-content').text()

         yield item

scrapy爬取极客学院全部课程的更多相关文章

PyCharm+Scrapy爬取安居客楼盘信息
一.说明 1.1 开发环境说明开发环境--PyCharm 爬虫框架--Scrapy 开发语言--Python 3.6 安装第三方库--Scrapy.pymysql.matplotlib 数据库--M ...
基于requests实现极客学院课程爬虫
背景本文主要是为了完成极客学院课程<Python 单线程爬虫>中讲师布置的实战作业. 开发环境操作系统:windows 10 Python :Python 2.7 IDE:PyChar ...
python极客学院爬虫V1
定向爬取极客学院视频,原本只有年费VIP只能下载,经过分析,只要找个免费体验VIP即可爬取所有视频涉及的基本技术:python xpath 正则 com+ 通过python调用迅雷从组件,实现自动创 ...
python scrapy版极客学院爬虫V2
python scrapy版极客学院爬虫V2 1 基本技术使用scrapy 2 这个爬虫的难点是 Request中的headers和cookies 尝试过好多次才成功(模拟登录),否则只能抓免费课 ...
Scrapy爬取自己的博客内容
python中常用的写爬虫的库有urllib2.requests,对于大多数比较简单的场景或者以学习为目的,可以用这两个库实现.这里有一篇我之前写过的用urllib2+BeautifulSoup做的一 ...
【极客学院出品】Cocos2d-X系列课程之九-BOX2D物理引擎
Cocos2d-x 是时下最热门的手游引擎,在国内和国外手机游戏开发使用的份额各自是70%和25%,在App Store的top10中,有7个是用它开发的. 本节课程为Cocos2d-x系列课程之九, ...
Scrapy爬取美女图片第四集突破反爬虫(上)
本周又和大家见面了,首先说一下我最近正在做和将要做的一些事情.(我的新书<Python爬虫开发与项目实战>出版了,大家可以看一下样章) 技术方面的事情:本次端午假期没有休息,正在使用fl ...
Scrapy爬取美女图片续集 (原创)
上一篇咱们讲解了Scrapy的工作机制和如何使用Scrapy爬取美女图片,而今天接着讲解Scrapy爬取美女图片,不过采取了不同的方式和代码实现,对Scrapy的功能进行更深入的运用.(我的新书< ...
maven介绍极客学院
来自极客学院 Apache Maven 是一套软件工程管理和整合工具.基于工程对象模型(POM)的概念,通过一个中央信息管理模块,Maven 能够管理项目的构建.报告和文档. Maven - 概述 M ...

随机推荐

Mysql语句的执行过程
当你希望MySQL能够以更高的性能运行查询时,最好的办法是弄清楚MySQL是如何优化和执行查询.<高性能MySQL> MySQL客户端与服务器端的通信特点客户端与服务器之间是半双工通信, ...
Vue解析四之注册变量
判断监听的变量,如果undefined可以用$set来注册一个变量. 另外click可以是表达式,不一定必须是一个方法.
详解Tomcat线程池原理及参数释义
omcat线程池有如下参数: maxThreads, 最大线程数,tomcat能创建来处理请求的最大线程数 maxSpareTHreads, 最大空闲线程数,在最大空闲时间内活跃过,但现在处于空闲,若 ...
上传到 App Store 时出错。
Try this, it fixed it for me. Open Terminal and run: cd ~ mv .itmstransporter/ .old_itmstransporte ...
STL --> deque双向队列
deque简介 deque是双向开口的连续性存储空间.虽说是连续性存储空间,但这种连续性只是表面上的,实际上它的内存是动态分配的,它在堆上分配了一块一块的动态储存区,每一块动态存储去本身是连续的,de ...
Linux中SVN的备份与恢复
linux中SVN备份有三种方式 1.svnadmin dump 是官方推荐的备份方式,优点是比较灵活,可以全量备份也可以增量备份,并提供版本恢复机制. 缺点是版本数过大,增长到数万以上,那么dump ...
ASP.NET没有魔法——ASP.NET MVC Razor与View渲染
对于Web应用来说,它的界面是由浏览器根据HTML代码及其引用的相关资源进行渲染后展示给用户的结果,换句话说Web应用的界面呈现工作是由浏览器完成的,Web应用的原理是通过Http协议从服务器上获取到 ...
python替换残缺的多域名图片网址
在获取网站真是图片的时候,经常遇到图片链接残缺问题. 例如下图所示的情况: img标签中的图片链接是残缺的,如果这个网站域名又是多种情况的话,比如 http://sports.online.sh.cn ...
MySQL之索引详解
这篇博客将要阐述为什么使用b+树作为索引,而不是b树或者其他树 1.什么是b树 (图片来自网络) b树相关特性:⑴关键字分布在整棵树中 ⑵任何一个关键字只出现在一个节点上 ⑶搜索可能在非叶子节点上结束 ...
【分布式系列之dubbo】SSM+Dubbo实战
对于传统的单一构架,也就是打成的war或者ear包部署在同一个Web容器里的构架,它虽然开发.测试.部署简单,但随着业务的不断发展,维护成本增加,可扩展性差,而且一台Tomcat的并发数在500左右, ...

scrapy爬取极客学院全部课程

scrapy爬取极客学院全部课程的更多相关文章

随机推荐

热门专题