python+bs4+urllib

# -*- coding: utf-8 -*-

#

#

#

from bs4 import BeautifulSoup

import urllib2

import sys

reload(sys)

sys.setdefaultencoding('utf-8')

###url = 'https://www.qidian.com/search?kw=%E7%AC%91%E5%82%B2%E6%B1%9F%E6%B9%96'

#

#

#

class main():

    def __init__(self):

        pass

    def search(self):

        '''查询函数'''

        ####输入关键字

        ####访问url，获取信息

        ####存储信息

        print '-'*80

        #print '--开始输入关键字: '.decode('utf-8').encode('gbk')

        #key = raw_input('key: ')

        key = urllib2.quote('笑傲江湖')

        url = 'https://www.qidian.com/search?kw='+key

        print '访问的网址是--'.decode('utf-8').encode('gbk')+url

        #####开始访问

        self.spider(url)

    def spider(self, url):

        print '-'*80

        print '开始访问网页'.decode('utf-8').encode('gbk')

        print '-'*80

        response = urllib2.urlopen(url).read()

        obj = BeautifulSoup(response,'html.parser')

        div_list = obj.find('div',{'class':'book-img-text'}).find_all('li')

        for v in div_list:

            name =  v.find('h4').find('a').text

            intro = v.find('div',{'class':'book-mid-info'}).find('p',{'class':'intro'}).text

            print intro

    def test(self):

        print urllib2.quote('笑傲江湖')

if __name__ == '__main__':

    book = main()

    book.search()

python+bs4+urllib的更多相关文章

Python -bs4介绍
https://cuiqingcai.com/1319.html Python -BS4详细介绍Python 在处理html方面有很多的优势,一般情况下是要先学习正则表达式的.在应用过程中有很多模块是 ...
Python使用urllib,urllib3,requests库+beautifulsoup爬取网页
Python使用urllib/urllib3/requests库+beautifulsoup爬取网页 urllib urllib3 requests 笔者在爬取时遇到的问题 1.结果不全 2.'抓取失 ...
python中urllib, urllib2,urllib3, httplib,httplib2, request的区别
permike原文python中urllib, urllib2,urllib3, httplib,httplib2, request的区别若只使用python3.X, 下面可以不看了, 记住有个ur ...
python:利用urllib查找计算机二级准考证号
aaarticlea/png;base64,iVBORw0KGgoAAAANSUhEUgAAAaYAAAEACAIAAAB3VkWnAAAgAElEQVR4nOydZ3gUR9bv+WhExhHnDH
【Python】Python的urllib模、urllib2模块的网络下载文件
因为需要从一些下载一个页PDF文件.但是需要下载PDF有数百个文件,这是不可能用人工点击下载.只是Python有相关模块,所以写一个程序PDF文件下载,顺便熟悉Python的urllib模块和ulrl ...
定义一个方法get_page(url),url参数是需要获取网页内容的网址，返回网页的内容。提示（可以了解python的urllib模块）
定义一个方法get_page(url),url参数是需要获取网页内容的网址,返回网页的内容.提示(可以了解python的urllib模块) import urllib.request def get_ ...
python爬虫 - Urllib库及cookie的使用
http://blog.csdn.net/pipisorry/article/details/47905781 lz提示一点,python3中urllib包括了py2中的urllib+urllib2. ...
Python 爬虫 --- urllib
对于互联网数据,Python 有很多处理网络协议的工具,urllib 是很常用的一种. 一.urllib.request,request 可以很方便的抓取 URL 内容. urllib.request ...
Python爬虫Urllib库的高级用法
Python爬虫Urllib库的高级用法设置Headers 有些网站不会同意程序直接用上面的方式进行访问,如果识别有问题,那么站点根本不会响应,所以为了完全模拟浏览器的工作,我们需要设置一些Head ...

随机推荐

YUICompressor的安装及使用（一）
step1:下载ant和YUICompressor 1) Ant: http://ant.apache.org/bindownload.cgi 打开页面后,下拉滚动条,找到如下图所示,单 ...
3d tech
product Company 3D "smart cameras" such as the Gocator LMI Technologies (Delta, BC Cana ...
nginx 学习资料
nginx 学习资料 table th:first-of-type { width: 90px; } table th:nth-of-type(2) { } table th:nth-of-type( ...
Github使用说明 --整理者米米
打开百度搜索Git官网下载对应的windows版本傻瓜式默认安装,点击完成 PS:安装的过程比较慢安装完成后打开命令行窗口(cmd) 查看版本号------git --version 安装成功 ...
源码查看工具ctags+vim
一.ctags源码工具的安装 1.sudo apt-get install ctags 2.源码目录如下: 3.对配置文件进行配置 4.在末尾添加如下: 二.使用 1. 进入源码目录,输入ctags ...
从错误0x80070522，谈强制完整性控制(MIC)。
在Windows 7碰到一个奇怪的问题,DE二个盘,NTFS的权限(属性--安全页)一模一样,没有任何区别,但在E盘根目录可以创建文件或文件夹,而在D盘根目录下报错:0x80070522,如果使用应用 ...
死磕!Windows下Apache+PHP+phpmyadmin的配置
环境配置真的很烦很费时间,稍不小心就会出错,这是一个鸡肋体力劳动,耐心和忍耐少不了.这个资料已经非常详细了,其中变量和路径不是百分百吻合但是意思已经很清楚了.剩下的就是耐心的执行和琢磨了. 一. A ...
解决js输出汉字乱码问题
当我们需要使用js输出汉字时,偶然会出现输出的中文汉字乱码的情况,在网上收了很多解决方案 1.在mata中加 <meta content="text/html; charset=utf ...
<亲测>.NET Core项目在Linux上使用QRCoder时出错"Unable to load DLL 'gdiplus'"
Centos 7 解决方案如下: yum install libgdiplus-devel
jquery 中prop和 attr
prop就是给html中元素固有的属性赋值而attr是给元素定义新的属性值.

python+bs4+urllib

python+bs4+urllib的更多相关文章

随机推荐

热门专题