requests bs4 爬取资讯图片

#!/usr/bin/env python

# Version = 3.5.2

# __auth__ = '无名小妖'

import requests

from bs4 import BeautifulSoup

import uuid

response = requests.get(

    url='http://www.autohome.com.cn/news/'

)

response.encoding = response.apparent_encoding  # 使用原页面的编码进行解析

# response.status_code 状态码

# 将页面字符串转化成bs对象，features 是转化方式，此处用的html.parser，而生产中用的是lxml，性能较好

soup = BeautifulSoup(response.text, features='html.parser')

# 获取id为'auto-channel-lazyload-article' 的标签

target = soup.find(id='auto-channel-lazyload-article')

# 在此标签下找到所有的li标签

li = target.find_all('li')

# 获取每个li标签下的a标签

for i in li:

    a = i.find('a')

    if a:

        # print(a.attrs.get('href'))

        txt = a.find('h3').text

        # 获取图片的地址

        img_url = a.find('img').attrs.get('src')

        if not img_url.startswith("http:"):

            img_url = "http:" + img_url

        # 下载图片

        img_response = requests.get(url=img_url)

        h = img_url.split('.')

        jpg_name = '{}.{}'.format(uuid.uuid4(), h[-1])

        with open(jpg_name, 'wb') as f:

            f.write(img_response.content)

requests bs4 爬取资讯图片的更多相关文章

requests+bs4爬取豌豆荚排行榜及下载排行榜app
爬取排行榜应用信息爬取豌豆荚排行榜app信息 - app_detail_url - 应用详情页url - app_image_url - 应用图片url - app_name - 应用名称 - ap ...
requests + bs4 爬取豌豆荚所有应用的信息
1.分析豌豆荚的接口的规律 - 获取所有app的接口url 2.往每一个接口发送请求,获取json数据解析并提取想要的数据 app_data: 1.图标 app_img_url 2.名字 app_n ...
python requests库爬取网页小实例：爬取网页图片
爬取网页图片: #网络图片爬取 import requests import os root="C://Users//Lenovo//Desktop//" #以原文件名作为保存的文 ...
python网络爬虫之解析网页的BeautifulSoup(爬取电影图片)[三]
目录前言一.BeautifulSoup的基本语法二.爬取网页图片扩展学习后记前言本章同样是解析一个网页的结构信息在上章内容中(python网络爬虫之解析网页的正则表达式(爬取4k动漫图 ...
使用request+bs4爬取所有股票信息
爬取前戏我们要知道利用selenium是非常无敌的,自我认为什么反爬不反爬都不在话下,但是今天我们为什么要用request+bs4爬取所有股票信息呢?因为他比较原始,因此今天的数据,爬取起来也是比较 ...
百度图片爬虫-python版-如何爬取百度图片?
上一篇我写了如何爬取百度网盘的爬虫,在这里还是重温一下,把链接附上: http://www.cnblogs.com/huangxie/p/5473273.html 这一篇我想写写如何爬取百度图片的爬虫 ...
[实战演练]python3使用requests模块爬取页面内容
本文摘要: 1.安装pip 2.安装requests模块 3.安装beautifulsoup4 4.requests模块浅析 + 发送请求 + 传递URL参数 + 响应内容 + 获取网页编码 + 获取 ...
python3爬取女神图片，破解盗链问题
title: python3爬取女神图片,破解盗链问题 date: 2018-04-22 08:26:00 tags: [python3,美女,图片抓取,爬虫, 盗链] comments: true ...
爬虫系列2：Requests+Xpath 爬取租房网站信息
Requests+Xpath 爬取租房网站信息 [抓取]:参考前文爬虫系列1:https://www.cnblogs.com/yizhiamumu/p/9451093.html [分页]:参考前文 ...

随机推荐

test20180922 倾斜的线
题意问题描述给定两个正整数P和Q.在二维平面上有n个整点.现在请你找到一对点使得经过它们的直线的斜率在数值上最接近P/Q(即这条直线的斜率与P/Q的差最小),请输出经过它们直线的斜率p/q.如果有 ...
ES6必知必会（一）—— 变量声明和结构赋值
本文章属于个人对es6一些比较常用的语法的总结归纳,其主要参考阮一峰大神的<a href="http://es6.ruanyifeng.com//">ECMAScrip ...
(精)字符串，map -> json对象->map(初学者必读)
import java.util.LinkedList; import java.util.*; import java.util.ListIterator; import net.sf.json.J ...
wcat 进行iis 压力测试
如何建立起WCAT Microsoft的Web容量分析工具(WCAT) 是测试你的客户-服务器网络配置的必备工具.这个工具在你的网络上对多种工作量的场景进行仿真,允许你确定你的网络和服务器的最佳配置. ...
JS判断IP的正则表达式
<html> <head> <title>最简洁的IP判断正则表达式</title> <meta http-equiv="Content ...
ML(4): 决策树分类
决策树(Decision Tree)是用于分类和预测的主要技术,它着眼于从一组无规则的事例推理出决策树表示形式的分类规则,采用自顶向下的递归方式,在决策树的内部节点进行属性值的比较,并根据不同属性判断 ...
如何为javascript代码编写注释以支持智能感知
在使用Visual Studio做开发的时候,智能感知是非常方便的.从VS2008开始,提供了对javascript的智能感知支持.例如上述代码中,我们先用document对象的getElement ...
C# 教程
http://www.runoob.com/csharp/csharp-tutorial.html
java newInstance() 的参数版本与无参数版本详解
newInstance() 的参数版本与无参数版本详解博客分类: Core Java 通过反射创建新的类示例,有两种方式: Class.newInstance() Constructor.new ...
BASIC-10_蓝桥杯_十进制转十六进制
示例代码: #include <stdio.h>#define N 16 void dg(int a){ int y = a%N; int next = (a-y)/N; if (next ...

requests bs4 爬取 资讯 图片

requests bs4 爬取 资讯 图片的更多相关文章

随机推荐

热门专题

requests bs4 爬取资讯图片

requests bs4 爬取资讯图片的更多相关文章