[Python]爬取CSDN论坛标题 2020.2.8

首先新建一个Lei.txt

内容为：

CloudComputing
ParentBlockchainTechnology
Enterprise
DotNET
Java
WebDevelop
VC
VB
Delphi
BCB
Cpp
OtherLanguage
MSSQL
PowerBuilder
Oracle
Linux
Windows
Embedded
GameDevelop
Network_communication
Other
Network_communication
OtherTechnicalForum
AI

爬虫代码如下：

 import requests

 from bs4 import BeautifulSoup

 import io

 import re

 url="https://bbs.csdn.net/forums/Mobile?page="

 def Content(url):

     try:

         kv = {'user-agent': 'Mozilla/5.0'}

         r = requests.get(url, headers=kv)

         r.encoding = r.apparent_encoding

         demo = r.text

         soup = BeautifulSoup(demo, "html.parser")

         text=""

         for a in soup.find_all("a",class_="forums_title"):

             text+=str(a.string).replace("【CSDN 20周年】8场大牛直播+周年T恤免费领", "").replace("小白学习笔记干货，记得点赞哦！", "").replace("有奖征集话题： 区块链大火，对于区块链开发零基础的我来说，要怎么入门呢？", "")

             text+="\n"

         print(text.lstrip())

         write(text.lstrip())

         #print(soup.prettify())

     except:

         print("没有数据了！")

 #写入内容

 def write(contents):

     f=open('E://luntan.txt','a+',encoding='utf-8')

     f.write(contents)

     print('写入成功！')

     f.close()

 #循环写入

 def write_all():

     try:

         f=open('E://Lei.txt','r+',encoding='utf-8')

         for line in f:

             line=line.rstrip("\n")

             for i in range(1,100):

                 url="https://bbs.csdn.net/forums/"+line+"?page="+str(i)

                 Content(url)

     except:

         print("超出页数！")

 if __name__=="__main__":

     write_all()

[Python]爬取CSDN论坛标题 2020.2.8的更多相关文章

Python爬取CSDN博客文章
0 url :http://blog.csdn.net/youyou1543724847/article/details/52818339Redis一点基础的东西目录 1.基础底层数据结构 2.win ...
【Python爬虫案例学习】Python爬取天涯论坛评论
用到的包有requests - BeautSoup 我爬的是天涯论坛的财经论坛:'http://bbs.tianya.cn/list.jsp?item=develop' 它里面的其中的一个帖子的URL ...
Python 爬取CSDN博客频道
初次接触python,写的很简单,开发工具PyCharm,python 3.4很方便 python 部分模块安装时需要其他的附属模块之类的,可以先 pip install wheel 然后可以直接下载 ...
Python 爬取盗墓笔记的标题,章节,章节名称
# coding:utf-8import requestsimport jsonfrom bs4 import BeautifulSoup user_agent = 'Mozilla/5.0 (Win ...
[Python学习] 简单爬取CSDN下载资源信息
这是一篇Python爬取CSDN下载资源信息的样例,主要是通过urllib2获取CSDN某个人全部资源的资源URL.资源名称.下载次数.分数等信息.写这篇文章的原因是我想获取自己的资源全部的评论信息. ...
【Python】爬取理想论坛单帖爬虫
代码: # 单帖爬虫,用于爬取理想论坛帖子得到发帖人,发帖时间和回帖时间,url例子见main函数 from bs4 import BeautifulSoup import requests impo ...
python爬取博客圆首页文章链接+标题
新人一枚,初来乍到,请多关照来到博客园,不知道写点啥,那就去瞄一瞄大家都在干什么好了. 使用python 爬取博客园首页文章链接和标题. 首先当然是环境了,爬虫在window10系统下,python ...
Python 爬取热词并进行分类数据分析-[解释修复+热词引用]
日期:2020.02.02 博客期:141 星期日 [本博客的代码如若要使用,请在下方评论区留言,之后再用(就是跟我说一声)] 所有相关跳转: a.[简单准备] b.[云图制作+数据导入] c.[拓扑 ...
Python 爬取途虎养车全系车型轮胎保养数据
Python 爬取途虎养车全系车型轮胎保养数据 2021.7.27 更新增加标题.发布时间参数 demo文末自行下载,需要完整数据私聊我 2021.2.19 更新增加大保养数据 2020. ...

随机推荐

nrm安装与配置(nrm管理npm源)
1.nrm nrm(npm registry manager )是npm的镜像源管理工具,有时候国外资源太慢,使用这个就可以快速地在 npm 源间切换 2.安装nrm 在命令行执行命令,npm ins ...
C#设计模式学习笔记：(18)状态模式
本笔记摘抄自:https://www.cnblogs.com/PatrickLiu/p/8032683.html,记录一下学习过程以备后续查用. 一.引言今天我们要讲行为型设计模式的第六个模式--状 ...
.NET Core MVC 静态文件应用
一.静态文件应用方面 ASP.NET Core 静态文件应用,主要分为两方面:网站访问和静态文件整合二.案例 1.访问静态文件我们都知道,在 ASP.NET 项目中,我们的静态文件一般要放在 ww ...
pikachu-SQL注入漏洞
一.SQL Inject 漏洞原理概述 1.1 什么是数据库注入漏洞数据库注入漏洞,主要是开发人员在构建代码的时候,没有对用户输入的值的边界进行安全的考虑,导致攻击者可以通过合法的输入点提交 ...
使用uftrace来debug应用程序
谈uftrace之前,先谈谈ftrace. ftrace是一个用于调试linux内核的工具,它可以用于调试内核的调用栈,performance等. ftrace的核心是在编译内核代码时,通过制定-pg ...
VMware使用与安装
VMware安装下载完Vmware -> 双击打开安装包 -> 选择下一步(如下图界面) 选择接受协议,点击下一步选择经典进行安装.这个是默认安装,会把默认插件安装到相对应的路径选择 ...
第一天，初学Markdown
Markdown学习二级标题三级标题字体 hello,world hello,world hello,world hello,world 引用飞冲分割线图片超链接跳转到安徽科技学院列 ...
C# WPF可拖拽的TabControl
微信公众号:Dotnet9,网站:Dotnet9,问题或建议:请网站留言, 如果对您有所帮助:欢迎赞赏. C# WPF可拖拽的TabControl 阅读导航本文背景代码实现本文参考源码 1. ...
win10下载
Win10 简体中文正式版微软MSDN官方ISO镜像下载(2020年1月21日更新) 官方地址:https://www.microsoft.com/zh-cn/software-download/w ...
CF #623 div.2
序话说,总有人认为我是黑别人电脑的(雾??其实,我不黑电脑,我黑手机. T1 此题巨水,比较四个面积就就好了.. /* make by ltao */ #include <iostream&g ...

[Python]爬取CSDN论坛 标题 2020.2.8

[Python]爬取CSDN论坛 标题 2020.2.8的更多相关文章

随机推荐

热门专题

[Python]爬取CSDN论坛标题 2020.2.8

[Python]爬取CSDN论坛标题 2020.2.8的更多相关文章