windows版爬取csdn

use  LWP::UserAgent;

use POSIX;

use HTML::TreeBuilder::XPath;

use Encode;

use HTML::TreeBuilder;

open DATAFH,">csdn.html" || die "open csdn file failed:$!";

my $ua = LWP::UserAgent->new;

$ua->timeout(10);

$ua->env_proxy;

$ua->agent("Mozilla/8.0");

my $response = $ua->get('http://blog.csdn.net/zhaoyangjian724');

my $base_dir="F:\\pa";

if ($response->is_success) {

 print DATAFH  $response->content

 };

use HTML::TreeBuilder::XPath;

  my $tree= HTML::TreeBuilder::XPath->new;

  $tree->parse_file( "csdn.html");

  ##     <a href="/zhaoyangjian724/article/category/1756569" onclick="_gaq.push(['_trackEvent','function', 'onclick', 'blog_articles_wenzhangfenlei']); ">Oracle dump解析

  ##获取博客分类的URL，根据a标签查找

  @Links = $tree->find_by_tag_name('a');

        foreach (@Links) {

                $href = $_->attr('href');

 ###获取博客每个类别的url

 ####@href 表示所有分类的url

                 if ($href =~/category/){print "\$href is $href\n";

                 push (@href,$href);

                    };

					};

 #@href 是所有类别url的汇总

 print "\@href is @href\n";

 #@type 是类别名称汇总,根据ul标签查找/li/a对应的值

 my @type=$tree->findvalues( '/html/body//ul[@class="panel_body"]/li/a');

 #my @type=encode("gbk", decode("utf8","@type"));

 foreach  (@type){

  my $a=encode("gbk", decode("utf8","$_")) ;

  push (@a, $a);

  };

 my  @type=@a;

 print "\@type is @type\n";

 my $length=@href;

 my @tmp=();

 ##@type 表示所有分类的名称

 for ($i=0;$i<$length;$i++){

     print "$href[$i]===$type[$i]\n";

     push (@tmp,$type[$i])};

	 #循环类别开始

	for ($i=0;$i<=@type - 1; $i++){

	print "\$type is $type\n";

                     #next  unless ($type[$i]) ;

                   if (! -d "$type[$i]"){

                    mkdir $type[$i];

                                };

                      chdir "$base_dir/$type[$i]";

                 ##进入每个分类版块url

                    my  $pageString;

                   my $response = $ua->get("http://blog.csdn.net$href[$i]");

                    ##每个版块首页url

					print "\$href[$i] is $href[$i]\n";

				    ##fh1.html每个版块首页url

                    open fh1,">fh1.html" || die "open csdn file failed:$!";

                    print fh1  $response->content;

                    close fh1;

                     my $tree= HTML::TreeBuilder::XPath->new;

                     $tree->parse_file( "fh1.html");

                   ##获取每个版块的页码数 这个方法有问题,这里是数组$_ is  150条数据 共8页

                   my  @pageString = $tree->findvalues('/html/body//div[@id="papelist"]/span');

                if ($pageString[0]){ if ($pageString[0] =~ /.*\s+.*?(\d+).*/){$pageString=$1}; };

				print "\@pageString is @pageString\n;";

				   ##获取$pageString

				   sleep (5);

                   unless ($pageString){$pageString=1};

                    print "\$pageString is $pageString\n";

                    sleep(5);

                     ##进入每页,处理url

                     for ($j=1;$j<=$pageString + 0; $j++){

					 ##每个类别对应的url

                      my $url="http://blog.csdn.net$href[$i]/$j";

                      print "\$url is $url\n";

                      my $response = $ua->get("$url");

					  ##fh2 每页url

                      open fh2,">fh2.html" || die "open csdn file failed:$!";

                       print fh2  $response->content;

                      close fh2;

                      #获取每页都多少条标题

                     my @pageTitles="";

                      my $tree= HTML::TreeBuilder::XPath->new;

                     $tree->parse_file( "fh2.html");

                     #获取标题,这里会拿到除了该类别下文章外,

                     my @pageTitles = $tree->findvalues('/html/body//span[@class="link_title"]');

					 my @a=();

					  foreach  (@pageTitles){

                     my $a=encode("gbk", decode("utf8","$_")) ;

                     push (@a, $a);

                        };

				     my @pageTitles=@a;

                      print "\$pageTitles[0] is  $pageTitles[0]\n";

					  print "\@pageTitles is @pageTitles\n";

					  sleep (10);

                     ##获取标题连接url

                       my $tree= HTML::TreeBuilder::XPath->new;

                      $tree->parse_file( "fh2.html");

					  @titleLinks="";

                      @titleLinks=$tree->find_by_tag_name('a');

                      @urlall="";

                      @urltmp="";

                      #@urlall除了包含每个类别的文章,还包含阅读排行里的文章

                      foreach (@titleLinks) {

                                               @titleHref = $_->attr('href');

                                               foreach (@titleHref) {

											   ###获取版块中每个页面的url

                                               if ($_ =~/zhaoyangjian724\/article\/details\/(\d+)$/){

                                                 unless ($_ ~~ @urlall) { print "\$_=========$_\n";push (@urlall ,encode("gbk", decode("utf8","$_")));}}

                                                     };

                                           };

										   ##第一个元素为空 需要去掉

										  shift @urlall;

                                          print "\@urlall is @urlall\n";

										  sleep (10);

                                          for ($k=0;$k<=@pageTitles - 1;$k++){

                                          print "\$urlall[$k] is $urlall[$k]\n";

                                          push (@urltmp,$urlall[$k]);

                                                                           };

                                            @urlall=@urltmp;

											shift @urlall;

                                          print "\$---urlall[0] is  $urlall[0]\n";

										  sleep (10);

					for ($m=0;$m<=@urlall - 1; $m++){

					$pageTitles[$m] =~ s/\s+//g;

					print "===========================\n";

					print "$pageTitles[$m]======$urlall[$m]\n";

				    print "===========================\n";

		         			 open fh3,">$pageTitles[$m].html" || die "open csdn file failed:$!";

						  my $response = $ua->get("http://blog.csdn.net$urlall[$m]");

                                                  print "--------------------------------\n";

                                                  print "$urlall[$m]"."\n";

                                                  print fh3  $response->content;

                                                  close fh3;

										# unlink("$pageTitles[$m].html.tmp");

                           #循环页码结束

                                                    }; 

							#循环每个分类的url结束

						#循环单个类别结束

                          }

						 chdir "$base_dir";  

				      }

windows版爬取csdn的更多相关文章

[Python学习] 简单爬取CSDN下载资源信息
这是一篇Python爬取CSDN下载资源信息的样例,主要是通过urllib2获取CSDN某个人全部资源的资源URL.资源名称.下载次数.分数等信息.写这篇文章的原因是我想获取自己的资源全部的评论信息. ...
Python爬取CSDN博客文章
0 url :http://blog.csdn.net/youyou1543724847/article/details/52818339Redis一点基础的东西目录 1.基础底层数据结构 2.win ...
Java爬虫实践--爬取CSDN网站图片为例
实现的效果,自动在工程下创建Pictures文件夹,根据网站URL爬取图片,层层获取.在Pictures下以网站的层级URL命名文件夹,用来装该层URL下的图片.同时将文件名,路径,URL插入数据库, ...
Python 2.7_爬取CSDN单页面博客文章及url(二)_xpath提取_20170118
上次用的是正则匹配文章title 和文章url,因为最近在看Scrapy框架爬虫需要了解xpath语法学习了下拿这个例子练手 1.爬取的单页面还是这个rooturl:http://blog.csd ...
Python 2.7_爬取CSDN单页面利用正则提取博客文章及url_20170114
年前有点忙,没来的及更博,最近看爬虫正则的部分巩固下 1.爬取的单页面:http://blog.csdn.net/column/details/why-bug.html 2.过程解析url获得网站 ...
信息领域热词分析系统--java爬取CSDN中文章标题即链接
package zuoye1; import java.sql.Connection;import java.sql.PreparedStatement;import java.sql.SQLExce ...
开发记录_自学Python写爬虫程序爬取csdn个人博客信息
每天刷开csdn的博客,看到一整个页面,其实对我而言,我只想看看访问量有没有上涨而已... 于是萌生了一个想法: 想写一个爬虫程序把csdn博客上边的访问量和评论数都爬下来. 打算通过网络各种搜集资料 ...
看我怎么扒掉CSDN首页的底裤（python selenium+phantomjs爬取CSDN首页内容）
这里只是学习一下动态加载页面内容的抓取,并不适用于所有的页面. 使用到的工具就是python selenium和phantomjs,另外调试的时候还用了firefox的geckodriver.exe. ...
Python 爬取CSDN博客频道
初次接触python,写的很简单,开发工具PyCharm,python 3.4很方便 python 部分模块安装时需要其他的附属模块之类的,可以先 pip install wheel 然后可以直接下载 ...

随机推荐

分分钟教你集成沉浸式侧滑关闭Activity
网上搜索侧滑关闭Activity,几乎没有系统状态栏跟随页面一起联动的,有明显的撕裂感,而这里则是状态栏跟随页面联动的,说来集成也是简单,等会你就知道了. 个人习惯,写博客前喜欢先截图 1.首先以项目 ...
Validation Rule和Binding Group
WPF学习之绑定-Validation Rule和Binding Group 在上一篇文章中我们讨论了有关WPF绑定的知识点,现在我们可以很容易的将业务数据作为源绑定到WPF控件并可以通过创建不同的D ...
jwPlayer实现支持IE8及以下版本避免出错的方法
jwplayer在支持Html5的情况下会自动使用html5的video和audio标签进行播放视频和音频.但是在IE中版本低于IE9时 <script src="jwplayer.h ...
网站集A的子网站B上没有解决方案C发布的webpart
在A的主站点,查看解决方案C在该网站集的feature,若未打开,则打开:若已经打开,可以先关闭再打开一次. 如果问题依然存在,可以查看子网站B上的feature是否打开,若未打开,则打开:若已经打开 ...
.NET设计模式（4）：建造者模式（Builder Pattern）
):建造者模式(Builder Pattern) .建造者模式的使用使得产品的内部表象可以独立的变化.使用建造者模式可以使客户端不必知道产品内部组成的细节. 2.每一个Builder都相对独立, ...
（经典）tcp粘包分析
转载自csdn:http://blog.csdn.net/zhangxinrun/article/details/6721495 这两天看csdn有一些关于socket粘包,socket缓冲区设置的问 ...
php redis 【摘自网上，只为参考】
ubuntu下安装php redis sudo apt-get install redis-server 测试redis是否安装成功:注意:要开启redis redis-cliset test hel ...
JAVA学习-基础知识
1.Java程序都是以类的形式编写的.2.存放源代码的文件叫源文件.(电脑不能直接看懂的,需要编译一下,电脑才能懂)如何编译源文件?用javac命令输入"javac 123.Java&quo ...
Linux权限体系总结
总结 1. LINUX9位权限及rwx字符的作用.对应的数字及对应的用户和用户组图解. 2. rwx对文件来说代表什么意思. 3. rwx对目录来说代表什么意思. 4. 企业生产环境目录设置权 ...
【算法】快速排序-Java版
说在前面的话平常码砖的时候,对于一个数组进行排序更多的是起泡排序,起泡排序对于一般不是很长的数组进行操作没什么问题,一旦数组过大,很明显效率低. 而快排是对起泡排序的一种改进,效率明显优高. 快排思 ...

windows版爬取csdn

windows版爬取csdn的更多相关文章

随机推荐

热门专题