<?php

class spider 

  private $content ; 
  private $contentlen ; 
  private $BestAnswer ; 
  private $CurPosition ;

function GetStart( $iStart

  { 
    return
strpos( $this->content , '>' ,
$iStart )+1 ; 
  }

function GetContent ( $url

  { 
   
$this->content =
file_get_contents($url); 
   
$this->contentlen = strlen(
$this->content ) ; 
    $start =
strpos( $this->content ,
'<title>') ; 
    $start =
$this->GetStart( $start ) ; 
    $end =
strpos( $this->content ,
'</title>' , $start )

    $title =
substr( $this->content , $start ,
$this->$end-$start ) ; 
    if ( strpos(
$title , '_百度知道' , 1 ) < 1 ) 
   

     
return false; 
   

    return ture

  }

function GetTitle() 
  { 
    $start =
strpos( $this->content ,
'<title>') ; 
    if ( $start
> 0 ) 
   

     
$start = $this->GetStart( $start )

     
$end = strpos( $this->content ,
'</title>' , $start )

     
$this->CurPosition = $end ; 
     
return substr( $this->content , $start , $end-$start
) ; 
   

    return NULL

  }

function GetQTitle() 
  { 
    $start =
strpos( $this->content , 'span
class="question-title"' , $this->CurPosition )

    if ( $start
> 0 ) 
   

     
$start = $this->GetStart( $start )

     
$end = strpos( $this->content ,
'</span>' , $start )

     
$this->CurPosition = $end ; 
     
return substr( $this->content , $start , $end-$start
) ; 
   

    return NULL

  }

function
GetClassFly() 
  { 
   
;

}

function
GetQContent() 
  { 
    
$start = strpos( $this->content , 'pre
id="question-content"' , $this->CurPosition )

    
if ( $start > 0 ) 
    

      
$start = $this->GetStart( $start )

      
$end = strpos( $this->content ,
'</pre>' , $start )

      
$this->CurPosition = $end ; 
      
return substr( $this->content , $start , $end-$start
) ; 
    

    
return NULL ; 
  }

function GetQsuply() 
  { 
    $start =
strpos( $this->content , 'id="question-suply"' ,
$this->CurPosition ) ; 
    if ( $start
> 0 ) 
   

     
$start = $this->GetStart( $start )

     
$end = strpos( $this->content ,
'</pre>' , $start )

     
$this->CurPosition = $end ; 
     
return substr( $this->content , $start , $end-$start
) ; 
   

    return NULL

  }

function GetAnswer() 
  { 
    $start =
strpos( $this->content , 'class="reply-text mb10"' ,
$this->CurPosition ) ; 
    if ( $start
> 0 ) 
   

     
$start = $this->GetStart( $start )

     
$end = strpos( $this->content ,
'</pre>' , $start )

     
$this->CurPosition = $end ; 
     
return substr( $this->content , $start , $end-$start
) ; 
   

    return NULL

  } 
}

ini_set('max_execution_time', '0'); 
$TestSpider = new spider() ; 
$Startqid = 1000001 ; 
$sndqid = 1000051 ; 
$standurl = 'http://zhidao.baidu.com/question/'

$html = '.html' ; 
$url ; 
$NoUse = 0 ;

function microtime_float() 

  list($usec, $sec) = explode(" ",
microtime()); 
  return ((float)$usec +
(float)$sec); 
}

$time_start = microtime_float(); 
$answer ; 
for ($i = $Startqid ; $i < $sndqid ; $i++


  $url = $standurl.$i.$html

  if ( $TestSpider->GetContent (
$url ) ) 
  { 
    echo
'<br>正在爬取编号为'.$i.'的网页<br>'

   
$TestSpider->GetTitle() ;
//得到网页标题,不用显示了 
    echo
'<font
color="green">问题:</font><font
color="red"><a target="_blank"
href="'.$url.'">
'.$TestSpider->GetQTitle().'</a></font><br>'
; //得到问题题目 
    echo
'<font
color="green">问题具体内容:</font>'.$TestSpider->GetQContent().'</font><br>'
; //得到问题内容,有可能不存在 
    echo
'<font
color="green">问题补充说明:</font>'.$TestSpider->GetQsuply().'</font><br>'
; //问题补充说明,有可能不存在 
    while (
($answer = $TestSpider->GetAnswer()) != NULL
)  
   

     
echo '<font
color="green">问题答案:</font>'.$answer.'</font><br>'
; //得到答案。有可能没有答案! 
   

    ob_flush()

    flush()

  } 
  else 
  { 
    echo
'<p>错误了<a
target="_blank" href="'.$url.'" style=
"color:#ff0000">'.$url.'</a></p>'

    $NoUse++

  } 
}

$time_end = microtime_float(); 
$time = $time_end - $time_start; 
$i = $i-$Startqid ; 
echo
'<p>爬取'.$i.'个网页用时'.$time.'秒</p>其中跳过'.$NoUse.'个无效网页!'
;

?>

百度知道的php爬虫的更多相关文章

  1. 我们必须要知道的RESTful服务最佳实践

    看过很多RESTful相关的文章总结,参齐不齐,结合工作中的使用,非常有必要归纳一下关于RESTful架构方式了,RESTful只是一种架构方式的约束,给出一种约定的标准,完全严格遵守RESTful标 ...

  2. 隔壁小孩都要知道的Drupal配置

    i春秋作家:Arizona 原文来自:隔壁小孩都要知道的Drupal配置 隔壁小孩都要知道的Drupal配置 Drupal是一个开源的PHP内容管理系统,具有相当复杂的架构.它还具有强大的安全模型.感 ...

  3. 程序员必须要知道的Hadoop的一些事实

    程序员必须要知道的Hadoop的一些事实.现如今,Apache Hadoop已经无人不知无人不晓.当年雅虎搜索工程师Doug Cutting开发出这个用以创建分布式计算机环境的开源软...... 1: ...

  4. 【转载】在IT界取得成功应该知道的10件事

     在IT界取得成功应该知道的10件事 2011-08-11 13:31:30 分类: 项目管理 导读:前面大多数文章都是Jack Wallen写的,这是他的新作,看来要成为NB程序员还要不停的自我总结 ...

  5. 理工科应该的知道的C/C++数学计算库(转)

    理工科应该的知道的C/C++数学计算库(转) 作为理工科学生,想必有限元分析.数值计算.三维建模.信号处理.性能分析.仿真分析...这些或多或少与我们常用的软件息息相关,假如有一天你只需要这些大型软件 ...

  6. 你应该知道的10个奇特的 HTML5 单页网站

    网页设计师努力寻找新的方式来展现内容.其中一个大的趋势是单页网站,现在被世界上的一些大的品牌广泛采用,使用它们来为用户提供一个快速,干净和简单的而且​​美丽的网站. 下面是10个令人惊叹的单页 H​​ ...

  7. Git / 程序员需要知道的12个Git高级命令

    众所周知,Git目前已经是分布式版本控制领域的翘楚,围绕着Git形成了完整的生态圈.学习Git,首先当然是学习Git的基本工作流.相比于SVN等传统版本控制系统来说,Git是专为分布式版本控制而生的强 ...

  8. 你应该知道的RPC原理

    你应该知道的RPC原理 在学校期间大家都写过不少程序,比如写个hello world服务类,然后本地调用下,如下所示.这些程序的特点是服务消费方和服务提供方是本地调用关系. 而一旦踏入公司尤其是大型互 ...

  9. 希望早几年知道的5个Unix命令

    原文: http://spin.atomicobject.com/2013/09/09/5-unix-commands/ 希望早几年知道的5个Unix命令 使用*nix系统已经有一段时间了.但是还是有 ...

随机推荐

  1. 2.6.2 Notification的功能与用法

    <LinearLayout xmlns:android="http://schemas.android.com/apk/res/android" android:layout ...

  2. saxReader的列子

    import org.slf4j.Logger; import org.slf4j.LoggerFactory; import org.xml.sax.Attributes; import org.x ...

  3. efront二次开发记要

    efront系统是一套开源的在线学习系统,是用PHP编写的,内含“考试”功能.该系统的开源的是社区版,虽然看上去功能强大,但使用起来却很不符合国情.为了让公司使用,先做了一次最简化的二次开发,由于是最 ...

  4. mybatis源码分析(3)——SqlSessionManager类

    从上图可能看出,在 mybatis中,SqlSession的实现类有两个,其中SqlSessionManager类不但实现了SqlSession接口,同时也实现了SqlSessionFactory接口 ...

  5. 使用 Puppet 在 Windows Azure 中配备 Linux 和 Windows 环境

     发布于 2013-12-11 作者 Ross Gardler 微软开放技术有限公司 (MS Open Tech) 很高兴地宣布发行新的 Windows Azure Puppet 模块.通过这个模 ...

  6. HDU-2562 奇偶位互换

    http://acm.hdu.edu.cn/showproblem.php?pid=2562 奇偶位互换 Time Limit: 3000/1000 MS (Java/Others)    Memor ...

  7. 文本编辑器 CKEditor 用法

    最新文本编辑器,FCK升级版:CKEditor.NET CKEditor.NET.dll 版本:3.6.4.0 官方网址:http://ckeditor.com/   效果图:     配置web.c ...

  8. pyhton 查找一个数的所有因子 以及 判断一个数是否是质数 两个小脚本

    最近看到一个网站, 欧拉计划.挺好玩,都是一些算法题.这是本站:http://projecteuler.net/problems 这个是中文站:http://pe.spiritzhang.com/ 下 ...

  9. 开发神器之--Sublime Text

    原来还有这么个神器啊,忍痛丢掉了notepad++,投入她的怀抱!! 使用和介绍就不写了,大牛们已经整理了. 官网:http://www.sublimetext.com/ 入门及心得:http://w ...

  10. FZU 2213 Common Tangents 第六届福建省赛

    题目链接:http://acm.fzu.edu.cn/problem.php?pid=2213 题目大意:两个圆,并且知道两个圆的圆心和半径,求这两个圆共同的切线有多少条,若有无数条,输出-1,其他条 ...