转载:http://www.169it.com/blog_article/601549531.html

本节主要内容:
一个关键词替换的类

主要可以用于关键词过滤,或关键词查找替换方面。

实现过程分析:
关键词替换,其实就是一个str_replace()的过程,如果是单纯的str_replace面对10W的关键词,1W字的文章也只需要2秒左右。

问题所在:
关键词替换了不只一次,比如a需要替换成<a>a</a>,但结果可能是<a><a>a</a></a>等这样。

为此,需要一个方法保护好已经替换了的标签,那么在处理文章之前,就先把标签替换掉比如[_tnum_]在文章处理好了以后再把它还原。

另外一个问题,如果关键字或文章中有[_tnum_]本身怎么办,那么就需要排除这种这里就不能使用str_replace了而需要用到preg_replace用正则来排除。

第三个问题,如果有两个关键字a和ab怎么办,希望先把长的匹配掉,短后匹配,这样就需要在匹配前先排序。

最后一个问题,当str_replace改成了preg_replace以后,变慢了同样一段话10W次匹配要5秒钟,字符串处理的函数中strpos要快一些,那么先用strpos找出关键词即可,10W次查询还不到1秒。就算是100万才道8秒多。

一个关键词匹配替换的类,代码:

代码示例:
 

<?php
  /* 
   * 关键词匹配类
   * @author ylx <ylx123456@gmail.com>
   * @packet mipang
   * 使用实例
   * $str = "绿壳蛋鸡撒范德萨下一年,下一年1的洒落开房间卢卡斯地方军";
   * $key = new KeyReplace($str,array("xxxx"=>"sadf","下一年1"=>'http://baidu.com',"下一年"=>'google.com'));
   * echo $key->getResultText();
   * echo $key->getRuntime();
   */
class KeyReplace
{
  private $keys = array();
  private $text = "";
  private $runtime = 0;
  private $url = true;
  private $stopkeys = array();
  private $all = false;
  /**
   * @access public    
   * @param string $text 指定被处理的文章
   * @param array $keys 指定字典词组array(key=>url,...) url可以是数组,如果是数组将随机替换其中的一个
   * @param array $stopkeys 指定停止词array(key,...) 这里面的词将不会被处理
   * @param boolean $url true 表示替换成链接否则只替换
   * @param boolean $all true 表示替换所有找到的词,否则只替换第一次
   */
  public function __construct($text='',$keys=array(),$url=true,$stopkeys=array(),$all=false) {
    $this->keys = $keys;
    $this->text = $text;
    $this->url = $url;
    $this->stopkeys = $stopkeys;
    $this->all = $all;
  }

/**
   * 获取处理好的文章
   * @access public    
   * @return string text
   */
  public function getResultText() {
    $start = microtime(true);
    $keys = $this->hits_keys();

$keys_tmp = array_keys()($keys);

function cmp($a, $b){
      if (mb_strlen($a) == mb_strlen($b)) {
 return 0;
      }
      return (mb_strlen($a) < mb_strlen($b)) ? 1 : -1;
    }

usort($keys_tmp,"cmp");

foreach($keys_tmp as $key){

if(is_array($keys[$key])){
 $url = $keys[$key][rand(0,count($keys[$key])-1)];
      }else
 $url = $keys[$key];

$this->text = $this->r_s($this->text,$key,$url);

}
    $this->runtime = microtime(true)-$start;

return $this->text;
  }
  /**
   * 获取处理时间
   * @access public    
   * @return float 
   */
  public function getRuntime() {

return $this->runtime;

}

/**
   * 设置关键词
   * @access public    
   * @param array $keys array(key=>url,...)
   */
  public function setKeys($keys) {

$this->keys = $keys;

}
  /**
   * 设置停止词
   * @access public    
   * @param array $keys array(key,...)
   */
  public function setStopKeys($keys) {

$this->stopkeys = $keys;

}
  /**
   * 设置文章
   * @access public    
   * @param string $text 
   */
  public function setText($text) {

$this->text = $text;

}

/**
   * 用来找到字符串里面命中的关键词
   * @access public
   * @return array $keys 返回匹配到的词array(key=>url,...)
   */
  public function hits_keys(){
    $ar = $this->keys;
    $ar = $ar?$ar:array();
    $result=array();
    $str = $this->text;
    foreach($ar as $k=>$url){
      $k = trim($k);
      if(!$k)
 continue;
      if(strpos($str,$k)!==false && !in_array($k,$this->stopkeys)){
 $result[$k] = $url;
      }
    }
    return $result?$result:array();
  }

/**
   * 用来找到字符串里面命中的停止词
   * @access public
   * @return array $keys 返回匹配到的词array(key,...)
   */
  public function hits_stop_keys(){
    $ar = $this->stopkeys;
    $ar = $ar?$ar:array();
    $result=array();
    $str = $this->text;
    foreach($ar as $k){
      $k = trim($k);
      if(!$k)
 continue;
      if(strpos($str,$k)!==false && in_array($k,$this->stopkeys)){
 $result[] = $k;
      }
    }
    return $result?$result:array();
  }

/**
   * 处理替换过程 
   * @access private
   * @param string $text 被替换者
   * @param string $key 关键词
   * @param string $url 链接
   * @return string $text 处理好的文章
   */
  private function r_s($text,$key,$url){

$tmp = $text;

$stop_keys = $this->hits_stop_keys();

$stopkeys = $tags = $a = array();
    if(preg_match_all("#<a[^>]+>[^<]*</a[^>]*>#su",$tmp,$m)){
      $a=$m[0];

foreach($m[0] as $k=>$z){
 $z = preg_replace("#\##s","\#",$z);

$tmp = preg_replace('#'.$z.'#s',"[_a".$k."_]",$tmp,1);
      }

};

if(preg_match_all("#<[^>]+>#s",$tmp,$m)){
      $tags = $m[0];
      foreach($m[0] as $k=>$z){
 $z = preg_replace("#\##s","\#",$z);
 $tmp = preg_replace('#'.$z.'#s',"[_tag".$k."_]",$tmp,1);
      }
    }
    if(!empty($stop_keys)){
      if(preg_match_all("#".implode("|",$stop_keys)."#s",$tmp,$m)){
 $stopkeys = $m[0];
 foreach($m[0] as $k=>$z){
   $z = preg_replace("#\##s","\#",$z);
   $tmp = preg_replace('#'.$z.'#s',"[_s".$k."_]",$tmp,1);
 }
      }
    }
    $key1 = preg_replace("#([\#\(\)\[\]\*])#s","\\\\$1",$key);

if($this->url)
      $tmp = preg_replace("#(?!\[_s|\[_a|\[_|\[_t|\[_ta|\[_tag)".$key1."(?!ag\d+_\]|g\d+_\]|\d+_\]|s\d+_\]|_\])#us",'<a href="'.$url.'">'.$key.'</a>',$tmp,$this->all?-1:1);
    else
      $tmp = preg_replace("#(?!\[_s|\[_a|\[_|\[_t|\[_ta|\[_tag)".$key1."(?!ag\d+_\]|g\d+_\]|\d+_\]|s\d+_\]|_\])#us",$url,$tmp,$this->all?-1:1);

if(!empty($a)){

foreach($a as $n=>$at){

$tmp = str_replace("[_a".$n."_]",$at,$tmp);

}

}    
    if(!empty($tags)){

foreach($tags as $n=>$at){

$tmp = str_replace("[_tag".$n."_]",$at,$tmp);

}

}    
    if(!empty($stopkeys)){

foreach($stopkeys as $n=>$at){

$tmp = str_replace("[_s".$n."_]",$at,$tmp);

}

}    
    return $tmp;
  }
}

 

php关键词替换的类(避免重复替换,保留与还原原始链接)的更多相关文章

  1. Java_类的热替换

    转自:http://www.ibm.com/developerworks/cn/java/j-lo-hotswapcls/#ibm-pcon Java ClassLoader 技术剖析 在本文中,我们 ...

  2. [改善Java代码]不要只替换一个类

    建议20: 不要只替换一个类 我们经常在系统中定义一个常量接口(或常量类),以囊括系统中所涉及的常量,从而简化代码,方便开发,在很多的开源项目中已采用了类似的方法,比如在Struts2中,org.ap ...

  3. Java 类的热替换---转载

    构建基于 Java 的在线升级系统 Java ClassLoader 技术剖析 在本文中,我们将不对 Java ClassLoader 的细节进行过于详细的讲解,而是关注于和构建在线升级系统相关的基础 ...

  4. Java 类的热替换 —— 概念、设计与实现

    详见: http://blog.yemou.net/article/query/info/tytfjhfascvhzxcytp71   Java 类的热替换 -- 概念.设计与实现 构建基于 Java ...

  5. 替换NSString类中的stringWithFormat:方法

    替换NSString类中的stringWithFormat:方法 先给出源码: YXUseful.h // // YXUseful.h // NSString // // Copyright (c) ...

  6. Java占位符替换工具类

    import java.util.HashMap; import java.util.Map; import org.slf4j.Logger; import org.slf4j.LoggerFact ...

  7. sed 's/AA/BB/' file # 将文件中的AA替换成BB,只替换一行中第一次出现的AA,替换后的结果输出到屏幕 sed 's/AA/BB/g' file # 将文件中的所有AA都替换成BB,替换后的结果输出到屏幕

    生信人的自我修养:Linux命令速查手册 简佐义 ​ 四川大学 生物信息学硕士 科学求真 赢 10 万奖金 · 院士面对面 209 人赞同了该文章 许多人做生物信息学,要么不重视Linux,要么不知道 ...

  8. java.lang.String中的replace方法到底替换了一个还是全部替换了。

    你没有看错我说的就是那个最常用的java.lang.String,String可以说在Java中使用量最广泛的类了. 但是我却发现我弄错了他的一个API(也可以说是两个API),这个API是关于字符串 ...

  9. 使用Nginx反向代理和内容替换模块实现网页内容动态替换功能

    2016年11月21日 10:30:00 xian_02 阅读数:10943   Nginx是一款轻量级高性能服务器软件,虽然轻量,但功能非常强大,可用于提供WEB服务.反向代理.负载均衡.缓存服务. ...

随机推荐

  1. 关于SubSonic3.0未处理InvalidOperationException异常(关键字TOP附近有语法错误)的处理

    早上在测试程序时,使用了Top这个属性,没想到马上抛出了个“未处理InvalidOperationException异常(关键字'TOP'附近有语法错误)”这个错误提示,见下图: 然后Debug一下, ...

  2. 改写yii2的listview功能

    在vendor\yiisoft\yii2\widgets路径下新增文件ListViewtest,将下列代码粘贴并保存 <?php namespace yii\widgets; use Yii;u ...

  3. PHP环境配置-从Apache官网下载windows版apache服务器

    由于个人有强迫倾向,下载软件都喜欢从官网下载,摸索了好久终于摸清楚怎么从Apache官网下载windows安装版的Apache服务器了,现在分享给大家. 进入apache服务器官网http://htt ...

  4. iOS 保持界面流畅的技巧 (转载)

    这篇文章会非常详细的分析 iOS 界面构建中的各种性能问题以及对应的解决思路,同时给出一个开源的微博列表实现,通过实际的代码展示如何构建流畅的交互. Index 演示项目 屏幕显示图像的原理 卡顿产生 ...

  5. Global eval. What are the options?

    David Flanagan最近写了一个关于全局eval的简单表达式,可以用一行式子表示: var geval = this.execScript || eval; 尽管看起来很简短,但是跨浏览器的兼 ...

  6. 利用Eclipse使用Java OpenCV(Using OpenCV Java with Eclipse)

    最近在上计算机视觉这门课程用到了OpenCV,于是找到了"Using OpenCV Java with Eclipse"这篇博文,是英文的,我将它翻译如下与大家分享 正文: 从2. ...

  7. spring笔记--依赖注入之针对不同类型变量的几种注入方式

    控制反转和依赖注入讲的都是一个概念,只不过是站在了不同的角度,所谓的依赖注入: 是指在运行期,由外部容器动态地将依赖对象注入到组件中.当spring容器启动后,spring容器初始化,创建并管理bea ...

  8. JavaMail发送邮件的笔记及Demo

    最近碰到一个需求,就是注册用户时候需要向用户发送激活邮箱,于是照着网上搜来的demo自己试着运行了一下,发件时我用的是网易163邮箱,收件时用QQ邮箱,运行后报了一个错误: 网络上搜索解决方式,多次尝 ...

  9. 第一篇blog

    之前不用blog,但是在杭电oj,poj上刷题,总会自己总结题型和使用什么算法,算法模板,自己在笔记本上写,耗时费力,感觉用键盘敲得总结,分享,大家相互学习提高.有时遇到不会做的,或者总是在oj上跑的 ...

  10. 详解Javascript的继承实现

    我最早掌握的在js中实现继承的方法是在w3school学到的混合原型链和对象冒充的方法,在工作中,只要用到继承的时候,我都是用这个方法实现.它的实现简单,思路清晰:用对象冒充继承父类构造函数的属性,用 ...