【iOS】正則表達式抓取网页数据制作小词典
版权声明:本文为博主原创文章,未经博主同意不得转载。
https://blog.csdn.net/xn4545945/article/details/37684127
应用程序不一定要自己去提供数据。有现成的数据学会去用才好。
网络非常大,各种搜索引擎每天到处爬。本文通过正則表達式抓取站点的数据来做一个小词典。
一、正則表達式的使用
1. 确定匹配方案,即pattern
2. 用pattern实例化NSRegularExpression
3. 用匹配方法開始匹配。
匹配一次:能够使用firstMatch方法
匹配多次:能够用matchs方法
正則表達式对比表:(在网上找到了一个非常不错的表,正則表達式各个语言通用)
http://www.jb51.net/shouce/jquery1.82/regexp.html
以下是測试代码。能匹配出:xn4545945
//測试正則表達式用的
- (void)findAnswerInHTMLTest {
NSString *srcStr = @"http://blog.csdn.net/xn4545945";
NSString *pattern = @"xn[^\\s]*"; //匹配以xn开头的不论什么非空白字符
//实例化正則表達式,须要指定两个选项
//NSRegularExpressionCaseInsensitive 忽略大写和小写
//NSRegularExpressionDotMatchesLineSeparators 让.能够匹配换行
NSRegularExpression *regex = [[NSRegularExpression alloc] initWithPattern:pattern options:NSRegularExpressionCaseInsensitive | NSRegularExpressionDotMatchesLineSeparators error:nil];
//匹配出结果集
NSTextCheckingResult *checkResult = [regex firstMatchInString:srcStr options:NSMatchingReportCompletion range:NSMakeRange(0, srcStr.length)];
// 取出找到的内容.
NSString *result = [srcStr substringWithRange:[checkResult rangeAtIndex:0]];
NSLog(@"数据为----->%@", result);
}
二、抓取网页数据,并制作小词典
用海词作为查询词典抓取数据。
直接在网址后面拼接查询词就可以查询,如查询“hello”,即http://dict.cn/hello
查看网页源码例如以下图: 即抓取出 (打招呼)喂;你好 就可以。
tips:
表示尽量少的匹配.
取代,表示忽略.
@implementation XNSpider
- (void)loadHTMLWithWord:(NSString *)word {
//1.发送HTML请求, 得到返回的网页.(转换为字符串)
NSString *urlString = [NSString stringWithFormat:@"%@%@", kBaseURL, word]; //拼接请求网址
urlString = [urlString stringByAddingPercentEscapesUsingEncoding:NSUTF8StringEncoding]; //中文转义
NSURL *url = [NSURL URLWithString:urlString]; //得到URL
NSURLRequest *request = [NSURLRequest requestWithURL:url cachePolicy:NSURLRequestUseProtocolCachePolicy timeoutInterval:5.0f];
[NSURLConnection sendAsynchronousRequest:request queue:[NSOperationQueue mainQueue] completionHandler: ^(NSURLResponse *response, NSData *data, NSError *connectionError) {
//得到的data数据转换为字符串
NSString *html = [[NSString alloc] initWithData:data encoding:NSUTF8StringEncoding];
// NSLog(@"%@", html);
//2.从返回的字符串中匹配出(正則表達式过滤)想要的. (另写一个方法findAnswerInHTML)
//然后通过代理传递结果给主线程,用于更新UI
NSString *result = [self findAnswerInHTML:html];
NSLog(@"%@", result);
if ([self.delegate respondsToSelector:@selector(finishSpider:)]) {
[self.delegate finishSpider:result]; //将完毕后的结果通过代理传到UI线程中去.
}
}];
}
/**
* 正則表達式匹配字符串的核心方法
*
* @param html 输入的整个网页字符串
*
* @return 返回匹配的结果
*/
- (NSString *)findAnswerInHTML:(NSString *)html {
//将须要取出的用(.*?
)取代. 大空格换行等用.*?取代,表示忽略.
NSString *pattern = @"<ul class=\"dict-basic-ul\">.*?<li><span>(.*?)</span><strong>(.*?)</strong></li>";
//实例化正則表達式,须要指定两个选项
//NSRegularExpressionCaseInsensitive 忽略大写和小写
//NSRegularExpressionDotMatchesLineSeparators 让.能够匹配换行
NSRegularExpression *regex = [[NSRegularExpression alloc] initWithPattern:pattern options:NSRegularExpressionCaseInsensitive | NSRegularExpressionDotMatchesLineSeparators error:nil];
//匹配出结果集
NSTextCheckingResult *checkResult = [regex firstMatchInString:html options:NSMatchingReportCompletion range:NSMakeRange(0, html.length)];
// 取出找到的内容. 数字分别相应第几个带括号(.*?
), 取0时输出匹配到的整句.
NSString *result = [html substringWithRange:[checkResult rangeAtIndex:2]];
NSLog(@"数据为----->%@", result);
return result;
}
匹配结果最后使用代理传到主线程中去更新UI。
转载请注明出处:http://blog.csdn.net/xn4545945
【iOS】正則表達式抓取网页数据制作小词典的更多相关文章
- iOS正則表達式(一)
什么是正則表達式? 正則表達式是对字符串操作的一种逻辑公式. 作用? 在iOS开发中我们通常使用正則表達式来匹配给定的字符串是否符合我们的业务逻辑,比方说用户注冊帐号仅仅能是手机号或者邮箱等.我们还能 ...
- ios 正則表達式替换
1. 不可变字符串 (content 是不可变) NSRegularExpression *regularExpression = [NSRegularExpression regularExpr ...
- iOS_正則表達式
iOS 正則表達式 正則表達式,又称正规表示法.常规表示法(英语:Regular Expression,在代码中常简写为regex.regexp或RE).计算机科学的一个概念. 正則表達式使用单个字符 ...
- python 学习笔记 10 -- 正則表達式
零.引言 在<Dive into Python>(深入python)中,第七章介绍正則表達式,开篇非常好的引出了正則表達式,以下借用一下:我们都知道python中字符串也有比較简单的方法, ...
- Python学习笔记8:标准库之正則表達式
Python拥有强大的标准库.从如今起,開始学习标准库中提供的一些经常使用功能. 首先看正則表達式(regular expression),它的主要功能是从字符串(string)中通过特定的模式(pa ...
- Python——正則表達式(2)
本文译自官方文档:Regular Expression HOWTO 參考文章:Python--正則表達式(1) 全文下载 :Python正則表達式基础 ======================== ...
- PHP第九课 正則表達式在PHP中的使用
今天内容 1.正則表達式 2.数学函数 3.日期函数 4.错误处理 正則表達式: 1.模式修正符 2.五个经常使用函数 另外一个正則表達式的站点:http://www.jb51.net/tools/z ...
- 网页抓取信息(php正則表達式、php操作excel)
1.问题描写叙述 实现对固定网页上自己须要的信息抓取,以表格形式存储. 我是拿wustoj上的一个排行榜来练习的,地址:wustoj 2.思路 网页自己就简单学习了一下php,刚好用它来做点事情吧,我 ...
- 深入浅出理解iOS经常使用的正則表達式—基础篇[Foundation]
參考资料:cocoachina的zys475481075的文章 几个单词 Regular ['regjʊlə]adj. 定期的:有规律的 Expression[ɪk'spreʃ(ə)n; ek-] n ...
随机推荐
- 【Python】学习笔记一:Hello world
前言 在我看来,无论我们学习什么语言第一个学习的估计都是Hello world,那么接下来就从Hello world说起! 编写代码 我在本机上已经安装了pycharm,所以我所编辑的代码都是在pyc ...
- Java8 Optional && Guava Optional
Java8 -- Optional boolean isPresent():与obj != null()一样:调用get()前要调用isPresent()检查,不然会报错 Optional的三种构造方 ...
- TCP定时器 之 延迟确认定时器
TCP在收到数据段但是无需马上确认时设定,如果在超时时间之内有数据要发送到对端,则确认会随着数据一起发送,即捎带ACK,如果达到超时时间则执行定时器回调立即发送ack: 启动定时器: 延迟确认定时器调 ...
- python3笔记七:break和continue语句
一:学习内容 break语句 continue语句 二:break语句 1. 说明 作用:跳出for和while的循环注意:只能跳出距离它最近的那一层循环 2.举例1 for i in range(1 ...
- MySQL定时任务实现方法
类型一:每隔一分钟插入一条数据: 参数说明: DEFINER:创建者: ON COMPLETION [NOT] PRESERVE :表示当事件不会再发生的情况下,删除事件(注意特定时间执行的事件, ...
- laravel 发送html邮件是a标签中的url不显示问题
- leetcode 328 奇偶链表
更新代码: 开头检测是否需要调整(是否具有第三个节点) 使用三个ListNode* 变量记录奇偶链表的头尾headA,tailA为奇链表,headB为偶数链表,由于只需要最后令tailA->ne ...
- leetcode 94二叉树的中序遍历
递归算法C++代码: /** * Definition for a binary tree node. * struct TreeNode { * int val; * TreeNode *left; ...
- 自定义PopupWindow实现常用效果
package com.loaderman.customviewdemo; import android.content.Context; import android.view.View; impo ...
- WPF prism 类、属性和方法的导入和导出
学习Prism一定要掌握依赖注入的应用,只有了解了Prism的依赖注入才能更好的使用Prism提升应用开发的架构. 首先说明Prism依赖注入有两种方式及MEF和Unity ,在Prism中是两个没有 ...