让正则更上一层楼-阿里云开发者社区

开发者社区> 技术小美> 正文

让正则更上一层楼

简介:
+关注继续查看

最近在研读《正则指引》,再将正则相关知识点梳理一遍。

下图是JavaScript中的正则功能,说明一列可看到支持程度。

 

一、语法

1)量词

匹配优先量词(greedy quantifier),也称为贪婪量词,在拿不准是否要匹配的时候,优先尝试匹配,记下这个状态,以备将来返回(回溯)。

忽略优先量词(lazy quantifier或reluctant quantifier),也称为懒惰量词,优先尝试跳过

下图是工具RegexBuddy中展示的回溯图,“backtrack”就是回溯的意思。

//贪婪量词
<p>.*<\/p>
//惰性量词
<p>.*?<\/p>
//匹配的字符串
<p>123</p><p>456</p>

贪婪量词

惰性量词

2)括号

1. 分组(grouping)

把一个表达式用括号括起来,括号内的表达式称为“子表达式”,例如“(\d{2}[0-9x])?”,括号内就变成了一个整体,或许不出现,或许出现一次。

2. 多选结构(alternative)

用竖线“(..|..)”分割开多个子表达式,这些子表达式也叫多选分支(option)。

3. 引用分组

正则表达式会保存每个分组真正匹配的文本,匹配完成后,通过group(num)之类的方法,“引用”分组在匹配时捕获的内容。num表示对应编号,从左往右,从1开始。JavaScript不支持命名分组。

4. 非捕获分组(non-capturing group)

前面说过,正则会保存匹配的文本,但有时候并不需要保存,提升性能,那么就需要非捕获。非捕获型括号就是开括号后紧跟问号与冒号“(?:...)”。

在《飞起来的正则表达式》中详细分析了匹配捕获的代码操作。

3)断言

1. 单词边界:【\b】

一边匹配【\w】(包括[0-9a-zA-Z]),一边不能匹配。下图深色部分是单词边界匹配的规则。

2. 行起始/结束位置:【^与$】

行终止符是【\r\n】,多行模式“m”可以在第二行继续匹配,例如需要匹配下面每个以数字开头的行,就能匹配第一和第三行。

1. first
no digit
3. third

3. 环视:顺序环视,逆序环视

环视类似单词边界,在旁边的文本满足某种条件,但本身不匹配任何字符。环视匹配的是位置,不是字符。JavaScript不支持逆序环视。

 

二、正则表达式原理

1)理论模型

正则表达式采用了一种理论模型,有穷自动机(Finite Automata),或叫状态机

自动售货机就是一种有穷自动机,假设饮料价格都是整数,只接收5块钱的纸币,可能的状态就会有6个:5元、4元、3元、2元、1元和0元。

塞进5元 =》 点1瓶可乐花掉3元 =》剩下3元按退币 =》 状态切换到0元 =》 0元也叫最终状态。

   

2)正则引擎

正则引擎会将一个正则直接量或者 RegExp 编译为一个原生代码程序,也就是生成许多自动机(状态);

测试的字符串会游走在各种状态之间,最终停在某个状态。

正则的引擎为两类:DFANFA

DFA(Deterministic Finite Automaton)确定型有穷自动机,DFA引擎不需要进行回溯,所以匹配效率一般情况下要高,但是它并不支持捕获组,于是也就不支持反向引用和$这种形式的引用,也不支持环视(Lookaround)、非贪婪模式等一些NFA引擎特有的特性。

NFA(Non-deterministic Finite Automata)不确定型有穷自动机

NFA对于一个字符的输入有可能存在多个以上的状态转移,而DFA对于每一个输入只存在一个选择

下图中DFA中S3位置输入a是S4,输入b是S2;而NFA中S2的位置输入b有两个可以转移到S3或S1.

所以每一个NFA都可以转化为一个DFA,但是一个DFA可以转化为多个NFA。

3)回溯

回溯的两个要点,引用自《精通正则表达式》第4章中的回溯:

1. 如果需要在“进行尝试”和“跳过尝试”之间选择,对于匹配优先量词,引擎会选择“进行尝试”;而忽略优先量词,会选择“跳过尝试”。

2. 回溯的时候,使用的分支是距离当前最近存储的选项,使用的原则是LIFO(Last In First Out)。

动画片中经常会出现走山洞,会在分岔路口丢块面包屑,用这个比喻就是,如果前面是死路,你只需原路返回,直到找到一堆面包屑为止。

 

三、正则技巧

1)关于元素的三种逻辑

按照元素(单个字符、字符组、多选分支等)的出现情况分为3类:必须出现,可能出现,不能出现。

不管正则多么复杂,总是这3种逻辑的组合。

2)表达式中的优先级

正则表达式的元素之间的组合关系只有4种。

 

四、正则表达式常见操作

1)提取

用正则表达式遍历整个字符串,找出匹配的文本。相关的方法是RegExp.exec(string)string.match(RegExp)

2)验证

检查字符串能否用正则表达式匹配。相关的方法是RegExp.test(string)

3)替换

删除不必要的文本,调整数据。相关的方法是string.replace(RegExp, replacement)

4)切分

元素是切分之后的片段。相关的方法是string.split(RegExp)

在《JavaScript与PHP中正则》中有具体分析各个方法的使用。

 

五、工具

通过使用RegexBuddy这个工具,可以对正则有更多感性的认识。

1)Token

工具会将正则表达式分解成各个“Token”。

1. 示例

<p>.*?<\/p>

上面的表达式对应的Token如下:

在上图中描述出了正则是区分大小写、惰性匹配、还有各个字符的匹配。

上面的正则比较简单,可以找个复杂点的正则查看Token,例如匹配邮箱的正则。

^[a-zA-Z0-9.!#$%&'*+\/=?^_`{|}~-]+@[a-zA-Z0-9](?:[a-zA-Z0-9-]{0,61}[a-zA-Z0-9])?(?:\.[a-zA-Z0-9](?:[a-zA-Z0-9-]{0,61}[a-zA-Z0-9])?)*$

2. Explain Token

点击“Explain Token”将弹出chm文档,不是中文的。

3. Insert Token

这是个简便功能,可以快速插入元字符、Unicode字符、还有一些组合(所有字符等),环视等。

第一张图是点击后的下拉菜单,第二张图是Unicode字符选择。

   

2)Debug

1. 匹配

下图中带颜色的部分就是能够匹配的字符

2. 调试

调试的时候要注意一些细节,上图中红色选中部分,要把鼠标位置放在字符串的最前面。

点击“Debug”后就能看到匹配过程。将鼠标选中某一行,能够看到对应的Token。例如下图选中了13行,对应的Token会加一层底色。

  

3)性能调优

在第9.3章中给出了一些正则的优化建议,包括使用缓存、准确表达意图、避免重复匹配、独立出文本和锚点。

我理解正则比较消耗性能的地方是“回溯”,所以减少回溯越少,增加性能。还可以减少捕获,提升性能。

通过工具能够看到每次匹配过程中回溯的次数。

//匹配的字符串
<script>123456</script>
//回溯9次
<script>.+<\/script>
//回溯5次
<script>.+?<\/script>
//回溯7次,不捕获
<script>(?:(?!<\/script>).)+<\/script>
<script>.+<\/script> <script>.+?<\/script> <script>(?:(?!<\/script>).)+<\/script>

 

 

工具RegexBuddy下载:

http://download.csdn.net/download/loneleaf1/9809385

 

参考资料:

正则指引

正则匹配可以又快又简单(一)

正则表达式匹配也可以简单快速(上:原理部分)

Regular Expression Matching Can Be Simple And Fast

探索Ruby正则表达式算法(译)

正则表达式引擎及其分类

JS正则表达式一条龙讲解

进阶正则表达式

PHP正则表达式的效率:回溯与固化分组

正则表达式 回溯

深入入门正则表达式(java) - 匹配原理 - 1 - 引擎分类与普适原则

 


本文转自 咖啡机(K.F.J) 博客园博客,原文链接:  http://www.cnblogs.com/strick/p/6688866.html ,如需转载请自行联系原作者

版权声明:本文内容由阿里云实名注册用户自发贡献,版权归原作者所有,阿里云开发者社区不拥有其著作权,亦不承担相应法律责任。具体规则请查看《阿里云开发者社区用户服务协议》和《阿里云开发者社区知识产权保护指引》。如果您发现本社区中有涉嫌抄袭的内容,填写侵权投诉表单进行举报,一经查实,本社区将立刻删除涉嫌侵权内容。

相关文章
阿里云服务器怎么设置密码?怎么停机?怎么重启服务器?
如果在创建实例时没有设置密码,或者密码丢失,您可以在控制台上重新设置实例的登录密码。本文仅描述如何在 ECS 管理控制台上修改实例登录密码。
10010 0
阿里云服务器ECS远程登录用户名密码查询方法
阿里云服务器ECS远程连接登录输入用户名和密码,阿里云没有默认密码,如果购买时没设置需要先重置实例密码,Windows用户名是administrator,Linux账号是root,阿小云来详细说下阿里云服务器远程登录连接用户名和密码查询方法
11586 0
阿里云服务器如何登录?阿里云服务器的三种登录方法
购买阿里云ECS云服务器后如何登录?场景不同,阿里云优惠总结大概有三种登录方式: 登录到ECS云服务器控制台 在ECS云服务器控制台用户可以更改密码、更换系.
13809 0
windows server 2008阿里云ECS服务器安全设置
最近我们Sinesafe安全公司在为客户使用阿里云ecs服务器做安全的过程中,发现服务器基础安全性都没有做。为了为站长们提供更加有效的安全基础解决方案,我们Sinesafe将对阿里云服务器win2008 系统进行基础安全部署实战过程! 比较重要的几部分 1.
9154 0
腾讯云服务器 设置ngxin + fastdfs +tomcat 开机自启动
在tomcat中新建一个可以启动的 .sh 脚本文件 /usr/local/tomcat7/bin/ export JAVA_HOME=/usr/local/java/jdk7 export PATH=$JAVA_HOME/bin/:$PATH export CLASSPATH=.
4653 0
如何设置阿里云服务器安全组?阿里云安全组规则详细解说
阿里云安全组设置详细图文教程(收藏起来) 阿里云服务器安全组设置规则分享,阿里云服务器安全组如何放行端口设置教程。阿里云会要求客户设置安全组,如果不设置,阿里云会指定默认的安全组。那么,这个安全组是什么呢?顾名思义,就是为了服务器安全设置的。安全组其实就是一个虚拟的防火墙,可以让用户从端口、IP的维度来筛选对应服务器的访问者,从而形成一个云上的安全域。
7456 0
阿里云服务器如何登录?阿里云服务器的三种登录方法
购买阿里云ECS云服务器后如何登录?场景不同,云吞铺子总结大概有三种登录方式: 登录到ECS云服务器控制台 在ECS云服务器控制台用户可以更改密码、更换系统盘、创建快照、配置安全组等操作如何登录ECS云服务器控制台? 1、先登录到阿里云ECS服务器控制台 2、点击顶部的“控制台” 3、通过左侧栏,切换到“云服务器ECS”即可,如下图所示 通过ECS控制台的远程连接来登录到云服务器 阿里云ECS云服务器自带远程连接功能,使用该功能可以登录到云服务器,简单且方便,如下图:点击“远程连接”,第一次连接会自动生成6位数字密码,输入密码即可登录到云服务器上。
22363 0
+关注
6906
文章
0
问答
文章排行榜
最热
最新
相关电子书
更多
《2021云上架构与运维峰会演讲合集》
立即下载
《零基础CSS入门教程》
立即下载
《零基础HTML入门教程》
立即下载