Java-API简析_java.util.regex.Pattern类（基于 Latest JDK）（浅析源码）|电子爱好者

admin管理员组
文章数量:1579083

【版权声明】未经博主同意，谢绝转载！（请尊重原创，博主保留追究权）
https://blog.csdn/m0_69908381/article/details/132953085
出自【进步*于辰的博客】

注：依赖类：Matcher。

文章目录

1、概述
2、正则表达式的构造摘要
3、方法摘要
- 3.1 static Pattern compile(String regex)
- 3.2 static Pattern compile(String regex, int flags)
- 3.3 int flags()
- 3.4 Matcher matcher(CharSequence input)
- 3.5 static boolean matches(String regex, CharSequence input)
- 3.6 String pattern()
- 3.7 static String quote(String s)
- 3.8 String[] split(CharSequence input)
- 3.9 String[] split(CharSequence input, int limit)
- 3.10 String toString()

1、概述

继承关系：

java.lang.Object
- java.util.regex.Pattern

所有已实现的接口：
Serializable

public final class Pattern extends Object implements Serializable

正则表达式的编译表示形式。

指定为字符串的正则表达式必须首先被编译为此类的实例。然后，可将得到的模式用于创建 Matcher 对象，依照正则表达式，该对象可以与任意字符序列匹配。执行匹配所涉及的所有状态都驻留在匹配器中，所以多个匹配器可以共享同一模式。

因此，典型的调用顺序是

 Pattern p = Pattern.compile("a*b");
 Matcher m = p.matcher("aaaaab");
 boolean b = m.matches();

在仅使用一次正则表达式时，可以方便地通过此类定义 matches 方法。此方法编译表达式并在单个调用中将输入序列与其匹配。语句

 boolean b = Pattern.matches("a*b", "aaaaab");

等效于上面的三个语句，尽管对于重复的匹配而言它效率不高，因为它不允许重用已编译的模式。

此类的实例是不可变的，可供多个并发线程安全使用。Matcher 类的实例用于此目的则不安全。

正则表达式的构造摘要
（篇幅考虑，移至下文）

反斜线、转义和引用

反斜线字符 ('\') 用于引用转义构造，如上表所定义的，同时还用于引用其他将被解释为非转义构造的字符。因此，表达式 \\ 与单个反斜线匹配，而 \{ 与左括号匹配。

在不表示转义构造的任何字母字符前使用反斜线都是错误的；它们是为将来扩展正则表达式语言保留的。可以在非字母字符前使用反斜线，不管该字符是否非转义构造的一部分。

根据 Java Language Specification 的要求，Java 源代码的字符串中的反斜线被解释为 Unicode 转义或其他字符转义。因此必须在字符串字面值中使用两个反斜线，表示正则表达式受到保护，不被 Java 字节码编译器解释。例如，当解释为正则表达式时，字符串字面值 "\b" 与单个退格字符匹配，而 "\\b" 与单词边界匹配。字符串字面值 "$hello$" 是非法的，将导致编译时错误；要与字符串 (hello) 匹配，必须使用字符串字面值 "\$hello\$"。

字符类

字符类可以出现在其他字符类中，并且可以包含并集运算符（隐式）和交集运算符 (&&)。并集运算符表示至少包含其某个操作数类中所有字符的类。交集运算符表示包含同时位于其两个操作数类中所有字符的类。

字符类运算符的优先级如下所示，按从最高到最低的顺序排列：

序号	含义	运算符
1	字面值转义	`\x`
2	分组	`[...]`
3	范围	`a-z`
4	并集	`[a-e][i-u]`
5	交集	`[a-z&&[aeiou]]`

注意，元字符的不同集合实际上位于字符类的内部，而非字符类的外部。例如，正则表达式 . 在字符类内部就失去了其特殊意义，而表达式 - 变成了形成元字符的范围。

行结束符

行结束符 是一个或两个字符的序列，标记输入字符序列的行结尾。以下代码被识别为行结束符：

新行（换行）符 ('\n')、
后面紧跟新行符的回车符 ("\r\n")、
单独的回车符 ('\r')、
下一行字符 ('\u0085')、
行分隔符 ('\u2028') 或
段落分隔符 ('\u2029)。

如果激活 UNIX_LINES 模式，则新行符是惟一识别的行结束符。

如果未指定 DOTALL 标志，则正则表达式.可以与任何字符（行结束符除外）匹配。

默认情况下，正则表达式 ^ 和 $ 忽略行结束符，仅分别与整个输入序列的开头和结尾匹配。如果激活 MULTILINE 模式，则 ^ 在输入的开头和行结束符之后（输入的结尾）才发生匹配。处于 MULTILINE 模式中时，$ 仅在行结束符之前或输入序列的结尾处匹配。

组和捕获

捕获组可以通过从左到右计算其开括号来编号。例如，在表达式 ((A)(B(C))) 中，存在四个这样的组：

序号	组
1	`((A)(B(C)))`
2	\A
3	`(B(C))`
4	`(C)`

组零始终代表整个表达式。

之所以这样命名捕获组是因为在匹配中，保存了与这些组匹配的输入序列的每个子序列。捕获的子序列稍后可以通过 Back 引用（见下文）在表达式中使用，也可以在匹配操作完成后从匹配器检索。

与组关联的捕获输入始终是与组最近匹配的子序列。如果由于量化的缘故再次计算了组，则在第二次计算失败时将保留其以前捕获的值（如果有的话）例如，将字符串 "aba" 与表达式 (a(b)?)+ 相匹配，会将第二组设置为 "b"。在每个匹配的开头，所有捕获的输入都会被丢弃。

以 (?) 开头的组是纯的 非捕获 组，它不捕获文本，也不针对组合计进行计数。

Unicode 支持

此类符合 Unicode Technical Standard #18:Unicode Regular Expression Guidelines 第 1 级和 RL2.1 Canonical Equivalents。

Java 源代码中的 Unicode 转义序列（如 \u2014）是按照 Java Language Specification 的第 3.3 节中的描述处理的。这样的转义序列还可以由正则表达式分析器直接实现，以便在从文件或键盘击键读取的表达式中使用 Unicode 转义。因此，可以将不相等的字符串 "\u2014" 和 "\\u2014" 编译为相同的模式，从而与带有十六进制值 0x2014 的字符匹配。

与 Perl 中一样，Unicode 块和类别是使用 \p 和 \P 构造编写的。如果输入具有属性 prop，则与 \p{prop} 匹配，而输入具有该属性时与 \P{prop} 不匹配。块使用前缀 In 指定，与在 InMongolian 中一样。可以使用可选前缀 Is 指定类别：\p{L} 和 \p{IsL} 都表示 Unicode 字母的类别。块和类别在字符类的内部和外部都可以使用。

受支持的类别是由 Character 类指定版本中的 The Unicode Standard 的类别。类别名称是在 Standard 中定义的，即标准又丰富。Pattern 所支持的块名称是 UnicodeBlock.forName() 所接受和定义的有效块名称。

行为类似 java.lang.Character boolean 是 methodname() （废弃的类别除外）的类别，可以通过相同的 \p{prop} 语法来提供，其中指定的属性具有名称 javamethodname。

与 Perl 5 相比较

Pattern 引擎用有序替换项执行传统上基于 NFA 的匹配，与 Perl 5 中进行的相同。

此类不支持 Perl 构造：

条件构造 (?{X}) 和 (?(condition)X|Y)、
嵌入式代码构造 (?{code}) 和 (??{code})、
嵌入式注释语法 (?#comment) 和
预处理操作 \l \u、\L 和 \U。

此类支持但 Perl 不支持的构造：

Possessive 数量词，它可以尽可能多地进行匹配，即使这样做导致所有匹配都成功时也如此。
字符类并集和交集，如上文所述。

与 Perl 的显著不同点是：

在 Perl 中，\1 到 \9 始终被解释为 Back 引用（见下文）；如果至少存在多个子表达式，则大于 9 的反斜线转义数按 Back 引用对待，否则在可能的情况下，它将被解释为八进制转义。在此类中，八进制转义必须始终以 0 开头。在此类中，\1 到 \9 始终被解释为 Back 引用，较大的数被接受为 Back 引用，如果在正则表达式中至少存在多个子表达式的话；否则，分析器将删除数字，直到该数小于或等于组的现有数或者其为一个数字。
Perl 使用 g 标志请求恢复最后匹配丢失的匹配。此功能是由 Matcher 类显式提供的：重复执行 find() 调用可以恢复丢失的最后匹配，除非匹配器被重置。
在 Perl 中，位于表达式顶级的嵌入式标记对整个表达式都有影响。在此类中，嵌入式标志始终在它们出现的时候才起作用，不管它们位于顶级还是组中；在后一种情况下，与在 Perl 中类似，标志在组的结尾处还原。
Perl 允许错误匹配构造，如在表达式 *a 中，以及不匹配的括号，如在在表达式 abc] 中，并将其作为字面值对待。此类还接受不匹配的括号，但对 +、? 和 * 不匹配元字符有严格限制；如果遇到它们，则抛出 PatternSyntaxException。

有关正则表达式构造行为更准确的描述，请参见《Mastering Regular Expressions, 2nd Edition》，该书由 Jeffrey E. F. Friedl、O’Reilly 和 Associates 合著，于 2002 年出版。

从以下版本开始：
1.4
另请参见：
String.split(String, int), String.split(String), 序列化表格

2、正则表达式的构造摘要

字符。

构造	匹配
`x`	字符 x
`\\`	反斜线字符
`\0n`	带有八进制值 0 的字符 n (0 <= n <= 7)
`\0nn`	带有八进制值 0 的字符 nn (0 <= n <= 7)
`\0mnn`·	带有八进制值 0 的字符 mnn（0 <= m <= 3、0 <= n <= 7）
`\xhh`	带有十六进制值 0x 的字符 hh
`\uhhhh`	带有十六进制值 0x 的字符 hhhh
`\t`	制表符 (‘\u0009’)
`\n`	新行（换行）符 (‘\u000A’)
`\r`	回车符 (‘\u000D’)
`\f`	换页符 (‘\u000C’)
`\a`	报警 (bell) 符 (‘\u0007’)
`\e`	转义符 (‘\u001B’)
`\cx`	对应于 x 的控制符

字符类。

构造	匹配
`[abc]`	a、b 或 c（简单类）
`[^abc]`	任何字符，除了 a、b 或 c（否定）
`[a-zA-Z]`	a 到 z 或 A 到 Z，两头的字母包括在内（范围）
`[a-d[m-p]]`	a 到 d 或 m 到 p：[a-dm-p]（并集）
`[a-z&&[def]]`	d、e 或 f（交集）
`[a-z&&[^bc]]`	a 到 z，除了 b 和 c：[ad-z]（减去）
`[a-z&&[^m-p]]`	a 到 z，而非 m 到 p：[a-lq-z]（减去）

预定义字符类。

构造	匹配
`.`	任何字符（与行结束符可能匹配也可能不匹配）
`\d`	数字：[0-9]
`\D`	非数字： [^0-9]
`\s`	空白字符：`[ \t\n\x0B\f\r]`
`\S`	非空白字符：[^\s]
`\w`	单词字符：[a-zA-Z_0-9]
`\W`	非单词字符：[^\w]

POSIX 字符类（仅 US-ASCII）。

构造	匹配
`\p{Lower}`	小写字母字符：[a-z]
`\p{Upper}`	大写字母字符：[A-Z]
`\p{ASCII}`	所有 ASCII：`[\x00-\x7F]`
`\p{Alpha}`	字母字符：`[\p{Lower}\p{Upper}]`
`\p{Digit}`	十进制数字：[0-9]
`\p{Alnum}`	字母数字字符：`[\p{Alpha}\p{Digit}]`
`\p{Punct}`	标点符号：`!"#$%&'()*+,-./:;<=>?@[\]^_`{
`\p{Graph}`	可见字符：`[\p{Alnum}\p{Punct}]`
`\p{Print}`	可打印字符：`[\p{Graph}\x20]`
`\p{Blank}`	空格或制表符：`[ \t]`
`\p{Cntrl}`	控制字符：`[\x00-\x1F\x7F]`
`\p{XDigit}`	十六进制数字：`[0-9a-fA-F]`
`\p{Space}`	空白字符：`[ \t\n\x0B\f\r]`

java.lang.Character 类（简单的 java 字符类型）。

构造	匹配
`\p{javaLowerCase}`	等效于 `java.lang.Character.isLowerCase()`
`\p{javaUpperCase}`	等效于 `java.lang.Character.isUpperCase()`
`\p{javaWhitespace}`	等效于 `java.lang.Character.isWhitespace()`
`\p{javaMirrored}`	等效于 `java.lang.Character.isMirrored()`

Unicode 块和类别的类。

构造	匹配
`\p{InGreek}`	Greek 块（简单块）中的字符
`\p{Lu}`	大写字母（简单类别）
`\p{Sc}`	货币符号
`\P{InGreek}`	所有字符，Greek 块中的除外（否定）
`[\p{L}&&[^\p{Lu}]]`	所有字母，大写字母除外（减去）

边界匹配器。

构造	匹配
`^`	行的开头
`$`	行的结尾
`\b`	单词边界
`\B`	非单词边界
`\A`	输入的开头
`\G`	上一个匹配的结尾
·\Z`	输入的结尾，仅用于最后的结束符（如果有的话）
·\z·	输入的结尾

Greedy 数量词。

构造	匹配
`X?`	X，一次或一次也没有
`X*`	X，零次或多次
`X+`	X，一次或多次
`X{n}`	X，恰好 n 次
`X{n,}`	X，至少 n 次
`X{n,m}`	X，至少 n 次，但是不超过 m 次

Reluctant 数量词。

构造	匹配
`X??`	X，一次或一次也没有
`X*?`	X，零次或多次
`X+?`	X，一次或多次
`X{n}?`	X，恰好 n 次
`X{n,}?`	X，至少 n 次
`X{n,m}?`	X，至少 n 次，但是不超过 m 次

Possessive 数量词。

构造	匹配
`X?+`	X，一次或一次也没有
`X*+`	X，零次或多次
`X++`	X，一次或多次
`X{n}+`	X，恰好 n 次
`X{n,}+`	X，至少 n 次
`X{n,m}+`	X，至少 n 次，但是不超过 m 次

Logical 运算符。

构造	匹配
`XY`	X 后跟 Y
`X\|Y`	X 或 Y
`(X)`	X，作为捕获组

Back 引用。

构造	匹配
`\n`	任何匹配的 nth 捕获组

引用。

构造	匹配
`\`	Nothing，但是引用以下字符
`\Q`	Nothing，但是引用所有字符，直到 \E
`\E`	Nothing，但是结束从 \Q 开始的引用

特殊构造（非捕获）。

构造	匹配
`(?:X)`	X，作为非捕获组
`(?idmsux-idmsux)`	Nothing，但是将匹配标志由 on 转为 off
`(?idmsux-idmsux:X)`	X，作为带有给定标志 on - off 的非捕获组
`(?=X)`	X，通过零宽度的正 lookahead
`(?!X)`	X，通过零宽度的负 lookahead
`(?<=X)`	X，通过零宽度的正 lookbehind
`(?<!X)`	X，通过零宽度的负 lookbehind
`(?>X)`	X，作为独立的非捕获组

3、方法摘要

3.1 static Pattern compile(String regex)

将给定的正则表达式编译到模式中。

3.2 static Pattern compile(String regex, int flags)

将给定的正则表达式编译到具有给定标志的模式中。

3.3 int flags()

返回此模式的匹配标志。

3.4 Matcher matcher(CharSequence input)

创建匹配给定输入与此模式的匹配器。

public Matcher matcher(CharSequence input) {
    if (!compiled) {
        synchronized(this) {
            if (!compiled)
                compile();
        }
    }
    Matcher m = new Matcher(this, input);
    return m;
}

后续解析。

3.5 static boolean matches(String regex, CharSequence input)

编译给定正则表达式并尝试将给定输入与其匹配。

public static boolean matches(String regex, CharSequence input) {
    Pattern p = Pattern.compile(regex);
    Matcher m = p.matcher(input);
    return m.matches();
}

后续解析。

3.6 String pattern()

返回在其中编译过此模式的正则表达式。

3.7 static String quote(String s)

返回指定 String 的字面值模式 String。

3.8 String[] split(CharSequence input)

围绕此模式的匹配拆分给定输入序列。

3.9 String[] split(CharSequence input, int limit)

围绕此模式的匹配拆分给定输入序列。

3.10 String toString()

返回此模式的字符串表示形式。

本文持续更新中。。。

本文标签：源码简析 Java API

版权声明：本文标题：Java-API简析_java.util.regex.Pattern类（基于 Latest JDK）（浅析源码）内容由热心网友自发贡献，该文观点仅代表作者本人，转载请联系作者并注明出处：https://www.elefans.com/dianzi/1727845950a1133093.html，本站仅提供信息存储空间服务，不拥有所有权，不承担相关法律责任。如发现本站有涉嫌抄袭侵权/违法违规的内容，一经查实，本站将立刻删除。

电子爱好者 - 最新技术资讯及电子产品介绍！

Java-API简析_java.util.regex.Pattern类（基于 Latest JDK）（浅析源码）

文章目录

1、概述

2、正则表达式的构造摘要

3、方法摘要

3.1 static Pattern compile(String regex)

3.2 static Pattern compile(String regex, int flags)

3.3 int flags()

3.4 Matcher matcher(CharSequence input)

3.5 static boolean matches(String regex, CharSequence input)

3.6 String pattern()

3.7 static String quote(String s)

3.8 String[] split(CharSequence input)

3.9 String[] split(CharSequence input, int limit)

3.10 String toString()

更多相关文章

Java Review (二十二、正则表达式）

Java基础学习生疏知识点总结（20）——SE模考错题总结

JAVA开发工程师知识点总结【字符串篇】

Java基础_字符串及正则表达式

Java中的正则表达式构造摘要

Java解惑4-40不情愿的构造器

回归基础 java基础数据 数据处理

Regular expressions in Java, Part 1

Regular expressions in Java

疯狂Java讲义（七）----第二部分

java 正则 参数 转义_Java正则表达式中各种字符以及转义字符的解释说明

java 正则 reset_Java的正则表达式深入分析

java正则表达式 ppt_Java正则表达式实例详解

java字符串正则分割字符串_java分割字符串和正则表达式 | 学步园

java:正则表达式 --转http:blog.csdn.netyangjiali014archive200706191658235.aspx

长文慎点，Java学习笔记（四）

java正则表达式 位置_Java 正则表达式的使用

java第五周总结

第七章Java基础类库

【建议收藏】Android中高级大厂面试源码秘籍，为你备战2024金三银四，直通大厂

发表评论

推荐文章

使用kali破解WIFI——Aircrack-ng

对PHP文件进行加解密：ZendGuard加密与ZendLoader解密

MySQL 9.0创新版发布！功能又进化了！

HTML站内搜索引擎

Mysql之快速上手sql优化

热门文章

kali2022.2无线网络WiFi破解详解

破解无线上网密码 无线WEP密码破解

android 本地视频加密软件,使用教程

bigsur正式版clover引导_迟来的OC引导版本升级教程，让大家在更新mac OS Big Sur的时候变得更轻松...

hbase数据导入

2019年信息安全工程师上午真题及答案解析

服务器显示网络受限,Win10系统网络显示受限连接的解决方法

电脑开机之后进入emergency mode

linux开机显示welcome to emergency mode?

探索网络资源，尽在爱盼-网盘资源搜索Web

最新文章

慧荣SMISM3280AB开卡量产工具适用于无法识别设备黑片U盘量产工具修复使用

u盘无法识别怎么办，u盘无法识别解决方法

linux 下u盘分区修复无法识别问题解决

定了，6大领域93个开源任务，阿里开源导师带你参与中科院开源之夏2022

两万字详解自动驾驶开发工具链的现状与趋势

agio U盘强制弹出导致的无法识别需格式化的问题的修复方案

U盘无法与计算机连接,U盘无法连接电脑

通过修复VMware软件解决虚拟机无法识别到U盘设备的问题

@mysql数据库面试手册

测试人员面试需要掌握的内容

Ubuntu及Debian下挂载U盘及exFat文件系统U盘无法挂载的解决

linux usb3.0无法识别u盘启动,Deepin 20系统能识别USB3.0：如果不能用请重启系统或重插几次...

为什么计算机无法读取u盘,电脑无法识别读取U盘怎么办？逐一排查解决问题

解决Ubuntu下U盘无法识别的问题

测试工程师「 面试题 」那点故事

小米手机肿么还原时钟

15000流明是多少瓦

一般普通投影机功率多大?

苹果绿联转换器有些投影机不能用

坚果V9投影机具体参数?

有关九年级作文850字精选

80后90后_高一作文

中级卫生专业资格中医全科学主治医师中级模拟题2021年(9)案与解析

(精品)师范大学招考硕士研究生课程八六0试卷

回归基础 java基础数据数据处理

java 正则参数转义_Java正则表达式中各种字符以及转义字符的解释说明

java正则表达式位置_Java 正则表达式的使用

破解无线上网密码无线WEP密码破解

测试工程师「面试题」那点故事

【鬼泣5（Devil May Cry V）v1.0十四项修改】鬼泣5（Devil May Cry V）v1.0十四项修改官方免费下载