hy199707

正则表达式与文本处理工具

引言

一、正则表达式基础

（一）字符匹配

1.基本字符

2.特殊字符

3.量词

4.边界匹配

（二）进阶用法

1.组与引用

2.选择

二、命令之-----grep

（一）基础用法

（二）高级用法

三、命令之-----sed

（一）基本用法

1.打印功能

2.插入内容

（二）查找替换

（三）变量

（四）高级用法

四、命令之-----awk

（一）基本介绍

（二）基本用法

（三）变量

（四）正则匹配

（五）line ranges：行范围

（六）条件判断

（六）数组

文本实战

1.过滤IP地址

2.统计网络连接状态

引言

正则表达式（Regular Expression，简写为regex或regexp）是一种用于文本搜索、匹配和替换的强大工具。它定义了一种字符串模式，使得我们可以通过这种模式来查找、验证或提取符合特定规则的文本片段。

在计算机科学和文本处理领域，正则表达式（Regular Expression）无疑是一种强大的工具。它为我们提供了一种简洁而富有表现力的方式来搜索、替换或提取符合特定模式的文本片段。无论是在编程开发、数据清洗、网络爬虫还是日志分析中，正则表达式的应用都无处不在。

一、正则表达式基础

（一）字符匹配

1.基本字符

直接写出即可匹配该字符本身，例如 a 匹配字符 "a"。

grep是一个全局搜索并打印匹配模式的行的命令。等下会讲到

2.特殊字符

.	匹配任意单个字符，可以是一个汉字
[]	匹配指定范围内的任意单个字符
[^]	匹配指定范围外的任意单个字符,示例：[^zhou][^a.z][a.z]
[:alnum:]	字母和数字
[:alpha:]	代表任何英文大小写字符，亦即A-Z,a-z
[:lower:]	小写字母,示例:[[:lower:]],相当于[a-z]
[:upper:]	大写字母
[:blank:]	空白字符（空格和制表符）
[:space:]	包括空格、制表符(水平和垂直)、换行符、回车符等各种类型的空白,比[:blank:]包含的范围广
[:cntrl:]	不可打印的控制字符（退格、删除、警铃...）
[:digit:]	十进制数字
[:xdigit:]	十六进制数字
[:graph:]	可打印的非空白字符
[:print:]	可打印字符
[:punct:]	标点符号
\w	#匹配单词构成部分，等价于[_[:alnum:]]
\W	#匹配非单词构成部分，等价于[^_[:alnum:]]
\S	#匹配任何非空白字符。等价于[^\f\n\r\t\v]。
\s	#匹配任何空白字符，包括空格、制表符、换页符等等。等价于[\f\n\r\t\v]
\d	数字字符集，等同于 [0-9]，如\d+可以匹配一个或多个连续的数字。

以前四个为例

. ：表示匹配单个字符

[ ]：匹配指定范围内的任意单个字符

[^]：匹配指定范围外的任意单个字符

[:alnum:]：字母和数字

3.量词

?	前一个元素出现0次或1次	如 colou?r 可以匹配 "color" 或 "colour"
*	前一个元素出现0次或多次	如 a*b 可以匹配 "b"、"ab"、"aab" 等
+	前一个元素至少出现1次	如 a+b 可以匹配 "ab"、"aab"，但不匹配 "b"
{n}	前一个元素精确出现n次	如 a{3} 只能匹配 "aaa"
{n,}	前一个元素至少出现n次	如 a{2,} 可以匹配 "aa"、"aaa" 等
{n,m}	前一个元素最少出现n次	最多出现m次，如 a{2,4} 匹配 "aa"、"aaa" 和 "aaaa"

？的用法

*的用法

+的用法

{n,m}的用法

4.边界匹配

^	匹配字符串的开始位置	如 ^Hello 只匹配以 "Hello" 开头的字符串
$	匹配字符串的结束位置	如 World$ 只匹配以 "World" 结尾的字符串
\b	匹配单词边界	确保前后为非单词字符和单词字符的交界处

^的用法

$的用法

\b的用法

\b主要用于位置锚定，即精确地界定匹配的模式必须是独立的单词，而不是作为其他单词的一部分。

（二）进阶用法

1.组与引用

（）

捕获分组

允许对内部模式进行分组，并可以引用捕获的内容

2.选择

表示或操作

匹配左右两边的任何一个表达式

符号“|”的使用

正则表达式是每个程序员都应该掌握的重要技能之一，熟练运用它可以极大地提高工作效率和代码质量。然而，需要注意的是，不同编程语言和工具对正则表达式的实现可能存在细微差异，请根据具体环境查阅相关文档并进行适配。同时，编写复杂正则时应尽量保持清晰和简洁，避免过度复杂的正则导致可读性和维护性降低。通过不断的实践与学习，你会发现正则表达式的世界充满了无限可能！

上面是一些正则表达式的基础用法。想要熟练掌握，还需要结合命令多加练习，下面介绍一些在工作中必备的三个文本处理命令

grep、sed 和 awk 是Linux/Unix环境下的三个非常强大的文本处理工具，它们在命令行中广泛用于搜索、替换和分析文本数据。

二、命令之-----grep

grep命令是Linux和类Unix系统中用于搜索文本文件中匹配特定模式的行的强大工具。它的全称是Global Regular Expression Print，即全局正则表达式打印

语法为

grep [选项] 表达式文件名

-i	忽略大小写进行匹配。
-v	反向选择，打印不包含匹配项的行。
-n	在输出行前加上行号。
-c	只显示包含匹配项的行数，而不是具体行内容。
-w	精确匹配整个单词。
-e	实现多个选项间的逻辑or关系
-f	从文件中读取多个搜索模式。
-r ;-R	递归地搜索目录下的所有文件。r不处理软链接R处理软链接
-l	仅列出包含匹配行的文件名。
-m	最多显示count个匹配行。
-o	只显示匹配内容
-q	静默输出，不显示任何内容。一般在写脚本的时候使用
-E	指定一个正则表达式模式。

（一）基础用法

grep的基础用法就是匹配已知字符

例如下图所示

还可以进行组合，比如查看一个目录下，有哪些文件包含匹配的字符串

使用grep -lr 需要匹配的内容目录

-o：表示只显示匹配的内容

-e：匹配多个内容，用-e连接起来

-m：最多显示指定的匹配行数

-v：反选，显示匹配内容之外的内容

-f：处理两个文件相同内容把第一个文件作为匹配条件

-w：精准匹配单词

（二）高级用法

与正则表达式相结合使用，一般使用正则表达式时，大多数字符都具有特殊含义，所以在命令行中需要进行转译，或者加 -E 使用扩展正则,支持更丰富的正则表达式特性

例如匹配ip地址，子网掩码和广播地址

这个时候，我们只需要加上-E开启扩展正则就无需进行转译，可以直接匹配

结合| 就无需使用-e进行字符串关联

使用grep统计当前主机有多少普通用户可以登录

总之，grep -E 提供了比基本正则表达式更多的灵活性和功能，使得能够编写更复杂、更精确的搜索模式。

三、命令之-----sed

相对于grep命令来说，sed的命令就更加强大了一些。

sed（Stream Editor）是一种流编辑器，它逐行处理文本文件或输入流，并能够进行搜索、替换、删除、插入等操作。

Sed是从文件或管道中读取一行，处理一行，输出一行；再读取一行，再处理一行，再输出一行，直到最后一行。每当处理一行时，把当前处理的行存储在临时缓冲区中，称为模式空间（PatternSpace），接着用sed命令处理缓冲区中的内容，处理完成后，把缓冲区的内容送往屏幕。接着处理下一行，这样不断重复，直到文件末尾。

sed命令，一般用于脚本当中

（一）基本用法

sed的基本语法为

sed [选项] ‘语法选项’ 文件名

-e	用指定命令或者脚本来处理输入的文本文件只有一个操作命令时省略，一般在执行多个操作命令使用
-f	用指定的脚本文件来处理输入的文本文件
-n	不输出模式空间内容到屏幕，取消默认的打印行为，只有在命令中显式使用 p 命令时才会打印行。
-r 或 -E	使用扩展正则表达式
-h	显示帮助
-i	直接修改目标文件
-i.xxx	备份文件并原处编辑。xxx为自定义后缀名，可以随意设置
-s	将多个文件视为独立文件，而不是单个连续的长文件流

语法选项（模式空间操作）：

s/old/new/flags	替换命令，用 new 替换每一行首次出现的 old，可选的标志包括 g:全局替换，在一行中所有匹配的地方都进行替换。 i:忽略大小写。 p:打印出已替换的行。
d	删除命令，删除匹配当前模式空间内容的行。
a\ text	在当前行后添加文本 text，新行以反斜杠 \ 结束。
i\ text	在当前行前插入文本 text。
p	打印当前行（默认行为，如果没有 -n 参数的话）。
q	退出 sed，如果后面跟着一个数字，则在处理到第 n 行之后退出。
c	替换，将选定行替换为指定内容
w	保存模式匹配的行至指定文件

地址范围：

number	指定要操作的行号。
/regex/	根据正则表达式匹配的行。
address1, address2	处理从 address1 到 address2 的行。

1.打印功能

虽然sed本身具有打印功能，但是直接使用sed命令却无法打印，因为sed的打印原理是将匹配的每一行内容，逐行放入模式空间，并打印到屏幕上。这里没有匹配项，所以无法打印

而加上语法选项p之后会将每一行的内容打印两边，这是因为，sed本身具有打印功能，而p选项，是打印文件内容，就等于将所有内容匹配了一遍，所有sed又打印了一遍。

加上-n选项后，取消了自动打印功能，所以只执行了p功能的打印属性

打印指定行数

2.插入内容

a：下方插入 i：上方插入 c：指定行替换

将其它文本的内容插入到当前文本中

这些都只是打印出来的内容，真实文件是没有改变的，想要真实修改文件，需要加-i选项

（二）查找替换

语法格式为 sed [选项] s/old/new/flags 文件路径

匹配旧内容时支持通配符，比如将selinux永久关闭，修改配置文件

查找替换中，还有一种比较实用的用法叫后向引用

就是使用捕获分组() 将括号中的字符串定义为一个分组，第一个括号中的内容就是1.第二个括号中的内容就是2，以此类推

修改httpd的配置文件中的监听端口

指定行数

指定需要修改的行的范围

（三）变量

sed支持变量查找与替换

首先定义变量

语法格式为

sed -ri "s/${变量名}/${变量名}/g" /etc/passwd

（四）高级用法

sed语法用有一些比较高级的使用方法

下面是一个语法选项

选项	含义
P	打印模式空间开端至\n内容，并追加到默认输出之前
N	读取匹配到的行的下一行追加至模式空间
n	读取匹配到的行的下一行覆盖至模式空间
G	从保持空间取出的内容追加至模式空间
g	从保持空间取出的数据覆盖至模式空间
H	把模式空间中的内容追加至保持空间
h	把模式空间中的内容覆盖至保持空间
x	把模式空间中的内容与保持空间中的内容进行互换
d	删除模式空间中的行
D	如果模式空间包含换行符，则删除直到第一个换行符的模式空间中的文本，并不会读取新的输入行，而使用合成的模式空间重新启动循环，如果模式空间不包含换行符，则会像发出d命令那样启动正常的新循环

n，表示读取匹配到的行的下一行覆盖至模式空间

打印奇数行与偶数行的方式

烧脑挑战

首先需要直到语法选项的含义

-n：取消默认打印

1：表示第一行

！：取反

G：从保持空间取出的内容追加至模式空间

h：把模式空间中的内容覆盖至保持空间

$！：表示最后一行

d：删除

现在，结合图片解释一下

从第一行开始匹配：1！取反，不是第一行才执行G（从保持空间取出的内容追加至模式空间），第一行不执行执行G，直接执行h（把模式空间中的内容覆盖至保持空间）保持空间为行1，不符合$(最后一行)条件，删除模式空间内容

第二行：1！取反，不是第一行就执行G，将保持空间取出的内容追加至模式空间，而后执行h，将行2与行1覆盖至保持空间，不是最后一行，删除模式空间内容

第三行：1！取反，不是第一行就执行G，将保持空间取出的内容追加至模式空间，而后执行h，将行3、行2、行1覆盖至保持空间，不是最后一行，删除模式空间内容

以此类推，一直到最后一行，不删除模式空间内容，输出到屏幕

小结：sed语法一般用在脚本当中，不需要打开文件，进行文件修改，如果在bash环境中一般直接使用vim进行修改，但是，处理大文件时使用sed命令会更好，因为vim需要打开文件，会占用缓存资源，sed不需要打开文件可以直修改

四、命令之-----awk

（一）基本介绍

awk 是一款强大的文本处理工具，它基于模式匹配和行处理的概念进行设计。在Unix/Linux环境中，awk 通常用于对结构化文本数据（如日志文件、表格数据等）执行一系列操作，包括搜索、过滤、格式化输出以及各种计算和转换。

起源与名称： awk 的名字来源于其三位创始人 Alfred Aho、Peter Weinberger 和 Brian Kernighan 的首字母组合

现在使用的awk命令来自gawk软件

基本语法： awk [options] 'pattern { action }' file(s)

options：可选的命令行选项，例如 -F 用于设置输入字段分隔符。

pattern：一个或多个条件表达式，当指定的模式匹配到当前行时，执行相应的动作。用{}指明

action：在模式匹配成功后要执行的操作，可以包含任意合法的Awk语句，如变量赋值、打印、循环、函数调用等。

file(s)：待处理的一个或多个输入文件名。

工作原理：

awk 将每一行输入数据视为一条记录，并将记录按照指定的分隔符划分为多个字段。对于每条记录，它都会尝试匹配给定的模式，如果模式匹配，则执行相应的动作。默认情况下，字段之间由空白字符（空格或制表符）分隔，但可以通过 -F 参数自定义分隔符。

内置功能

变量：awk 提供了一系列预定义变量，如 $0 表示整个记录，$1 到 $n 分别表示各字段，NF 表示字段数，NR 表示当前处理的记录行号等。

BEGIN/END 块

BEGIN 块在读取任何输入之前执行一次，常用于初始化变量或打印头部信息。

END 块在所有输入处理完毕后执行一次，适合于统计汇总结果或打印尾部信息。

运算符和表达式：支持算术、比较、逻辑及正则表达式等，可以用来构造复杂的匹配和控制流程。流程控制：if...else 条件判断，for 和 while 循环，以及其他控制结构。

函数：内置有多种函数，如数学函数、字符串函数，同时也允许用户自定义函数。

选项：

-v	定义变量
-F	指定分隔符

常见内置变量

（二）基本用法

awk默认以一个以上的空格为分隔符

比如以前想过滤出IP地址，需要好几个命令堆加在一起，现在只需要awk一个命令就可以了

-F：指定分隔符

BEGIN/END 块

BEGIN 块在读取任何输入之前执行一次，常用于初始化变量或打印头部信息。

END 块在所有输入处理完毕后执行一次，适合于统计汇总结果或打印尾部信息。

BEGIN/END必须要大写

awk还支持标准输入

（三）变量

awk中常见的内置变量有以下几种

内置变量	作用
NR	当前处理的行的行号（序数）
NF	当前处理的行的字段个数
FS	列分隔符，指定每行文本的字段分隔符，默认为空格或制表位。与 “ -F ” 作用相同
OFS	输出内容的列分隔符
RS	行分隔符，awk从文件中读取资料时，将根据RS的定义把资料切割成许多条记录，而awk一次仅读入一条记录进行处理。预设值是"\n"
$0	当前处理的行的整行内容
$n	当前处理行的第n个字段（第n列）
FILENAME	被处理的文件名

NR：表示当前处理的行的行号（序数）

语法为awk 'NR==n{处理动作}' 文件名

例：

awk '{print $1,NR}' passwd：打印出行号

awk 'NR==2{print $1}' /etc/passwd：只取第二行的第一个字段
awk 'NR==1,NR==3{print}' passwd ：打印出1到3 行

awk '(NR%2)==1{print NR,$0}' passwd：打印出函数取余数为1的行
awk '(NR%2)==0{print NR,$0}' passwd：打印出函数取余数为0行

$0：当前处理的行的整行内容

awk 'NR==1||NR==3{print}' passwd：打印出1和3行
awk 'NR>=3 && NR<=6{print NR,$0}' /etc/passwd ：打印出大于等于第三行，小于等于第六行，也就是3-6行

FNR：将多个文件分开显示

NF：当前处理的行的字段个数

例：

awk -F: '{print NF}' passwd

awk -F: '{print $NF}' passwd ：$NF表示最后一个字段

df|awk '{print $(NF-1)}'：倒数第二行

FS：列分隔符，指定每行文本的字段分隔符

RS：行分隔符，awk从文件中读取资料时，根据RS的定义把资分段，而awk一次仅读入一条记录进行处理。预设值是"\n"

OFS 输出内容的列分隔符（$n=$n 用于激活，否则不生效，n且必须存在）

（四）正则匹配

awk同样支持正则表达式进行匹配

（五）line ranges：行范围

算术操作符
x+y, x-y, x*y, x/y, x^y, x%y

比较操作符：
==, !=, >, >=, <, <=
逻辑
与：&&，并且关系
或：||，或者关系
非：!，取反

（六）条件判断

if语句：awk的if语句也分为单分支、双分支和多分支
单分支为if(判断条件){执行语句}

双分支为if(判断条件){执行语句}else{执行语句}

多分支为if(判断条件){执行语句}else if(判断条件){执行语句}else if(判断条件){执行语句}else if(判断条件){执行语句

（六）数组

awk的数组是关联数组(即key/value方式的hash数据结构)，索引下标可为数值(甚至是负数、小数等)，也可为字符串

1. 在内部，awk数组的索引全都是字符串，即使是数值索引在使用时内部也会转换成字符串

2. awk的数组元素的顺序和元素插入时的顺序很可能是不相同的

文本实战

1.过滤IP地址

[root@localhost ~]#ifconfig ens33|grep  netmask|tr -s " "|cut  -d " "  -f3
192.168.83.30

#ifconfig ens33：只看ens33网卡信息
#grep   netmask：过滤包含netmask的行
#tr -s " "     : 压缩空格
#cut -d " " -f3：以空格为分隔符，取第三列

[root@localhost ~]#ifconfig ens33|sed  -nr  's/ .*  inet (.*)  netmask.*/\1/p'
192.168.83.30

#ifconfig ens33：只看ens33网卡信息
#sed...........：
#-nr：关闭自动打印并开启扩展正则  
#.*表示任意字符，第一个.*表示前面的空格 
#inet (.*)表示inet后面的任意字符
#netmask.*表示netmask后面的任意字符；
#\1表示调用第一个括号中的内容；
#p打印
#打印出第一个括号中的内容，inet 后面的括号，里面的内容就是Ip地址
#需要注意空格符号，inte后面有一个空格 (.*)后面有两个空格  netmask


[root@localhost ~]#ifconfig ens33|awk  /netmask/'{print  $2}'
192.168.83.30

#ifconfig ens33：只看ens33网卡信息
#awk........
/netmask/   ：找到包含netmask的行
{print  $2} ：打印第二列

2.统计网络连接状态

总结：

grep、sed 和 awk是在日常工作中必不可少的操作命令，需要重点去掌握，而正则表达式，是实现文本高效处理的重要组成部分

命令名称	主要功能
grep	根据正则表达式搜索文件内容，并打印匹配行。
sed	对输入流（如文件或管道的输出）进行逐行编辑，可以实现查找、替换、删除、插入等多种操作。
awk	基于模式匹配对每一行数据进行处理，支持更复杂的条件判断和字段处理能力，通常用于结构化数据的处理。

你可能感兴趣的:(正则表达式)

jmeter获取返回json参数个数海纳百川_9dc7
我们在用jmeter做测试的时候，返回很多json数据，然后呢想要从中取出某个参数的数量，人工取数的情况下，会很繁琐。因此必须借助正则提取器。操作如下：配置线程组：然后配置正则表达式提取器：2转载：正则表达式提取器说明再用jmeter后置BeanShellPostProcessor3importcom.eclipsesource.json.*;importjava.util.regex.Match
linux正则表达式小黑要上天 linux RegEX linux 正则表达式运维
linux正则表达式，又名常规表达式，是通过一些特殊字符的排列，用以搜索、替换、删除一行或多行字符串。简而言之，linux正则表达式是用在字符串处理中的“表示式”。linux正则表达式并不是工具程序，而是一个字符串处理的标准依据，如果想要以正则表达式的方式处理字符串，就要使用支持正zhen则表达式的工具程序，这类工具程序很多，如：grep、awk、sed等。linux正则表达式对于系统管理员来说很
python 正则表达式断言_Python 之 RE（正则表达式）常用 jck????? python 正则表达式断言
正则表达式基础提取字符串语法说明例可匹配字符串.匹配除了换行符”\n”以外的任意字符a.bacb、adb、a2b、a~b\转义，将转义字符后面的一个字符改变成原来的意思a[b\.\\]cabc、a.c、a\c[]匹配括号内的任意字符a[b,c,d,e]fabd、acf、adf、aef预定义字符语法说明例可匹配字符串^以说明字符串开始^123123abc、123321、123zxc$以说明字符串结尾
web学习笔记（三十四） shan33__ 笔记学习笔记 javascript 原型模式正则表达式
目录1.面向对象的特征2.面向对象的继承方式3.正则表达式3.1如何创建正则表达式3.2边界符3.2[]方括号3.3正则表达式中相关的方法汇总3.4常用元字符含义3.5常用量词1.面向对象的特征封装性：就像是把东西放在一个密封的盒子里一样，只让外部使用者通过指定的接口来访问盒子里的东西，而不需要知道盒子里具体是怎么实现的。这样做可以保护内部数据，让代码更容易维护和重用。继承性：就像家族中的父子关系
Kafka主题二三事慢一点，细一点 Kafka kafka 分布式
客户端如果订阅了多次主题，则以最后一次为主，例如consumer.subscribe(Arrays.asList(topic1));consumer.subscribe(Arrays.asList(topic2));则订阅的只有topic2。消费者订阅主题是支持正则表达式，这样如果有新topic上线，并且匹配正则，则也会消费到这个新topic的内容，比如consumer.subscribe(Pat
Springboot(-) Quartz定时任务cron表达式详解 charles_lun Java菜鸟到老鸟的蜕变之路
目录前言正文1.cron表达式组成2.子表达式范围3.子表达式格式4.字符含义5.表达式例子结束语前言在做springboot整合Quartz的时候，看到指导手册里推荐用cron表达式，然后抱着试试看的态度，额，刚一上手，感觉又回到了正则表达式的恐惧之中，乱，晕，硬着头皮看，终于看完了，有了一定的理解，赶紧整理记录下来，方便自己查看，也方便新接触的同学理解。正文1.cron表达式组成cron表达式
开发技术-Java从字符串中提取小数 JustDI-CM Java开发小技术 java
目录1.前提正则表达式全解析+常用示例常用正则表达式合集，这一篇就够了！！Pattern和Matcher2.实现1.前提项目上请求第三方服务，其中有个字段为字符串和小数的混合，类似：武汉0.1333；北京10.25；其它地区110.1需要将其中的小数取出。技术积累：正则表达式全解析+常用示例常用正则表达式合集，这一篇就够了！！Pattern和Matcher2.实现Stringstr="武汉0.13
正则表达式总结（校验数字,字符串及特殊需求的表达式） polaris9z JavaScript javascript
定义：正则表达式(regularexpression)描述了一种字符串匹配的模式（pattern），可以用来检查一个串是否含有某种子串、将匹配的子串替换或者从某个串中取出符合某个条件的子串等。正则表达式的组件可以是单个的字符、字符集合、字符范围、字符间的选择或者所有这些组件的任意组合。正则表达式是由普通字符（例如字符a到z）以及特殊字符（称为"元字符"）组成的文字模式。模式描述在搜索文本时要匹配的
vim搜索和替换 ketaotech vim vim chrome 编辑器
目录正则表达式1.特殊字符2.字符类(character-classes)3.规则4.交替和分组5.量词(quantifier)和重数(multi)贪婪模式(greedy)非贪婪模式(non-greedy)6.魔法(magic)详解6.1.基本魔法(magic)6.2.无魔法(nomagic)6.3.深度魔法(verymagic)7.正则表达式举例7.1.精确匹配单词7.2.变量,方法或类的重命名
python入门第十一天正则 xinmin
正则表达式普通字符：importre#完全匹配r=re.findall('xin',"wewqefrexinminwdwwrffdasw")print(r)#['xin']元字符：#.:通配符（代指一个字符）r=re.findall('xin.i',"wewqefrexinminwdwwrffdasw")print(r)#['xinmi']#^:匹配开头r=re.findall('^xin',"x
第二十二查询、检索、搜索 smallswan Rust七十二变开发语言
查询在计算机中十分广泛的应用。在字符串或者文本文件中查询关键字，模式匹配，正则表达式。在数组、树、哈希表等数据结构中查询指定数据在数据库中查询在海量非结构文件中查询搜索引擎模式匹配模式匹配是数据结构中字符串的一种基本运算，给定一个子串，要求在某个字符串中找出与该子串相同的所有子串，这就是模式匹配。模式匹配经典问题：strStr()DFA算法usestd::collections::BTreeSet
双非二本找实习前的准备day5 广州悠扬 leetcode java 数据结构算法职场和发展
学习目标：每天2-3到简单sql（刷完即止），每天复习代码随想录上的题目3道算法（时间充足可以继续），今天的八股背少一点，MySQL和Redis各1-2道好了，主攻复习是java基础今日碎碎念：1）今天刷SQL以及复习Java基础，就不写算法了，另外就是复习之前的八股力扣刷题SQL力扣1873：1873.计算特殊奖金解答思路：1）本题练习的主要是如何使用正则表达式以及在查询中使用If，当然，也可以
正则中的\d与\D、\w与\W、\s与\S各代表什么意思 A 风 javascript es6
正则中的\d与\D、\w与\W、\s与\S各代表什么意思\D：表示非数字\w：表示一个字[0－9a-zA-Z_]\W：表示除[0－9a-zA-Z_]之外的字符\s：表示一个空白字符（空格，tab，换页符等）\S：表示一个非空白字符这些都是正则中能够表示一类字符的原子/*$以什么结尾*//*下面的正则表达式匹配0-9的数字里面不能是字符串只能是数字必须是1-5位*/constad=/^[0-9]{1
前端（十八）要你何用杀了算了
1.正则正则//校验QQ/*//JS的方式比较麻烦functioncheckQQ(qq){varflag=true;//默认符合要求if(qq.length>=5&&qq.length2.正则表达式正则表达式//匹配字母a，i表示忽略大小写，g表示全文检索varre=newRegExp('a','ig');varre2=/a/ig;varstr='abc';//调用test方法进行匹配，匹配成功返
hyperscan库接口的使用飞翔公园11223 数据库 oracle mysql c++
Hyperscan库的使用主要涉及到几个关键步骤：编译正则表达式、创建数据库、执行匹配操作以及处理匹配结果。下面我将详细介绍这些步骤中涉及的主要接口和它们的使用方法。1.编译正则表达式在使用Hyperscan进行匹配之前，首先需要将正则表达式编译成Hyperscan能够理解的格式。这一步骤通过hs_compile或hs_compile_multi函数完成。hs_compilehs_error_th
爬虫技术抓取网站数据 Bearjumpingcandy 爬虫
爬虫技术是一种自动化获取网站数据的技术，它可以模拟人类浏览器的行为，访问网页并提取所需的信息。以下是爬虫技术抓取网站数据的一般步骤：发起HTTP请求：爬虫首先会发送HTTP请求到目标网站，获取网页的内容。解析HTML：获取到网页内容后，爬虫会使用HTML解析器解析HTML文档，提取出需要的数据。数据提取：通过使用XPath、CSS选择器或正则表达式等工具，爬虫可以从HTML文档中提取出所需的数据，
Python中re模块的使用拉钩掉头 python 开发语言
在Python中，处理正则表达式的模块是re模块。通过re模块，可以使用正则表达式来进行字符串的匹配、查找、替换等操作。执行效率特别高，可读性不强。1.方法match从头开始匹配返回Match或者Noneimportrer=re.match(".\w{10}","Hello_worldhiworld",re.I)print(type(r),r)ifr:print(r.group())search匹
【MySQL】查询varchar类型字段的内容不包含数字内容忆白笙 MySQL mysql 数据库
问题描述某些情况下需要查询varchar类型字段的内容为特殊内容时SQL语句主要是通过NOTREGEXP和正则表达式来实现，也可以调整正则表达式满足不同效果SELECT*FROMyour_tableWHEREyour_columnNOTREGEXP'^[0-9]+$';
oracle使用正则表达式REGEXP_SUBSTR提取XML里面的内容 qq_39255840 oracle 正则表达式 xml
使用extract(XMLTYPE(XML),‘xphat’).getstringval()提取XML，长度过长存在报错ORA-06502:PL/SQL:数字或值错误:characterstringbuffertoosmallORA-06512:在“SYS.XMLTYPE”,line169并且存在速度较慢等问题。正则提取XML，由于这边的XML文本中Name标签，接着的标签即为Value的值，故这
余弦相似度算法和IntelliScraper python人工智能
场景当时，我说要开发一个HSipder，开发完毕的时候，我发现不太智能，通过正则表达式拿过来的相似数据实际上也不太ok，但是后面我在接触机器学习的时候听闻了余弦相似度算法，当时用他爬了一些网页，结果是很ok的，于是我把HSipder项目拆了拆加入了余弦算法，我发现准确度上去了一个维度。很Nice，随机我将其发布到pypi库，并且开源，命名为IntelliScraper，意思是智能爬，也有人工智能的
C#知识点-17（正则表达式）土豆下土前端
正则表达式概念：正则表达式是用来进行文本处理的技术，是语言无关的，在几乎所有语言中都有实现元字符：1、.：匹配除\n之外的任何单个字符。例如正则表达式“b.g”能匹配如下字符串：“big”、“bug”、“bg”，但是不匹配“buug”，“b..g”可以匹配“buug”。2、[]：字符组，匹配括号中的任何一个字符（范围,字符集合）。例如正则表达式“b[aui]g”匹配bug、big和bag，但是不匹
ES6 - Day4 - 正则表达式今天会下雨吗 es6 字符串正则表达式 js javascript
目标能够说出正则表达式的作用能够写出简单的正则表达式能够使用正则表达式对表单进行验证能够使用正则表达式替换内容1正则表达式概述1.1什么是正则表达式正则表达式（RegularExpression）是用于匹配字符串中字符组合的模式。在JavaScript中，正则表达式也是对象。正则表通常被用来检索、替换那些符合某个模式（规则）的文本，例如验证表单：用户名表单只能输入英文字母、数字或者下划线，昵称输入
Kotlin基础——DSL 松仔log #Kotlin基础 kotlin 开发语言 android
DSL（领域特定语言）常见的DSL就是SQL和正则表达式，用于操作数据库和文本字符串，KotlinDSL通常为嵌套的Lambda表达式或链式方法，如https://github.com/gradle/gradle-script-kotlin用于构建Gradle脚本https://github.com/JetBrains/Exposed用于操作数据库https://github.com/Kotlin
Python笔记五之正则表达式后端python正则表达式
本文首发于公众号：Hunter后端原文链接：Python笔记五之正则表达式这一篇笔记介绍在Python里使用正则表达式。正则表达式，RegularExpression，可用于在一个目标字符串里对于指定模式的字符进行查找、替换、分割等操作。比如，判断某个字符串里是否都是数字，或者是否包含指定字符串，又或者更直接的例子是判断电话号码或者邮箱是否合法等。这一篇笔记里，我们将先介绍一个正则表达式的函数，并
利用正则表达式判断字符串是否只有小写字母或数字。 qq_59812342 Python 正则表达式 python
importres=input()list=re.findall(r'[0-9a-z]',s)iflen(list)==len(s):print('Y')else:print('N')
Java Pattern正则匹配，并获取匹配内容 @航空母舰 java 开发语言
java.util.regex包主要包括以下三个类：Pattern类：pattern对象是一个正则表达式的编译表示。Pattern类没有公共构造方法。要创建一个Pattern对象，你必须首先调用其公共静态编译方法，它返回一个Pattern对象。该方法接受一个正则表达式作为它的第一个参数。Matcher类：Matcher对象是对输入字符串进行解释和匹配操作的引擎。与Pattern类一样，Matche
c# 目录文件夹去掉中文李建军 C#
核心思想如下Regexreg=newRegex(@"[\u4e00-\u9fa5]");//正则表达式可以用来判断字符串中是否包含中文str=reg.Replace(str,"");//将中文字符替换成空字段destFolderPath=fsinfo.FullName.Replace(fsinfo.Name,"")+str;//获取上级目录+新文件名if(Regex.IsMatch(fsinfo.
reDOS攻击补天阁 android ReDos攻击 web安全正则表达式
正则表达式回溯：当涉及到正则表达式的回溯时，让我们来看一个具体的例子。考虑以下正则表达式模式a+b，其中a+表示匹配一个或多个连续的字符"a"，b表示匹配字符"b"。现在，假设有一个输入字符串为"aaab"，我们试图将这个字符串与模式进行匹配。以下是回溯的过程：引擎开始尝试匹配a+，它找到了第一个"a"。然后引擎尝试匹配更多的"a"，发现了两个额外的"a"。此时，引擎已经匹配了三个"a"，接下来它
飞浆：零代码创建Prompt应用实战课程笔记【持续更新中】 AI一天，人间一年 prompt 笔记
飞浆：零代码创建Prompt应用实战课Prompt基本定义驱动大模型进行表达的文本描述例1：画一幅画，呆萌的小猫躺在大泡泡中，可爱温柔，动漫风格，暖系色调，居中，面对镜头，虚拟引擎，棉花糖质感，光线追踪，机制细节，质感细腻，8K，超高清，超广角，极致清晰，丁达尔效应例2：请生成一张统计图，内容为：橘子10个，苹果20个，梨15个，猕猴桃10个例3：帮我撰写一个验证邮箱的正则表达式Prompt入门公
[转载] Python_正则表达式匹配Word文档 ey_snail
参考链接：Python中的正则表达式2(搜索，匹配和查找全部)使用正则表达式匹配Word文档中的所有字符1、原文内容如下：2、期望得到的结果：3、源码：//fromdocximportDocumentimportrepattern=re.compile("\d{6}[\u4e00-\u9fff]+")#正则表达式#pattern=re.compile("\d{6}[^A-Za-z0-9\!\%\[
java杨辉三角 3213213333332132 java基础
package com.algorithm; /** * @Description 杨辉三角 * @author FuJianyong * 2015-1-22上午10:10:59 */ public class YangHui { public static void main(String[] args) { //初始化二维数组长度 int[][] y
《大话重构》之大布局的辛酸历史白糖_ 重构
《大话重构》中提到“大布局你伤不起”，如果企图重构一个陈旧的大型系统是有非常大的风险，重构不是想象中那么简单。我目前所在公司正好对产品做了一次“大布局重构”，下面我就分享这个“大布局”项目经验给大家。背景公司专注于企业级管理产品软件，企业有大中小之分，在2000年初公司用JSP/Servlet开发了一套针对中
电驴链接在线视频播放源码 dubinwei 源码电驴播放器视频 ed2k
本项目是个搜索电驴（ed2k）链接的应用,借助于磁力视频播放器（官网： http://loveandroid.duapp.com/ 开放平台），可以实现在线播放视频，也可以用迅雷或者其他下载工具下载。项目源码： http://git.oschina.net/svo/Emule,动态更新。也可从附件中下载。项目源码依赖于两个库项目，库项目一链接： http://git.oschina.
Javascript中函数的toString()方法周凡杨 JavaScript js toString function object
简述 The toString() method returns a string representing the source code of the function. 简译之，Javascript的toString()方法返回一个代表函数源代码的字符串。句法 function.
struts处理自定义异常 g21121 struts
很多时候我们会用到自定义异常来表示特定的错误情况，自定义异常比较简单，只要分清是运行时异常还是非运行时异常即可，运行时异常不需要捕获，继承自RuntimeException，是由容器自己抛出，例如空指针异常。非运行时异常继承自Exception，在抛出后需要捕获，例如文件未找到异常。此处我们用的是非运行时异常，首先定义一个异常LoginException: /** * 类描述：登录相
Linux中find常见用法示例 510888780 linux
Linux中find常见用法示例 ·find path -option [ -print ] [ -exec -ok command ] {} \; find命令的参数；
SpringMVC的各种参数绑定方式 Harry642 springMVC 绑定表单
1. 基本数据类型(以int为例，其他类似)： Controller代码： @RequestMapping("saysth.do") public void test(int count) { } 表单代码： <form action="saysth.do" method="post&q
Java 获取Oracle ROWID aijuans java oracle
A ROWID is an identification tag unique for each row of an Oracle Database table. The ROWID can be thought of as a virtual column, containing the ID for each row. The oracle.sql.ROWID class i
java获取方法的参数名 antlove java jdk parameter method reflect
reflect.ClassInformationUtil.java package reflect; import javassist.ClassPool; import javassist.CtClass; import javassist.CtMethod; import javassist.Modifier; import javassist.bytecode.CodeAtt
JAVA正则表达式匹配查找替换提取操作百合不是茶 java 正则表达式替换提取查找
正则表达式的查找;主要是用到String类中的split(); String str; str.split();方法中传入按照什么规则截取,返回一个String数组常见的截取规则: str.split("\\.")按照.来截取 str.
Java中equals()与hashCode()方法详解 bijian1013 java set equals()hashCode()
一.equals()方法详解 equals()方法在object类中定义如下： public boolean equals(Object obj) { return (this == obj); } 很明显是对两个对象的地址值进行的比较（即比较引用是否相同）。但是我们知道，String 、Math、I
精通Oracle10编程SQL(4)使用SQL语句 bijian1013 oracle 数据库 plsql
--工资级别表 create table SALGRADE ( GRADE NUMBER(10), LOSAL NUMBER(10,2), HISAL NUMBER(10,2) ) insert into SALGRADE values(1,0,100); insert into SALGRADE values(2,100,200); inser
【Nginx二】Nginx作为静态文件HTTP服务器 bit1129 HTTP服务器
Nginx作为静态文件HTTP服务器在本地系统中创建/data/www目录，存放html文件(包括index.html) 创建/data/images目录，存放imags图片在主配置文件中添加http指令 http { server { listen 80; server_name
kafka获得最新partition offset blackproof kafka partition offset 最新
kafka获得partition下标，需要用到kafka的simpleconsumer import java.util.ArrayList; import java.util.Collections; import java.util.Date; import java.util.HashMap; import java.util.List; import java.
centos 7安装docker两种方式 ronin47
第一种是采用yum 方式 yum install -y docker
java-60-在O(1)时间删除链表结点 bylijinnan java
public class DeleteNode_O1_Time { /** * Q 60 在O(1)时间删除链表结点 * 给定链表的头指针和一个结点指针(!!)，在O(1)时间删除该结点 * * Assume the list is: * head->...->nodeToDelete->mNode->nNode->..
nginx利用proxy_cache来缓存文件 cfyme cache
user zhangy users; worker_processes 10; error_log /var/vlogs/nginx_error.log crit; pid /var/vlogs/nginx.pid; #Specifies the value for ma
[JWFD开源工作流]JWFD嵌入式语法分析器负号的使用问题 comsci 嵌入式
假如我们需要用JWFD的语法分析模块定义一个带负号的方程式，直接在方程式之前添加负号是不正确的，而必须这样做： string str01 = "a=3.14;b=2.71;c=0;c-((a*a)+(b*b))" 定义一个0整数c,然后用这个整数c去
如何集成支付宝官方文档 dai_lm android
官方文档下载地址 https://b.alipay.com/order/productDetail.htm?productId=2012120700377310&tabId=4#ps-tabinfo-hash 集成的必要条件 1. 需要有自己的Server接收支付宝的消息 2. 需要先制作app，然后提交支付宝审核，通过后才能集成调试的时候估计会真的扣款，请注意
应该在什么时候使用Hadoop datamachine hadoop
原帖地址：http://blog.chinaunix.net/uid-301743-id-3925358.html 存档，某些观点与我不谋而合，过度技术化不可取，且hadoop并非万能。 --------------------------------------------万能的分割线-------------------------------- 有人问我，“你在大数据和Hado
在GridView中对于有外键的字段使用关联模型进行搜索和排序 dcj3sjt126com yii
在GridView中使用关联模型进行搜索和排序首先我们有两个模型它们直接有关联: class Author extends CActiveRecord { ... } class Post extends CActiveRecord { ... function relations() { return array( '
使用NSString 的格式化大全 dcj3sjt126com Objective-C
格式定义The format specifiers supported by the NSString formatting methods and CFString formatting functions follow the IEEE printf specification; the specifiers are summarized in Table 1. Note that you c
使用activeX插件对象object滚动有重影蕃薯耀 activeX插件滚动有重影
使用activeX插件对象object滚动有重影 <object style="width:0;" id="abc" classid="CLSID:D3E3970F-2927-9680-BBB4-5D0889909DF6" codebase="activex/OAX339.CAB#
SpringMVC4零配置 hanqunfeng springmvc4
基于Servlet3.0规范和SpringMVC4注解式配置方式，实现零xml配置，弄了个小demo，供交流讨论。项目说明如下： 1.db.sql是项目中用到的表，数据库使用的是oracle11g 2.该项目使用mvn进行管理，私服为自搭建nexus,项目只用到一个第三方 jar，就是oracle的驱动； 3.默认项目为零配置启动，如果需要更改启动方式，请
《开源框架那点事儿16》：缓存相关代码的演变 j2eetop 开源框架
问题引入上次我参与某个大型项目的优化工作，由于系统要求有比较高的TPS，因此就免不了要使用缓冲。该项目中用的缓冲比较多，有MemCache，有Redis，有的还需要提供二级缓冲，也就是说应用服务器这层也可以设置一些缓冲。当然去看相关实现代代码的时候，大致是下面的样子。 [java] view plain copy print ? public vo
AngularJS浅析 kvhur JavaScript
概念 AngularJS is a structural framework for dynamic web apps. 了解更多详情请见原文链接：http://www.gbtags.com/gb/share/5726.htm Directive 扩展html，给html添加声明语句，以便实现自己的需求。对于页面中html元素以ng为前缀的属性名称，ng是angular的命名空间
架构师之jdk的bug排查(一)---------------split的点号陷阱 nannan408 split
1.前言. jdk1.6的lang包的split方法是有bug的,它不能有效识别A.b.c这种类型,导致截取长度始终是0.而对于其他字符,则无此问题.不知道官方有没有修复这个bug. 2.代码 String[] paths = "object.object2.prop11".split("'"); System.ou
如何对10亿数据量级的mongoDB作高效的全表扫描 quentinXXZ mongodb
本文链接: http://quentinXXZ.iteye.com/blog/2149440 一、正常情况下，不应该有这种需求首先，大家应该有个概念，标题中的这个问题，在大多情况下是一个伪命题，不应该被提出来。要知道，对于一般较大数据量的数据库，全表查询，这种操作一般情况下是不应该出现的，在做正常查询的时候，如果是范围查询，你至少应该要加上limit。说一下，
C语言算法之水仙花数 qiufeihu c 算法
/** * 水仙花数 */ #include <stdio.h> #define N 10 int main() { int x,y,z; for(x=1;x<=N;x++) for(y=0;y<=N;y++) for(z=0;z<=N;z++) if(x*100+y*10+z == x*x*x
JSP指令 wyzuomumu jsp
jsp指令的一般语法格式： <%@ 指令名属性 =”值 ” %> 常用的三种指令： page,include,taglib page指令语法形式： <%@ page 属性 1=”值 1” 属性 2=”值 2”%> include指令语法形式： <%@include file=”relative url”%> (jsp可以通过 include