python实现的正则表达式功能入门教程【经典】

2025-03-02 07:14:15

本文讲述了python实现的正则表达式功能。分享给大家供大家参考，具体如下：

前文：

首先，什么叫正则表达式（Regular Expression）？

例如我们要判断字符串"adi_e32fv,Ls"里面是否含有子串"e32f"，又例如我们在一个含百万个姓名的txt文件中找姓“王”，名字以“五”结尾的名字，然后打印出来。结果为：“王五”、“王小五”、“王大五”、“王小小五”……

以前我们是使用字符串函数来查找的，但是代码实现起来会很复杂。如今用正则表达式只需要一句 re.findall('王.*？五',txt1) 就可以了！正则表达式是写网络爬虫的最基本的知识，可以用正则表达式在html中搜集满足某些字串要求的网址。下面是个人对正则表达式基础知识的一些总结。

（操作环境：32位Win8系统，运行工具：python2.7.9+Eclipse.）

正文：

1、首先要导入python的re模块。

2、元字符 . ^ $ * + ? {} [] \ | ()

re模块中的findall（str1，str2）方法返回字串str2中匹配str1格式的字串。例如在字符串'dit dot det,dct dit dot'中匹配'dit'结果为：

str1 = 'dit dot det,dct dit dot'
print re.findall('dit',str1)

结果：

['dit', 'dit']

|作用：'dit|dct'表示dit或者dct。

str1 = 'dit dot det,dct dit dot'
print re.findall('dit|dct',str1)

结果：

['dit', 'dct', 'dit']

[]作用：[ic]表示i或c，例如'd[ic]t'表示dit和dct两者，和'dit|dct'等价：

str1 = 'dit dot det,dct dit dot'
print re.findall('d[ic]t',str1)

结果：

['dit', 'dct', 'dit']

^作用一：[^ic]中^表示否定，即除了i和c：

str1 = 'dit dot det,dct dit dot'
print re.findall('d[^ic]t',str1)

结果：

['dot', 'det', 'dot']

^作用二：^dit表示子串dit在开头位置，而dct不是在开头：

str1 = 'dit dot det,dct dit dot'
print re.findall('^dit',str1)
print re.findall('^dct',str1)

结果：

['dit'][]

$作用：dot$表示子串dot要在末尾位置，而dct不是在末尾：

str1 = 'dit dot det,dct dit dot'
print re.findall('dot$',str1)
print re.findall('dct$',str1)

结果：

['dot'][]

.作用：d.t表示d与t之间省略了一个任意字符：

str1 = 'dit dot det,dct dit dot'
print re.findall('d.t',str1)

结果：

['dit', 'dot', 'det', 'dct', 'dit', 'dot']

+作用：di+t表示d与t之间省略了一个或多个'i'：

str1 = 'd dt dit diit det'
print re.findall('d.+t',str1)

结果：

['dit', 'diit']

*作用：di*t表示d与t之间省略了零个至多个'i'：

str1 = 'd dt dit diit det'
print re.findall('d.*t',str1)

结果：

['dt', 'dit', 'diit']

经常，'.'和'+'或者'*'搭配使用。'.+'表示省略了一个至多个任意元素，'.*'表示省略了零个至多个任意元素：

str1 = 'd dt dit diit det'
print re.findall('d.+t',str1)
print re.findall('d.*t',str1)

结果：

['d dt dit diit det']['d dt dit diit det']

？作用一：看.+的匹配结果，'dit'、'dot'也满足'd.+t'的匹配条件，而输出的却是满足匹配条件的最长子串'dit dot det,dct dit dot'，这个叫贪婪匹配。如果要输出最短的匹配字串，只需在'+'后面加上'？'：（注：对于'*'也是一样，只需在'*'后面加上'？'）

str1 = 'd dt dit diit det'
print re.findall('d.+?t',str1)

结果：

['dit', 'dot', 'det', 'dct', 'dit', 'dot']

？作用二：di?t表示i可有可无，即dt、dit都满足匹配条件：

str1 = 'd dt dit diit det'
print re.findall('di?t',str1)

结果：

['dt', 'dit']

{}作用一：di{n}t表示d和t之间有n个'i'：

str1 = 'dt dit diit diiit diiiit'
print re.findall('di{2}t',str1)

结果：

['diit']

{}作用二：di{n,m}t表示d和t之间有n到m个'i'：

str1 = 'dt dit diit diiit diiiit'
print re.findall('di{1,3}t',str1)

结果：

['dit', 'diit', 'diiit']

其中，n和m都是可以省略的。{n,}表示n个到任意个；{,m}表示0个到m个；{,}表示任意个，和'*'功能一样：

str1 = 'dt dit diit diiit diiiit'
print re.findall('di{1,}t',str1)
print re.findall('di{,3}t',str1)
print re.findall('di{,}t',str1)

结果：

['dit', 'diit', 'diiit', 'diiiit']
   ['dt', 'dit', 'diit', 'diiit']
   ['dt', 'dit', 'diit', 'diiit', 'diiiit']

\作用一：取消元字符，变成转义字符：

str1 = '^abc ^abc'
print re.findall('^abc',str1)
print re.findall('\^abc',str1)

结果：

[]['^abc', '^abc']

\作用二：预定义字符

str1 = '12 abc 345 efgh'
print re.findall('\d+',str1)
print re.findall('\w+',str1)

结果：

['12', '345']
   ['12', 'abc', '345', 'efgh']

()作用：在匹配字符串后，只输出匹配字串'()'里面的内容：

str1 = '12abcd34'
print re.findall('12abcd34',str1)
print re.findall('1(2a)bcd34',str1)
print re.findall('1(2a)bc(d3)4',str1)

结果：

['12abcd34']
   ['2a']
   [('2a', 'd3')]

3、re模块里的主要方法：findall()、finditer()、match()、search()、compile()、split()、sub()、subn()。

re.findall(pattern,string,flags = 0)

作用：在string中从左往右搜索与pattern匹配的字串，结果以list形式返回。

str1 = 'ab cd'
print re.findall('\w+',str1)

结果：['ab', 'cd']

re.finditer(pattern,string,flags = 0)

作用：其功能与re.findall相同，但结果以迭代器的形式返回。

str1 = 'ab cd'
iter1 = re.finditer('\w+',str1)
for a in iter1:
  print a.group(),a.span()

结果：

ab (0, 2)
cd (3, 5)

（注：a.group()返回满足匹配调节的字串，a.span()返回字串的起始位置和末尾位置）

re.search(pattern,string,flags = 0)

作用：在string中从左往右搜索与pattern匹配的字串，无匹配结果则返回None，否则返回一个search实例。

str1 = 'ab cd'
result = re.search('cd',str1)
if result == None:
  print 'None'
else:
  print result.group(),result.start(),result.end()

结果：cd 3 5

re.match(pattern,string,flags = 0)

作用：判断string的头部是否与pattern匹配，是则返回match实例，否则返回None。

str1 = 'ab cd'
result = re.match('cd',str1)
if result == None:
  print 'None'
else:
  print result.group(),result.start(),result.end()

结果：None

re.compile(pattern,flags = 0)

作用：对匹配格式pattern进行编译，返回一个实例对象。对正则表达式先编译，可以大幅提高匹配速度。

str1 = 'ab cd'
pre = re.compile('ab')
print pre.findall(str1)

结果：['ab']

re.split(pattern,string,maxsplit = 0,flags = 0)

作用：在string匹配pattern的时候做分割：

str1 = 'ab.c.de'
str2 = '12+34-56*78/90'
print re.split('\.',str1)
print re.split('[\+\-\*/]',str2)

结果：

['ab', 'c', 'de']
['12', '34', '56', '78', '90']

re.sub(pattern,repl,string,count = 0,flags = 0)

作用：在string当中把满足pattern正则的字串替换成repl：

str1 = 'abcde'
print re.sub('bc','123',str1)

结果：a123de

re.subn(pattern,repl,string,count = 0,flags = 0)

作用：其功能与re.sub()相同，但返回的结果多了一个数字，代表替换了多少次

str1 = 'abcdebce'
print re.subn('bc','123',str1)

结果：('a123de123e', 2)

PS：这里再为大家提供2款非常方便的正则表达式工具供大家参考使用：

JavaScript正则表达式在线测试工具：
http://tools.jb51.net/regex/javascript

正则表达式在线生成工具：
http://tools.jb51.net/regex/create_reg

更多关于Python相关内容可查看本站专题：《Python正则表达式用法总结》、《Python数据结构与算法教程》、《Python Socket编程技巧总结》、《Python函数使用技巧总结》、《Python字符串操作技巧汇总》、《Python入门与进阶经典教程》及《Python文件与目录操作技巧汇总》

希望本文所述对大家Python程序设计有所帮助。

Python删除Java源文件中全部注释的实现方法

本文实例讲述了Python删除Java源文件中全部注释的实现方法.分享给大家供大家参考,具体如下: 同事想删除一个Java项目中的全部注释,让我帮忙想想办法. 没找不到合适工具,就写了这个脚本,遍历指定目录,查找*.java文件,删除其中/* */之间,及// 至行末的内容. (用之前要改改其中的路径): #!D:\Python32 # 过滤JAVA程序中的注释 # 如果字符串中有注释符号的话会有问题. import os import re import io # 改这个目录!!! top_d
Python中的多行注释文档编写风格汇总

什么是docstring 在软件工程中,其实编码所占的部分是非常小的,大多是其它的事情,比如写文档.文档是沟通的工具. 在Python中,比较推崇在代码中写文档,代码即文档,比较方便,容易维护,直观,一致. 代码写完,文档也出来了.其实Markdown也差不多这种思想,文本写完,排版也完成了. 看看PEP 0257中对docstring的定义: A docstring is a string literal that occurs as the first statement in a modu
python正则表达式中的括号匹配问题

问题: m = re.findall('[0-9]*4[0-9]*', '[4]') 可以匹配到4. m = re.findall('([0-9])*4([0-9])*', '[4]') 匹配不到4. 这是为什么呢?PS,这个是一个简化的说明,我要用的正则比这个复杂,所以要用到(),表示一个序列的匹配. 补充一点,我放在notepad++中用的时候,两种写法都能匹配出来,不知道为什么python中就不行了. 答案: python的正则中用()会进行匹配,所以返回结果是['',''],就是两个()
Python文件去除注释的方法

本文实例讲述了Python文件去除注释的方法.分享给大家供大家参考.具体实现方法如下: #!/usr/bin/python # -*- coding: GBK -*- #writer:xmnathan #py文件去注释 import re import os import ConfigParser Python='CleanNote' def ReadIni(path,section,option):#文件路径,章节,关键词 #读取ini cf=ConfigParser.ConfigParser
Python 匹配任意字符（包括换行符）的正则表达式写法

想使用正则表达式来获取一段文本中的任意字符,写出如下匹配规则: (.*) 结果运行之后才发现,无法获得换行之后的文本.于是查了一下手册,才发现正则表达式中,"."(点符号)匹配的是除了换行符"\n"以外的所有字符. 以下为正确的正则表达式匹配规则: ([\s\S]*) 同时,也可以用 "([\d\D]*)"."([\w\W]*)" 来表示. Web技术之家_www.waweb.cn 在文本文件里, 这个表达式可以匹配所有的英文
Python实现多行注释的另类方法

Python程序的注释感觉很不合群,对于习惯了使用/**/多行注释的人来说,到Python中只能使用#号进行单行注释很痛苦. 复制代码代码如下: # 这里是单行注释 # a = 50 # b = 10 # c = 10 其实我们可以通过多行文本定义的格式实现多行注释: 复制代码代码如下: """ # 这里是多行注释 a = 50 b = 10 c = 10 """ 这个方法感觉还不错,跟/**/多行注释用起来没
Python实现删除Android工程中的冗余字符串

Android提供了一套很方便的进行资源(语言)国际化机制,为了更好地支持多语言,很多工程的翻译往往会放到类似crowdin这样的平台上.资源是全了,但是还是会有一些问题. 哪些问题以下使用一些语言进行举例.其中values为工程默认的资源. 1.某语言的资源和某语言限定区域的资源之间.如values-fr-rCA存在于values-fr相同的字符串,这种表现最为严重. 2.某语言的资源和默认的资源之间.values-fr存在与values相同的字符串,可能原因是由于values-fr存在未翻
Python正则表达式匹配HTML页面编码

html页面一般都会指定一个编码,如何获取到是处理html页面的第一步,因为错误的编码必然带来后面处理的问题.这里我用python的正则表达式写了个: import re a = ["<meta http-equiv="Content-Type" content="text/html; charset=utf-8" />", '<meta http-equiv=Content-Type content="text/ht
Python中使用strip()方法删除字符串中空格的教程

strip()方法返回所有字符从开始及字符串的末尾(默认空格字符)被去除后的字符串的一个副本. 语法以下是strip()方法的语法: str.strip([chars]); 参数 chars -- 字符-从开始或结束的字符串被删除去除. 返回值此方法返回所有字符从开始及字符串的末尾(默认空格字符)被去除后的字符串的一个副本. 例子下面的例子显示了strip()方法的使用. #!/usr/bin/python str = "0000000this is string example....w
Python基于正则表达式实现检查文件内容的方法【文件检索】

本文实例讲述了Python基于正则表达式实现检查文件内容的方法分享给大家供大家参考,具体如下: 这个是之前就在学python,欣赏python的小巧但是功能强大,是连电池都自带的语言.平时工作中用Java ,觉得python在日常生活中比java用处要大,首先语法没那么复杂,特别是io的操作,java里要写一大坨没关的代码.还有就是不用编译,而且linux系统默认都会自带. 这次遇到的问题是工作当中想要迁移一个系统中的一个模块,这个时候需要评估模块里的代码有没有对其他代码强依赖,就是有没有imp
Python使用中文正则表达式匹配指定中文字符串的方法示例

本文实例讲述了Python使用中文正则表达式匹配指定中文字符串的方法.分享给大家供大家参考,具体如下: 业务场景: 从中文字句中匹配出指定的中文子字符串 .这样的情况我在工作中遇到非常多, 特梳理总结如下. 难点: 处理GBK和utf8之类的字符编码, 同时正则匹配Pattern中包含汉字,要汉字正常发挥作用,必须非常谨慎.推荐最好统一为utf8编码,如果不是这种最优情况,也有酌情处理. 往往一个具有普适性的正则表达式会简化程序和代码的处理,使过程简洁和事半功倍,这往往是高手和菜鸟最显著的差别.

python实现的正则表达式功能入门教程【经典】

相关推荐

随机推荐