正则表达式专项测试
考察知识点
- re模块:match、search、findall、finditer、sub、split
- 正则语法:字符类、量词、定位符、转义字符
- 分组与捕获:普通分组、命名分组、非捕获分组
- 替换操作:sub函数、替换字符串、回调替换
re.IGNORECASE标志使匹配忽略大小写,re.MULTILINE使^和$匹配每行的开头和结尾,re.DOTALL使.匹配包括换行符在内的所有字符。
re.sub(pattern, replacement, string)用于字符串替换,将匹配的内容替换为指定字符串,返回替换后的新字符串。
贪婪量词(、+、{n,})尽可能匹配更多字符,非贪婪量词(?、+?、{n,}?)尽可能匹配更少字符,在量词后加?即可转为非贪婪模式。
正则表达式中\d匹配数字,\w匹配字母数字下划线,.匹配任意字符(除换行),*匹配0次或多次,+匹配1次或多次。
正则表达式中的分组使用括号()定义,可以通过group()方法获取分组内容,group(0)返回整个匹配,group(1)返回第一个分组。
Python的re模块提供了正则表达式匹配功能,match()从字符串开头匹配,search()在字符串中搜索匹配,findall()返回所有匹配结果。
re.compile()可以预先编译正则表达式,返回Pattern对象,多次使用同一模式时编译可以提高性能。
执行re.findall(r'hello', 'Hello World hello', re.IGNORECASE)的结果是:
编译后的Pattern对象可以直接使用以下哪些方法?
正则表达式a+匹配的是:
执行以下代码后,groups()返回什么?
m = re.search(r'(\w+)@(\w+)\.(\w+)', 'test@example.com')
执行re.findall(r'<div.*?</div>', '<div>a</div><div>b</div>')的结果是:
对字符串'Python is great',执行re.match('is', ...)的结果是:
执行re.sub(r'\d+', 'NUM', 'a1b23c456')的结果是:
re.____________()预编译正则表达式,返回____________对象。编译后的Pattern可以直接调用____________、search、findall、sub等方法。编译可以提高性能,避免重复解析模式。编译时可以指定标志参数。
\d匹配____________,\w匹配____________,\s匹配____________字符。.匹配任意字符(除换行)。*匹配0次或多次,+匹配1次或多次,?匹配0次或1次。[]定义字符类,^表示开头或取反。
re.____________(或re.I)使匹配____________。re.____________(或re.M)使^和$匹配每行的开头结尾。re.DOTALL(或re.S)使.匹配包括换行在内的所有字符。多个标志用|符号组合。
分组用____________()定义,group____________返回整个匹配,group____________返回第一个分组。groups()返回所有分组组成的元组。命名分组用(?Ppattern)语法,通过group('name')获取。反向引用用\n(数字)或(?P=name)。
re.____________()从字符串____________匹配,不匹配返回____________。re.search()在字符串任意位置搜索第一个匹配。re.findall()返回所有匹配结果的列表。Match对象的group()方法返回匹配内容。
贪婪量词____________匹配字符,如.*匹配到最后。非贪婪量词在量词后加____________,如____________,尽可能少匹配字符。非贪婪适合提取最短的匹配,如HTML标签。贪婪适合匹配最长的连续内容。