Python--詳解Python中re.sub


給出定義:

re.sub(pattern, repl, string, count=0, flags=0)

Return the string obtained by replacing the leftmost non-overlapping occurrences of pattern in string by the replacement repl. If the pattern isn’t found, string is returned unchanged. repl can be a string or a function; if it is a string, any backslash escapes in it are processed. That is, \n is converted to a single newline character, \r is converted to a carriage return, and so forth. Unknown escapes such as \j are left alone. Backreferences, such as \6, are replaced with the substring matched by group 6 in the pattern. For example:

>>> re.sub(r'def\s+([a-zA-Z_][a-zA-Z_0-9]*)\s*\(\s*\):',
... r'static PyObject*\npy_\1(void)\n{',
... 'def myfunc():')
'static PyObject*\npy_myfunc(void)\n{'
If repl is a function, it is called for every non-overlapping occurrence of pattern. The function takes a single match object argument, and returns the replacement string. For example:

>>> def dashrepl(matchobj):
... if matchobj.group(0) == '-': return ' '
... else: return '-'
>>> re.sub('-{1,2}', dashrepl, 'pro----gram-files')
'pro--gram files'
>>> re.sub(r'\sAND\s', ' & ', 'Baked Beans And Spam', flags=re.IGNORECASE)
'Baked Beans & Spam'
The pattern may be a string or an RE object.

The optional argument count is the maximum number of pattern occurrences to be replaced; count must be a non-negative integer. If omitted or zero, all occurrences will be replaced. Empty matches for the pattern are replaced only when not adjacent to a previous match, so sub('x*', '-', 'abc') returns '-a-b-c-'.

In addition to character escapes and backreferences as described above, \g<name> will use the substring matched by the group named name, as defined by the (?P<name>...) syntax. \g<number> uses the corresponding group number; \g<2> is therefore equivalent to \2, but isn’t ambiguous in a replacement such as \g<2>0. \20 would be interpreted as a reference to group 20, not a reference to group 2 followed by the literal character '0'. The backreference \g<0> substitutes in the entire substring matched by the RE.

Changed in version 2.7: Added the optional flags argument.

  


re.sub的功能

re是regular expression的所寫,表示正則表達式

sub是substitute的所寫,表示替換;

re.sub是個正則表達式方面的函數,用來實現通過正則表達式,實現比普通字符串的replace更加強大的替換功能;

舉個最簡單的例子:

如果輸入字符串是:

inputStr = "hello 111 world 111"
1
那么你可以通過

replacedStr = inputStr.replace("111", "222")
1
去換成

"hello 222 world 222"
1
但是,如果輸入字符串是:

inputStr = "hello 123 world 456"
1
而你是想把123和456,都換成222

(以及其他還有更多的復雜的情況的時候),

那么就沒法直接通過字符串的replace達到這一目的了。

就需要借助於re.sub,通過正則表達式,來實現這種相對復雜的字符串的替換:

replacedStr = re.sub("\d+", "222", inputStr)
1
當然,實際情況中,會有比這個例子更加復雜的,其他各種特殊情況,就只能通過此re.sub去實現如此復雜的替換的功能了。

所以,re.sub的含義,作用,功能就是:

對於輸入的一個字符串,利用正則表達式(的強大的字符串處理功能),去實現(相對復雜的)字符串替換處理,然后返回被替換后的字符串

其中re.sub還支持各種參數,比如count指定要替換的個數等等。

下面就是來詳細解釋其各個參數的含義。

re.sub的各個參數的詳細解釋

re.sub共有五個參數。

re.sub(pattern, repl, string, count=0, flags=0)

其中三個必選參數:pattern, repl, string

兩個可選參數:count, flags

第一個參數:pattern

pattern,表示正則中的模式字符串,這個沒太多要解釋的。

需要知道的是:

反斜杠加數字(\N),則對應着匹配的組(matched group)
比如\6,表示匹配前面pattern中的第6個group
意味着,pattern中,前面肯定是存在對應的,第6個group,然后你后面也才能去引用
比如,想要處理:

hello crifan, nihao crifan
1
且此處的,前后的crifan,肯定是一樣的。

而想要把整個這樣的字符串,換成crifanli

則就可以這樣的re.sub實現替換:

inputStr = "hello crifan, nihao crifan";
replacedStr = re.sub(r"hello (\w+), nihao \1", "crifanli", inputStr);
1
2
第二個參數:repl

repl,就是replacement,被替換,的字符串的意思。

repl可以是字符串,也可以是函數。

repl是字符串

如果repl是字符串的話,其中的任何反斜杠轉義字符,都會被處理的。

即:

\n:會被處理為對應的換行符;
\r:會被處理為回車符;
其他不能識別的轉移字符,則只是被識別為普通的字符:
比如\j,會被處理為j這個字母本身;
反斜杠加g以及中括號內一個名字,即:\g,對應着命了名的組,named group
接着上面的舉例:

想要把對應的:

hello crifan, nihao crifan
1
中的crifan提取出來,只剩:

crifan

就可以寫成:

inputStr = "hello crifan, nihao crifan";
replacedStr = re.sub(r"hello (\w+), nihao \1", "\g<1>", inputStr);
print "replacedStr=",replacedStr; #crifan
1
2
3
對應的帶命名的組(named group)的版本是:

inputStr = “hello crifan, nihao crifan”;
replacedStr = re.sub(r”hello (?P\w+), nihao (?P=name)”, “\g”, inputStr);
print “replacedStr=”,replacedStr; #crifan

repl是函數

舉例說明:

比如輸入內容是:

hello 123 world 456
1
想要把其中的數字部分,都加上111,變成:

hello 234 world 567
1
那么就可以寫成:

#!/usr/bin/python
# -*- coding: utf-8 -*-

import re;

def pythonReSubDemo():
"""
demo Pyton re.sub
"""
inputStr = "hello 123 world 456";

def _add111(matched):
intStr = matched.group("number"); #123
intValue = int(intStr);
addedValue = intValue + 111; #234
addedValueStr = str(addedValue);
return addedValueStr;

replacedStr = re.sub("(?P<number>\d+)", _add111, inputStr);
print "replacedStr=",replacedStr; #hello 234 world 567

###############################################################################
if __name__=="__main__":
pythonReSubDemo();

  

第三個參數:string

string,即表示要被處理,要被替換的那個string字符串。

沒什么特殊要說明。

第四個參數:count

舉例說明:

繼續之前的例子,假如對於匹配到的內容,只處理其中一部分。

比如對於:

hello 123 world 456 nihao 789
1
只是像要處理前面兩個數字:123,456,分別給他們加111,而不處理789,

那么就可以寫成:

#!/usr/bin/python
# -*- coding: utf-8 -*-

import re;

def pythonReSubDemo():
"""
demo Pyton re.sub
"""
inputStr = "hello 123 world 456 nihao 789";

def _add111(matched):
intStr = matched.group("number"); #123
intValue = int(intStr);
addedValue = intValue + 111; #234
addedValueStr = str(addedValue);
return addedValueStr;

replacedStr = re.sub("(?P<number>\d+)", _add111, inputStr, 2);
print "replacedStr=",replacedStr; #hello 234 world 567 nihao 789

###############################################################################
if __name__=="__main__":
pythonReSubDemo();

  


第五個參數:flags

關於re.sub的注意事項

要注意,被替換的字符串,即參數repl,是普通的字符串,不是pattern

注意到,語法是:

re.sub(pattern, repl, string, count=0, flags=0)
1
即,對應的第二個參數是repl。

需要你指定對應的r前綴,才是pattern:

r"xxxx"
1
不要誤把第四個參數flag的值,傳遞到第三個參數count中了

否則就會出現我這里:

【已解決】Python中,(1)re.compile后再sub可以工作,但re.sub不工作,或者是(2)re.search后replace工作,但直接re.sub以及re.compile后再re.sub都不工作

遇到的問題:

當傳遞第三個參數,原以為是flag的值是,

結果實際上是count的值

所以導致re.sub不功能,

所以要參數指定清楚了:

replacedStr = re.sub(replacePattern, orignialStr, replacedPartStr, flags=re.I); # can omit count parameter
1
或:

replacedStr = re.sub(replacePattern, orignialStr, replacedPartStr, 1, re.I); # must designate count parameter
1
才可以正常工作。
---------------------
作者:Mrzhoug
來源:CSDN
原文:https://blog.csdn.net/mrzhoug/article/details/51585615
版權聲明:本文為博主原創文章,轉載請附上博文鏈接!


免責聲明!

本站轉載的文章為個人學習借鑒使用,本站對版權不負任何法律責任。如果侵犯了您的隱私權益,請聯系本站郵箱yoyou2525@163.com刪除。



 
粵ICP備18138465號   © 2018-2025 CODEPRJ.COM