在 OpenResty 中,同時(shí)存在兩套正則表達(dá)式規(guī)范:Lua 語言的規(guī)范和 Nginx 的規(guī)范,即使您對(duì) Lua 語言中的規(guī)范非常熟悉,我們?nèi)圆唤ㄗh使用 Lua 中的正則表達(dá)式。一是因?yàn)?Lua 中正則表達(dá)式的性能并不如 Nginx 中的正則表達(dá)式優(yōu)秀;二是 Lua 中的正則表達(dá)式并不符合 POSIX 規(guī)范,而 Nginx 中實(shí)現(xiàn)的是標(biāo)準(zhǔn)的 POSIX 規(guī)范,后者明顯更具備通用性。
Lua 中的正則表達(dá)式與 Nginx 中的正則表達(dá)式相比,有 5%-15%的性能損失,而且 Lua 將表達(dá)式編譯成 Pattern 之后,并不會(huì)將 Pattern 緩存,而是每此使用都重新編譯一遍,潛在地降低了性能。Nginx 中的正則表達(dá)式可以通過參數(shù)緩存編譯過后的 Pattern ,不會(huì)有類似的性能損失。
o 選項(xiàng)參數(shù)用于提高性能,指明該參數(shù)之后,被編譯的 Pattern 將會(huì)在 worker 進(jìn)程中緩存,并且被當(dāng)前 worker 進(jìn)程的每次請(qǐng)求所共享。 Pattern 緩存的上限值通過 lua_regex_cache_max_entries 來修改。
# nginx.conf
location /test {
content_by_lua '
local regex = [[\\d+]]
-- 參數(shù)"o"是開啟緩存必須的
local m = ngx.re.match("hello, 1234", regex, "o")
if m then
ngx.say(m[0])
else
ngx.say("not matched!")
end
';
}
# 在網(wǎng)址中輸入"yourURL/test",即會(huì)在網(wǎng)頁中顯示 1234 。
Lua 中正則表達(dá)式語法上最大的區(qū)別,Lua 使用'%' 來進(jìn)行轉(zhuǎn)義,而其他語言的正則表達(dá)式使用'\' 符號(hào)來進(jìn)行轉(zhuǎn)義。其次,Lua 中并不使用'?' 來表示非貪婪匹配,而是定義了不同的字符來表示是否是貪婪匹配。定義如下:
符號(hào) | 匹配次數(shù) | 匹配模式 |
---|---|---|
+ | 匹配前一字符 1 次或多次 | 非貪婪 |
* | 匹配前一字符 0 次或多次 | 貪婪 |
- | 匹配前一字符 0 次或多次 | 非貪婪 |
? | 匹配前一字符 0 次或 1 次 | 僅用于此,不用于標(biāo)識(shí)是否貪婪 |
符號(hào) | 匹配模式 |
---|---|
. | 任意字符 |
%a | 字母 |
%c | 控制字符 |
%d | 數(shù)字 |
%l | 小寫字母 |
%p | 標(biāo)點(diǎn)字符 |
%s | 空白符 |
%u | 大寫字母 |
%w | 字母和數(shù)字 |
%x | 十六進(jìn)制數(shù)字 |
%z | 代表 0 的字符 |
local s = "hello world"
local i, j = string.find(s, "hello")
print(i, j) --> 1 5
local s = "hello world from Lua"
for w in string.gmatch(s, "%a+") do
print(w)
end
-- output :
-- hello
-- world
-- from
-- Lua
local a = "Lua is cute"
local b = string.gsub(a, "cute", "great")
print(a) --> Lua is cute
print(b) --> Lua is great
--> a line
print(string.gsub("a (enclosed (in) parentheses) line", "%b()", ""))