Golang 正则匹配效率详解
作者:无痕空间 发布时间:2024-01-30 03:41:47
标签:Golang,正则匹配,效率
最近有个小需求,校验IMEI是否为15位纯数字(是否合法)
以下是正则匹配
与自己实现的简单验证方式进行压测
package main
import (
"regexp"
"testing"
)
func BenchmarkIsDigitalRegexp(b *testing.B) {
for i := 0; i < b.N; i++ {
_ = isDigitalRegexp("358901806972417")
}
}
func BenchmarkIsDigital(b *testing.B) {
for i := 0; i < b.N; i++ {
_ = isDigital("358901806972417")
}
}
func isDigitalRegexp(imei string) bool {
if ok, _ := regexp.Match("^[0-9]{15}$", []byte(imei)); ok {
return true
}else {
return false
}
}
func isDigital(imei string) bool {
n := len(imei)
if n == 15 {
for i := 0; i < n; i++ {
if imei[i] >= 48 && imei[i] <= 57 {
continue
}else {
return false
}
}
}else {
return false
}
return true
}
压测结果:
C:\Users\M709FJSA\go\src\pprof_demo\re>go test -bench=. -benchmem
goos: windows
goarch: amd64
pkg: pprof_demo/re
BenchmarkIsDigitalRegexp-12 300000 4644 ns/op 6450 B/op 70 allocs/op
BenchmarkIsDigital-12 200000000 9.48 ns/op 0 B/op 0 allocs/op
PASS
ok pprof_demo/re 4.577s
很明显,正则需要重新分配内存较多,从pprof生成图也可以看出,正则调用关系错综复杂
补充:Golang —— 正则表达式
正则表达式是一种进行模式匹配和文本操纵的复杂而又强大的工具。虽然正则表达式比纯粹的文本匹配效率低,但是它却更灵活。
按照它的语法规则,随需构造出的匹配模式就能够从原始文本中筛选出几乎任何你想要得到的字符组合。
Go语言通过regexp标准包为正则表达式提供了官方支持,如果你已经使用过其他编程语言提供的正则相关功能,那么你应该对Go语言版本的不会太陌生,但是它们之间也有一些小的差异,因为Go实现的是RE2标准,除了\C。
其实字符串处理我们可以使用strings包来进行搜索(Contains、Index)、替换(Replace)和解析(Split、Join)等操作,但是这些都是简单的字符串操作,他们的搜索都是大小写敏感,而且固定的字符串,如果我们需要匹配可变的那种就没办法实现了,当然如果strings包能解决你的问题,那么就尽量使用它来解决。
因为他们足够简单、而且性能和可读性都会比正则好。
正则匹配规则图
详细请参考官方文档
简单的正则表达式
1. 匹配任意类型
buf := "abc azc a7c aac 888 a9c tac"
// 1. 解释规则
reg := regexp.MustCompile(`a.c`) // 这里会解析正则表达式,成功就返回解释器(. ——> 除\n外任意字符)
if reg == nil { // 解释失败
fmt.Println("MustCompile err")
return
}
// 2. 根据规则提取关键信息
res := reg.FindAllStringSubmatch(buf, -1) //-1表示匹配所有的
// res := reg.FindAllStringSubmatch(buf, 1) //1表示匹配一个
fmt.Println("res = ", res)
执行结果:
res = [[abc] [azc] [a7c] [aac] [a9c]]
2. 使用 […] (字符集) 匹配[0-9]之间的数值
buf := "abc azc a7c aac 888 a9c tac"
//1) 解释规则, 它会解析正则表达式,如果成功返回解释器
reg1 := regexp.MustCompile(`a[0-9]c`)
if reg1 == nil { //解释失败,返回nil
fmt.Println("MustCompile err")
return
}
//2) 根据规则提取关键信息
result1 := reg1.FindAllStringSubmatch(buf, -1)
fmt.Println("result1 = ", result1)
执行结果:
result1 = [[a7c] [a9c]]
3. 使用 \d 匹配[0-9]之间的数值
buf := "abc azc a7c aac 888 a9c tac"
//1) 解释规则, 它会解析正则表达式,如果成功返回解释器
reg1 := regexp.MustCompile(`a\dc`)
if reg1 == nil { //解释失败,返回nil
fmt.Println("MustCompile err")
return
}
//2) 根据规则提取关键信息
result1 := reg1.FindAllStringSubmatch(buf, -1)
fmt.Println("result1 = ", result1)
执行结果:
result1 = [[a7c] [a9c]]
4.匹配小数
buf := "3.14 456 adsc as23d 1.23 3. 9.99 1lsa23d 0.08 0.00 "
// 解释正则表达式
reg := regexp.MustCompile(`\d+\.\d+`) // +表示匹配前一个字符的一次或者多次
if reg == nil {
fmt.Println("MustCompile err")
return
}
// 提取关键信息
res := reg.FindAllStringSubmatch(buf, -1)
fmt.Println("res = ", res)
执行结果:
res = [[3.14] [1.23] [9.99] [0.08] [0.00]]
5.匹配信息中某关键字并过滤带标签的
// ` ` 是原生字符串
buf := `
<!DOCTYPE html>
<html lang="zh-CN">
<head>
<title>Go语言标准库文档中文版 | Go语言中文网 | Golang中文社区 | Golang中国</title>
<meta name="viewport" content="width=device-width, initial-scale=1, maximum-scale=1.0, user-scalable=no">
<meta http-equiv="X-UA-Compatible" content="IE=edge, chrome=1">
<meta charset="utf-8">
<link rel="shortcut icon" href="/static/img/go.ico" rel="external nofollow" >
<link rel="apple-touch-icon" type="image/png" href="/static/img/logo2.png" rel="external nofollow" >
<meta name="author" content="polaris <polaris@studygolang.com>">
<meta name="keywords" content="中文, 文档, 标准库, Go语言,Golang,Go社区,Go中文社区,Golang中文社区,Go语言社区,Go语言学习,学习Go语言,Go语言学习园地,Golang 中国,Golang中国,Golang China, Go语言论坛, Go语言中文网">
<meta name="description" content="Go语言文档中文版,Go语言中文网,中国 Golang 社区,Go语言学习园地,致力于构建完善的 Golang 中文社区,Go语言爱好者的学习家园。分享 Go 语言知识,交流使用经验">
</head>
<div>和爱好</div>
<div>哈哈
你在吗
不在
</div>
<div>测试</div>
<div>你过来啊</div>
<frameset cols="15,85">
<frame src="/static/pkgdoc/i.html">
<frame name="main" src="/static/pkgdoc/main.html" tppabs="main.html" >
<noframes>
</noframes>
</frameset>
</html>
`
// 解释正则表达式
reg := regexp.MustCompile(`<div>(?s:(.*?))</div>`) // s用来处理换行情况
if reg == nil {
fmt.Println("MustCompile err")
return
}
// 提取关键字
res := reg.FindAllStringSubmatch(buf, -1)
// fmt.Println("res = ", res)
// 过滤<> </>
for _, text := range res {
//fmt.Println("text[0] = ", text[0]) // 带<> </>的
fmt.Println("text[1] = ", text[1]) // 不带<> </> 的
}
执行结果:
text[1] = 和爱好
text[1] = 哈哈
你在吗
不在
text[1] = 测试
text[1] = 你过来啊
以上为个人经验,希望能给大家一个参考,也希望大家多多支持脚本之家。如有错误或未考虑完全的地方,望不吝赐教。
来源:https://blog.csdn.net/weixin_40943560/article/details/94595733
0
投稿
猜你喜欢
- View in Browser功能不生效问题安装玩view in browser插件后,在文档中点击邮件的view in browser 不
- 之前,我介绍了学习安装并配置前端自动化工具Gulp,觉得gulp确实比grunt的配置简单很多,于是我决定再深入学习一下gulp,就去网上查
- 这篇文章主要介绍了如何使用python3获取当前路径及os.path.dirname的使用,文中通过示例代码介绍的非常详细,对大家的学习或者
- Windows Registry Editor Version 5.00 [HKEY_LOCAL_MACHINE\SOFTWARE\Micr
- 前言本文主要介绍了关于MySQL主键为0与主键自排约束的关系,分享出来供大家参考学习,下面话不多说了,来一起看看详细的介绍吧。开始不设置主键
- OpenCV 对象跟踪这篇文章使用 OpenCV 中内置的八种不同的对象跟踪算法,实现对物体的跟踪。首先,介绍一下8种跟踪算法。然后,演示如
- 总有人认为linux搭建php环境很复杂,然后尝试安装lnmp一键安装包。其实说白了就是安装一个web服务器,然后支持php即可,很简单的,
- 一、爬取豆瓣热评该程序进行爬取豆瓣热评,将爬取的评论(json文件)保存到与该python文件同一级目录 * 意需要下载这几个库:reques
- 上下文管理器最常用的是确保正确关闭文件,with open('/path/to/file', 'r') as
- 小试牛刀:1.需要python如何读取文件2.需要python操作list3.需要使用split()对字符串进行分割代码运行截图 :代码(c
- 转换工具层出不穷,ffmpeg才是全能的转换工具,只是不支持图形操作。没有关系,命令行方式,在freebsd/linux下直接来我们的思路是
- 把函数作为参数的用法比较直观:def func(a, b): return a + bdef test(f, a, b): print f
- 目录一、比较汽车性能二、比较不同城市近期天气状况雷达图是以从同一点开始的轴上表示的三个或更多个定量变量的二维图表的形式显示多变量数据的图形方
- 总结为:改注册表。顺手写个脚本:import tkinter as tkfrom tkinter import ttkimport winr
- random 模块中的常用函数random()返回一个位于区间 [0,1] 内的实数;uniform(a, b)返回一个位于区间 [a,b]
- 1、安装scikit-learn1.1Scikit-learn 依赖Python (>= 2.6 or >= 3.3),NumP
- CSS样式和JavaScript脚本是应该放在外部文件中呢?还是把它们放在页面本身之内呢?如何处理是关于一些性能规则的思维,就这些问题,我们
- 1.使用Paramiko登陆到单台交换机实验拓扑云彩桥接到本机环回接口:192.168.1.1/24三层交换机IP:192.168.1.2/
- 日期时间转字符串Select CONVERT(varchar(100), GETDATE(), 0): 05 16 2006 10:57AM
- 如下所示:jsonObject 是个jsonif (key in jsonObject) : print '有'else: