coolcode转SyntaxHighlighter与Mysql正则表达式实现分析

2025-02-12 21:04:55

最近，我抽空改成SyntaxHighlighter。由于coolcode插件的开头标签是
<coolcode>
或者[coolcode]这样的，而SyntaxHighlighter是

[code lang="php"]
这样的（或者其他）。遂只能想办法把老的格式转化成新的格式。当然，肯定用到正则表达式了。
原来的代码高亮开头标识为

<coolcode lang="php" download="123.php" linenum="on"><coolcode lang="php" linenum="off"><coolcode lang="php">
这种类型的，
而SyntaxHighlighter的标识为

[code lang="php"]
那根据要求写的正则表达式为

<coolcode lang="[a-z]+".*?>
解释一下

代码如下:

[a-z]+ 匹配 php,javascript,cpp,sql,css 等，后面的.*?中的 .表示任何除了换行之外的字符，而*表示0次或者无数次，*+这些表述次数的符号后面接的?标识非贪婪模式

看图，这个正则可以实现上述要求了。

但是，问题还没解决，我们还有一种情况没考虑，那就是
<coolcode
后面不一定接的就是lang="php"这样的属性啊，有可能是download，也有可能是linenum="on/off"啊，所以，我们的正则还需要改。
CFC4N把正则改为
<coolcode.*?lang="[a-z]+".*?>
截图如下

细心的朋友可能看出来图中匹配的红色框内多出了
<coolcode
，意思也就是说，前面的

<coolcode>
需要排除掉。如何排除呢？聪明的你肯定立刻想到.这个万能字符替换成非<>两个符号的规则，好，CFC4N立刻修改一下。
修改之后的正则为

<coolcode.*?lang="[a-z]+".*?>
果然，匹配正常了。结果见截图。

到这里，问题似乎解决了，可是，当初糊涂的我，把coolcode的两种开头标识都用了，那就是

<coolcode
和[coolcode，那么，看官您认为这个正则该如何改写呢？
没错，无非就是开头，结尾的标识考虑两种情况<和[，那么正则就好改了。（别忘了排除规则里的符号哦）
[<\[]coolcode[^<>\[\]]*?lang="[a-z]+"[^<>\[\]]*?[>\]]
嗯，好，我们来看下效果：

很好很完美。
下面，就可以去执行了。
可是，我遇到一个很意外的事情。居然发现老的代码里包含这样的格式
[coolcode linenum=\"off\" lang=\"cpp\"]<coolcode download=\"\" lang=\"cpp\" linenum="off">
呃，问题在这里了，只是多了个转义字符\罢了，那么，改起来，也简单。也就是允许\出现0次或者一次，而标识0次或者1次的符号为?，那么我们直接在\后面加个?，也就是改成这样\?就可以了吗？
显然，不是。在正则表达式里，\也表示转义，那么，匹配\的话，也得转义一下\，则应该为\\? 这样才对。
修改后正则为
[<\[]coolcode[^<>\[\]]*?lang=\\?"[a-z]+\\?"[^<>\[\]]*?[>\]]
匹配结果见下图:

现在，大功告成了。我们可以进行转换了。关于转换，我们可以用两种方法。

•Mysql的REPLACE函数，单个的去替换
<coolcode lang="php/cpp/javascript/sql/css等" download="name" linenum="on/off">
为对应的
[code lang="php/cpp/javascript/sql/css等"]
，这样操作，省的去写程序，取出，替换，再写入了，缺点是量大，手工也挺累，体力活。mysql仅仅支持正则查询，不支持正则查询的替换，我们也可以构造联合嵌套的SQL来替换正则匹配的字符串，但是无法取出php/cpp/javascrip这样的语言标记，替换为新的语言标记。也就是说，mysql不支持正则表达式的反向引用。

•PHP读数据库，替换，再写入。PHP的preg_replace函数支持反向引用（preg_replace不支持自定义组名的反向引用），我们只好写个查询语句，查询包含coolcode标识的文章，然后再替换，当然，直接查询包含coolcode的文章可能太多，我们也可以写个MYSQL支持的POSIX正则引擎的表达式，来匹配使用coolcode标签的文章，再来替换，写入。以减少文章的操作量。当然正则表达式也会浪费很大的资源。
当然，在PHP代码的preg_replace函数使用上面的正则，进行反向引用时，需要对正则稍作修改。给lang=""中间的一个组名。正则修改为
[<\[]coolcode[^<>\[\]]*?lang=\\?"([a-z]+\\?)"[^<>\[\]]*?[>\]]
PHP的替换代码为
$contents = preg_replace('/[<|[]coolcode[^>[\]]*?lang=\\\\?"([^"]+?)\\\\?"[^>[\]]*?[>|\]]/i','[code lang="\\1"',$contents);
其中正则的i修饰符标识不区分大小写。

还有，别忘记了coolcode的结束标识和[/coolcode]要替换成[/code]。
mysql里执行两句sql即可

代码如下:

UPDATE wp_posts SET post_content = REPLACE(post_content,'</coolcode>','[\/code]'); //注意后面多了个反斜杠，记得去掉
UPDATE wp_posts SET post_content = REPLACE(post_content,'[/coolcode]','[\/code]'); //注意后面多了个反斜杠，记得去掉

总结：
本文牵扯的正则表达式并无高级用法，都是平常很简单的用法。关于PCRE引擎正则表达式的递归(迭代),组命名，反向引用，零宽断言等，CFC4N会在以后的时间里，找合适的例子写出来。当然，这些高级用法，CFC4N在帮朋友写的正则表达式里已经用到了，大家可以看看，欢迎批评和指点。
PS：如果需要coolcode转SyntaxHighlighter的完整PHP程序，留言即可，我抽空写出来。

mysql正则表达式 LIKE 通配符

扩展正则表达式的一些字符是: "."匹配任何单个的字符. 一个字符类"[...]"匹配在方括号内的任何字符.例如,"[abc]"匹配"a"."b"或"c".为了命名字符的一个范围,使用一个"-"."[a-z]"匹配任何小写字母,而"[0-9]"匹配任何数字. " * "匹配零个或多个在它前面的东西.例如,&q
MySql官方手册学习笔记2 MySql的模糊查询和正则表达式

SQL模式匹配允许你使用"_"匹配任何单个字符,而"%"匹配任意数目字符(包括零字符).在 MySQL中,SQL的模式默认是忽略大小写的.下面给出一些例子.注意使用SQL模式时,不能使用=或!=:而应使用LIKE或NOT LIKE比较操作符. 要想找出以"b"开头的名字: mysql> SELECT * FROM pet WHERE name LIKE 'b%';+--------+--------+---------+------+---
详解MySql基本查询、连接查询、子查询、正则表达查询

查询数据指从数据库中获取所需要的数据.查询数据是数据库操作中最常用,也是最重要的操作.用户可以根据自己对数据的需求,使用不同的查询方式.通过不同的查询方式,可以获得不同的数据.MySQL中是使用SELECT语句来查询数据的.在这一章中将讲解的内容包括. 1.查询语句的基本语法 2.在单表上查询数据 3.使用聚合函数查询数据 4.多表上联合查询 5.子查询 6.合并查询结果 7.为表和字段取别名 8.使用正则表达式查询什么是查询? 怎么查的? 数据的准备如下: create table STUD
mysql 正则表达式查询含有非数字和字符的记录

比如我们有一张school表,里面有一个字段county_name,现在我们要查询county_name字段中包含a-w字母和数字以外字符的记录,那么sql该如何写呢?请看下面的写法: select * from info where name regexp '[^a-w0-9]'; mysql中正则表达式使用regexp关键字,[^a-w0-9]表示匹配除了a-w字母和数字以外的字符. 下面向大家介绍mysql正则表达式的其他使用实例: 匹配名称含有1000的所有行 SELECT * FROM
简述MySQL 正则表达式

我们已经了解到MySQL可以通过 LIKE ...% 来进行模糊匹配. MySQL 同样也支持其他正则表达式的匹配, MySQL中使用 REGEXP 操作符来进行正则表达式匹配. 如果您了解PHP或Perl,那么操作起来就非常简单,因为MySQL的正则表达式匹配与这些脚本的类似. 下表中的正则模式可应用于 REGEXP 操作符中. 实例了解以上的正则需求后,我们就可以更加自己的需求来编写带有正则表达式的SQL语句.以下我们将列出几个小实例(表名:person_tbl )来加深我们的理解: 查找
在MySQL中用正则表达式替换数据库中的内容的方法

PS:下面是转过来的,用于记录下,这个不是正则的初衷,只是用了REGEXP而已,正则的更灵活更方便将comment表中的author_url包含www.sohu.com的记录,其中的sohu替换为sina,一个语句搞定~ update comment set author_url=REPLACE(author_url,'sohu','sina') where author_url REGEXP 'www.sohu.com'; 带IF判断的复杂替换 update comment set url=
MySQL 字符串模式匹配扩展正则表达式模式匹配

标准的SQL模式匹配 SQL的模式匹配允许你使用"_"匹配任何单个字符,而"%"匹配任意数目字符(包括零个字符).在 MySQL中,SQL的模式缺省是忽略大小写的.下面显示一些例子.注意在你使用SQL模式时,你不能使用=或!=:而使用LIKE或NOT LIKE比较操作符. 例如,在表pet中,为了找出以"b"开头的名字: mysql> SELECT * FROM pet WHERE name LIKE "b%"; +--
MySQL中REGEXP正则表达式使用大全

以前我要查找数据都是使用like后来发现mysql中也有正则表达式了并且感觉性能要好于like,下面我来给大家分享一下mysql REGEXP正则表达式使用详解,希望此方法对大家有帮助. MySQL采用Henry Spencer的正则表达式实施,其目标是符合POSIX 1003.2.请参见附录C:感谢.MySQL采用了扩展的版本,以支持在SQL语句中与REGEXP操作符一起使用的模式匹配操作.请参见3.3.4.7节,"模式匹配". 在本附录中,归纳了在MySQL中可用于REGEXP操作
mysql中如何使用正则表达式查询

基本形式属性名 regexp '匹配方式' 正则表达式的模式字符 ^ 匹配字符开始的部分 eg1: 从info表name字段中查询以L开头的记录 select * from info where name regexp '^L'; eg2: 从info表name字段中查询以aaa开头的记录 select * from info where name regexp '^aaa'; $ 匹配字符结束的部分 eg1: 从info表name字段中查询以c结尾的记录 select * from info
MYSQL使用正则表达式过滤数据

一.正则与LIKE的区别 Mysql的正则表达式仅仅使SQL语言的一个子集,可以匹配基本的字符.字符串. 例如:select * from wp_posts where post_name REGEXP'hello',可以检索出列post_name中所有包含hello的行 REGEXP'.og' .是正则表达式中里一个特殊的字符.它表示匹配一个字符,因此,dog,hog,mog等等都能匹配. 注意: 关于LIKE和REGEXP的区别:LIKE匹配整个列.如果被匹配的文本仅在列值中出现,LIKE
MySql中正则表达式的使用方法描述

正则表达式定义了一个字符串的规则.最简单的正则表达式不包含任何保留字.例如,正则表达式hello只和字符串"hello"匹配. 一般的正则表达式使用了某些特殊的结构,所以它能匹配更多的字符串.例如,正则表达式hello|word既能匹配字符串"hello"也能匹配字符串 "word".举一个更复杂一点的例子,正则表达式b[an]*s可以匹配字符串"bananas"."baaaaas" ."bs&
MySQL正则表达式入门教程

我们知道,在SQL之中,可以用 like 这个谓词(表达式) 来进行模糊检索,并支持 %,?,_等占位符.但是,这个模糊检索的功能有很多限制,简单来说就是太模糊了.在MySQL中提供了 REGEXP 关键字来支持正则表达式,当然,只是一些很简单的正则啦.首先,我们构造一些测试数据. 复制代码代码如下: -- 建表USE test;DROP TABLE IF EXISTS t_regcustomer;CREATE TABLE t_regcustomer ( id INT(10) AUTO_INC

coolcode转SyntaxHighlighter与Mysql正则表达式实现分析

相关推荐

随机推荐