用排除法匹配一个不确定长度和内容的标题
匿名 · 更新于 2014/1/15
我们在做网页数据采集的时候,经常会遇到匹配一个不确定长度和内容的标题,例如下方的html源码,
<a class="li1" href="../default2.asp?gp_id=548"> No.1 读《时间简史》有感 </a>
比如一个页面内有多个这样的代码块,我们要获取每个这样区块a标签之间的内容,但是我们现在不确定a标签里边的内容到底都包含什么字符以及长度范围,但是我们确定了内容中不会出现"<"这个符号,那么我们就可以这样写正则表达式
preg_match_all('/\s+([^<]*)<\/a>/',$content,$arr)
