用PHP代替JS玩转DOM的思路及示例代码

前端技术 2023/09/04 PHP

事情的起源比较简单，我需要把一个导航页的数据整理好写入数据库。一个比较直观的方法是对html文件进行分析，通用的方法是用php的正则表达式来匹配。但是这样做开发和维护都很困难，代码可读性非常差。

导航页的数据都是规则的排列在DOM树当中的，用JS可以用几个循环轻松的对其进行操作，而且JS需要依赖浏览器，操作数据库很困难。其实PHP就有现成的类库对DOM树种的节点进行增删改查操作，在此做一些笔记。

这里涉及到2个类 DOMDocument 和 DOMXPath。

其实思路比较明确，就是通过DOMDocument将一个html file转换成DOM树的数据结构，再用DOMXPath的实例去搜索这个DOM树，拿到想要特定节点，接下来就可以对当前节点的子树进行遍历，得到想要的结果。

在当前目录下有一个这样一个导航的html文件 \"./hao.html\"

现在需要得到所有<a>标签的中文内容，php代码如下：

复制代码代码如下:

<?php
//将html/xml文件转换成DOM树
$dom = new DOMDocument();
$dom->loadHTMLFile(\"hao.html\");

//得到所有class为fix的dl标签

// example 1: for everything with an id
//$elements = $xpath->query(\"//*[@id]\");

// example 2: for node data in a selected id
//$elements = $xpath->query(\"/html/body/div[@id=\'yourTagIdHere\']\");

// example 3: same as above with wildcard
//$elements = $xpath->query(\"*/div[@id=\'yourTagIdHere\']\");
$xpath = new DOMXPath($dom);
$dls = $xpath->query(\'//dl[@class=\"fix\"]\');

foreach ($dls as $dl) {
$spans = $dl->childNodes;
foreach ($spans as $span) {
echo trim($span->textContent).\"\\t\";
}
echo \"\\n\";
}
?>

输出结果如下：

注意：值得注意的一点是DOMDocument的默认编码方式是Latin，所以在处理utf编码的中文的时候，需要在<head>后面紧跟着填入

复制代码代码如下:

在其他位置，或者是只写上<meta content=\"charset=utf-8\">都是不识别的哦

本文地址：https://www.stayed.cn/item/11826

转载请注明出处。

本站部分内容来源于网络,如侵犯到您的权益,请联系我

微信
QQ好友
QQ空间
腾讯微博
新浪微博
人人网

我的博客

人生若只如初见，何事秋风悲画扇。

我的标签

随笔档案

2024-02(2)
2023-06(1)
2023-05(1)
2023-04(14)
2023-03(3)
2023-01(6)
2022-12(5)
2022-11(5)
2022-07(2)
2022-06(4)
2022-05(3)
2022-03(1)
2021-12(6)
2021-11(1)
2021-10(3)
2021-09(5)
2021-07(5)
2021-02(2)
2021-01(7)
2020-12(18)
2020-11(14)
2020-10(12)
2020-09(10)
2020-08(22)
2020-07(2)
2020-06(1)
2020-04(5)
2020-03(9)
2020-02(7)
2020-01(9)
2019-12(8)
2019-11(10)
2019-10(11)
2019-09(17)
2019-08(16)
2019-07(6)
2019-06(3)
2019-04(1)
2019-03(8)
2019-02(5)
2019-01(1)
2018-11(2)
2018-10(3)
2018-09(1)
2018-08(3)
2018-07(3)
2018-06(7)
2018-04(4)
2018-03(5)
2018-02(4)
2018-01(22)
2017-12(3)
2017-11(5)
2017-10(15)
2017-09(26)
2017-08(1)
2017-07(3)