《前端实战总结》之使用解释器模式实现获取元素Xpath路径的算法

前端领域里基于javascript的设计模式和算法有很多,在很多复杂应用中也扮演着很重要的角色,接下来就介绍一下javascript设计模式中的解释器模式,并用它来实现一个获取元素Xpath路径的算法。

上期回顾

正文

1.解释器模式

对于一种语言,我们给出其文法表示形式(一种语言中的语法描述工具,用来定义语言的规则),并定义一种解释器,通过这种解释器来解释语言中定义的句子。

定义听起来可能比较抽象,举个例子比如我们常见的网站多语言,要实现多语言我们首先要预定语言的类型,提前设计不同语言的语料库,然后我们会根据配置和统一的变量规则来映射到不同语言。

2.元素的Xpath路径

XPath 用于在 XML 文档中通过元素和属性进行导航。虽然XPath 是用来查找XML节点,但同样可以用来查找HTML文档中的节点,因为HTML和XML结构类似。这里我们只考虑html,即元素在html页面中所处的路径。

那么如何快速获取元素的Xpath路径呢?其实也很简单,我们打开谷歌调试工具:

选中某个元素,如下,单机鼠标右键:

选中Copy XPath即可复制元素的Xpath路径。格式可能长这样:

1//*[@id="juejin"]/div[2]/main/div/div[1]/article/div[1]

获取元素Xpath路径的应用场景很多,比如我们经常使用的python爬虫,利用爬虫框架可以通过Xpath路径很方便额控制页面中的某个dom节点,进而获取想要的数据和元素;又比如我们通过发送元素的Xpath路径给后端,后端可以统计某一功能的使用情况和交互数据;又比如分析用户在网站中浏览的热力分布图,路径画像等等。

3.js实现获取元素的Xpath路径

在实现之前,首先我们分析一下Xpath路径的结构,比如我们有一个页面,元素span的结构如下:

1<!DOCTYPE html> 2<html lang="en"> 3<head> 4 <meta charset="UTF-8"> 5 <meta name="viewport" content="width=device-width, initial-scale=1.0"> 6 <meta http-equiv="X-UA-Compatible" content="ie=edge"> 7 <title>Document</title> 8</head> 9<body> 10 <div> 11 <span>我是徐小夕</span> 12 </div> 13</body> 14</html>

那么我们的Xpath路径可能长这样:

1HTML/BODY|HEAD/DIV/SPAN

从上面可以看出,我们的最右边一个元素都是目标元素,而最左边第一个元素都是最外层容器。要完成这个过程首先我们要通过元素的parentNode来获取当前元素的父元素,直到找到最顶层位置。但我们还需要注意的一点是,每找到上一层我们还要遍历该元素前面的兄弟元素previousSibling,如果这个兄弟元素名字和它后面的元素名字相同,则在元素名上+1.

第一步我们先实现一个遍历同级兄弟元素的方法getSameLevelName:

1// 获取兄弟元素名称 2function getSameLevelName(node){ 3 // 如果存在兄弟元素 4 if(node.previousSibling) { 5 let name = '', // 返回的兄弟元素名称字符串 6 count = 1, // 紧邻兄弟元素中相同名称元素个数 7 nodeName = node.nodeName, 8 sibling = node.previousSibling; 9 while(sibling){ 10 if(sibling.nodeType == 1 && sibling.nodeType === node.nodeType && sibling.nodeName){ 11 if(nodeName == sibling.nodeName){ 12 name += ++count; 13 }else { 14 // 重制相同紧邻节点名称节点个数 15 count = 1; 16 // 追加新的节点名称 17 name += '|' + sibling.nodeName.toUpperCase() 18 } 19 } 20 sibling = sibling.previousSibling; 21 } 22 return name 23 }else { 24 // 不存在兄弟元素返回'' 25 return '' 26 } 27}

第二步,遍历文档树。

1// XPath解释器 2let Interpreter = (function(){ 3 return function(node, rwrap){ 4 // 路径数组 5 let path = [], 6 // 如果不存在容器节点,默认为document 7 wrap = rwrap || document; 8 // 如果当前节点等于容器节点 9 if(node === wrap) { 10 if(wrap.nodeType == 1) { 11 path.push(wrap.nodeName.toUpperCase()) 12 } 13 return path 14 } 15 // 如果当前节点的父节点不等于容器节点 16 if(node.parentNode !== wrap){ 17 // 对当前节点的父节点执行遍历操作 18 path = arguments.callee(node.parentNode, wrap) 19 } 20 // 如果当前节点的父元素节点与容器节点相同 21 else { 22 wrap.nodeType == 1 && path.push(wrap.nodeName.toUpperCase()) 23 } 24 // 获取元素的兄弟元素的名称统计 25 let siblingsNames = getSameLevelName(node) 26 if(node.nodeType == 1){ 27 path.push(node.nodeName.toUpperCase() + siblingsNames) 28 } 29 // 返回最终的路径数组结果 30 return path 31 } 32})()

有了这两个方法,我们就可以轻松获取元素的XPath路径啦,比如:

1let path = Interpreter(document.querySelector('span')) 2console.log(path.join('/'))

这样会返回开篇的一样的数据结构了.如:HTML/BODY|HEAD/DIV/SPAN

最后

如果想了解更多webpack,node,gulp,css3,javascript,nodeJS,canvas等前端知识和实战,欢迎在公众号《趣谈前端》加入我们一起学习讨论,共同探索前端的边界。

更多推荐

点赞
收藏

评论区

加载中...

相关推荐

MySQL:[Err] 1292 - Incorrect datetime value: ‘0000-00-00 00:00:00‘ for column ‘CREATE_TIME‘ at row 1

文章目录问题用navicat导入数据时,报错:原因这是因为当前的MySQL不支持datetime为0的情况。解决修改sql\mode:sql\mode:SQLMode定义了MySQL应支持的SQL语法、数据校验等,这样可以更容易地在不同的环境中使用MySQL。全局s

Oracle 分组与拼接字符串同时使用

SELECTT.,ROWNUMIDFROM(SELECTT.EMPLID,T.NAME,T.BU,T.REALDEPART,T.FORMATDATE,SUM(T.S0)S0,MAX(UPDATETIME)CREATETIME,LISTAGG(TOCHAR(

MySQL部分从库上面因为大量的临时表tmp_table造成慢查询

背景描述Time:20190124T00:08:14.70572408:00User@Host:@Id:Schema:sentrymetaLast_errno:0Killed:0Query_time:0.315758Lock_

皕杰报表之UUID

​在我们用皕杰报表工具设计填报报表时,如何在新增行里自动增加id呢?能新增整数排序id吗?目前可以在新增行里自动增加id,但只能用uuid函数增加UUID编码,不能新增整数排序id。uuid函数说明:获取一个UUID,可以在填报表中用来创建数据ID语法:uuid()或uuid(sep)参数说明:sep布尔值,生成的uuid中是否包含分隔符'',缺省为

手写Java HashMap源码

HashMap的使用教程HashMap的使用教程HashMap的使用教程HashMap的使用教程HashMap的使用教程22

一篇文章带你了解JavaScript日期

日期对象允许您使用日期(年、月、日、小时、分钟、秒和毫秒)。一、JavaScript的日期格式一个JavaScript日期可以写为一个字符串:ThuFeb02201909:59:51GMT0800(中国标准时间)或者是一个数字:1486000791164写数字的日期,指定的毫秒数自1970年1月1日00:00:00到现在。1\.显示日期使用