本文主要是介绍PHP基于字典树算法实现搜索联想功能,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!
搜索联想功能是各大搜索引擎具备的基础功能,如下图所示,这个功能简化了用户的输入行为,并且能够给用户推荐热门的搜索词,下面我们来讲一下如何用php实现搜索联想的功能。
实现原理
搜索联想功能拆解一下由两部分组成
- 给定一个查询词,找出以他为前缀的其他目标查询词
- 对目标查询词进行排序,选出权重高的若干个查询词
本篇中重点讲解一下第一部分的实现,这里使用Trie树,也叫字典树,这个数据结构来解决这个问题。通过Trie树可以很方便快速的找到已该字符串为前缀的目标字符串。
什么是Trie树
Trie树,即字典树,又称单词查找树或键树,是一种树形结构,是一种哈希树的变种。典型应用是用于统计和排序大量的字符串(但不仅限于字符串),所以经常被搜索引擎系统用于文本词频统计。它的优点是:最大限度地减少无谓的字符串比较,查询效率往往比哈希表高。
Trie的核心思想是空间换时间。利用字符串的公共前缀来降低查询时间的开销以达到提高效率的目的。
它有3个基本性质:
- 根节点不包含字符,除根节点外每一个节点都只包含一个字符。
- 从根节点到某一节点,路径上经过的字符连接起来,为该节点对应的字符串。
- 每个节点的所有子节点包含的字符都不相同。
假如我们有如下字符串
hello,hi,today,touch,weak
那么构造出来的Trie树如下图所示
当查询的时候只需要从根开始按字符沿着树进行深度遍历,就可以把已该词为前缀的其他查询词查找出来。
代码实现
用于实现搜索联想功能的核心方法有两个:
- 将查询词的数据集构建成Trie树
- 查找以某个查询词为前缀的所有查询词
第一步:构建Trie树
注意由于一个字符串有中文有英文,所以对每个字符串使用以下代码进行了分割,将字符串转化成了一个字符的数组
$charArray = preg_split('/(?<!^)(?!$)/u', $str);
然后对每个字符串执行addWordToTrieTree方法,这个方法将一个词加入到Trie树中,这里用到了递归的方法
public function buildTrieTree($strList) {$tree = [];foreach($strList as $str) {$charArray = preg_split('/(?<!^)(?!$)/u', $str); $tree = $this->addWordToTrieTree($charArray, $tree);}return $tree;}public function addWordToTrieTree($charArray, $tree) {if (count($charArray) == 0) {return [];}$char = $charArray[0];$leftStr = array_slice($charArray, 1);$tree[$char] = $this->addWordToTrieTree($leftStr, $tree[$char]);return $tree;}
第二步:查询前缀词
查询前缀词即给定一个字符串,查询树中所有以该串为前缀的字符串,也就是联想的过程。
首先调用findSubTree方法,从Trie中找到该前缀所在的子树,然后调用traverseTree方法,遍历这颗子树,把所有的字符串都提取出来,这里也是用了递归的方法。
public function queryPrefix($prefix)
这篇关于PHP基于字典树算法实现搜索联想功能的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!