[数据统计] 搜索引擎索引库:百度大于雅虎中国 之一

2023-11-22 12:30

本文主要是介绍[数据统计] 搜索引擎索引库:百度大于雅虎中国 之一,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

[数据统计] 搜索引擎索引库:百度大于雅虎中国 之一

互联网渗透的越深、世界就会越平;信息越透明,诚信越重要---题记



        关心搜索引擎的朋友们都知道,搜全率和搜准率是衡量搜索引擎系统的两项基础指标,在很多关于搜索引擎技术评比的文章中搜全率和搜准率被频频提及。

        搜准率是一个很难量化的指标,如何判断一个搜索引擎的搜索结果和使用者的意图最相关,没有一个定性的结论。所以很多冠以智能化、社会化、元搜索头衔的搜索引擎也都是朝搜准这个方向努力,耐人寻味的是,大多数公司都宣称自己的搜索引擎是基于那些技术,却没有告诉我们一个可以接受的衡量指标。当然,这不怪他们。

        搜全率相对来说则可以量化,最简单的衡量指标就是索引量了。google和yahoo 之间曾有过争论:“实测证明Google仍是搜索之王 雅虎"牛皮"吹破” 。对于这次争论google是如何反击的呢?正如keso所说的google在反商业化的上的成功一样,google 随后不久透露要减小索引库的大小。很显然对于浩如烟海的互联网来说,能搜全仍是一个艰巨的目标。

        类似的情景正在中国上演。在“It人士每天必读的100篇互联网新闻”上经常可以看到雅虎中国的宣传稿件,主题有开创蓝海、搜索盲测、抓虫行动等等,而百度此类的新闻却鲜有耳闻。百度的低调或许可以让他在靠近“google”的形象上多加一分。


中文搜索引擎谁最好?除了搜全率和搜准率外,最近又多出了一个争论的焦点:“谁最懂中文”。然后在这场单方面发起的谁最懂中文的时候,搜狗却实实在在的来了句:“搜狗更懂网络”。我想雅虎市场人员也许该从百事可乐的成功中学点什么。

作为一个搜索引擎的爱好者,我对搜全率和搜准率的问题也非常关注。于是动手准备测试一下雅虎中国和百度索引库的情况。这并不是一个好差事,但我决定还是尝试一下。

搜全率的测试方法:基本方法:抽样测试
分2个阶段进行:
1、测试对指定站点的索引量 (本文进行分析)
2、测试对基础关键词的索引量(在下一篇文章中进行分析)


本文的数据主要是对“指定站点的索引量”的一个数据统计。

基本资料分三部分:
1、指定站点的来源,出于公平的考虑,指定站点分别来源于:
http://site.baidu.comhttp://site.yahoo.com.cn 。总共4784个,可以从下面的链接下载。
2、对上述站点的索引量统计,即使用:site:domain 的方法获取搜索引擎对此站点的索引量。为了增加可比性,去掉了索引量为0的站点(或许因为网络错误造成的,原始资料在
附件中)。
   (前端时间百度的site数量变化有些异常,现在基本正常。另一篇文章会捎带分析这个现象。)
3、相关分析。


结果见下图:

 

 

(分析过程省略,详细的数据可以从这里下载: http://www.search-analysis.com/baiduVSyahoochina-01.rar


结论:
1、百度的索引库比雅虎中国的大。
 在双方都认为最重要的3793个站点中:百度索引量:1626829061  ,雅虎中国的索引量:1018594668,高出:608234393 ,高出6亿。


2、百度的索引量分布图比较接近“长尾 Long Tail ”,长尾曲线比较完美。图形越接近长尾表明搜索引擎索引库基础的架构越好。
   (理由是:"哥白尼对天动说美学上的反对是他拒绝托勒密体系的重要原因..." - Thomas Kuhn, The Copernican Revolution )

        很显然上面的分析还不一定能囊括所有方面,因此我准备还从下面几个方面继续深入研究:

之二:[百度vs雅虎中国]收录量和pr的相关性;
之三:[百度vs雅虎中国]索引量和alexa排名的相关性;
之四:[百度vs雅虎中国]如何测试搜索索引库的膨胀率;

 原文: [数据统计] 搜索引擎索引库:百度大于雅虎中国 之一 

这篇关于[数据统计] 搜索引擎索引库:百度大于雅虎中国 之一的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/410163

相关文章

使用Java解析JSON数据并提取特定字段的实现步骤(以提取mailNo为例)

《使用Java解析JSON数据并提取特定字段的实现步骤(以提取mailNo为例)》在现代软件开发中,处理JSON数据是一项非常常见的任务,无论是从API接口获取数据,还是将数据存储为JSON格式,解析... 目录1. 背景介绍1.1 jsON简介1.2 实际案例2. 准备工作2.1 环境搭建2.1.1 添加

MySQL中删除重复数据SQL的三种写法

《MySQL中删除重复数据SQL的三种写法》:本文主要介绍MySQL中删除重复数据SQL的三种写法,文中通过代码示例讲解的非常详细,对大家的学习或工作有一定的帮助,需要的朋友可以参考下... 目录方法一:使用 left join + 子查询删除重复数据(推荐)方法二:创建临时表(需分多步执行,逻辑清晰,但会

Java实现任务管理器性能网络监控数据的方法详解

《Java实现任务管理器性能网络监控数据的方法详解》在现代操作系统中,任务管理器是一个非常重要的工具,用于监控和管理计算机的运行状态,包括CPU使用率、内存占用等,对于开发者和系统管理员来说,了解这些... 目录引言一、背景知识二、准备工作1. Maven依赖2. Gradle依赖三、代码实现四、代码详解五

详谈redis跟数据库的数据同步问题

《详谈redis跟数据库的数据同步问题》文章讨论了在Redis和数据库数据一致性问题上的解决方案,主要比较了先更新Redis缓存再更新数据库和先更新数据库再更新Redis缓存两种方案,文章指出,删除R... 目录一、Redis 数据库数据一致性的解决方案1.1、更新Redis缓存、删除Redis缓存的区别二

oracle数据库索引失效的问题及解决

《oracle数据库索引失效的问题及解决》本文总结了在Oracle数据库中索引失效的一些常见场景,包括使用isnull、isnotnull、!=、、、函数处理、like前置%查询以及范围索引和等值索引... 目录oracle数据库索引失效问题场景环境索引失效情况及验证结论一结论二结论三结论四结论五总结ora

Redis事务与数据持久化方式

《Redis事务与数据持久化方式》该文档主要介绍了Redis事务和持久化机制,事务通过将多个命令打包执行,而持久化则通过快照(RDB)和追加式文件(AOF)两种方式将内存数据保存到磁盘,以防止数据丢失... 目录一、Redis 事务1.1 事务本质1.2 数据库事务与redis事务1.2.1 数据库事务1.

Oracle Expdp按条件导出指定表数据的方法实例

《OracleExpdp按条件导出指定表数据的方法实例》:本文主要介绍Oracle的expdp数据泵方式导出特定机构和时间范围的数据,并通过parfile文件进行条件限制和配置,文中通过代码介绍... 目录1.场景描述 2.方案分析3.实验验证 3.1 parfile文件3.2 expdp命令导出4.总结

更改docker默认数据目录的方法步骤

《更改docker默认数据目录的方法步骤》本文主要介绍了更改docker默认数据目录的方法步骤,文中通过示例代码介绍的非常详细,对大家的学习或者工作具有一定的参考学习价值,需要的朋友们下面随着小编来一... 目录1.查看docker是否存在并停止该服务2.挂载镜像并安装rsync便于备份3.取消挂载备份和迁

不删数据还能合并磁盘? 让电脑C盘D盘合并并保留数据的技巧

《不删数据还能合并磁盘?让电脑C盘D盘合并并保留数据的技巧》在Windows操作系统中,合并C盘和D盘是一个相对复杂的任务,尤其是当你不希望删除其中的数据时,幸运的是,有几种方法可以实现这一目标且在... 在电脑生产时,制造商常为C盘分配较小的磁盘空间,以确保软件在运行过程中不会出现磁盘空间不足的问题。但在

opencv实现像素统计的示例代码

《opencv实现像素统计的示例代码》本文介绍了OpenCV中统计图像像素信息的常用方法和函数,文中通过示例代码介绍的非常详细,对大家的学习或者工作具有一定的参考学习价值,需要的朋友们下面随着小编来一... 目录1. 统计像素值的基本信息2. 统计像素值的直方图3. 统计像素值的总和4. 统计非零像素的数量