【情报心路】数据源的搜索渠道和搜索技巧

2023-11-06 13:20

本文主要是介绍【情报心路】数据源的搜索渠道和搜索技巧,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

图片

图源:摄图网可商用图片

我们在往期分享了很多类型的数据源,但是很多小伙伴都会问,这些数据源是从哪些渠道搜集到的,该如何去搜索和积累数据源?特别是一些正在为写论文发愁的毕业党们,不知道论文数据从何找起。接下来,小福妹就掏出一生所学的家底儿(夸张了哈,小福妹的干货还多着呢,以后慢慢跟你们分享)。

图片

有些小伙伴在查找某种类型的数据源的时候,只会在搜索引擎的搜索框中输入某个关键词甚至是一段很长的句子,但是这种方式搜索出来的结果还是很局限的,那么,我们情报分析师在平时的调查中是如何既迅速又精准地找到我们想要的数据源呢?看小福妹来教你几招:

图片

数据源从哪找?

首先,数据源主要分为两大类即官方数据源和非官方数据源(在调查中我们一般倾向于使用官方数据源),官方数据源主要来自各国家政府部门官网,如国内的诉讼司法数据就来自裁判文书网,国内的数据源我们都分享了很多,今天我们主要讲数据源的搜集方法。非官方数据源则主要来自一些第三方机构,此外还有非营利组织的数据,或者是由一些记者或者新闻机构建立的“民间数据库”等。

其次,数据源还可以根据其适用范围分类,比如经济类数据、环境类数据、某公司相关的数据等。我们就需要通过在搜索引擎设置关键词进行搜索。此外,还有一些学术期刊的网站也能找到某些领域的大量数据。后面,小福妹会陆续为大家放送各种不同类型的数据库资源,一定要持续关注我们的公众号哦!

数据源的积累和保存方法可以点下方链接,看小福妹给大家介绍的OSINT数据库的创建方法。

【情报心路】创建自己的 OSINT 数据库

2021-11-16

图片

图片

如何准确搜索?

我们在搜索引擎进行搜索的时候,都知道把关键词加上引号以精确搜索,但是这种搜索方法看似是更加精确,其实会出现结果范围缩小。我们可以在我们要调查的两个关键词对象之间加上“AROUND”,然后添加模糊词数,即可扩大搜索范围,从而避免出现漏网之鱼。

开源调查专家范埃斯(Henk van Ess)曾提出一种“可视化思维”的搜索技巧,即灵活运用谷歌内置的一些搜索术语,结合反图像搜索以及可视化思维,便可以加快调查进展,提高工作效率。他认为虽然大部分都精通于概念思维,但是当我们试图讲一次搜索分解到最基本要素时,可视化思维往往能取得更好的效果。

其实,范埃斯提出的分解基本要素与我们情报分析师工作流程中分解任务这一环节不谋而合。当我们面对一个庞大的调查主题时,我们可以尝试将它分解成若干个小的对象,这个时候就会更容易开始调查。

除了选对关键词来找到你想要的东西以外,范埃斯表示,可视化思维方法包括确定你想要的东西,排除你已经知道的东西,并使用最合理的方法找到你需要的数据

其实,范埃斯提到的“可视化思维”应用到我们的调查当中就是要大胆猜测,小心验证,即在调查开始之前根据现拥有的数据去大胆猜测可能存在的证据,然后进行小心验证环节,最后得出合理的结果;如果猜测出现错误,即不断循环调查流程,不断循环往复,考验的是分析师的耐心和细心程度。

关于如何可视化搜索,他还给出以下建议:

 1 将“对象+动作”作为关键词进行搜索

一般来说,如果我们在搜索引擎中直接输入关键词“采访”,可能出现很多采访相关的内容,但是过于庞杂的信息会掩盖我们真正想要的东西。比如,我们想要找一个名为 Anna Kog 的受访人采访,想象一下在采访中可能会出现的词语,一定会有人名还有“说”这个动作。此时,我们通过“人物对象+动作”作为关键词进行搜索,在采访中我们就可以用 ”Kog says “作为关键词搜索。

 2 将关键词“细节化”以缩小搜索范围

例如,在搜索某张特定的地图之前,我们需要先思考一下一般地图上通常会用到的常用术语。你会发现“地图(map)”这个词过于笼统,但是如果我们搜索跟地图相关的一些元素,比如“比例尺(scale)”,再加上一些其他细节关键词来进一步缩小搜索范围,就可以快速准确地达到我们想要的搜索结果。

 3 用“关键词*”“-排除内容”搜索

范埃斯在一次交流会上向在场的人提出一个问题,让他们当场利用网络检索找出除了众所周知的美国学者 Francis Boyle 外,另外 4 位声称新冠病毒是生物武器的科学家的名字。

大约有一半的与会者在谷歌上进行搜索时,使用的关键词都类似于“声称新冠病毒是生物武器的科学家”,但没有人能够基于这样的搜索词成功找到另外4名科学家。

范埃斯解释说,提出这种说法的科学家不太可能在他们的原帖中使用“科学家”或“说法”等字眼。相反,他建议用 Dr. * *来搜索科学家——其中的星号*为通配符,允许 Google 呈现该位置上为任意名字的结果——并用减号过滤掉那些关于 Francis Boyle 的结果:-boyle。

 4 使用搜索运算符来寻找两者间的联系

操作符(Operators)是指某些可以对在线文本搜索进行精确与优化的特殊的字符和指令。我们可以试试使用运算符,大写的 AROUND,然后在后面添加一个括号,括号中填写你试图联系的两个目标在文本之间的大致字符数。

我们可以根据其他语言中的平均句子和标题的长度进行调整,但一定要确保 AROUND 和括号之间不留空格。范埃斯用以下搜索指令找到了另外四位科学家:“Dr. * *” AROUND(7) “coronavirus is a bioweapon” -boyle。

 5 利用“图片+site国家标识符”寻找目标人物

选取你要调查的对象的资料照片,点击 Google 搜索框的相机图标后,上传到 Google Images 中。在 JPEG 图片 旁边的搜索框中用国家标识符代替人名。

例如,如果是伊朗,则使用 site:ir 的指令代码。范埃斯表示,你甚至不需要知道如何用外语(例如波斯语)拼写他们的名字,就可以在网络上找到伊朗媒体发布的关于他的文稿。

但你用来进行搜索的照片必须要非常简单——选择此人最常用的资料照片,例如其 Twitter 等社交媒体账号的头像,或是 Google 图片搜索出来的第一张照片。

图片

即使记者不知道一个人的名字在外语中是如何拼写的,范埃斯表示也可以在 Google 图片中搜索此人的照片,再结合其国家的标识符,便能帮你找到在以该种外语发表的文稿中此人名字的拼写方式。


 

 6 利用 Who Posted What? 

对于那些使用传统的反向图像搜索很难找到的图片,可以在 Instagram 中输入一个地名,以此抓取一个地理位置链接,并将其与目标日期一起粘贴到 Who Posted What? 中。你也可以据此确定发布照片的人,再通过 Google 搜索找到他们的 Twitter 账号,然后联系他们,再进一步询问图片的相关情况。

图片

当使用反向图片搜索难以找到想要的图时,可以试试在 Who Posted What? 中输入地理位置代码链接以及具体日期。这种方法不仅可以帮助你找到要找的照片,还可以找到图片来源的线索。

 7 以“-site:平台”为关键词寻找视频在其他平台发布情况

如果你只知道一则被疯狂转发的视频被发布在 YouTube 上,试着在 Google 中粘贴链接,并用减号指令将该平台从搜索结果中排除,如: -site:youtube.com。你也可以试着用同样的排除法来寻找被删除的 Instagram 账号图片:将已被删除的 Instagram 链接粘贴到 Google 中,但要加上指令:-site:Instagram.com你也许就会发现该链接已经被第三方网站复制并存档了。

 8 思考其他可视化线索

商标是可视化思维的一个很好的例子。如果你的调查目标是一家公司,而其官方网站提供的信息很少,但包含了公司的商标,你便可以据此在网上搜索该标志可能出现的其他地方。

例如企业网站上常设的客户商标列表,如此一来便可找到与其有业务往来的其他公司。你可以在 Google Images 中使用目标公司的商标进行正常的反向图像搜索,并将该公司的网站过滤在外,方法是在搜索框内使用 -site: 指令,再在后面输入该公司官网网址。

 9 当以上这些高级工具都不起作用时,可以尝试单纯的文字搜索

当我们试图寻找一个疑似恐怖分子在机场拍摄的图像时,无论 TinEye 还是 Yandex 这样强大的反向图像工具都无法找到。但一篇现场的文字报道提到了一条不同寻常的可视化线索——嫌疑人身后有一只黄色的大泰迪熊。

于是,其实我们只需在谷歌图片中输入“机场黄熊(airport yellow bear)”,就能找到这张图片。范埃斯提醒大家,如果想使用图片主体颜色作为关键词在 Google Image 中进行搜索,只有用英语拼出这些颜色术语时才有效,如“green’’或“blue’’等。

本篇文章为福韵原创内容,未经授权禁止转载

封面来源:摄图网可商用图片

END

这篇关于【情报心路】数据源的搜索渠道和搜索技巧的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/356868

相关文章

Python在二进制文件中进行数据搜索的实战指南

《Python在二进制文件中进行数据搜索的实战指南》在二进制文件中搜索特定数据是编程中常见的任务,尤其在日志分析、程序调试和二进制数据处理中尤为重要,下面我们就来看看如何使用Python实现这一功能吧... 目录简介1. 二进制文件搜索概述2. python二进制模式文件读取(rb)2.1 二进制模式与文本

Python使用Matplotlib和Seaborn绘制常用图表的技巧

《Python使用Matplotlib和Seaborn绘制常用图表的技巧》Python作为数据科学领域的明星语言,拥有强大且丰富的可视化库,其中最著名的莫过于Matplotlib和Seaborn,本篇... 目录1. 引言:数据可视化的力量2. 前置知识与环境准备2.1. 必备知识2.2. 安装所需库2.3

90%的人第一步就错了! 顺利登录wifi路由器后台的技巧

《90%的人第一步就错了!顺利登录wifi路由器后台的技巧》登录Wi-Fi路由器,其实就是进入它的后台管理页面,很多朋友不知道该怎么进入路由器后台设置,感兴趣的朋友可以花3分钟了解一下... 你是不是也遇到过这种情况:家里网速突然变慢、想改WiFi密码却不知道从哪进路由器、新装宽带后完全不知道怎么设置?别慌

录音功能在哪里? 电脑手机等设备打开录音功能的技巧

《录音功能在哪里?电脑手机等设备打开录音功能的技巧》很多时候我们需要使用录音功能,电脑和手机这些常用设备怎么使用录音功能呢?下面我们就来看看详细的教程... 我们在会议讨论、采访记录、课堂学习、灵感创作、法律取证、重要对话时,都可能有录音需求,便于留存关键信息。下面分享一下如何在电脑端和手机端上找到录音功能

Python函数的基本用法、返回值特性、全局变量修改及异常处理技巧

《Python函数的基本用法、返回值特性、全局变量修改及异常处理技巧》本文将通过实际代码示例,深入讲解Python函数的基本用法、返回值特性、全局变量修改以及异常处理技巧,感兴趣的朋友跟随小编一起看看... 目录一、python函数定义与调用1.1 基本函数定义1.2 函数调用二、函数返回值详解2.1 有返

Java实现复杂查询优化的7个技巧小结

《Java实现复杂查询优化的7个技巧小结》在Java项目中,复杂查询是开发者面临的“硬骨头”,本文将通过7个实战技巧,结合代码示例和性能对比,手把手教你如何让复杂查询变得优雅,大家可以根据需求进行选择... 目录一、复杂查询的痛点:为何你的代码“又臭又长”1.1冗余变量与中间状态1.2重复查询与性能陷阱1.

Python内存优化的实战技巧分享

《Python内存优化的实战技巧分享》Python作为一门解释型语言,虽然在开发效率上有着显著优势,但在执行效率方面往往被诟病,然而,通过合理的内存优化策略,我们可以让Python程序的运行速度提升3... 目录前言python内存管理机制引用计数机制垃圾回收机制内存泄漏的常见原因1. 循环引用2. 全局变

MySQL中查询和展示LONGBLOB类型数据的技巧总结

《MySQL中查询和展示LONGBLOB类型数据的技巧总结》在MySQL中LONGBLOB是一种二进制大对象(BLOB)数据类型,用于存储大量的二进制数据,:本文主要介绍MySQL中查询和展示LO... 目录前言1. 查询 LONGBLOB 数据的大小2. 查询并展示 LONGBLOB 数据2.1 转换为十

Python进阶之列表推导式的10个核心技巧

《Python进阶之列表推导式的10个核心技巧》在Python编程中,列表推导式(ListComprehension)是提升代码效率的瑞士军刀,本文将通过真实场景案例,揭示列表推导式的进阶用法,希望对... 目录一、基础语法重构:理解推导式的底层逻辑二、嵌套循环:破解多维数据处理难题三、条件表达式:实现分支

Python中的filter() 函数的工作原理及应用技巧

《Python中的filter()函数的工作原理及应用技巧》Python的filter()函数用于筛选序列元素,返回迭代器,适合函数式编程,相比列表推导式,内存更优,尤其适用于大数据集,结合lamb... 目录前言一、基本概念基本语法二、使用方式1. 使用 lambda 函数2. 使用普通函数3. 使用 N