新技术对传统学科的颠覆:系谱网使用大数据寻亲问祖

2024-02-11 17:40

本文主要是介绍新技术对传统学科的颠覆:系谱网使用大数据寻亲问祖,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

摘要:追本溯源似乎是人类的天性,由于互联网和大数据等技术的发展,系谱学取得了很多进展,寻找并图表描绘家族史已变成一种潮流。Ancestry是系谱学领域有名的企业,近日添加了将孤立的事件整合成完整档案的功能模块。

家谱网爱好者可能认为在Ancestry网上通过人口普查记录、出生证明和其他文件来寻找亲属的信息这件事很有趣。当向朋友和亲属来炫耀自己的个人记录时,就显得不那么有说服力了,而且讲述一个祖先的社会档案并不简单。

Ancestry.com服务幕后的人已经意识到了这一点。现在,他们正在最大限度的利用其4PB的数据库(包括官方的个人记录,用户提交的信息和其它有新特征的数据),为用户提供由计算机生成但是可编辑的祖先信息摘要。

Ancestry网推出的这项服务名为Story View,本季度早些时候只针对一小部分客户,现在10%的客户都可以享受这一服务了。该公司的产品执行副总裁Eric Shoup在最近一次采访中表示,他们计划在正式发布Story View功能前,将对比Stroy View功能使用前后的情况,以进一步完善Story View。通过允许用户围绕一个单页的文档图像以及编辑文件中的文本部分,Ancestry已经增强了这项功能的互动性。

它是如何工作的

Story View功能基于一个比较成熟的工具,该工具可以对亲属数据包括一些手写的记录进行数据挖掘。但是有时只有关键字段,如姓名和居住地。客户可以访问手写记录,定位到一个亲属被描述的位置,查看未被处理的数据,比如那个人的职业。

通过逐步指导"keyers"解析手写记录,并将记录转换为可搜索的文本,Ancestry正在试图通过手写记录获取更多信息。街道地址已经通过这种方式添加进去,其它的字段以后也会添加。同时,由于Ancestry在不断扩充其资料库,社会档案也会有更多的来源。

 

为了从多个文档中提取信息生成一个段落总结,Ancestry求助于Narrative Science,该公司成立于2010年,专注于使用机器生成可读的拷贝(传说中会让我们小编都失业的技术)。早期应用于体育赛事的报道和上市公司的收益报告,现在Narrative Science技术被更多的用于个人信息处理。

Ancestry叙事(narrative)和内容(context)服务团队的首席开发人员Reed McGrew说,当Ancestry第一次采用Narrative Science技术时,只能分批地产生数据。它们会生成大量的财务报告,这并不是我们试图提供的,因为这种批处理确实很慢。

几个月内,Narrative Science开发了一个新的API,这个API可以在更精细的水平上工作。McGrew说:“它们基于单个用户生成社会档案”。

Ancestry精于处理家谱信息,该公司的编辑提供编辑的标准,或“规则”,规定了narratives收发数据的格式。McGrew解释了Ancestry标准:“比如遇到孩子只比母亲小10岁的记录,这更像是输入错误,虽然现实情况中也会发生,但多数情况下不会,所以我们会把这条记录当成错误的来处理”。

包含Shoup某个亲属信息的记录

在Story View中,一个祖先的图片和生活摘要下面是一个缩放的文档图片,而不是结构化文本的离散字段。图片的旁边,Ancestry会提供从文档信息中生成的导语。一旦Ancestry发现所有的记录都和一个人有关,就会根据Ancestry的编辑规则选择出特定的事实组装成完整的句子。一旦基于文档的导语显示在浏览器中,用户就可以在共享前编辑和保存它们。

很难共享

Ancestry的CIO Scott Sorenson说,我们面临的挑战并不在于创建和存储用户的新数据和网页。存储会变得越来越便宜,精确的手写记录处理也不是问题。通常keyers都在中国找,中国的字符集比我们的字母表要大很多,他们很擅长键入这些记录。

真正困难的部分是确保服务的高可用性,数以百万的用户提供正确的文档和文本,并确保网站流量高峰时不致崩溃,但是Story View的目标之一是让更多的人浏览网站内容并最终注册。

www.itbole.net

转载于:https://www.cnblogs.com/itbole/archive/2013/05/29/3105742.html

这篇关于新技术对传统学科的颠覆:系谱网使用大数据寻亲问祖的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/700418

相关文章

Python获取中国节假日数据记录入JSON文件

《Python获取中国节假日数据记录入JSON文件》项目系统内置的日历应用为了提升用户体验,特别设置了在调休日期显示“休”的UI图标功能,那么问题是这些调休数据从哪里来呢?我尝试一种更为智能的方法:P... 目录节假日数据获取存入jsON文件节假日数据读取封装完整代码项目系统内置的日历应用为了提升用户体验,

vue使用docxtemplater导出word

《vue使用docxtemplater导出word》docxtemplater是一种邮件合并工具,以编程方式使用并处理条件、循环,并且可以扩展以插入任何内容,下面我们来看看如何使用docxtempl... 目录docxtemplatervue使用docxtemplater导出word安装常用语法 封装导出方

SpringBoot3实现Gzip压缩优化的技术指南

《SpringBoot3实现Gzip压缩优化的技术指南》随着Web应用的用户量和数据量增加,网络带宽和页面加载速度逐渐成为瓶颈,为了减少数据传输量,提高用户体验,我们可以使用Gzip压缩HTTP响应,... 目录1、简述2、配置2.1 添加依赖2.2 配置 Gzip 压缩3、服务端应用4、前端应用4.1 N

Linux换行符的使用方法详解

《Linux换行符的使用方法详解》本文介绍了Linux中常用的换行符LF及其在文件中的表示,展示了如何使用sed命令替换换行符,并列举了与换行符处理相关的Linux命令,通过代码讲解的非常详细,需要的... 目录简介检测文件中的换行符使用 cat -A 查看换行符使用 od -c 检查字符换行符格式转换将

使用Jackson进行JSON生成与解析的新手指南

《使用Jackson进行JSON生成与解析的新手指南》这篇文章主要为大家详细介绍了如何使用Jackson进行JSON生成与解析处理,文中的示例代码讲解详细,感兴趣的小伙伴可以跟随小编一起学习一下... 目录1. 核心依赖2. 基础用法2.1 对象转 jsON(序列化)2.2 JSON 转对象(反序列化)3.

使用Python实现快速搭建本地HTTP服务器

《使用Python实现快速搭建本地HTTP服务器》:本文主要介绍如何使用Python快速搭建本地HTTP服务器,轻松实现一键HTTP文件共享,同时结合二维码技术,让访问更简单,感兴趣的小伙伴可以了... 目录1. 概述2. 快速搭建 HTTP 文件共享服务2.1 核心思路2.2 代码实现2.3 代码解读3.

Elasticsearch 在 Java 中的使用教程

《Elasticsearch在Java中的使用教程》Elasticsearch是一个分布式搜索和分析引擎,基于ApacheLucene构建,能够实现实时数据的存储、搜索、和分析,它广泛应用于全文... 目录1. Elasticsearch 简介2. 环境准备2.1 安装 Elasticsearch2.2 J

使用C#代码在PDF文档中添加、删除和替换图片

《使用C#代码在PDF文档中添加、删除和替换图片》在当今数字化文档处理场景中,动态操作PDF文档中的图像已成为企业级应用开发的核心需求之一,本文将介绍如何在.NET平台使用C#代码在PDF文档中添加、... 目录引言用C#添加图片到PDF文档用C#删除PDF文档中的图片用C#替换PDF文档中的图片引言在当

Java中List的contains()方法的使用小结

《Java中List的contains()方法的使用小结》List的contains()方法用于检查列表中是否包含指定的元素,借助equals()方法进行判断,下面就来介绍Java中List的c... 目录详细展开1. 方法签名2. 工作原理3. 使用示例4. 注意事项总结结论:List 的 contain

C#使用SQLite进行大数据量高效处理的代码示例

《C#使用SQLite进行大数据量高效处理的代码示例》在软件开发中,高效处理大数据量是一个常见且具有挑战性的任务,SQLite因其零配置、嵌入式、跨平台的特性,成为许多开发者的首选数据库,本文将深入探... 目录前言准备工作数据实体核心技术批量插入:从乌龟到猎豹的蜕变分页查询:加载百万数据异步处理:拒绝界面