使用Python中的Featuretools实现自动化特征工程的实用指南

本文主要是介绍使用Python中的Featuretools实现自动化特征工程的实用指南,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

任何参与机器学习黑客马拉松和竞赛的人都知道特征工程的重要性。自从我意识到它具有巨大的潜力以来,我一直是特征工程的巨大倡导者。但手动完成时,这可能是一个缓慢而艰巨的过程。我必须花时间集思广益,讨论哪些功能,并从不同的角度分析它们的可用性。现在,整个FE(Feature Engineering,特征工程)流程都可以实现自动化,我将在本文中向您展示。

资料来源:VentureBeat

我们将使用名为Featuretools的Python特征工程库来执行此操作。但在我们开始讨论之前,我们首先要看一下FE的基本构建模块,用直观的例子来理解它们,然后最后使用BigMart Sales数据集深入了解自动化特征工程的可怕世界。

目录

  1. 什么是feature?

  2. 什么是特征工程?

  3. 为什么需要特征工程?

  4. 自动化特征工程

  5. Featuretools简介

  6. Featuretools的实现

  7. Featuretools可解释性

1.什么是feature?

在机器学习的背景下,feature即特征可以被描述为解释现象发生的特性(charactristic)或一组特性。当这些特性转换为某种可测量的形式时,它们被称为特征。

例如,假设您有一个学生列表。此列表包含每个学生的姓名,他们学习的小时数,他们的智商以及之前考试中的总分数。现在,您将获得有关新学生的信息 - 他/她学习的小时数和智商,但他/她的分数不见了。你必须估计他/她可能的分数。

在这里,您将使用IQ和study_hours构建预测模型来估计这些缺失的标记。因此,IQ和study_hours被称为此模型的特征。

2.什么是特征工程?

特征工程可以简单地定义为从数据集中的现有特征创建新特征的过程。让我们考虑一个样本数据,其中包含一些项目的详细信息,例如它们的重量和价格。

现在,要创建新特征,我们可以使用Item_Weight和Item_Price。那么,让我们创建一个名为Price_per_Weight的特征。它只是物品的价格除以物品的重量。此过程称为特征工程。

这只是从现有特征创建新特征的一个简单示例,但在实践中,当我们拥有相当多的特征时,特征工程可能变得非常复杂和繁琐。

让我们再看一个例子。在流行的泰坦尼克号数据集(Titanic dataset)中,有一个乘客姓名特征,下面是数据集中的一些名称:

  • Montvila, Rev. Juozas

  • Graham, Miss. Margaret Edith

  • Johnston, Miss. Catherine Helen “Carrie”

  • Behr, Mr. Karl Howell

  • Dooley, Mr. Patrick

这些名称实际上可以分解为其他有意义的特征。例如,我们可以将类似的标题提取并分组为单个类别。让我们来看看乘客姓名中的唯一标题数量。

事实证明,'Dona','Lady','Countess','Capt','Col','Don','Dr','Major','Rev','Sir'和'Jonkheer '非常罕见,可以放在一个标签下。我们称之为rare_title。除此之外,标题'Mlle'和'Ms'可以放在'Miss'下,'Mme'可以用'Mrs'替换。

这篇关于使用Python中的Featuretools实现自动化特征工程的实用指南的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/642068

相关文章

Java实现字节字符转bcd编码

《Java实现字节字符转bcd编码》BCD是一种将十进制数字编码为二进制的表示方式,常用于数字显示和存储,本文将介绍如何在Java中实现字节字符转BCD码的过程,需要的小伙伴可以了解下... 目录前言BCD码是什么Java实现字节转bcd编码方法补充总结前言BCD码(Binary-Coded Decima

python获取指定名字的程序的文件路径的两种方法

《python获取指定名字的程序的文件路径的两种方法》本文主要介绍了python获取指定名字的程序的文件路径的两种方法,文中通过示例代码介绍的非常详细,对大家的学习或者工作具有一定的参考学习价值,需要... 最近在做项目,需要用到给定一个程序名字就可以自动获取到这个程序在Windows系统下的绝对路径,以下

SpringBoot全局域名替换的实现

《SpringBoot全局域名替换的实现》本文主要介绍了SpringBoot全局域名替换的实现,文中通过示例代码介绍的非常详细,对大家的学习或者工作具有一定的参考学习价值,需要的朋友们下面随着小编来一... 目录 项目结构⚙️ 配置文件application.yml️ 配置类AppProperties.Ja

Java使用Javassist动态生成HelloWorld类

《Java使用Javassist动态生成HelloWorld类》Javassist是一个非常强大的字节码操作和定义库,它允许开发者在运行时创建新的类或者修改现有的类,本文将简单介绍如何使用Javass... 目录1. Javassist简介2. 环境准备3. 动态生成HelloWorld类3.1 创建CtC

JavaScript中的高级调试方法全攻略指南

《JavaScript中的高级调试方法全攻略指南》什么是高级JavaScript调试技巧,它比console.log有何优势,如何使用断点调试定位问题,通过本文,我们将深入解答这些问题,带您从理论到实... 目录观点与案例结合观点1观点2观点3观点4观点5高级调试技巧详解实战案例断点调试:定位变量错误性能分

使用Python批量将.ncm格式的音频文件转换为.mp3格式的实战详解

《使用Python批量将.ncm格式的音频文件转换为.mp3格式的实战详解》本文详细介绍了如何使用Python通过ncmdump工具批量将.ncm音频转换为.mp3的步骤,包括安装、配置ffmpeg环... 目录1. 前言2. 安装 ncmdump3. 实现 .ncm 转 .mp34. 执行过程5. 执行结

Python实现批量CSV转Excel的高性能处理方案

《Python实现批量CSV转Excel的高性能处理方案》在日常办公中,我们经常需要将CSV格式的数据转换为Excel文件,本文将介绍一个基于Python的高性能解决方案,感兴趣的小伙伴可以跟随小编一... 目录一、场景需求二、技术方案三、核心代码四、批量处理方案五、性能优化六、使用示例完整代码七、小结一、

Python中 try / except / else / finally 异常处理方法详解

《Python中try/except/else/finally异常处理方法详解》:本文主要介绍Python中try/except/else/finally异常处理方法的相关资料,涵... 目录1. 基本结构2. 各部分的作用tryexceptelsefinally3. 执行流程总结4. 常见用法(1)多个e

Java实现将HTML文件与字符串转换为图片

《Java实现将HTML文件与字符串转换为图片》在Java开发中,我们经常会遇到将HTML内容转换为图片的需求,本文小编就来和大家详细讲讲如何使用FreeSpire.DocforJava库来实现这一功... 目录前言核心实现:html 转图片完整代码场景 1:转换本地 HTML 文件为图片场景 2:转换 H

Java使用jar命令配置服务器端口的完整指南

《Java使用jar命令配置服务器端口的完整指南》本文将详细介绍如何使用java-jar命令启动应用,并重点讲解如何配置服务器端口,同时提供一个实用的Web工具来简化这一过程,希望对大家有所帮助... 目录1. Java Jar文件简介1.1 什么是Jar文件1.2 创建可执行Jar文件2. 使用java