机器学习Day2-机器学习算法过程没有免费午餐定理

2024-02-23 20:50

本文主要是介绍机器学习Day2-机器学习算法过程没有免费午餐定理,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

一、机器学习算法过程

大部分人认为随着大数据和深度学习的发展,只要将网上的数据随意的放进模型中,就可以实现了,其实这是一个错误的观点【笔者一开始也是这样想的】,确实有时候能得到正确的结论,但是大部分是错的

1.特征提取【Feature Extraction

  • 通过训练样本获得的,对机器学习任务有帮助的多维度数据

  • 机器学习的重点不是为了研究如何去提取特征

  • 机器学习的重点:假设在已经提取好特征的前提下,去如何构造算法获得更好的性能

  • 当然也不是提取特征不重要,如果我们提取了好的特征,那么我们机器就能获得不错的性能,相反,如果我们提取的特征很差,即使我们有非常大的机器学习的算法,也是不可能获得好的性能的,

2.为什么不以特征提取为重点?

这是因为不同的任务提取特征的方式是不同的,针对不同的煤质不同的任务,提取特征的方式是千变万化的,【例如语音、图像、视频等】,要是以此为重点,即使花费几门课也讲不完,因此机器学习注重于在假设已经获得特征的前提下,去研究合理的算法,去让学习系统获得更好的性能。

3.特征选择【Feature Selection

    • 例子

  • 我们可以发现,白细胞和红细胞在周长和面积这两个特征中的重合度很少,而其圆形度,虽然红细胞在白细胞的上方,但是重合度很大,因此如果我们采用圆形度作为区分白细胞和红细胞的特征,那么其识别率并不会很高,这两种在其他方面的重合度也很大,因此,我们会采取重合度少的周长和面积,作为区分白细胞和红细胞的特征,以此来构建机器学习的系统。

4.算法构建

那么如何以这两种特征来构建算法呢?他们采取了支持向量机【Support Vector Machine】,一共有三种内核,可以把下列的三种看做三种算法模式

  1. 线性内核

  1. 多项式内核

  1. 高斯径向基函数核

5.特征空间【Feature Space

  • 基于上述两种特征,研究者将白细胞和红细胞画到了同一个二维空间中,其中横坐标代表面积纵坐标代表周长,以此去描点,并做了一定程度的归一,将这两个特征的值归一化到【-1,1】,在这个例子中,我们把这个二维空间成为特征空间【Feature Space】,如果在其他方面,有多个特征,那么特征空间可以是多维的。

  • 那么基于之前提到的三种算法,我们在图纸上画出了三条不同的分界线,一旦我们画出这一线条,那么就代表我们机器学习的过程就已经结束了。

  • 为何这么说呢,例如,这时候来了一个新的样本,我们计算它的周长和面积,再进行一定程度上的归一,再画到这张图上,看是在这一条线的那一侧,就可以进行分类了

  • 在此有两个概念【维度和标准】,【维度】有人说,我一眼就能画出这条线,那是因为这里的维度是二维的,那么如果,维度是上万维,那么你还能看出来吗?人眼对于多维是缺乏想象力的。【标准】上述基于三种算法,画出的线,对于某些区域的划分是不一样的,例如,第二张图片和第三张图片的左下侧

  • 那么哪种算法更好呢,我们针对于不同的情况,需要去采取不同的方法,这个没有绝对意义的好和坏的标准,因为我们采取的数据是有限的,当然我们也不可能穷尽所有的样本数据,如何针对不同的应用场景,选择不同的机器学习算法,构造新的机器学习算法,解决目前无法解决的应用场景,这是一个理论和实践的科学过程

二、没有免费午餐定理【No Free Lunch Theorem

  • 针对于之前提出的哪种算法更好,我们在这给出一个初步的回答,1995年,D.H.Wolpert等人提出了没有免费午餐定理【No Free Lunch Theorem

  • 定理概述:任何一个预测函数,如果在一些训练样本上表现好,那么必然在另一些训练样本表现不好,如果不对数据在特征空间的先验分布有一定的假设,那么表现好与表现不好的情况一样多,因此不存在,任何情况下都是非常完美的机器学习算法

  • 对于先验分布概率,有如下要求

那么,这一假设有道理吗?有道理,但是也可能出错

基于没有免费午餐定理,我们如果不对特征空间的先验分布有要求,那么所以算法的表现概率都是一样的,我们不能片面的去夸大这一定理的作用,从而对开发新的算法丧失信心,但是我们要时刻牢记这一定理的提醒,

因此,再好的算法,也会有犯错的可能,【没有免费午餐定理】告诉我们,没有放之四海皆准的算法,没有人能知道先验样本的假设【就像,明天的太阳一定会升起吗】

这篇关于机器学习Day2-机器学习算法过程没有免费午餐定理的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/739891

相关文章

最新版IDEA配置 Tomcat的详细过程

《最新版IDEA配置Tomcat的详细过程》本文介绍如何在IDEA中配置Tomcat服务器,并创建Web项目,首先检查Tomcat是否安装完成,然后在IDEA中创建Web项目并添加Web结构,接着,... 目录配置tomcat第一步,先给项目添加Web结构查看端口号配置tomcat    先检查自己的to

SpringBoot集成SOL链的详细过程

《SpringBoot集成SOL链的详细过程》Solanaj是一个用于与Solana区块链交互的Java库,它为Java开发者提供了一套功能丰富的API,使得在Java环境中可以轻松构建与Solana... 目录一、什么是solanaj?二、Pom依赖三、主要类3.1 RpcClient3.2 Public

Android数据库Room的实际使用过程总结

《Android数据库Room的实际使用过程总结》这篇文章主要给大家介绍了关于Android数据库Room的实际使用过程,详细介绍了如何创建实体类、数据访问对象(DAO)和数据库抽象类,需要的朋友可以... 目录前言一、Room的基本使用1.项目配置2.创建实体类(Entity)3.创建数据访问对象(DAO

SpringBoot整合kaptcha验证码过程(复制粘贴即可用)

《SpringBoot整合kaptcha验证码过程(复制粘贴即可用)》本文介绍了如何在SpringBoot项目中整合Kaptcha验证码实现,通过配置和编写相应的Controller、工具类以及前端页... 目录SpringBoot整合kaptcha验证码程序目录参考有两种方式在springboot中使用k

SpringBoot整合InfluxDB的详细过程

《SpringBoot整合InfluxDB的详细过程》InfluxDB是一个开源的时间序列数据库,由Go语言编写,适用于存储和查询按时间顺序产生的数据,它具有高效的数据存储和查询机制,支持高并发写入和... 目录一、简单介绍InfluxDB是什么?1、主要特点2、应用场景二、使用步骤1、集成原生的Influ

SpringBoot实现websocket服务端及客户端的详细过程

《SpringBoot实现websocket服务端及客户端的详细过程》文章介绍了WebSocket通信过程、服务端和客户端的实现,以及可能遇到的问题及解决方案,感兴趣的朋友一起看看吧... 目录一、WebSocket通信过程二、服务端实现1.pom文件添加依赖2.启用Springboot对WebSocket

HarmonyOS学习(七)——UI(五)常用布局总结

自适应布局 1.1、线性布局(LinearLayout) 通过线性容器Row和Column实现线性布局。Column容器内的子组件按照垂直方向排列,Row组件中的子组件按照水平方向排列。 属性说明space通过space参数设置主轴上子组件的间距,达到各子组件在排列上的等间距效果alignItems设置子组件在交叉轴上的对齐方式,且在各类尺寸屏幕上表现一致,其中交叉轴为垂直时,取值为Vert

Ilya-AI分享的他在OpenAI学习到的15个提示工程技巧

Ilya(不是本人,claude AI)在社交媒体上分享了他在OpenAI学习到的15个Prompt撰写技巧。 以下是详细的内容: 提示精确化:在编写提示时,力求表达清晰准确。清楚地阐述任务需求和概念定义至关重要。例:不用"分析文本",而用"判断这段话的情感倾向:积极、消极还是中性"。 快速迭代:善于快速连续调整提示。熟练的提示工程师能够灵活地进行多轮优化。例:从"总结文章"到"用

浅析Spring Security认证过程

类图 为了方便理解Spring Security认证流程,特意画了如下的类图,包含相关的核心认证类 概述 核心验证器 AuthenticationManager 该对象提供了认证方法的入口,接收一个Authentiaton对象作为参数; public interface AuthenticationManager {Authentication authenticate(Authenti

不懂推荐算法也能设计推荐系统

本文以商业化应用推荐为例,告诉我们不懂推荐算法的产品,也能从产品侧出发, 设计出一款不错的推荐系统。 相信很多新手产品,看到算法二字,多是懵圈的。 什么排序算法、最短路径等都是相对传统的算法(注:传统是指科班出身的产品都会接触过)。但对于推荐算法,多数产品对着网上搜到的资源,都会无从下手。特别当某些推荐算法 和 “AI”扯上关系后,更是加大了理解的难度。 但,不了解推荐算法,就无法做推荐系