【R数据科学读书笔记】R语言的数据结构原来可以这样理解

2024-06-23 20:58

本文主要是介绍【R数据科学读书笔记】R语言的数据结构原来可以这样理解,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

R语言的数据结构原来可以这样理解

这是R数据科学的读书笔记之一,《R数据科学》是一本教你如何用R语言进行数据分析的书。即便我使用R语言快2年多了,但是读这本书还是受益颇多。

最早接触R语言的时候看的是《R语言实战》, 在第二章里,该书将R语言的数据结构分为6种,向量、矩阵、数组、数据框、因子和列表。当时的理解是,矩阵是二维的向量,数组是二维以上的向量,数据框是特殊性质的列表。

但是读完《R数据科学》的第15章:向量后,我发现原来R语言的数据结构原来可以只分为两类

  • 原子向量: 包含6种类型,逻辑性、整型、双精度型、字符型、复数型和原始型
  • 递归向量: 更常见的名字叫做列表

原子向量和递归向量的 唯一区别 就在于其中存放的值是否都是同种类型。

  • 向量(vector), 矩阵(matrix)和数组(array)以及因子(factor)都只能存放一种数据类型,因此is.atomic的判断结果都是TRUE, 所以都是原子向量
  • 数据库和列表可以包含不同类型的数据,所以用is.recursive的判断结果是TRUE,所以都是递归向量

此外,每个向量都有两个关键属性(properties),类型和长度, 分别用typeof()length()进行查看。分别去用typeof()查看向量、矩阵、数组、因子、数据框和列表时,你会发现前面4个返回都是6种基本数据类型,而数据框和列表返回的都是"list".

我们还可以在向量上附加任意多的元数据(metadata),这些元数据称之为特征(attributes)。 附加不同的特性后就得到了扩展向量(augmented vectors), 其中名称、维度和类是三种特别重要的属性。

如果你去查看attribute和property的中文翻译时,你会发现两者都有一个释义叫做属性

从扩展向量的角度上看数据类型时,可以得到如下洞见

第一: 矩阵和数组相对于普通向量主要就多了一个dim属性,所以我们可以通过如下的操作来创建矩阵和数组

is.v.m.a <- function(x) {c(is.vector(x), is.matrix(x), is.array(x))}
v <- c(1,2,3,4)
is.v.m.a(v) # TRUE FALSE FALSE
attr(v,'dim') <- c(2,2)
is.v.m.a(v) # FALSE  TRUE  TRUE
attr(v,'dim') <- c(1,2,2)
is.v.m.a(v) # FALSE FALSE  TRUE  

注: 矩阵是特殊的数组。

第二:名称是一种额外属性, 对于向量是"names", 对于数组则是"dimnames[[x]]", x表示不同维度, 对于列表而言则是"names",对于数据框是"names"对于列名和"row.names"对于行名

v <- c(1,2,3,4)
attr(v,'names') <- c('a','b','c','d')

第三:类(class)也是一种属性,类是面向对象编程的一个概念。在R语言中,我们会发现同一个函数居然可以用在不同的数据集,比如说print用在ggplot2的对象中,结果是输出图片,这种函数就称之为泛型函数

methods(print)# 内容过多,不在这里展示
# 我们可以具体某个函数的代码
getS3method("print","data.frame")

关于泛型函数的更多知识会在后续的面向对象编程里介绍。

其他知识点

R语言的缺失值一般都标记为"NA", 因此在读取数据的时候默认也将文件中的"NA"当作缺失值,但是很有可能其他人会用"null"作为缺失值的标记,所以结果就会导致这一列全部被当做是字符串,影响后续的分析。

在向量取子集时,熟悉Python的人需要注意一点,Python中x=[1,2,3,4]; x[-1]表示选择最后一个元素,而在R语言里x= c(1,2,3,4); x[-1]表示删除第一个元素,即R用负整数取子集时会丢弃对应位置的元素。

[[[在提取列表时,一定要注意,[[会使列表降低一个层次,而[会返回一个新的、更小的列表,也就是

l <- list(c(1,2,3))
l[1] # 返回列表
l[[1]] # 返回向量

为了更好理解这两者在列表中的差异,作者还提供了一个非常形象的例子,我用另一个例子来说明下:

我所就读的初中每个年级段大概有10个班级,每个班级的人数都不太一样。那么这里的一个年级段就是一个列表x,每个班级都是列表里元素。那么x[1]表示的是解散其他所有班级,只留下第一个班级组成年级段。而x[[1]]表示是第一个班级。x[[1]][1]表示的可能是第一个班级里的第一个学生。

这篇关于【R数据科学读书笔记】R语言的数据结构原来可以这样理解的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/1088258

相关文章

C语言中联合体union的使用

本文编辑整理自: http://bbs.chinaunix.net/forum.php?mod=viewthread&tid=179471 一、前言 “联合体”(union)与“结构体”(struct)有一些相似之处。但两者有本质上的不同。在结构体中,各成员有各自的内存空间, 一个结构变量的总长度是各成员长度之和。而在“联合”中,各成员共享一段内存空间, 一个联合变量

大语言模型(LLMs)能够进行推理和规划吗?

大语言模型(LLMs),基本上是经过强化训练的 n-gram 模型,它们在网络规模的语言语料库(实际上,可以说是我们文明的知识库)上进行了训练,展现出了一种超乎预期的语言行为,引发了我们的广泛关注。从训练和操作的角度来看,LLMs 可以被认为是一种巨大的、非真实的记忆库,相当于为我们所有人提供了一个外部的系统 1(见图 1)。然而,它们表面上的多功能性让许多研究者好奇,这些模型是否也能在通常需要系

【服务器运维】MySQL数据存储至数据盘

查看磁盘及分区 [root@MySQL tmp]# fdisk -lDisk /dev/sda: 21.5 GB, 21474836480 bytes255 heads, 63 sectors/track, 2610 cylindersUnits = cylinders of 16065 * 512 = 8225280 bytesSector size (logical/physical)

回调的简单理解

之前一直不太明白回调的用法,现在简单的理解下 就按这张slidingmenu来说,主界面为Activity界面,而旁边的菜单为fragment界面。1.现在通过主界面的slidingmenu按钮来点开旁边的菜单功能并且选中”区县“选项(到这里就可以理解为A类调用B类里面的c方法)。2.通过触发“区县”的选项使得主界面跳转到“区县”相关的新闻列表界面中(到这里就可以理解为B类调用A类中的d方法

人工和AI大语言模型成本对比 ai语音模型

这里既有AI,又有生活大道理,无数渺小的思考填满了一生。 上一专题搭建了一套GMM-HMM系统,来识别连续0123456789的英文语音。 但若不是仅针对数字,而是所有普通词汇,可能达到十几万个词,解码过程将非常复杂,识别结果组合太多,识别结果不会理想。因此只有声学模型是完全不够的,需要引入语言模型来约束识别结果。让“今天天气很好”的概率高于“今天天汽很好”的概率,得到声学模型概率高,又符合表达

SQL Server中,查询数据库中有多少个表,以及数据库其余类型数据统计查询

sqlserver查询数据库中有多少个表 sql server 数表:select count(1) from sysobjects where xtype='U'数视图:select count(1) from sysobjects where xtype='V'数存储过程select count(1) from sysobjects where xtype='P' SE

C语言 将“China”译成密码

将“China”译成密码,密码规律是:用原来的字母后面的第4个字母代替原来的字母。例如,字母“A”后面的第4个字母是“E”,用“E”代替“A”。因此,“China”应译为“Glmre”。编译程序用付赋初值的方法使c1,c2,c3,c4,c5这五个变量的值分别为“C”,“h”,“i”,“n”,“a”,经过运算,使c1,c2,c3,c4,c5分别变成“G”,“l”,“m”,“r”,“e”。分别用put

【数据结构】线性表:顺序表

文章目录 1. 线性表2. 顺序表2.1 概念及结构2.2 接口实现2.3 顺序表的问题及思考 1. 线性表 线性表是n个具有相同特性的数据元素的有限序列。 线性表是一种在实际中广泛使用的数据结构,常见的线性表:顺序表、链表、栈、队列、字符串… 线性表在逻辑上是线性结构,也就说是连续的一条直线。但是在物理结构上并不一定是连续的,线性表在物理上存储时,通常以数组和链式结构的形式

数据时代的数字企业

1.写在前面 讨论数据治理在数字企业中的影响和必要性,并介绍数据治理的核心内容和实践方法。作者强调了数据质量、数据安全、数据隐私和数据合规等方面是数据治理的核心内容,并介绍了具体的实践措施和案例分析。企业需要重视这些方面以实现数字化转型和业务增长。 数字化转型行业小伙伴可以加入我的星球,初衷成为各位数字化转型参考库,星球内容每周更新 个人工作经验资料全部放在这里,包含数据治理、数据要

数据结构9——排序

一、冒泡排序 冒泡排序(Bubble Sort),顾名思义,就是指越小的元素会经由交换慢慢“浮”到数列的顶端。 算法原理 从左到右,依次比较相邻的元素大小,更大的元素交换到右边;从第一组相邻元素比较到最后一组相邻元素,这一步结束最后一个元素必然是参与比较的元素中最大的元素;按照大的居右原则,重新从左到后比较,前一轮中得到的最后一个元素不参4与比较,得出新一轮的最大元素;按照上述规则,每一轮结