20180521-A · US Honey Production · ggplot2 dplyr ggdraw geom_bar magick 柱状图 条形图 · R 语言数据可视化 案例 源码

本文主要是介绍20180521-A · US Honey Production · ggplot2 dplyr ggdraw geom_bar magick 柱状图 条形图 · R 语言数据可视化 案例 源码,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

所有作品合集传送门: Tidy Tuesday

2018 年合集传送门: 2018

US Honey Production


欢迎来到ggplot2的世界!

ggplot2是一个用来绘制统计图形的 R 软件包。它可以绘制出很多精美的图形,同时能避免诸多的繁琐细节,例如添加图例等。

用 ggplot2 绘制图形时,图形的每个部分可以依次进行构建,之后还可以进行编辑。ggplot2 精心挑选了一系列的预设图形,因此在大部分情形下可以快速地绘制出许多高质量的图形。如果在格式上还有额外的需求,也可以利用 ggplot2 中的主题系统来进行定制, 无需花费太多时间来调整图形的外观,而可以更加专注地用图形来展现你的数据。


在这里插入图片描述



1. 一些环境设置

# 设置为国内镜像, 方便快速安装模块
options("repos" = c(CRAN = "https://mirrors.tuna.tsinghua.edu.cn/CRAN/"))

2. 设置工作路径

wkdir <- '/home/user/R_workdir/TidyTuesday/2018/2018-05-21_US_Honey_Production/src-a'
setwd(wkdir)

3. 加载 R 包

library(cowplot)
library(tidyverse)# 导入字体设置包
library(showtext) # font_add_google() showtext 中从谷歌字体下载并导入字体的函数
# name 中的是字体名称, 用于检索, 必须严格对应想要字体的名字 
# family 后面的是代码后面引用时的名称, 自己随便起
# 需要能访问 Google, 也可以注释掉下面这行, 影响不大
# font_families_google() 列出所有支持的字体, 支持的汉字不多
# http://www.googlefonts.net/
font_add_google(name = "Gochi Hand", family =  "gochi")
font_add_google(name = "Staatliches" , family = "staat")
font_add_google(name = "ZCOOL QingKe HuangYou", family =  "zqhy")# 后面字体均可以使用导入的字体
showtext_auto()

4. 加载数据

# 加载原始数据. 注: 原始数据结构比较复杂, 可以自行查看
df_input_a  <- readr::read_csv('../data/honeyraw_1998to2002.csv', col_names = FALSE, skip = 9)
df_input_b  <- readr::read_csv('../data/honeyraw_2003to2007.csv', col_names = FALSE, skip = 81)
df_input_c  <- readr::read_csv('../data/honeyraw_2008to2012.csv', col_names = FALSE, skip = 72)# 简要查看数据内容
glimpse(df_input_a)
## Rows: 288
## Columns: 9
## $ X1 <dbl> 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1…
## $ X2 <chr> "d", "d", "d", "d", "d", "d", "d", "d", "d", "d", "d", "d", "d", "d…
## $ X3 <chr> "AL", "AZ", "AR", "CA", "CO", "FL", "GA", "HI", "ID", "IL", "IN", "…
## $ X4 <chr> "16", "55", "53", "450", "27", "230", "75", "8", "120", "9", "9", "…
## $ X5 <chr> "71", "60", "65", "83", "72", "98", "56", "118", "50", "71", "92", …
## $ X6 <chr> "1136", "3300", "3445", "37350", "1944", "22540", "4200", "944", "6…
## $ X7 <chr> "159", "1485", "1688", "12326", "1594", "4508", "307", "66", "2220"…
## $ X8 <chr> "72", "64", "59", "62", "70", "64", "69", "77", "65", "119", "85", …
## $ X9 <chr> "818", "2112", "2033", "23157", "1361", "14426", "2898", "727", "39…
# 检查数据的列名
colnames(df_input_a)
## [1] "X1" "X2" "X3" "X4" "X5" "X6" "X7" "X8" "X9"

5. 数据预处理

# 自定义函数
mytidy <- function(df_input, y){df_input %>% # 去除缺失值drop_na()%>% # datasets::state.abb 数据集存放了美国各州的英文缩写名, 这一步用于筛选美国各州的数据filter(X3 %in% state.abb) %>% # mutate_at() 通过名称修改指定数据列的内容dplyr::mutate_at(vars(X4:X9), as.numeric) %>% # mutate() 主要用于在数据框中添加新的变量, 这些变量是通过对现有的变量进行操作而形成的dplyr::mutate(X1 = X1 + y -1,X4 = X4 * 1000,X6 = X4 * X5,X7 = X7 * 1000,X8 = X8/100,X9 = X6 * X8) %>% # select() 筛选需要的列, - 表示剔除指定的列select(-X2) %>% # rename() 为了便于后续理解, 重命名指定的列rename(year = X1, st = X3,numcol = X4,yieldpercol = X5,totalprod = X6,stocks = X7,priceperlb = X8, prodvalue = X9)  
}# 通过自定义函数, 进一步整理数据
df_tidy_a <- mytidy(df_input_a, 1998)
df_tidy_b <- mytidy(df_input_b, 2003)
df_tidy_c <- df_input_c %>% # 因为 df_input_c$X3 为美国各州的英文缩写, 这里将其替换成全名, 以兼容自定义函数mutate(X3 = state.abb[match(X3, state.name)]) %>% mytidy(2008)# 按行合并三个数据集
df_plot <- dplyr::bind_rows(df_tidy_a, df_tidy_b, df_tidy_c)# 简要查看数据内容
glimpse(df_plot)
## Rows: 626
## Columns: 8
## $ year        <dbl> 1998, 1998, 1998, 1998, 1998, 1998, 1998, 1998, 1998, 1998…
## $ st          <chr> "AL", "AZ", "AR", "CA", "CO", "FL", "GA", "HI", "ID", "IL"…
## $ numcol      <dbl> 16000, 55000, 53000, 450000, 27000, 230000, 75000, 8000, 1…
## $ yieldpercol <dbl> 71, 60, 65, 83, 72, 98, 56, 118, 50, 71, 92, 78, 46, 50, 1…
## $ totalprod   <dbl> 1136000, 3300000, 3445000, 37350000, 1944000, 22540000, 42…
## $ stocks      <dbl> 159000, 1485000, 1688000, 12326000, 1594000, 4508000, 3070…
## $ priceperlb  <dbl> 0.72, 0.64, 0.59, 0.62, 0.70, 0.64, 0.69, 0.77, 0.65, 1.19…
## $ prodvalue   <dbl> 817920, 2112000, 2032550, 23157000, 1360800, 14425600, 289…

6. 利用 ggplot2 绘图

# 加载一个本地图片
bee.img <- magick::image_read('../data/bee.jpg') %>%magick::image_colorize(opacity = 28, color = 'white')# PS: 方便讲解, 我这里进行了拆解, 具体使用时可以组合在一起
gg <- df_plot %>%# 根据 st 州名将数据进行分组group_by(st) %>% # summarise() 总结指定的列, 这里求和summarise(sumprod = sum(totalprod)) %>% # arrange() + desc() 降序排列arrange(desc(sumprod)) %>% # 新建 ggplot2 画布ggplot(aes(x = fct_reorder(st, sumprod), y = sumprod))
# geom_bar() 绘制条形图, stat = "identity",意味着条形的高度表示数据数据的值
gg <- gg + geom_bar(stat = "identity")
# coord_flip() 横纵坐标位置转换
gg <- gg + coord_flip()
# geom_text() 添加文本信息, 同时格式化输出大位数字
gg <- gg + geom_text(aes(st, sumprod, label = format(sumprod, big.mark = ",", scientific = FALSE)), hjust = -0.02, colour = 'red', family = 'gochi')
# scale_y_continuous() 对连续变量设置坐标轴显示范围
# scales::unit_format() 通过添加单位后缀来优化缩放比例, 这里以 Million 百万来缩放
gg <- gg + scale_y_continuous(labels = scales::unit_format(unit = "M", scale = 1e-6), limits = c(0, 510000000))
# labs() 对图形添加注释和标签(包含标题 title、子标题 subtitle、坐标轴 x & y 和引用 caption 等注释)
gg <- gg + labs(title = "美国蜂蜜生产 (1998-2012)",subtitle = NULL,x = NULL,y = NULL,caption = "资料来源: Bee Culture - graph by 数绘小站")
# theme_minimal() 去坐标轴边框的最小化主题
gg <- gg + theme_minimal()
# theme() 实现对非数据元素的调整, 对结果进行进一步渲染, 使之更加美观
gg <- gg + theme(# panel.grid.major 主网格线, 这一步表示删除主要网格线panel.grid.major = element_blank(),# panel.grid.minor 次网格线, 这一步表示删除次要网格线panel.grid.minor = element_blank(),# panel.border 面板背景 数据上面panel.border = element_blank(),# panel.background 面板背景 数据下面panel.background = element_blank(),# plot.margin 调整图像边距, 上-右-下-左plot.margin = margin(12, 15, 2, 10), # axis.text.x X-坐标轴文本axis.text.x = element_text(size = 11),# axis.text.y Y-坐标轴文本, 这里调整坐标轴标签与坐标轴之间的间距axis.text.y = element_text(size = 12, margin = margin(0, -1, 0, 0, 'cm')),# text 设置文本格式text = element_text(family = 'staat'),# plot.background 图片背景plot.background = element_blank(),# plot.title 主标题plot.title = element_text(hjust = 0.1, color = "black", size = 32, face = "bold", family = 'zqhy'),# plot.caption 说明文字plot.caption =  element_text(size = 16, hjust = 0.85, vjust = 50, family = 'zqhy'),# legend.position 设置图例位置, "none" 表示不显示图例legend.position = "none")# 利用 cowplot::ggdraw 合并多个图
info.text = '2016年,美国拥有5个或更多蜂群的生产商生产的\n蜂蜜总量为1.619亿磅,比2015年增长了3%。2016\n年,采集蜂蜜的蜂群有278万个,比2015年增长了\n4%。每个蜂群收获的蜂蜜平均产量为58.3磅,比\n2015年的58.9磅下降了1%。'
source.text = '数据来源: Bee Culture · 2016'
caption.text = 'GRAPH BY 数绘小站'
merge.gg <- ggdraw()
merge.gg <- merge.gg + draw_image(bee.img, x = -0.05, y = -0.21, height = 1.42, width = 1.22)
merge.gg <- merge.gg + draw_plot(gg, x = 0., y = -0.04, height = 1.05, width = 1.02)
merge.gg <- merge.gg + draw_text(text = info.text, x = 0.305, y = 0.55 , family = "zqhy" , size = 15 , hjust = 0)
merge.gg <- merge.gg + draw_text(text = source.text, x = 0.385, y = 0.325, size = 16 , hjust = 0)
merge.gg <- merge.gg + draw_text(text = caption.text, x = 0.685, y = 0.325 , color = 'red' , size = 16 , hjust = 0)

7. 保存图片到 PDF 和 PNG

gg

在这里插入图片描述

filename = '20180521-A-01'
ggsave(filename = paste0(filename, ".pdf"), width = 9.6, height = 6.4, device = cairo_pdf)
ggsave(filename = paste0(filename, ".png"), width = 9.6, height = 6.4, dpi = 100, device = "png", bg = 'white')
merge.gg

在这里插入图片描述

filename = '20180521-A-02'
ggsave(filename = paste0(filename, ".pdf"), width = 9.6, height = 6.1, device = cairo_pdf)
ggsave(filename = paste0(filename, ".png"), width = 9.6, height = 6.1, dpi = 100, device = "png", bg = 'white')

8. session-info

sessionInfo()
## R version 4.2.1 (2022-06-23)
## Platform: x86_64-pc-linux-gnu (64-bit)
## Running under: Ubuntu 20.04.5 LTS
## 
## Matrix products: default
## BLAS:   /usr/lib/x86_64-linux-gnu/openblas-pthread/libblas.so.3
## LAPACK: /usr/lib/x86_64-linux-gnu/openblas-pthread/liblapack.so.3
## 
## locale:
##  [1] LC_CTYPE=en_US.UTF-8       LC_NUMERIC=C              
##  [3] LC_TIME=en_US.UTF-8        LC_COLLATE=en_US.UTF-8    
##  [5] LC_MONETARY=en_US.UTF-8    LC_MESSAGES=en_US.UTF-8   
##  [7] LC_PAPER=en_US.UTF-8       LC_NAME=C                 
##  [9] LC_ADDRESS=C               LC_TELEPHONE=C            
## [11] LC_MEASUREMENT=en_US.UTF-8 LC_IDENTIFICATION=C       
## 
## attached base packages:
## [1] stats     graphics  grDevices utils     datasets  methods   base     
## 
## other attached packages:
##  [1] showtext_0.9-5  showtextdb_3.0  sysfonts_0.8.8  forcats_0.5.2  
##  [5] stringr_1.4.1   dplyr_1.0.10    purrr_0.3.4     readr_2.1.2    
##  [9] tidyr_1.2.1     tibble_3.1.8    ggplot2_3.3.6   tidyverse_1.3.2
## [13] cowplot_1.1.1  
## 
## loaded via a namespace (and not attached):
##  [1] httr_1.4.4          sass_0.4.2          bit64_4.0.5        
##  [4] vroom_1.5.7         jsonlite_1.8.2      modelr_0.1.9       
##  [7] bslib_0.4.0         assertthat_0.2.1    highr_0.9          
## [10] googlesheets4_1.0.1 cellranger_1.1.0    yaml_2.3.5         
## [13] pillar_1.8.1        backports_1.4.1     glue_1.6.2         
## [16] digest_0.6.29       rvest_1.0.3         colorspace_2.0-3   
## [19] htmltools_0.5.3     pkgconfig_2.0.3     broom_1.0.1        
## [22] haven_2.5.1         magick_2.7.3        scales_1.2.1       
## [25] tzdb_0.3.0          googledrive_2.0.0   generics_0.1.3     
## [28] farver_2.1.1        ellipsis_0.3.2      cachem_1.0.6       
## [31] withr_2.5.0         cli_3.4.1           magrittr_2.0.3     
## [34] crayon_1.5.1        readxl_1.4.1        evaluate_0.16      
## [37] fs_1.5.2            fansi_1.0.3         xml2_1.3.3         
## [40] textshaping_0.3.6   tools_4.2.1         hms_1.1.2          
## [43] gargle_1.2.1        lifecycle_1.0.3     munsell_0.5.0      
## [46] reprex_2.0.2        compiler_4.2.1      jquerylib_0.1.4    
## [49] systemfonts_1.0.4   rlang_1.0.6         grid_4.2.1         
## [52] rstudioapi_0.14     labeling_0.4.2      rmarkdown_2.16     
## [55] gtable_0.3.1        DBI_1.1.3           curl_4.3.2         
## [58] R6_2.5.1            lubridate_1.8.0     knitr_1.40         
## [61] fastmap_1.1.0       bit_4.0.4           utf8_1.2.2         
## [64] ragg_1.2.3          stringi_1.7.8       parallel_4.2.1     
## [67] Rcpp_1.0.9          vctrs_0.4.2         dbplyr_2.2.1       
## [70] tidyselect_1.1.2    xfun_0.32

测试数据

配套数据下载:US Honey Production

这篇关于20180521-A · US Honey Production · ggplot2 dplyr ggdraw geom_bar magick 柱状图 条形图 · R 语言数据可视化 案例 源码的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/575617

相关文章

大模型研发全揭秘:客服工单数据标注的完整攻略

在人工智能(AI)领域,数据标注是模型训练过程中至关重要的一步。无论你是新手还是有经验的从业者,掌握数据标注的技术细节和常见问题的解决方案都能为你的AI项目增添不少价值。在电信运营商的客服系统中,工单数据是客户问题和解决方案的重要记录。通过对这些工单数据进行有效标注,不仅能够帮助提升客服自动化系统的智能化水平,还能优化客户服务流程,提高客户满意度。本文将详细介绍如何在电信运营商客服工单的背景下进行

基于MySQL Binlog的Elasticsearch数据同步实践

一、为什么要做 随着马蜂窝的逐渐发展,我们的业务数据越来越多,单纯使用 MySQL 已经不能满足我们的数据查询需求,例如对于商品、订单等数据的多维度检索。 使用 Elasticsearch 存储业务数据可以很好的解决我们业务中的搜索需求。而数据进行异构存储后,随之而来的就是数据同步的问题。 二、现有方法及问题 对于数据同步,我们目前的解决方案是建立数据中间表。把需要检索的业务数据,统一放到一张M

关于数据埋点,你需要了解这些基本知识

产品汪每天都在和数据打交道,你知道数据来自哪里吗? 移动app端内的用户行为数据大多来自埋点,了解一些埋点知识,能和数据分析师、技术侃大山,参与到前期的数据采集,更重要是让最终的埋点数据能为我所用,否则可怜巴巴等上几个月是常有的事。   埋点类型 根据埋点方式,可以区分为: 手动埋点半自动埋点全自动埋点 秉承“任何事物都有两面性”的道理:自动程度高的,能解决通用统计,便于统一化管理,但个性化定

Hadoop企业开发案例调优场景

需求 (1)需求:从1G数据中,统计每个单词出现次数。服务器3台,每台配置4G内存,4核CPU,4线程。 (2)需求分析: 1G / 128m = 8个MapTask;1个ReduceTask;1个mrAppMaster 平均每个节点运行10个 / 3台 ≈ 3个任务(4    3    3) HDFS参数调优 (1)修改:hadoop-env.sh export HDFS_NAMENOD

使用SecondaryNameNode恢复NameNode的数据

1)需求: NameNode进程挂了并且存储的数据也丢失了,如何恢复NameNode 此种方式恢复的数据可能存在小部分数据的丢失。 2)故障模拟 (1)kill -9 NameNode进程 [lytfly@hadoop102 current]$ kill -9 19886 (2)删除NameNode存储的数据(/opt/module/hadoop-3.1.4/data/tmp/dfs/na

异构存储(冷热数据分离)

异构存储主要解决不同的数据,存储在不同类型的硬盘中,达到最佳性能的问题。 异构存储Shell操作 (1)查看当前有哪些存储策略可以用 [lytfly@hadoop102 hadoop-3.1.4]$ hdfs storagepolicies -listPolicies (2)为指定路径(数据存储目录)设置指定的存储策略 hdfs storagepolicies -setStoragePo

Hadoop集群数据均衡之磁盘间数据均衡

生产环境,由于硬盘空间不足,往往需要增加一块硬盘。刚加载的硬盘没有数据时,可以执行磁盘数据均衡命令。(Hadoop3.x新特性) plan后面带的节点的名字必须是已经存在的,并且是需要均衡的节点。 如果节点不存在,会报如下错误: 如果节点只有一个硬盘的话,不会创建均衡计划: (1)生成均衡计划 hdfs diskbalancer -plan hadoop102 (2)执行均衡计划 hd

性能分析之MySQL索引实战案例

文章目录 一、前言二、准备三、MySQL索引优化四、MySQL 索引知识回顾五、总结 一、前言 在上一讲性能工具之 JProfiler 简单登录案例分析实战中已经发现SQL没有建立索引问题,本文将一起从代码层去分析为什么没有建立索引? 开源ERP项目地址:https://gitee.com/jishenghua/JSH_ERP 二、准备 打开IDEA找到登录请求资源路径位置

深入探索协同过滤:从原理到推荐模块案例

文章目录 前言一、协同过滤1. 基于用户的协同过滤(UserCF)2. 基于物品的协同过滤(ItemCF)3. 相似度计算方法 二、相似度计算方法1. 欧氏距离2. 皮尔逊相关系数3. 杰卡德相似系数4. 余弦相似度 三、推荐模块案例1.基于文章的协同过滤推荐功能2.基于用户的协同过滤推荐功能 前言     在信息过载的时代,推荐系统成为连接用户与内容的桥梁。本文聚焦于

JAVA智听未来一站式有声阅读平台听书系统小程序源码

智听未来,一站式有声阅读平台听书系统 🌟&nbsp;开篇:遇见未来,从“智听”开始 在这个快节奏的时代,你是否渴望在忙碌的间隙,找到一片属于自己的宁静角落?是否梦想着能随时随地,沉浸在知识的海洋,或是故事的奇幻世界里?今天,就让我带你一起探索“智听未来”——这一站式有声阅读平台听书系统,它正悄悄改变着我们的阅读方式,让未来触手可及! 📚&nbsp;第一站:海量资源,应有尽有 走进“智听