[算法系列之十六]数据压缩之游程编码

2024-02-19 01:38

本文主要是介绍[算法系列之十六]数据压缩之游程编码,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

简介

无论现在计算机和网络的速度有多快,用户始终要求更快速的体验。为了降低传输数据的容量,我们通常会对数据进行压缩。这就是计算机科学领域一直是研究和发展的焦点的原因。

数据压缩算法有很多,有些是无损的,有些是有损的,但是它们的主要目标都是降低存储空间和传输量。对于两个远距离节点之间的数据传输,这些压缩算法非常有用。也许最直观的例子就是web服务器和浏览器之间的数据传输。

在过去的几年里做了很多关于文件压缩的研究,这些研究基于客户端实现的。这样的文件有javascript、css、html和图像。实际上,服务器和客户端都具备一些数据压缩技术,例如GZIP的使用极大地降低了数据传输量。此外,还有很多的工具和技巧能够降低数据大小。

事实上,当文件在客户的虚拟机上执行时,程序员不必理会文件的具体格式如何。如此一来空格、水平制表符和换行符对于文件上下文的理解没有任何意义。这就是YUI Compressor、Google Closure Compiler等压缩工具移除那些符号的原因。当然,为了提高压缩率文件还能被进一步压缩。本篇文章暂不讨论这一点,但这表明了数据压缩算法的重要性。

如果我们使用一些数据压缩工具,效果会更好。不幸的是,事实并非如此,压缩率通常取决于数据本身。很明显,数据压缩算法的选择主要取决于数据,我们必须首先对数据进行研究。

这里我将讨论“游程编码”(run-length encoding),它是一种十分简单的无损数据压缩算法,在某些情况下非常有用。

这里写图片描述

概述

该算法的实现是用当前数据元素以及该元素连续出现的次数来取代字符串中连续出现的数据部分。具体实现我们通过一个字符串实例来说明。

aaaaaaaaaabbbaxxxxyyyzyx

字符串长度为24,我们可以看到字符串中有很多的重复部分。使用游程算法,我们用较短的字符串后加一个计数值来替换游程对象。

a10b3a1x4y3z1y1x1

此时字符串长度为17,大约是初始字符串长度的70%。很明显,这并不是压缩给定字符串的最佳方式。例如当字符仅出现一次时,我们并不需要其后添加“1”。在某些情况下,这种方式会增加初始字符串的长度,而这违反了我们的初衷。这样我们得到的字符串如下。

a10b3ax4y3zyx

此时字符串长度为13,是初始长度的54%!上面例子的一个变种是不对字符保持计数,而是对位置进行计数。这样原始字符串可以被压缩成下面这样。

a0b10a13x14y18z21y22x23

使用这两种方式中的哪一个取决于我们的目标。第二种情况下,我们能够实现二分查找的优化。

显然,这个算法不仅适用于字符串。对数组也能取得很好的结果。一个典型的例子是服务器和客户机之间字符对象(JSON)的传输。特别是如果有大量重复数据序列的存在,我们能获取很好的压缩结果。

实现

下面的实现是假设我们要使用c++(原文使用PHP实现)编写程序对字符串进行压缩。但是这个算法本质上并没有限制我们只能压缩字符串。正如我前面所说,只要略微修改,我们就能将其用于其他数据结构。游程算法适用于大量重复元素序列非常重要,不管是字符元素还是数组元素。

/*--------------------------------
*   日期:2015-02-07
*   作者:SJF0115
*   题目: 数据压缩之Run-Length Encoding
*   博客:
------------------------------------*/
#include <iostream>
using namespace std;string RunLengthEncoding(string str){int size = str.size();if(size <= 0){return "";}//ifchar pre = ' ';string result;int count = 0;for(int i = 0;i < size;++i){if(str[i] != pre){if(i > 0){result += to_string(count);}//ifresult += str[i];count = 0;pre = str[i];}//if++count;}//forresult += to_string(count);return result;
}int main(){//string str("aaaaaaaaaabbbaxxxxyyzyx");//string str("abbbb");string str("a");string result = RunLengthEncoding(str);cout<<"压缩后数据->"<<result<<endl;return 0;
}

或者

/*--------------------------------
*   日期:2015-02-07
*   作者:SJF0115
*   题目: 数据压缩之Run-Length Encoding
*   博客:
------------------------------------*/
string RunLengthEncoding(string str){int size = str.size();if(size <= 0){return "";}//ifstring result(str.substr(0,1));int count = 0;for(int i = 0;i < size;++i){if(i > 0 && str[i] != str[i-1]){result += to_string(count);result += str[i];count = 0;}//if++count;}//forresult += to_string(count);return result;
}

略微优化。

/*--------------------------------
*   日期:2015-02-07
*   作者:SJF0115
*   题目: 数据压缩之Run-Length Encoding
*   博客:
------------------------------------*/
string RunLengthEncoding(string str){int size = str.size();if(size <= 0){return "";}//ifstring result(str.substr(0,1));int count = 0;for(int i = 0;i < size;++i){if(i > 0 && str[i] != str[i-1]){if(count > 1){result += to_string(count);}//ifresult += str[i];count = 0;}//if++count;}//forif(count > 1){result += to_string(count);}//ifreturn result;
}
aaaaaaaaaabbbaxxxxyyzyx  ---->  a10b3ax4y2zyx

最后一个小变化——现在我们存储字符位置。

/*--------------------------------
*   日期:2015-02-07
*   作者:SJF0115
*   题目: 数据压缩之Run-Length Encoding
*   博客:
------------------------------------*/
string RunLengthEncoding(string str){int size = str.size();if(size <= 0){return "";}//ifstring result;for(int i = 0;i < size;++i){if(i == 0){result += str[i]+to_string(i);}//ifelse if(i > 0 && str[i] != str[i-1]){result += str[i] + to_string(i);}//if}//forreturn result;
}
aaaaaaaaaabbbaxxxxyyzyx  ---->  a0b10a13x14y18z20y21x22

复杂性和数据压缩

我们习惯使用时间复杂度来衡量时间,通常希望能找到最快的实现方式,比如查找算法。在这里快速压缩数据并不特别重要,重要的是尽可能的无损压缩,使得输出尽可能的小。游程编码的优点在于该算法容易实现。

应用程序

在很多情况下,我们可以使用游程编码。它常用于图像压缩,特别是用于黑白图片处理时是效果非常好。这里,我将介绍上面提及的另一种应用情况。假设我们要使用JSON将大量数组数据传给我们的Ajax程序。假设这些传输数据是一些年份,例如电影首映的年份。一年内有很多电影首映,虽然数据已被排序,但实际上我们没有得到任何好处。更要命的是有大量的数据序列。这里我们可以使用游程编码。

$data = array(0   => 1991,1   => 1991,...2223    => 1991,2224    => 1992,...19298   => 1995,19299   => 1996,...
);

正如你看到的,传输整个数组将会是一个噩梦,特别是如果网络的速度很慢。最好对数据进行压缩(例如使用PHP的json_encode)。

// {"0":1991,"1":1991, ..., "2223":1991,"2224":1992, ..., "19298":1995,"19299":1996, ...}
echo json_encode($data);

运行游程编码之后,我们得到结果像以下数组一样(注意这些只是样本数据,最佳存储数据格式取决于你)

$data = array(0 => array(1991, 2224),1 => array(1992, 3948),2 => array(1995, 2398),3 => array(1996, 3489),
);

JSON输出

// [[1991,2224],[1992,3948],[1995,2398],[1996,3489]]
echo json_encode($data);

注意如果是已排序数据,我们能够获得更好的压缩结果!!!这种方式能够用于图像,图形或者地图坐标的压缩。

这是数据压缩在日常工作中有用的唯一例子。尽管服务器和客户机之间的通信可以优化和压缩,我们能够改善它。换句话说我们不能够保证对方是否支持压缩。

那么,相应的客户端必须对数据进行解压,这个过程很缓慢。

在第一种情况下,我们只是用时间去传输,如下面的流程图所示。

这里写图片描述
未压缩数据传输时间!

第二种情况,我们应该累加压缩,传输和解压的时间。

这里写图片描述
压缩数据传输时间!

所有这些都很重要,但总的来说数据压缩在我们日常生活中的多数情况下都很方便。

原文链接

Computer Algorithms: Data Compression with Run-length Encoding

这篇关于[算法系列之十六]数据压缩之游程编码的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/723100

相关文章

Spring Security 从入门到进阶系列教程

Spring Security 入门系列 《保护 Web 应用的安全》 《Spring-Security-入门(一):登录与退出》 《Spring-Security-入门(二):基于数据库验证》 《Spring-Security-入门(三):密码加密》 《Spring-Security-入门(四):自定义-Filter》 《Spring-Security-入门(五):在 Sprin

不懂推荐算法也能设计推荐系统

本文以商业化应用推荐为例,告诉我们不懂推荐算法的产品,也能从产品侧出发, 设计出一款不错的推荐系统。 相信很多新手产品,看到算法二字,多是懵圈的。 什么排序算法、最短路径等都是相对传统的算法(注:传统是指科班出身的产品都会接触过)。但对于推荐算法,多数产品对着网上搜到的资源,都会无从下手。特别当某些推荐算法 和 “AI”扯上关系后,更是加大了理解的难度。 但,不了解推荐算法,就无法做推荐系

Hadoop数据压缩使用介绍

一、压缩原则 (1)运算密集型的Job,少用压缩 (2)IO密集型的Job,多用压缩 二、压缩算法比较 三、压缩位置选择 四、压缩参数配置 1)为了支持多种压缩/解压缩算法,Hadoop引入了编码/解码器 2)要在Hadoop中启用压缩,可以配置如下参数

康拓展开(hash算法中会用到)

康拓展开是一个全排列到一个自然数的双射(也就是某个全排列与某个自然数一一对应) 公式: X=a[n]*(n-1)!+a[n-1]*(n-2)!+...+a[i]*(i-1)!+...+a[1]*0! 其中,a[i]为整数,并且0<=a[i]<i,1<=i<=n。(a[i]在不同应用中的含义不同); 典型应用: 计算当前排列在所有由小到大全排列中的顺序,也就是说求当前排列是第

csu 1446 Problem J Modified LCS (扩展欧几里得算法的简单应用)

这是一道扩展欧几里得算法的简单应用题,这题是在湖南多校训练赛中队友ac的一道题,在比赛之后请教了队友,然后自己把它a掉 这也是自己独自做扩展欧几里得算法的题目 题意:把题意转变下就变成了:求d1*x - d2*y = f2 - f1的解,很明显用exgcd来解 下面介绍一下exgcd的一些知识点:求ax + by = c的解 一、首先求ax + by = gcd(a,b)的解 这个

综合安防管理平台LntonAIServer视频监控汇聚抖动检测算法优势

LntonAIServer视频质量诊断功能中的抖动检测是一个专门针对视频稳定性进行分析的功能。抖动通常是指视频帧之间的不必要运动,这种运动可能是由于摄像机的移动、传输中的错误或编解码问题导致的。抖动检测对于确保视频内容的平滑性和观看体验至关重要。 优势 1. 提高图像质量 - 清晰度提升:减少抖动,提高图像的清晰度和细节表现力,使得监控画面更加真实可信。 - 细节增强:在低光条件下,抖

【数据结构】——原来排序算法搞懂这些就行,轻松拿捏

前言:快速排序的实现最重要的是找基准值,下面让我们来了解如何实现找基准值 基准值的注释:在快排的过程中,每一次我们要取一个元素作为枢纽值,以这个数字来将序列划分为两部分。 在此我们采用三数取中法,也就是取左端、中间、右端三个数,然后进行排序,将中间数作为枢纽值。 快速排序实现主框架: //快速排序 void QuickSort(int* arr, int left, int rig

poj 3974 and hdu 3068 最长回文串的O(n)解法(Manacher算法)

求一段字符串中的最长回文串。 因为数据量比较大,用原来的O(n^2)会爆。 小白上的O(n^2)解法代码:TLE啦~ #include<stdio.h>#include<string.h>const int Maxn = 1000000;char s[Maxn];int main(){char e[] = {"END"};while(scanf("%s", s) != EO

科研绘图系列:R语言扩展物种堆积图(Extended Stacked Barplot)

介绍 R语言的扩展物种堆积图是一种数据可视化工具,它不仅展示了物种的堆积结果,还整合了不同样本分组之间的差异性分析结果。这种图形表示方法能够直观地比较不同物种在各个分组中的显著性差异,为研究者提供了一种有效的数据解读方式。 加载R包 knitr::opts_chunk$set(warning = F, message = F)library(tidyverse)library(phyl

秋招最新大模型算法面试,熬夜都要肝完它

💥大家在面试大模型LLM这个板块的时候,不知道面试完会不会复盘、总结,做笔记的习惯,这份大模型算法岗面试八股笔记也帮助不少人拿到过offer ✨对于面试大模型算法工程师会有一定的帮助,都附有完整答案,熬夜也要看完,祝大家一臂之力 这份《大模型算法工程师面试题》已经上传CSDN,还有完整版的大模型 AI 学习资料,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费