对utf-8字符串计算长度

2024-05-15 02:18
文章标签 字符串 utf 计算长度

本文主要是介绍对utf-8字符串计算长度,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

对utf-8字符串计算长度

1.简介

在linux操作系统下,默认使用utf-8字符集,当程序中的在流中使用字符(ASCII)时用strlen()函数完全能够处理问题,但是在流中使用中文汉字时,strlen()就力不从心了。若更改字符集为GB2312,一个汉字等于两个字符,但是此更改不仅要修改文件保存的保存字符集,还要修改系统的字符集及终端的字符集。所以我通过对utf-8字符集的学习,自己编写了一个求utf-8字符编码的长度计算函数。


2.UTF-8 字符集编码格式

           编码                                                             长度(Byte)
      1               2               3            4        
0xxxxxxx                                                                        1

110xxxxx 10xxxxxx                                                       2

1110xxxx 10xxxxxx  10xxxxxx                                      3

11110xxx 10xxxxxx 10xxxxxx 10xxxxxx                       4

从编码中第一列可看出:  1.最高位为0时,编码长度为1, 可存放一个ASCII字符。
                                           2.最高位为1,次高位为1,第6位为0时,编码长度为2。
                                           3.最高位为1,次高位为1,第6位为1,第5位为0时,编码长度为3,绝大多数汉字的utf-8编码的长度都为3。

                                           ....以此类推.....


3.函数原型
    void       GetUtf8Length (     char   const   *str ,             int     cnt[]       );
    返回值为空: 这里不去判断输入字符串指针是否安全,故无返回。(可以根据需求修改)
    char const *str: 输入字符串指针,并且告诉编译器,程序不能修改指针所指向地址里的值。
    int cnt[]: 这个数组用于存储各种长度字符的个数。
               cnt[0] 字符串中,各种长度字符的总和。
               cnt[1] 长度为1的字符总和, 也就是源字符串中ASCII字符的个数。
               cnt[2] 长度为2的字符总和。
               cnt[3] 长度为3的字符总和。
               cnt[4] 长度为4的字符总和。
               注: int cnt[5]; 这个声明需在调用GetUtf8Length函数的代码块作用域中定义。
                    数组初始化,全为0 如用: # include <string.h>                        memset( cnt, 0, sizeof(int) * 5);


4.函数定义

<span style="font-size:14px;">void
GetUtf8Length( char const *str, int *cnt){while( *str != '\0' ){if( *str & 1<<7 ){/* 第8位(从右到左)为1*/if( *str & (1<<6) ){/*第7位为1*/if( *str & (1<<5) ){/*第6位为1*/if( *str & (1<<4)){/*第5位为1  11110xxx*/cnt[4]++,cnt[0]++,str += 4;/*4字节的字符总数加1,各种长度总数加1,指针向后移动4位*/continue;/*开始下次循环*/}cnt[3]++,cnt[0]++,str += 3;/* 1110xxxx*/continue;}cnt[2]++,cnt[0]++,str += 2;/*110xxxxx*/continue;}}cnt[1]++,cnt[0]++,str += 1;/*0xxxxxxx*/continue;}
}	
</span>
5.测试程序

<span style="font-size:14px;">/******************************************START******************************************************/
# include <stdio.h>
# include <stdlib.h>
# include <string.h>/*不用memset函数,可以不要*/void GetUtf8Length( char const *str, int *cnt );/******************************************MAIN******************************************************/
int
main( void ){char str[] = "这是一条UTF-8的文本,请数数aaaabbbbcccc*(是的.";int cnt[5];memset( cnt, 0, sizeof(int) * 4 );GetUtf8Length( str, cnt);printf( " 这条文本的字符共%d个 ; 其中汉字有%d个, 英文字符%d个\n", cnt[0], cnt[3], cnt[1] );return EXIT_SUCCESS;
}
/******************************************END*******************************************************//******************************************FUNC******************************************************/
void
GetUtf8Length( char const *str, int *cnt){while( *str != '\0' ){if( *str & 1<<7 ){if( *str & (1<<6) ){if( *str & (1<<5) ){if( *str & (1<<4)){cnt[4]++,cnt[0]++,str += 4;continue;}cnt[3]++,cnt[0]++,str += 3;continue;}cnt[2]++,cnt[0]++,str += 2;continue;}}cnt[1]++,cnt[0]++,str += 1;continue;}
}
/*********************************************END****************************************************/</span>

6.运行图片




                                                                          Writer:  Anden       Email:  andensemail@163.com      Time:  2016.03.30

这篇关于对utf-8字符串计算长度的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/990527

相关文章

Java实现将HTML文件与字符串转换为图片

《Java实现将HTML文件与字符串转换为图片》在Java开发中,我们经常会遇到将HTML内容转换为图片的需求,本文小编就来和大家详细讲讲如何使用FreeSpire.DocforJava库来实现这一功... 目录前言核心实现:html 转图片完整代码场景 1:转换本地 HTML 文件为图片场景 2:转换 H

Java使用正则提取字符串中的内容的详细步骤

《Java使用正则提取字符串中的内容的详细步骤》:本文主要介绍Java中使用正则表达式提取字符串内容的方法,通过Pattern和Matcher类实现,涵盖编译正则、查找匹配、分组捕获、数字与邮箱提... 目录1. 基础流程2. 关键方法说明3. 常见场景示例场景1:提取所有数字场景2:提取邮箱地址4. 高级

Python 字符串裁切与提取全面且实用的解决方案

《Python字符串裁切与提取全面且实用的解决方案》本文梳理了Python字符串处理方法,涵盖基础切片、split/partition分割、正则匹配及结构化数据解析(如BeautifulSoup、j... 目录python 字符串裁切与提取的完整指南 基础切片方法1. 使用切片操作符[start:end]2

MyBatis的xml中字符串类型判空与非字符串类型判空处理方式(最新整理)

《MyBatis的xml中字符串类型判空与非字符串类型判空处理方式(最新整理)》本文给大家介绍MyBatis的xml中字符串类型判空与非字符串类型判空处理方式,本文给大家介绍的非常详细,对大家的学习或... 目录完整 Hutool 写法版本对比优化为什么status变成Long?为什么 price 没事?怎

MySQL常用字符串函数示例和场景介绍

《MySQL常用字符串函数示例和场景介绍》MySQL提供了丰富的字符串函数帮助我们高效地对字符串进行处理、转换和分析,本文我将全面且深入地介绍MySQL常用的字符串函数,并结合具体示例和场景,帮你熟练... 目录一、字符串函数概述1.1 字符串函数的作用1.2 字符串函数分类二、字符串长度与统计函数2.1

C# $字符串插值的使用

《C#$字符串插值的使用》本文介绍了C#中的字符串插值功能,详细介绍了使用$符号的实现方式,文中通过示例代码介绍的非常详细,需要的朋友们下面随着小编来一起学习学习吧... 目录$ 字符使用方式创建内插字符串包含不同的数据类型控制内插表达式的格式控制内插表达式的对齐方式内插表达式中使用转义序列内插表达式中使用

详解MySQL中JSON数据类型用法及与传统JSON字符串对比

《详解MySQL中JSON数据类型用法及与传统JSON字符串对比》MySQL从5.7版本开始引入了JSON数据类型,专门用于存储JSON格式的数据,本文将为大家简单介绍一下MySQL中JSON数据类型... 目录前言基本用法jsON数据类型 vs 传统JSON字符串1. 存储方式2. 查询方式对比3. 索引

MySQL字符串常用函数详解

《MySQL字符串常用函数详解》本文给大家介绍MySQL字符串常用函数,本文结合实例代码给大家介绍的非常详细,对大家学习或工作具有一定的参考借鉴价值,需要的朋友参考下吧... 目录mysql字符串常用函数一、获取二、大小写转换三、拼接四、截取五、比较、反转、替换六、去空白、填充MySQL字符串常用函数一、

Python中反转字符串的常见方法小结

《Python中反转字符串的常见方法小结》在Python中,字符串对象没有内置的反转方法,然而,在实际开发中,我们经常会遇到需要反转字符串的场景,比如处理回文字符串、文本加密等,因此,掌握如何在Pyt... 目录python中反转字符串的方法技术背景实现步骤1. 使用切片2. 使用 reversed() 函

MySQL查询JSON数组字段包含特定字符串的方法

《MySQL查询JSON数组字段包含特定字符串的方法》在MySQL数据库中,当某个字段存储的是JSON数组,需要查询数组中包含特定字符串的记录时传统的LIKE语句无法直接使用,下面小编就为大家介绍两种... 目录问题背景解决方案对比1. 精确匹配方案(推荐)2. 模糊匹配方案参数化查询示例使用场景建议性能优