Java 字符编码与解码

1、字符编码的发展历程

①、ASCII 码

  因为计算机只认识数字,所以我们在计算机里面的一切数据都是以数字来表示,因为英文字符有限,所以规定使用的字节的最高位是 0,每一个字节都是以 0-127 之间的数字来表示。比如 A 对应 65,a 对应 97。这便是 美国标准信息交换码,ASCII

		String str = new String("Aa");
		byte[] strASCII = str.getBytes("ASCII");
		System.out.println(Arrays.toString(strASCII));//[65, 97]

  ②、GB2312 码

  随着计算机在全球的普及,很多国家和地区都把自己的字符引入了计算机,比如汉字。此时发现一个字节能表示的数字范围太小,不能包含所有的中文汉字。那么就规定使用两个字节来表示一个汉字。

  规定:原有的 ASCII 字符的编码保持不变,仍然使用一个字节表示,为了区别一个中文字符与两个 ASCII 码字符相区别。中文字符的每个字节最高位规定为 1(即中文的二进制是负数),这便是 GB2312 编码

		String str = new String("Aa帅锅");
		byte[] strASCII = str.getBytes("GB2312");
		System.out.println(Arrays.toString(strASCII));//[65, 97, -53, -89, -71, -8]

  ③、GBK

  由于中国汉字太多,在 GB2312 的基础上增加了更多的中文字符,这种编码是 GBK

问题:如果只是在中国,那么大家都认识汉字,但是如果是别的国家,而该国家的码表中是没有收录汉字的。那么计算机在显示的时候就为乱码或是别的字符

解决办法:为了解决各个国家因为本地化字符编码带来的影响,就把全世界所有的字符统一进行编码---Unicode 编码

     此时某一个字符在全世界任何地方显示都是固定的,比如汉字 哥,在任何地方都是以十六进制 54E5 来表示。

     Unicode 的字符编码都占有两个字节

  ④、UTF-8

  是一种针对 Unicode 的可变长度字符编码,又称为 万国码,是 Unicode 的实现方式之一。编码中的第一个字节仍与 ASCII 兼容,这使得原来处理 ASCII 字符的软件无须或只需做少部分修改,即可继续使用。因此,它逐渐成为电子邮件、网页及其他存储或传送文字的应用中,优先采用的编码。互联网工程工作小组(IETF)要求所有互联网协议都必须支持 UTF-8 编码

		String str = new String("Aa帅锅");
		byte[] strASCII = str.getBytes("UTF-8");
		System.out.println(Arrays.toString(strASCII));//[65, 97, -27, -72, -123, -23, -108, -123]

存储字母、数字:无论什么字符集都占有 1 个字节

存储汉字:GBK 家族占有 2 个字节。UTF-8 占有 3 个字节

       不能使用单字节的字符集(ASCII/ISO-8859-1)来存储中文

2、字符的编码和解码

信息在计算机网络中传输是以字节的形式。那么如何变为字节?这就是编码的过程。那么计算机接收了这个编码,如何让使用者认识呢?那必须要将字节转换为人所识别的字符串形式,这就是解码的过程。

  编码:将字符串转换为 byte 数组

  解码:把 byte 数组转换为 字符串

注意:①、编码格式和解码格式必须一致,否则乱码

String str = new String("Aa帅锅");
		//编码操作
		byte[] strByte = str.getBytes("GBK");
		System.out.println(Arrays.toString(strByte));//[65, 97, -53, -89, -71, -8]
		
		//解码操作  
		//注意编码的字符集和解码的字符集格式必须一致(是其扩展字符集也可以),否则会乱码
		//第一种:编码格式为 GBK,解码格式为 ISO-8859-1  那么就会乱码
		String str2 = new String(strByte,"ISO-8859-1");
		System.out.println(str2); //Aa?§??
		
		//第二种:编码和解码格式一致
		String str3 = new String(strByte,"GBK");
		System.out.println(str3); //Aa帅锅

  ②、有时候编码为和解码格式一致了,但是还是乱码,这是因为在数据在传输过程中经过服务器的处理,而这个服务器可能是外国人编写的,那么就会将数据转换为 别的字符格式,那么你如果还是直接转为自己想要的格式是会乱码的。

  解决办法:先获取经过服务器之后的数据还原编码,然后在进行解码

String str = new String("Aa帅锅");
		//编码操作
		byte[] strByte = str.getBytes("UTF-8");
		System.out.println(Arrays.toString(strByte));//[65, 97, -27, -72, -123, -23, -108, -123]
		
		
		//中间经过了服务器的传输,编码格式转成了 ISO-8859-1
		String str2 = new String(strByte,"ISO-8859-1");
		
		//解码操作  ,此时如果直接进行解码,那么会乱码
		String str3 = new String(str2.getBytes(),"UTF-8");
		System.out.println(str3); //Aa???????
		
		//对于上面的乱码,我们必须先还原服务器之前的编码格式,然后在进行解码。那么就不会乱码
		byte[] strByte2 = str2.getBytes("ISO-8859-1");
		String str4 = new String(strByte2,"UTF-8");
		System.out.println(str4); //Aa帅锅

本文参与腾讯云自媒体分享计划,欢迎正在阅读的你也加入,一起分享。

发表于

我来说两句

0 条评论
登录 后参与评论

相关文章

来自专栏转载gongluck的CSDN博客

c++ 中__declspec 的用法

c++ 中__declspec 的用法 语法说明: __declspec ( extended-decl-modifier-seq ) 扩展修饰符: ...

5617
来自专栏白驹过隙

Python - 学习经验分享

30412
来自专栏云霄雨霁

Java--类和对象之基础知识

1383
来自专栏Python小屋

Python运算符+与+=的那些事

这两个运算符很多语言都提供了,好像也没啥好说的,不就是像下面这样子用嘛。 >>> x = 3 >>> y = x+6 >>> y 9 >>> x += 6 >>...

2695
来自专栏用户3030674的专栏

java单例模式

单例设计模式:解决一个类在内存中只存在一个对象  多用于环境变量设置等  单例模式的要求:1.只能有一个对象,禁止其他程序建立该类对象          2....

631
来自专栏水击三千

JavaScript变量作用域

执行环境是JavaScript中比较重要的概念。执行环境定义了变量或者函数有权访问的其他数据决定了他们各自的行为,每个执行环境都有一个与之关联的变量,环境中定义...

2679
来自专栏老马说编程

计算机程序的思维逻辑 (9) - 条件执行的本质

条件执行 前面几节我们介绍了如何定义数据和进行基本运算,为了对数据有透彻的理解,我们介绍了各种类型数据的二进制表示。 现在,让我们回顾程序本身,只进行基本操...

18610
来自专栏程序员互动联盟

【答疑释惑】JavaScript解释器是干什么用的?

问题: ? JavaScript解释器主要是干什么用的?他不是一门语言吗? 解答: JavaScript是一门脚本语言,是需要被别人解释执行的,这个别人就是Ja...

2856
来自专栏Golang语言社区

Golang语言--闭包和普通函数调用区别

代码: ? 运行这段程序,输出结果为 1 2 3 3 2 1 这里就是普通的函数调用,每次调用func p时,完成 i 的值复制,然后打印,此时 i 值复制了3...

2716
来自专栏微信公众号:Java团长

触摸Java常量池

java常量池是一个经久不衰的话题,也是面试官的最爱,题目花样百出,这次好好总结一下。

1061

扫码关注云+社区