Python入门进阶篇 No.7 —— 常用编码介绍

编程入门 行业动态 更新时间:2024-10-06 12:32:44

Python<a href=https://www.elefans.com/category/jswz/34/1770026.html style=入门进阶篇 No.7 —— 常用编码介绍"/>

Python入门进阶篇 No.7 —— 常用编码介绍

Python入门进阶篇 No.7 —— 常用编码介绍


文章目录

  • Python入门进阶篇 No.7 —— 常用编码介绍
  • 一、常用编码
  • 二、ASCII
  • 三、ISO8859-1
  • 四、GB2312,GBK,GB18030
    • GB2312
    • GBK
    • GB18030
  • 五、Unicode
  • 六、UTF-8
  • 总结

前生篇:file文件操作_操作系统底层关系_写入文件

后世篇:中文乱码问题

基础篇:小白不看都能懂 —— Python之真功夫系列(全章)


一、常用编码

  • 在操作文本文件时,经常会操作中文,这时候就经常会碰到乱码问题。为了让大家有能力解决中文乱码问题,这里简单介绍一下各种编码之间的关系。

  • 常用编码之间的关系如下:

二、ASCII

  • 全称为 American Standard Code for Information Interchange,美国信息交换标准代码,这是世界上最早最通用的单字节编码系统,主要用来显示现代英语及其他西欧语言。
  • ASCII 码用 7 位表示,只能表示 128 个字符。只定义了 2^7 =128 个字符,用7bit 即可完全编码,而一字节 8bit 的容量是 256,所以一字节 ASCII 的编码最高位总是 0。
  • 0~31 表示控制字符如回车、退格、删除等;32~126 表示打印字符即可以通过键盘输入并且能显示出来的字符;其中 48~57 为 0 到 9 十个阿拉伯数字,65~90 为 26 个大写英文字母,97~122 号为 26 个小写英文字母,其余为一些标点符号、运算符号等,具体可以参考 ASCII 标准表(大家自行百度,不在此赘述)。

三、ISO8859-1

  • ISO-8859-1 又称 Latin-1,是一个 8 位单字节字符集,它把 ASCII 的最高位也利用起来,并兼容了 ASCII,新增的空间是 128,但它并没有完全用完。
  • 在 ASCII 编码之上又增加了西欧语言、希腊语、泰语、阿拉伯语、希伯来语对应的文字符号,它是向下兼容 ASCII 编码

四、GB2312,GBK,GB18030

GB2312

  • GB2312 全称为信息交换用汉字编码字符集,是中国于 1980 年发布,主要用于计算机系统中的汉字处理。GB2312 主要收录了 6763 个汉字、682 个符号。
  • GB2312覆盖了汉字的大部分使用率,但不能处理像古汉语等特殊的罕用字,所以后来出现了像 GBK、GB18030 这种编码。
  • GB2312 完全兼容 ISO8859-1。

GBK

全称为 Chinese Internal Code Specification,即汉字内码扩展规范,于 1995 年制定。它主要是扩展了 GB2312,在它的基础上又加了更多的汉字,它一共收录了 21003 个汉字

GB18030

  • 现在最新的内码字集于 2000 年发布,并于 2001 年强制执行,包含了中国大部分少数民族的语言字符,收录汉字数超过 70000 余个。
  • 它主要采用单字节、双字节、四字节对字符编码,它是向下兼容 GB2312 和 GBK 的,虽然是我国的强制使用标准,但在实际生产中很少用到,用得最多的反而是 GBK 和 GB2312

五、Unicode

  • Unicode 编码设计成了固定两个字节,所有的字符都用 16 位(2^16=65536)表示,包括之前只占 8 位的英文字符等,所以会造成空间的浪费,UNICODE 在很长的一段时间内都没有得到推广应用。Unicode 完全重新设计,不兼容 iso8859-1,也不兼容任何其他编码。

六、UTF-8

  • 对于英文字母,unicode 也需要两个字节来表示。所以 unicode 不便于传输和存储。因此而产生了 UTF 编码,UTF-8 全称是(8-bit UnicodeTransformation Format)。
  • UTF 编码兼容 iso8859-1 编码,同时也可以用来表示所有语言的字符,不过,UTF 编码是不定长编码,每一个字符的长度从 1-4 个字节不等。其中,英文字母都是用一个字节表示,而汉字使用三个字节。
  • 一般项目都会使用 UTF-8。unicode 中虽然汉字是两个字节,UTF-8 中汉字是 3 个字节。但是互联网中一个网页也包含了大量的英文字母,这些英文字母只占用 1 个字节,整体占用空间,UTF-8 仍然优于Unicode。

总结

以上帮各位总结好了,收藏,关注即可查收。

前生篇:file文件操作_操作系统底层关系_写入文件

后世篇:中文乱码问题

基础篇:小白不看都能懂 —— Python之真功夫系列(全章)


关注下方公众号,免费拿Python学习资料!!!

更多推荐

Python入门进阶篇 No.7 —— 常用编码介绍

本文发布于:2024-02-07 07:02:55,感谢您对本站的认可!
本文链接:https://www.elefans.com/category/jswz/34/1754339.html
版权声明:本站内容均来自互联网,仅供演示用,请勿用于商业和其他非法用途。如果侵犯了您的权益请与我们联系,我们将在24小时内删除。
本文标签:入门   常用   进阶篇   Python

发布评论

评论列表 (有 0 条评论)
草根站长

>www.elefans.com

编程频道|电子爱好者 - 技术资讯及电子产品介绍!