UTF-8和UTF-8MB4编码的区别及应用场景详解

频道:服务器安全防护 日期: 浏览:248
蓝梯子海外云服务器

utf8mb4和utf8一样吗?MySQL在5.5.3之后增加了这个utf8mb4的编码,mb4就是most bytes 4的意思,专门用来兼容四字节的unicode。utf8mb4是utf8的超集,除了将编码改为utf8mb4外不需要做其他转换。当然,为了节省空间,一般情况下使用utf8也就够了。

UTF-8 和 UTF-8MB4 有什么区别?

UTF-8 和 UTF-8MB4 是 Unicode 字符编码的变体,它们之间的主要区别在于支持的字符集和编码范围。

UTF-8 是一种可变长度的字符编码,它使用 1-4 字节编码字符,其中常见的字符使用 1-3 字节编码,较不常见的字符使用 4 字节编码。UTF-8 是一种非常流行的字符编码,它广泛用于互联网和计算机系统中。UTF-8 支持 Unicode 字符集中的所有字符,但对于一些较不常见的字符,需要使用 4 字节编码来表示。

UTF-8MB4 是 UTF-8 的一个超集,它支持所有 Unicode 字符,包括 Emoji 表情符号和其他一些较不常见的字符。UTF-8MB4 中的 “MB4” 代表 “most bytes 4″,这意味着它支持使用 4 字节编码的字符。Unicode 字符集中的一些字符需要使用 4 字节编码,而 UTF-8 中默认只支持 1-3 字节编码。因此,如果您需要存储包含 4 字节编码字符的文本数据,则需要使用 UTF-8MB4 编码。

在 MySQL 数据库中,UTF-8 编码只支持最大长度为 3 字节的字符,而 UTF-8MB4 编码支持最大长度为 4 字节的字符。因此,如果您需要存储包含 4 字节编码字符的文本数据,您应该使用 UTF-8MB4 编码。

既然utf8能够存下大部分中文汉字,那为什么还要使用utf8mb4呢?

原来mysql支持的 utf8 编码最大字符长度为 3 字节,如果遇到 4 字节的宽字符就会插入异常了。三个字节的 UTF-8 最大能编码的 Unicode 字符是 0xffff,也就是 Unicode 中的基本多文种平面(BMP)。也就是说,任何不在基本多文本平面的 Unicode字符,都无法使用 Mysql 的 utf8 字符集存储。包括 Emoji 表情(Emoji 是一种特殊的 Unicode 编码,常见于 ios 和 android 手机上),和很多不常用的汉字,以及任何新增的 Unicode 字符等等(utf8的缺点)。

通常,计算机在存储字符时,会根据不同类型的字符以及编码方式分配存储空间。例如以下几种编码方式;

UTF-8和UTF-8MB4编码的区别及应用场景详解

①ASCII编码中,一个英文字母(不分大小写)占用一个字节的空间,一个中文汉字占用两个字节的空间。一个二进制的数字序列,在计算机中作为一个数字单元存储时,一般为8位二进制数,换算为十进制。最小值0,最大值255。

②UTF-8编码中,一个英文字符占用一个字节的存储空间,一个中文(含繁体)占用三个字节的存储空间。

③Unicode编码中,一个英文占用两个字节的存储空间,一个中文(含繁体)占用两个字节的存储空间。

④UTF-16编码中,一个英文字母字符或一个汉字字符存储都需要占用2个字节的存储空间(Unicode扩展区的一些汉字存储需要4个字节)。

⑤UTF-32编码中,世界上任何字符的存储都需要占用4个字节的存储空间。

如何选择适当的字符编码来存储和处理文本数据?

在选择字符编码时,您应该考虑以下几点:

1.数据库支持的字符编码:不同的数据库支持不同的字符编码。如果您正在使用 MySQL 数据库,您应该选择支持 UTF-8MB4 编码的版本,以确保您可以正确地存储和检索包含 4 字节编码字符的文本数据。

2.存储的文本数据中是否包含 4 字节编码字符:如果您需要存储包含 4 字节编码字符的文本数据,您应该选择使用 UTF-8MB4 编码。否则,您可以使用 UTF-8 编码,因为它可以满足大多数情况下的需求。

3.应用程序的要求:您的应用程序可能会有一些特定的要求,例如需要支持多种语言或特殊字符集。在这种情况下,您应该选择适当的字符编码来满足这些要求。

UTF-8和UTF-8MB4编码的区别及应用场景详解

总的来说,如果您需要存储包含 4 字节编码字符的文本数据,您应该使用 UTF-8MB4 编码。否则,您可以使用 UTF-8 编码。

既然utf8能兼容绝大部分的字符,为什么要扩展utf8mb4?

随着互联网的发展,产生了许多新类型的字符,例如emoji这种类型的符号,也就是我们通常在聊天时发的小黄脸表情,这种字符的出现不在基本多平面的Unicode字符之中,导致无法在MySQL中使用utf8存储,MySQL于是对utf8字符进行了扩展,增加了utf8mb4这个编码。

所以,设计数据库时如果想要允许用户使用特殊符号,最好使用utf8mb4编码来存储,使得数据库有更好的兼容性,但是这样设计会导致耗费更多的存储空间。

总结:

UTF-8 是一种变长编码,用于表示 Unicode 字符集中的字符,最多可以表示 1,112,064 个字符。

UTF-8MB4 是对 UTF-8 的扩展,支持更广泛的字符集范围,可以表示 Unicode 字符集中的所有字符,包括辅助平面和 Emoji 表情等。

在大多数情况下,使用 UTF-8 编码是常见且足够的。只有在需要存储或处理特殊字符集时,才需要考虑使用 UTF-8MB4 编码。

 

蓝梯子海外云服务器