网站制作

常见字符编码格式

更新时间：2025-01-11 07:45:49

1. GB2312：简体中文编码，一个汉字占用两个字节，在中国大陆是主要的编码方式。当文档或网页中包含繁体中文、日文、韩文等时，这些内容可能无法被正确编码。

2. BIG5：繁体中文编码，主要在台湾地区使用。

3. GBK：支持简体和繁体中文，但对于其他国家的非拉丁字母语言仍然存在问题。

4. UTF-8：Unicode编码的一种。Unicode用一些基本的保留字符制定了三套编码方式，它们分别是UTF-8、UTF-16和UTF-32。在UTF-8中，字符是以8位序列来编码的，用一个或几个字节来表示一个字符。这种方式的最大好处是UTF-8保留了ASCII字符的编码作为它的一部分。UTF-8俗称“万国码”，可以同屏显示多语种，一个汉字占用三个字节。为了实现国际化，网页应尽可能采用UTF-8编码。当然，处理中文时HTTP头也要改为UTF-8编码的——加上``。

5. EUC_KR：用来存储韩国KSX1001字符集（旧称KSC5601）的字符。此标准由KSX2901（旧称KS C 5861）定义。KS X 1001字符使用两个字节来表示。“高位字节”使用0xA1-0xFE，“低位字节”使用0xA1-0xFE。

6. Shift_JIS：是一个日本电脑系统常用的编码表。它能容纳全角及半角拉丁字母、平假名、片假名、符号及日语汉字。它被命名为Shift_JIS的原因，是它在放置全角字符时，要避开原本在0xA1-0xDF放置的半角假名字符。在微软及IBM的日语电脑系统中，即使用了这个编码表。这个编码表称为CP932。

7. EUC_JP：用来存储日本JISx0208以及JISx0212的字集的字符，但日文文字较多使用ISO-2022-JP或Shift_JIS的方法来表示。

8. KOI8-R：KOI-8系列的斯拉夫文字8位元编码，供俄语及保加利亚语使用。

9. ASCII及其扩展字符集：作用是表征英语及西欧语言。ASCII用7位表示，能表示128个字符；其扩展用8位表示，表示256个字符。范围是ASCII从00到7F，扩展从00到FF。

10. ISO-8859-1字符集：作用是扩展ASCII，表示西欧、希腊语等。位数是8位，范围是从00到FF，兼容ASCII字符集。

11. GB2312字符集：作用是国家简体中文字符集，兼容ASCII。位数使用两个字节表示，能表示7445个符号，包括6763个汉字，几乎覆盖所有高频率汉字。范围是高字节从A1到F7，低字节从A1到FE。

12. BIG5字符集：作用是统一繁体字编码。位数使用两个字节表示，表示13053个汉字。范围是高字节从A1到F9，低字节从40到7E，A1到FE。

13. GBK字符集：作用是GB2312的扩展，加入对繁体字的支持，兼容GB2312。位数使用两个字节表示，可表示21886个字符。范围是高字节从81到FE，低字节从40到FE。

14. GB18030字符集：作用是解决中文、日文、朝鲜语等的编码，兼容GBK。位数采用变字节表示（1 ASCII，2，4字节）。可表示27484个文字。范围是1字节从00到7F；2字节高字节从81到FE，低字节从40到7E和80到FE；4字节第一三字节从81到FE，第二四字节从30到39。

15. UCS字符集：作用是国际标准ISO 10646定义了通用字符集（Universal Character Set）。它是与UNICODE同类的组织，UCS-2和UNICODE兼容。位数有UCS-2和UCS-4两种格式，分别是2字节和4字节。范围目前，UCS-4只是在UCS-2前面加了0x0000。

16. UNICODE字符集：作用是为世界650种语言进行统一编码，兼容ISO-8859-1。位数有多个编码方式，分别是UTF-8，UTF-16和UTF-32。

标签：常见字符编码格式

上一篇：我想问一下gbk和utf8的区别

下一篇：第三方微信投票系统哪个好用

首页

网站制作

关于

服务

联系我们

与我们合作

您也可通过下列途径与我们取得联系：

常见字符编码格式