常见字符编码格式
1. GB2312:简体中文编码,一个汉字占用两个字节,在中国大陆是主要的编码方式。当文档或网页中包含繁体中文、日文、韩文等时,这些内容可能无法被正确编码。
2. BIG5:繁体中文编码,主要在台湾地区使用。
3. GBK:支持简体和繁体中文,但对于其他国家的非拉丁字母语言仍然存在问题。
4. UTF-8:Unicode编码的一种。Unicode用一些基本的保留字符制定了三套编码方式,它们分别是UTF-8、UTF-16和UTF-32。在UTF-8中,字符是以8位序列来编码的,用一个或几个字节来表示一个字符。这种方式的最大好处是UTF-8保留了ASCII字符的编码作为它的一部分。UTF-8俗称“万国码”,可以同屏显示多语种,一个汉字占用三个字节。为了实现国际化,网页应尽可能采用UTF-8编码。当然,处理中文时HTTP头也要改为UTF-8编码的——加上``。
5. EUC_KR:用来存储韩国KSX1001字符集(旧称KSC5601)的字符。此标准由KSX2901(旧称KS C 5861)定义。KS X 1001字符使用两个字节来表示。“高位字节”使用0xA1-0xFE,“低位字节”使用0xA1-0xFE。
6. Shift_JIS:是一个日本电脑系统常用的编码表。它能容纳全角及半角拉丁字母、平假名、片假名、符号及日语汉字。它被命名为Shift_JIS的原因,是它在放置全角字符时,要避开原本在0xA1-0xDF放置的半角假名字符。在微软及IBM的日语电脑系统中,即使用了这个编码表。这个编码表称为CP932。
7. EUC_JP:用来存储日本JISx0208以及JISx0212的字集的字符,但日文文字较多使用ISO-2022-JP或Shift_JIS的方法来表示。
8. KOI8-R:KOI-8系列的斯拉夫文字8位元编码,供俄语及保加利亚语使用。
9. ASCII及其扩展字符集:作用是表征英语及西欧语言。ASCII用7位表示,能表示128个字符;其扩展用8位表示,表示256个字符。范围是ASCII从00到7F,扩展从00到FF。
10. ISO-8859-1字符集:作用是扩展ASCII,表示西欧、希腊语等。位数是8位,范围是从00到FF,兼容ASCII字符集。
11. GB2312字符集:作用是国家简体中文字符集,兼容ASCII。位数使用两个字节表示,能表示7445个符号,包括6763个汉字,几乎覆盖所有高频率汉字。范围是高字节从A1到F7,低字节从A1到FE。
12. BIG5字符集:作用是统一繁体字编码。位数使用两个字节表示,表示13053个汉字。范围是高字节从A1到F9,低字节从40到7E,A1到FE。
13. GBK字符集:作用是GB2312的扩展,加入对繁体字的支持,兼容GB2312。位数使用两个字节表示,可表示21886个字符。范围是高字节从81到FE,低字节从40到FE。
14. GB18030字符集:作用是解决中文、日文、朝鲜语等的编码,兼容GBK。位数采用变字节表示(1 ASCII,2,4字节)。可表示27484个文字。范围是1字节从00到7F;2字节高字节从81到FE,低字节从40到7E和80到FE;4字节第一三字节从81到FE,第二四字节从30到39。
15. UCS字符集:作用是国际标准ISO 10646定义了通用字符集(Universal Character Set)。它是与UNICODE同类的组织,UCS-2和UNICODE兼容。位数有UCS-2和UCS-4两种格式,分别是2字节和4字节。范围目前,UCS-4只是在UCS-2前面加了0x0000。
16. UNICODE字符集:作用是为世界650种语言进行统一编码,兼容ISO-8859-1。位数有多个编码方式,分别是UTF-8,UTF-16和UTF-32。
多重随机标签