西文字符编码与汉字编码
⑶汉字的内码:是汉字在计算机内部存储、处理的代码。英文字符的 机内码是最高位为0的8位ASCⅡ码,而汉字字符的机内码是两个字节 的最高位都为1的ASCⅡ码。即将国标码的每字节最高位置1作为汉字 机内码。公式为:
区位码+2020H=国标码
国标码+8080H=机内码
或:区位码+A0A0H=机内码
例如:汉字“中”的区位码是3630H,它的国标码是(5650H),机内 码是( D6D0H )。
(二)、汉字编码:
对汉字进行编码是为了使电脑能够识别并 处理汉字,在汉字处理的各个环节中,由 于要求不同,采用的编码也不同。
汉字输入过程:
输入码
汉 字 输 入
国标码
机内码
地址码
字形码 汉 字 输 出
汉字的输入码
汉字的输入码:是为用户能利用西文键盘 输入汉字而设计的编码。主要有以下四种:
①数字编码:如电报码、区位码。 ②字音编码:如双拼、全拼输入方案。 ③字形编码:如五笔字形码、表形码。
3、比较以下两个ASCII值的大小: “0”___“S” “3”___“8”
“A”___“C”
“A”___“a”
4、每一个点在存储器中用____个二进制位(bit)
存储,所以一个16×16点阵汉字需要____个字节存储
空间。
二、计算题:
1、“啊”汉字的区位码为1601,求这汉字的国标码和
机内码。
2、已知某汉字区号34,位号56,求某汉字的国标码和
机内码。
汉字机内码每个字节的最高位均是1,而西文字符机内码(ASCII)的 最高位是0
汉字字形码
汉字字形码(输出码)(字模) 汉字的输出码:提供输出汉字时的需要的汉字字形,用
以将机内码还原为汉字进行输出。汉字字形码是一种汉 字字模点阵的二进制码,是汉字的输出码。 我国已颁布了16×16、24×24、32×32和48×48点阵的 字模标准。汉字显示一般用16×16的点阵,而24×24以 上的点阵一般用于打印。 点阵越大精度越高所需要的存储单元越多打印出的字也 越清析。 N个汉字点阵为a×b共需要多少存储空间M:(N*A*B)/8
版本:7位版本(使用了一个字节中的7位,最高位置0, 数值范围从0000000~1111111,即0~127,共计 128个字符。
ASCII码对照表:
ξ1.2西文字符编码与汉字编码 一、ASCII
128个字符包括: (一)、 94个可显示打印字符。 码值范围:33~126 数字0~9:(48~57)——————— 10个 大写英文字母A~Z:(65~90)————26个 小写英文字母a~z:(97~122)———26个 标点符号和运算符号———————— 32个 (二)、34个不可显示字符。 码值范围:0~32,127 控制字符:空格:32 DEL:127 课堂提问:ASCII的大小顺序是怎样的?
ξ1.2西文字符编码与汉字编码 一、ASCII
ASCII的大小规则:控制字符<数字<大写字母<小写字母
同个字母大写+32 →小写字母
课堂练习:指出A,3,y,Y,空格的ASCⅡ码值大小顺序? 答:空格<3<A<Y<y
空格:32
0:48 → 3:51
A:65
Z:90 → Y:89
↓ +32 y:121
区位码:使用了两个字节,最高位均置0
128×128=
94×94=8836
16384 区位码是把7445个国标码放置在一个94行×94
列的阵列中。阵列的每一行称为一个汉字的“区”,
用区号表示;每一列称为一个汉字的“位”,用位
号表示。显然,区号范围是1~94,位号的范围也是
1~94。这样,一个汉字在表中的位置可用它所在的
ξ1.2西文字符编码与汉字编码 二、汉字编码
汉字编码种类:
1、国标码
2、区位码
3、机内码
音码:全拼、双拼、微软拼音 形码:如五笔如智能ABC、自然码
5、汉字地址码
数字码:如区位码、电报码
6、字型码
外码(输入)→内码→字型码(输出)
ξ1.2西文字符编码与汉字编码 二、汉字编码
我国于1980年颁布了《信息交换用汉字编码字符
集·基本集》,简称GB2312-80码 (国标码)。
汉字编码表
非汉字图形字符 682个
7445个
一级 3755个——汉语拼音排序
汉字 6763个
二级 3008个——偏旁部首排序 课堂提问:可以用一个字节来存放汉字编码吗?
ξ1.2西文字符编码与汉字编码 二、汉字编码
区号与位号来确定。一个汉字的区号与位号的组合
就是该汉字的“区位码”。区位码的形式是:高两
位为区号,低两位为位号。
ξ1.2西文字符编码与汉字编码 二、汉字编码
区位码:实际上也是一种汉字输入码。
实际上只用了87×94=8178个编码。其中682个 图形符号,分布在1~15区;一级汉字分布在16~55 区;二级汉字(不常用汉字) 分布在56~87区;88区 以后为空白区,以待扩展。
一、填空题: 1、ASCII码是____位二进制字符编码,是___
_______的缩写,共有__个不同的字符编码,其 中包括10个阿拉伯数字、___个英文大小写字母、__ _个符号和运算符以及___个控制符,____符是不 能显示的,其余95个是可显示(打印)的ASCII码。
2、GB2312,简称______,共收纳___个汉字, 其中一级汉字有___个,二级汉字有____个,并且 一级汉字按_______顺序排列,二级汉字按___ ____排列。根据GB2312的编码方法,把该码分成__ _个区,每个区分成___个码位。
授课内容:西文字符编码与汉字编码
ξ1.2西文字符编码与汉字编码
编码 定义:用二进制数0、1的不同组合
来表示特定的信息。
ξ1.2西文字符编码与汉字编码 一、ASCII(西文字符编码)
全称:美国标准信息交换代码(American Standard Code for Information Interchange)
④音形编码:根据语音和字形双重因素确 定的输入码。
国标码
(1)汉字信息交换码:国家标准汉字编码简称国标码,主要用于不 同系统之间汉字信息的存储与交换。GB2312-80编码集规定了计算机 使用汉字和图形符号总数为7445个。
(2)一个汉字的编码由两个字节组成,第一个字节称为“区”,第 二个字节称为“位”,这就是区位码。国标码最多可组成94区×94位, 组成一个94×94的矩阵。 在此方阵中,每一行称为一个“区”,每 一列称为一个“位”。 共收录了汉字和图形符号7445个,每个汉字 用两个字节表示。汉字分为两级:一级汉字3755个,按汉语拼音字母 排列;二级汉字3008个,按部首排列;非汉字字符682个。
优点:无重码 缺点:难以记忆
ξ1.2西文字符编码与汉字编码 二、汉字编码
区位码:4位十进制数,编码范围从0101~ 国94标94码:国标GB2312-80中规定,所有汉字和字
符的每个字节的编码范围与ASCII码表中的94个字 符编码相一致(即从33~126),所以,其编码范 围是:2121H~7E7EH。国标码是十六进制数。 所以:
国标码、机内码、区位码的相互转换: 第一步:将区位码转换成十六进制数 第二步:根据公式转换:
国标码=区位码+2020H 机内码=国标码+8080H
机内码=区位码+A0A0H
课堂练习:以汉字“大”为例,在区位码表中查询 其
解:1、区其位区码位,码然为后2求08其3,国即标区码号和为机2内0码,。位号为83 2、将区位号2083转换为十六进制表示为1453H 3、国标码=1453H+2020H=3473H 4、机内码=3473H+8080H=B4F3H
机内国码标:码以=上区两位种码编+码20均2与0HASCII冲突。机内码将 国标码两个字节的最高位均置1,从而避免了与 ASCII的冲突。其每个字节从161~254。它也是 十六进制数。所以,其编码范围是:A1A1H~ FEFEH。
机内码=国标码+8080H
ξ1.2西文字符编码与汉字编码 二、汉字编码
ξ1.2西文字符编码与汉字编码
作业:
1、已知大写字母D的ASCII码为68,那么小写字 母d的ASCII码为?
2、F的ASCII码是46H,则f的ASCII是? 3、无论采用拼音输入法,还是五笔字型输入法
输入汉字,存储到计算机内部的一律是汉字 的? 4、已知“江苏”两字的区位码是“2913”和 “4353”, 求其国标码和机内码。
高考信息技术一轮专题24:ASCⅡ码和汉字编码
高考信息技术一轮专题24:ASCⅡ码和汉字编码一、单选题1. ( 2分) 用WinHex软件观察字符内码如图所示,下列描述正确的是()A. 可推断“j”的内码为70HB. “陈旻”字内码为B3C2HC. “name”占用4b存储空间D. “My”内码和01001101 01111001B等值2. ( 2分) 字符“H”对应的ASCII码值为1001000,那么字符“K”对应的ASCII码值为( )A. 1001001B. 1001010C. 1001011D. 10001013. ( 2分) 下列有关汉字编码的叙述中,错误的是( )A. 智能拼音码属于音码,五笔字形码属于形码B. 采用BIG5编码,一个汉字在计算机中用两个字节表示C. 机内码是供计算机系统内部进行存储、加工和传输而统一使用的代码D. 字型码和音码、形码一样都属于输入码4. ( 2分) 计算机的汉字编码有输入码、机内码、输出码,以下不属于输入码的是()。
A. 智能ABCB. 搜狗拼音C. 微软拼音D. 国标码(GB)5. ( 2分) 汉字的编码多种多样,如输入码、输出码和机内码,其功能各异。
用于存储汉字的编码称为( )A. 机内码B. 字型码C. 拼音码D. 输出码6. ( 2分) 目前,国际上通用的字符编码是()A. ASCII码B. 拼音码C. 国标码D. 外码7. ( 2分) 下列关于汉字编码的叙述中,正确的是( )A. 搜狗拼音属于形码,五笔字形属于音码B. 采用BIG5编码,一个汉字在计算机中用一个字节表示C. 机内码是供计算机系统内部进行存储、加工和传输而统一使用的代码D. 字型码和音码、形码一样都属于输入码8. ( 2分) 下列选项中,不是计算机上使用的汉字编码方式的是( )A. 内码B. 条形码C. 外码D. 字型码9. ( 2分) 在ASCⅡ字符编码表中,字符“d”的ASCⅡ码是100,则字符“a”的ASCⅡ码是()A. 97B. 98C. 102D. 10310. ( 2分) 【加试题】下图是“中国诗词大会”的内码,可根据该图计算出“中”字在()A. 54区48位B. 36区30位C. 56区50位D. B6区B0位11. ( 2分) 在用Winhex软件观察字符的十六进制内码时,结果如下图所示,如果内码“69”位置上看到的是“70”,则该内码对应的字符为()A. IB. jC. pD. q12. ( 2分) 用十六进制查看字符内码,结果如下图所示该字符内码可能是()A. 2个GB2312字符B. 4个ASCII字符C. 2个ASCII字符1个GB2312字符D. 4个GB2312字符13. ( 2分) 下图可知I的内码是49H,那么字母j的内码会是()A. 4AHB. 50HC. 6AHD. 70H14. ( 2分) 使用UltraEdit软件观察“翻的-Ship”的内码,如图所示。
浅析汉字编码过程
浅析汉字编码过程作者:黄小花来源:《电脑知识与技术》2015年第04期摘要:该文围绕了汉字的编码过程,详细介绍了输入码、区位码、国标码、机内码、字形码的编码方法。
输入码是为方便汉字输入而形成的汉字编码为,国标码是为表示汉字而统一的编码,计算机还不能将国标码作为汉字在计算机中的表现形式,因为会和ASCII码发生冲突,所以又产生了汉字的机内码,机内码是存储汉字的编码,最终汉字是通过字形码或输出码将汉字输出。
关键词:汉字的编码;国标码;机内码;字形码中图分类号:G642 文献标识码:A 文章编号:1009-3044(2015)04-0181-02Abstract: This paper around the coding process Chinese characters, detailed introduces the coding method for input code, area code, GB code, machine code, shape code. The input code is formed Chinese characters code for the convenience of Chinese characters input, GB code is unified for the said Chinese characters coding, computer can be GB code as a form Chinese characters in the computer, because ASCII codes and conflict, so they produced a Chinese characters within the machine code, machine code is only, font code is Chinese characters coding form to display and print output Chinese characters.Key words: Chinese characters coding; GB code; machine code; font code计算机是二进制世界,只能识别由0和1组成的二进制度,所有外部信息都要编码成二进制。
反码 原码 补码
[+7]补+ [-6]补 = 00000111 +11111010
进位舍去 100000001
= 00000001
说明:补码的减法可以按加法来处理 20
补码的表示范围: 假设用一个字节表示一个数。 用补码表示的最大值:+127,
其补码为:01111111。 用补码表示的最小值:-128,
其补码为:10000000。 所以,用补码表示的数的范围是:
49
2.GBK汉字内码扩展规范(了解)
GBK编码区分三个部分:
➢ 浮点数(实数)分类:
短浮点数、浮点数、
长浮点数、高精度浮点数
end of 2.4
30
2.5 文字的表示和处理
一、西文字符编码 二、汉字编码 三、汉字的输入和输出 四、文本处理
31
一、西文字符编码 1. ASCII码(重点)
ASCII码,即美国标准信息交换码
(American Standard Code for Information
(B4F3)
48
2.GBK汉字内码扩展规范(了解)
问题:GB2312-80只有6763个汉字,使用时 功能不够。
解决方法:1995年发布GBK,全称为《汉字内码扩
展规范》GBK字符集中一共有21003个汉字和883个 图形符号,它与GB2312国标汉字字符集及其内码保 持兼容。
组成:共收入21886个汉字和图形符号 (21003个汉字,883个图形符号)
Interchange),使用7个二进位对字符 进行编码。
32
❖ 基本的ASCII字符集共有128个字符
95个可打印字符(常用字母、数字、标点符 号) 33个控制字符(不可直接显示或打印)
国标码区位码等的区别
即:中文内码之一,代表中文,在广泛使用,影响所及,使用量渐见普及。
“国家标准信息交换用汉字编码”(GB2312-80标准),简称国标码。
国标码是指1980年中国制定的用于不同的具有处理功能的计算机系统间交换汉字信息时使用的编码。
国际码是二字节码, 用两个七位二进制数编码表示一个汉字。
目前国标码收入6763个汉字, 其中一级汉字(最常用)3755个, 二级汉字3008个, 另外还包括682个西文字符、图符。
例如“巧”字的代码是39H 41H, 在机内形式如下: 0 1 1 1 0 0 1 1 第一0 0 0 0 0 1第二字节在计算机内部,汉字编码和西文编码是共存的,如何区分它们是个很重要的问题,因为对不同的信息有不同的处理方式。
方法之一是对于二字节的国标码,将二个字节的最高位都置成“1”, 而码所用字节最高位保持“0”,然后由软件(或硬件)根据字节最高位来作出判断。
字符代码化是指用户从键盘上输入代表某个汉字的编码。
我们把采用不同的编码系统以代表汉字进行输入的方案(如数字码、拼音码和),称为汉字的输入法,、五笔字型码、拼音码、、拼音输入法等都是其中的具体代表。
汉字通过编码输入计算机后,在其后的处理过程中,不同阶段使用不同的代码,首先通过键盘管理程序将接收到的输入编码转换为0和1构成的机内码,实现计算机的存储、加工和传输处理。
同样,存储在计算机内部的机内码也必须经转换后才能恢复汉字的“本来面目”。
这种转换通常是由计算机的输入/输出设备来实现的, 有时还需要软件来参与这种转换过程。
这个阶段的汉字代码称为字形码,用以显示和打印输出。
区位码:1980年,为了使每一个汉字有一个全国统一的代码,我国颁布了第一个汉字编码的国家标准:GB2312-80《信息交换用汉字编码字符集》基本集,这个字符集是我国中文信息处理技术的发展基础,也是目前国内所有汉字系统的统一标准。
国标码是一个四位十六进制数,区位码是一个四位的十进制数,每个国标码或区位码都对应着一个唯一的汉字或符号,但因为十六进制数我们很少用到,所以大家常用的是区位码,它的前两位叫做区码,后两位叫做位码。
计算机中的字是如何处理的
字符编码一、西文字符编码:ASCII码ASCII码全称为美国标准信息交换码(American Standard Code for Information Interchange)。
它用8位二进制数来编码,第1位全部是0,因此ASCII码最多可以表示2^7=128个字符,包括字母、数字、标点符号、控制符号等西文字符。
ASCII码已经被ISO认定为国际标准。
1)控制字符:0~31、127,共33个,不可显示;2)普通字符:95个,包括10个阿拉伯数字、52个英文大小写字母、33个标点符号和运算符。
常见ASCII码的大小规则,0-9<A-Z<a-z:ASCII码表记住几个常见字母的ASCII码大小:“A”为65;“a”为97;“0”为48;在计算机系统中,用1字节来存储一个ASCII字符。
上表是标准ASCII字符,有一个特点:最高位(第八位)为0。
还有一种叫做扩充ASCII码,它是用8位二进制数给字符编码,这样可以表示256种字符。
二、汉字编码计算机处理汉字时,也必须先将汉字代码化,然后对汉字代码进行处理。
1.汉字国标码中国的文字不是拼音文字,汉字的个数有数万之多,远远超过区区256 个字符,因此我们就使用两个字节来表示一个中文。
为了与ASCII 保持兼容,与ASCII码相同的编码我们不使用。
1980年我国颁布了《信息交换用汉字编码字符集(基本集)》GB2312-80,简称国标码(或GB码),一共收集了7445个字符,其中汉字6763个。
一级汉字3755个,按汉字拼音字母顺序排列;二级汉字3008个,按部首笔画汉字排列。
两个字节编码一个国标码字符。
2.汉字的机内表示:机内码:计算机在信息处理时表示汉字的编码,称作机内码。
现在我国都用国标码(GB2312)作为机内码。
中国的台湾省也在使用中文,但是由于历史的原因,那里没有使用大陆的简体中文,还在使用着繁体的中文,并且他们自己也制定了一套表示繁体中文的字符编码,称为BIG5,不幸的是,虽然他们的也使用两个字节来表示一个汉字,但他们没有象我们兼容ASCII 一样兼容大陆的简体中文,他们使用了大致相同的编码范围来表示繁体的汉字。
数据编码的基本方式
28
机内码
文档仅供参考,如有不当之处,请联系改正。
GB2312-80统一要求了中文旳基本编码原则,但是 要存储在计算机中与西文编码在计算机中旳表达
)8= ( )16=
文档仅供参考,如有不当之处,请联系改正。
编码
计算机是美国人发明旳,所以计算机旳字 符集中自然包括了英文旳26个字母。
计算机要在全世界通用,必须采用公认旳 原则格式对字符、符号进行编码。
常用旳字符编码有ASCII码、BCD码、西文 字符编码和EBCDIC码。
21
文档仅供参考,如有不当之处,请联系改正。
文档仅供参考,如有不当之处,请联系改正。
二进制数转换为十六进制数
整数部分从低位向高位方向每4位用一种等值旳十六 进制数来替代,即四位并为一位,最终不足4位时在 高位处补0,补够4位;小数部分从高位向低位方向 每4位用一种等值旳十六进制数来替,最终不足4位 时在低位处补0,补够4位。 (1110 0101 1010 . 1011 1001)2 =(E5A.B9)16
78~7E
位 区 1~15
16~55
56~87
88~94
21 22 23 24 25 26 …………7C 7D 7E
7F
1 2 3 4 5 6 ………………91 92 93 94
非中文图形符号(常用符号、数字序号、俄文、 英文、法文、希腊字母、日文平、片假名等)
啊阿埃
一级中文
(3755个)
二级中文(3008个)
23
文档仅供参考,如有不当之处,请联系改正。
西文字符处理起来比较简朴,而中文信息 处理起来就复杂了。中文是图形文字,常 用中文就有3000~6000个,形状和笔画差 别很大。这就决定了中文字符旳编码方案 必须完全不同于西文旳编码方案。
字符编码
23
GB码区位示例
01区
78位
24
GB码区位示例(续)
16 区 1 2 3 4 5 6 7 8 9 0 啊 阿 埃 挨 哎 唉 哀 皑 癌 1 蔼 矮 艾 碍 爱 隘 鞍 氨 安 俺 2 按 暗 岸 胺 案 肮 昂 盎 凹 敖 3 熬 翱 袄 傲 奥 懊 澳 芭 捌 扒 4 叭 吧 笆 八 疤 巴 拔 跋 靶 把 5 耙 坝 霸 罢 爸 白 柏 百 摆 佰 6 败 拜 稗 斑 班 搬 扳 般 颁 板 7 版 扮 拌 伴 瓣 半 办 绊 邦 帮 8 梆 榜 膀 绑 棒 磅 蚌 镑 傍 谤 9 苞 胞 包 褒 剥 17 区 1 2 3 4 5 6 7 8 9 0 薄 雹 保 堡 饱 宝 抱 报 暴 1 豹 鲍 爆 杯 碑 悲 卑 北 辈 背 2 贝 钡 倍 狈 备 惫 焙 被 奔 苯 3 本 笨 崩 绷 甭 泵 蹦 迸 逼 鼻 4 比 鄙 笔 彼 碧 蓖 蔽 毕 毙 毖 5 币 庇 痹 闭 敝 弊 必 辟 壁 臂 6 避 陛 鞭 边 编 贬 扁 便 变 卞 7 辨 辩 辫 遍 标 彪 膘 表 鳖 憋 8 别 瘪 彬 斌 濒 滨 宾 摈 兵 冰 9 柄 丙 秉 饼 炳
19
二、计算机中中文字符的表示 汉字交换码
国家标准将每个汉字和图形符号的两个字节分 别用两位的十进制编码(不足补0),前字节的编 码称为区码,后字节的编码称为位码,排列在一个 94行94列的二维代码表中,形成区位码表。 如“保”字在二维代码表中处于17区第03位 ,区位码即为1703D 。 把区位码按一定的规则转换成的二进制代码叫 做信息交换码(简称国标码)。
字 符 编 码
1
提
纲
一 计算机中字符的表示(ASCII码) 二 计算机中中文字符的表示
2
概 述
浙江省计算机高考复习(第6课)常用信息的编码
(3)汉字字形码
在计算机系统中,要显示或打印任何字符、汉字都 是由点阵式的字模组成。
16*16的点阵的汉字
字形码:
为了使计算机能识别和存储字模,就必须对字模进 行数字化,把字模中的每一个点都用二进制数表示,即 用“1”表示黑点,用“0”表示白点。这种数字化的字 模点阵代码就是字形码。
精品课程
常用信息的编码
计算机内部均采用二进制数来表示各种信息。要想使输 入设备输入的数字、字符、标点符号和文字等信息能被计算 机所识别,必须将其转换为相应的二进制编码。
目前常用的编码有:
BCD码、ASCII码、汉字编码和奇偶校验码等。
BCD码(了解)
用四位二进制数码来表示一个十进制数。 规则:选用0000-1001来表示0-9的十个数符。 如: (365)10=(0011 0110 0101)BCD 11001.11B= (25.75)10 =(0010 0101.0111 0101)BCD
练习3:某计算机系统中采用奇校验,若字符‘A’在
传送到目的地时为“11000010”,传输过程是否出错?
计算机能否发现?
奇偶校验码只能发现一位或者奇数位错误,而且不能纠 正错误。
汉字地址码:
指出汉字模信息在汉字库中存放的逻辑地址的编码。
三、奇偶校验码
校验码:具有发现或纠正传送过程中出现的错误的编码。
最常用、最简单的校验方法就是奇偶校验,一般以 一个字节为单位加奇偶校验位。 奇校验: 确保被传输的数据中‘1’的个数是奇数个。
偶校验:
确保被传输的数据中‘1’的个数是是偶数个。
ASCII码和汉字编码
ASCII码编码特点
• 1.大写字母的ASCII码值比相对应的小写字母小32 例:A的ASCII值为65,而a的ASCII值为97
• 2.ASCII码值大小关系:
数字<大写英文字母<小写英文字母
• 3.计算机存储器在存放ASCII码时,占用一个字节 1Byte=8bit(计算机在存放ASCII码时,只占用1个字节右7位, 最左位补0; 形式如0xxxxxxx)。
为了汉字的输出显示和打印,需要描述汉字的字形, 对汉字字形的编码称为汉字的字形码。
归纳——汉字在计算机中的表示
输入法输入 查找对应的区位码 区位码加2020H 转为国际码 国际码加8080H转为 十六进制机内码
查找对应字形码 输出
转为二进制机内码
3.观察字符内码
UltraEdit:十六进制内码观察器
字符 ASCII码字符 汉字 二进制编码 8位 16位 查看到的内码 2个十六进制数 4个十六进制数 存储 占1B 占2B
例1. 用UltraEdit软件观察字符内码,结果如下图所示:
则其中内码“32 30”表示的字符为( B ) (A)2010 (B)20 (C)10 (D)假 例2.用UltraEdit软件观察字符内码,结果如下图所示:
(1)汉字输入
汉字输入 方法 自动识别 汉字输入码
如手写、语音识别
音码:全拼、双拼、智能ABC等
形码:五笔字型法、郑码输入法
(2)汉字编码
汉字编码(GB2312-80)采用区位码表示汉字。区位码分94个区,每 区94个位,构成94*94个单元的表格。“区号”和“位号”各占一字节(第 一个字节标记区号,第二个字节标记位号),所以一个汉字占2个字节。
通过内码观察器查看字符内码
汉字编码关系
输入码、区位码、国标码与机内码我们知道,键盘是当前微机的主要输入设备,输入码就是使用英文键盘输入汉字时的编码。
目前,我国已推出的输入码有数百种,但用户使用较多的约为十几种,按输入码编码的主要依据,大体可分为顺序码、音码、形码、音形码四类,如“保”字,用全拼,输入码为码为“BAO”,用区位码,输入码为“1703”,用五笔字型则输入码为“WKS”。
计算机只识别由0、1组成的代码,ASCII码是英文信息处理的标准编码,汉字信息处理也必须有一个统一的标准编码。
我国国家标准局于1981年5月颁布了《信息交换用汉字编码字符集──基本集》,代号为GB2312-80,共对6763个汉字和682个图形字符进行了编码,其编码原则为:汉字用两个字节表示,每个字节用七位码(高位为0),国家标准将汉字和图形符号排列在一个94行94列的二维代码表中,每两个字节分别用两位十进制编码,前字节的编码称为区码,后字节的编码称为位码,此即区位码,如在二维代码表中处于17区第3位,区位码即为“1703 ”。
(教材附页可找到)国标码并不等于区位码,它是由区位码稍作转换得到,其转换方法为:先将十进制区码和位码转换为十六进制的区码和位码,这样就得了一个与国标码有一个相对位置差的代码,再将这个代码的第一个字节和第二个字节分别加上20H,就得到国标码,相当于如果不转换的话,在两个字节上分别加上32即可。
如:“保”字的国标码为3123H,它是经过下面的转换得到的:1703D->1103H->+20H->3123H。
国标码是汉字信息交换的标准编码,但因其前后字节的最高位为0,与ASCII码发生冲突,如“保”字,国标码为31H和23H,而西文字符“1”和“#”的SCII也为31H和23H,现假如内存中有两个字节为31H和23H,这到底是一个汉字,还是两个西文字符“1”和“#”?于是就出现了二义性,显然,国标码是不可能在计算机内部直接采用的,于是,汉字的机内码采用变形国标码,其变换方法为:将国标码的每个字节都加上128,即将两个字节的最高位由0改1,其余7位不变,也就是如果国标码是16进制的,直接加上8080H即可。
