职业IT人-IT人生活圈

 找回密码
 成为会员
搜索
查看: 4697|回复: 5

哎,作个记事本怎么就那么难?

[复制链接]
sixdo 发表于 2006-6-27 19:35 | 显示全部楼层 |阅读模式
<p>?记事本的界面到是好作,</p><p>可是保存和另存就是不会,气死我了,</p><p>29号就考试了,可能就是考这个记事本,也不知道能不能过,</p><p>版主们帮我看看呗,</p><p>最好作一个简单的保存和另存为的程序,谢谢了.</p><p>我要是学的差不多了,也当一个版主试试!!!!!嘻嘻</p> H3TStBfX.rar (2 KB, 下载次数: 34) <br/>
sophia 发表于 2006-6-29 10:16 | 显示全部楼层
<p>我在你原来的代码基础上改了,加了保存和另存为功能,有比较详细的注释,我想你应该能看懂。另外要注意什么时候用全局变量,什么时候用局部变量,比如程序中的filename。</p> tv4UVwkg.rar (3 KB, 下载次数: 37) <br/>
 楼主| sixdo 发表于 2006-6-30 08:49 | 显示全部楼层
<p>老大,程序有问题,就是在打开TXT文件,编程以后,用Windows记事本打开有乱码</p><p>如附件所示</p> JmURSPIs.rar (25 KB, 下载次数: 27) <br/>
[此贴子已经被作者于2006-6-30 8:58:02编辑过]

DJnwobU7.rar

86 KB, 下载次数: 28, 下载积分: 生活币 -1 个

tq7KYKD5.rar

86 KB, 下载次数: 26, 下载积分: 生活币 -1 个

FrM8sAZR.rar

86 KB, 下载次数: 24, 下载积分: 生活币 -1 个

sophia 发表于 2006-7-2 15:29 | 显示全部楼层
<p>唉,改别人的程序才难吧,自己做一个才没有这么麻烦呢…………</p><p>现在暂时没有空,我晚上帮你看吧,晚上我顺便发个我自己写的给你</p>
sophia 发表于 2006-7-3 20:23 | 显示全部楼层
我在我的电脑上运行并做和你一样的操作,是没有任何问题的,你的问题也不是乱码,而是编码问题。默认情况下,记事本是以ANSI编码保存文本文档的,你改成unicode试试,应该就没有问题了。关于编码问题,我给你找了篇文章,你可以看看:)
[此贴子已经被作者于2006-7-4 0:46:15编辑过]
sophia 发表于 2006-7-3 20:28 | 显示全部楼层
<h4><a name="intro"></a><font size="2">引言</font></h4><p><font size="2">“字符与编码”是一个被经常讨论的话题。即使这样,时常出现的乱码仍然困扰着大家。虽然我们有很多的办法可以用来消除乱码,但我们并不一定理解这些办法的内在原理。而有的乱码产生的原因,实际上由于底层代码本身有问题所导致的。因此,不仅是初学者会对字符编码感到模糊,有的底层开发人员同样对字符编码缺乏准确的理解。</font></p><p><strong><font size="2">1. 编码问题的由来,相关概念的理解</font></strong></p><h5>1.1 字符与编码的发展</h5><p><font size="2">从计算机对多国语言的支持角度看,大致可以分为三个阶段:</font></p><table cellspacing="0" cellpadding="3" border="0"><tbody><tr><td class="top_1"><font size="2"> </font></td><td class="top_2" nowrap="true" align="center"><b><font size="2">系统内码</font></b></td><td class="top_2" align="center"><b><font size="2">说明</font></b></td><td class="top_2" align="center"><b><font size="2">系统</font></b></td></tr><tr><td class="con_1" nowrap="true"><font size="2">阶段一</font></td><td class="con_2" nowrap="true" align="center"><font size="2">ASCII</font></td><td class="con_2"><font size="2">计算机刚开始只支持英语,其它语言不能够在计算机上存储和显示。</font></td><td class="con_2"><font size="2">英文 DOS</font></td></tr><tr><td class="con_1" nowrap="true"><font size="2">阶段二</font></td><td class="con_2" nowrap="true" align="center"><font size="2">ANSI编码<br/>(本地化)</font></td><td class="con_2"><font size="2">为使计算机支持更多语言,通常使用 0x80~0xFF 范围的 2 个字节来表示 1 个字符。比如:汉字 '中' 在中文操作系统中,使用 [0xD6,0xD0] 这两个字节存储。<br/><br/>不同的国家和地区制定了不同的标准,由此产生了 GB2312, BIG5, JIS 等各自的编码标准。这些使用 2 个字节来代表一个字符的各种汉字延伸编码方式,称为<b> ANSI 编码</b>。在简体中文系统下,ANSI 编码代表 GB2312 编码,在日文操作系统下,ANSI 编码代表 JIS 编码。<br/><br/>不同 ANSI 编码之间互不兼容,当信息在国际间交流时,无法将属于两种语言的文字,存储在同一段<b> ANSI 编码</b>的文本中。</font></td><td class="con_2"><font size="2">中文 DOS,中文 Windows 95/98,日文 Windows 95/98</font></td></tr><tr><td class="bot_1" nowrap="true"><font size="2">阶段三</font></td><td class="bot_2" nowrap="true" align="center"><font size="2">UNICODE<br/>(国际化)</font></td><td class="bot_2"><font size="2">为了使国际间信息交流更加方便,国际组织制定了 <b>UNICODE 字符集</b>,为各种语言中的每一个字符设定了统一并且唯一的数字编号,以满足跨语言、跨平台进行文本转换、处理的要求。</font></td><td class="bot_2"><font size="2">Windows NT/2000/XP,Linux,Java</font></td></tr></tbody></table><p><font size="2">字符串在内存中的存放方法:</font></p><p><font size="2">在 ASCII 阶段,<b>单字节字符串</b>使用一个字节存放一个字符(SBCS)。比如,"Bob123" 在内存中为:</font></p><table cellspacing="5" cellpadding="0" border="0" style="FONT-SIZE: 80%; COLOR: #000080;"><tbody><tr><td><font size="2">42</font></td><td><font size="2">6F</font></td><td><font size="2">62</font></td><td><font size="2">31</font></td><td><font size="2">32</font></td><td><font size="2">33</font></td><td><font size="2">00</font></td></tr><tr><td bgcolor="#000080"><font size="2"><img height="1" alt="" src="http://www.regexlab.com/images/spacer.gif" width="1" border="0"/></font></td><td bgcolor="#000080"><font size="2"><img height="1" alt="" src="http://www.regexlab.com/images/spacer.gif" width="1" border="0"/></font></td><td bgcolor="#000080"><font size="2"><img height="1" alt="" src="http://www.regexlab.com/images/spacer.gif" width="1" border="0"/></font></td><td bgcolor="#000080"><font size="2"><img height="1" alt="" src="http://www.regexlab.com/images/spacer.gif" width="1" border="0"/></font></td><td bgcolor="#000080"><font size="2"><img height="1" alt="" src="http://www.regexlab.com/images/spacer.gif" width="1" border="0"/></font></td><td bgcolor="#000080"><font size="2"><img height="1" alt="" src="http://www.regexlab.com/images/spacer.gif" width="1" border="0"/></font></td><td bgcolor="#000080"><font size="2"><img height="1" alt="" src="http://www.regexlab.com/images/spacer.gif" width="1" border="0"/></font></td></tr><tr><td align="center"><font size="2">B</font></td><td align="center"><font size="2">o</font></td><td align="center"><font size="2">b</font></td><td align="center"><font size="2">1</font></td><td align="center"><font size="2">2</font></td><td align="center"><font size="2">3</font></td><td align="center"><font size="2">\0</font></td></tr></tbody></table><p><font size="2">在使用 ANSI 编码支持多种语言阶段,每个字符使用一个字节或多个字节来表示(MBCS),因此,这种方式存放的字符也被称作<b>多字节字符</b>。比如,"中文123" 在中文 Windows 95 内存中为7个字节,每个汉字占2个字节,每个英文和数字字符占1个字节:</font></p><table cellspacing="5" cellpadding="0" border="0" style="FONT-SIZE: 80%; COLOR: #000080;"><tbody><tr><td><font size="2">D6</font></td><td><font size="2">D0</font></td><td><font size="2">CE</font></td><td><font size="2">C4</font></td><td><font size="2">31</font></td><td><font size="2">32</font></td><td><font size="2">33</font></td><td><font size="2">00</font></td></tr><tr><td bgcolor="#ff0000" colspan="2"><font size="2"><img height="1" alt="" src="http://www.regexlab.com/images/spacer.gif" width="1" border="0"/></font></td><td bgcolor="#ff0000" colspan="2"><font size="2"><img height="1" alt="" src="http://www.regexlab.com/images/spacer.gif" width="1" border="0"/></font></td><td bgcolor="#000080"><font size="2"><img height="1" alt="" src="http://www.regexlab.com/images/spacer.gif" width="1" border="0"/></font></td><td bgcolor="#000080"><font size="2"><img height="1" alt="" src="http://www.regexlab.com/images/spacer.gif" width="1" border="0"/></font></td><td bgcolor="#000080"><font size="2"><img height="1" alt="" src="http://www.regexlab.com/images/spacer.gif" width="1" border="0"/></font></td><td bgcolor="#000080"><font size="2"><img height="1" alt="" src="http://www.regexlab.com/images/spacer.gif" width="1" border="0"/></font></td></tr><tr><td align="center" colspan="2"><font size="2">中</font></td><td align="center" colspan="2"><font size="2">文</font></td><td align="center"><font size="2">1</font></td><td align="center"><font size="2">2</font></td><td align="center"><font size="2">3</font></td><td align="center"><font size="2">\0</font></td></tr></tbody></table><p><font size="2">在 UNICODE 被采用之后,计算机存放字符串时,改为存放每个字符在 UNICODE 字符集中的序号。目前计算机一般使用 2 个字节(16 位)来存放一个序号(DBCS),因此,这种方式存放的字符也被称作<b>宽字节字符</b>。比如,字符串 "中文123" 在 Windows 2000 下,内存中实际存放的是 5 个序号:</font></p><table cellspacing="5" cellpadding="0" border="0" style="FONT-SIZE: 80%; COLOR: #000080;"><tbody><tr><td valign="bottom"><font size="2">2D</font></td><td valign="bottom"><font size="2">4E</font></td><td valign="bottom"><font size="2">87</font></td><td valign="bottom"><font size="2">65</font></td><td valign="bottom"><font size="2">31</font></td><td valign="bottom"><font size="2">00</font></td><td valign="bottom"><font size="2">32</font></td><td valign="bottom"><font size="2">00</font></td><td valign="bottom"><font size="2">33</font></td><td valign="bottom"><font size="2">00</font></td><td valign="bottom"><font size="2">00</font></td><td valign="bottom"><font size="2">00</font></td><td><font color="#808080" size="2"> ← 在 x86 CPU 中,低字节在前</font></td></tr><tr><td bgcolor="#ff0000" colspan="2"><font size="2"><img height="1" alt="" src="http://www.regexlab.com/images/spacer.gif" width="1" border="0"/></font></td><td bgcolor="#ff0000" colspan="2"><font size="2"><img height="1" alt="" src="http://www.regexlab.com/images/spacer.gif" width="1" border="0"/></font></td><td bgcolor="#ff0000" colspan="2"><font size="2"><img height="1" alt="" src="http://www.regexlab.com/images/spacer.gif" width="1" border="0"/></font></td><td bgcolor="#ff0000" colspan="2"><font size="2"><img height="1" alt="" src="http://www.regexlab.com/images/spacer.gif" width="1" border="0"/></font></td><td bgcolor="#ff0000" colspan="2"><font size="2"><img height="1" alt="" src="http://www.regexlab.com/images/spacer.gif" width="1" border="0"/></font></td><td bgcolor="#ff0000" colspan="2"><font size="2"><img height="1" alt="" src="http://www.regexlab.com/images/spacer.gif" width="1" border="0"/></font></td><td><font size="2"><img height="1" alt="" src="http://www.regexlab.com/images/spacer.gif" width="1" border="0"/></font></td></tr><tr><td align="center" colspan="2"><font size="2">中</font></td><td align="center" colspan="2"><font size="2">文</font></td><td align="center" colspan="2"><font size="2">1</font></td><td align="center" colspan="2"><font size="2">2</font></td><td align="center" colspan="2"><font size="2">3</font></td><td align="center" colspan="2"><font size="2">\0</font></td><td align="center"><font size="2"> </font></td></tr></tbody></table><p><font size="2">一共占 10 个字节。</font></p><p><strong><font size="2">1.2 字符,字节,字符串</font></strong></p><p><font size="2">理解编码的关键,是要把字符的概念和字节的概念理解准确。这两个概念容易混淆,我们在此做一下区分:</font></p><table cellspacing="0" cellpadding="3" border="0"><tbody><tr><td class="top_1"><font size="2"> </font></td><td class="top_2" align="center"><b><font size="2">概念描述</font></b></td><td class="top_2" align="center"><b><font size="2">举例</font></b></td></tr><tr><td class="con_1" nowrap="true" align="center"><font size="2">字符</font></td><td class="con_2"><font size="2">人们使用的记号,抽象意义上的一个符号。</font></td><td class="con_2"><font size="2">'1', '中', 'a', '$', '¥', ……</font></td></tr><tr><td class="con_1" nowrap="true" align="center"><font size="2">字节</font></td><td class="con_2"><font size="2">计算机中存储数据的单元,一个8位的二进制数,是一个很具体的存储空间。</font></td><td class="con_2"><font size="2">0x01, 0x45, 0xFA, ……</font></td></tr><tr><td class="con_1" nowrap="true" align="center"><font size="2">ANSI<br/>字符串</font></td><td class="con_2"><font size="2">在内存中,如果“字符”是以 <b>ANSI 编码</b>形式存在的,一个字符可能使用一个字节或多个字节来表示,那么我们称这种字符串为 <b>ANSI 字符串</b>或者<b>多字节字符串</b>。</font></td><td class="con_2"><font size="2">"中文123"<br/><span class="rem"><font color="#339933">(占7字节)</font></span></font></td></tr><tr><td class="bot_1" nowrap="true" align="center"><font size="2">UNICODE<br/>字符串</font></td><td class="bot_2"><font size="2">在内存中,如果“字符”是以在 UNICODE 中的序号存在的,那么我们称这种字符串为 <b>UNICODE 字符串</b>或者<b>宽字节字符串</b>。</font></td><td class="bot_2"><font size="2">L"中文123"<br/><span class="rem"><font color="#339933">(占10字节)</font></span></font></td></tr></tbody></table><p><font size="2">由于不同 ANSI 编码所规定的标准是不相同的,因此,对于一个给定的<b>多字节字符串</b>,我们必须知道它采用的是哪一种编码规则,才能够知道它包含了哪些“字符”。而对于 <b>UNICODE 字符串</b>来说,不管在什么环境下,它所代表的“字符”内容总是不变的。</font></p><p><strong><font size="2">1.3 字符集与编码</font></strong></p><p><font size="2">各个国家和地区所制定的不同 ANSI 编码标准中,都只规定了各自语言所需的“字符”。比如:汉字标准(GB2312)中没有规定韩国语字符怎样存储。这些 ANSI 编码标准所规定的内容包含两层含义:</font></p><ol><li><font size="2">使用哪些字符。也就是说哪些汉字,字母和符号会被收入标准中。所包含“字符”的集合就叫做“<b>字符集</b>”。 </font></li><li><font size="2">规定每个“字符”分别用一个字节还是多个字节存储,用哪些字节来存储,这个规定就叫做“<b>编码</b>”。 </font></li></ol><p><font size="2">各个国家和地区在制定编码标准的时候,“字符的集合”和“编码”一般都是同时制定的。因此,平常我们所说的“字符集”,比如:GB2312, GBK, JIS 等,除了有“字符的集合”这层含义外,同时也包含了“编码”的含义。</font></p><p><font size="2">“<b>UNICODE 字符集</b>”包含了各种语言中使用到的所有“字符”。用来给 UNICODE 字符集编码的标准有很多种,比如:UTF-8, UTF-7, UTF-16, UnicodeLittle, UnicodeBig 等。</font></p><p><strong><font size="2">1.4 常用的编码简介</font></strong></p><p><font size="2">简单介绍一下常用的编码规则,为后边的章节做一个准备。在这里,我们根据编码规则的特点,把所有的编码分成三类:</font></p><table cellspacing="0" cellpadding="3" border="0"><tbody><tr><td class="top_1" align="center"><b><font size="2">分类</font></b></td><td class="top_2" align="center"><b><font size="2">编码标准</font></b></td><td class="top_2" align="center"><b><font size="2">说明</font></b></td></tr><tr><td class="con_1" nowrap="true" align="center"><font size="2">单字节字符编码</font></td><td class="con_2"><font size="2">ISO-8859-1</font></td><td class="con_2"><font size="2">最简单的编码规则,每一个字节直接作为一个 UNICODE 字符。比如,[0xD6, 0xD0] 这两个字节,通过 iso-8859-1 转化为字符串时,将直接得到 [0x00D6, 0x00D0] 两个 UNICODE 字符,即 "中"。<br/><br/>反之,将 UNICODE 字符串通过 iso-8859-1 转化为字节串时,只能正常转化 0~255 范围的字符。</font></td></tr><tr><td class="con_1" nowrap="true" align="center"><font size="2">ANSI 编码</font></td><td class="con_2"><font size="2">GB2312,<br/>BIG5,<br/>Shift_JIS,<br/>ISO-8859-2 ……</font></td><td class="con_2"><font size="2">把 UNICODE 字符串通过 ANSI 编码转化为“字节串”时,根据各自编码的规定,一个 UNICODE 字符可能转化成一个字节或多个字节。<br/><br/>反之,将字节串转化成字符串时,也可能多个字节转化成一个字符。比如,[0xD6, 0xD0] 这两个字节,通过 GB2312 转化为字符串时,将得到 [0x4E2D] 一个字符,即 '中' 字。<br/><br/>“ANSI 编码”的特点:<br/>1. 这些“ANSI 编码标准”都只能处理各自语言范围之内的 UNICODE 字符。<br/>2. “UNICODE 字符”与“转换出来的字节”之间的关系是人为规定的。</font></td></tr><tr><td class="bot_1" nowrap="true" align="center"><font size="2">UNICODE 编码</font></td><td class="bot_2"><font size="2">UTF-8,<br/>UTF-16, UnicodeBig ……</font></td><td class="bot_2"><font size="2">与“ANSI 编码”类似的,把字符串通过 UNICODE 编码转化成“字节串”时,一个 UNICODE 字符可能转化成一个字节或多个字节。<br/><br/>与“ANSI 编码”不同的是:<br/>1. 这些“UNICODE 编码”能够处理所有的 UNICODE 字符。<br/>2. “UNICODE 字符”与“转换出来的字节”之间是可以通过计算得到的。</font></td></tr></tbody></table><p><font size="2">我们实际上没有必要去深究每一种编码具体把某一个字符编码成了哪几个字节,我们只需要知道“编码”的概念就是把“字符”转化成“字节”就可以了。对于“UNICODE 编码”,由于它们是可以通过计算得到的,因此,在特殊的场合,我们可以去了解某一种“UNICODE 编码”是怎样的规则。</font></p><p><strong><font size="2">2. 字符与编码在程序中的实现</font></strong></p><h5>2.1 程序中的字符与字节</h5><p><font size="2">在 C++ 和 Java 中,用来代表“字符”和“字节”的数据类型,以及进行编码的方法:</font></p><table cellspacing="0" cellpadding="3" border="0"><tbody><tr><td class="top_1" align="center"><b><font size="2">类型或操作</font></b></td><td class="top_2" align="center"><b><font size="2">C++</font></b></td><td class="top_2" align="center"><b><font size="2">Java</font></b></td></tr><tr><td class="con_1" nowrap="true" align="center"><font size="2">字符</font></td><td class="con_2"><font size="2">wchar_t</font></td><td class="con_2"><font size="2">char</font></td></tr><tr><td class="con_1" nowrap="true" align="center"><font size="2">字节</font></td><td class="con_2"><font size="2">char</font></td><td class="con_2"><font size="2">byte</font></td></tr><tr><td class="con_1" nowrap="true" align="center"><font size="2">ANSI 字符串</font></td><td class="con_2"><font size="2">char[]</font></td><td class="con_2"><font size="2">byte[]</font></td></tr><tr><td class="con_1" nowrap="true" align="center"><font size="2">UNICODE 字符串</font></td><td class="con_2"><font size="2">wchar_t[]</font></td><td class="con_2"><font size="2">String</font></td></tr><tr><td class="con_1" nowrap="true" align="center"><font size="2">字节串→字符串</font></td><td class="con_2"><font size="2">mbstowcs(), MultiByteToWideChar()</font></td><td class="con_2"><font size="2">string = new String(bytes, "encoding")</font></td></tr><tr><td class="bot_1" nowrap="true" align="center"><font size="2">字符串→字节串</font></td><td class="bot_2"><font size="2">wcstombs(), WideCharToMultiByte()</font></td><td class="bot_2"><font size="2">bytes = string.getBytes("encoding")</font></td></tr></tbody></table><p><font size="2">以上需要注意几点:</font></p><ol><li><font size="2">Java 中的 char 代表一个“UNICODE 字符(宽字节字符)”,而 C++ 中的 char 代表一个字节。 </font></li><li><font size="2">MultiByteToWideChar() 和 WideCharToMultiByte() 是 Windows API 函数。</font></li></ol><p><strong><font size="2">2.2 Java 中相关实现方法</font></strong></p><p><font size="2">字符串类 String 中的内容是 UNICODE 字符串:</font></p><table cellspacing="0" cellpadding="6" bgcolor="#eeeeee" border="1"><tbody><tr><td class="code"><span class="rem"><font color="#339933" size="2">// Java 代码,直接写中文</font></span><span class="pw"><br/><font color="#ff0000" size="2">String</font></span><font size="2"> string = <span class="string"><font color="#ff00ff">"中文123"</font></span>;<br/><br/></font><font size="2"><font color="#339933"><span class="rem">// 得到长度为 5,因为是 5 个字符</span><br/></font><span class="pw"><font color="#ff0000">System</font></span>.out.println(string.length());</font></td></tr></tbody></table><p><font size="2">字符串 I/O 操作,字符与字节转换操作。在 Java 包 java.io.* 中,以“Stream”结尾的类一般是用来操作“字节串”的类,以“Reader”,“Writer”结尾的类一般是用来操作“字符串”的类。</font></p><table cellspacing="0" cellpadding="6" bgcolor="#eeeeee" border="1"><tbody><tr><td class="code"><span class="rem"><font color="#339933" size="2">// 字符串与字节串间相互转化<br/><br/>// 按照 GB2312 得到字节(得到多字节字符串)</font></span><span class="key"><br/><font color="#0000ff" size="2">byte</font></span><font size="2"> [] bytes = string.getBytes(<span class="string"><font color="#ff00ff">"GB2312"</font></span>);<br/><br/></font><font size="2"><font color="#339933"><span class="rem">// 从字节按照 GB2312 得到 UNICODE 字符串</span><br/></font>string = <span class="key"><font color="#0000ff">new</font></span><br/><span class="pw"><font color="#ff0000">String</font></span>(bytes, <span class="string"><font color="#ff00ff">"GB2312"</font></span>);<br/><br/></font><font size="2"><font color="#339933"><span class="rem">// 要将 String 按照某种编码写入文本文件,有两种方法:<br/><br/>// 第一种办法:用 Stream 类写入已经按照指定编码转化好的字节串</span><br/></font>OutputStream os = <span class="key"><font color="#0000ff">new</font></span> FileOutputStream(<span class="string"><font color="#ff00ff">"1.txt"</font></span>);<br/>os.write(bytes);<br/>os.close();<br/><br/></font><font size="2"><font color="#339933"><span class="rem">// 第二种办法:构造指定编码的 Writer 来写入字符串</span><br/></font>Writer ow = <span class="key"><font color="#0000ff">new</font></span> OutputStreamWriter(<span class="key"><font color="#0000ff">new</font></span> FileOutputStream(<span class="string"><font color="#ff00ff">"2.txt"</font></span>), <span class="string"><font color="#ff00ff">"GB2312"</font></span>);<br/>ow.write(string);<br/>ow.close();<br/><br/><span class="rem"><font color="#339933">/* 最后得到的 1.txt 和 2.txt 都是 7 个字节 */</font></span></font></td></tr></tbody></table><p><font size="2">如果 java 的源程序编码与当前默认 ANSI 编码不符,则在编译的时候,需要指明一下源程序的编码。比如:</font></p><table cellspacing="0" cellpadding="6" bgcolor="#eeeeee" border="1"><tbody><tr><td class="code"><font size="2">E:\>javac <font color="#ff0000">-encoding BIG5</font> Hello.java</font></td></tr></tbody></table><p><font size="2">以上需要注意区分源程序的编码与 I/O 操作的编码,前者是在编译时起作用,后者是在运行时起作用。</font></p><p><strong><font size="2">3. 几种误解,以及乱码产生的原因和解决办法</font></strong></p><h5>3.1 容易产生的误解</h5><table cellspacing="0" cellpadding="3" border="0"><tbody><tr><td class="top_1"><font size="2"> </font></td><td class="top_2" align="center"><b><font size="2">对编码的误解</font></b></td></tr><tr><td class="con_1" nowrap="true" align="center"><font size="2">误解一</font></td><td class="con_2"><font size="2">在将“字节串”转化成“UNICODE 字符串”时,比如在读取文本文件时,或者通过网络传输文本时,容易将“字节串”简单地作为<b>单字节字符串</b>,采用每“一个字节”就是“一个字符”的方法进行转化。<br/><br/>而实际上,在非英文的环境中,应该将“字节串”作为 ANSI 字符串,采用适当的编码来得到 UNICODE 字符串,有可能“多个字节”才能得到“一个字符”。<br/><br/>通常,一直在英文环境下做开发的程序员们,容易有这种误解。</font></td></tr><tr><td class="bot_1" nowrap="true" align="center"><font size="2">误解二</font></td><td class="bot_2"><font size="2">在 DOS,Windows 98 等非 UNICODE 环境下,字符串都是以 ANSI 编码的字节形式存在的。这种以字节形式存在的字符串,必须知道是哪种编码才能被正确地使用。这使我们形成了一个惯性思维:“字符串的编码”。<br/><br/>当 UNICODE 被支持后,Java 中的 String 是以字符的“序号”来存储的,不是以“某种编码的字节”来存储的,因此已经不存在“字符串的编码”这个概念了。只有在“字符串”与“字节串”转化时,或者,将一个“字节串”当成一个 ANSI 字符串时,才有编码的概念。<br/><br/>不少的人都有这个误解。</font></td></tr></tbody></table><p><font size="2">第一种误解,往往是导致乱码产生的原因。第二种误解,往往导致本来容易纠正的乱码问题变得更复杂。</font></p><p><font size="2">在这里,我们可以看到,其中所讲的“误解一”,即采用每“一个字节”就是“一个字符”的转化方法,实际上也就等同于采用 iso-8859-1 进行转化。因此,我们常常使用 bytes = string.getBytes("iso-8859-1") 来进行逆向操作,得到原始的“字节串”。然后再使用正确的 ANSI 编码,比如 string = new String(bytes, "GB2312"),来得到正确的“UNICODE 字符串”。</font></p><p><strong><font size="2">3.2 非 UNICODE 程序在不同语言环境间移植时的乱码</font></strong></p><p><font size="2">非 UNICODE 程序中的字符串,都是以某种 ANSI 编码形式存在的。如果程序运行时的语言环境与开发时的语言环境不同,将会导致 ANSI 字符串的显示失败。</font></p><p><font size="2">比如,在日文环境下开发的非 UNICODE 的日文程序界面,拿到中文环境下运行时,界面上将显示乱码。如果这个日文程序界面改为采用 UNICODE 来记录字符串,那么当在中文环境下运行时,界面上将可以显示正常的日文。</font></p><p><font size="2">由于客观原因,有时候我们必须在中文操作系统下运行非 UNICODE 的日文软件,这时我们可以采用一些工具,比如,南极星,AppLocale 等,暂时的模拟不同的语言环境。</font></p><p><strong><font size="2">3.3 网页提交字符串</font></strong></p><p><font size="2">当页面中的表单提交字符串时,首先把字符串按照当前页面的编码,转化成字节串。然后再将每个字节转化成 "%XX" 的格式提交到 Web 服务器。比如,一个编码为 GB2312 的页面,提交 "中" 这个字符串时,提交给服务器的内容为 "%D6%D0"。</font></p><p><font size="2">在服务器端,Web 服务器把收到的 "%D6%D0" 转化成 [0xD6, 0xD0] 两个字节,然后再根据 GB2312 编码规则得到 "中" 字。</font></p><p><font size="2">在 Tomcat 服务器中,request.getParameter() 得到乱码时,常常是因为前面提到的“误解一”造成的。默认情况下,当提交 "%D6%D0" 给 Tomcat 服务器时,request.getParameter() 将返回 [0x00D6, 0x00D0] 两个 UNICODE 字符,而不是返回一个 "中" 字符。因此,我们需要使用 bytes = string.getBytes("iso-8859-1") 得到原始的字节串,再用 string = new String(bytes, "GB2312") 重新得到正确的字符串 "中"。</font></p><p><strong><font size="2">3.4 从数据库读取字符串</font></strong></p><p><font size="2">通过数据库客户端(比如 ODBC 或 JDBC)从数据库服务器中读取字符串时,客户端需要从服务器获知所使用的 ANSI 编码。当数据库服务器发送字节流给客户端时,客户端负责将字节流按照正确的编码转化成 UNICODE 字符串。</font></p><p><font size="2">如果从数据库读取字符串时得到乱码,而数据库中存放的数据又是正确的,那么往往还是因为前面提到的“误解一”造成的。解决的办法还是通过 string = new String( string.getBytes("iso-8859-1"), "GB2312") 的方法,重新得到原始的字节串,再重新使用正确的编码转化成字符串。</font></p><p><strong><font size="2">3.5 电子邮件中的字符串</font></strong></p><p><font size="2">当一段 Text 或者 HTML 通过电子邮件传送时,发送的内容首先通过一种指定的<b>字符编码</b>转化成“字节串”,然后再把“字节串”通过一种指定的<b>传输编码</b>(Content-Transfer-Encoding)进行转化得到另一串“字节串”。比如,打开一封电子邮件源代码,可以看到类似的内容:</font></p><table cellspacing="0" cellpadding="6" width="100%" bgcolor="#eeeeee" border="1"><tbody><tr><td class="code"><font size="2">Content-Type: text/plain;<br/> <font color="#ff0000">charset="gb2312"</font><br/><font color="#ff0000">Content-Transfer-Encoding: base64</font><br/><br/>sbG+qcrQuqO17cf4yee74bGjz9W7+b3wudzA7dbQ0MQNCg0KvPKzxqO6uqO17cnnsaPW0NDEDQoNCg==</font></td></tr></tbody></table><p><font size="2">最常用的 Content-Transfer-Encoding 有 Base64 和 Quoted-Printable 两种。在对二进制文件或者中文文本进行转化时,Base64 得到的“字节串”比 Quoted-Printable 更短。在对英文文本进行转化时,Quoted-Printable 得到的“字节串”比 Base64 更短。</font></p><p><font size="2">邮件的标题,用了一种更简短的格式来标注“字符编码”和“传输编码”。比如,标题内容为 "中",则在邮件源代码中表示为:</font></p><table cellspacing="0" cellpadding="6" width="100%" bgcolor="#eeeeee" border="1"><tbody><tr><td class="code"><font size="2"><font color="#339933"><span class="rem">// 正确的标题格式</span><br/></font>Subject: <span style="BACKGROUND-COLOR: #ffff00;">=?</span>GB2312<span style="BACKGROUND-COLOR: #ffff00;">?B?</span>1tA=<span style="BACKGROUND-COLOR: #ffff00;">?=</span></font></td></tr></tbody></table><p><font size="2">其中,</font></p><ul><li><font size="2">第一个“=?”与“?”中间的部分指定了字符编码,在这个例子中指定的是 GB2312。 </font></li><li><font size="2">“?”与“?”中间的“B”代表 Base64。如果是“Q”则代表 Quoted-Printable。 </font></li><li><font size="2">最后“?”与“?=”之间的部分,就是经过 GB2312 转化成字节串,再经过 Base64 转化后的标题内容。 </font></li></ul><p><font size="2">如果“传输编码”改为 Quoted-Printable,同样,如果标题内容为 "中":</font></p><table cellspacing="0" cellpadding="6" width="100%" bgcolor="#eeeeee" border="1"><tbody><tr><td class="code"><font size="2"><font color="#339933"><span class="rem">// 正确的标题格式</span><br/></font>Subject: <span style="BACKGROUND-COLOR: #ffff00;">=?</span>GB2312<span style="BACKGROUND-COLOR: #ffff00;">?Q?</span>=D6=D0<span style="BACKGROUND-COLOR: #ffff00;">?=</span></font></td></tr></tbody></table><p><font size="2">如果阅读邮件时出现乱码,一般是因为“字符编码”或“传输编码”指定有误,或者是没有指定。比如,有的发邮件组件在发送邮件时,标题 "中":</font></p><table cellspacing="0" cellpadding="6" width="100%" bgcolor="#eeeeee" border="1"><tbody><tr><td class="code"><font size="2"><font color="#339933"><span class="rem">// 错误的标题格式</span><br/></font>Subject: <span style="BACKGROUND-COLOR: #ffff00;">=?</span><font color="#ff0000">ISO-8859-1</font><span style="BACKGROUND-COLOR: #ffff00;">?Q?</span>=D6=D0<span style="BACKGROUND-COLOR: #ffff00;">?=</span></font></td></tr></tbody></table><p><font size="2">这样的表示,实际上是明确指明了标题为 [0x00D6, 0x00D0],即 "中",而不是 "中"。</font></p><p><strong><font size="2">4. 几种错误理解的纠正</font></strong></p><h5>误解:“ISO-8859-1 是国际编码?”</h5><p><font size="2">非也。iso-8859-1 只是单字节字符集中最简单的一种,也就是“字节编号”与“UNICODE 字符编号”一致的那种编码规则。当我们要把一个“字节串”转化成“字符串”,而又不知道它是哪一种 ANSI 编码时,先暂时地把“每一个字节”作为“一个字符”进行转化,不会造成信息丢失。然后再使用 bytes = string.getBytes("iso-8859-1") 的方法可恢复到原始的字节串。</font></p><h5>误解:“Java 中,怎样知道某个字符串的内码?”</h5><p><font size="2">Java 中,字符串类 java.lang.String 处理的是 UNICODE 字符串,不是 ANSI 字符串。我们只需要把字符串作为“抽象的符号的串”来看待。因此不存在字符串的内码的问题。</font></p><table cellspacing="0" cellpadding="0" width="100%" border="0"><tbody><tr valign="top"><td align="right" width="100%"><font size="2"><img height="1" alt="" src="http://www.regexlab.com/images/blue_rule.gif" width="553" border="0"/></font></td></tr></tbody></table>
[此贴子已经被作者于2006-7-5 16:34:25编辑过]
您需要登录后才可以回帖 登录 | 成为会员

本版积分规则

QQ|手机版|小黑屋|网站帮助|职业IT人-IT人生活圈 ( 粤ICP备12053935号-1 )|网站地图
本站文章版权归原发布者及原出处所有。内容为作者个人观点,并不代表本站赞同其观点和对其真实性负责,本站只提供参考并不构成任何投资及应用建议。本站是信息平台,网站上部分文章为转载,并不用于任何商业目的,我们已经尽可能的对作者和来源进行了通告,但是能力有限或疏忽造成漏登,请及时联系我们,我们将根据著作权人的要求立即更正或者删除有关内容。

GMT+8, 2024-4-29 00:23 , Processed in 0.167044 second(s), 23 queries , Gzip On.

Powered by Discuz! X3.4

Copyright © 2001-2021, Tencent Cloud.

快速回复 返回顶部 返回列表