>>a='中'>>>type(a)>>>isinstance(a,basestring)True>>>a=u'中'>>>type(a)>>>isin" />

欧美三区_成人在线免费观看视频_欧美极品少妇xxxxⅹ免费视频_a级毛片免费播放_鲁一鲁中文字幕久久_亚洲一级特黄

python中的編碼知識整理匯總

系統(tǒng) 1711 0

問題

在平時工作中,遇到了這樣的錯誤:

            
UnicodeDecodeError: 'ascii' codec can't decode byte

          

想必大家也都碰到過,很常見 。于是決定對python的編碼做一個整理和學(xué)習(xí)。

基礎(chǔ)知識

在python2.x中,有兩種數(shù)據(jù)類型,unicode和str,這兩個都是basestring的子類

            
>>> a = '中'
>>> type(a)

            
              
>>> isinstance(a,basestring)
True
>>> a = u'中'
>>> type(a)

              
                
>>> isinstance(a,basestring)
True

              
            
          

兩者的區(qū)別,概括來講,str是字節(jié)串,由unicode經(jīng)過編碼(encode)后的字節(jié)組成的(好比與python3.x的byte);unicode是對象,才是真正意義上的字符串,由字符組成

            
>>> a='中文'
>>> len(a)
6
>>> repr(a)
"'\\xe4\\xb8\\xad\\xe6\\x96\\x87'"
>>> b=u'中文'
>>> len(b)
2
>>> repr(b)
"u'\\u4e2d\\u6587'"

          

控制臺和腳本

在linux下的python控制臺執(zhí)行以下命令,所得的結(jié)果和執(zhí)行腳本是不同的

            
>>> a = u'中文'
>>> repr(a)
"u'\\xe4\\xb8\\xad\\xe6\\x96\\x87'"
>>> b = unicode('中文','utf-8')b)
>>> repr(b)
"u'\\u4e2d\\u6587'"

          

可以看到,u'中文'初始化的對象a不是我們所期望的,那究竟是什么原因呢?
將python看成是一根管子,管子里頭處理的中間過程都是使用unicode的。入口處,全部轉(zhuǎn)成unicode;出口處,再轉(zhuǎn)成目標編碼(當(dāng)然,有例外,處理邏輯中要用到具體編碼的情況)。
在控制臺執(zhí)行命令a = u'中文',可以將解釋為命令,a = ‘中文'.decode(encode),從而到到unicode對象a。那么這里的encode是什么呢?對于控制臺來說,就是標準輸入,即sys.stdin.encoding

            
>>> sys.stdin.encoding
'ISO-8859-1'

          

我的這邊控制臺默認的編碼是ISO-8859-1,故a = u'中文' <=> a = '中文'.decode('ISO-8859-1')
這里的'中文'是控制臺理解的,即使根據(jù)終端編碼方式編碼后的字節(jié)碼,對于utf-8編碼的終端,'中文'='\\xe4\\xb8\\xad\\xe6\\x96\\x87'

            
>>> a='中文'.decode('ISO-8859-1') 
>>> repr(a)
"u'\\xe4\\xb8\\xad\\xe6\\x96\\x87'"

          

那如何修改此編碼值呢,設(shè)置為什么呢?在linux環(huán)境中設(shè)置環(huán)境變量方法如下,具體設(shè)置什么只要與終端編碼方式一直即可

            
export PYTHONIOENCODING=UTF-8

          

總結(jié)

重新回到最初的那個問題,造成問題的原因是沒有搞清楚unicode和str的區(qū)別,將兩者進行了混用。

            
>>> a = '中文'
>>> a.encode('gbk')
Traceback (most recent call last):
 File "
            
              ", line 1, in 
              
                
UnicodeDecodeError: 'ascii' codec can't decode byte 0xe4 in position 0: ordinal not in range(128)

              
            
          

以上的對象a其實是str,即字節(jié)碼,若終端是utf-8編碼的話,那么a就是用utf-8 encode的字節(jié)碼。a.encode('gbk') 等價于a.decode(encoding).encode('gbk'),即先將字節(jié)碼解碼為unicode字符,然后再encode為字節(jié)碼。unicode對象作為中轉(zhuǎn)站。那么這里的encoding是什么呢?

            
>>> import sys
>>> sys.getdefaultencoding()
'ascii'

          

默認是ascii,這正是錯誤為什么報無法用ascii解碼的原因

            
>>> reload(sys)

            
              
>>> sys.setdefaultencoding('utf-8')
>>> a = '中文'
>>> repr(a)
"'\\xe4\\xb8\\xad\\xe6\\x96\\x87'"
>>> a.encode('gbk')
'\xd6\xd0\xce\xc4'

            
          

將默認編碼改為utf-8,即可。不鼓勵對str使用encode方法,因為其中隱式對str進行了解碼。decode只對str,encode只對unicode,一切decode/encode都顯示指定編碼方式。


更多文章、技術(shù)交流、商務(wù)合作、聯(lián)系博主

微信掃碼或搜索:z360901061

微信掃一掃加我為好友

QQ號聯(lián)系: 360901061

您的支持是博主寫作最大的動力,如果您喜歡我的文章,感覺我的文章對您有幫助,請用微信掃描下面二維碼支持博主2元、5元、10元、20元等您想捐的金額吧,狠狠點擊下面給點支持吧,站長非常感激您!手機微信長按不能支付解決辦法:請將微信支付二維碼保存到相冊,切換到微信,然后點擊微信右上角掃一掃功能,選擇支付二維碼完成支付。

【本文對您有幫助就好】

您的支持是博主寫作最大的動力,如果您喜歡我的文章,感覺我的文章對您有幫助,請用微信掃描上面二維碼支持博主2元、5元、10元、自定義金額等您想捐的金額吧,站長會非常 感謝您的哦!!!

發(fā)表我的評論
最新評論 總共0條評論
主站蜘蛛池模板: 浮力影院最新地址 | 日韩欧美一区二区不卡 | 性xxxx免费观看视频 | 久久久无码精品一区二区三区 | 亚洲精品一区二区三区蜜桃久 | 国产精品综合亚洲AV久久久小说 | 亚洲天堂2013 | 精品国产一区二区三区四 | 精品欧美一区二区三区在线 | 久久久精品日本 | 欧美欲妇激情视频在线 | 国产一区二区三区久久久久久久久 | a毛片久久免费观看 | 国产精品极品美女自在线看免费一区二区 | 亚洲码在线 | 亚洲成人另类 | 亚洲精品久久午夜无码一区二区 | 久久91综合国产91久久精品 | 成人精品视频在线观看 | 一区二区在线看 | 起视碰碰97摸摸碰碰视频 | 欧美欲妇激情视频在线 | 成人黄视频在线观看 | 欧美福利 | 91精品一区 | 免费国产一区 | 日韩在线无 | 久久久久国产精品 | av2014天堂网 | 久色一区 | 色欧美色| 中文字幕综合在线观看 | 精品特级毛片 | 日本精品三级 | 91在线看| 视频成人永久免费视频 | 亚洲精品福利一区二区三区 | 亚洲欧美一区二区久久香蕉 | 国产精品久久99 | 欧美一级免费 | 手机看片高清日韩精品 |