字符

字符是一個信息單位，簡單來講就是一個字母、數字、標點符號、漢字等。

字符的最佳定義是Unicode字符：

它是一個全球化的標准，能表示世界上所有語言的字符。Unicode字符的標識（碼位）是以4~6個十六進制數字表示的，並且加前綴U+。

字節

字節是計算機信息計量單位，一個字節代表八個比特，存儲的數值范圍為0~255。

字節跳動（ByteDance）互聯網公司的字節就是這個字節。

字節是機器的，字符是人類的。

把人類字符轉換為機器字節時使用的算法叫做編碼，反之叫做解碼。

算法不同，字節與字符的關系也不同：

bytes和bytearray

字節實際上是個二進制序列。不可變bytes類型和可變bytearray類型是用來存儲二進制序列的，它們的示例如下：

>>> cafe = bytes("café", encoding="utf_8")
>>> cafe
b'caf\xc3\xa9'
>>> cafe[0]
99
>>> cafe[:1]
b'c'
>>> cafe_arr = bytearray(cafe)
>>> cafe_arr
bytearray(b'caf\xc3\xa9')
>>> cafe_arr[-1:]
bytearray(b'\xa9')

特別的是cafe[0]返回了整數，cafe[:1]返回了二進制序列，這是因為s[0] == s[:1]只對str類型成立，而對於其他類型來說，s[i]返回一個元素，s[i:i+1]返回一個相同類型的序列。

二進制序列實際上是整數序列。它們的字面量表示法包含ASCII字符（ASCII只能表示英文體系的字符），比如cafe的b'caf\xc3\xa9'，具體規則是：

從空格到~的字符直接使用ASCII字符
制表符\t、換行符\n、回車符\r、轉義符\\
其他字符用十六進制轉義序列，比如\x00空字節

構建bytes和bytearray對象的方式有以下幾種：

一個str對象和一個encoding關鍵字參數
一個可迭代對象，數值在0~255
一個實現了緩沖協議的對象，如bytes、bytearray、memoryview、array.array

memoryview和struct

memoryview允許在二進制數據結構之間共享內存，struct能從序列中提取結構化信息。

示例如下，提取一個GIF圖像的寬度和高度：

import struct

with open("filter.gif", "rb") as fp:
    img = memoryview(fp.read())

# 這里不會復制字節序列，因為用的memoryview
header = img[:10]
print(bytes(header))  # b'GIF89a+\x02\xe6\x00'

# <是小字節序，3s3s是兩個3字節序列，HH是兩個16位二進制整數
# 類型、版本、寬度、高度
struct.unpack("<3s3sHH", header)  # (b'GIF', b'89a', 555, 230)

# 刪除引用，釋放memoryview實例所占的內存
del header
del img

小結

本文介紹了字符和字節的概念以及它們之間的關系，一個字符對應一個或多個字節。字符是人類的，字節是機器的，編碼就是人類字符轉換為機器字節，反之叫做解碼。然后分別介紹了二進制序列的類型bytes和bytearray，和二進制序列的工具memoryview和struct。

參考資料：

《流暢的Python》

http://www.ruanyifeng.com/blog/2007/10/ascii_unicode_and_utf-8.html

https://zh.wikipedia.org/wiki/字符_(計算機科學)

https://home.unicode.org/

https://zh.wikipedia.org/wiki/字節

https://www.runoob.com/w3cnote/byte-character.html

免責聲明！

本站轉載的文章為個人學習借鑒使用，本站對版權不負任何法律責任。如果侵犯了您的隱私權益，請聯系本站郵箱yoyou2525@163.com刪除。

猜您在找 關於字符字節 python3 python字符串有多少字節 python 2 ，python3 字符串，字節 python 關於字節串和字符串 python中的字符串和字節串 python3的字符串和字節 python中字節與字符串的轉換 Python 字節與字符串的轉換 Python的字符串和字節型 python字符串與字節序列