Python 存储字符串时节省空间的方法

2025-04-12 15:25:28

从 Python 3 开始，str 类型代表着 Unicode 字符串。取决于编码的类型，一个 Unicode 字符可能会占 4 个字节，这个有些时候有点浪费内存。

出于内存占用以及性能方面的考虑，Python 内部采用下面 3 种方式来存储 Unicode 字符：

一个字符占一个字节（Latin-1 编码）
一个字符占二个字节（UCS-2 编码）
一个字符占四个字节（UCS-4 编码）

使用 Python 进行开发的时候，我们会觉得字符串的处理都很类似，很多时候根本不需要注意这些差别。可是，当碰到大量的字符处理的时候，这些细节就要特别注意了。

我们可以做一些小实验来体会下上面三种方式的差别。方法 sys.getsizeof 用来获取一个对象所占用的字节，这里我们会用到。

>>> import sys
>>> string = 'hello'
>>> sys.getsizeof(string)
54
>>> # 1-byte encoding
... sys.getsizeof(string + '!') - sys.getsizeof(string)
1
>>> # 2-byte encoding
... string2 = '你'
>>> sys.getsizeof(string2 + '好') - sys.getsizeof(string2)
2
>>> sys.getsizeof(string2)
76
>>> # 4-byte encoding
... string3 = ':snake:'
>>> sys.getsizeof(string3 + ':computer:') - sys.getsizeof(string3)
4
>>> sys.getsizeof(string3)
80

如上所示，当字符串的内容不同时，所采用的编码也会不同。需要注意的是，Python 中每个字符串都会另外占用 49-80 字节的空间，用于存储额外的一些信息，比如哈希、字符串长度、字符串字节数和字符串标识。这么一来，一个空字符串会占用 49 个字节，也就好理解了。

我们可以通过 cbytes 直接获取一个对象的编码类型：

import ctypes
class PyUnicodeObject(ctypes.Structure):
 # internal fields of the string object
 _fields_ = [("ob_refcnt", ctypes.c_long),
    ("ob_type", ctypes.c_void_p),
    ("length", ctypes.c_ssize_t),
    ("hash", ctypes.c_ssize_t),
    ("interned", ctypes.c_uint, 2),
    ("kind", ctypes.c_uint, 3),
    ("compact", ctypes.c_uint, 1),
    ("ascii", ctypes.c_uint, 1),
    ("ready", ctypes.c_uint, 1),
    # ...
    # ...
    ]
def get_string_kind(string):
 return PyUnicodeObject.from_address(id(string)).kind

然后测试

>>> get_string_kind('Hello')
1
>>> get_string_kind('你好')
2
>>> get_string_kind(':snake:')
4

如果一个字符串中的所有字符都能用 ASCII 表示，那么 Python 会使用 Latin-1 编码。简单说下，Latin-1 用于表示前 256 个 Unicode 字符。它能支持很多拉丁语言，比如英语、瑞典语、意大利语等。不过，如果是汉语、日语、西伯尔语等非拉丁语言，Latin-1 编码就行不通了。因为这些语言的文字的码位值（编码值）超过了 1 个字节的范围（0-255）。

>>> ord('a')
97
>>> ord('你')
20320
>>> ord('!')
33

大部分语言文字使用 2 个字节（UCS-2）来编码就已经足够了。4 个字节（UCS-4）的编码在保存特殊符号、emoji 表情或者少见的语言文字的时候会用到。

设想有一个 10GB 的 ASCII 文本文件，我们准备将其读到内存里面去。如果你插入一个 emoji 表情到文件中，文件占用空间将会达到 4 倍。如果你处理 NLP 问题较多的话，这种差别你应该能经常体会到。

Python 内部为什么不直接使用 UTF-8 编码

最常见的 Unicode 编码是 UTF-8，但是 Python 内部并没有使用它。

UTF-8 编码字符的时候，取决于字符的内容，占的空间在 1-4 个字节内发生变化。这是一种特别省空间的存储方式，但正因为这种变长的存储方式，导致字符串不能通过下标直接进行随机读取，只能遍历进行查找。比如，如果采用的是 UTF-8 编码的话，Python 获取 string[5] 只能一个一个字符的进行扫描，直至找到目标字符。如果是定长编码的话也就没有问题了，要用一个下标定位一个字符，只需要用下标乘以指定长度（1、2 或者 4）就能确定。

字符串驻留

Python 中的空字符串和 ASCII 字符都会使用到字符串驻留（string interning）技术。怎么理解？你就把这些字符（串）看作是单例的就行。也就是说，两个相同内容的字符串如果使用了驻留的技术，那么内存里面其实就只开辟了一个空间。

>>> a = 'hello'
>>> b = 'world'
>>> a[4],b[1]
('o', 'o')
>>> id(a[4]), id(b[1]), a[4] is b[1]
(4567926352, 4567926352, True)
>>> id('')
4545673904
>>> id('')
4545673904

正如你看到的那样，a 中的字符 o 和 b 中的字符 o 有着同样的内存地址。Python 中的字符串是不可修改的，所以提前为某些字符分配好位置便于后面使用也是可行的。

使用到字符串驻留的除了 ASCII 字符、空窜之外，字符长度不超过 20 的串也使用到了同样的技术，前提是这些串的内容在编译的时候就能确定。

这包括：

方法名、类型
变量名
参数名
常量（代码中定义的字符串）
字典的键
属性名

当你在交互式命令行中编写代码的时候，语句同样也会先被编译成字节码。所以说，交互式命令行中的短字符串也会被驻留。

>>> a = 'teststring'
>>> b = 'teststring'
>>> id(a), id(b), a is b
(4569487216, 4569487216, True)
>>> a = 'test'*5
>>> b = 'test'*5
>>> len(a), id(a), id(b), a is b
(20, 4569499232, 4569499232, True)
>>> a = 'test'*6
>>> b = 'test'*6
>>> len(a), id(a), id(b), a is b
(24, 4569479328, 4569479168, False)

因为必须是常量字符串会使用到驻留，所以下面的例子不能达到驻留的效果：

>>> open('test.txt','w').write('hello')
5
>>> open('test.txt','r').read()
'hello'
>>> a = open('test.txt','r').read()
>>> b = open('test.txt','r').read()
>>> id(a), id(b), a is b
(4384934576, 4384934688, False)
>>> len(a), id(a), id(b), a is b
(5, 4384934576, 4384934688, False)

字符串驻留技术，减少了大量的重复字符串的内存分配。Python 底层通过字典实现的这种技术，这些暂存的字符串作为字典的键。如果想要知道某个字符串是否已经驻留，使用字典的查找操作就能确定。

Python 的 unicode 对象的实现（ https://github.com/python/cpython/blob/master/Objects/unicodeobject.c ）大约有 16,000 行 C 代码，其中有很多小优化在本文中未提及。如果你想更多的了解 Python 中的 Unicode，推荐你去看一下字符串相关的 PEPs（ https://www.python.org/dev/peps/ ），同时查看下 unicode 对象的源码。

总结

以上所述是小编给大家介绍的Python 存储字符串时节省空间的方法,希望对大家有所帮助，如果大家有任何疑问请给我留言，小编会及时回复大家的。在此也非常感谢大家对我们网站的支持！
如果你觉得本文对你有帮助，欢迎转载，烦请注明出处，谢谢！

用python代码将tiff图片存储到jpg的方法

mac用起来还是有很多不方便的地方,app很局限也都不是很好用,mac自带的截图工具,格式是tiff,需要转成jpg才能在代码中使用,利用python代码很轻松做到了这一点: 打开终端,输入bpython: from PIL import Image im=Image.open('/Users/jowang/Pictures/wbh5.tiff') im.save('/Users/jowang/Pictures/wbh5.jpg') 很简洁! 以上这篇用python代码将tiff图片存储到jpg
使用python存储网页上的图片实例

本文介绍在已知网络图片的地址下,存储图片到本地本文例子随便选择LOFTER上一张图片,复制图片的地址,如下图所示在Python中输入代码 import requests #图片地址 img_url = "http://imglf0.nosdn.127.net/img/RWppUi92Wk1nQzFtTUtCdUdwY2Vkd1pPekVqZ1RhT0VRZVJkeFhRanc0d2Vwa2dVUmUrR25RPT0.jpg?imageView&thumbnail=500x0&
详解如何在python中读写和存储matlab的数据文件(*.mat)

背景在做deeplearning过程中,使用caffe的框架,一般使用matlab来处理图片(matlab处理图片相对简单,高效),用python来生成需要的lmdb文件以及做test产生结果.所以某些matlab从图片处理得到的label信息都会以.mat文件供python读取,同时也python产生的结果信息也需要matlab来做进一步的处理(当然也可以使用txt,不嫌麻烦自己处理结构信息). 介绍 matlab和python间的数据传输一般是基于matlab的文件格式.mat,pytho
python奇偶行分开存储实现代码

例子: 1:www.jb51.net 2:www.jb51.net 3:www.jb51.net 4:www.jb51.net 5:www.jb51.net 6:www.jb51.net 7:www.jb51.net 8:www.jb51.net 9:www.jb51.net 10:www.jb51.net 11:www.jb51.net 12:www.jb51.net 13:www.jb51.net 14:www.jb51.net 15:www.jb51.net 16:www.jb51.net
Python OpenCV读取png图像转成jpg图像存储的方法

如下所示: import os import cv2 import sys import numpy as np path = "F:\\ImageLib\\VRWorks_360_Video _SDK_1.1\\footage14\\" print(path) for filename in os.listdir(path): if os.path.splitext(filename)[1] == '.png': # print(filename) img = cv2.imread(
python3下使用cv2.imwrite存储带有中文路径图片的方法

由于imwrite前使用编码在python3中已经不适用,可用imencode代替,以下代码是从视频中获取第2帧保存在中文文件夹下的实例: cap = cv2.VideoCapture("***.mp4") cap.set(cv2.CAP_PROP_POS_FRAMES, 2) ret, frame=cap.read() cv2.imwrite("我//h.jpg", frame) #该方法不成功 cv2.imencode('.jpg', frame)[1].tof
Python 存储字符串时节省空间的方法

从 Python 3 开始,str 类型代表着 Unicode 字符串.取决于编码的类型,一个 Unicode 字符可能会占 4 个字节,这个有些时候有点浪费内存. 出于内存占用以及性能方面的考虑,Python 内部采用下面 3 种方式来存储 Unicode 字符: 一个字符占一个字节(Latin-1 编码) 一个字符占二个字节(UCS-2 编码) 一个字符占四个字节(UCS-4 编码) 使用 Python 进行开发的时候,我们会觉得字符串的处理都很类似,很多时候根本不需要注意这些差别.可是,当
Python实现自动登录百度空间的方法

本文实例讲述了Python实现自动登录百度空间的方法.分享给大家供大家参考,具体如下: 开发环境:Fedora12 + Python2.6.2 #!/usr/bin/python # coding: GBK import urllib,urllib2,httplib,cookielib def auto_login_hi(url,name,pwd): url_hi="http://passport.baidu.com/?login" #设置cookie cookie=cookielib
python判断字符串是否纯数字的方法

本文实例讲述了python判断字符串是否纯数字的方法.分享给大家供大家参考.具体如下: 判断的代码如下,通过异常判断不能区分前面带正负号的区别,正则表达式可以根据自己需要比较灵活的写,通过isdigit方法用来判断是否是纯数字,测试代码如下复制代码代码如下: #!/usr/bin/python # -*- coding: utf-8 -*- a = "1" b = "1.2" c = "a" #通过抛出异常 def is_num_by_exc
python实现字符串完美拆分split()的方法

函数:split() 例子我们想要将以下字符串rule进行拆分.字符串表示的是一个规则,由"-"得到"-".我们需要将规则中的条件属性与取值分别提取出来,存放在条件属性列表cf_list与值列表cv_list中,规则的结论的属性与取值也提取出来,分别存放结果属性列表rf_list与值列表rc_list. rule = '{age=Middle-aged,sex=Male,education=Bachelors}=>{native-country=United
Python实现迭代时使用索引的方法示例

本文实例讲述了Python实现迭代时使用索引的方法.分享给大家供大家参考,具体如下: 索引迭代 Python中,迭代永远是取出元素本身,而非元素的索引. 对于有序集合,元素确实是有索引的.有的时候,我们确实想在 for 循环中拿到索引,怎么办? 方法是使用 enumerate()函数: >>> L = ['Adam', 'Lisa', 'Bart', 'Paul'] >>> for index, name in enumerate(L): ... print index
python中字符串String及其常见操作指南(方法、函数)

目录下标与切片常见方法查找替换分割大小写格式化对齐格式化清除空白字符检查补充:16个常用函数总结注意:对字符串的所有操作,原始数据(即原字符串)不变 !(字符串是不可变类型) 对原字符串操作会返回一个操作后的数据, 可以使用变量去接受数据 ----------------------------------------------------------------------------------------------------------------------
python将字符串转换成数组的方法

python将字符串转换成数组的方法.分享给大家供大家参考.具体实现方法如下: #----------------------------------------- # Name: string_to_array.py # Author: Kevin Harris # Last Modified: 02/13/04 # Description: This Python script demonstrates # how to modify a string by # converting it
python清除字符串里非数字字符的方法

本文实例讲述了python清除字符串里非数字字符的方法.分享给大家供大家参考.具体如下: import re s = "how19 a*re 254y**ou?" # Using regular expressions print re.sub("\D", "", s) 希望本文所述对大家的Python程序设计有所帮助.
python实现字符串和日期相互转换的方法

本文实例讲述了python实现字符串和日期相互转换的方法.分享给大家供大家参考.具体分析如下: 这里用的分别是time和datetime函数 ''' @author: jiangqh ''' import time,datetime # date to str print time.strftime("%Y-%m-%d %X", time.localtime()) #str to date t = time.strptime("2009 - 08 - 08", &q
python判断字符串是否是json格式方法分享

在实际工作中,有时候需要对判断字符串是否为合法的json格式解决方法使用json.loads,这样更加符合'Pythonic'写法代码示例: Python import json def is_json(myjson): try: json_object = json.loads(myjson) except ValueError, e: return False return True 运行代码编辑模式复制折叠输出结果: Python print is_json("{}") #

Python 存储字符串时节省空间的方法

相关推荐

随机推荐