Python内存溢出
- 存在循环引用,gc不能释放;
- 存在全局对象,该对象不断的变大,占据内存;
- 使用了c或者c++扩展,扩展内存溢出了;
有时候使用pykafka, pykafka的balancedconsumer类有个参数queued_max_messages。
这个参数的意思balancedconsumer会为每个分区缓存消息,默认一个分区是2000条。
如果一条消息是1M,只有一个分区的话,就缓存了2000M,对于不够内存的机器那就gg了。
将调用方法的参数调小来使用。
Python内存泄露
循环引用的变量并不会被回收,它会一直驻留在内存中,就会造成了内存泄漏(内存空间在使用完毕后未释放)。
Python垃圾回收机制
GC作为现代编程语言的自动内存管理机制,
专注于两件事:1. 找到内存中无用的垃圾资源 2. 清除这些垃圾并把内存让出来给其他对象使用。
GC彻底把程序员从资源管理的重担中解放出来,让他们有更多的时间放在业务逻辑上。
但这并不意味着码农就可以不去了解GC,毕竟多了解GC知识还是有利于我们写出更健壮的代码。
- 引用计数(Reference Counting)
原理: 每个对象维护一个ob_ref字段,用来记录该对象当前被引用的次数,每当新的引用指向该对象时,它的引用计数ob_ref加1,
每当该对象的引用失效时计数ob_ref减1,一旦对象的引用计数为0,该对象立即被回收。
缺点: 额外空间+不能解决循环计数问题
- 标记清除(Mark—Sweep)
算法是一种基于追踪回收(tracing GC)技术实现的垃圾回收算法。
它分为两个阶段:
第一阶段是标记阶段,GC会把所有的『活动对象』打上标记,
第二阶段是把那些没有标记的对象『非活动对象』进行回收。
那么GC又是如何判断哪些是活动对象哪些是非活动对象的呢?
对象之间通过引用(指针)连在一起,构成一个有向图,对象构成这个有向图的节点,而引用关系构成这个有向图的边。
从根对象(root object)出发,沿着有向边遍历对象,可达的(reachable)对象标记为活动对象,不可达的对象就是要被清除的非活动对象。
根对象就是全局变量、调用栈、寄存器。
标记清除算法作为Python的辅助垃圾收集技术主要处理的是一些容器对象,比如list、dict、tuple,instance等,
因为对于字符串、数值对象是不可能造成循环引用问题。
缺点: 清除非活动的对象前它必须顺序扫描整个堆内存,哪怕只剩下小部分活动对象也要扫描所有对象。
- 分代回收
分代回收是一种以空间换时间的操作方式,Python将内存根据对象的存活时间划分为不同的集合,每个集合称为一个代。
Python将内存分为了3“代”,分别为年轻代(第0代)、中年代(第1代)、老年代(第2代),
他们对应的是3个链表,它们的垃圾收集频率与对象的存活时间的增大而减小。
新创建的对象都会分配在年轻代,年轻代链表的总数达到上限时,Python垃圾收集机制就会被触发,
把那些可以被回收的对象回收掉,而那些不会回收的对象就会被移到中年代去,
依此类推,老年代中的对象是存活时间最久的对象,甚至是存活于整个系统的生命周期内。
同时,分代回收是建立在标记清除技术基础之上。
分代回收同样作为Python的辅助垃圾收集技术处理那些容器对象
Python回收模块
回收循环引用
import gc
sys.getrefcount(a)
unreachable_count = gc.collect()
gc.collect()方法专门用来处理这些循环引用,返回处理这些循环引用一共释放掉的对象个数。
设置debug泄露模式
gc.set_debug(gc.DEBUG_LEAK),会把所有已经回收掉的unreachable的对象也都加入到garbage里面。
set_debug还有很多参数诸如gc.DEBUG_STAT|DEBUG_COLLECTABLE|DEBUG_UNCOLLECTABLE|DEBUG_SAVEALL等等,
设置了相关参数后gc模块会自动检测垃圾回收状况并给出实时地信息反映。
设置分代回收参数
gc.get_threshold()
gc.set_threshold(threashold0,threshold1,threshold2)
这个方法涉及到之前说过的分代回收的策略。
python中默认把所有对象分成三代。第0代包含了最新的对象,第2代则是最早的一些对象。在一次垃圾回收中,所有未被回收的对象会被移到高一代的地方。
这个方法返回的是(700,10,10),这也是gc的默认值。
这个值的意思是说,在第0代对象数量达到700个之前,不把未被回收的对象放入第一代;
而在第一代对象数量达到10个之前也不把未被回收的对象移到第二代。
可以是使用gc.set_threshold(threashold0,threshold1,threshold2)来手动设置这组阈值。
相关书籍
《垃圾回收的算法与实现》
《Python源码剖析》