虽然这个问题我是在 Python 里遇到的,但是用 Ruby 解释起来比较容易一些。在 Ruby 里,遍历一个数组可以有很多种方法,最常用的两种无非是 for
和 each
:
arr = ['a', 'b', 'c'] arr.each { |e| puts e } for e in arr puts e end |
通常我比较喜欢后者,似乎因为写起来比较好看,不过从效率上来说前者应该会稍微快一点,因为后者实际上是在遍历的过程中对每个元素都调用一个 lambda 函数来做的,虽然一般情况下并不明显,不过设置上下文并调用函数确实是有开销的,特别是在动态语言里面(不考虑 JIT 内联优化的话)。不过这次的问题并不是性能。然而确实跟“ each
对每个元素都会新建一个 scope 而 for
则不是”有关。
看下面一段代码:
arr = ['a', 'b', 'c'] h1 = Hash.new h2 = Hash.new arr.each { |e| h1[e] = lambda { e+'!'} } for e in arr h2[e] = lambda { e+'!' } end h1['a'].call # => ? h2['a'].call # => ? |
两个 call
分别会得到什么?应该已经猜到了吧?分别是 'a!'
和 'c!'
,后者之所以是 'c!'
是因为 for
并没有在循环的每一步都重新创建一个 scope ,因此三个 lambda
的 closure 引用到了同一个变量,而这个变量在最后一次被赋值为 'c'
,所以导致了这样的后果。
问题其实出自我在用 Python 写的一个小程序中的一段,代码类似于这样:
for prop in public_props: setattr(proxy, 'get_%s'%prop, lambda: self.get_prop(prop)) |
其中 proxy 是我提供的一个代理对象,将 self
的一些公开的属性给暴露出去,因为要限制对非 public 的属性的访问,我并不想在这个 proxy 中存放任何到 self
的引用,否则在没有访问权限限制的 Python 里通过类似 proxy._orig_self.some_private_prop
的方式来访问是轻而易举的。所以最后选择了上面那样的做法。
不幸的是,由于像刚才所说的那样,for
并没有每次都单独创建 scope ,因此 closure 全部引用到了同一个变量上,导致所有的属性值取出来都是最后一个属性了。看到这样诡异的 bug ,如果是在 C/C++ 里面,我肯定要怀疑是内存或者指针的问题了。不过想了半天才终于恍然大悟!不过 Python 里面没有 Ruby 那么方便的 each
可以用,lambda
用起来也很鸡肋,所以最后通过定义一个局部的函数来解决了:
def proxy_prop(name): setattr(proxy, 'get_%s'%prop, lambda: self.get_prop(name) for prop in public_props: proxy_prop(prop) |
最后,还要多嘴一句,对于之前 Ruby 那个例子,如果把 each
和 for
的执行顺序颠倒过来,会得到不同的结果:
arr = ['a', 'b', 'c'] h1 = Hash.new h2 = Hash.new for e in arr h2[e] = lambda { e+'!' } end arr.each { |e| h1[e] = lambda { e+'!'} } h1['a'].call # => 'c!' h2['a'].call # => 'c!' |
现在两个都是 'c!'
了!这是因为 Ruby 1.8 的实现里面 block 的参数可以对局部变量或者全局变量之类的任何东西进行赋值,而不是通常意义上的一个 lambda
函数的参数那么简单。由于前面的 for
语句在当前作用域创建了一个 e
作为局部变量,因此 each
就直接对这个局部变量进行赋值了,这样,每次引用到的又变成了同一个东西,导致了一个隐秘的 Bug !
值得庆幸的是,block 的这个“特性”在 Ruby 1.9 中已经被去除了,block 的参数只能是正常参数,所以就不再存在这样的问题了。希望 1.9 尽快普及吧!
我很喜欢你关于ruby文章方面的内容,有可能可以一起讨论下,我喜欢ruby是因为语言方便。
实际上很多情况下我都会用each来写东西(在ruby中),为什么呢?因为别的语言只有for这样的东西,既然有了each说明这个方法有值得使用的地方,但是我没有发现其中这种关于赋值的问题。好比说当初print和puts的区别,一些不知道的人也许两个会混用,但是实际使用之后会发现两种输出的方法是不一样的。这又好比在ruby中输出的时候我们输入print “”的内容和print ”的内容就是不一样的。这也是为什么某些情况下ruby在一些字符输出的时候要加上/来区别对待一样
不知道可不可以允许我在百度ruby语言吧里转载你这篇文章呢?可以的话希望QQ联系我,我的QQ67662088或者给我发邮件
@司马睿风
你想要转载的话,尽管转载好了,我 blog 里的内容除非特别说明,都是符合 by-nc-sa 的 Creative Commons 协议的。 🙂
我觉得你把问题想复杂了。如果你注意到ruby中的block相当于匿名函数,这个问题就很好理解了。each后的e是匿名函数的参数,每次调用自然是不一样的,而for中的e是局部变量,循环多少次都是指向同一地址。何必劳神呢。
http://www.ibm.com/developerworks/cn/linux/l-cn-closure/index.html
@mouse
呵呵,然而 Ruby 1.8 中 block 的参数可以是直接绑定到外围的局部变量上去的。 🙂
@pluskid
这确实是个问题,应该遵循最近绑定的原则。
谢谢了
我转载到这里了http://tieba.baidu.com/f?kz=556564988
今天看Learning Python第三版的時候看到這個問題(p324-325)。印象中在鮮果裡見過你的blog提到for的這個詭異之處,所以搜索一番找到這篇blog。
Learning Python給出的方案是指定argument默認值,因為指定默認值這一步是在創建函數的時候演算的。比如,針對你提到的python代碼:
for prop in public_props:
setattr(proxy, ‘get_%s’%prop, lambda prop=prop: self.get_prop(prop))
@weakish
唔,这样倒也确实是个不错的办法。 🙂
This is a great article. I’m new to blogging but still learning. Thanks for the great resource.