我来教你Python字典组成的数组去重 |

2025年3月28日 00:46:02Crq

Crq

管理员

关注

2013
文章

0
粉丝

Linux教程评论22字数 773阅读2分34秒阅读模式

摘要因为使用set去重的前提是该对象为不可变对象，而字典是可变对象，因此无法直接使用该方法去重。那么怎么解决这个问题呢？

你知道吗？如果数组是字典组成的，直接对数组内的字典采用set的方式进行去重，会报错：

test = [{"a": 1}, {"a": 1}, {"a": 3}, {"b": 4}]
test = list(set(test))
>>> TypeError: unhashable type: 'dict'

因为使用set去重的前提是该对象为不可变对象，而字典是可变对象，因此无法直接使用该方法去重。

那么怎么解决这个问题呢？有三个办法。

1.使用reduce方法

reduce() 函数会对参数序列中元素进行累积。

比如：

from functools import reduce
def add(x, y) :            # 两数相加
    return x + y
print(reduce(add, [1,2,3,4,5])) # 计算列表和：1+2+3+4+5
# 15

上述写法也能用lambda函数简化为：

from functools import reduce
print(reduce(lambda x, y: x+y, [1,2,3,4,5])) # 使用 lambda 匿名函数
# 15

因此，我们自己编写一个函数进行数组内的字典去重：

from functools import reduce
data = [{"a": 1}, {"a": 1}, {"a": 3}, {"b": 4}]
result = []
def unduplicate(result, data):
    if data not in result:
        result = result + [data]
    return result
for i in data:
    result = unduplicate(result, i)
print(result)
# [{'a': 1}, {'a': 3}, {'b': 4}]

稍显复杂，如果使用reduce函数和lambda函数，代码能简化很多：

def delete_duplicate(data):
    func = lambda x, y: x + [y] if y not in x else x
    data = reduce(func, [[], ] + data)
    return data
print(delete_duplicate(data))
# [{'a': 1}, {'a': 3}, {'b': 4}]

当然，我也能一行写完这个功能：

data = reduce(lambda x, y: x + [y] if y not in x else x, [[], ] + data)

只不过有可能会被打死在工位上，所以不建议这么干。

2.奇怪的技巧

就如文章开头提到的，字典之所以不能用set去重，是因为它是可变对象。

但是...如果我们把它变成不可变对象呢？

data = [{"a": 1}, {"a": 1}, {"a": 3}, {"b": 4}]
def delete_duplicate(data):
    immutable_dict = set([str(item) for item in data])
    data = [eval(i) for i in immutable_dict]
    return data
print(delete_duplicate(data))
# [{'a': 1}, {'a': 3}, {'b': 4}]

没错，这能成。

遍历字典，将每个子项变成字符串存放到数组中，再通过set函数去重。
通过eval函数，将去重后的数组里的每个子项重新转化回字典。
如此Python，怎能不好玩？

高效的方式
上面讲了两种骚操作，其实都不太建议在实际工作中使用。

一个原因是真的太骚了，怕被打趴在工位上。

另一个原因是，它们在应对较大数据量的时候，性能不太行。

下面是最正统的方式：

data = [dict(t) for t in set([tuple(d.items()) for d in data])]
# data:
# [{'a': 1}, {'b': 2}]

其实和第二种方式一样，是将数组内的每个字典转成元组，也就是不可变对象，再使用set进行去重。去重完毕后再使用dict函数将元组重新组成字典对。

但是，这种方法对于字典内还有字典的数据结构是不适用的，因此对于字典对里还有字典情况的去重，比如：

data2 = [{"a": {"b": "c"}}, {"a": {"b": "c"}}]

这种情况我建议使用第二种方式去重：

data2 = [{"a": {"b": "c"}}, {"a": {"b": "c"}}]
def delete_duplicate_str(data):
    immutable_dict = set([str(item) for item in data])
    data = [eval(i) for i in immutable_dict]
    return data
print(delete_duplicate_str(data2))
# [{'a': {'b': 'c'}}]

怎么样，这三种方式你都学会了吗？

我的微信

微信号已复制

我的微信

这是我的微信扫一扫

我来教你Python字典组成的数组去重

ASP.NET MVC使用jQuery的Load方法加载静态页面详解

ASP.NET MVC实现登录后跳转到原界面详解

Linux 命令行删除指定扩展名文件

HTML5 Audio(音频)简介

使用 Python 创建你自己的 Shell（下）

Android自定义定时闹钟开发详解

怎样在 Ubuntu 中修改默认程序

简单介绍Android自定义View实现时钟功能

如何在 Ubuntu Linux 16.04上安装开源的 Discourse 论坛

十招让Ubuntu 16.04用起来更得心应手