python去重函数,Python去重函数

Python 去重，统计，lambda函数

df.drop_duplicates('item_name')

创新互联建站主要从事成都做网站、网站建设、网页设计、企业做网站、公司建网站等业务。立足成都服务石狮,10年网站建设经验,价格优惠、服务专业,欢迎来电咨询建站服务:13518219792

方法一：

df.drop_duplicates('item_name').count()

方法二：

df['item_name'].nunique()

结果：50

附：nunique()和unique()的区别：

unique()是以数组形式（numpy.ndarray）返回列的所有唯一值（特征的所有唯一值）

nunique()即返回的是唯一值的个数

比如：df['item_name'].unique()

要求：将下表中经验列将按周统计的转换为经验不限，保留学历

df1['经验'] = df1['经验'].apply(lambda x: '经验不限'+ x[-2:] if '周' in x else x)

#解释：将‘5天/周6个月’变成‘经验不限’，然后保留学历‘本科’

方法二：定义函数

def dataInterval(ss):

if '周' in ss:

return '经验不限'+ ss[-2:]

return ss

df1['经验'] = df1['经验'].apply(dataInterval)

利用集合的不重复属性，可以先转换至集合，再用list()函数转换回来即可。

比如，a是一个列表，a=list(set(a))，即可完成列表去重。

如：arr =['a','d','e','a']

用： arr= sorted(set(arr), key=arr.index)

同： arr = list(set(arr))

arr.sort(key=arr.index)

⚠️直接set(arr)也可以去除重复元素，只是新数组的顺序就不是原来的顺序了。

如：arr=[{'text':wuyuan,'value':1},{'text':默认,'value':2},{'text':默认,'value':2},

{'text':wyy,'value':4}]

用： f = lambda x,y:x if y in x else x + [y]

arr = reduce(f, [[], ] + arr)

⚠️这里去除的字典里面的键值对必须是完全一样的。

新闻名称：python去重函数,Python去重函数
转载来于：http://myzitong.com/article/dsiipds.html