python的等深分箱实例
作者:Damon_guang 发布时间:2022-11-30 01:01:20
标签:python,等深分箱
背景
当前很多文章尝试过最优分箱,python上也有cut等方法进行等宽分箱。为了方便日后输出结果以及分箱要求。做一个简单的轮子以供大家日后使用。很多能用其他轮子的地方也没有多余出力,也不托大会比别人写的好。空间复杂度尽我所能。
方法展示
话不多说上代码。
以下为等深分箱以及encoding方法
# -*- coding: utf-8 -*-
"""
Created on Tue Jan 29 17:26:38 2019
@author: DamomWCG
"""
class Equal_depth_box:
def equal_box(list, bin_num):
'''
param:
list:you need bin box list
bin_num: you want bin num
'''
bin_num = 10
list.sort() #need sort can replace by others
list_2 = list.copy()
all_num = len(list_2)
bin_sep = all_num/bin_num
bin_sep = int(bin_sep)
bin_list = []
for i in range(1,bin_num):
bin_dict = {}
bin_dict = i*bin_sep
bin_list.append(bin_dict)
bin_real_list = []
for i in bin_list:
#print(i)
bin_real_dict = {}
bin_real_dict = list[i]
bin_real_list.append(bin_real_dict)
return bin_real_list
def replace_box(list_1,replace_list):
'''
param:
list_1:you need bin list
replace_list: from equal box, replace the original list
'''
import pandas as pd
list_max = max(list_1)
list_min = min(list_1)
replace_list.insert(0,list_min -1) #insert start
replace_list.append(list_max + 1) #insert end
list_2 = pd.cut(list_1, bins = replace_list,
labels = range(len(replace_list) - 1)).tolist()
return list_2
if __name__ == '__main__':
import random
list_1 = random.sample(range(1000), 134)
print(list_1.sort())
print('real_list: {}'.format(list_1[0:50]))
replace_list = bin_class.equal_box(list_1, 10)
list_2 = bin_class.replace_box(list_1, replace_list)
print('encode_list: {}'.format(list_2[0:50]))
原始git地址
https://github.com/DamonWCG/Equal_depth_box/blob/master/Equal_depth_box
使用案例
本案例数据为,我进行过一步的最优分箱,来做一步等深分箱来进行横向对比。
原始数据形式
具体案例
# -*- coding: utf-8 -*-
"""
Created on Wed Jan 30 16:17:19 2019
@author: DamonWCG
"""
from Equal_depth_box import *
import pandas as pd
df = pd.read_csv('test.csv', encoding = 'gbk')
df.columns
####需要分箱的列
list_1 = df['deal_city_encoding'].tolist() #本方法是针对于list,所以对于series需要进行变换
####需要分箱的个数
replace_list = Equal_depth_box.equal_box(list_1, 5)
####替代的名称
##因为列表排序所以需要重新排序对齐,这里我有空再想想其他办法
df.sort_values(by="deal_city_encoding", inplace = True)
list_2 = Equal_depth_box.replace_box(list_1, replace_list)
df['deal_city_bin_encoding'] = list_2
df.to_csv('df.csv', encoding = 'gbk', index = False)
本方法现阶段encoding形式为数字型。
分箱最终结果形式
需要注意,我得列表形式重新decode时候需要按照当前排序数组重新编码,这个问题我年后会解决。
来源:https://blog.csdn.net/weixin_40192436/article/details/86706231
0
投稿
猜你喜欢
- 我们现在回到函数上。记得我们用 SUM 这个指令来算出所有的 Sales (营业额)吧!如果我们的需求变成是要算出每一间店 (store_n
- Rosenbrock函数的定义如下:其函数图像如下:我分别使用梯度下降法和牛顿法做了寻找Rosenbrock函数的实验。梯度下降梯度下降的更
- 遇到一个难题,在无物理键盘情况下,通过页面软键盘在页面文本框输入汉字,不知道51js的各位大牛有没有遇到过这种需求,如果遇到过是如何解决的,
- 级联样式表在13年前被引入,而且被广泛使用的CSS 2.1 标准在11年前被创建,显然我们现在已经与当年相差千里了。相当了不起的是期间网站开
- 昨天打包下载了一个服务器整站,拿到这个*.mdb的文件后,却不知道怎么用,百度了一下,才知道是一种木马打包的形式文件,不能用WINrar来解
- 最近项目中需要Python的打包,看到网上也没有很详细的资料,于是做了一些示例程序。研究了一下,Python如何在Windows和Linux
- 如何获取一个页面内所有URL链接?在Python中可以使用urllib对网页进行爬取,然后利用Beautiful Soup对爬取的页面进行解
- 在图像处理以及图像特效中,经常会用到一种成高斯分布的蒙版,蒙版可以用来做图像融合,将不同内容的两张图像结合蒙版,可以营造不同的艺术效果。这里
- '*****************************************************************
- 本人在做项目的时候遇到一个问题:某个函数需要在每个小时的 3 分钟时候被执行一次,我希望我 15:45 启动程序,过了18 分钟在 16:0
- 一、打开/关闭文件1、对文件操作时首先要打开文件,打开文件用 fopen()函数,语法是:fopen(filename,mode,inclu
- php高并发之opcache今天工作的时候接触到客户的一台服务器,业务逻辑比较简单 。估算pv在120w左右吧,用的是阿里云2c4g的服务器
- 在官方网站中对as_index有以下介绍:as_index : boolean, default TrueFor aggregated ou
- 有的时候我们在使用pycharm编辑python,需要导入各种各样的包,这些包是不能直接使用的,需要先进行安装。否则就会出现模块导入错误。下
- 自己的小Python项目好几天没有写了,今天打开PyCharm准备继续写,突然发现之前的激活码被取消不能用了,本来激情满满的准备干活啦!之前
- python装饰器就是用于扩展原函数功能的一种函数,这个函数特殊的地方就是它的返回值也是一个函数,使用Python装饰器的一个好处就是:在不
- 对于从事数据领域的小伙伴来说,当需要阐述自己观点、展示项目成果时,我们需要在最短时间内让别人知道你的想法。我相信单调乏味的语言很难让别人快速
- 众所周知,OpenStack的通信方式有两种,一种是基于HTTP协议的RESTFul API方式,另一种则是RPC调用。两种通信方式的应用场
- 官方文档中关于super的定义说的不是很多,大致意思是返回一个代理对象让你能够调用一些继承过来的方法,查找的机制遵循mro规则,最常用的情况
- read()方法读取文件size个字节大小。如果读取命中获得EOF大小字节之前,那么它只能读取可用的字节。语法以下是read()