2017.06.06回顾 三种构造dataframe的方法 多重共线性开坑

本文主要是介绍2017.06.06回顾 三种构造dataframe的方法 多重共线性开坑,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

1、和星期一上午一样的问题,就是精神不好,打瞌睡,我后面的主要工作就是把注册信息变量提取整理做到建模表中,上午还日常看了下股票,亏得他妈一塌糊涂

2、下午一来就是继续v7的开发,关于上一个工作日的两个list合成dataframe的方法,我觉得是存在问题,感觉到太繁琐了,我于是查了下资料,我震惊了,原来那么简单,我并且根据这个总结了三种不同的构造dataframe的方法

#三种构造dataframe的方法
import pandas as pdds1 = [{'a':1,'b':2},{'a':3,'b':4},{'a':5,'b':6}]
df1 = pd.DataFrame(ds1)
print 'method 1:'
print df1ds2 = [[1,2],[3,4],[5,6]]
df2 = pd.DataFrame(ds2,columns=['a','b'])
print 'method 2:'
print df2a = [1,3,5]
b = [2,4,6]
df3 = pd.DataFrame({'a':a,'b':b})
print 'method 3:'
print df3

3、把模型序列化到硬盘这种说法没有,这个存储过程就叫做序列化,自信

4、然后根据两个list的组合方法,重新组合了dataframe,然后进行了排序,IV大小,一目了然,但是这种方法我发现一个小问题,就是组成的dataframe的变量顺序可能不是dict里面的书写顺序

5、我嫌WOE的值的输出,肉眼非常不好看,我尝试进行格式化输出,格式化输出第一个遇到的问题就是类型存储问题,需要用numpy的格式转换方法进行转换,x_copy.astype(np.str_),我看到网上的示例,变量类型也是写的numpy的类型,这个转换需要重新赋值,然后就可以赋值字符串了,开始的字符串格式化方式,不方便按key进行排序,最后我想了个办法,在格式化字符串前面加标号,这样就方便对key值进行排序

6、外部首先把column_name和woe存储到一个dict中

woe_list = list(res_woe)
woe_dict = dict(zip(name_list, woe_list))
zip两个list,然后用dict进行类型转换

7、为了方便观看对dict按key进行排序,方法是

sorted(woe_dict['ANTI_FRD_SCORE'].items(),key = lambda item:item[0])
这里woe_dict['ANTI_FRD_SCORE']也是一个dict,最后输出的时候循环输出,可视化效果更佳

8、我开始研究新的变量,但是发现有个产品已经停用很久了

9、我灵机一动,想到查看一下同盾欺诈分和多头次数的关系,真的是不查不知道,一查吓一跳,0.93的相关系数 ,高度相关,然后要下班的时候就和Simon讨论这个强相关的问题,其实这里就有一个坑,我对多重共线性对于logistic regression的影响理解其实并不充分,主要没从数学推倒的角度去理解过,也没从实验的角度去理解过,然后晚上的时间我主要都是尝试去了解多重共线性对于logistic regression的影响,那看了这么多,我自己来复述一下,多重共线性对于逻辑回归有哪些影响?

  • 使得系数不稳定,增减样本,或者增减变量,都会使得系数发生很大的变化,甚至负号反向
  • 解释性上受到影响,这个主要场景就是医学上那种,比如吸烟人群是不吸烟人群患肺癌概率的两倍
  • 参数估计不准确,如果参数不准,那最后输出的结果就不准确,其实这点我自己都没能理解,按照最小化损失函数,算出参数,是什么就是什么,为什么会不准呢?
感觉网上的人也有点嘴炮,没的数学证明,没得实验过程说明,就一条一条摆出来,向是文科考试一样,这个问题,我后面还要深入研究,我一定要把多头次数的信息干掉,没用的信息!
10、晚上就放开可以W,但是运动和12点前睡觉一定要坚持,还要轻轨上的碎片时间,一定用来解决一些生活中的问题!





这篇关于2017.06.06回顾 三种构造dataframe的方法 多重共线性开坑的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/689789

相关文章

JavaScript中的reduce方法执行过程、使用场景及进阶用法

《JavaScript中的reduce方法执行过程、使用场景及进阶用法》:本文主要介绍JavaScript中的reduce方法执行过程、使用场景及进阶用法的相关资料,reduce是JavaScri... 目录1. 什么是reduce2. reduce语法2.1 语法2.2 参数说明3. reduce执行过程

C#中读取XML文件的四种常用方法

《C#中读取XML文件的四种常用方法》Xml是Internet环境中跨平台的,依赖于内容的技术,是当前处理结构化文档信息的有力工具,下面我们就来看看C#中读取XML文件的方法都有哪些吧... 目录XML简介格式C#读取XML文件方法使用XmlDocument使用XmlTextReader/XmlTextWr

C++初始化数组的几种常见方法(简单易懂)

《C++初始化数组的几种常见方法(简单易懂)》本文介绍了C++中数组的初始化方法,包括一维数组和二维数组的初始化,以及用new动态初始化数组,在C++11及以上版本中,还提供了使用std::array... 目录1、初始化一维数组1.1、使用列表初始化(推荐方式)1.2、初始化部分列表1.3、使用std::

oracle DBMS_SQL.PARSE的使用方法和示例

《oracleDBMS_SQL.PARSE的使用方法和示例》DBMS_SQL是Oracle数据库中的一个强大包,用于动态构建和执行SQL语句,DBMS_SQL.PARSE过程解析SQL语句或PL/S... 目录语法示例注意事项DBMS_SQL 是 oracle 数据库中的一个强大包,它允许动态地构建和执行

Ubuntu固定虚拟机ip地址的方法教程

《Ubuntu固定虚拟机ip地址的方法教程》本文详细介绍了如何在Ubuntu虚拟机中固定IP地址,包括检查和编辑`/etc/apt/sources.list`文件、更新网络配置文件以及使用Networ... 1、由于虚拟机网络是桥接,所以ip地址会不停地变化,接下来我们就讲述ip如何固定 2、如果apt安

Go路由注册方法详解

《Go路由注册方法详解》Go语言中,http.NewServeMux()和http.HandleFunc()是两种不同的路由注册方式,前者创建独立的ServeMux实例,适合模块化和分层路由,灵活性高... 目录Go路由注册方法1. 路由注册的方式2. 路由器的独立性3. 灵活性4. 启动服务器的方式5.

在不同系统间迁移Python程序的方法与教程

《在不同系统间迁移Python程序的方法与教程》本文介绍了几种将Windows上编写的Python程序迁移到Linux服务器上的方法,包括使用虚拟环境和依赖冻结、容器化技术(如Docker)、使用An... 目录使用虚拟环境和依赖冻结1. 创建虚拟环境2. 冻结依赖使用容器化技术(如 docker)1. 创

Go语言中三种容器类型的数据结构详解

《Go语言中三种容器类型的数据结构详解》在Go语言中,有三种主要的容器类型用于存储和操作集合数据:本文主要介绍三者的使用与区别,感兴趣的小伙伴可以跟随小编一起学习一下... 目录基本概念1. 数组(Array)2. 切片(Slice)3. 映射(Map)对比总结注意事项基本概念在 Go 语言中,有三种主要

Spring排序机制之接口与注解的使用方法

《Spring排序机制之接口与注解的使用方法》本文介绍了Spring中多种排序机制,包括Ordered接口、PriorityOrdered接口、@Order注解和@Priority注解,提供了详细示例... 目录一、Spring 排序的需求场景二、Spring 中的排序机制1、Ordered 接口2、Pri

Idea实现接口的方法上无法添加@Override注解的解决方案

《Idea实现接口的方法上无法添加@Override注解的解决方案》文章介绍了在IDEA中实现接口方法时无法添加@Override注解的问题及其解决方法,主要步骤包括更改项目结构中的Languagel... 目录Idea实现接China编程口的方法上无法添加@javascriptOverride注解错误原因解决方