日常机器学习(十九)Matplotlib细节设置 获取链接 Facebook X Pinterest 电子邮件 其他应用 十一月 07, 2019 若想除去图形的四周边框,可以用下面的函数 去除单位锯齿,以可用下图参数 颜色可以使用自定义颜色 使用linewidth=number可以定义线条宽度,ax.text(x,y,"text")可以在(x,y)位置插入文本 获取链接 Facebook X Pinterest 电子邮件 其他应用 评论
日常机器学习(二十三)线性预测回归实例——缺失值处理 十一月 18, 2019 使用missingno中的包,可以画出缺失值的位置: 白色的位置表示缺失值位置。(详情可以参见https://github.com/ResidentMario/missingno) pd.isnull()可以显示数据中缺失的那一部分,代入到原数据中,就可以显示出缺失的那一部分的数据值。 对于缺失的数据如何填补,我们可以先画该数据的累积分布函数(ECDF函数可以画累积分布函数,详情package参照第二十二篇)或柱状分布函数来看看该数据的具体分布。 groupby()函数可以根据括号中的选项来对原数据进行分类 transform函数可以替换原数据中的缺失值。 可以看到在'Sepal.Width'中原来的缺失值使用'setosa'这一类的平均值来替换掉。 阅读全文
日常机器学习(二十二)线性预测回归实例——package及数据介绍 十一月 15, 2019 本篇讲一个关于线性回归的实际案例: 首先介绍几个常用的包 seaborn包是做数据的可视化的。missingno是做缺失值数据的可视化。 %matplotlib inline这个属于python里的魔法函数,可以省略plt.show()从而直接画图 在线性回归的统计中,主要用到的包是stats和skl包。seed是随机种子。 使用pd.read_csv()可以读取csv文件,na_values="?"表示把问号的数值替换为缺失值。 data.shape表示可以获取数据的维度 data.describe()可以显示出数据的各个统计量的值,第一行count为有效数据的个数。 阅读全文
日常机器学习(二十四)线性预测回归实例——特征相关性 十一月 22, 2019 首先corr()函数可以帮助我们找到数据的协相关系数矩阵 可以看出这是一个对称矩阵。为了找出相关系数较大的两组数据,我们可以只取矩阵的上三角部分 由上图可以看出,只需在原先的矩阵上乘上一个上三角全为1的矩阵即可。然后用stack()命令可以将矩阵转换成两两匹配的列 然后用sort命令对数据进行绝对值的从大到小排列,并重新定义index 可以看到重新定义index后数据的列名(columns)是level_0和level_1,我们可以用data.columns重新定义列名 可以从数据中看出Petal.Length和Petal.Width相关性很高,可以用乘积来替代。No.那一列与别的相关性很高,但是这是编号,可以drop掉 sns中有一个heatmap可以画相关性的图 下图看出,颜色越深的表示相关性越高 sns也有可以画两两匹配的散点图pairplot hue表示可以用原数据中的一些分类变量来画不同类别的点,对角线上图表示数据分布 sns中lmplot函数可以画针对性的两两分布图,并给出线性回归的曲线。阴影部分表示置信区间 阅读全文
评论
发表评论