SerDe是Serialize/Deserilize的简称,目的是用于序列化和反序列化。 序列化作用 序列化是对象转换为字节序列的过程。序列化是...
机器学习监督算法的基本思路是 让拟合的模型尽量接近真实数据, 换句更通俗的话, 要让我们的模型尽量简单又能很好的反应已知数据之间关系。在这个贴近...
如上篇文章, 岭回归、Lasso回归和ElasticNet 回归都是以普通的线性回归为基础,先列举下线性回归的模型公式: 岭回归为解决共线性问题...
上一篇文章中,线性回归关键问题之一:求解系数的方法梯度下降。梯度下降在数据挖掘很多算法中都有应用, 属于比较基本的数学基础方法, 本文对此算法进...
常见回归算法基础概念,参见下如下文章,个人感觉是介绍比较好的文章: 7 Types of Regression Techniques you s...
Yarn介绍 MapReduce 早期的 JobTracker/TaskTracker 机制在可扩展性,内存消耗,线程模型,可靠性和性能存在较大...
缺失值处理方式 删除 均值缺点:当缺失数据不是随机数据时会产生偏差.对于正常分布的数据可以使用均值代替, 中位值数据是倾斜的,使用中位数比均值可...
一、交叉熵的由来 信息量香农提出的“信息熵”, 是用来解决信息量化问题。信息的不确定性越强, 需要用来表达的数据量也就越多。事件的不确定性通常是...
SVM是数据挖掘算法中比较复杂难懂的,反复观看斯坦福机器学习的视频, 以及网上零散学习各种数学和SVM相关资料, 对SVM还只能算有个粗浅的理解...