浅谈机器学习业务方面使用 R + Hadoop 是否可靠

众所周知，R 在解决统计学问题方面无与伦比。但是 R 在数据量达到 2G 以上速度就很慢了，于是就催生出了与 hadoop 相结合跑分布式算法这种解决方案，但是，python+Hadoop 这样的解决方案有没有团队在使用？R 这样起源于统计学的计算机包与 Hadoop 相结合会不会出问题？因为他们在不懂R和Hadoop的特征应用场景的情况下，恰好抓到了一根免费，开源的稻草。

R：

R的应用场景不在于无与伦比的统计学习能力，而在于结构化数据下无与伦比的单位代码产出量。神经网络，决策树等基于结构化数据的算法一行代码搞定，预测又只是一行代码。这样，商业数据库（如包括Oracle，Netezza，Teradata，SAP HANA等）提供了R接口供统计分析人员进行高效实施。同样的，SAS和IBM SPSS也做到了一部分高效实施能力，他们没有的是R独有的庞大cran packages群。但相似的一点是，R的package群也把它的用户惯坏了，惯坏到这些人只是觉得这是一个SAS或者SPSS的免费版，而不是去通过代码学习如何做机器学习哪怕一点点核心原理。你要做的，就是高效的最新结构化数据算法的实施。

最重要的是，从Hadoop上的数据加载到这些库，不仅保证了数据本身的正确性和结构化，也已经保证了数据模型的第二、第三范式化（CAErwin 的第一课），想做任何一个分析，你手边的数据库简单的join就形成了你需要的分析宽表。想想SQL里sum over的设计含义：为什么它要制造数据的冗余？那一定是为了BI或者分析存在的。

Hadoop：

Hadoop的应用场景不在于给统计分析软件提供强力的支持，而只是提供了一个分布式数据的泛用免费框架，基于键值对（key value pair）高效的对原始非结构化数据进行存储。

结构化和非结构化数据库结合的R+Hadoop看起来很美，实则困难重重。我的看法是，任何一家在数据分析领域（Text Mining暂时除外，见后）决定以一个稳健的态度涉足的企业，都无一例外的基于数据强一致性的考虑，选择传统的结构化数据库作为后续结构化分析的依托 —— 哪怕他们是收费的。如果习惯代码开发，Hadoop+python自己做初步的数据处理，而后使用基于java的Mahout是一个很自然的选择。

R+Hadoop的幻觉：

不管什么和Hadoop结合，都喜欢以word count这种典型的键值对开始。事实上R可以做这件事，但是觉得R做的无与伦比，就有点进入误区。还是那句R的美在于结构化数据下无与伦比的单位代码产出量。一旦你发现你作为专注于数据的分析师，同时也是一个并不骨灰的代码开发者，开始用R操作列表和数据结构，开始用R重写Mapper和Reducer，你就会产生一个疑问：

为嘛不学Java、Python？这种分析“不传统”，就算你不想学吧，为嘛不找懂它们的人来干？

Python基于键值对存储，也具有相当高的单位代码产出量，也有很多科学计算包。从这个意义上你可以做出一个白箱，单机缩水版的mahout，而且适合处理有增量算法的大数据学习（看看NumPy,SciPy,）。一样免费。

数据挖掘的幻觉：

数据挖掘是什么，很难吗？

广义的数据挖掘，包括数据分析和机器学习，只说最核心的数学概念的话，估计就几句话；恰好R的简洁性也是能用几句话做完这几句话的：

0 数据清洗，标准化。和1-4，理解真实世界是相辅相成的

1 最先学的数学技巧是空间分解：LL’，PCA，SVD，回归以及L2/L0惩罚变种

2 再学最优化算法：L1惩罚回归，SVM

3 数据结构：决策树（列表类），词频统计（键值对或者字典类），FP-growth（一个树的加强版）。学到这，所谓“贝叶斯”根本就不能叫算法，只能叫一个指导思想。

4 模型集成：Adaboost，神经网络，bootstrap。对方法，对模型参数都能集成（大杂烩！）

任何一个听起来很装逼的算法，逃不过被解析成这4类方法组合的命运。

可以看到，大数据分析的瓶颈在哪？

第0步，和曾经的大Boss讨论过，传统行业数据仓库实施起码还能打10年，而”实体-关系”概念和”键-值”概念这两种抽象起码还能打30年，数据的组织，过滤，元数据维护都是数据产生价值的必经之路，这方面的工作很枯燥但是很基础，大数据和传统数据都需要；

第1步是最基本最重要的分析手段，也最容易在大数据语境下导致单机无法分析的亿阶稀疏大矩阵产生：例1，用户User对商品SKU的购买记录，；例 2，在特定的经纬度，特定的时间，特定的用户发生了动作；这两个例子是典型的“汇总还不如不汇总”的情况，必须要有分布式稀疏矩阵处理技术；

第2步，序贯MCMC的串行性可以通过并行集成方法模拟，但是收敛性还仍然较低，需要暴力并行堆FLOPS；对应的，因为SVM/Lasso都有增量算法、分布式算法方案，核心思想在于“世界的真实，模型的本质，都是稀疏的”，锁少量资源，分布式地更新模型系数或者是梯度，这些算法在理论上得到突破后，往往依赖分析型数据库或者大数据平台灵活的并发调度，灵活的行列混合存储模式，这一点是单机、小集群、传统数据库难以企及的；

第3、4步，这里虽然举了很简单的例子，但这些是在数学模型和数据模型上是最没有开发压力的，需要关心的只是资深程序员的功底了。举例说明，文本挖掘（NLP）统计完词频你还是得会空间里做PCA（或者其他形式的大矩阵加工）；如果不然，只引入HMM模型和基础字典树的话，学习成本就只有学习贝叶斯理论了，并且仍然可以高效并行的解决NLP问题，有兴趣的可以参考Viterbi算法和CRF算法。

人面猴
序言：七十年代末，一起剥皮案震惊了整个滨河市，随后出现的几起案子，更是在滨河造成了极大的恐慌，老刑警刘岩，带你破解...
沈念sama阅读 159,716评论 4赞 364
死咒
序言：滨河连续发生了三起死亡事件，死亡现场离奇诡异，居然都是意外死亡，警方通过查阅死者的电脑和手机，发现死者居然都...
沈念sama阅读 67,558评论 1赞 294
救了他两次的神仙让他今天三更去死
文/潘晓璐我一进店门，熙熙楼的掌柜王于贵愁眉苦脸地迎上来，“玉大人，你说我怎么就摊上这事。” “怎么了？”我有些...
开封第一讲书人阅读 109,431评论 0赞 244
道士缉凶录：失踪的卖姜人
文/不坏的土叔我叫张陵，是天一观的道长。经常有香客问我，道长，这世上最难降的妖魔是什么？我笑而不...
开封第一讲书人阅读 44,127评论 0赞 209
港岛之恋（遗憾婚礼）
正文为了忘掉前任，我火速办了婚礼，结果婚礼上，老公的妹妹穿的比我还像新娘。我一直安慰自己，他们只是感情好，可当我...
茶点故事阅读 52,511评论 3赞 287
恶毒庶女顶嫁案：这布局不是一般人想出来的
文/花漫我一把揭开白布。她就那样静静地躺着，像睡着了一般。火红的嫁衣衬着肌肤如雪。梳的纹丝不乱的头发上，一...
开封第一讲书人阅读 40,692评论 1赞 222
城市分裂传说
那天，我揣着相机与录音，去河边找鬼。笑死，一个胖子当着我的面吹牛，可吹牛的内容都是我干的。我是一名探鬼主播，决...
沈念sama阅读 31,915评论 2赞 313
双鸳鸯连环套：你想象不到人心有多黑
文/苍兰香墨我猛地睁开眼，长吁一口气：“原来是场噩梦啊……” “哼！你这毒妇竟也来了？” 一声冷哼从身侧响起，我...
开封第一讲书人阅读 30,664评论 0赞 202
万荣杀人案实录
序言：老挝万荣一对情侣失踪，失踪者是张志新（化名）和其女友刘颖，没想到半个月后，有当地人在树林里发现了一具尸体，经...
沈念sama阅读 34,412评论 1赞 246
护林员之死
正文独居荒郊野岭守林人离奇死亡，尸身上长有42处带血的脓包…… 初始之章·张勋以下内容为张勋视角年9月15日...
茶点故事阅读 30,616评论 2赞 245
白月光启示录
正文我和宋清朗相恋三年，在试婚纱的时候发现自己被绿了。大学时的朋友给我发了我未婚夫和他白月光在一起吃饭的照片。...
茶点故事阅读 32,105评论 1赞 260
活死人
序言：一个原本活蹦乱跳的男人离奇死亡，死状恐怖，灵堂内的尸体忽然破棺而出，到底是诈尸还是另有隐情，我是刑警宁泽，带...
沈念sama阅读 28,424评论 2赞 254
日本核电站爆炸内幕
正文年R本政府宣布，位于F岛的核电站，受9级特大地震影响，放射性物质发生泄漏。R本人自食恶果不足惜，却给世界环境...
茶点故事阅读 33,098评论 3赞 238
男人毒药：我在死后第九天来索命
文/蒙蒙一、第九天我趴在偏房一处隐蔽的房顶上张望。院中可真热闹，春花似锦、人声如沸。这庄子的主人今日做“春日...
开封第一讲书人阅读 26,096评论 0赞 8
一桩弑父案，背后竟有这般阴谋
文/苍兰香墨我抬头看了看天上的太阳。三九已至，却和暖如春，着一层夹袄步出监牢的瞬间，已是汗流浃背。一阵脚步声响...
开封第一讲书人阅读 26,869评论 0赞 197
情欲美人皮
我被黑心中介骗来泰国打工，没想到刚下飞机就差点儿被人妖公主榨干…… 1. 我叫王不留，地道东北人。一个月前我还...
沈念sama阅读 35,748评论 2赞 276
代替公主和亲
正文我出身青楼，却偏偏与公主长得像，于是被迫代替她去往敌国和亲。传闻我的和亲对象是个残疾皇子，可洞房花烛夜当晚...
茶点故事阅读 35,641评论 2赞 271

浅谈机器学习业务方面使用 R + Hadoop 是否可靠

推荐阅读更多精彩内容