春秋战国,群雄逐鹿,战争四起,硝烟不止。
用这句话来形容今天大数据圈的激烈竞争再恰当不过了。上篇文章“从2017大数据版图看大数据的技术架构”简单罗列了下Matt Turck机构2017年刚发布的大数据版图,借此简单梳理一下大数据的生态。这篇文章我们就详细看看这些大数据提供商到底是些什么角色,顺便再补充一下国内的大数据重要厂商,算是能够“以偏概全”一下。从这些年大数据生态的发展来看,一幅合纵连横的画面渐渐浮出水面。
那就先从一份IPO招股书说起。
1、引子北京时间4月1日,著名的大数据软件公司Cloudera周五向SEC提交IPO招股书,计划融资2亿美元,股票代码为CLDR,将在纽约证券交易所上市。
一时间,坊间议论纷纷,有的人认为Cloudera将是又一个围绕开源软件打造的大型企业,成为数据界的Red Hat。而Red Hat早已于1999年上市,并成为开源软件成功走向世界的一段佳话。据2016年第四季度及全年财报数据显示,Red Hat保持了56个季度的业绩增长,全年营收突破20亿美元,它的市值已经超过了130亿美元。

Redhat的广告同时,更多的人则认为,Cloudera上市实属无奈之举,连续三年估值毫无增长,私下融资渠道缺乏,故而只能在这个点上市以便在股市上圈钱支撑公司继续运行下去。
从近期的新闻,以及Cloudera将上市的股票价格定在一个较低的价位(12到14美元)来看,其颓势已经不可避免。实际上,这个也是非常符合近两年大数据技术的发展趋势的,现在的技术之争已经全面发展到整个生态和技术栈的竞争了,如果还是简单的抱着那个曾经的Hadoop,无疑会慢慢走向灭亡。
在这个合纵连横的时期,为数众多的创业公司和传统的IT/互联网巨头联合上演了一出精彩的争霸大戏。
大数据究竟是风口还是坟墓?开源生态究竟是不是方向?初创公司如何和已有的巨头公司竞争?中国企业能否在当下的大数据环境中突出重围,有所建树?
带着这些疑问,我们出发了。
2、合纵时代在Hadoop时代,一个经典的“合纵”好戏便是有由Hadoop之父之称的Doug Cutting所导演的,当时的霸王便是Google。
那还是在十年前的时候,Google仰仗着三驾马车(GFS、MapReduce和BigTable)在分布式处理领域纵横驰骋,根本没把其他的一些诸侯放在眼里。然而,没想到的是突然冒出来了一个Doug Cutting。
当时,毕业于美国斯坦福大学的Cutting第一份工作是在Xerox,紧接着加入了Architext公司(其主要产品即为著名的Excite搜索引擎)。在那段时间,Cutting阅读了大量的论文,同时自己也发表了很多论文。尽管Cutting在两家公司积累了不少技术知识,但他却认为,自己当时搞的这些研究只是纸上谈兵,没有人试验过这些理论的可实践性。他决定勇敢地迈出这一步。于是,Lucene诞生了,第一个提供全文文本搜索的开源函数库。之后,Cutting再接再厉,在Lucene的基础上将开源的思想继续深化,于是第二个项目就出来了,这就是Nutch。
接下来,由于没有顶住互联网经济泡沫的冲击,Architext破产了。那时的Cutting正在寻找一种低开销的方式来构建网页中的大量算法。幸运的是,Google这时正好发布了一项研究报告,报告中介绍了两款Google为支持自家的搜索引擎而开发的软件平台。这两个平台一个是GFS(Google File System),用于存储不同设备所产生的海量数据;另一个是MapReduce,它运行在GFS之上,负责分布式大规模数据。基于这两个平台,Cutting开发出最引人瞩目的作品----Hadoop。
出于对时间成本的考虑,在从Architext离职四年后,Cutting决定找一家更靠谱的公司,进一步完善 Hadoop的性能。他先后面试了几家公司,其中也包括IBM,但IBM似乎对他的早期项目Lucene更感兴趣,至于Hadoop则不置可否。就在此时,Cutting接受了当时Yahoo!搜索项目负责人Raymie Stata的邀请,于2006年正式加入Yahoo!。在Yahoo!,有一支一百人的团队帮助他完善Hadoop项目,这期间开发工作进行得卓有成效。不久之后,Yahoo!就宣布,将其旗下的搜索业务的架构迁移到Hadoop上来。当时Cutting的上司叫Eric Baldeschwieler,就是后来Hortonworks的CEO。
有了Hadoop这个大杀器,Yahoo!接下来开始在硅谷大力布道Hadoop,并且IBM、Facebook以及LinkedIn等当时红火的公司都一拥而上,结果Hadoop就这样茁壮地成长起来。紧接着,除了传统行业之外,Yahoo!、Facebook、eBay、LinkedIn等公司都开始大规模的把自家的产品往Hadoop上转。
直到今天,整个大数据界的生态系统都是围绕着Hadoop来展开的,而作为大数据技术的奠基人Google,在这个生态圈中已经几乎没什么影响力了。这么一大块市场,Google当初只要能切入一点,就可以占到极大的好处。难怪坊间流传着一个特别著名的八卦,大致上是说,有人采访了Larry Page,问他有没有什么后悔的事情,Larry Page说,他很后悔让MapReduce和Google File System这样的论文给发了出来。
围绕Hadoop的“合纵”,为数众多的大中小公司合力扳倒了巨无霸Google,同时也产生了几家初创公司,其中一个便是文章开头提到的Cloudera,另外几个著名的公司包括:Hortonworks、MapR和Pivotal,联合组成了大数据版图的第一方阵。

2017大数据版图的一角
通过开源的Hadoop来进行合纵,初战告捷!
另外,某种程度上,我们必须说,很多的创新都在工业界。今天的学术界,在很多领域,比如数据库、操作系统,包括现在的大数据,可以推动整个产业向前发展的能力正在越来越弱。其实,早在2000年的时候,当时Bell实验室的Rob Pike就写了一篇振聋发聩的雄文:Systems Software Research is Irrelevant,痛斥当下学术界所做的研究毫无影响力,固步自封的弊病,再无80、90年代初那种轰轰烈烈的创新了。
因此,Hadoop的出现,不仅搅乱了工业界,也极大刺激了学术界。于是在2008年,数据库领域的大牛,图灵奖得主Michael Stonebraker和他的小伙伴们发表了一篇论文:MapReduce: a major step backwards,文章列举了Hadoop中的一个主要部分MapReduce不行的种种理由。这事情到2009年SIGMOD的时候达到了一个顶峰。当时Michael Stonebraker等人发表了2篇关于数据库性能方面的论文,比较了Hadoop和他们自己的一个系统,证明Hadoop和一个数据库相比是多么的烂和多么的不堪。
虽然Stonebraker说得有一定道理,但不管怎么样来讲,Hadoop和它所带来的一些很重要的变化,的确是让数据的处理规模上了一个新台阶。而数据库的人只顾盯着天生就有缺陷的Hadoop(主要是MapReduce部分),而不顾文章中用廉价机器构建大规模数据并行处理,这一重要而且非常非常奠基性的贡献,实在是让人遗憾。
3、连横时代虽然 Hadoop的表现惊艳,但在当时并非所有公司都有条件使用,与此同时,用户需求却在日益增加。有些大公司(如银行、电信公司、大型零售商等)只关注于产品,却不想在技术工程和咨询服务上过多投入,它们需要一个可以帮助其解决问题的平台,这就是Cutting后来跳槽到Cloudera的初衷。
更为重要的是,Cutting开始盘算着新一轮的争霸策略。“合纵”策略掀翻了巨无霸Google后,Cutting希望进一步成为新的霸主,这次他采用的策略则是“连横”。对付强国需要合纵,进攻和自己差不多的国家则需要找一个有力的靠山。
虽然名字里有一个“云”,Cloudera并不是一个真正的云公司。它是一个建立在开放源代码Hadoop项目之上的商业产品。尽管Hadoop可能是处理大数据的有力方式且它可以开源使用,但是用起来并不简单。这正是Cloudera和2014年已经上市的Hortonworks等公司的机会所在,还有两个就是MapR和Pivotal。这些公司试图把Hadoop打包起来,以服务的方式提供给其他机构来使用。
凭借着Doug Cutting的到来,Cloudera获得了巨大的成功,同时也开始物色一个新的巨头作为自己的靠山,这个公司便是Intel。在Cutting的游说下,2014年,Intel以7.4亿美元的价格拿走了Cloudera 18%的股权,跟随Intel的还有Google,Dell公司老总Mike Dell的私人投资基金以及其他各路人马。实际上,早在2012年上半年,刚开始Intel是准备收购Cloudera的,未料甲骨文抢先一步给Cloudera开出16亿美金的offer,于是Intel转战Hortonworks,但也没谈拢。Intel在非自身专业领域投资上的犹豫,导致的策略性失误让他们损失惨重。
这一次,Intel可谓是下了血本,甚至不惜解散自己的Hadoop团队。没错,在投资Cloudera之前,Intel本来也在经营自己的Hadoop版本,并在2010年5月发行了第一个英特尔版本的Hadoop解决方案。2011年底,大数据在美国火了,英特尔董事会也开始关注这个领域,一回头发现竟然是中国的一个团队在做着这件事,于是便大量追加投资,在中美两地大幅招人,鼎盛时期团队达到了100多人。所谓世事难料,正式因为这次Intel的投资,使得在国内早先做Hadoop英特尔版本的团队离开Intel自立门户,也就是今天在上海安家落户的星环科技,后面谈国内大数据公司的时候我们详细再说。

Intel当年的Hadoop发行版这次投资也把Cloudera的总估值送上了40多亿的巅峰,并且牢牢的坐稳了Hadoop发行商的头把交椅。
通过Intel来进行连横,再战亦捷!
Cloudera也进入了一个新的时期。
4、纵横交错借助着Intel拔得了Hadoop的头筹之后,Cloudera开始向新的领域进军:数据仓库和云大数据。细心的人可以发现,Cloudera这次在招股书中把IBM、甲骨文、SAP和Teradata这些巨头列为竞争对手,同时亚马逊AWS和微软Azure等基础设施提供商也被其列为竞争对手。前者就是数据仓库,后者就是云基础设施厂商。
要进入新领域挑战Oracle和TeraData这样的巨头公司,Doug Cutting和Cloudera想必是相当的费脑筋了,因为展现在他们眼前的是如下一幅图,简直惊呆了!

2016年Gartner数据仓库及数据管理魔力象限这里,有必要先说说什么是Gartner魔力象限。
Magic Quadrant 魔力象限以二维模型来阐述各个厂商、供应商的实力与差异,基于两个分析指标方向。
横轴:前瞻性(Completenessof Vision)
包括厂商或供应商提供的产品底层技术基础的能力、市场领导能力、创新能力和外部投资等等。
纵轴:执行能力(Abilityto Execute)
包括产品的使用难度、市场服务的完善程度和技术支持能力、管理团队的经验和能力等。
最后将这些分析指标综合起来定位在四个不同的区域:Niche Players:执行能力和前瞻性都一般,但是可能在特定的某个市场做的不错,同时也不会超过那些特别大型的成熟厂商或者供应商。通常是集中在某些特定领域、专业领域,或者是一些比较新的企业。
Challengers:执行能力很强,但是前瞻性一般。通常情况下是指比较大型的成熟厂商,由于其本身特定市场比较成熟、市场执行能力很强,但是在新领域新市场的拓展上目前还没有做出太多的发展计划改变。
Visionaries:Visionaries这个词放在这里表示远见者的意思。通常描述前瞻性很不错、了解未来的市场发展动态和前景,有潜力进行创新。在执行能力上分为有远见但是短期内无法实现的早期创业者,和一些有远见但是执行反应能力调整不及时的比较成熟的大型厂商、供应商们。
Leaders:领导者与行业领袖。执行能力和前瞻得分均比较高的大型成熟公司、行业领袖。他们拥有大量的客户群体,在全球市场上都有极高的知名度。这些行业领袖在市场中有很大的影响力,有能力有实力影响和引领整个行业的发展。
从图中可以看到,领导者区域还是以Oracle、Teradata、IBM、SAP、Microsoft这些传统巨头为主。同时也可以看到Oracle在执行能力上要远远高于其它厂商,在前瞻性上要稍微落后于 Teradata和IBM。但这幅图最可怕之处是这五大厂商在领导者区域的位置已经深入领导者象限腹地,与挑战者或是远见者的平均得分的差距还是非常大的,可以说是行业的绝对领袖。
因此,我想除了纵横交错的战略以外,剩下的就是要看机遇了。于是我们看到了Cloudera一边在推广Impala和Kudu等开源项目(Impala是快速数据仓库分析查询引擎,而Kudu则是新一代存储系统),试图再一次联合同道中人;一边也在谋求上市,希望再以此吸引巨头的关注,甚至收购。
MapReduce已经死掉,Yarn也开始显现颓势,而Spark的江湖地位已经稳固。大数据的技术栈还在继续变化着。
在这个继续不断不变化的大环境下,Cloudera的策略效果和机遇到底如何,让我们拭目以待!
这里不得不提的是由UC Berkeley AMPLab主导开发的Spark。前面我们还说,在计算机系统领域,来自高校的有效创新越来越难,AMPLab却是个例外。

AMPLab成立于2011年初,六年多来,虽然身为实验室,却又实际上兼顾着“孵化器”的功能。
BDAS,the Berkeley Data Analytics Stack就是基于实验室成果而整合出的开源软件栈,给业界带来了巨大的影响。

AMPLab有超过半数左右的人曾经加入创业或正在创业,学生的创业热情和能力不可小觑的。更何况时下流行的开源项目Spark,Shark,Alluxio (前身为Tachyon) ,Mesos等都是出自于此。Spark于2009年诞生于伯克利,最初只是一个研究性项目。在2013年,Spark发展成为了Apache基金项目,并在同年开发Apache Spark的团队成立了Databricks公司。由于发家于AMPLab,Spark从不一开始就打上了学术的烙印。Spark的核心RDD,以及流处理,SQL智能分析,机器学习等功能无不来自实验室学生的一篇篇学术论。通过产学研一体化,Spark逐渐将MapReduce、Streaming、SQL、Machine Learning、Graph Processing等模型统一到一个平台下,并以一致的API公开,并提供相同的部署方案,使得Spark的工程应用领域变得很广泛。
同时,Spark的迅速发展壮大也离不开活跃的代码库和组织完善的社区活动。从2013年开始,参与贡献的公司从17家增加到了60多家,包括中国的阿里、百度、网易、腾讯、搜狐等。
MPLab孵化出来的孩子可谓是各有特长,有长于计算的Spark,也有善于存储的Alluxio,还有擅长资源管理的Mesos。AMPLab身兼实验室和孵化器的双重身份,成为了学术界与工业界跨界典范,在这个纵横交错的时代独树一帜。
5、国内硝烟再起大数据这股热风从几年前开始就刮向了国内,并且形成了飓风。然而,就像所有其他技术领域一样,什么事情到国内就都变了个样。当我们看着国外的大数据版图,分析着Gartner的魔力象限的时候,总会想像这国内会是一番怎样的景象。
果然,没有让我们失望,画风就是不一样。国内大数据的版图是下面这个样子的:

中国大数据企业排行榜 V3.0版以及这个样子的:

中国大数据产业生态图谱2016(Analysys易观)
我只想说真的很“邪气”,凡是和技术沾边的,大都被国外公司所占领;而凡是和应用、业务、行业相关的都是我们的天下,而且五花八门、种类繁多。
同时,我们再看看Gartner的魔力象限图,这次看最新的2017版。

2017年Gartner魔力象限惊喜出现了!虽然是在Niche Players的象限,但竟然有两家中国公司,一个是华为,另一个就是上文所提到的星环科技。
其实,我们仔细看看前面的图会发现,星环科技早在2016年也入选了Gartner的魔力象限图,而且还是在远见者象限中。同时,星环科技也是《中国大数据企业排行榜》技术平台类的第一名。
我们来看看国内的相关公司都有些什么技术和产品吧。

华为的FusionInsight大数据平台

星环科技的TDH平台另外和Hadoop基础软件相关的还有北京的红象云腾。红象大数据发行版CRH为企业大数据实施提供一套完整的一站式大数据解决方案,产品覆盖了企业数据仓库、商业智能、机器学习、数据可视化等领域,助力企业在DT时代更敏捷、更智能、更具洞察力。

红象-CRH系列再就是上海的爱可生,平台级产品包括:面向大数据处理的爱可生MySQL数据库分布式集群面向云计算的爱可生数据库即服务平台DBaaS支持高可用读写分离的数据库资源池平台从上面我们可以看到,国内大数据基础软件公司主要还是跟随Hadoop/Spark的套路,并且技术上有一定实力的大概只有华为和星环了。但就是这,却给予了我们一个非常值得期待的未来。
我们知道,基础软件在一个软件生态系统中位于核心的地位,像操作系统、数据库这样的基础软件一直是我们国家绕不过去的一道坎。随着互联网+的发展,几年前互联网公司已经喊出了去IOE的口号(去掉IBM小型机、Oracle数据库、EMC存储设备),并且已经开始做到,例如阿里的业务系统。随着大数据的发展,随着我国自主大数据平台的建设,这一趋势会愈加明显。
大数据领域实际上是整个生态链的竞争,特别是在中国。现在看来,越来越多的场景是既需要提供基础软件,同时也要提供上层应用解决方案的。单纯提供技术平台的厂商越来越尴尬,这也是为什么国外的那些大数据技术提供商很难在国内打开局面的原因。像数据库时代那样单纯买数据库软件的日子已经一去不复返了。
因此,虽然目前我们的大数据技术还有待提高,但我还是非常的看好国内大数据领域的,不仅是因为国内的大数据需求大,更重要的是由于大数据应用的特殊性,国内市场将会很好的培养一批拥有大数据核心技术的公司,就像互联网时代一样,它将造就一批类似BAT的中国大数据公司的崛起。
6、趋势从今年开始,大数据领域将更加强调基于云的解决方案,也更加强调大数据分析的整个生态链。传统数据仓库应用虽然普遍,但下滑之势已经难掩,逻辑数据仓库正在快速崛起。至少在国内,像IBM、SAP这样的公司,日子将更加难过。
云基础设施将会越来越成熟,已经成为了事实上的标准,如果不能快速拥抱它,落后甚至淘汰都不是危言耸听。看看AWS的突飞猛进(从挑战者迈入领导者象限),其威胁不言而喻。另一个值得关注的点就是Google的强势回归(2016年的Gartner魔力象限还没有Google呢),借助着在云计算和人工智能方面的布局,Google重新回到大数据的视野,进行着新一轮的争霸。
华为和星环都是基于开源生态打造平台,并且提供一体化的解决方案。华为对开源社区的贡献越来越大,Hadoop社区贡献排名全球第三,Spark社区贡献排名全球第四;而星环科技的产品成熟度则越来越高。随着这两家在国内落地的项目越来越多,人员越来越完备,将逐渐成为技术领头羊,进而挑战国际巨头。
特别是星环科技,由于拥有从Intel出来的原班人马,技术力量上和远见性上具有很强的优势,从他们去年开始推出的TOS(Transwarp Operating System)产品上可见一斑。

星环科技的TOS产品基于容器技术的云操作系统TOS是大数据和云计算融合的产品,其目的很明显,在云上打造大数据的生态,让更多的合作伙伴方便的加入到星环的大数据生态中来。这一点无疑是非常明智的,“合纵连横”的格局又悄然开始出现。
不知道这一次,究竟谁会笑到最后。
评论 (0)