这个定义符合当前计算机专家的软件建模思维,即去掉现实模型中的复杂细节,由设计人员依据自身所掌握的知识,按照主观意识抽象出一个用来代替现实复杂模型的简单模型。
然而不幸的是,这种思维用于处理真正的大数据模型时,大麻烦就会出现了。蝴蝶效应让大范围内的数据效果变得不可思议。
对于计算科学来说,所有的理论和方法,都是为了处理数据本身的复杂关系。这是唯一的目的。如果把物理世界的存在事物当成数据体,那么物理世界的所有理论和方法,其目的也只是解决数据的存在关系。
人们对大数据的误解主要体现在以下一些方面:
误解一,大数据是大量简单小数据集的集合。真实情况是,大数据是由不同层次的数据集构成的复杂数据集合。其哲学逻辑描述是,大数据作为一个存在的事实,由一系列的数据集构成,数据集作为存在的事实,由更小的数据集组成,不能再分解的数据集被称为对象,是大数据的最小构成单元。
误解二,大数据的效果来自对大量小型数据集的合并分析。真实的情况是,真正决定大数据效果的是数据的组织连接形式,即结构。结构传递了结点上数据的效果,按照混沌理论,一个很小的局部事件,通过不确定性的非线性路径的传递,将产生蝴蝶效应。或者一个很大的局部效果,通过传递过程的衰减,变成很小的整体影响。
3、大数据的关键技术在哪里
尽管中国的IT权威专家或者技术人员很少质疑来自西方的新概念,把它们当成“真理”而大加宣传,但是西方的权威专家却在不断修正这些概念,有时会全面否定之前的定义或者观点。
据网上资料显示,UML之父Ivar Jacobson来中国参加一次活动时说,“软件工程中有几百种方法,种类太多本身就是一个问题,这些方法缺乏一个共同的基础,比如很难将CMMI和Scrum统一到一起。现在要做的就是重建软件工程的基础”。又比如google指出了hadoop存在的问题,并且采用其它技术来替换。
在中华文化里,“人穷志短”、“拉大旗做虎皮”是中国人很重要的的处世方式,这种生存哲学阻碍了中国取得原创革命性科技成果的机会。比如中国的权威专家一方面高谈完全自主知识产权的重要性,并以此通过政府的力量控制更多的资源,另一方面又想办法和西方的权威机构合作,利用他们的先进技术来保证自己在国内的技术领先地位,甚至少数人幻想这种方式可以让他们超越给他们提供技术的西方合作机构。
大数据是一个西方专家目前并没有弄明白的东西。谷歌的工程师发现当大量的数据出现时,就可以获得一种规律性的结论。于是西方专家提出了大数据(Big data)概念,并快速成为科学家、企业家和政府关注的对象。
据网上资料说,谷歌流感趋势预测的文章发表4年以后,新的一期《自然杂志消息》报道了一则坏消息:在最近的一次流感爆发中谷歌流感趋势不起作用了。
建立大数据模型并不是一件容易的事情,受还原论思想的影响,西方的计算科学家采用线性思维来建立大数据模型,大数据只是大量小数据体的集合,并不考虑数据聚集在一起后产生的整体效应。这不是说西方科学家不了解整体效果,混沌理论,蝴蝶效应也是西方科学家提出的。
除了民族自卑感外(长期的民族屈辱使中国人失去了原始创造的自信),追求个人(或者小集团)名利的社会大环境使中国失去了原始创造力的生存土壤。
建立大数据模型需要把西方的还原论和东方的整体论思想结合起来,参照《逻辑哲学论》里的描述方式,大数据是由大量不能再分解的数据单元构成的,这些数据单元连接成小数据体,小数据体再连接成数据体,最终连接成一个大数据体。所以大数据是一个巨复杂的数据模型,但是这个巨复杂模型又是由简单模型组成的。可见大数据的关键技术在于数据体的组织连接形式,即结构。
由此可见,大数据技术包含两大部分,一是简单数据处理,属于传统技术,目前已经有很多有效的方法;另外一个是数据结构处理,这是一个全新的技术,也是云计算的典型特征,在这个技术领域,中国和美国等发达国家处在相同的起跑线上。