为你找到 1000 条关于 高级大数据系统 的结果
MapReduce中search任务可以只用map实现
统计最流行的单词时,可以通过提前去除出现频率低的单词,来提高程序效率
Spark的核心API支持下列哪几种语言
Spark具备快速的内存计算能力,其API支持Java、Scala,、Python、R四种编程语言。
Spark生态体系中,包括以下哪几种计算框架
Streaming具备实时流数据的处理能力。Spark SQL使得用户使用他们最擅长的语言查询结构化数据,DataFrame位于Spark SQL的核心,DataFrame将数据保存为行的集合,对应行中的各列都被命名,通过使用DataFra...
Spark一切都以ResilientDistributedDataset(RDD)为基础
RDD是Spark框架中的核心概念。可以将RDD视作数据库中的一张表。其中可以保存任何类型的数据。Spark将数据存储在不同分区上的RDD之中。
以下针对RDD的操作中,属于Transformation的操作有哪些?
常见的RDD的Transformation操作如下:map():参数是函数,函数应用于RDD每一个元素,返回值是新的RDDflatMap():参数是函数,函数应用于RDD每一个元素,将元素数据进行拆分,变成迭代器,返回值是新的RDDfilt...
以下针对RDD的操作中,属于Action的操作有哪些?
collect():返回RDD所有元素count():RDD里元素个数countByValue():各元素在RDD中出现次数reduce():并行整合所有RDD数据,例如求和操作fold(0)(func):和reduce功能一样,不过fol...
在Spark的运行架构中,一个Job包含多个Task(被送到executor上的工作单元)组成的并向计算,往往由Transformation产生
Job是指包含多个Task组成的并行计算,往往由Action操作产生
在Spark计算的过程中,可以直接使用Localfiles和DFSfiles作为数据源来生成原始RDD。
哪些是流式数据处理的特征?
Storm中的Bolt既可以处理收到的Tuples,也可以创建新的Tuples流。
在下列哪些生产环境的需求驱动下,使用“NoSQL”系列数据库比较合适
并不是任何场景,“NoSQL”系列数据库都优于传统的关系型数据库,一般来说,在以下情况下,比较适合使用“NoSQL”系列数据库:1)数据库表的schema经常变化;比如在线商城,维护产品的属性经常要增加字段,如果该表的数据量过百万,新增字段...
Chubby是一种高可用的分布式锁服务,Chubby有几个活跃副本,同时有几个主副本提供服务,
Chubby是一种高可用的分布式锁服务,Chubby有五个活跃副本,同时只有一个主副本提供服务,副本之间用Paxos算法维持一致性,Chubby提供了一个命名空间(包括一些目录和文件),每个目录和文件就是一个锁,Chubby的客户端必须和C...
下列哪个不属于HBase的特点
HBase是基于Google BigTable模型开发的,典型的key/value系统;
GraphDB的特性是对关系进行操作。