为你找到 1000 条关于 大数据机器学习 的结果
加解密技术是防止电子病历数据在存储和传输过程中丢失、盗窃、篡改和破坏。
正确
为什么人们从追求单个更快的计算机转移到了追求更多的核,以及更多的机器
机器并行化不会使机器更容易使用,参考小结 2.2 大数据系统设计——并行化理念
以下的关于Google文件系统保存元数据的方法那些描述是正确的?
董先生提到,NoSQL解决了数据的_____的问题,但会失去_____。
数据稀疏可能会对模型的效果造成重要的影响。
数据稀疏会导致模型结果可信度下降,演讲者提及的降低数据稀疏性的重要方法是对有关联的数据进行聚合。
13亿人口,平均每人每年产生的照片和视频存储量为500MB,如果对一年产生的数据进行存储需要什么级别的存储容量()
聚合一般需要分成两个阶段进行,第一个阶段中增加Hash-semiaggregate有机会很大的减少两个阶段间的shuffle数据量。计算每个买家订单数量,SELECTBuyer,COUNT(*)FROMOrdersGROUPBYBuyer;,如果平均每个买家有三条订单,那么上述优化在最好的情况下shuffle数据量会是未优化前的多少?()
HDFS中典型的块大小是64MB,一个HDFS文件可以被被切分成多个64MB大小的块,如果需要,每一个块可以分布在不同的数据节点上。
“NoSQL”系列的数据库根据数据的存储模型和特点可以分为很多类,其中属于“key-value”存储类型的是
BigTable依赖于Google的几项技术,用GFS来存储日志和数据文件;按SSTable文件格式存储数据;用Chubby管理元数据。
以下哪一项不是目前我国地方政府数据开放存在的问题
目前我国地方政府数据开放的主要问题是数据量少、可机读率低、质量差、更新频率低、价值低。
哪个地区按照“谁拥有、谁定级”的原则将政府数据资源进行了分类?
固定知识点
以下哪些是数据爆炸带来哪些挑战?
机器学习的核心是使用大量的数据来训练,通过各种算法从数据中学习如何完成任务
可视化可以将难以理解的原始数据变换成用户可以理解的模式和特征,并显示出来。依据可视化流程概念图,在原始数据和可视化中间这一步骤是()