MapR大资料融合平台正式上市,每秒可处理近2千万笔讯息

MapR
Hadoop企业版发行商MapR于3月8日宣布,旗下融合资料平台(Converged Data Platform)正式上市,并加强Docker容器(Container)、安全性、资料治理等功能。另外,此平台现在也包含了开源Hadoop专案Apache Myriad,让丛集管理工具YARN和Mesos间共享资料中心的资源,并支援多租户环境。
MapR融合资料平台将Hadoop和Spark、网络规模(Web-Scale)的储存、NoSQL、资料串流功能等整合到一个统一的丛集,提供用户可以部署即时资料应用程序。而该平台主要由大资料事件串流系统MapR Streams、NoSQL数据库管理系统MapR DB,以及基于POSIX档案系统型态的储存系统MapR FS所组成。
在这次的更新中,MapR透过状态资料(Stateful Data)来加强Container与持续储存(Persistent Storage)的互动,而状态资料就是指资料的背景,举例来说,顾客的销售历史记录,每个重要资讯构成了历史记录,历史记录则构成了资料背景,而此资料能供应用程序持续检索。另外,融合资料平台之于Docker Container就像资料服务层,提供Container分散式且弹性的储存,也包含容器化(Containerized)应用程序所需的数据库和讯息与串流功能。
在安全性方面,融合资料平台现在利用存取控制运算式(Access Control Expressions,ACE)来描述使用者存取的资料权限,根据MapR,ACE让系统管理员可用1~2行的程式码,就能描述指定的存取权限。而除了ACE外,MapR也在MapR Volume多加一层资料档案的防护,加强多租户控制,以确保资料仅供指定群组存取。
而在效能的部分,研究机构ESG进行MapR Streams的基准测试,结果显示在每秒3.5GB的吞吐量下,每秒可处理超过1.8千万笔讯息。另外,MapR DB现在支援原生JSON文件储存格式,使用者可在SSD中,透过平行I/O即时存取NoSQL资料。
