11月5日,在2022云栖大会一体化大数据智能峰会上,由开放原子开源基金会、X-lab开放实验室和阿里巴巴开源委员会联合出品的《2022年开源大数据热力报告》重磅发布。其中,阿里巴巴推动的Apache Flink在流处理领域热力值排名第一,DataX、Flink CDC、Apache Celeborn入围热力榜单。
据悉,报告基于公开数据研究最活跃的102个开源大数据项目,探寻出开源大数据技术发展背后的“摩尔定律”,每隔40个月,开源项目热力值就会翻一倍,技术完成一轮更新迭代。开放原子开源基金会副秘书长刘京娟表示,在过去8年里,发生了5次较大规模的技术热力跃迁,多元化、一体化、云原生成为当前开源大数据发展趋势的最显著特征。
早在2009年,阿里巴巴就开始大规模使用Hadoop等开源大数据技术,在经历双11等内部核心业务锤炼之后,于2015年启动开源大数据技术实时化,并实现全面上云,以开源大数据平台E-MapReduce和实时计算Flink版来对外提供公共云服务。阿里巴巴也积极参与开源社区以及合作伙伴的开源共建,贡献了开源数据Shuffle服务Celeborn到Apache孵化器,推动Flink成为实时计算领域的事实标准,最终形成了开放、多元、现代、智能的开源大数据技术生态。
阿里巴巴一直本着开放、创新、贡献的初心积极推动开源大数据技术的演进,截止到今年,贡献了10余个顶级开源项目,培养50余位顶级开源项目Committer、PMC,代码贡献量超过150万,开源文化氛围浓厚,构建了围绕数据集成Flink CDC、数据分析Flink SQL、机器学习Flink ML、规则引擎Flink CEP、动态表存储Flink Table Store的Apache Flink生态项目群,推动Flink茁壮成长为Apache的头部项目之一。同时,生长于阿里巴巴的 Celeborn 项目-大数据计算引擎通用Shuffle服务成功进入Apache孵化器,为开源大数据技术更添一份力量。
从共建到引领,阿里云开源大数据产品矩阵升级
云栖大会上,阿里云开源大数据产品矩阵再次升级,开源大数据平台E-MapReduce将技术引领优势转化为云上产品服务能力,重磅发布E-MapReduce 2.0,面向未来构建下一代开源大数据基础设施,弹性优化能力提升3倍,伸缩规模达千台,3分钟即可创建100节点的数据湖集群。
依托于EMR、OSS、DataWorks产品组合的数据湖,满分通过了信通院云原生数据湖评测,全面兼容HDFS,湖权限和生命周期管理能力升级。实时计算Flink增强了复杂事件处理功能,可应用于实时风控、实时营销场景,分钟级作业诊断,帮助用户资源效率提升30%。
阿里云还联合Elastic 公司推出云原生 Serverless Elasticsearch,为用户带来SaaS化产品体验,同时,使用成本下降53%。与Cloudera公司战略合作的数据混合云 Cloudera CDP公共云正式商用,为CDP用户带来统一的云上云下使用体验。
(图说:阿里云开源大数据负责人王峰)
阿里巴巴开源委员会大数据领域副主席、阿里云开源大数据负责人王峰在会上表示,开源大数据技术已经进入了全面云原生的时代,依托全面云原生架构,为用户提供极致弹性伸缩,按需使用的服务;同时,在实时计算技术领域持续创新,提出Flink SQL + Table Store的使用方式,实现端到端的数仓链路实时流动,提供全增量数据链路一致性体验;构建统一架构的云原生数据湖,架构从存算一体到存算分离,融合多元化计算模式,实现智能安全的数据湖管理。在此基础之上,持续优化“智能运维大脑”,推出如Flink作业自动调优,EMR Doctor智能运维诊断系统等,全面加深开源大数据平台的增值能力,帮助用户更高效地使用。
(免责声明:本网站内容主要来自原创、合作伙伴供稿和第三方自媒体作者投稿,凡在本网站出现的信息,均仅供参考。本网站将尽力确保所提供信息的准确性及可靠性,但不保证有关资料的准确性及可靠性,读者在使用前请进一步核实,并对任何自主决定的行为负责。本网站对有关资料所引致的错误、不确或遗漏,概不负任何法律责任。
任何单位或个人认为本网站中的网页或链接内容可能涉嫌侵犯其知识产权或存在不实内容时,应及时向本网站提出书面权利通知或不实情况说明,并提供身份证明、权属证明及详细侵权或不实情况证明。本网站在收到上述法律文件后,将会依法尽快联系相关文章源头核实,沟通删除相关内容或断开相关链接。 )