免费领取大会全套PPT    

点此领取

立即报名

刘欣瑀

阿里巴巴存储服务团队高级软件工程师、Paimon C++负责人

阿里巴巴存储服务团队高级软件工程师,Apache Paimon Committer、Paimon-cpp Maintainer。专注 Paimon-cpp 项目核心研发与开源维护,成功推动其在阿里巴巴内部数据湖中的落地应用。此前负责时序数据库 Khronos 的研发,为阿里巴巴集团监控系统提供数据存储与查询能力。主要研究方向包括存储引擎、高性能数据格式及系统级性能优化,致力于与 Apache 社区共同建设原生数据湖仓生态。

演讲主题

Paimon-cpp:面向原生查询引擎的 Apache Paimon C++ 实现与落地实践

Apache Paimon 已成为 Apache 生态中发展最活跃的数据湖仓格式之一,但当前主流实现主要依赖 JVM,这对越来越多追求低延迟、高性能、易嵌入的原生查询引擎提出了新的挑战。本次分享将结合我们主导研发的 Paimon-cpp 项目,介绍如何从零构建一个兼容 Apache Paimon 行为的高性能 C++ 实现,支持 Append Table、Primary Key Table、MOR、Deletion Vector、Data Evolution、多类索引以及实时数据查询能力。我们将重点分享基于 Arrow 列式内存格式的核心设计,以及如何通过浅拷贝数据交换、预取优化、异步并行行列转换、Blob I/O 优化和面向时序数据的 Map 共享列化设计,提升读写与 Compaction 性能。同时,也会介绍其模块化插件式架构如何适配不同文件系统、文件格式、线程池和指标组件。最后结合实际工程经验,分享 Paimon-cpp 在接入原生引擎、生产调优和开源贡献过程中的关键实践与总结。 本次分享将从 Paimon-cpp 的研发背景与设计目标出发,介绍其如何兼容 Apache Paimon 行为并支持 Append Table、Primary Key Table、MOR、Deletion Vector、Data Evolution、多类索引及实时数据查询;进一步分享基于 Arrow 的列式内存设计,以及浅拷贝数据交换、预取优化、异步并行行列转换、Blob I/O 优化和面向时序数据的 Map 共享列化等关键实现,最后结合实际落地经验介绍其模块化架构设计、生产调优与原生引擎接入实践。 听众将能够了解原生查询引擎接入湖仓格式时面临的核心挑战与实现路径,系统理解 Paimon C++ 实现中的格式兼容、性能优化与架构设计思路,并获得在实时查询、主键表处理、时序数据建模及生产落地中的可复用实践经验,为自研湖仓引擎、存储系统或数据平台建设提供参考。

© boolan.com 博览 版权所有

沪ICP备15014563号

沪公网安备31011502003949号