Apache Parquet 是一种专为大数据处理框架优化的列式存储格式。与传统的行式存储格式不同,Parquet 按列存储数据,从而实现了高效的数据压缩和编码。这种列式存储方式使查询引擎能够仅检索给定查询所需的特定列,从而显著减少 I/O 操作并提升查询性能。Parquet 被设计为自描述格式,这意味着数据模式(Schema)直接嵌入在数据文件本身中,消除了对外部元数据存储的需求,简化了数据管理。它支持多种数据类型以及复杂的嵌套结构。Parquet 广泛应用于数据仓库、数据湖以及其他对高效数据存储和检索要求极高的各类大数据应用场景中。它与 Apache Spark、Hadoop 和 Presto 等主流框架的深度集成,使其成为数据处理流水线中的多功能选择。该格式同时支持读写操作,尽管它通常被用于“一次写入,多次读取”(WORM)的场景。