Apache Parquet est un format de stockage en colonnes optimisé pour une utilisation avec des frameworks de traitement de données massives (Big Data). Contrairement aux formats orientés lignes, Parquet stocke les données par colonnes, ce qui permet une compression et un encodage des données très efficaces. Ce stockage en colonnes permet aux moteurs de requête de ne récupérer que les colonnes nécessaires pour une requête donnée, réduisant ainsi considérablement les entrées/sorties (I/O) et améliorant les performances des requêtes. Parquet est conçu pour être auto-descriptif, ce qui signifie que le schéma est intégré directement dans le fichier de données lui-même. Cela élimine le besoin de stockages de métadonnées externes et simplifie la gestion des données. Il prend en charge une large gamme de types de données et de structures imbriquées complexes. Parquet est largement utilisé dans l'entreposage de données (data warehousing), les lacs de données (data lakes) et d'autres applications Big Data où le stockage et la récupération efficaces des données sont critiques. Son intégration avec des frameworks populaires tels qu'Apache Spark, Hadoop et Presto en fait un choix polyvalent pour les pipelines de traitement de données. Le format est conçu pour les opérations de lecture et d'écriture, bien qu'il soit souvent utilisé dans des scénarios où les données sont écrites une seule fois et lues plusieurs fois (modèle WORM : write-once, read-many).