Aller au contenu
Wikipédia l'encyclopédie libre

Apache ORC

Un article de Wikipédia, l'encyclopédie libre.

Apache ORC (Optimized Row Columnar) est un format de stockage de données orienté colonne libre et à code source ouvert de entre autres de l'écosystème Apache Hadoop. Il est similaire aux autres formats de fichiers de stockage en colonnes disponibles dans l'écosystème Hadoop, tels que RCFile et Parquet. Il est compatible avec la plupart des infrastructures de traitement de données de l'environnement lac de données.

En , Hortonworks a annoncé le format de fichier Optimized Row Columnar (ORC) en collaboration avec Facebook. Un mois plus tard, le format Apache Parquet était annoncé, développé par Cloudera et Twitter [3] .

Comparaison

[modifier | modifier le code ]

Apache ORC est comparable aux formats de fichier tels RCFile et Parquet - les trois font partie de la catégorie de stockage de données en colonnes dans l'écosystème Hadoop. Ils ont tous une meilleure compression et un meilleur encodage avec des performances de lecture améliorées au prix d'écritures plus lentes.

Notes et références

[modifier | modifier le code ]
  1. ↑ « https://projects.apache.org/json/projects/orc.json » (consulté le )
  2. ↑ « Release 2.3.1 », (consulté le )
  3. ↑ Justin Kestelyn, « Introducing Parquet: Efficient Columnar Storage for Apache Hadoop », Cloudera blog, (consulté le )

Voir aussi

[modifier | modifier le code ]
v· m
Projets principaux ASF logo
Incubateur Apache
en cours d'incubation
incubation finie
Autres projets
Apache attic / Projets en fin de vie
Personnalités
Divers
v· m
Écosystème Hadoop
Distributions Hadoop
Base de données
Flux de données
Interrogation
Machine Learning
SQL
Gestionnaire de cluster
Format de fichier
Vrac
v· m
Écosystème des lakehouses ouverts
Concepts
Formats de stockage
Moteurs de calcul et requête
Streaming et ingestion
Orchestration

AltStyle によって変換されたページ (->オリジナル) /