Apache ORC
| Développé par | Apache Software Foundation Voir et modifier les données sur Wikidata |
|---|---|
| Première version | [1] Voir et modifier les données sur Wikidata |
| Dernière version | 2.3.1 ()[2] Voir et modifier les données sur Wikidata |
| Dépôt | github.com/apache/orc Voir et modifier les données sur Wikidata |
| Écrit en | C++ et Java Voir et modifier les données sur Wikidata |
| Type |
Format de fichier (en) Format de sérialisation de données (d) Projet de la fondation Apache (d)Voir et modifier les données sur Wikidata |
| Licence | Licence Apache 2.0 Voir et modifier les données sur Wikidata |
| Site web | orc.apache.org Voir et modifier les données sur Wikidata |
Apache ORC (Optimized Row Columnar) est un format de stockage de données orienté colonne libre et à code source ouvert de entre autres de l'écosystème Apache Hadoop. Il est similaire aux autres formats de fichiers de stockage en colonnes disponibles dans l'écosystème Hadoop, tels que RCFile et Parquet. Il est compatible avec la plupart des infrastructures de traitement de données de l'environnement lac de données.
En , Hortonworks a annoncé le format de fichier Optimized Row Columnar (ORC) en collaboration avec Facebook. Un mois plus tard, le format Apache Parquet était annoncé, développé par Cloudera et Twitter [3] .
Comparaison
[modifier | modifier le code ]Apache ORC est comparable aux formats de fichier tels RCFile et Parquet - les trois font partie de la catégorie de stockage de données en colonnes dans l'écosystème Hadoop. Ils ont tous une meilleure compression et un meilleur encodage avec des performances de lecture améliorées au prix d'écritures plus lentes.
Notes et références
[modifier | modifier le code ]- (en) Cet article est partiellement ou en totalité issu de l’article de Wikipédia en anglais intitulé «Apache ORC» (voir la liste des auteurs).
- ↑ « https://projects.apache.org/json/projects/orc.json » (consulté le )
- ↑ « Release 2.3.1 », (consulté le )
- ↑ Justin Kestelyn, « Introducing Parquet: Efficient Columnar Storage for Apache Hadoop », Cloudera blog, (consulté le )
Voir aussi
[modifier | modifier le code ]- Apache Iceberg
- Apache Hive
- Apache NiFi
- PIG (outil de programmation)
- Apache Spark
- Presto (moteur de recherche SQL)
| Projets principaux |
|
ASF logo | |||
|---|---|---|---|---|---|
| Incubateur Apache |
|
||||
| Autres projets | |||||
| Apache attic / Projets en fin de vie | |||||
| Personnalités | |||||
| Divers | |||||
Écosystème Hadoop |
||
|---|---|---|
| Distributions Hadoop | ||
| Base de données | ||
| Flux de données | ||
| Interrogation | ||
| Machine Learning | ||
| SQL | ||
| Gestionnaire de cluster | ||
| Format de fichier | ||
| Vrac | ||
Écosystème des lakehouses ouverts |
|
|---|---|
| Concepts | |
| Formats de stockage | |
| Moteurs de calcul et requête | |
| Streaming et ingestion | |
| Orchestration | |