Combiné aux notebooks d'ipython, cette librairie est vraiment efficace.
Je n'avais jamais su prendre le temps de maitriser numpy, encore moins d'apprendre R pour pouvoir aisement brasser des tableaux de données de plusieurs millions de lignes (tenant en mémoire vive).
Au delà des fonctionnalités de base, ce sont les petits détails suivants qui me font gagner un temps fou :
- lire une source CSV ou Excel en une ligne de code;
- exporter un résultat au format HTML ou JSON en une ligne (très utile en combinaison d'un framework web comme web2py) ;
- obtenir un graphique d'un série de plus de 100000 lignes en moins d'une seconde là où Excel s'épuise ;
- Pivoter et grouper des tableaux dans tous les sens pour produire des résultats
- Faire du traitement lourd sur les dates ; Quand je dis lourd, je parle des choses pénibles comme l'alignement de dates, le sous et sur-échantillonnage, etc ...
Mes comparaisons systématiques avec Excel sont volontaires. Pandas(+notebook) est pour moi un complément, et parfois un substitut, à Excel dans beaucoup de mes projets. Excel est largement sur-utilisé et au final coûte très cher quand il s'agit d'automatiser des tâches complexes ou de traiter des volumes important (>50000 ligne).
Dis autrement, je rève d'un frontal tableur pour pandas ;-)
# excel+pandas+notebook
Posté par PhE . En réponse à la dépêche Pandas, une bibliothèque pour manipuler facilement des données. Évalué à 4.
Combiné aux notebooks d'ipython, cette librairie est vraiment efficace.
Je n'avais jamais su prendre le temps de maitriser numpy, encore moins d'apprendre R pour pouvoir aisement brasser des tableaux de données de plusieurs millions de lignes (tenant en mémoire vive).
Au delà des fonctionnalités de base, ce sont les petits détails suivants qui me font gagner un temps fou :
- lire une source CSV ou Excel en une ligne de code;
- exporter un résultat au format HTML ou JSON en une ligne (très utile en combinaison d'un framework web comme web2py) ;
- obtenir un graphique d'un série de plus de 100000 lignes en moins d'une seconde là où Excel s'épuise ;
- Pivoter et grouper des tableaux dans tous les sens pour produire des résultats
- Faire du traitement lourd sur les dates ; Quand je dis lourd, je parle des choses pénibles comme l'alignement de dates, le sous et sur-échantillonnage, etc ...
Mes comparaisons systématiques avec Excel sont volontaires. Pandas(+notebook) est pour moi un complément, et parfois un substitut, à Excel dans beaucoup de mes projets. Excel est largement sur-utilisé et au final coûte très cher quand il s'agit d'automatiser des tâches complexes ou de traiter des volumes important (>50000 ligne).
Dis autrement, je rève d'un frontal tableur pour pandas ;-)