Pipeline de streaming de données en temps réel construit autour de données de l'API GitHub : Kafka assure le courtage de messages asynchrones, Flink (via PyFlink) effectue le traitement et les transformations de flux, Hadoop/HDFS avec Hive et HBase fournissent le stockage distribué et l'interrogation, et Elasticsearch + Kibana gèrent l'indexation et les tableaux de bord de visualisation. Inclut un exemple d'analyse de comptage de mots, un chargement de tables Hive depuis CSV, et une conception de schéma HBase avec familles de colonnes, avec une attention particulière à la compatibilité des versions entre outils.