Zurich Tram Data

Vom Rohdaten-Archiv zum Master-Datensatz

Data-Engineering-Pipeline für das Zürcher Tramnetz (VBZ) | 2023–2025 (IST-Format v1)

38 GB
IST-Rohdaten, schweizweit
94,4 M
Halt-Ereignisse im Master
26
Spalten aus 5 Quellen
9
reproduzierbare Notebooks

Das Projekt

MotivationEntstanden als Abschlussarbeit einer Data-Science-Fortbildung — mit dem Anspruch, Data Science nicht abstrakt, sondern an einem Alltagsbeispiel mit echtem Impact im ÖPNV zu zeigen. Die Recherche führte über deutsche ÖPNV Betreiber nach Zürich mit seiner herausragend guten Open-Data-Landschaft.
AufgabeEinen sauberen Master-Datensatz der realen VBZ-Tram-Halte bauen, mit dem eine qualitativ belastbare Analyse überhaupt erst möglich wird — die Data-Engineering-Grundlage für zh-tram-flow, dem Analyse- und Vorhersage-Projekt zu Zürich Tram. Leitgedanke: reduzieren was da ist, anreichern was für eine aussagekräftige Analyse fehlt.
Reduktion~400 Transportunternehmen → VBZ Tram, Polars statt Pandas (~4× schneller und sparsamer, per Benchmark belegt), 21 → 10 Spalten, ~11 % Zeilen entfernt.
AnreicherungVier Kontextquellen recherchiert und integriert — GTFS, Meteo, Events (kein Open Data → Handaufbau), Geo. 10 → 26 Spalten über Left- und Spatial-Joins.
Resultatvbz_master.parquet — 94,4 M Halt-Ereignisse × 26 Spalten, 1:1 reproduzierbar über 9 Notebooks, systematisch validiert: Schema, Wertebereiche, Join-Qualität, Stichproben gegen die Rohdaten.

Detaillierte Projekt Präsentationen

Das Projekt in drei kuratierten Ansichten für verschiedene Zielgruppen und Zeitbudgets.
Jede Präsentation nutzt die gleichen Daten — andere Dramaturgie und Fokus.

Weitere Ressourcen