NYC Taxi Routes

Nachfrage- und Routenanalyse für die JFK-Flottenplanung
Data-Analysis-Projekt mit Routen-Klassifikation | 300.000 Taxifahrten, NYC 2016

Technical Insights

Datenbereinigung, Geo-Klassifikation über Bounding-Boxes und methodische Entscheidungen. Ohne Business-Empfehlungen.

6.631
Zeilen über Fehler- und Scope-Masken entfernt
2
Bounding-Boxes klassifizieren jede Fahrt
9
mögliche Routentypen
0
Fehler-Outputs in 5 Notebooks
Agenda

Inhaltsübersicht

Datenaufbereitung, Geo-Klassifikation und Methodik

1Daten und Bereinigung
2Routen-Klassifikation
3Geo-Bounds und Methodik
4Grenzen
Daten

Ein Datensatz, 2016er Yellow-Taxi-Fahrten

Aufbereiteter CSV-Auszug aus dem StackFuel-Übungsprojekt

SchrittUmfangAnmerkung
Rohdaten300.000 Zeilen × 12 Spalteneine Zeile je Fahrt, NYC 2016
Bereinigt293.369 Zeilen6.631 Zeilen über Fehler- und Scope-Masken entfernt
Klassifiziert293.369 × +3 SpaltenAbfahrtsgebiet, Ankunftsgebiet und Routentyp je Fahrt
Keine Fahrzeug-IDs, keine Flottengröße. Jede Empfehlung ist ein relativer Faktor auf den Wochenschnitt, keine Stückzahl.
Daten

Messfehler von Geschäfts-Scope getrennt

Zwei Arten von Masken, unterschiedlich begründet

Messfehler — unmögliche Werte
Koordinaten außerhalb NYC, negative oder Null-Fahrpreise, lange Distanz bei Near-Zero-Fahrpreis (Sensordefekt), unplausible Passagierzahl. Technisch falsch, deshalb raus.
Geschäfts-Scope — plausibel, aber außerhalb
Fahrpreise über 250 $, Extremdistanzen. Echte Fahrten, aber nicht Teil des Alltagsgeschäfts, um das es hier geht.
24 exakte Duplikate
Vollständig identische Zeilen, ersatzlos entfernt.
6.631 Zeilen entfernt, 2,2 % der Rohdaten. Klein genug, um die Verteilungen nicht zu verzerren, groß genug, um die Extremwerte aus den Kennzahlen zu halten.
Daten

Abgeleitete Spalten für die Analyse

features/engineering.py — Geo, Ökonomie, Zeit

GruppeSpaltenZweck
Geo-Routedeparture · arrival · routeBounding-Box-Klassifikation je Fahrt
Ökonomietotal_yield · price_per_mileErtrag je Fahrt und je Meile
Zeittime_slot · is_weekendTagesabschnitt und Wochenende
Verteilunglog-Transformierte der schiefen Numerikrobustere Vergleiche
Die Klassifikations- und Ökonomie-Spalten tragen die gesamte spätere Analyse. Sie entstehen einmal in der Preparation und werden exportiert.
Routen

Neun Routentypen aus zwei Gebieten

Jede Fahrt bekommt ein Abfahrts- und ein Ankunftsgebiet: JFK, NYC oder Other

Fahrten je Routentyp, logarithmische Skala

Jede Fahrt wird über zwei Bounding-Boxes klassifiziert: liegt der Punkt in der JFK-Box, in der NYC-Box oder außerhalb.

Die Fahrtenzahl ist logarithmisch aufgetragen, weil NYC→NYC alle anderen Routentypen um Größenordnungen übersteigt.

Routen

Wo die Fahrten beginnen

Pickup- und Dropoff-Punkte, klassifiziert nach JFK / NYC / Other

Pickup- und Dropoff-Standorte in NYC

Die Masse der Punkte liegt in Manhattan und den inneren Boroughs. Der JFK bildet einen kompakten, klar abgesetzten Cluster im Südosten.

Diese räumliche Trennung ist der Grund, warum ein einfaches Rechteck für die Klassifikation ausreicht.

Methodik

Klassifikation über Bounding-Boxes

nyc_taxi_routes.utils.JFK / .NYC — zentral definiert, nicht in Notebooks dupliziert

GebietBreitengradLängengradZweck
JFK40,627 – 40,660−73,808 – −73,766Flughafen-Rechteck, rund 3,7 km Kantenlänge
NYC40,577 – 40,918−74,150 – −73,700Metropolregion
Otheraußerhalb beider Boxenalles Übrige
Ein Rechteck ist eine grobe Näherung an das Flughafengelände. Es fasst die Terminal-Vorfahrten sicher, greift am Rand aber auch angrenzende Straßen mit — bewusst in Kauf genommen für eine reproduzierbare, an einer Stelle nachlesbare Regel.
Methodik

Deskriptiv, relativ, reproduzierbar

Drei bewusste Entscheidungen zum Vorgehen

Annahme: Ergebnisform
Eine konkrete Taxi-Stückzahl für den JFK.
Befund: Ergebnisform
Gewichtungsfaktoren auf den Wochenschnitt — der Datensatz enthält keine Flottengröße.
Annahme: Methode
Ein Vorhersagemodell mit Train/Test-Split.
Befund: Methode
Eine Bestandsaufnahme von Anteilen und Zeitmustern in den 2016er Daten.
Annahme: Klassifikation
Ein exaktes Flughafen-Polygon.
Befund: Klassifikation
Eine Bounding-Box — grob, aber zentral definiert und reproduzierbar.
Die Frage ist eine Anteils- und Verteilungsfrage, keine Prognose. Jede Vereinfachung ist dokumentiert und im Code an einer Stelle nachlesbar.
Grenzen

Was diese Analyse nicht leisten kann

Aussagegrenzen, offen benannt

Keine Stückzahl
Der Datensatz enthält keine Flottengröße. Alle Empfehlungen sind relative Faktoren auf den Wochenschnitt, keine Taxi-Zahlen.
Ein Jahr, eine Stadt
2016er Yellow-Taxi-Daten für NYC. Kein Trend über die Zeit, keine Übertragung auf andere Jahre oder Anbieter — Uber und Lyft fehlen.
Bounding-Box statt Polygon
Das JFK-Rechteck greift am Rand angrenzende Straßen mit. Die JFK-Zahlen sind dadurch eher eine leichte Obergrenze.
Deskriptiv, nicht prognostisch
Anteile und Muster im Bestand, kein Vorhersagemodell. Ob die Muster über 2016 hinaus gelten, zeigt erst neue Datenlage.

NYC Taxi Routes

Nachfrage- und Routenanalyse für die JFK-Flottenplanung
Data-Analysis-Projekt mit Routen-Klassifikation | 300.000 Taxifahrten, NYC 2016

Eine Nische richtig einordnen

1,93 % der Fahrten, rund das Vierfache an Wert, mit klarem Wochen- und Tagesrhythmus. Der Beitrag war nicht ein Modell, sondern die saubere Klassifikation und die Übersetzung der Muster in eine gewichtete Bereitstellung.