Stillstandsprognose für Taxifahrten in Quito
Data-Science-Projekt mit 280-Konfigurationen-Sweep | 2016–2017
Eine Taxi-App in Quito will Fahrgäste vorwarnen
Wer vorher weiss, dass er im Stau stehen wird, erlebt die Fahrt weniger schlecht.
wait_sec — Sekunden, die das Fahrzeug während der Fahrt komplett stillsteht.Eine einfache lineare Regression als Referenz
„Kannst du diesen Wert unterbieten?“ — die Aufgabenstellung formuliert das Ziel selbst.
| Eigenschaft | Wert |
|---|---|
| Fahrten | 15.657 |
| Spalten | 11, davon 1 Zielgrösse |
| Zeitraum | Juni 2016 – August 2017 |
| Gebiet | Quito, Stadt und Randbezirke inklusive Flughafen |
| Nach Bereinigung | 98,8 % der Zeilen erhalten |
| Quelle | Kaggle, Mario Navas, CC BY-SA 4.0 |
Der Grund für alles, was danach kommt
Der Median liegt bei 222 s, der Mittelwert bei 304 s. Ein Training auf der Rohskala würde seine Kapazität auf wenige Extremfahrten verwenden.
Nach der Log-Transformation ist die Verteilung annähernd symmetrisch — das ist der Grund, warum das transformierte Ziel später den grössten einzelnen Sprung bringt.
Bewertet gegen Werte, die während der Modellierung nicht vorlagen
Für eine Vorwarnung reicht es. Für eine Sekundenangabe nicht.
Ein Fehler von gut zwei Minuten auf einen Median von knapp vier Minuten trägt eine Genauigkeit vor, die das Modell nicht hat. Die Konsequenz steht in den Empfehlungen — und sie betrifft die Anzeige, nicht das Modell.
Auswählen und berichten sind zwei verschiedene Jobs
Der erste Durchgang hat den Sieger auf demselben Testset gekürt, auf dem er ihn berichtet hat — nachgemessen kostete das 0,62 s beim zufälligen und 0,00 s beim temporalen Split.
| Split | Bester auf Test | Auf Val gewählt | Optimismus | Rang des Val-Siegers |
|---|---|---|---|---|
| zufällig | 145,23 s | 145,85 s | 0,62 s | 2 von 280 |
| temporal | 139,63 s | 139,63 s | 0,00 s | 1 von 280 |
Von rund 53 Sekunden Gewinn über der Baseline liefert die bereits vorhandene Fahrzeitschätzung allein etwa 28.
Sie wegzulassen kostet aber nur rund 8 Sekunden — Schätzung und konstruierte Features sind grösstenteils redundant. Das Modell verpackt keine fremde Schätzung neu, aber die eigene Wertschöpfung ist kleiner, als die Gesamtzahl vermuten lässt.
Der mittlere vorzeichenbehaftete Fehler liegt bei rund +60 Sekunden und liest sich wie eine systematische Unterschätzung.
Er ist überwiegend die Schiefe der Zielverteilung: MAE wird vom bedingten Median minimiert, und bei rechtsschiefem Ziel liegt der Mittelwert zwangsläufig darüber. Die tatsächliche Drift des Modells beträgt rund 14 Sekunden.
Vier Befunde des ersten Durchgangs überlebten die Prüfung nicht
Rangfolgen ohne Streuungsmass und Verzerrungen ohne Verteilungskorrektur erzeugen Befunde, die keine sind.
Kein einziger dieser Fehler war ein Rechenfehler. Alle vier entstanden dadurch, dass eine Zahl für sich genommen betrachtet wurde — ohne die Frage, wie stabil sie ist und woher sie kommt. Was übrig blieb, ist weniger, aber es hält.
MAE wird vom Median minimiert — die Hälfte aller Schätzungen liegt damit zu niedrig. Für eine Zusage an einen wartenden Fahrgast ist das die falsche Zielfunktion.
Ein auf das 80. Perzentil trainiertes Modell hat die deutlich schlechtere Kennzahl und hält seine Zusage in vier von fünf Fahrten statt in gut der Hälfte.
| Anforderung der Aufgabe | Erster Durchgang | Jetzt |
|---|---|---|
| Daten einlesen und bereinigen | erfüllt | erfüllt |
| Feature Engineering | erfüllt | erfüllt, ohne Leakage |
| Modell anpassen | erfüllt | erfüllt |
| Schritte zu einer Pipeline verbinden | fehlte | predict_wait_sec(csv, model) |
| Vorgeschriebener Split test_size=0.1 | 0.2 verwendet | eingehalten |
| predictions_aim.csv erzeugen | fehlte | 1.635 Vorhersagen |
Drei betreffen das Produkt, eine das Data-Engineering-Team
Stillstandsprognose für Taxifahrten in Quito
Data-Science-Projekt mit 280-Konfigurationen-Sweep | 2016–2017
Die Grenze lag nicht am Modell
Die Aufgabe fragte, ob 164 Sekunden zu unterbieten sind. Die Antwort ist ja, um 15 Prozent. Der lehrreichere Teil war die Feststellung, dass 280 Modellvarianten auf demselben Boden landen — und dass der nächste Fortschritt aus Daten kommen muss, die es noch nicht gibt.