Stillstandsprognose für Taxifahrten in Quito
Data-Science-Projekt mit 280-Konfigurationen-Sweep | 2016–2017
Eine einfache lineare Regression als Referenz
„Kannst du diesen Wert unterbieten?“ — die Aufgabenstellung formuliert das Ziel selbst.
| Eigenschaft | Wert |
|---|---|
| Fahrten | 15.657 |
| Spalten | 11, davon 1 Zielgrösse |
| Zeitraum | Juni 2016 – August 2017 |
| Gebiet | Quito, Stadt und Randbezirke inklusive Flughafen |
| Nach Bereinigung | 98,8 % der Zeilen erhalten |
| Quelle | Kaggle, Mario Navas, CC BY-SA 4.0 |
Der Grund für alles, was danach kommt
Der Median liegt bei 222 s, der Mittelwert bei 304 s. Ein Training auf der Rohskala würde seine Kapazität auf wenige Extremfahrten verwenden.
Nach der Log-Transformation ist die Verteilung annähernd symmetrisch — das ist der Grund, warum das transformierte Ziel später den grössten einzelnen Sprung bringt.
Auswählen und berichten sind zwei verschiedene Jobs
Der erste Durchgang hat den Sieger auf demselben Testset gekürt, auf dem er ihn berichtet hat — nachgemessen kostete das 0,62 s beim zufälligen und 0,00 s beim temporalen Split.
| Split | Bester auf Test | Auf Val gewählt | Optimismus | Rang des Val-Siegers |
|---|---|---|---|---|
| zufällig | 145,23 s | 145,85 s | 0,62 s | 2 von 280 |
| temporal | 139,63 s | 139,63 s | 0,00 s | 1 von 280 |
Ein temporaler Split ist der bessere Test für den Einsatz — er verlangt, dass das Modell in eine ungesehene Periode überträgt.
Hier liefert er die bessere Zahl, weil sein Testabschnitt keine einzige Regenzeit-Fahrt enthält. Bei 14 Monaten Daten fällt der letzte Zeitabschnitt zwangsläufig in eine Jahreszeit. Eine Zahl, die sich verbessert, wenn die Methodik strenger wird, misst das Fenster, nicht das Modell.
Von rund 53 Sekunden Gewinn über der Baseline liefert die bereits vorhandene Fahrzeitschätzung allein etwa 28.
Sie wegzulassen kostet aber nur rund 8 Sekunden — Schätzung und konstruierte Features sind grösstenteils redundant. Das Modell verpackt keine fremde Schätzung neu, aber die eigene Wertschöpfung ist kleiner, als die Gesamtzahl vermuten lässt.
Der mittlere vorzeichenbehaftete Fehler liegt bei rund +60 Sekunden und liest sich wie eine systematische Unterschätzung.
Er ist überwiegend die Schiefe der Zielverteilung: MAE wird vom bedingten Median minimiert, und bei rechtsschiefem Ziel liegt der Mittelwert zwangsläufig darüber. Die tatsächliche Drift des Modells beträgt rund 14 Sekunden.
Bewertet gegen Werte, die während der Modellierung nicht vorlagen
MAE wird vom Median minimiert — die Hälfte aller Schätzungen liegt damit zu niedrig. Für eine Zusage an einen wartenden Fahrgast ist das die falsche Zielfunktion.
Ein auf das 80. Perzentil trainiertes Modell hat die deutlich schlechtere Kennzahl und hält seine Zusage in vier von fünf Fahrten statt in gut der Hälfte.
Drei betreffen das Produkt, eine das Data-Engineering-Team
Stillstandsprognose für Taxifahrten in Quito
Data-Science-Projekt mit 280-Konfigurationen-Sweep | 2016–2017
Die Grenze lag nicht am Modell
Die Aufgabe fragte, ob 164 Sekunden zu unterbieten sind. Die Antwort ist ja, um 15 Prozent. Der lehrreichere Teil war die Feststellung, dass 280 Modellvarianten auf demselben Boden landen — und dass der nächste Fortschritt aus Daten kommen muss, die es noch nicht gibt.