Lektion 1 von 9
Bevor du rechnest: Daten und Skalenniveaus
Du liest einen Datensatz wie eine Fachperson: Merkmale und Skalenniveaus bestimmen, Grundgesamtheit und Stichprobe unterscheiden und einen Datensatz-Steckbrief erstellen.
Worum es geht
Elias ist im ersten Lehrjahr bei der Kurierdienst Rapido Bern GmbH. Seit Wochen hört die Disposition Klagen über verspätete Lieferungen, aber niemand weiss, wie schlimm es wirklich ist. Also bekommt Elias den Tracking-Export vom März: 3'200 Lieferungen, eine Zeile pro Sendung, und den Auftrag "Mach mal eine Auswertung".
Die Versuchung ist gross, sofort Durchschnitte auszurechnen. Genau da passieren die teuersten Fehler: Wer den Mittelwert der Postleitzahlen bildet, eine Sterne-Bewertung auf drei Kommastellen genau berichtet oder fehlende Werte als Null zählt, liefert Zahlen, die korrekt aussehen und trotzdem Unsinn sind. Deshalb beginnt jede Auswertung mit einer Frage, die nichts mit Formeln zu tun hat: Was steht eigentlich in diesen Daten, und welche Rechnungen sind damit erlaubt?
In dieser Lektion lernst du, einen Datensatz zu lesen wie eine Fachperson: Merkmale erkennen, Skalenniveaus bestimmen, Grundgesamtheit und Stichprobe unterscheiden und mit Excel, SQL oder Python einen ersten Steckbrief erstellen. Das ist das Fundament für alle weiteren Lektionen.
Merkmale, Ausprägungen und Merkmalsträger
So sieht ein Ausschnitt aus Elias' Export aus:
| Sendung | Datum | Zone | PLZ | Fahrzeug | Pakete | Distanz_km | Dauer_min | Bewertung | Zweitzustellung |
|---|---|---|---|---|---|---|---|---|---|
| R-00417 | 02.03.2026 | Altstadt | 3011 | Velo | 2 | 3.4 | 27 | nein | |
| R-00418 | 02.03.2026 | Ost | 3006 | Lieferwagen | 12 | 9.8 | 74 | 2 | nein |
| R-00419 | 03.03.2026 | Nord | 3014 | E-Cargobike | 4 | 5.2 | 41 | 4 | nein |
| R-01022 | 16.03.2026 | Altstadt | 3011 | Velo | 1 | 1.7 | 540 | 1 | ja |
Drei Begriffe helfen dir, über solche Tabellen präzise zu sprechen:
- Der Merkmalsträger ist das Objekt, über das eine Zeile Auskunft gibt. Hier ist das eine Lieferung, in einer Umfrage wäre es eine befragte Person.
- Ein Merkmal ist eine Eigenschaft, die du an jedem Merkmalsträger beobachtest. Jede Spalte ist ein Merkmal: Zone, Fahrzeug, Dauer.
- Eine Ausprägung ist der konkrete Wert in einer Zelle: "Altstadt", "Velo", 27.
Klingt banal, verhindert aber Missverständnisse: "Wie viele Velos hatten wir?" kann die Anzahl Fahrzeuge oder die Anzahl Velo-Lieferungen meinen. Kläre immer zuerst, was eine Zeile ist.
Skalenniveaus: was du mit einem Merkmal rechnen darfst
Nicht jede Spalte, in der Zahlen stehen, ist auch eine Zahl im mathematischen Sinn. Die PLZ 3011 ist nicht "kleiner" als 3014 in einem sinnvollen Sinn, und der Mittelwert 3012.4 bezeichnet keinen Ort. Das Skalenniveau sagt dir, welche Vergleiche und Rechnungen bei einem Merkmal Sinn ergeben.
Nominal: Die Ausprägungen sind nur Namen. Du kannst sagen "gleich" oder "verschieden", aber nicht ordnen. Beispiele: Zone, Fahrzeug, PLZ, Sendungsnummer, Ticketkategorie.
Ordinal: Die Ausprägungen haben eine Reihenfolge, aber die Abstände sind nicht gleich gross oder nicht bekannt. Beispiele: Bewertung mit 1 bis 5 Sternen, Priorität Standard, Express, Blitz, Zufriedenheit von "sehr unzufrieden" bis "sehr zufrieden". Ob der Schritt von 1 zu 2 Sternen gleich gross ist wie der von 4 zu 5, weiss niemand.
Metrisch (kardinal): Die Abstände sind gleich gross und bedeutungsvoll. Hier unterscheidest du noch zwei Fälle:
- Intervallskala: kein natürlicher Nullpunkt. Datum, Uhrzeit, Temperatur in °C. Differenzen sind sinnvoll (die Abholung war 40 Minuten später), Verhältnisse nicht (20 °C ist nicht "doppelt so warm" wie 10 °C).
- Verhältnisskala: echter Nullpunkt. Dauer, Distanz, Anzahl Pakete, Preis. Hier darfst du sagen: "Diese Lieferung dauerte doppelt so lang."
Metrische Merkmale können zudem diskret (zählbar: 3 Pakete) oder stetig (messbar, beliebig fein: 3.47 km) sein. Das wird in Lektion 5 beim Bilden von Klassen wichtig.
Jedes höhere Niveau erlaubt alles, was die tieferen erlauben, und noch etwas mehr:
| Skalenniveau | Was du vergleichen kannst | Lagemass | Streuung | Beispiel Rapido |
|---|---|---|---|---|
| nominal | gleich oder verschieden | Modus | Häufigkeitsverteilung | Zone, Fahrzeug, PLZ |
| ordinal | zusätzlich grösser oder kleiner | zusätzlich Median | Quartile, Spannweite der Ränge | Bewertung 1 bis 5 Sterne |
| intervall | zusätzlich Differenzen | zusätzlich Mittelwert | Standardabweichung | Datum, Abholzeit |
| verhältnis | zusätzlich Verhältnisse | alle | alle | Dauer, Distanz, Pakete |
Ordne jedem Merkmal aus dem Rapido-Export sein Skalenniveau zu.
Eine Kollegin berechnet in Elias' Auswertung =MITTELWERT(tblLieferungen[PLZ]) und erhält 3012.4. Was ist die beste Reaktion?
Grundgesamtheit und Stichprobe
Bevor du eine Zahl berichtest, fragst du: Über wen oder was will ich eine Aussage machen?
- Die Grundgesamtheit ist die Menge aller Merkmalsträger, über die du etwas sagen willst. Zum Beispiel alle Lieferungen von Rapido im März.
- Eine Stichprobe ist ein Teil davon, den du tatsächlich untersuchst.
- Untersuchst du die ganze Grundgesamtheit, spricht man von einer Vollerhebung.
Elias' Export enthält alle 3'200 Lieferungen vom März. Für die Frage "Wie pünktlich war Rapido im März?" ist das eine Vollerhebung. Will die Geschäftsleitung aber wissen "Wie pünktlich sind wir übers ganze Jahr?", ist der März nur eine Stichprobe, und zwar keine zufällige: Im März gibt es weder Weihnachtsverkehr noch Sommerferien.
Noch heikler ist die Spalte Bewertung. Nur 576 von 3'200 Empfängerinnen und Empfängern haben Sterne vergeben, also 18 %. Wer bewertet freiwillig? Häufig die sehr Zufriedenen und vor allem die Verärgerten. Diese Selbstselektion verzerrt das Bild, egal wie sauber du danach rechnest.
In Formeln unterscheidet man deshalb Kennzahlen der Grundgesamtheit (griechische Buchstaben, etwa μ für den Mittelwert) und der Stichprobe (lateinische, etwa x̄). In Lektion 3 siehst du, warum Excel deshalb zwei Funktionen für die Standardabweichung hat.
Nur 576 von 3'200 Empfängerinnen und Empfängern haben im März eine Sternebewertung abgegeben. Die Geschäftsleitung will in den Jahresbericht schreiben: 'Unsere Kundschaft gibt uns im Median 4 Sterne.' Was ist das Hauptproblem dieser Aussage?
Drei Werkzeuge, dieselbe Rechnung
Im Betrieb wertest du meistens mit Excel aus, Datenbanken fragst du mit SQL ab, und für wiederkehrende Auswertungen ist ein Python-Skript praktisch. Die Statistik dahinter ist überall dieselbe. Darum siehst du in diesem Kurs alle drei Varianten und übst SQL und Python in den Code-Laboren direkt im Browser.
| Frage | Excel | SQL | Python |
|---|---|---|---|
| Wie viele Zeilen? | =ZEILEN(tblLieferungen) | COUNT(*) | len(daten) |
| Wie viele ausgefüllte Werte? | =ANZAHL(tblLieferungen[Bewertung]) | COUNT(bewertung) | len([w for w in werte if w is not None]) |
| Wie viele verschiedene Werte? | =ANZAHL2(EINDEUTIG(tblLieferungen[Zone])) | COUNT(DISTINCT zone) | len(set(zonen)) |
| Kleinster und grösster Wert | =MIN(...), =MAX(...) | MIN(...), MAX(...) | min(...), max(...) |
Beachte die zweite Zeile: COUNT(bewertung) zählt nur Zeilen, in denen eine Bewertung steht, COUNT(*) zählt alle. Diesen Unterschied nutzt du, um fehlende Werte zu finden.
Schritt für Schritt: der Datensatz-Steckbrief
Elias erstellt, bevor er irgendetwas auswertet, einen Steckbrief des Exports.
Schritt 1: Original sichern. Er legt die Datei rapido_tracking_2026-03.csv unverändert in einen Ordner Original. Gerechnet wird nur mit einer Kopie.
Schritt 2: Rohdaten als Tabelle. In Excel importiert er die Datei auf ein Blatt Rohdaten, formatiert sie mit Strg+T als Tabelle und nennt sie tblLieferungen. Kontrolle: =ZEILEN(tblLieferungen) ergibt 3'200, genau die Zahl aus der Mail der IT.
Schritt 3: Skalenniveau pro Spalte. Er notiert für jede Spalte Skala und sinnvolle Kennzahlen:
| Spalte | Skala | sinnvolle Kennzahlen |
|---|---|---|
| Zone, Fahrzeug, PLZ | nominal | Häufigkeiten, Anteile, Modus |
| Bewertung | ordinal | Häufigkeiten, Median, Quartile |
| Datum | intervall | Zeitraum, Anzahl pro Tag |
| Pakete, Distanz_km, Dauer_min | verhältnis | Mittelwert, Median, Standardabweichung, Quartile |
| Zweitzustellung | nominal (ja/nein) | Anteil in Prozent |
Schritt 4: Kontrollzahlen. =MIN(tblLieferungen[Datum]) und =MAX(...) ergeben 02.03.2026 und 31.03.2026. Der 1. März war ein Sonntag, das passt. =ANZAHL2(EINDEUTIG(tblLieferungen[Zone])) liefert aber 6, obwohl Rapido nur fünf Zonen kennt. Ein Filter zeigt: 37 Zeilen enthalten "Bern Ost" statt "Ost". Elias ändert die Rohdaten nicht, sondern ergänzt eine berechnete Spalte Zone_bereinigt mit =WENN([@Zone]="Bern Ost";"Ost";[@Zone]).
Schritt 5: Fehlende Werte. =ANZAHL(tblLieferungen[Bewertung]) ergibt 576. Also fehlt bei 2'624 Lieferungen (82 %) die Bewertung. Das kommt in den Steckbrief, damit niemand später die Sterne als Meinung "aller Kunden" verkauft.
Schritt 6: Plausibilität. Die Dauer reicht von 4 bis 1'150 Minuten. 4 Minuten sind möglich (Ziel im selben Gebäude), fast 20 Stunden deuten auf eine Zweitzustellung am Folgetag. Mehr dazu in Lektion 2 und 4.
Das Ergebnis ist ein Steckbrief von wenigen Zeilen: Quelle, Zeitraum, Anzahl Zeilen, Skalen, fehlende Werte, Auffälligkeiten. Er kostet zwanzig Minuten und erspart dir Stunden an falschen Auswertungen. Probier es jetzt selbst mit einem Auszug der Rapido-Daten:
Labor: der erste Blick auf die Daten
Die Tabelle lieferung enthält einen Auszug aus Elias' Märzexport. Schreibe eine Abfrage, die eine einzige Zeile mit diesen fünf Spalten liefert (in dieser Reihenfolge):
| Spalte | Inhalt |
|---|---|
anzahl | Anzahl aller Lieferungen |
mit_bewertung | Anzahl Lieferungen, bei denen eine Bewertung vorhanden ist |
zonen | Anzahl verschiedener Werte in der Spalte zone |
von | frühestes Datum |
bis | spätestes Datum |
Schau dir danach das Ergebnis an. Rapido kennt nur fünf Zonen. Was fällt dir auf? Mit SELECT DISTINCT zone FROM lieferung; findest du die Ursache.
Tabellen und Testdaten ansehen
PRAGMA foreign_keys = ON;
CREATE TABLE lieferung (
id INTEGER PRIMARY KEY,
datum TEXT NOT NULL, -- ISO-Format JJJJ-MM-TT
zone TEXT NOT NULL,
fahrzeug TEXT NOT NULL,
pakete INTEGER NOT NULL,
distanz_km REAL NOT NULL,
dauer_min INTEGER NOT NULL, -- Minuten von Abholung bis Zustellung
bewertung INTEGER, -- 1 bis 5 Sterne, freiwillig (sonst NULL)
zweitzustellung INTEGER NOT NULL -- 1 = ja, 0 = nein
);
INSERT INTO lieferung VALUES
(1, '2026-03-02', 'Altstadt', 'Velo', 1, 2.1, 18, 5, 0),
(2, '2026-03-02', 'Altstadt', 'Velo', 2, 3.4, 27, NULL, 0),
(3, '2026-03-03', 'Nord', 'E-Cargobike', 4, 5.2, 41, 4, 0),
(4, '2026-03-03', 'Ost', 'Lieferwagen', 12, 9.8, 74, 2, 0),
(5, '2026-03-04', 'Süd', 'Velo', 1, 2.8, 24, NULL, 0),
(6, '2026-03-05', 'Altstadt', 'Velo', 3, 1.9, 22, 5, 0),
(7, '2026-03-05', 'Ost', 'Lieferwagen', 15, 11.2, 88, NULL, 0),
(8, '2026-03-06', 'West', 'E-Cargobike', 5, 4.6, 39, 4, 0),
(9, '2026-03-09', 'Altstadt', 'Velo', 2, 2.5, 31, NULL, 0),
(10, '2026-03-09', 'Nord', 'Velo', 1, 3.9, 35, 3, 0),
(11, '2026-03-10', 'Ost', 'Lieferwagen', 9, 8.4, 56, NULL, 0),
(12, '2026-03-11', 'Süd', 'Lieferwagen', 8, 7.1, 52, 4, 0),
(13, '2026-03-12', 'Altstadt', 'E-Cargobike', 6, 3.3, 44, NULL, 0),
(14, '2026-03-12', 'West', 'Velo', 2, 3.1, 29, 5, 0),
(15, '2026-03-13', 'Ost', 'Velo', 3, 6.0, 48, 2, 0),
(16, '2026-03-16', 'Altstadt', 'Velo', 1, 1.7, 540, 1, 1),
(17, '2026-03-17', 'Nord', 'Lieferwagen', 10, 8.9, 58, NULL, 0),
(18, '2026-03-18', 'Altstadt', 'Velo', 2, 2.2, 26, 4, 0),
(19, '2026-03-19', 'Bern Ost', 'E-Cargobike', 7, 6.8, 71, NULL, 0),
(20, '2026-03-20', 'Süd', 'Velo', 1, 2.6, 610, NULL, 1);Typische Fehler
- Kennnummern mitteln. PLZ, Kundennummern oder Artikelnummern sind nominal, auch wenn Excel sie als Zahl speichert. Korrektur: Häufigkeiten statt Mittelwert, die Spalte am besten als Text formatieren.
- Ordinale Skalen als exakte Zahl verkaufen. "Die Zufriedenheit liegt bei 3.47 von 5" täuscht eine Genauigkeit vor, die die Skala nicht hat. Korrektur: Median und Verteilung angeben, zum Beispiel "Median 4 Sterne, 22 % vergeben 1 oder 2 Sterne".
- Fehlende Werte als Null behandeln. Eine leere Bewertung ist keine Bewertung mit 0 Sternen. Wer Leerzellen mit 0 füllt, drückt den Durchschnitt künstlich. Korrektur: leer lassen, Anzahl fehlender Werte ausweisen.
- Rohdaten überschreiben. Wer "Bern Ost" direkt im Export ersetzt, kann später nicht mehr nachweisen, was geliefert wurde. Korrektur: Original sichern, bereinigen in einer zusätzlichen Spalte.
- Vollerhebung mit Verallgemeinerung verwechseln. Die Märzdaten beschreiben den März vollständig, aber nicht automatisch das ganze Jahr. Korrektur: im Bericht klar sagen, worauf sich die Zahl bezieht.
Zusammenfassung
- Kläre zuerst, was eine Zeile ist (Merkmalsträger), welche Spalten es gibt (Merkmale) und welche Werte vorkommen (Ausprägungen).
- Nominal erlaubt Häufigkeiten und Modus, ordinal zusätzlich Median und Quartile, metrisch zusätzlich Mittelwert und Standardabweichung.
- Zahlen in einer Spalte sind nicht automatisch metrisch: PLZ und Kennnummern sind nominal.
- Unterscheide Grundgesamtheit, Stichprobe und Vollerhebung, und achte auf Selbstselektion bei freiwilligen Angaben.
- Ein Datensatz-Steckbrief mit Zeilenzahl, Zeitraum, Skalen, fehlenden Werten und Auffälligkeiten gehört vor jede Auswertung.
- Rohdaten bleiben unverändert, bereinigt wird in Kopien oder zusätzlichen Spalten.
Mit deiner eigenen KI vertiefen
Kopiere einen Prompt in Claude, ChatGPT oder Claude Code. Er macht die KI zur Lernbegleitung statt zum Lösungsautomaten.
Sokratischer Skalen-Coach Chat-KI
Du übst an deinen eigenen Daten, Skalenniveaus zu bestimmen und passende Kennzahlen zu wählen. Die KI fragt nach, statt dir die Lösung zu geben.