378

Daten & Datenbanken · Datenqualität

Daten bereinigen und deren Plausibilität sowie Qualität überprüfen

Du lernst, die Qualität eines Datensatzes zu messen, Fehler und Dubletten systematisch zu finden und sauber zu bereinigen, ohne Daten zu verfälschen.

Fortgeschritten Fortgeschritten ca. 20 Std. SelbststudiumDigitales Business: 3. Lehrjahr · Berufsfachschule
#Datenqualität#Datenbereinigung#Dubletten#Plausibilität#Vollständigkeit#Data Profiling#Power Query#pandas#Validierung

Überblick

Worum geht es?

Echte Betriebsdaten sind nie sauber: Felder fehlen, Kunden existieren doppelt, ein Geburtsjahr steht auf 1900, ein Austritt liegt vor dem Eintritt. Du beurteilst Datenqualität anhand klarer Dimensionen und machst sie mit Kennzahlen messbar. Mit Profiling, Plausibilitätsregeln und Dublettenprüfung findest du Probleme und bereinigst sie nachvollziehbar in Power Query oder pandas. Zum Schluss schlägst du Massnahmen vor, damit die Fehler gar nicht mehr entstehen.

Wofür brauchst du das?

Jede Auswertung ist nur so gut wie die Daten dahinter. Wenn 4 % der Kunden doppelt im CRM stehen, erhalten sie zwei Mailings und der Umsatz pro Kunde ist falsch. Datenqualität ist eine Kernaufgabe im digitalen Business und Voraussetzung für 379 (Interpretieren), 235 (Visualisieren) und 393 (Machine Learning).

Das solltest du schon können

  • Daten aus mehreren Quellen in Excel oder Power Query zusammenführen (Modul 376)
  • Bedingungen mit UND, ODER, NICHT formulieren und fehlende Werte (NULL) berücksichtigen (Modul 377)
  • Grundlagen von Tabellen, Schlüsseln und Datentypen in Datenbanken (Modul 164)
  • Grundsätze des revDSG, insbesondere Richtigkeit und Datenminimierung (Modul 231)

Typische Tools & Technologien

Excel mit Power Query (Spaltenprofil, Spaltenqualität)Python mit pandasJupyter NotebookPower BI DesktopSQL (GROUP BY, HAVING)UID-Register / Post-PLZ-Verzeichnis als Referenzdaten

Lernziele

Was musst du können?

Das sind die Fähigkeiten, die am Ende des Moduls sitzen sollten. Jedes Ziel mit einem Beispiel aus dem Lehrbetrieb.

  1. 1

    Datenqualität anhand klarer Dimensionen beurteilen und mit Kennzahlen messen

    Kompetenz A

    Statt 'die Daten sind schlecht' sagst du präzise, was nicht stimmt: Vollständigkeit, Korrektheit, Konsistenz, Eindeutigkeit, Aktualität oder Gültigkeit. Für jede Dimension definierst du eine messbare Kennzahl und einen Zielwert.

    Situation

    Ein Treuhandbüro in Luzern will einen Newsletter an seine 4'800 Kundinnen und Kunden schicken. Die Geschäftsleitung fragt, ob die CRM-Daten dafür gut genug sind.

    Deine Aufgabe

    Erstelle einen kurzen Qualitätsbericht mit Kennzahlen.

    Gutes Ergebnis

    Vollständigkeit E-Mail: 89 % (528 fehlen). Eindeutigkeit: 168 vermutete Dubletten (3.5 %). Gültigkeit PLZ: 96 Einträge ausserhalb 1000 bis 9658 oder nicht vierstellig. Aktualität: 610 Kontakte seit über 3 Jahren nicht mehr bearbeitet. Empfehlung: Dubletten vor dem Versand bereinigen, sonst gehen Mails doppelt raus.

    VollständigkeitKorrektheitKonsistenzEindeutigkeitAktualitätGültigkeitQualitätskennzahl
  2. 2

    Einen unbekannten Datensatz mit Profiling systematisch untersuchen

    Kompetenz B

    Bevor du etwas korrigierst, verschaffst du dir einen Überblick: Datentypen, Anzahl leerer Werte, eindeutige Werte, Minimum, Maximum, häufigste Ausprägungen. In Power Query nutzt du Spaltenprofil und Spaltenqualität, in pandas info(), describe(), isna().sum() und value_counts().

    Situation

    Du bekommst einen Export der Mitarbeiterstammdaten eines Spitals mit 2'350 Zeilen und 28 Spalten für eine Auswertung zur Altersstruktur.

    Deine Aufgabe

    Erstelle ein Profil und notiere alle Auffälligkeiten.

    Gutes Ergebnis

    df.describe() zeigt Geburtsjahr Minimum 1900 (14 Fälle, offensichtlich Platzhalter) und Pensum Maximum 180 %. value_counts() auf 'Abteilung' zeigt 'Chirurgie', 'chirurgie' und 'Chir.'. Spalte 'Austritt' ist als Text gespeichert. Alles in einer Liste mit Anzahl und Beispiel festgehalten.

    Data ProfilingSpaltenprofildescribe / infovalue_countsPlatzhalterwerte
  3. 3

    Plausibilitätsregeln definieren und automatisiert prüfen

    Kompetenz C

    Du legst Regeln fest, die gültige Daten erfüllen müssen: Wertebereiche, Formate, Pflichtfelder und Querprüfungen zwischen Feldern. Die Regeln setzt du als Formeln, Power-Query-Spalten oder pandas-Bedingungen um und erzeugst eine Liste aller Verstösse.

    Situation

    Die Lohnbuchhaltung eines Baugeschäfts lädt jeden Monat Stammdaten ins Lohnprogramm. Letzten Monat wurde ein Lohn auf eine ungültige IBAN überwiesen und kam zurück.

    Deine Aufgabe

    Definiere fünf Plausibilitätsregeln für die Lohnstammdaten.

    Gutes Ergebnis

    1. IBAN beginnt mit CH, hat 21 Zeichen, Prüfziffer gültig. 2. AHV-Nummer im Format 756.XXXX.XXXX.XX. 3. Austrittsdatum leer oder nach Eintrittsdatum. 4. Pensum zwischen 10 und 100 %. 5. Monatslohn bei 100 % zwischen CHF 3'500 und 20'000, sonst manuelle Kontrolle. Ergebnis: 7 Verstösse, die vor dem Import geklärt werden.

    WertebereichFormatprüfungPflichtfeldQuerprüfungPrüfzifferAusnahmeliste
  4. 4

    Dubletten erkennen und kontrolliert zusammenführen

    Kompetenz D

    Exakte Dubletten findest du schnell, die meisten echten Dubletten unterscheiden sich aber leicht in der Schreibweise. Du normalisierst Werte (Kleinbuchstaben, Umlaute, Rechtsform, Leerzeichen), nutzt eindeutige Merkmale wie die UID und legst fest, welcher Datensatz bei einer Zusammenführung gewinnt.

    Situation

    Im CRM eines Elektroinstallateurs stehen 'Müller Haustechnik AG', 'Mueller Haustechnik AG' und 'Müller Haustechnik A.G.', alle in Sursee, mit unterschiedlichen Telefonnummern.

    Deine Aufgabe

    Finde solche Dubletten systematisch und schlage ein Vorgehen zur Bereinigung vor.

    Gutes Ergebnis

    Hilfsspalte mit normalisiertem Namen (ue zu ü, Rechtsform vereinheitlicht, Satzzeichen entfernt) plus PLZ. Gruppieren ergibt 41 Gruppen mit mehr als einem Eintrag. Wo vorhanden, Abgleich über die UID (CHE-Nummer). Regel: Der zuletzt bearbeitete Datensatz bleibt führend, Telefonnummern werden ergänzt, nicht überschrieben. Zusammenführung erst nach Freigabe durch den Verkauf.

    exakte Dubletteunscharfe DubletteNormalisierungMatch-SchlüsselGolden RecordUID
  5. 5

    Daten nachvollziehbar und reproduzierbar bereinigen

    Kompetenz E

    Du veränderst nie die Rohdaten, sondern arbeitest mit gespeicherten Schritten in Power Query oder einem Jupyter Notebook. Fehlende Werte behandelst du bewusst: löschen, kennzeichnen oder begründet ergänzen. Jede Bereinigung hältst du in einem Protokoll fest, damit jemand anderes sie prüfen und wiederholen kann.

    Situation

    Für eine Auswertung der Kundenzufriedenheit fehlen bei 9 % der Antworten die Angaben zur Filiale, bei 2 % ist das Alter unrealistisch (unter 14 oder über 110).

    Deine Aufgabe

    Bereinige die Daten so, dass die Entscheide transparent sind.

    Gutes Ergebnis

    Jupyter Notebook mit Schritten: Rohdaten laden, unrealistisches Alter auf NaN setzen (nicht löschen, Antwort bleibt nutzbar), fehlende Filiale als 'unbekannt' kennzeichnen. Am Anfang des Notebooks eine Tabelle: Regel, betroffene Zeilen, Entscheid, Begründung. Rohdatei schreibgeschützt abgelegt.

    Rohdaten unverändert lassenBereinigungsprotokollfehlende Werte (NaN)ImputationReproduzierbarkeit
  6. 6

    Ursachen von Qualitätsproblemen an der Quelle beheben

    Kompetenz F

    Bereinigen bekämpft Symptome. Du findest heraus, wo die Fehler entstehen (Eingabemaske, Import, Prozess, fehlende Zuständigkeit) und schlägst Massnahmen vor, z.B. Pflichtfelder, Auswahllisten, Validierung bei der Eingabe oder eine verantwortliche Person (Data Owner).

    Situation

    Im Offertformular auf der Website eines Gartenbauers wird der Kanton als Freitext erfasst. In den Daten stehen über 60 Varianten wie 'ZH', 'Zürich', 'Zuerich', 'Kt. Zürich'.

    Deine Aufgabe

    Schlage Massnahmen vor, damit das Problem nicht wieder entsteht.

    Gutes Ergebnis

    Dropdown mit den 26 Kantonskürzeln statt Freitext. Kanton zusätzlich automatisch aus der PLZ ableiten und vorschlagen. Altbestand einmalig per Zuordnungstabelle in Power Query bereinigen. Zuständigkeit für die Formularfelder bei der Marketingleiterin festgelegt.

    UrsachenanalyseEingabevalidierungAuswahllisteReferenzdatenData OwnerProzessverbesserung

Selbsteinschätzung

Wo stehst du?

Die Kompetenzmatrix zerlegt das Modul in Themenstränge und drei Stufen. Für den Kompetenznachweis solltest du überall mindestens Stufe 2 erreichen. Dein Stand bleibt in diesem Browser gespeichert und färbt Lernweg und Übungen ein.

Tippe auf eine Aussage, um deinen Stand zu setzen: offen unsicher sitzt
A

Datenqualität messen

Ziel 1

Grundlagen

Fortgeschritten

Erweitert

B

Daten profilen

Ziel 2

Grundlagen

Fortgeschritten

Erweitert

C

Plausibilitätsregeln

Ziel 3

Grundlagen

Fortgeschritten

Erweitert

D

Dubletten bereinigen

Ziel 4

Grundlagen

Fortgeschritten

Erweitert

E

Nachvollziehbar bereinigen

Ziel 5

Grundlagen

Fortgeschritten

Erweitert

F

Ursachen an der Quelle beheben

Ziel 6

Grundlagen

Fortgeschritten

Erweitert

Praxisfall

Ersatzteile für den neuen Webshop der Thurgauer Landtechnik AG

Ladina ist im 3. Lehrjahr bei der Thurgauer Landtechnik AG in Weinfelden, einem Händler für Landmaschinen und Ersatzteile mit 140 Mitarbeitenden. In drei Monaten sollen 48'000 Ersatzteile aus dem ERP in einen neuen B2B-Webshop übernommen werden. Die Projektleiterin beauftragt Ladina, die Artikeldaten vorher zu prüfen und zu bereinigen.

  1. Kapitel 1

    Was der Webshop braucht

    Ladina klärt mit der Projektleiterin, welche Felder der Webshop zwingend braucht: Bezeichnung, Preis, Herstellernummer und Gewicht, weil daraus die Versandkosten berechnet werden. Für jedes Feld legt sie einen Zielwert fest, beim Gewicht zum Beispiel 98 Prozent gefüllt. Die erste Messung ergibt beim Gewicht nur 71 Prozent. Damit ist klar, dass die Migration ohne Bereinigung scheitern würde.

    Ziel 1

  2. Kapitel 2

    6'300 Teile wiegen nichts

    Im Spaltenprofil von Power Query sieht Ladina, dass 6'300 Artikel ein Gewicht von genau 0 haben. Beim Hersteller findet sie dieselbe Firma als "Agrotec", "AGROTEC" und "Agro-Tec". Auffällig sind auch 2'100 Artikel mit Erfassungsdatum 01.01.2000. Mit einer gezielten Abfrage bestätigt sie, dass diese alle aus einem Altdatenimport von 2009 stammen.

    Ziel 2

  3. Kapitel 3

    Regeln mit Ausnahmen

    In einem Jupyter Notebook formuliert Ladina Regeln mit pandas: Verkaufspreis mindestens so hoch wie Einkaufspreis, Gewicht zwischen 1 Gramm und 2 Tonnen, Zolltarifnummer mit acht Ziffern. 412 Artikel verstossen gegen mindestens eine Regel. Bei der Durchsicht entdeckt sie, dass Aktionsartikel bewusst unter dem Einkaufspreis verkauft werden. Sie ergänzt eine Ausnahme für Artikel mit Aktionskennzeichen, statt sie als Fehler zu melden.

    Ziel 3

  4. Kapitel 4

    Ein Teil, drei Nummern

    Nach dem Entfernen von Leerzeichen und Bindestrichen in den Herstellernummern findet Ladina mit GROUP BY und HAVING 1'150 Gruppen, in denen dasselbe Teil unter mehreren Artikelnummern geführt wird. Sie legt fest, dass jeweils der Artikel mit den meisten Verkäufen der letzten 24 Monate bestehen bleibt, Lagerbestände addiert und offene Aufträge umgehängt werden. 90 Gruppen mit Preisunterschieden über 20 Prozent markiert sie zur Prüfung durch das Produktmanagement.

    Ziel 4

  5. Kapitel 5

    Sauber bleiben

    Alle Schritte laufen in einem Notebook, das die Originaldaten nicht verändert und für jeden Schritt die Anzahl betroffener Artikel protokolliert. Das Produktmanagement prüft eine Stichprobe von 50 Artikeln, bevor die Daten übernommen werden. Als Ursachen findet Ladina den Lieferantenimport ohne Gewichtsspalte und das Freitextfeld für den Hersteller. Sie schlägt ein Pflichtfeld Gewicht, eine Auswahlliste für Hersteller und einen monatlichen Qualitätsbericht vor, und drei Monate später liegt der Füllgrad beim Gewicht bei 99 Prozent.

    Ziel 5Ziel 6Ziel 1

Lernweg

Wie lernst du das?

  1. 1

    Was ist gute Datenqualität?

    ca. 2 Std.

    Du lernst die Qualitätsdimensionen kennen und übst, Probleme präzise zu benennen.

    • Zu jeder Dimension zwei Beispiele aus deinem Lehrbetrieb sammeln
    • Für einen CRM-Export fünf Qualitätskennzahlen definieren
    • Einen Zielwert pro Kennzahl festlegen und begründen

    Trainiert Kompetenz A1

    Lernziel1

  2. 2

    Profiling mit Power Query und pandas

    ca. 4 Std.

    Du untersuchst einen fremden Datensatz mit beiden Werkzeugen und vergleichst die Ergebnisse.

    • In Power Query Spaltenprofil, Spaltenqualität und Spaltenverteilung aktivieren und auswerten
    • In Jupyter mit pandas info(), describe(), isna().sum() und value_counts() dasselbe Profil erstellen
    • Eine Auffälligkeitsliste mit Spalte, Problem, Anzahl und Beispiel erstellen

    Trainiert Kompetenz B1B2A2

    Lernziel21

  3. 3

    Plausibilitätsregeln bauen

    ca. 4 Std.

    Du formulierst Regeln und setzt sie als automatische Prüfungen um.

    • Für Personen- und Bestelldaten je fünf Regeln formulieren (Format, Bereich, Querprüfung)
    • Regeln als bedingte Spalten in Power Query oder als pandas-Bedingungen umsetzen
    • Eine Ausnahmeliste mit allen Verstössen pro Regel erzeugen

    Trainiert Kompetenz C1C2

    Lernziel3

  4. 4

    Dubletten finden und zusammenführen

    ca. 4 Std.

    Du übst exakte und unscharfe Dublettensuche und definierst Regeln für die Zusammenführung.

    • Exakte Dubletten mit duplicated() bzw. 'Duplikate entfernen' finden
    • Normalisierte Match-Spalte bauen und unscharfe Dubletten gruppieren
    • Regeln für den Golden Record festlegen: welches Feld gewinnt bei Konflikten?

    Trainiert Kompetenz D1D2

    Lernziel4

  5. 5

    Bereinigen, dokumentieren, Ursachen beheben

    ca. 4 Std.

    Du führst eine komplette Bereinigung durch, dokumentierst sie und leitest Massnahmen an der Quelle ab.

    • Eine Bereinigung in einem Notebook oder in Power Query mit Protokolltabelle umsetzen
    • Qualitätskennzahlen vor und nach der Bereinigung vergleichen
    • Drei Massnahmen formulieren, damit die häufigsten Fehler nicht mehr entstehen

    Trainiert Kompetenz E1E2F1F2A2

    Lernziel561

Üben

Übungen aus der Praxis

Adressliste für ein Mailing prüfen

Einstieg Einstieg

Ein Sportverein mit 650 Mitgliedern will die Einladung zur Generalversammlung per Post verschicken. Die Adressliste wurde über Jahre in Excel gepflegt.

Weist nach A1C1

  1. Vollständigkeit von Strasse, PLZ und Ort messen
  2. PLZ auf Gültigkeit prüfen (vierstellig, Bereich 1000 bis 9658)
  3. Exakte Dubletten über Name und Adresse finden
  4. Kurzbericht mit drei Kennzahlen erstellen
Tipp anzeigen

Eine als Zahl gespeicherte PLZ kann beim Import Nachkommastellen oder Tausendertrennzeichen erhalten (8'570). Prüfe auch die Länge mit LÄNGE().

Lösungsskizze anzeigen

ANZAHL2 vs. ANZAHLLEEREZELLEN pro Spalte für Vollständigkeit. WENN(UND(LÄNGE(PLZ)=4;PLZ>=1000;PLZ<=9658);"ok";"prüfen"). Hilfsspalte Name&Strasse&PLZ und ZÄHLENWENN > 1 für Dubletten. Bericht: z.B. 97 % vollständig, 12 ungültige PLZ, 9 Dubletten.

Personaldaten in pandas bereinigen

Fortgeschritten Fortgeschritten

Für eine Altersstruktur-Analyse erhältst du einen Export mit 2'350 Mitarbeitenden eines Spitals. Es gibt Platzhalter-Geburtsjahre, uneinheitliche Abteilungsnamen und Austrittsdaten vor dem Eintritt.

Weist nach B2C2E2

  1. Profil mit info(), describe(), value_counts() erstellen
  2. Plausibilitätsregeln für Geburtsjahr, Pensum und Austritt umsetzen
  3. Abteilungsnamen mit einer Zuordnungstabelle vereinheitlichen
  4. Bereinigungsprotokoll mit Anzahl betroffener Zeilen pro Regel erstellen
Tipp anzeigen

Ersetze unplausible Werte durch NaN statt die ganze Zeile zu löschen. So bleiben die übrigen Angaben für andere Auswertungen nutzbar.

Lösungsskizze anzeigen

Geburtsjahr < 1940 oder > aktuelles Jahr minus 15 auf NaN. Pensum ausserhalb 0 bis 100 markieren. df['Austritt'] < df['Eintritt'] als Konflikt ausgeben, nicht automatisch korrigieren. Mapping-Dictionary für Abteilungen mit replace(). Protokoll als DataFrame mit Regel, Anzahl, Entscheid.

Qualitätsprojekt CRM

Anspruchsvoll Anspruchsvoll

Ein B2B-Grosshändler für Gastronomiebedarf hat 9'200 Firmenkunden im CRM. Der Verkauf beklagt Doppelbesuche, die Buchhaltung Rechnungen an alte Adressen. Die Geschäftsleitung will einen Massnahmenplan.

Weist nach A3D3E3F3

  1. Qualitätskennzahlen für Eindeutigkeit, Aktualität und Gültigkeit erheben
  2. Unscharfe Dubletten mit Normalisierung und UID-Abgleich finden
  3. Regeln für die Zusammenführung festlegen und mit dem Verkauf abstimmen
  4. Ursachen analysieren und drei Massnahmen an der Quelle vorschlagen
  5. Ergebnisse vor und nach der Bereinigung in einem kurzen Bericht zeigen
Tipp anzeigen

Frag nach, wie neue Kunden heute erfasst werden. Oft entstehen Dubletten, weil Verkauf und Buchhaltung unabhängig voneinander Kunden anlegen.

Lösungsskizze anzeigen

Kennzahlen vorher: z.B. 6 % Dubletten, 14 % ohne UID, 9 % Adressen älter als 5 Jahre. Match-Schlüssel aus normalisiertem Namen plus PLZ, UID als starker Treffer. Golden Record: neuestes Änderungsdatum führt, keine Information geht verloren. Massnahmen: Dublettenprüfung beim Anlegen, UID als Pflichtfeld, eine Stelle für Neuerfassungen. Kennzahlen nachher zeigen den Effekt.

Selbstcheck

Kannst du das beantworten?

Was ist der Unterschied zwischen Vollständigkeit und Korrektheit?

Vollständig heisst, ein Wert ist vorhanden. Korrekt heisst, der Wert stimmt mit der Realität überein. Eine falsche E-Mail-Adresse ist vollständig, aber nicht korrekt.

Nenne ein Beispiel für eine Querprüfung.

Das Austrittsdatum muss leer sein oder nach dem Eintrittsdatum liegen.

Warum findest du 'Müller AG' und 'Mueller AG' nicht mit 'Duplikate entfernen'?

Weil die Funktion nur exakt gleiche Werte erkennt. Du brauchst zuerst eine normalisierte Vergleichsspalte.

Was ist ein Golden Record?

Der eine, bereinigte Datensatz, der nach dem Zusammenführen von Dubletten als gültig gilt.

Warum löschst du unplausible Werte nicht einfach mit der ganzen Zeile?

Weil du damit auch die korrekten Angaben verlierst und die Auswertung verzerren kannst. Besser: Wert als fehlend markieren und begründen.

Welche pandas-Befehle zeigen dir schnell fehlende Werte und Ausreisser?

df.isna().sum() für fehlende Werte, df.describe() für Minimum, Maximum und Quartile.

Was bringt ein Data Owner?

Eine klar verantwortliche Person entscheidet über Regeln und Korrekturen eines Datenbestands. Ohne Zuständigkeit bleiben Fehler liegen.

Prüfung

Stolpersteine & Prüfungstipps

Typische Stolpersteine

  • Direkt in der Originaldatei korrigieren und nicht mehr wissen, was vorher drinstand.
  • Dubletten automatisch zusammenführen, ohne Regeln festzulegen, welcher Wert gewinnt.
  • Ausreisser als Fehler behandeln, obwohl sie echt sind, z.B. eine Grossbestellung oder ein 100-jähriger Kunde.
  • Nur bereinigen, aber die Ursache nicht melden. Nächsten Monat sind die gleichen Fehler wieder da.
  • Bei der Dublettensuche Personendaten in fremde Online-Tools hochladen und damit gegen das revDSG verstossen.

Tipps für den Kompetenznachweis

  • Benenne bei jedem gefundenen Problem die Qualitätsdimension. Das zeigt, dass du systematisch vorgehst.
  • Gib immer Zahlen an: wie viele Zeilen betroffen, wie viel Prozent, vorher und nachher.
  • Begründe jede Bereinigungsentscheidung in einem Satz, besonders bei fehlenden Werten.
  • Schliesse mit Massnahmen an der Quelle ab. Reines Bereinigen gibt in der Regel nicht die volle Punktzahl.

Glossar

Begriffe kurz erklärt

Datenqualität
Eignung von Daten für ihren Verwendungszweck, gemessen an Dimensionen wie Vollständigkeit oder Korrektheit.
Data Profiling
Systematische Analyse eines Datensatzes, um Struktur, Inhalte und Auffälligkeiten zu erkennen.
Plausibilitätsprüfung
Prüfung, ob ein Wert realistisch und mit anderen Werten vereinbar ist.
Dublette
Mehrfacher Eintrag für dasselbe reale Objekt, z.B. dieselbe Firma zweimal im CRM.
Normalisierung
Werte in eine einheitliche Form bringen, z.B. Kleinbuchstaben, ohne Satzzeichen, einheitliche Rechtsform.
Golden Record
Der massgebliche, bereinigte Datensatz nach dem Zusammenführen von Dubletten.
Imputation
Ergänzen fehlender Werte mit einem begründeten Schätzwert, z.B. dem Median.
Data Owner
Person, die fachlich für einen Datenbestand und seine Qualität verantwortlich ist.
UID
Unternehmens-Identifikationsnummer im Format CHE-123.456.788 (letzte Ziffer ist eine Prüfziffer), eindeutig für jedes Schweizer Unternehmen.

Mit KI-Tutor

Jeder Kurs hat einen persönlichen KI-Tutor

  • Erklärt in deinem Tempo
  • Debuggt mit dir
  • Fachgespräch wie im QV
  • Unbegrenzt neue Übungen

Denkanstösse statt fertiger Lösungen. In der Gratis-Lektion zum Ausprobieren.

KI-Tutor · Modul 164Nur Tipps

Mein JOIN liefert plötzlich doppelte Zeilen. Was mache ich falsch?
Gute Frage! Schau dir die Spalte an, über die du verbindest: Ist sie in beiden Tabellen eindeutig? Was passiert mit einer Kundin, die zwei Bestellungen hat?
Ah, dann kommt sie zweimal vor …
Genau. Willst du die Bestellungen zählen oder nur die Kundinnen sehen? Je nachdem hilft dir GROUP BY oder DISTINCT.

Tutavio

So helfen wir dir bei Modul 378

  • Wir profilen mit dir einen (anonymisierten) Datensatz aus deinem Lehrbetrieb und erstellen gemeinsam eine Auffälligkeitsliste mit Kennzahlen.
  • Wir entwickeln mit dir Plausibilitätsregeln für deine Daten und setzen sie in Power Query oder pandas um.
  • Wir zeigen dir, wie du unscharfe Dubletten mit Normalisierung findest, und besprechen, welche Regeln für die Zusammenführung sinnvoll sind.
  • Vor der Prüfung üben wir Fallaufgaben: Probleme erkennen, Dimension benennen, Bereinigung begründen, Massnahmen ableiten.

Unverbindlich anfragen. Wir melden uns innert 24 Stunden.

Tutor:in für Modul 378 finden

Passende Module

Diese Seite ist eine eigene Lernhilfe von Tutavio und keine offizielle Modulbeschreibung. Nummer, Titel und Einordnung stammen aus den öffentlichen Bildungsplänen. Die verbindliche Modulidentifikation findest du im Modulbaukasten von ICT-Berufsbildung Schweiz.

Gratis-LektionNachhilfe