1 Datenvorverarbeitung und Data Wrangling

Studienziele Modul 1

Die Teilnehmenden lernen Daten als zentralen Rohstoff der digitalen Transformation kennen und können Daten gegenüber Information und Wissen abgrenzen. Sie kennen die wichtigsten Datenquellen, beherrschen grundlegende Methoden des Datenzugriffs und beurteilen die Datenqualität kompetent. Ebenso (er-)kennen sie typische Fehlerquellen in der Datenhaltung und können diese konstruktiv beseitigen. Die Teilnehmenden kennen Methoden der Datenreinigung und -validierung, können sich einen Überblick über das Profil des Datensatzes  verschaffen und auswertungsbereite Datensätze erzeugen.

Technologisch steht die statistische Programmiersprache R und mit ihr das tidyverse-Ökosystem im Mittelpunkt. Die Teilnehmenden werden unterstützt, R-Programme mithilfe von KI-Werkzeugen in Python zu übersetzen und dabei die konzeptionelle Übertragbarkeit zu reflektieren. Analyseergebnisse werden mit Quarto dokumentiert und reproduzierbar gemacht. 

Die Teilnehmenden werden in die Nutzung relationaler Datenbanksysteme eingeführt und können Datenbankabfragen in der Structured Query Language (SQL) formulieren.    

Lehrinhalte

  • Daten, Information, Wissen - Grundbegriffe und Abgrenzungen
  • Datentypen, Skalenniveaus, Transaktionsdaten, Open Data, Sensordaten
  • Datenzugriff: Datenbankverbindungen, REST-APIs, Dateiformate und Encoding
  • Datenqualität:Explorative Datenanalyse und Profililng
  • Bad Data / Good Data: Typische Fehlerquellen, Risiken tabellenkalkulationsbasierter Datenverwaltung; gute Dateiorganisation
  • Datenreinigung und -validierung:
    • Bearbeitung von Zeichenketten,
    • Funktionen für numerische Daten, Zeit- und Datumsangaben
    • Deduplizierung und Entity Resolution
    • Fehlende Werte
  • Auswertungsbereite Datensätze: Tidy Data und Data Wrangling - Konversion, Selektion, Filterung, Aggregation, Neuanordnung und Erweiterung (Join, Union)
  • SQL: Grundlagen und praktische Abfragen
  • Technologie: R/tidyverse, Quarto, KI-gestützte Code-Übersetzung von R nach Python (Pandas)
  • Überblick: Cloud-Datenspeicher und moderne ETL-Konzepte

Lehr- und Lernmethoden

Problem based learning; Vorträge, problemorientierte Übungen und Aufgaben

Abschluss

Hochschulzertifikat der Berliner Hochschule für Technik
(bei Absolvierung der modulbegleitenden Aufgaben und der Modulprüfung; 5 Creditpoints nach ECTS);
ansonsten Teilnahmebescheinigung

Durchführung

Dauer: 8 Wochen 
Beginn: Oktober 2026
Anmeldung: jederzeit zum nächsten Beginn
Präsenztermine: Anfang Oktober und Anfang Dezember 2026 (jeweils Fr/Sa)

Nutzungsentgelt

1.500,- Euro 

Zugangsvoraussetzungen

  • Abschluss eines Hochschulstudiums oder eines vergleichbaren Studiums an einer Berufsakademie (BA)
  • mindestens ein Jahr für die Weiterbildung geeignete Berufserfahrung
  • Erste Erfahrungen bzw. Interesse am Arbeiten mit KI-Werkzeugen wie Copilot, Gemini, ChatGPT/Claude (freie Version)
  • Interesse an der Teilnahme durch berufliche Erfahrungen in einem der Themenfelder (Vorverarbeitung, Datenanalyse, Ergebniskommunikation).

Detaillierte Informationen:

Aufbau und Ablauf des Fernstudienkurses

weiter zu Modul 2: Quantitative Methoden und Data Mining