Detaillierte Informationen zum Seminar
Inhalte:
Dieser Kurs vermittelt Ihnen eine umfassende Einführung in Python für Data Science, einer der beliebtesten Programmiersprachen im Bereich Machine Learning und Deep Learning. Wir nutzen die Anaconda Distribution, die sich selbst als die weltweit populärste Data Science Plattform bezeichnet, und arbeiten in der Entwicklungsumgebung Jupyter Lab.
Nach dem Seminar sind Sie in der Lage:
- Daten aus verschiedenen Formaten in Python einzulesen
- Daten mit seaborn und matplotlib zu visualisieren
- Datenbereinigung mit pandas durchzuführen, einschließlich des Ersetzens fehlender Werte, Anpassen von Zeilen und Spalten sowie Erstellen neuer Spalten
Sie lernen zudem:
- Wie Sie eigene Funktionen in Python schreiben
- Die Umsetzung von Control Flows wie For-Schleifen und If-Else-Bedingungen
- Das Grundkonzept von pandas DataFrames und wie Sie Data Wrangling und Data Cleaning erfolgreich durchführen
Im Bereich Machine Learning erhalten Sie eine Einführung in die verschiedenen Ansätze: supervised, unsupervised und Reinforcement Learning. Mit scikit-learn werden Sie eigenständig Algorithmen in Python trainieren, validieren, den Train-Test-Split durchführen und Gütekriterien zur Beurteilung der Modelle berechnen und interpretieren können.
Bekannte Machine Learning Algorithmen, die im Seminar behandelt werden, umfassen:
- Entscheidungsbäume
- K-Means Clustering
- DBSCAN Clustering
- K-Nearest Neighbors (KNN)
Diese Algorithmen decken die Bereiche Regression, Klassifikation und Clustering ab. Sie werden lernen, diese Algorithmen zu verstehen und sie in Python zu implementieren.
Nach Abschluss des Kurses verfügen Sie über fundierte Grundlagen in Data Science und haben die Einstiegshürde für den Einsatz von Python im Machine Learning erfolgreich überwunden. Sie werden in der Lage sein, Ihr Wissen selbstständig weiter auszubauen und praktische Anwendungen zu entwickeln. Der Schwerpunkt liegt auf der eigenständigen Umsetzung der Inhalte auf Ihrem Laptop, unterstützt durch den Dozenten.
Grundlagen von Python
- Neue Pakete installieren
- Jupyter Notebook als Entwicklungsumgebung/IDE
- Funktionen und Methoden
Das Paket pandas - DataFrame
- Struktur (Zeilen, Spalten) eines DataFrames
- Auswahl einer Zeile/Spalte
- Zeilen/Spalten erstellen, löschen, ändern
- Boolean indexing: eine logische Abfrage zur Selektion von Zeilen
- Daten zusammenfassen, um einen Überblick zu erhalten.
Berechnen von Statistiken direkt im pandas DataFrame
- Einfache Statistiken direkt auf einem DataFrame (Mittelwert, Min, Max, Summe, Median, Varianz,…)
- Zusammenfassen und Filtern von Daten
- Fehlende Werte ersetzen
- Kreuztabelle (Kontingenztafel)
Daten einlesen und schreiben
- Das Arbeitsverzeichnis in Python setzen
- Ein CSV bzw. Excel einlesen und schreiben
- Von einer URL einlesen
- Überblick über nützliche Parameter
- Lesen und Schreiben vom Python Format pickle
Control Flows
- Eine eigene Funktion schreiben
- Default Parameter in einer Funktion setzen: position arguments und keyword arguments
- For-Schleifen
- If-Else Bedingungen
Datenvisualisierung mit seaborn / matplotlib
- Die wichtigsten Grundlagen von matplotlib
- Achsen-Beschriftung, Legende, Titel ändern
- Einen Plot speichern
- In seaborn Linienplot, Boxplot, Histogram, Scatterplot, Barplot erstellen
- Darstellungen (Größe der Datenpunkte, Farbe, Gruppierung) mit einer Variable variieren oder festsetzen
String Manipulation im DataFrame, Grundlagen von numpy
- Text zeilenweise in einem DataFrame bearbeiten
- Informationen aus Text extrahieren
- Numpy arrays erstellen und nach Zeilen, Spalten slicen
- Funktionen in numpy auf ein array anwenden
Überblick über Machine Learning
- Einführung in Machine Learning
- Anwendungsbeispiele von Machine Learning
- Künstliche Intelligenz - Machine Learning - Deep Learning
- Unterschied Supervised - Unsupervised Learning (überwachtes - unüberwachtes Lernen)
- Overfitting und Train-Test-Split
Entscheidungsbaum mit scikit-learn
- Aufteilung der Daten in Test-Train, ein Model erstellen und validieren
- Grundlagen des Algorithmus
- Umsetzung in Python
- Validieren der Ergebnisse (u.a. confusion matrix, sensitivity, accuracy)
- Anpassen von Hyperparametern im Training
Neuronales Netz, K-Nearest Neighbor
- Grundlagen des Algorithmus
- Ein Multi-Layer-Perceptron (MLP) trainieren
- Umsetzung in Python mit scikit-learn
- Validieren der Ergebnisse (u.a. confusion matrix, sensitivity, accuracy)
- Anpassen von Hyperparametern
K-Means Clustering
- Ein Cluster-Model erstellen und validieren
- Grundlagen des Algorithmus
- Umsetzung in Python mit scikit-learn
- Validieren der Ergebnisse (Sillhouette Score, Calinski-Harabasz)
DBSCAN
- Wie funktioniert DBSCAN Clustering?
- Grundlagen des Algorithmus und Unterschiede zu K-Means
- Umsetzung in Python mit scikit-learn
- Validieren der Ergebnisse (Sillhouette Score, Calinski-Harabasz)
Technik im Data Science mit Python Kurs
- Die Teilnehmer benötigen für die Übungsaufgaben Laptops. Wir empfehlen, Ihren eigenen Laptop mit der vorab installierten Software mitzubringen. Eine genaue Installationsanleitung für die Software wird Ihnen vor dem Seminar per E-mail zugesandt. Auf Anfrage stellen wir auch Schulungslaptops zur Verfügung.
- Bitte prüfen Sie, ob Ihr Firmenlaptop Zugangsbeschränkungen im Internet hat. Die digitalen Unterlagen (Skript, Code, Dateien) werden im Kurs online zum Download zur Verfügung gestellt. Sie erhalten vor der Schulung per E-Mail den Link zu einer Testdatei zum Download, um dies überprüfen zu können.
- Sie sollten sich in firmenfremde WLAN-Netze registrieren können.
- Als Backup Lösung ist es möglich, dass der USB Port bei Ihrem Laptop freigeschalten ist, um damit im Seminar verwendete Dateien oder sonstige Unterlagen übertragen zu können.
- In der Schulung wird das Betriebssystem Windows verwendet. Der Umgang mit Ihrem verwendeten Betriebssystem und Laptop sollte bekannt sein. Insbesondere sollten Sie ohne Schwierigkeiten Sonderzeichen auf der Tastatur finden (insbesondere bei Apple Geräten werden auf manchen Tastaturen nicht immer runde, eckige bzw. geschweifte Klammern dargestellt).
Kooperationspartner
Dieses Online-Weiterbildungsangebot wird über die E-Learningplattform von Enable AI bereitgestellt. Zur Einrichtung des User-Accounts und Zusendung von Zugangsdaten und Nutzung der Lernplattform übermitteln wir Name, Anschrift, E-Mail-Adresse der Teilnehmenden an Enable AI. In diesem Zusammenhang wird auch die Telefonnummer zur Klärung der technischen Fragen übermittelt.
Ablauf
Dieses Seminar findet zu 100% online statt. Bitte prüfen Sie im Vorfeld, ob Sie die technischen Voraussetzungen für die Teilnahme am Online-Unterricht erfüllen.
Dauer/zeitlicher Ablauf:
24 Stunden
Ziele/Bildungsabschluss:
Teilnahmebescheinigung /
Zielgruppe:
Der Python Data Science Kurs ist ideal für Teilnehmer, welche die Anwendung von Python erlernen möchten, um Daten zu analysieren und Machine Learning Algorithmen zu programmieren. Angesprochen sind Anwender, welche die Data Science Grundlagen lernen möchten.
Seminarkennung:
1846_262_01AI