Motivation & Hintergrund
Reale Datensätze aus der automatisierten Schadensinspektion sind häufig unausgeglichen. In der Regel stehen einer großen Anzahl an schadensfreier Beispiele nur vergleichsweise wenige schadhafter Beispiele gegenüber. Für die Entwicklung von Klassifikationsmodellen stellt diese Klassenungleichgewicht eine Herausforderung dar, da das Modell während des Trainings deutlich häufiger Beispiele der Mehrheitsklasse sieht. Dies kann dazu führen, dass insbesondere die für die Schadensinspektion relevante Minderheitsklasse nicht zuverlässig erkannt wird.
Ziel der Arbeit ist es, den Einfluss unterschiedlich stark ausgeprägter Klassenungleichgewichte auf die Modellperformance zu untersuchen und geeignete Strategien zum Umgang mit unausgeglichenen Datensätzen zu evaluieren.
Dabei sollen verschiedene Ansätze zur Reduzierung des Einflusses der Klassenungleichheit implementiert und miteinander verglichen werden. Zusätzlich soll untersucht werden, welchen Beitrag synthetisch erzeugte Daten zur Verbesserung der Klassenverteilung und der Modellperformance leisten können.
Vorkenntnisse:
- Programmierkenntnisse (Python)
- (optional) Erfahrung mit Machine Learning
Kontakt:
Velimir Barun, M. Sc.
Telefon +49 511 762 13463
Weitere Informationen entnehmen Sie bitte der beigefügten PDF.