Motivation
Die Verfügbarkeit von Trainingsdaten mit ausreichender Qualität ist eine der wichtigsten Voraussetzungen für die Teilhabe kleiner und mittlerer Unternehmen (KMU) am Fortschritt im Bereich der Künstlichen Intelligenz (KI). Insbesondere für die domänenspezifische Anwendung von automatischer Sprachverarbeitung, z.B. im industriellen Umfeld, sind die Sprachdaten meist nicht in ausreichender Quantität und Qualität verfügbar. Dies gilt besonders für KMU mit einem sehr spezifischen Produktportfolio und einer damit verbundenen speziellen Terminologie, die sich nicht aus allgemeinen Sprachressourcen erschließen lässt. Bei der KI-basierten Bilderkennung ist es bereits üblich, die Trainingsdaten künstlich zu vervielfältigen und zu variieren (sog. DataAugmentation). Im Gegensatz dazu haben sich in der Sprachverarbeitung Data-AugmentationVerfahren, die es erlauben, aus einer kleinen Menge an relevanten Sprachdaten die für das Maschinelle Lernen erforderlichen Datenmengen automatisch zu generieren, noch nicht in vergleichbarer Weise etabliert. Dies gilt im Besonderen für deutschsprachige Anwendungen.
Ziele und Vorgehen
Ziel des Verbundvorhabens „SLIK“ ist es, diese Lücke zu schließen und KMU, die nicht über genügend eigene Trainingsdaten verfügen, den Einsatz von Sprachverarbeitungsmodellen zu erleichtern. Dazu werden im Vorhaben Werkzeuge entwickelt, die domänenspezifische, synthetische Sprachdaten erzeugen, mit deren Hilfe KMU ohne große Datensammlungen text- und sprachbasierte Sprachassistenten erstellen können. Zudem sollen vorgefertigte, mittels Data Augmentation generierte Korpora geschriebener und gesprochener Sprache für verschiedene KMU-relevante Anwendungsdomänen bereitgestellt werden. Um diese Ziele zu erreichen, sollen hybride Systeme zum Einsatz kommen, die regelbasierte Verarbeitung mit Maschinellem Lernen kombinieren und so wesentliche Vorteile gegenüber einem rein statistischen Ansatz bieten. Dabei werden auch die besonderen Anforderungen von KMU berücksichtigt: eng eingegrenzte Anwendungsdomänen, Kontrolle, Sicherheit, Vertraulichkeit und Nachvollziehbarkeit sowie die einfache Durchführbarkeit der Data-Augmentation.
Innovationen und Perspektiven
Das übergeordnete Ziel dies Vorhabens ist es, mit Hilfe der entwickelten Werkzeuge und der bereitgestellten Sprachkorpora insbesondere deutsche KMU in die Lage zu versetzen, schnell und einfach neue KI-basierte Systeme zur Verarbeitung natürlicher deutscher Sprache in ihr Arbeits- bzw. Produktionsumfeld zu integrieren.