Kampf der KI-Modelle: Welche KI soll ich für die Textanalyse nutzen?

Erfahren Sie, wie KI Unternehmen dabei unterstützt, offene Textantworten effizient zu analysieren und in verwertbare Erkenntnisse umzuwandeln. Der Artikel erklärt zentrale Textklassifikationsmodelle und zeigt, wie deren Leistung mithilfe von Precision, Recall und F1-Score bewertet wird.
Data Analysis
Feedback Management
Market Research
Survey Design and Best Practices
Lesezeit 10 Min.
Melanie Vultorius
Which AI Model is Best

Einführung

Haben Sie sich schon einmal gefragt, wie Unternehmen mit der Flut von Rückmeldungen umgehen, die sie erhalten? Früher erforderte dieser Prozess viel manuellen Aufwand. Jetzt bieten KI-Modelle für die Textanalyse einen effizienteren Ansatz. Diese fortschrittlichen Modelle wandeln unstrukturierte Daten aus Umfrageantworten und Kommentaren in sozialen Medien schnell in verwertbare Erkenntnisse um. In diesem Artikel gehen wir näher auf die Funktionsweise dieser Technologien ein, vergleichen verschiedene Klassifizierungsmodelle und zeigen effektive Methoden zur Messung ihrer Leistung auf.

Im Anschluss an diese Einführung laden wir Sie ein, sich eine Webinar-Aufzeichnung anzusehen, die diese Konzepte weiter veranschaulicht und eine visuelle und detaillierte Erkundung der KI in Aktion bietet.

Webinar-Aufzeichnung

KI-gestützte Analyse offener Antworten

Die Analyse offener Antworten bedeutet, dass unstrukturierte Textdaten nach bestimmten Themen und Gefühlen sortiert werden. Dies hilft Unternehmen, das Kundenfeedback zu verstehen und wichtige Trends und Probleme zu erkennen. Dies umfasst in der Regel zwei Hauptschritte: erstens die Zuordnung von Themen zu jeder Antwort, um zu sehen, worüber diskutiert wird, und zweitens die Zusammenfassung dieser Ergebnisse, um einen Überblick zu bekommen. Dieser strukturierte Ansatz spart nicht nur Zeit, sondern liefert auch umsetzbare Erkenntnisse, die zu besseren Entscheidungen und zur Verbesserung von Produkten und Dienstleistungen beitragen können.

Die Integration fortschrittlicher KI-Werkzeuge wie ChatGPT kann diesen Prozess verfeinern, wie in unserem ausführlichen Artikel über die Verwendung von ChatGPT für offene Umfrageantworten beschrieben.

Modelle zur Textklassifizierung

Textklassifizierungsmodelle gibt es in verschiedenen Formen, die jeweils für unterschiedliche Aufgaben geeignet sind:

  • Regelbasierte Modelle: Sie verwenden vordefinierte Regeln und Mustervergleiche, um Text zu klassifizieren. Sie sind einfach und leicht zu implementieren, können aber starr sein und erfordern manuelle Aktualisierungen.

  • Modelle für maschinelles Lernen: Dazu gehören Algorithmen wie Naive Bayes, Support Vector Machines (SVM), Entscheidungsbäume (Random Forests) und logistische Regression. Diese Modelle lernen aus markierten Daten und können mit neuem, ungesehenem Text umgehen. Sie benötigen jedoch viele markierte Daten, um effektiv zu trainieren, und können mit komplexer Sprache Probleme haben.

  • Transformator-Modelle: Die neueste Generation umfasst BERT, GPT, T5 und RoBERTa. Diese Modelle verwenden eine fortschrittliche Verarbeitung natürlicher Sprache und werden mit großen Datenmengen trainiert. Sie können komplexe Sprachaufgaben mit hoher Genauigkeit bewältigen und sich an verschiedene Textanalyseanforderungen anpassen.

Modelle-zur-Textklassifizierung

Verständnis des Klassifizierungsprozesses

Die folgende Tabelle veranschaulicht den Prozess der Kategorisierung von Elementen oder Antworten in vordefinierte Kategorien oder Themen. Dieses Beispiel zeigt, wie KI-Modelle für die Textanalyse und menschliche Annotatoren zusammenarbeiten können, um verschiedene Eingaben genau zu klassifizieren.

Bilder_Kategorien

Wie kann die Leistung von KI-Modellen gemessen werden?

Um die Leistung dieser Modelle zu veranschaulichen, betrachten wir zwei Szenarien: eine Tierklassifizierungsaufgabe und eine Themenklassifizierungsaufgabe für offenen Text.

Beispiel für die Klassifizierung von Tieren

Bei dieser Aufgabe klassifizieren die Modelle Bilder entweder als „Tier“ oder „nicht Tier“. Die Konfusionsmatrix hilft dabei, die Leistung des Modells zu visualisieren, indem sie wahr-positive, falsch-positive, wahr-negative und falsch-negative Ergebnisse anzeigt.

  • Wahr Positiv (TP): Das Modell identifiziert ein Bild korrekt als ein Tier. Zum Beispiel werden Bilder von einem Schäferhund, einem Welpen und einer Katze korrekt als „Tier“ klassifiziert.

  • Falsch Positiv (FP): Das Modell identifiziert ein Nicht-Tierbild fälschlicherweise als Tier. Zum Beispiel werden Bilder von einem Muffin und Gras fälschlicherweise als „Tier“ klassifiziert.

  • Falsch Negativ (FN): Das Modell kann ein Tierbild nicht identifizieren und stuft es als „nicht tierisch“ ein. Zum Beispiel wird das Bild einer Katze fälschlicherweise als „Nicht Tier“ klassifiziert.

  • Wahr Negativ (TN): Das Modell identifiziert ein Nicht-Tierbild korrekt als „Nicht-Tier“. Dies wird im Beispiel nicht explizit gezeigt, aber es würde bedeuten, dass Nicht-Tier-Bilder wie der Muffin und das Gras richtig klassifiziert werden.

Verstandnis-der-Klassifikationsergebnisse

Wenn es um Aufgaben geht, bei denen Informationen in zwei Kategorien sortiert werden müssen, z. B. ja/nein oder beschädigt/nicht beschädigt, ist es wichtig zu wissen, wie genau KI-Modelle für die Textanalyse arbeiten. Um dies zu messen, verwenden wir drei Schlüsselmetriken: Präzision, Rückruf, F1-Score.

  • Genauigkeit:

    • Misst, wie viele der „Ja“-Entscheidungen des Modells richtig waren.

    • Damit wird sichergestellt, dass das Modell nicht zu viele Elemente fälschlicherweise als „ja“ kennzeichnet (Minimierung von Fehlalarmen).

  • Rückruf:

    • Überprüft, ob das Modell alle „Ja“-Fälle identifiziert, die es identifizieren sollte.

    • Eine hohe Trefferquote bedeutet, dass das Modell die meisten echten „Ja“-Situationen erkennt und keine Fälle übersehen werden.

  • F1-Punktzahl:

    • Kombiniert Präzision und Rückruf in einer Metrik

    • Hilft, ein Gleichgewicht zwischen der Notwendigkeit, so viele positive Fälle wie möglich zu erkennen, und der Notwendigkeit, zu viele Fehler zu vermeiden, herzustellen.

Nützlich für den Vergleich von Modellen, um festzustellen, welches Modell insgesamt am besten abschneidet, und um einen schnellen Überblick über die Genauigkeit und Zuverlässigkeit zu erhalten.

In der folgenden Abbildung werden die Konzepte der Präzision, des Recalls und des F1-Scores anhand konkreter Zahlen aus einem früheren Beispiel zur Klassifizierung „Tier“ vs. „Nicht-Tier“ visuell erläutert. Es zeigt die Berechnungen für Präzision, Recall und den F1-Score auf der Grundlage echter Daten und veranschaulicht, wie diese Metriken abgeleitet werden und warum sie für die Bewertung der Leistung eines Modells wichtig sind.

Screenshot-2024-07-11-151459

Der F1-Score gibt schnell Aufschluss darüber, wie gut ein Modell die Erkennung wahrer Positivmeldungen bei gleichzeitiger Minimierung von Fehlern ausbalanciert. Durch die Überprüfung dieses Wertes können Sie effizient bestimmen, welches Modell für Ihre spezifischen Anforderungen am zuverlässigsten ist, und so das Risiko falscher Klassifizierungen verringern.

Vergleich der F1-Score verschiedener Szenarien

Die Bewertung der Leistung verschiedener Modelle anhand des F1-Scores vermittelt ein klares Bild von ihrer Genauigkeit und Zuverlässigkeit. In einer vergleichenden Studie wurden beispielsweise verschiedene Modelle auf ihre Fähigkeit getestet, Text genau zu klassifizieren. Die F1-Scores variierten, was auf die Stärken und Schwächen der einzelnen Ansätze hindeutet.

  • Modell 1 (klassifiziert alle Bilder als Tiere): Dieses Modell erzielt eine hohe Trefferquote, indem es jedes Bild als Tier klassifiziert und damit sicherstellt, dass alle Tiere auch tatsächlich identifiziert werden. Dies geht jedoch auf Kosten vieler falsch positiver Ergebnisse, da es auch Nicht-Tierbilder fälschlicherweise als Tiere klassifiziert:

    • Präzision: Ungefähr 67 %, was bedeutet, dass nicht alle vorhergesagten Tiere auch tatsächlich Tiere sind

    • Wiedererkennung: 100%, da das Modell erfolgreich alle Tierbilder identifiziert.

    • F1-Score: Ca. 80 %, was trotz der hohen Anzahl falsch positiver Ergebnisse ein angemessenes Gleichgewicht zwischen Präzision und Rückruf zeigt.

Screenshot-2024-07-11-151600
  • Modell 2 (klassifiziert alle Bilder als nicht tierisch): Dieses Modell vermeidet falsch positive Ergebnisse vollständig, indem es jedes Bild als „kein Tier“ klassifiziert. Dieser Ansatz gewährleistet zwar, dass Nicht-Tiere nicht fälschlicherweise als Tiere identifiziert werden, führt aber zu sehr schlechten Leistungskennzahlen:

    • Präzision: 0 %, da das Modell nie ein Bild als Tier vorhersagt.

    • Wiedererkennungswert: 0%, da es keine tatsächlichen Tiere identifiziert.

    • F1-Score: 0 %, da das Modell nicht in der Lage ist, Präzision und Recall effektiv auszugleichen.

Der Vergleich dieser beiden Modelle zeigt, dass Modell 1 besser für Szenarien geeignet ist, in denen es entscheidend ist, alle Tiere zu identifizieren, auch wenn es einige falsch-positive Bilder gibt, während Modell 2 in seltenen Fällen nützlich sein könnte, in denen die Vermeidung von falsch-positiven Bildern wichtiger ist als die Identifizierung von richtig-positiven Bildern.

Screenshot-2024-07-11-151617

Beispiel für eine Textklassifizierung

Hier klassifizieren die Modelle das Kundenfeedback in vordefinierte Themen. Zum Beispiel könnte das Feedback zum Lieferservice in Themen wie Pünktlichkeit, Servicequalität und Schäden kategorisiert werden. Die Leistung wird an von Menschen kommentierten Benchmarks gemessen, die zeigen, wie gut die KI-Modelle mit dem menschlichen Urteil übereinstimmen. Dieser Ansatz gewährleistet, dass die KI-Kategorisierung sowohl relevant als auch genau ist.

Screenshot-2024-07-11-161140

Die Folie zeigt, wie KI-Modelle Feedback zu Themen wie Schäden, Pünktlichkeit und Service behandeln. Ein Feedback wie „Der Karton war aufgerissen, und es fehlten Teile“ sollte beispielsweise unter „Beschädigung“ kategorisiert werden.

Beim Sortieren von Kundenfeedback in Kategorien wie „Beschädigung“ oder „keine Beschädigung“ ist es entscheidend, dass unsere Textklassifizierungsmodelle dies richtig machen. Stellen Sie sich vor, ein Kunde sagt: „Ihr Paket hat sich verspätet, aber zum Glück war es nicht beschädigt. Unser Modell muss verstehen, dass es sich nicht um eine Beschädigung handelt. Auf der anderen Seite wollen wir eine ernsthafte Beschwerde wie „Das Produkt war bei der Ankunft zerdrückt. Ich bin sehr enttäuscht!‘

Um sicherzustellen, dass unsere Modelle genau und zuverlässig sind, stützen wir uns auf die so genannte F1-Bewertung. Dieser Wert sagt uns, wie gut das Modell Fehler vermeidet und echte Probleme nicht übersieht. Es ist eine Art Zeugnis, das uns hilft, das Modell auf Kurs zu halten und sicherzustellen, dass es echte Probleme ohne Verwechslungen erkennt.

Die genaue Kategorisierung des Feedbacks und das Verständnis der dahinter stehenden Stimmung ist nicht nur für die Aufrechterhaltung der Kundenzufriedenheit von entscheidender Bedeutung, sondern auch für die Anwendung dieser Erkenntnisse in komplexeren Analysen. Bei der Key-Driver-Analyse beispielsweise ist das Verständnis dieser Kategorien und Stimmungen von entscheidender Bedeutung, da es dazu beiträgt, herauszufinden, was wirklich zur Kundenzufriedenheit beiträgt. Diese Anwendung zeigt, wie ein effektiver Umgang mit offenen Textantworten wertvolle Erkenntnisse in der fortgeschrittenen Marktforschung liefern kann, indem die von KI-Modellen durchgeführte detaillierte Kategorisierung und Stimmungsanalyse genutzt wird.

Was macht einen guten F1-Score aus?

Ein gutes F1-Ergebnis reicht in der Regel von akzeptabel (über 60 %) bis hervorragend (über 80 %). Um eine hohe F1-Punktzahl zu erreichen, muss das Modell sorgfältig trainiert, feinabgestimmt und anhand von von Menschen kommentierten Daten validiert werden. Bei Textklassifizierungsaufgaben gilt ein F1-Ergebnis von über 70 % als Richtwert für eine hohe Leistung. Dadurch wird sichergestellt, dass das Modell ein ausgewogenes Verhältnis zwischen Präzision und Recall aufweist und zuverlässige und genaue Ergebnisse liefert.

Wie ein ausgezeichneter F1-Score erreicht wird

Um eine hohe F1-Punktzahl, in der Regel über 80 %, zu erreichen, bedarf es einer Mischung aus KI-Werkzeuge und menschlichen Erkenntnissen. Folgen Sie dieser strukturierten, von Survalyzer inspirierten Methode, um Ihr KI-Modell zu optimieren:

  • Schritt 1: Fragen Sie AI-GPT, welche Themen in Ihren Daten vorkommen

Verwenden Sie AI-GPT, um zunächst potenzielle Themen aus Ihrem Datensatz zu identifizieren. Dies hilft, einen vorläufigen Rahmen für Ihre Analyse festzulegen, indem häufige Themen und Kategorien hervorgehoben werden.

  • Schritt 2: Manuelle Überprüfung und Verfeinerung der Kategorien auf der Grundlage von Best Practices

Nachdem AI-GPT Themen vorgeschlagen hat, überprüfen Sie diese manuell, um Genauigkeit und Relevanz sicherzustellen. Verfeinern Sie diese Themen anhand von Best Practices aus der Branche, um die Kategorien spezifischer und umsetzbarer zu machen. Verwenden Sie beispielsweise anstelle eines allgemeinen Begriffs wie „Pünktlichkeit“ spezifische Bezeichnungen wie „Verspätete Lieferung“ oder „Pünktlichkeit“.

  • Schritt 3: Führen Sie mehrere Versuche durch

Führen Sie 4 bis 5 Versuche durch, um die Konsistenz der verfeinerten Themen zu bestätigen. Dieser Schritt trägt dazu bei, Ihre Themenauswahl zu festigen, indem er sicherstellt, dass sie für verschiedene Datensätze relevant sind.

  • Schritt 4: Vorbereiten der Trainingsdaten

Bereiten Sie Ihre Trainingsdaten vor, indem Sie einen großen Teil davon manuell kategorisieren, um einen hochwertigen Ausgangsdatensatz zu erstellen. Sie können auch AI-GPT zur Unterstützung bei der vorläufigen Kategorisierung verwenden, gefolgt von einer menschlichen Überprüfung und Verfeinerung der Genauigkeit.

Die Vorbereitung genauer Trainingsdaten ist für den Erfolg von KI-Modellen in der Textanalyse entscheidend. Eine genaue Stichprobe stellt sicher, dass die Vorhersagen des Modells zuverlässig sind und den breiteren Datensatz widerspiegeln. Lesen Sie mehr über die Grundlagen der Stichprobenerhebung und berechnen Sie die optimale Stichprobengröße, um sicherzustellen, dass Ihre Trainingsdaten eine zuverlässige KI-Analyse unterstützen.

  • Schritt 5: Modelltraining und Validierung

Trainieren Sie Ihr KI-Modell anhand der aufbereiteten und verfeinerten Daten. Validieren Sie die Leistung des Modells kontinuierlich, indem Sie es an einer Teilmenge Ihrer Daten testen und auf der Grundlage dieser Ergebnisse die erforderlichen Anpassungen vornehmen.

  • Schritt 6: Einsatz des trainierten Modells

Sobald das Modell trainiert ist und eine genaue Leistung gezeigt hat, setzen Sie es ein, um neue Daten zu analysieren. Es sollte den Text auf der Grundlage der klar definierten Themen genau kategorisieren.

  • Schritt 7: Überwachen und Optimieren

Behalten Sie die Leistung des Modells im Auge und optimieren Sie es bei Bedarf. Dieser kontinuierliche Anpassungsprozess trägt dazu bei, die Effektivität des Modells aufrechtzuerhalten und macht es zu einem zuverlässigen Instrument für die Entscheidungsfindung und Strategieentwicklung.

Durch die Befolgung dieser Schritte hat Survalyzer mit seinem speziell trainierten KI-Modell einen F1-Wert von 75 % erreicht und damit sowohl die menschliche Klassifizierung als auch allgemeine KI-Modelle wie GPT 3.5 übertroffen. Dieser Ansatz stellt sicher, dass das Modell genau und auf die spezifischen Geschäftsanforderungen zugeschnitten ist.

Schlussfolgerungen

Zusammenfassend lässt sich sagen, dass der Einsatz von KI zur Klassifizierung und Analyse von Texten zu einem unverzichtbaren Werkzeug für Unternehmen wird, das Bereiche wie Kundenservice und Marketing verbessert. Durch die Integration von Technologien wie maschinelles Lernen und Transformationsmodelle werden Unternehmen nicht nur effizienter, sondern erhalten auch wertvolle Einblicke in das Kundenverhalten.

Wenn Sie diese Technologien verstehen und sie strategisch einsetzen, können Sie Ihre Datenverarbeitung erheblich verbessern. Da diese Fortschritte unsere Herangehensweise an Geschäftsabläufe auf subtile Weise verändern, sollten Sie daran denken, dass unser Team Sie bei der Integration dieser Lösungen in Ihr Unternehmen unterstützt, um sicherzustellen, dass sie mit Ihren Zielen übereinstimmen und sinnvolle Ergebnisse liefern.

Autor

Melanie Vultorius

Mehr von Survalyzer

Diese Artikel könnten Sie interessieren