14  Analysemethoden

Der Fokus in diesem Buch und im zugehörigen Kurs liegt auf der quantitativen Textanalyse. Eine weitere im Kontext von Social-Media-Daten häufig angewandte Methode ist die Netzwerkanalyse. Diese behandeln wir hier nicht, aber Kapitel 13 aus dem Buch Computational Analysis of Communication gibt hier eine gute Einführung.

Wichtiger Hinweis: Das Buch und der Kurs können nur eine kurze Einführung in die Grundlagen der quantitativen Textanalyse geben. Es gibt viele weitere Themen, die wir hier nicht behandeln können. Hierzu lohnt sich ein Blick in andere Einführungen. Neben dem bereits mehrfach erwähnten Buch Computational Analysis of Communication sind z.B. folgende Bücher und Kurse empfehlenswert:

Es ist auch möglich, die Netzwerkanalyse mit der quantitativen Textanalyse zu kombinieren (Bail, 2016). Dies geht z.B. mit dem R-Paket textnets (siehe auch das Tutorial vom Paket-Autor Chris Bail).

14.1 Arten von Analysemethoden

In der quantitativen Textanalyse gibt es viele unterschiedliche Auswertungsmethoden. Diese lassen sich wie folgt kategorisieren:

  • Deskriptive Methoden: Hierbei werden die Daten in ihrer Rohform beschrieben, z.B. durch Häufigkeiten von Wörtern, Links und Hashtags. Diese behandeln wir in Kapitel 16.

  • Sentiment-Analyse und diktionärbasierte Methoden Bei der Sentiment-Analyse wird versucht, die Stimmung oder Haltung in einem Text zu bestimmen, z.B. ob ein Text auf Social Media positiv, negativ oder neutral ist. Bei der Sentiment-Analyse kommen häufig sogenannte Diktionäre (dictionaries) zum Einsatz. Diese können aber auch genutzt werden, um andere Konstrukte zu messen wie z.B. Populismus. Diese beiden Methoden behandeln wir in Kapitel 17.

  • Unsupervised Machine Learning: Hierbei werden Algorithmen eingesetzt, um Muster in den Daten zu erkennen, ohne dass diese vorher definiert wurden. Ein Beispiel hierfür ist die Topic-Modellierung, bei der versucht wird, Themen in einem Textkorpus zu identifizieren. Diese Methode behandeln wir in Kapitel 18.

  • Supervised Machine Learning: Hierbei werden Algorithmen eingesetzt, um Muster in den Daten zu erkennen, die vorher definiert wurden. Ein Beispiel hierfür ist die Textklassifikation, bei der versucht wird, Texte in vordefinierte Kategorien einzuteilen. Diese Methode behandeln wir hier aus Platz- und Zeitgründen nicht, aber Kapitel 8 aus dem Buch Computational Analysis of Communication behandelt diese ausführlich.

Textdaten können auch mit Large Language Models (LLMs) analysiert werden. Ein interessantes R-Paket für die automatisierte Inhaltsanalyse mit LLMs ist klaus. Mit diesem kann man auch Chat AI von der GWDG nutzen, auf das viele Unis in Deutschland Zugriff haben. Gute Einführungen in die Nutzung von LLMs für die Analyse von Textdaten bieten z.B. die Paper von Farjam et al. (2025) und Foisy et al. (2025).

Bevor die genannten Analysemethoden genutzt werden können, müssen die Daten jedoch zunächst aufbereitet werden. Dieser Prozess wird als Preprocessing bezeichnet und umfasst i.d.R. mehrere Schritte. Mit diesen befassen wir uns im Kapitel 15.

14.2 Setup: Pakete & Daten

14.2.1 Pakete

Es gibt viele verschiedene Pakete für die Aufbereitung und Analyse von Textdaten in R. Einige davon werden wir in den nächsten Abschnitten kennenlernen. Ein sehr umfangreiches Paket, mit dem wir viel arbeiten werden, ist quanteda (Benoit et al., 2018). Neben einem großen Funktionsumfang und einer sehr guten Dokumentation bietet quanteda zudem auch eine Reihe hilfreicher Tutorials an, welche die Nutzung erleichtern.

Wie gewohnt, müssen wir das Paket zunächst einmalig installieren und dann in jedem Skript bzw. in jeder R-Sitzung (Session) laden, in dem/der wir es nutzen wollen.

install.packages("quanteda")

library(quanteda)

Für quanteda gibt es auch eine Reihe von Erweiterungspaketen (wie z.B. quanteda.textstats. Diese müssen ebenfalls installiert und geladen werden. Dies machen wir dann jeweils in den Abschnitten, in denen wir diese nutzen.

Ein weiteres umfangreiches Paket für die Aufbereitung und Analyse von Textdaten ist tidytext.

install.packages("tidytext")

library(tidytext)

14.2.2 Daten

In den Analysebeispielen in den nächsten Kapiteln arbeiten wir mit Daten von Bluesky und YouTube. Wie diese gesammelt werden können, wird in Kapitel 11 und Kapitel 13 beschrieben. Da Daten, die über die APIs dieser Plattformen gesammelt werden, nicht einfach über GitHub geteilt werden können, müssen Sie diese vor dem Durcharbeiten der Beispiele in den Kapitel zur Aufbereitung und Auswertung selbst entsprechende Datensätze sammeln und diese lokal speichern.

Wie immer müssen Sie die Dateinamen und Pfade in den Code-Beispielen entsprechend anpassen, damit diese auf Ihrem Computer funktionieren (siehe @ sec-import und Kapitel 26). In den Beispielen gehen wir davon aus, dass die Daten im Ordner data liegen und die Dateien bluesky_data.csv und youtube_data.csv heißen. Ein Beispiel-Skript zur Sammlung solcher Daten ist im Skript collect_data.R zu finden.

Sollten Sie keine eigenen Bluesky- oder YouTube-Daten sammeln können, können Sie alternativ auch die simulierten YouTube-Daten aus dem Tutorial zum R-Paket Paket tubecleanR nutzen.

Hinweis: Mit leichten Anpassungen lassen sich die Code-Beispiele auch auf Daten von anderen Plattformen wie z.B. TikTok anwenden.