Sechs Interviews sind geführt, die Aufnahmen liegen auf dem Laptop, und die Abgabe ist in acht Wochen. Jetzt kommt der Teil, den fast alle unterschätzen: das Abschreiben. Wer vorher weiß, nach welchen Regeln er schreibt und wie lange das dauert, spart sich doppelte Arbeit.
Interview transkribieren: Schritt für Schritt
- Regelsystem festlegen. Klären Sie vor dem ersten Wort, nach welchen Regeln Sie schreiben. Fragen Sie Ihren Lehrstuhl, ob es eine Vorgabe gibt. Gibt es keine, sind die einfachen Regeln nach Dresing & Pehl ein verbreiteter Standard.
- Aufnahme vorbereiten. Ist das Gespräch auf mehrere Dateien verteilt, fügen Sie sie zu einer zusammen, zum Beispiel mit MP3 zusammenfügen. Sonst beginnen die Zeitmarken in jedem Teil wieder bei null.
- Rohtext erzeugen. Von Hand mit Kopfhörer und einem Programm, das langsamer abspielen und kurz zurückspringen kann. Oder automatisch mit einer Spracherkennung.
- Sprecher setzen. Jeder Redebeitrag bekommt einen eigenen Absatz mit Kürzel und Doppelpunkt, etwa I: für die interviewende und B: für die befragte Person.
- Korrektur hören. Den ganzen Text lesen und dabei die Aufnahme noch einmal hören. Dabei tragen Sie Pausen, Lachen und unverständliche Stellen nach.
- Anonymisieren und exportieren. Namen, Orte und Firmen durch Platzhalter ersetzen, dann als Word-Datei oder für Ihre Analysesoftware speichern.
Transkriptionsregeln nach Dresing & Pehl
Thorsten Dresing und Thorsten Pehl beschreiben in ihrem kostenlosen Praxisbuch ein Regelsystem für die inhaltlich-semantische Transkription. Die 9. Auflage von 2024 fasst die Grundregeln in fünf Punkten zusammen. Dazu kommen Erweiterungsmodule, die Sie je nach Forschungsfrage einzeln oder komplett übernehmen.
| Thema | Grundregeln | Erweiterungsmodule |
|---|---|---|
| Wortlaut | jedes Wort aufschreiben, Dialekt an Schriftdeutsch annähern | zusätzlich Wort- und Satzabbrüche mit „/“, Wortdoppelungen immer |
| „hm“, „ja“, „genau“ | weglassen, wenn sie den Redefluss nicht unterbrechen; aufschreiben, wenn sie eine Antwort sind | Rezeptionssignale und Fülllaute aller Personen werden transkribiert, außer dem Backchanneling der interviewenden Person, solange es den Redefluss nicht unterbricht |
| Pausen | deutliche Pausen ab 3 Sekunden als „(…)“ | „(.)“ ca. 1 s, „(..)“ ca. 2 s, „(…)“ ca. 3 s, „(Zahl)“ länger |
| Emotion, Betonung | Lachen, Seufzen in Klammern; Betontes in VERSALIEN | nach „hm“ die Bedeutung, z. B. „hm (bejahend)“ |
| Unverständliches | „(unv.)“ oder vermuteter Wortlaut mit Fragezeichen, etwa „(Glück?)“ | wie Grundregeln |
| Überlappungen | nicht vorgesehen | mit „//“ markiert |
Dazu gibt das Praxisbuch Schreibempfehlungen. „hm“ wird immer „hm“ geschrieben, nie „mhm“. Zögerungslaute werden immer „ähm“, nie „öhm“. Einheiten werden ausgeschrieben, also „Euro“ statt „€“. Die Höflichkeitsform „Sie“ wird groß geschrieben, „du“ klein. Wer mehrere Interviews im Team abtippt, sollte diese Liste ausdrucken. Sonst sieht jedes Transkript anders aus.
Transkription Interview: ein Beispiel
So sieht ein kurzer Ausschnitt nach den Grundregeln aus. Die Zeitmarke am Ende des Absatzes hat das Format #hh:mm:ss-z#, das z ist die Zehntelsekunde.
I: Wie sind Sie zu dem Verein gekommen? #00:01:23-4#
B: Über eine Nachbarin, die hat mich einfach mal mitgenommen. (…) Und dann bin ich geblieben, das war so 2019. (lacht) Eigentlich wollte ich nur EINMAL zuschauen. #00:01:41-8#
I: War das Ihr erster Verein? #00:01:44-0#
B: Ja. #00:01:45-2#
Das kurze „Ja“ steht als eigener Absatz, weil es die Antwort auf eine Frage ist (Regeln 2 und 5). Hätte die interviewende Person während der Antwort „ja“ gemurmelt, ohne den Redefluss zu unterbrechen, fiele es nach den Grundregeln weg.
Zur Zeitmarke: Eine Stelle bei 2.712,58 Sekunden sind 45 Minuten (2.700 Sekunden) plus 12,58 Sekunden. Die Zehntel werden abgeschnitten, nicht gerundet. Die Marke lautet also #00:45:12-5#. Laut Praxisbuch dienen Zeitmarken nicht zum Zitieren. Sie erlauben, in MAXQDA oder f4analyse per Klick an die passende Stelle der Aufnahme zu springen.
Wie lange dauert es, ein Interview zu transkribieren?
Für einfache Regelsysteme nennt das Praxisbuch das 5- bis 10-Fache der Interviewdauer, inklusive Korrekturlesen. Der schnellste dort gemessene Wert lag bei etwa 1 zu 3, ohne Korrekturdurchgang. Detaillierte Systeme für die Gesprächsanalyse brauchen ein Vielfaches davon. Mehr als 6 Stunden Transkription pro Tag halten die Autoren nicht für realistisch, ohne dass die Fehlerrate steigt.
Rechenbeispiel für eine Bachelorarbeit: sechs Interviews zu je 45 Minuten.
| Schritt | Rechnung | Ergebnis |
|---|---|---|
| Aufnahmedauer gesamt | 6 × 45 min | 270 min = 4,5 h |
| von Hand, untere Grenze | 4,5 h × 5 | 22,5 h |
| von Hand, obere Grenze | 4,5 h × 10 | 45 h |
| Arbeitstage bei 6 h am Tag | 22,5 h ÷ 6 | knapp 4 Tage |
| Arbeitstage bei 4 h am Tag | 45 h ÷ 4 | gut 11 Tage |
| mit KI-Rohtext, bei rund 50 % Ersparnis | 22,5 h ÷ 2 bis 45 h ÷ 2 | etwa 11 bis 23 h |
Die letzte Zeile ist eine eigene Rechnung. Die Autoren sprechen aus ihrer Praxis von „rund 50 Prozent und mehr“, die Rechnung nimmt den unteren Wert. Öffentliche Studien zum Zeitaufwand mit Korrektur gibt es laut Praxisbuch bisher nicht. Wie viel Sie tatsächlich sparen, hängt vor allem von der Tonqualität ab.
Interview transkribieren mit KI
Seit etwa 2022 ist die automatische Spracherkennung nach Einschätzung von Dresing & Pehl für qualitative Interviews brauchbar. Sie erzeugt einen Rohtext, den Sie danach korrigieren. Unser Werkzeug Interview transkribieren nutzt dafür whisper.cpp mit dem Modell large-v3-turbo. Das ist laut OpenAI eine schnellere Fassung von Whisper large-v3 mit geringem Verlust an Genauigkeit.
Das Werkzeug liefert Text mit Zeiten, aber keine Sprecher. Den Sprecher setzen Sie je Absatz mit Alt + 1, Alt + 2 und so weiter. Es setzt die Regeln um, die sich aus Text und Zeiten ableiten lassen. Bei „einfach“ entfernt es Fülllaute, es vereinheitlicht „hm“ und „ähm“ und setzt Zeitmarken. Was man hören muss, tragen Sie selbst nach: Betonung, Lachen, Abbrüche und die meisten Pausen. Für Abschlussarbeiten gibt es ein Word-Dokument mit Zeilennummern aus, für MAXQDA und f4analyse eine TXT-Datei mit Zeitmarken.
Es ist ein Server-Werkzeug. Laut Werkzeugseite wird die Tonspur auf unserem Server in Deutschland verarbeitet und nach der Erkennung gelöscht, der Text nach der Abholung. Die Einzelheiten stehen auf der Werkzeugseite im Abschnitt „Wo die Aufnahme verarbeitet wird“ und in der Datenschutzerklärung.
Datenschutz bei Interviews
Interviews enthalten fast immer personenbezogene Daten. Das Praxisbuch nennt dafür eine Reihe von Pflichten: eine unterschriebene Einwilligungserklärung, Speicherung der Aufnahmen innerhalb der EU oder des EWR, sicheres Löschen nach Projektende und eine Dokumentation dieser Schritte. Wer die Transkription oder Verarbeitung extern vergibt, braucht laut Praxisbuch eine Vereinbarung zur Auftragsverarbeitung. Diese Weitergabe muss außerdem schon in der Einwilligungserklärung stehen. Klären Sie deshalb vor dem ersten Interview mit Ihrer Hochschule, welche Dienste Sie nutzen dürfen.
Anonymisieren Sie das Transkript, bevor es in die Arbeit oder in einen Anhang geht. Ersetzen Sie Namen durch fortlaufende Platzhalter wie [Name 1] und bewahren Sie die Zuordnungsliste getrennt vom Transkript auf.
Typische Fehler
- Regeln erst nach dem dritten Interview festlegen. Dann müssen Sie die ersten Transkripte noch einmal anfassen. Entscheiden Sie vor dem ersten Wort.
- Den KI-Text ungeprüft übernehmen. Jedes Transkript enthält nach dem ersten Durchgang Fehler, ob von Hand oder automatisch. Das Praxisbuch nennt eine Untersuchung, nach der etwa 37 Prozent der Fehler ungeübter Transkribierender die Aussage inhaltlich verfälschen.
- Mehrere Teildateien einzeln transkribieren. Die Zeitmarken passen dann nicht mehr zur Gesamtaufnahme. Fügen Sie Teile vorher zusammen.
- Verrauschte Aufnahme direkt abschreiben. Lüfter, Straßenlärm oder Geschirr kosten bei der Erkennung und beim Korrekturhören Zeit. Was ein Filter retten kann, steht im Ratgeber Hintergrundgeräusche entfernen.
- Gebeugte Namen vergessen. Beim Anonymisieren steht „Krause“ auf der Liste, „Krauses“ aber nicht. Suchen Sie nach dem Ersetzen noch einmal nach Namensteilen.
- Zu lange Tage. Nach dem Praxisbuch sind mehr als 6 Stunden Transkription pro Tag nicht realistisch, ohne dass mehr Fehler entstehen.
Grenzen der automatischen Erkennung
Whisper trennt keine Stimmen. Sprechen zwei Personen gleichzeitig, landet beides in einem Abschnitt, manchmal fehlt das Leisere ganz. Namen, Fachbegriffe und starke Mundart gehen am häufigsten daneben. Das Praxisbuch nennt als ungeeignet vor allem starken Dialekt wie Schweizerdeutsch, viele gleichzeitig sprechende Personen und Hintergrundlärm wie in einer Mensa. Dann bleibt nur das Abtippen von Hand.
Auch Pausen erkennt das Modell schlecht. Es reiht die Abschnitte meist lückenlos aneinander, selbst wenn dazwischen Stille lag. Wenn Ihre Regeln Pausen verlangen, setzen Sie sie beim Korrekturhören. Für eine kurze Sprachnachricht ohne Sprecherwechsel reicht ein einfacheres Werkzeug wie Sprachnachricht in Text.