Zum Inhalt springen
Mörsberger Tools
Bilder & Dateien

Wie transkribiert man ein Interview? Regeln, Zeitaufwand und ein Beispiel

Ein Interview transkribieren Sie, indem Sie die Aufnahme nach festen Regeln Wort für Wort aufschreiben, jeden Redebeitrag als eigenen Absatz mit Sprecherkürzel wie I: oder B: setzen und das Ergebnis mit Kopfhörer Korrektur hören. Für Abschlussarbeiten reichen meist die einfachen Regeln nach Dresing & Pehl; planen Sie dafür von Hand das 5- bis 10-Fache der Interviewdauer ein, mit automatischer Erkennung deutlich weniger.

Zum Werkzeug: Interview transkribierenInterview abschreiben lassen, Sprecher setzen, anonymisieren und als Word mit Zeilennummern ausgeben.

Sechs Interviews sind geführt, die Aufnahmen liegen auf dem Laptop, und die Abgabe ist in acht Wochen. Jetzt kommt der Teil, den fast alle unterschätzen: das Abschreiben. Wer vorher weiß, nach welchen Regeln er schreibt und wie lange das dauert, spart sich doppelte Arbeit.

Interview transkribieren: Schritt für Schritt

  1. Regelsystem festlegen. Klären Sie vor dem ersten Wort, nach welchen Regeln Sie schreiben. Fragen Sie Ihren Lehrstuhl, ob es eine Vorgabe gibt. Gibt es keine, sind die einfachen Regeln nach Dresing & Pehl ein verbreiteter Standard.
  2. Aufnahme vorbereiten. Ist das Gespräch auf mehrere Dateien verteilt, fügen Sie sie zu einer zusammen, zum Beispiel mit MP3 zusammenfügen. Sonst beginnen die Zeitmarken in jedem Teil wieder bei null.
  3. Rohtext erzeugen. Von Hand mit Kopfhörer und einem Programm, das langsamer abspielen und kurz zurückspringen kann. Oder automatisch mit einer Spracherkennung.
  4. Sprecher setzen. Jeder Redebeitrag bekommt einen eigenen Absatz mit Kürzel und Doppelpunkt, etwa I: für die interviewende und B: für die befragte Person.
  5. Korrektur hören. Den ganzen Text lesen und dabei die Aufnahme noch einmal hören. Dabei tragen Sie Pausen, Lachen und unverständliche Stellen nach.
  6. Anonymisieren und exportieren. Namen, Orte und Firmen durch Platzhalter ersetzen, dann als Word-Datei oder für Ihre Analysesoftware speichern.

Transkriptionsregeln nach Dresing & Pehl

Thorsten Dresing und Thorsten Pehl beschreiben in ihrem kostenlosen Praxisbuch ein Regelsystem für die inhaltlich-semantische Transkription. Die 9. Auflage von 2024 fasst die Grundregeln in fünf Punkten zusammen. Dazu kommen Erweiterungsmodule, die Sie je nach Forschungsfrage einzeln oder komplett übernehmen.

ThemaGrundregelnErweiterungsmodule
Wortlautjedes Wort aufschreiben, Dialekt an Schriftdeutsch annähernzusätzlich Wort- und Satzabbrüche mit „/“, Wortdoppelungen immer
„hm“, „ja“, „genau“weglassen, wenn sie den Redefluss nicht unterbrechen; aufschreiben, wenn sie eine Antwort sindRezeptionssignale und Fülllaute aller Personen werden transkribiert, außer dem Backchanneling der interviewenden Person, solange es den Redefluss nicht unterbricht
Pausendeutliche Pausen ab 3 Sekunden als „(…)“„(.)“ ca. 1 s, „(..)“ ca. 2 s, „(…)“ ca. 3 s, „(Zahl)“ länger
Emotion, BetonungLachen, Seufzen in Klammern; Betontes in VERSALIENnach „hm“ die Bedeutung, z. B. „hm (bejahend)“
Unverständliches„(unv.)“ oder vermuteter Wortlaut mit Fragezeichen, etwa „(Glück?)“wie Grundregeln
Überlappungennicht vorgesehenmit „//“ markiert

Dazu gibt das Praxisbuch Schreibempfehlungen. „hm“ wird immer „hm“ geschrieben, nie „mhm“. Zögerungslaute werden immer „ähm“, nie „öhm“. Einheiten werden ausgeschrieben, also „Euro“ statt „€“. Die Höflichkeitsform „Sie“ wird groß geschrieben, „du“ klein. Wer mehrere Interviews im Team abtippt, sollte diese Liste ausdrucken. Sonst sieht jedes Transkript anders aus.

Transkription Interview: ein Beispiel

So sieht ein kurzer Ausschnitt nach den Grundregeln aus. Die Zeitmarke am Ende des Absatzes hat das Format #hh:mm:ss-z#, das z ist die Zehntelsekunde.

I: Wie sind Sie zu dem Verein gekommen? #00:01:23-4#

B: Über eine Nachbarin, die hat mich einfach mal mitgenommen. (…) Und dann bin ich geblieben, das war so 2019. (lacht) Eigentlich wollte ich nur EINMAL zuschauen. #00:01:41-8#

I: War das Ihr erster Verein? #00:01:44-0#

B: Ja. #00:01:45-2#

Das kurze „Ja“ steht als eigener Absatz, weil es die Antwort auf eine Frage ist (Regeln 2 und 5). Hätte die interviewende Person während der Antwort „ja“ gemurmelt, ohne den Redefluss zu unterbrechen, fiele es nach den Grundregeln weg.

Zur Zeitmarke: Eine Stelle bei 2.712,58 Sekunden sind 45 Minuten (2.700 Sekunden) plus 12,58 Sekunden. Die Zehntel werden abgeschnitten, nicht gerundet. Die Marke lautet also #00:45:12-5#. Laut Praxisbuch dienen Zeitmarken nicht zum Zitieren. Sie erlauben, in MAXQDA oder f4analyse per Klick an die passende Stelle der Aufnahme zu springen.

Wie lange dauert es, ein Interview zu transkribieren?

Für einfache Regelsysteme nennt das Praxisbuch das 5- bis 10-Fache der Interviewdauer, inklusive Korrekturlesen. Der schnellste dort gemessene Wert lag bei etwa 1 zu 3, ohne Korrekturdurchgang. Detaillierte Systeme für die Gesprächsanalyse brauchen ein Vielfaches davon. Mehr als 6 Stunden Transkription pro Tag halten die Autoren nicht für realistisch, ohne dass die Fehlerrate steigt.

Rechenbeispiel für eine Bachelorarbeit: sechs Interviews zu je 45 Minuten.

SchrittRechnungErgebnis
Aufnahmedauer gesamt6 × 45 min270 min = 4,5 h
von Hand, untere Grenze4,5 h × 522,5 h
von Hand, obere Grenze4,5 h × 1045 h
Arbeitstage bei 6 h am Tag22,5 h ÷ 6knapp 4 Tage
Arbeitstage bei 4 h am Tag45 h ÷ 4gut 11 Tage
mit KI-Rohtext, bei rund 50 % Ersparnis22,5 h ÷ 2 bis 45 h ÷ 2etwa 11 bis 23 h

Die letzte Zeile ist eine eigene Rechnung. Die Autoren sprechen aus ihrer Praxis von „rund 50 Prozent und mehr“, die Rechnung nimmt den unteren Wert. Öffentliche Studien zum Zeitaufwand mit Korrektur gibt es laut Praxisbuch bisher nicht. Wie viel Sie tatsächlich sparen, hängt vor allem von der Tonqualität ab.

Interview transkribieren mit KI

Seit etwa 2022 ist die automatische Spracherkennung nach Einschätzung von Dresing & Pehl für qualitative Interviews brauchbar. Sie erzeugt einen Rohtext, den Sie danach korrigieren. Unser Werkzeug Interview transkribieren nutzt dafür whisper.cpp mit dem Modell large-v3-turbo. Das ist laut OpenAI eine schnellere Fassung von Whisper large-v3 mit geringem Verlust an Genauigkeit.

Das Werkzeug liefert Text mit Zeiten, aber keine Sprecher. Den Sprecher setzen Sie je Absatz mit Alt + 1, Alt + 2 und so weiter. Es setzt die Regeln um, die sich aus Text und Zeiten ableiten lassen. Bei „einfach“ entfernt es Fülllaute, es vereinheitlicht „hm“ und „ähm“ und setzt Zeitmarken. Was man hören muss, tragen Sie selbst nach: Betonung, Lachen, Abbrüche und die meisten Pausen. Für Abschlussarbeiten gibt es ein Word-Dokument mit Zeilennummern aus, für MAXQDA und f4analyse eine TXT-Datei mit Zeitmarken.

Es ist ein Server-Werkzeug. Laut Werkzeugseite wird die Tonspur auf unserem Server in Deutschland verarbeitet und nach der Erkennung gelöscht, der Text nach der Abholung. Die Einzelheiten stehen auf der Werkzeugseite im Abschnitt „Wo die Aufnahme verarbeitet wird“ und in der Datenschutzerklärung.

Datenschutz bei Interviews

Interviews enthalten fast immer personenbezogene Daten. Das Praxisbuch nennt dafür eine Reihe von Pflichten: eine unterschriebene Einwilligungserklärung, Speicherung der Aufnahmen innerhalb der EU oder des EWR, sicheres Löschen nach Projektende und eine Dokumentation dieser Schritte. Wer die Transkription oder Verarbeitung extern vergibt, braucht laut Praxisbuch eine Vereinbarung zur Auftragsverarbeitung. Diese Weitergabe muss außerdem schon in der Einwilligungserklärung stehen. Klären Sie deshalb vor dem ersten Interview mit Ihrer Hochschule, welche Dienste Sie nutzen dürfen.

Anonymisieren Sie das Transkript, bevor es in die Arbeit oder in einen Anhang geht. Ersetzen Sie Namen durch fortlaufende Platzhalter wie [Name 1] und bewahren Sie die Zuordnungsliste getrennt vom Transkript auf.

Typische Fehler

  • Regeln erst nach dem dritten Interview festlegen. Dann müssen Sie die ersten Transkripte noch einmal anfassen. Entscheiden Sie vor dem ersten Wort.
  • Den KI-Text ungeprüft übernehmen. Jedes Transkript enthält nach dem ersten Durchgang Fehler, ob von Hand oder automatisch. Das Praxisbuch nennt eine Untersuchung, nach der etwa 37 Prozent der Fehler ungeübter Transkribierender die Aussage inhaltlich verfälschen.
  • Mehrere Teildateien einzeln transkribieren. Die Zeitmarken passen dann nicht mehr zur Gesamtaufnahme. Fügen Sie Teile vorher zusammen.
  • Verrauschte Aufnahme direkt abschreiben. Lüfter, Straßenlärm oder Geschirr kosten bei der Erkennung und beim Korrekturhören Zeit. Was ein Filter retten kann, steht im Ratgeber Hintergrundgeräusche entfernen.
  • Gebeugte Namen vergessen. Beim Anonymisieren steht „Krause“ auf der Liste, „Krauses“ aber nicht. Suchen Sie nach dem Ersetzen noch einmal nach Namensteilen.
  • Zu lange Tage. Nach dem Praxisbuch sind mehr als 6 Stunden Transkription pro Tag nicht realistisch, ohne dass mehr Fehler entstehen.

Grenzen der automatischen Erkennung

Whisper trennt keine Stimmen. Sprechen zwei Personen gleichzeitig, landet beides in einem Abschnitt, manchmal fehlt das Leisere ganz. Namen, Fachbegriffe und starke Mundart gehen am häufigsten daneben. Das Praxisbuch nennt als ungeeignet vor allem starken Dialekt wie Schweizerdeutsch, viele gleichzeitig sprechende Personen und Hintergrundlärm wie in einer Mensa. Dann bleibt nur das Abtippen von Hand.

Auch Pausen erkennt das Modell schlecht. Es reiht die Abschnitte meist lückenlos aneinander, selbst wenn dazwischen Stille lag. Wenn Ihre Regeln Pausen verlangen, setzen Sie sie beim Korrekturhören. Für eine kurze Sprachnachricht ohne Sprecherwechsel reicht ein einfacheres Werkzeug wie Sprachnachricht in Text.

Jetzt ausprobieren: Interview transkribierenKostenlos, ohne Anmeldung.

Häufige Fragen

Welche Transkriptionsregeln nehme ich für die Bachelorarbeit?

Für eine inhaltliche Auswertung, etwa eine qualitative Inhaltsanalyse, reichen in der Regel die einfachen Regeln nach Dresing & Pehl. Wenn Sie Pausen, Abbrüche oder gleichzeitiges Sprechen auswerten wollen, nehmen Sie die Erweiterungsmodule dazu. Verbindlich ist, was Ihr Lehrstuhl vorgibt. Nennen Sie das gewählte Regelsystem in der Methodik.

Wie lange dauert es, ein Interview von einer Stunde zu transkribieren?

Von Hand nach einfachen Regeln fünf bis zehn Stunden, inklusive Korrekturlesen. So steht es im Praxisbuch von Dresing & Pehl. Mit automatischer Erkennung schätzen die Autoren aus eigener Erfahrung eine Ersparnis von „rund 50 Prozent und mehr“, öffentliche Studien dazu gibt es laut Praxisbuch noch nicht.

Kann ich ein Interview kostenlos mit KI transkribieren?

Ja. Unser Werkzeug „Interview transkribieren“ schreibt die Aufnahme mit whisper.cpp und dem Modell large-v3-turbo ab, kostenlos und ohne Anmeldung. Pro Anschluss ist eine Aufnahme je Stunde möglich, höchstens zwei Stunden lang. Den Korrekturdurchgang nimmt Ihnen keine Software ab.

Muss das Transkript Zeilennummern haben?

Das hängt von Ihrer Vorgabe ab. Laut Praxisbuch zitiert man in inhaltsanalytischen Arbeiten meist mit Absatznummern, gesprächsanalytische Verfahren nutzen eher Zeilennummern. MAXQDA und f4analyse setzen Absatznummern selbst. Unser Werkzeug gibt ein Word-Dokument mit fortlaufenden Zeilennummern aus, falls Ihr Lehrstuhl sie verlangt.

Darf ich Interviews mit einem Online-Dienst transkribieren?

Nur, wenn das zu Ihrer Einwilligungserklärung und den Regeln Ihrer Hochschule passt. Das Praxisbuch nennt für die externe Verarbeitung eine Vereinbarung zur Auftragsverarbeitung und empfiehlt, das vorab mit dem Datenschutzbeauftragten der Hochschule zu klären. Wie unser Werkzeug mit der Aufnahme umgeht, steht auf der Werkzeugseite und in der Datenschutzerklärung.

Quellen

↑ ↓ auswählenEnter öffnen