Zum Inhalt springen
Mörsberger Tools
Bilder & Dateien

Interview transkribieren nach Dresing & Pehl

Transkribiert Interviews für Abschlussarbeit und Forschung mit Zeitmarken und Sprecherwechsel nach den Regeln von Dresing & Pehl und gibt ein Word-Dokument mit Zeilennummern aus; die Tonspur wird auf unserem Server in Deutschland verarbeitet und nach der Erkennung gelöscht.

Von Marvin Mörsberger Zuletzt geprüft: 08.10.2026 Grundlage: Dresing, T. / Pehl, T.: Praxisbuch Interview, Transkription & Analyse, 8. Auflage, Marburg 2018, S. 21–26, 29 und 33 (kostenloses PDF, abgerufen am 08.10.2026) Verarbeitung auf unserem Server in Deutschland

1. Aufnahme und Regeln

MP3, M4A, WAV, OPUS oder Video (MP4, MOV), höchstens 2 Stunden. Bei Videos löst Ihr Browser nur die Tonspur heraus.

Aufnahme hierher ziehen oder antippenErst der Knopf „Hochladen und abschreiben“ sendet die Tonspur an unseren Server.
Sprache der Aufnahme
Regelwerk nach Dresing & Pehl

Inhaltlich-semantisch: „äh“ und „ähm“ fallen weg, Pausen ab etwa 3 Sekunden als (...). Die Erkennung findet Pausen selten, ergänzen Sie sie beim Korrekturhören.

Zeitmarken
Sprecherkürzel
  • Alt + 1I:
  • Alt + 2B:

Vor dem Absenden: Die Tonspur geht über Cloudflare an unseren Server in Deutschland. Dort liegt sie während der Verarbeitung als Datei in einem eigenen temporären Ordner und wird nach der Erkennung gelöscht; den Text verwirft der Dienst, sobald Ihr Browser ihn abgeholt hat. Der Dienst protokolliert weder Dateiname noch Text noch IP-Adresse. Pro Stunde und Anschluss ist eine Aufnahme möglich. Für personenbezogene Forschungsdaten prüfen Sie die Vorgaben Ihrer Hochschule. Einzelheiten stehen unten unter „Wo die Aufnahme verarbeitet wird“.

Grenzen: 2 Stunden Aufnahme, 250 MB Tonspur, eine Aufnahme pro Stunde. Ein Projekt zum Weiterarbeiten laden Sie unten im Export.

2. Transkript prüfen und Sprecher setzen

Ein Absatz je erkanntem Abschnitt. Gleiche Sprecher hintereinander werden im Export zu einem Beitrag zusammengefasst.

Laden Sie das Beispiel oder schicken Sie eine Aufnahme ab. Danach steht hier der Text zum Bearbeiten.

3. Anonymisieren und exportieren

Die Exporte erscheinen, sobald ein Transkript im Editor steht.

Interview transkribieren in vier Schritten

  1. Aufnahme wählen. MP3, M4A, WAV, OPUS oder ein Video. Ihr Browser liest die Länge sofort aus. Ist die Aufnahme länger als zwei Stunden, sehen Sie das, bevor irgendetwas hochgeladen wird.
  2. Hochladen und abschreiben. Der Browser löst die Tonspur heraus und verkleinert sie auf MP3 mit 16 kHz in Mono. Eine Stunde Interview sind dann rund 58 MB. Auf unserem Server schreibt whisper.cpp mit dem Modell large-v3-turbo den Text ab.
  3. Prüfen und Sprecher setzen. Jeder erkannte Abschnitt steht als eigener Absatz im Editor. Klicken Sie auf die Zeit vor einem Absatz, hören Sie genau diese Stelle. Mit Alt + 1 wird der Absatz zur Frage (I:), mit Alt + 2 zur Antwort (B:).
  4. Exportieren. Word mit Zeilennummern für die Abschlussarbeit, TXT für MAXQDA oder f4analyse, SRT und VTT für Untertitel und eine Projektdatei zum Weiterarbeiten.

Mit „Beispiel laden“ probieren Sie Editor und Export ohne Upload aus. Ihr Arbeitsstand bleibt in diesem Browser gespeichert, nur Text und Zeiten, nie die Aufnahme. Laden Sie die Seite neu, bietet das Werkzeug den Stand wieder an.

Regeln nach Dresing & Pehl (einfach, erweitert)

Thorsten Dresing und Thorsten Pehl beschreiben in ihrem kostenlosen Praxisbuch ein inhaltlich-semantisches Regelsystem für Interviewtranskripte, mit einer einfachen und einer erweiterten Stufe. Das Werkzeug setzt die Regeln um, die sich aus Text und Zeiten ableiten lassen. Den Rest erledigen Sie im Editor.

RegelEinfachErweitertDas Werkzeug
Pausenab ca. 3 s „(...)“(.) ca. 1 s, (..) ca. 2 s, (...) ca. 3 s, (Zahl) längersetzt sie nur, wo die Erkennung zwischen zwei Abschnitten eine Lücke lässt. Das ist selten, Pausen ergänzen Sie beim Korrekturhören
Fülllaute „äh“, „ähm“nicht transkribiertwerden transkribiertentfernt sie bei „einfach“
Schreibweiseimmer „hm“ (nicht „mhm“), immer „ähm“ (nicht „öhm“)vereinheitlicht automatisch
Sprecherbeitrageigener Absatz, Leerzeile dazwischen, Zeitmarke mindestens am Absatzendefasst gleiche Sprecher zusammen
Unverständliches„(unv.)“, mit Zeitmarke, wenn innerhalb einer Minute keine andere stehtKnopf „(unv.)“, Zeitmarke automatisch

Nicht automatisch geht, was man hören muss: Betonung in VERSALIEN, Abbrüche mit „/“, Lachen in Klammern, Dialekt ins Hochdeutsche und Rezeptionssignale wie „ja“ oder „genau“, die nur dann ins Transkript gehören, wenn sie eine Antwort sind. Die Regeln stehen im Praxisbuch auf den Seiten 21 bis 25.

Zeitmarken und Sprecher

Eine Zeitmarke hat die Form #hh:mm:ss-z#, das z ist die Zehntelsekunde. Sie wird abgeschnitten, nicht gerundet. Ein Abschnitt, der bei 83,42 Sekunden beginnt, steht also bei #00:01:23-4#, eine Stelle bei 3.723 Sekunden bei #01:02:03-0#. Das Werkzeug setzt die Marke an das Ende jedes Sprecherbeitrags, mit der Endzeit des letzten Abschnitts. So sieht auch das Beispiel im Praxisbuch auf Seite 26 aus. Mit „Zusätzlich jede Minute“ kommen in langen Erzählungen Marken hinzu, sobald seit der letzten eine Minute vergangen ist.

Die Kürzel sind I: für die interviewende und B: für die befragte Person. Für eine Gruppendiskussion fügen Sie B2: oder einen Namen hinzu, bis zu neun Kürzel, jedes mit eigener Taste von Alt + 1 bis Alt + 9. Der Doppelpunkt am Ende ist Teil des Formats, ein Kürzel wie „Dr. Ö:“ wird deshalb als „Dr. Ö“ gespeichert. Steht so etwas mitten im Text, bleibt es Text.

Anonymisieren

Tragen Sie Namen, Orte und Firmen ein und wählen Sie die Art. Beim Export ersetzt das Werkzeug jeden Begriff durch einen Platzhalter, nummeriert nach dem ersten Auftreten im Dokument. Im Beispielinterview kommt „Krause“ dreimal und „Öztürk“ einmal vor. Krause steht zuerst im Text und wird deshalb dreimal zu [Name 1], Öztürk einmal zu [Name 2]. Gebeugte Formen wie „Krauses“ tragen Sie zusätzlich ein. Die Zuordnungsliste mit den Klarnamen gibt es als eigene Datei, die Sie getrennt vom Transkript aufbewahren. Projektdatei und gespeicherter Stand enthalten den Text unverändert.

Übernahme in MAXQDA, f4analyse und Word

Der TXT-Export schreibt jeden Beitrag als eine Zeile I: Text #00:00:06-8#, dazwischen eine Leerzeile, in UTF-8 mit Kennung (BOM) und Windows-Zeilenenden. Das ist das Format von f4transkript, das Dresing & Pehl verwenden. MAXQDA nennt in seiner Hilfe genau dieses Format unter den Zeitmarken, die es beim Import erkennt. Es fragt dann nach der Audiodatei und verknüpft beide. MAXQDA verwirft Zeitmarken, die früher liegen als eine vorherige, deshalb laufen die Marken im Export immer aufsteigend.

Das Word-Dokument hat fortlaufende Zeilennummern über alle Seiten. Kopf und Leerzeilen zwischen den Sprechern zählen nicht mit, damit Sie in der Arbeit sauber zitieren können, etwa „Interview 3, Z. 112–118“. Für einzelne Teile einer langen Aufnahme fügen Sie die Dateien vorher mit MP3 zusammenfügen zusammen oder wandeln exotische Formate mit dem Datei-Converter um.

Grenzen der automatischen Erkennung

Whisper trennt keine Stimmen. Sprechen zwei Personen gleichzeitig, landet beides in einem Abschnitt, manchmal fehlt das Leisere ganz. Namen, Fachbegriffe und starke Mundart sind die häufigsten Fehler. Bei Stille erfindet das Modell gelegentlich Sätze; bekannte Fälle wie Untertitel-Abspänne filtert der Dienst heraus. Die Grenzen der Abschnitte setzt das Modell nicht auf die Zehntelsekunde genau. Vor allem reiht es die Abschnitte meist lückenlos aneinander, auch wenn dazwischen eine Pause lag; in unserem Test mit Pausen von einer bis gut vier Sekunden setzte das Werkzeug deshalb kein einziges Pausenzeichen. Pausen tragen Sie beim Korrekturhören selbst ein, für „(...)“ gibt es einen Knopf. Verrauschte Aufnahmen bessert Rauschen entfernen vorher oft hörbar auf. Für kurze Sprachnachrichten ohne Sprecher reicht Sprachnachricht in Text. Pro Anschluss ist eine Aufnahme je Stunde möglich, höchstens zwei Stunden lang.

Wo die Aufnahme verarbeitet wird

Die Erkennung läuft auf unserem Server in Deutschland, einem Mac Studio, nicht in einem Rechenzentrum eines KI-Anbieters. Ihr Browser löst vorher die Tonspur heraus, von einem Video geht also nur der Ton an den Server, nicht das Bild. Eine Ausnahme gibt es: Kann Ihr Browser die Datei nicht selbst umwandeln (etwa Camcorder-Videos mit AC-3-Ton), bietet die Seite an, die Datei unverändert zu senden, und nennt dabei ihre Größe. Wählen Sie das, geht das ganze Video samt Bild an den Server und wird dort genauso behandelt und gelöscht wie eine Tonspur. Die Daten gehen über Cloudflare an den Server. Dort liegt sie als Datei auf der Festplatte, in einem eigenen temporären Ordner je Auftrag, auf den nur das Benutzerkonto des Dienstes Zugriff hat. Die hochgeladene Datei wird gelöscht, sobald sie in das Arbeitsformat WAV mit 16 kHz umgewandelt ist. Die WAV-Datei und die Ausgabe der Erkennung werden gelöscht, sobald der Text im Arbeitsspeicher steht, und den Text verwirft der Dienst, sobald Ihr Browser ihn abgeholt hat. Brechen Sie ab, löscht er sofort. Was nicht abgeholt wird, entfernt ein Aufräumlauf, der jede Minute prüft, 30 Minuten nach dem Anlegen oder nach der Fertigstellung; wartende oder laufende Aufträge spätestens vier Stunden nach dem Anlegen.

Das Protokoll des Dienstes enthält Dauer, Größe, Status, Rechenzeit und den Grund der Löschung, keinen Dateinamen, keinen Text und keine IP-Adresse. Schreibt er eine Aufnahme bei der Einstellung Deutsch in einer anderen Sprache ab, notiert er deren Kürzel. Der vorgeschaltete Webserver führt für diesen Pfad kein Zugriffsprotokoll, auch nicht für Anfragen, die sein Bot-Schutz abweist. Nur wenn der Dienst nicht erreichbar ist, schreibt er eine Fehlermeldung mit Zeitpunkt und Pfad, ohne IP-Adresse, Kopfzeilen und Abfrage-Parameter; diese Datei wird ab 10 MB gewechselt, die letzten fünf bleiben liegen. Für das Limit von einer Aufnahme pro Stunde hält der Dienst Ihre IP-Adresse gesalzen gehasht im Arbeitsspeicher, das Salz entsteht bei jedem Neustart neu. Für personenbezogene Forschungsdaten prüfen Sie die Vorgaben Ihrer Hochschule.

Häufige Fragen

Welche Transkriptionsregeln brauche ich für die Bachelorarbeit?

Für eine inhaltliche Auswertung, etwa eine qualitative Inhaltsanalyse, reichen meist die einfachen Regeln nach Dresing & Pehl. Wollen Sie Zögern, Pausen und gleichzeitiges Sprechen auswerten, nehmen Sie die erweiterten. Verbindlich ist, was Ihr Lehrstuhl vorgibt.

Erkennt das Werkzeug die Sprecher selbst?

Nein. Die Erkennung liefert Text mit Zeiten, aber keine Sprecher. Sie setzen den Sprecher je Absatz per Auswahlfeld oder mit Alt + 1, Alt + 2 und so weiter.

Wie genau ist die Erkennung?

Bei klarer Aufnahme mit einem Mikrofon pro Person ist der Text meist gut lesbar, Fachbegriffe, Namen und Dialekt gehen aber oft daneben. Planen Sie einen vollständigen Korrekturdurchgang mit Kopfhörer ein.

Wo wird meine Aufnahme verarbeitet?

Auf unserem eigenen Server in Deutschland, erreichbar über Cloudflare. Die Tonspur liegt dort nur während der Verarbeitung als Datei und wird nach der Erkennung gelöscht, der Text nach der Abholung. Für personenbezogene Forschungsdaten prüfen Sie die Vorgaben Ihrer Hochschule.

Kann ich das Transkript in MAXQDA öffnen?

Ja. Der TXT- und der Word-Export setzen Zeitmarken im Format #hh:mm:ss-x#, das MAXQDA laut eigener Hilfe beim Import erkennt und mit der Audiodatei verknüpft.

Quellen

↑ ↓ auswählenEnter öffnen