Interview transkribieren in vier Schritten
- Aufnahme wählen. MP3, M4A, WAV, OPUS oder ein Video. Ihr Browser liest die Länge sofort aus. Ist die Aufnahme länger als zwei Stunden, sehen Sie das, bevor irgendetwas hochgeladen wird.
- Hochladen und abschreiben. Der Browser löst die Tonspur heraus und verkleinert sie auf MP3 mit 16 kHz in Mono. Eine Stunde Interview sind dann rund 58 MB. Auf unserem Server schreibt whisper.cpp mit dem Modell large-v3-turbo den Text ab.
- Prüfen und Sprecher setzen. Jeder erkannte Abschnitt steht als eigener Absatz im Editor. Klicken Sie auf die Zeit vor einem Absatz, hören Sie genau diese Stelle. Mit Alt + 1 wird der Absatz zur Frage (I:), mit Alt + 2 zur Antwort (B:).
- Exportieren. Word mit Zeilennummern für die Abschlussarbeit, TXT für MAXQDA oder f4analyse, SRT und VTT für Untertitel und eine Projektdatei zum Weiterarbeiten.
Mit „Beispiel laden“ probieren Sie Editor und Export ohne Upload aus. Ihr Arbeitsstand bleibt in diesem Browser gespeichert, nur Text und Zeiten, nie die Aufnahme. Laden Sie die Seite neu, bietet das Werkzeug den Stand wieder an.
Regeln nach Dresing & Pehl (einfach, erweitert)
Thorsten Dresing und Thorsten Pehl beschreiben in ihrem kostenlosen Praxisbuch ein inhaltlich-semantisches Regelsystem für Interviewtranskripte, mit einer einfachen und einer erweiterten Stufe. Das Werkzeug setzt die Regeln um, die sich aus Text und Zeiten ableiten lassen. Den Rest erledigen Sie im Editor.
| Regel | Einfach | Erweitert | Das Werkzeug |
|---|---|---|---|
| Pausen | ab ca. 3 s „(...)“ | (.) ca. 1 s, (..) ca. 2 s, (...) ca. 3 s, (Zahl) länger | setzt sie nur, wo die Erkennung zwischen zwei Abschnitten eine Lücke lässt. Das ist selten, Pausen ergänzen Sie beim Korrekturhören |
| Fülllaute „äh“, „ähm“ | nicht transkribiert | werden transkribiert | entfernt sie bei „einfach“ |
| Schreibweise | immer „hm“ (nicht „mhm“), immer „ähm“ (nicht „öhm“) | vereinheitlicht automatisch | |
| Sprecherbeitrag | eigener Absatz, Leerzeile dazwischen, Zeitmarke mindestens am Absatzende | fasst gleiche Sprecher zusammen | |
| Unverständliches | „(unv.)“, mit Zeitmarke, wenn innerhalb einer Minute keine andere steht | Knopf „(unv.)“, Zeitmarke automatisch | |
Nicht automatisch geht, was man hören muss: Betonung in VERSALIEN, Abbrüche mit „/“, Lachen in Klammern, Dialekt ins Hochdeutsche und Rezeptionssignale wie „ja“ oder „genau“, die nur dann ins Transkript gehören, wenn sie eine Antwort sind. Die Regeln stehen im Praxisbuch auf den Seiten 21 bis 25.
Zeitmarken und Sprecher
Eine Zeitmarke hat die Form #hh:mm:ss-z#, das z ist die Zehntelsekunde. Sie wird abgeschnitten, nicht gerundet.
Ein Abschnitt, der bei 83,42 Sekunden beginnt, steht also bei #00:01:23-4#, eine Stelle bei 3.723 Sekunden
bei #01:02:03-0#. Das Werkzeug setzt die Marke an das Ende jedes Sprecherbeitrags, mit der Endzeit des letzten
Abschnitts. So sieht auch das Beispiel im Praxisbuch auf Seite 26 aus. Mit „Zusätzlich jede Minute“ kommen in langen
Erzählungen Marken hinzu, sobald seit der letzten eine Minute vergangen ist.
Die Kürzel sind I: für die interviewende und B: für die befragte Person. Für eine Gruppendiskussion fügen Sie B2: oder einen Namen hinzu, bis zu neun Kürzel, jedes mit eigener Taste von Alt + 1 bis Alt + 9. Der Doppelpunkt am Ende ist Teil des Formats, ein Kürzel wie „Dr. Ö:“ wird deshalb als „Dr. Ö“ gespeichert. Steht so etwas mitten im Text, bleibt es Text.
Anonymisieren
Tragen Sie Namen, Orte und Firmen ein und wählen Sie die Art. Beim Export ersetzt das Werkzeug jeden Begriff durch einen Platzhalter, nummeriert nach dem ersten Auftreten im Dokument. Im Beispielinterview kommt „Krause“ dreimal und „Öztürk“ einmal vor. Krause steht zuerst im Text und wird deshalb dreimal zu [Name 1], Öztürk einmal zu [Name 2]. Gebeugte Formen wie „Krauses“ tragen Sie zusätzlich ein. Die Zuordnungsliste mit den Klarnamen gibt es als eigene Datei, die Sie getrennt vom Transkript aufbewahren. Projektdatei und gespeicherter Stand enthalten den Text unverändert.
Übernahme in MAXQDA, f4analyse und Word
Der TXT-Export schreibt jeden Beitrag als eine Zeile I: Text #00:00:06-8#, dazwischen eine Leerzeile, in UTF-8
mit Kennung (BOM) und Windows-Zeilenenden. Das ist das Format von f4transkript, das Dresing & Pehl verwenden. MAXQDA nennt in seiner Hilfe
genau dieses Format unter den Zeitmarken, die es beim Import erkennt. Es fragt dann nach der Audiodatei und verknüpft beide.
MAXQDA verwirft Zeitmarken, die früher liegen als eine vorherige, deshalb laufen die Marken im Export immer aufsteigend.
Das Word-Dokument hat fortlaufende Zeilennummern über alle Seiten. Kopf und Leerzeilen zwischen den Sprechern zählen nicht mit, damit Sie in der Arbeit sauber zitieren können, etwa „Interview 3, Z. 112–118“. Für einzelne Teile einer langen Aufnahme fügen Sie die Dateien vorher mit MP3 zusammenfügen zusammen oder wandeln exotische Formate mit dem Datei-Converter um.
Grenzen der automatischen Erkennung
Whisper trennt keine Stimmen. Sprechen zwei Personen gleichzeitig, landet beides in einem Abschnitt, manchmal fehlt das Leisere ganz. Namen, Fachbegriffe und starke Mundart sind die häufigsten Fehler. Bei Stille erfindet das Modell gelegentlich Sätze; bekannte Fälle wie Untertitel-Abspänne filtert der Dienst heraus. Die Grenzen der Abschnitte setzt das Modell nicht auf die Zehntelsekunde genau. Vor allem reiht es die Abschnitte meist lückenlos aneinander, auch wenn dazwischen eine Pause lag; in unserem Test mit Pausen von einer bis gut vier Sekunden setzte das Werkzeug deshalb kein einziges Pausenzeichen. Pausen tragen Sie beim Korrekturhören selbst ein, für „(...)“ gibt es einen Knopf. Verrauschte Aufnahmen bessert Rauschen entfernen vorher oft hörbar auf. Für kurze Sprachnachrichten ohne Sprecher reicht Sprachnachricht in Text. Pro Anschluss ist eine Aufnahme je Stunde möglich, höchstens zwei Stunden lang.
Wo die Aufnahme verarbeitet wird
Die Erkennung läuft auf unserem Server in Deutschland, einem Mac Studio, nicht in einem Rechenzentrum eines KI-Anbieters. Ihr Browser löst vorher die Tonspur heraus, von einem Video geht also nur der Ton an den Server, nicht das Bild. Eine Ausnahme gibt es: Kann Ihr Browser die Datei nicht selbst umwandeln (etwa Camcorder-Videos mit AC-3-Ton), bietet die Seite an, die Datei unverändert zu senden, und nennt dabei ihre Größe. Wählen Sie das, geht das ganze Video samt Bild an den Server und wird dort genauso behandelt und gelöscht wie eine Tonspur. Die Daten gehen über Cloudflare an den Server. Dort liegt sie als Datei auf der Festplatte, in einem eigenen temporären Ordner je Auftrag, auf den nur das Benutzerkonto des Dienstes Zugriff hat. Die hochgeladene Datei wird gelöscht, sobald sie in das Arbeitsformat WAV mit 16 kHz umgewandelt ist. Die WAV-Datei und die Ausgabe der Erkennung werden gelöscht, sobald der Text im Arbeitsspeicher steht, und den Text verwirft der Dienst, sobald Ihr Browser ihn abgeholt hat. Brechen Sie ab, löscht er sofort. Was nicht abgeholt wird, entfernt ein Aufräumlauf, der jede Minute prüft, 30 Minuten nach dem Anlegen oder nach der Fertigstellung; wartende oder laufende Aufträge spätestens vier Stunden nach dem Anlegen.
Das Protokoll des Dienstes enthält Dauer, Größe, Status, Rechenzeit und den Grund der Löschung, keinen Dateinamen, keinen Text und keine IP-Adresse. Schreibt er eine Aufnahme bei der Einstellung Deutsch in einer anderen Sprache ab, notiert er deren Kürzel. Der vorgeschaltete Webserver führt für diesen Pfad kein Zugriffsprotokoll, auch nicht für Anfragen, die sein Bot-Schutz abweist. Nur wenn der Dienst nicht erreichbar ist, schreibt er eine Fehlermeldung mit Zeitpunkt und Pfad, ohne IP-Adresse, Kopfzeilen und Abfrage-Parameter; diese Datei wird ab 10 MB gewechselt, die letzten fünf bleiben liegen. Für das Limit von einer Aufnahme pro Stunde hält der Dienst Ihre IP-Adresse gesalzen gehasht im Arbeitsspeicher, das Salz entsteht bei jedem Neustart neu. Für personenbezogene Forschungsdaten prüfen Sie die Vorgaben Ihrer Hochschule.