Ein Interview im Café, eine Sprachnachricht von der Baustelle, ein Video vom Kindergeburtstag mit Wind am Mikrofon: Das Wichtigste ist drauf, aber schwer zu verstehen. Manches lässt sich nachträglich retten, anderes nicht.
Welche Geräusche sich entfernen lassen
Für einen Filter gibt es zwei Arten von Störung. Gleichmäßige Geräusche bleiben über die ganze Aufnahme ähnlich: Rauschen des Mikrofons, Lüfter, Klimaanlage, Kühlschrank, Netzbrummen bei 50 Hz. Wechselnde Geräusche kommen und gehen: Autos, Geschirr, Tastaturklicken, ein bellender Hund, Wind. Die erste Art schafft jeder Rauschfilter. Die zweite nur einer, der gelernt hat, wie Sprache klingt.
| Störung | Klassischer Filter (Audacity) | KI-Filter (DeepFilterNet) |
|---|---|---|
| Rauschen, Lüfter, Brummen | gut | gut |
| Straßenlärm, Stimmengewirr im Raum | schwach | gut bis mittel |
| Klicken, Geschirr, kurze Knalle | kaum | gut |
| Wind am Mikrofon | kaum | mittel, oft hörbare Reste |
| Hall in großen Räumen | nein | teilweise |
| andere Stimme im Vordergrund, Musik | nein | nein, Musik wird nur gedämpft |
So arbeiten die Filter
Der klassische Weg heißt spektrale Subtraktion und ist seit den späten 1970er-Jahren bekannt. Sie zeigen dem Programm eine Stelle, an der nur das Störgeräusch zu hören ist, etwa die zwei Sekunden vor dem ersten Wort. Das Programm merkt sich, wie laut jede Frequenz dort ist, und zieht diesen Anteil von der ganzen Aufnahme ab. Bei gleichmäßigem Rauschen funktioniert das gut. Ändert sich die Störung, passt das gemerkte Profil nicht mehr.
Ein KI-Filter wie DeepFilterNet, entwickelt an der Universität Erlangen-Nürnberg (erste Fassung 2021, die dritte Version DeepFilterNet3 erschien 2023), braucht kein Störprofil. Ein neuronales Netz schätzt für jedes kurze Zeitfenster und jedes Frequenzband, wie viel davon Stimme ist, und dämpft den Rest. Weil es auf großen Mengen Sprache trainiert wurde, erkennt es auch Geräusche, die nur kurz auftreten. Dafür gilt alles, was nicht nach Sprache klingt, als Störung, auch Musik.
Die Wege im Vergleich
iPhone, App „Sprachmemos“: Apple beschreibt in der aktuellen iPhone-Anleitung einen Filter, der schon beim Aufnehmen greift. Während die App läuft, öffnen Sie das Kontrollzentrum, tippen oben auf „Sprachmemos“ und wählen „Stimmisolation“. „Breites Spektrum“ nimmt die Umgebung dagegen bewusst mit. Für eine fertige Aufnahme in Sprachmemos gibt es die Option „Aufnahme optimieren“: Aufnahme antippen, „Optionen“ wählen und die Option einschalten. Laut Apple reduziert sie Hintergrundgeräusche und Echo, wenn Sie Mono- oder Stereo-Aufnahmen abspielen. Die Datei selbst ändert sich dadurch nicht; wer die bereinigte Fassung weitergeben will, braucht einen anderen Weg. Für ein Video oder eine WhatsApp-Nachricht hilft beides nicht. Für Telefonate und Videoanrufe gibt es im Kontrollzentrum eine ähnliche Mikrofoneinstellung, die ebenfalls nur live wirkt.
Audacity (Windows, Mac, Linux, kostenlos): Markieren Sie eine Stelle nur mit Störgeräusch, wählen Sie „Effekt“, „Rauschentfernung und Reparatur“, „Rauschverminderung“ und klicken Sie auf „Rauschprofil ermitteln“. Danach markieren Sie die ganze Aufnahme, öffnen den Effekt erneut und bestätigen. Mit dem Regler für die Rauschverminderung in dB stellen Sie ein, wie stark gedämpft wird. Für einen Lüfter oder ein rauschendes Ansteckmikrofon ist das ein sehr guter Weg.
Schnittprogramme: Viele Videoschnittprogramme haben inzwischen eigene Rauschfilter. Ihre Qualität schwankt stark, und die besten stecken oft in Bezahlversionen.
Im Browser: Rauschen und Hintergrundgeräusche entfernen nutzt DeepFilterNet3 auf unserem Server. Sie brauchen kein Störprofil und keine Installation, wählen nur die Stärke und hören Original und Ergebnis direkt untereinander.
Schritt für Schritt: ein Interview aus dem Café
Ein Beispiel. Eine Vereinsvorsitzende hat ein Gespräch von acht Minuten mit dem Handy aufgenommen, die Datei heißt Interview.m4a. Im Hintergrund laufen eine Kaffeemaschine, Geschirr und leises Stimmengewirr.
- Rauschen entfernen öffnen und die Datei in das Feld ziehen.
- Stärke „Mittel“ wählen. Sie dämpft Störungen um höchstens 24 dB und hält die Stimme natürlich.
- Ausgabeformat MP3 wählen, wenn die Datei weitergeschickt wird, sonst FLAC oder WAV.
- „Hochladen und entrauschen“ drücken. Der Filter rechnet in unseren Messungen etwa 18-mal schneller als Echtzeit, acht Minuten sind also nach knapp einer halben Minute fertig, dazu kommt der Upload.
- Beide Fassungen anhören. Ist die Kaffeemaschine noch deutlich, mit „Stark“ wiederholen, und zwar mit dem Original.
Wie viel ein Filter bringt, zeigt unser Test mit 60 Sekunden gesprochenem Text und weißem Rauschen bei 5 dB Signal-Rausch-Abstand. Nach dem Filter in der Stärke „Stark“ lag der Abstand bei 16,6 dB, also 11,6 dB besser. In Leistung gerechnet ist die Störung damit rund vierzehnmal schwächer als vorher.
Soll das Gespräch danach abgetippt werden, schicken Sie die gefilterte Fassung an Interview transkribieren. Die Spracherkennung macht auf einer sauberen Aufnahme weniger Fehler.
WhatsApp-Sprachnachrichten verständlich machen
Eine Sprachnachricht von der Baustelle oder aus dem Zug ist ein häufiger Fall. WhatsApp speichert solche Nachrichten als Datei mit der Endung .opus, und genau diese Datei nimmt das Werkzeug an.
Am iPhone: Halten Sie die Sprachnachricht gedrückt, wählen Sie „Weiterleiten“ und dann unten das Teilen-Symbol. Mit „In Dateien sichern“ landet die Datei in der Dateien-App. Von dort ziehen oder wählen Sie sie im Browser aus.
Unter Android: Die Dateien liegen im internen Speicher, je nach Android-Version unter Android/media/com.whatsapp/WhatsApp/Media/WhatsApp Voice Notes, sortiert in Wochenordnern. Einfacher ist oft auch hier das Teilen-Menü der Nachricht.
Nach dem Filtern laden Sie das Ergebnis als MP3 herunter und können es wieder verschicken. Für Sprachnachrichten reicht meist die Stufe „Mittel“. Ist der Sprecher kaum zu hören, weil das Handy in der Jackentasche steckte, hilft auch der beste Filter nur begrenzt.
Videos: nur der Ton wird bearbeitet
Bei einem Video löst Ihr Browser die Tonspur heraus und schickt nur diese an den Server. Das Bild bleibt auf Ihrem Gerät. Zurück kommt die gefilterte Tonspur als Audiodatei, und zwar immer in Mono; aus Stereo wird also Mono. Diese legen Sie im Schnittprogramm unter das Video und schalten den Originalton stumm, etwa in iMovie, Clipchamp oder DaVinci Resolve. Videos bis 500 MB werden angenommen, gefiltert werden bis zu zehn Minuten Ton.
Was mit Ihrer Aufnahme passiert
Der Filter läuft nicht im Browser, weil das Modell samt Rechenbibliothek mehrere Hundert Megabyte groß ist. Bei einer Audiodatei geht die Datei selbst, bei einem Video nur die Tonspur verschlüsselt an Cloudflare, das die Verbindung zum Weiterleiten entschlüsselt und die Daten durch einen verschlüsselten Tunnel an unseren Server in Deutschland schickt. Dort läuft sie in einem abgeschotteten Container ohne Internetzugang, wird nur im Arbeitsspeicher verarbeitet und direkt nach der Antwort gelöscht. Protokolliert werden weder Inhalt noch Dateiname noch IP-Adresse, auch nicht in den Fehlermeldungen des vorgeschalteten Webservers; für das Stundenlimit speichert der Dienst statt der IP-Adresse nur einen daraus gebildeten Prüfwert, höchstens eine Stunde lang. Erlaubt sind sechs Aufträge pro Stunde.
Besser aufnehmen: die wirksamste Rauschunterdrückung
Kein Filter holt zurück, was nie aufgenommen wurde. Vier Dinge helfen mehr als jede Nachbearbeitung:
- Näher ran: Halbiert sich der Abstand zum Mund, wird die Stimme etwa 6 dB lauter, das Umfeld bleibt gleich. Ein Handy auf dem Tisch zwischen zwei Personen ist fast immer zu weit weg.
- Wind abschirmen: Draußen mit dem Rücken zum Wind sprechen oder das Mikrofon mit der Hand abschatten. Ein Windschutz aus Schaumstoff kostet wenige Euro.
- Raum wählen: Teppich, Vorhänge und Polstermöbel schlucken Hall. Kahle Küchen und Treppenhäuser klingen hallig.
- Störquellen abschalten: Lüfter, Kühlschrank und Spülmaschine für die Dauer der Aufnahme aus.
Typische Fehler
- Zu stark gefiltert: Die Stimme klingt trocken und künstlich. Beginnen Sie mit der mittleren Stufe.
- Zweimal gefiltert: Das Ergebnis wird nicht sauberer, nur dumpfer.
- Übersteuerte Aufnahme: Ist die Stimme schon verzerrt, bleibt sie es. Ein Filter repariert keine Übersteuerung.
- Musik entfernen wollen: Hintergrundmusik wird gedämpft, aber nicht sauber getrennt.
- Zu lange Aufnahme: Über zehn Minuten teilen Sie die Datei vorher auf. Mehrere Teile führen Sie danach mit MP3 zusammenfügen wieder zu einer Datei zusammen.
Wer aus einer gereinigten Aufnahme einen Klingelton schneiden will, findet die Schritte im Ratgeber Lied als Klingelton aufs iPhone.