Geräusche entfernen in drei Schritten
Ziehen Sie eine Aufnahme in das Feld: eine Sprachnachricht, ein Interview vom Handy, eine Videokonferenz-Aufzeichnung oder ein Video. Wählen Sie die Stärke und das Ausgabeformat. Mit „Hochladen und entrauschen“ geht die Tonspur an unseren Server, der Filter läuft, und daneben (am Handy darunter) erscheint die bereinigte Fassung zum Anhören und Herunterladen. Den Vergleich hören Sie direkt untereinander: oben das Original, darunter das Ergebnis.
Mit „Beispiel laden“ hören Sie den Effekt ohne eigene Datei. Das Beispiel ist künstlich erzeugt: eine Folge von Vokalen mit einer Grundfrequenz von 120 Hz, darunter weißes Rauschen fünf Dezibel unter dem Sprachpegel und ein leises 50-Hz-Brummen, wie es von schlecht geerdeten Geräten kommt.
So arbeitet der Filter
Das Werkzeug nutzt DeepFilterNet3, ein neuronales Netz von Hendrik Schröter und Kollegen an der Universität Erlangen-Nürnberg, veröffentlicht 2023. Es zerlegt den Ton in kurze Zeitfenster und Frequenzbänder, schätzt für jedes Band, wie viel davon Sprache ist, und dämpft den Rest. Im unteren Frequenzbereich, wo die Stimme ihre Obertöne hat, rechnet es zusätzlich mit einem Filter über mehrere Zeitfenster und erhält so die Feinstruktur der Stimme. Die Aufnahme wird dafür auf 48 kHz und einen Kanal umgerechnet. Stereo wird also zu Mono.
Ein Zahlenbeispiel aus unserem Test: 60 Sekunden gesprochener Text, gemischt mit weißem Rauschen bei 5 dB Signal-Rausch-Abstand. Nach dem Filter in der Stärke „Stark“ lag der Abstand bei 16,6 dB, ein Gewinn von 11 dB. Das bedeutet, die Störung ist rund zwölfmal schwächer als vorher. Gerechnet hat der Server dafür 3 Sekunden.
Welche Stärke passt
| Stärke | Dämpfung | Geeignet für |
|---|---|---|
| Sanft | höchstens 12 dB | leises Rauschen, Lüfter, Raumklang; die Stimme bleibt am natürlichsten |
| Mittel | höchstens 24 dB | die meisten Handyaufnahmen, Straße, Büro |
| Stark | ohne Grenze | Wind, Baustelle, lautes Brummen; Atem und Raum verschwinden ganz |
Was der Filter kann und was nicht
Gut entfernt werden gleichmäßige Geräusche wie Rauschen, Brummen, Lüfter, Klimaanlagen und Straßenlärm, dazu vieles, was kurz auftritt: Tastaturklicken, Geschirr, ein Hund im Nebenraum. Wind am Mikrofon wird deutlich leiser, verschwindet aber nicht immer ganz, weil er die Stimme selbst verzerrt.
Grenzen hat das Verfahren bei allem, was wie Sprache klingt. Redet im Hintergrund jemand anderes, bleibt diese Stimme oft hörbar. Musik wird als Störung behandelt und gedämpft, aber nicht sauber getrennt; Gesang klingt danach dünn. Hall in großen Räumen wird nur teilweise reduziert. Und was in der Aufnahme fehlt, kann kein Filter zurückholen: Ist die Stimme übersteuert oder im Lärm völlig untergegangen, bleibt sie schwer verständlich.
Typische Fehler
Der häufigste Fehler ist „zu viel“. Wer bei einem ruhigen Interview die Stärke „Stark“ wählt, bekommt eine Stimme, die trocken und leicht künstlich klingt. Beginnen Sie mit „Mittel“ und gehen Sie nur bei lauten Störungen höher. Zweitens: zweimal filtern bringt kaum etwas, das Ergebnis klingt nur dumpfer. Drittens: Wollen Sie den Text einer Aufnahme haben, filtern Sie sie zuerst und schicken Sie das Ergebnis danach an Sprachnachricht in Text. Die Erkennung macht auf einer sauberen Aufnahme weniger Fehler.
Video: warum nur der Ton hochgeladen wird
Bei einem Video dekodiert Ihr Browser die Tonspur und rechnet sie in eine WAV-Datei um. Nur diese geht an den Server. Bis gut fünf Minuten bleibt die Tonspur bei 48 kHz; bei längeren Videos rechnet der Browser auf 24 kHz herunter, damit die Datei unter 30 MB bleibt. Für Sprache ist das ohne Verlust an Verständlichkeit, weil die wichtigen Anteile unter 8 kHz liegen. Sie bekommen die bereinigte Tonspur zurück und legen sie im Schnittprogramm unter das Video. Brauchen Sie nur den Ton aus einem Video, hilft auch MP4 in MP3 umwandeln.
Grenzen und Datenschutz
Erlaubt sind Aufnahmen bis 10 Minuten und 30 MB, Videos bis 500 MB (davon wird nur der Ton gesendet). Pro Stunde sind sechs Aufträge je Anschluss möglich, damit der Server für alle schnell bleibt. Längere Aufnahmen teilen Sie vorher mit Video schneiden auf.
Der Filter läuft nicht im Browser, weil das Modell samt Rechenbibliothek mehrere Hundert Megabyte groß ist. Deshalb geht die Tonspur über Cloudflare verschlüsselt an unseren Server in Deutschland. Dort läuft sie in einem abgeschotteten Container ohne Internetzugang, wird nur im Arbeitsspeicher verarbeitet und direkt nach der Antwort gelöscht.
Protokolliert wird an zwei Stellen, beide ohne Inhalt, Dateiname und IP-Adresse. Der vorgeschaltete Webserver notiert je Anfrage Zeitpunkt, Methode, Pfad ohne Abfrage-Parameter, Status, Größe und Dauer, aber keine Kopfzeilen; diese Datei wird ab 20 MB gewechselt, die letzten fünf bleiben liegen. Der Dienst selbst notiert nur Werkzeug, Status, Größe und Dauer. Ihre IP-Adresse kommt über Cloudflare mit und dient allein dem Stundenlimit: Der Dienst merkt sich zu ihr die Zeitpunkte Ihrer Aufträge der letzten Stunde, nur im Arbeitsspeicher und nie auf der Festplatte. Ältere Zeitpunkte verfallen, die Adresse selbst verschwindet spätestens beim Neustart des Dienstes.