Zum Inhalt springen
Mörsberger Tools
Bilder & Dateien

Rauschen und Hintergrundgeräusche entfernen

Entfernt Rauschen, Wind und Hintergrundgeräusche aus Sprachaufnahmen und Videos mit einem KI-Filter (DeepFilterNet) auf unserem Server in Deutschland; das Video verlässt Ihr Gerät nicht, nur die Tonspur, und sie wird sofort gelöscht.

Von Marvin Mörsberger Zuletzt geprüft: 08.10.2026 Grundlage: Schröter u. a.: DeepFilterNet, Perceptually Motivated Real-Time Speech Enhancement (Interspeech 2023) Verarbeitung auf unserem Server in Deutschland

1. Aufnahme auswählen

Audio bis 30 MB und 10 Minuten (MP3, M4A, WhatsApp-Opus, WAV, FLAC). Bei Videos löst Ihr Browser nur die Tonspur heraus.

Audio oder Video hierher ziehen oder antippenErst beim Klick auf „Hochladen und entrauschen“ geht die Tonspur an unseren Server.
Stärke

dämpft um höchstens 24 dB, für die meisten Aufnahmen richtig.

Ausgabeformat

Datenschutz: Die Tonspur wird über Cloudflare verschlüsselt an unseren Server in Deutschland gesendet, dort in einem abgeschotteten Container ohne Internetzugang gefiltert und sofort nach der Auslieferung gelöscht. Ins Protokoll kommen nur Zeitpunkt, Pfad, Status, Größe und Dauer, keine IP-Adresse; die IP hält der Dienst nur für das Stundenlimit im Arbeitsspeicher, nie auf der Festplatte.

2. Vorher und nachher

Wählen Sie eine Aufnahme oder laden Sie das Beispiel.

Geräusche entfernen in drei Schritten

Ziehen Sie eine Aufnahme in das Feld: eine Sprachnachricht, ein Interview vom Handy, eine Videokonferenz-Aufzeichnung oder ein Video. Wählen Sie die Stärke und das Ausgabeformat. Mit „Hochladen und entrauschen“ geht die Tonspur an unseren Server, der Filter läuft, und daneben (am Handy darunter) erscheint die bereinigte Fassung zum Anhören und Herunterladen. Den Vergleich hören Sie direkt untereinander: oben das Original, darunter das Ergebnis.

Mit „Beispiel laden“ hören Sie den Effekt ohne eigene Datei. Das Beispiel ist künstlich erzeugt: eine Folge von Vokalen mit einer Grundfrequenz von 120 Hz, darunter weißes Rauschen fünf Dezibel unter dem Sprachpegel und ein leises 50-Hz-Brummen, wie es von schlecht geerdeten Geräten kommt.

So arbeitet der Filter

Das Werkzeug nutzt DeepFilterNet3, ein neuronales Netz von Hendrik Schröter und Kollegen an der Universität Erlangen-Nürnberg, veröffentlicht 2023. Es zerlegt den Ton in kurze Zeitfenster und Frequenzbänder, schätzt für jedes Band, wie viel davon Sprache ist, und dämpft den Rest. Im unteren Frequenzbereich, wo die Stimme ihre Obertöne hat, rechnet es zusätzlich mit einem Filter über mehrere Zeitfenster und erhält so die Feinstruktur der Stimme. Die Aufnahme wird dafür auf 48 kHz und einen Kanal umgerechnet. Stereo wird also zu Mono.

Ein Zahlenbeispiel aus unserem Test: 60 Sekunden gesprochener Text, gemischt mit weißem Rauschen bei 5 dB Signal-Rausch-Abstand. Nach dem Filter in der Stärke „Stark“ lag der Abstand bei 16,6 dB, ein Gewinn von 11 dB. Das bedeutet, die Störung ist rund zwölfmal schwächer als vorher. Gerechnet hat der Server dafür 3 Sekunden.

Welche Stärke passt

StärkeDämpfungGeeignet für
Sanfthöchstens 12 dBleises Rauschen, Lüfter, Raumklang; die Stimme bleibt am natürlichsten
Mittelhöchstens 24 dBdie meisten Handyaufnahmen, Straße, Büro
Starkohne GrenzeWind, Baustelle, lautes Brummen; Atem und Raum verschwinden ganz

Was der Filter kann und was nicht

Gut entfernt werden gleichmäßige Geräusche wie Rauschen, Brummen, Lüfter, Klimaanlagen und Straßenlärm, dazu vieles, was kurz auftritt: Tastaturklicken, Geschirr, ein Hund im Nebenraum. Wind am Mikrofon wird deutlich leiser, verschwindet aber nicht immer ganz, weil er die Stimme selbst verzerrt.

Grenzen hat das Verfahren bei allem, was wie Sprache klingt. Redet im Hintergrund jemand anderes, bleibt diese Stimme oft hörbar. Musik wird als Störung behandelt und gedämpft, aber nicht sauber getrennt; Gesang klingt danach dünn. Hall in großen Räumen wird nur teilweise reduziert. Und was in der Aufnahme fehlt, kann kein Filter zurückholen: Ist die Stimme übersteuert oder im Lärm völlig untergegangen, bleibt sie schwer verständlich.

Typische Fehler

Der häufigste Fehler ist „zu viel“. Wer bei einem ruhigen Interview die Stärke „Stark“ wählt, bekommt eine Stimme, die trocken und leicht künstlich klingt. Beginnen Sie mit „Mittel“ und gehen Sie nur bei lauten Störungen höher. Zweitens: zweimal filtern bringt kaum etwas, das Ergebnis klingt nur dumpfer. Drittens: Wollen Sie den Text einer Aufnahme haben, filtern Sie sie zuerst und schicken Sie das Ergebnis danach an Sprachnachricht in Text. Die Erkennung macht auf einer sauberen Aufnahme weniger Fehler.

Video: warum nur der Ton hochgeladen wird

Bei einem Video dekodiert Ihr Browser die Tonspur und rechnet sie in eine WAV-Datei um. Nur diese geht an den Server. Bis gut fünf Minuten bleibt die Tonspur bei 48 kHz; bei längeren Videos rechnet der Browser auf 24 kHz herunter, damit die Datei unter 30 MB bleibt. Für Sprache ist das ohne Verlust an Verständlichkeit, weil die wichtigen Anteile unter 8 kHz liegen. Sie bekommen die bereinigte Tonspur zurück und legen sie im Schnittprogramm unter das Video. Brauchen Sie nur den Ton aus einem Video, hilft auch MP4 in MP3 umwandeln.

Grenzen und Datenschutz

Erlaubt sind Aufnahmen bis 10 Minuten und 30 MB, Videos bis 500 MB (davon wird nur der Ton gesendet). Pro Stunde sind sechs Aufträge je Anschluss möglich, damit der Server für alle schnell bleibt. Längere Aufnahmen teilen Sie vorher mit Video schneiden auf.

Der Filter läuft nicht im Browser, weil das Modell samt Rechenbibliothek mehrere Hundert Megabyte groß ist. Deshalb geht die Tonspur über Cloudflare verschlüsselt an unseren Server in Deutschland. Dort läuft sie in einem abgeschotteten Container ohne Internetzugang, wird nur im Arbeitsspeicher verarbeitet und direkt nach der Antwort gelöscht.

Protokolliert wird an zwei Stellen, beide ohne Inhalt, Dateiname und IP-Adresse. Der vorgeschaltete Webserver notiert je Anfrage Zeitpunkt, Methode, Pfad ohne Abfrage-Parameter, Status, Größe und Dauer, aber keine Kopfzeilen; diese Datei wird ab 20 MB gewechselt, die letzten fünf bleiben liegen. Der Dienst selbst notiert nur Werkzeug, Status, Größe und Dauer. Ihre IP-Adresse kommt über Cloudflare mit und dient allein dem Stundenlimit: Der Dienst merkt sich zu ihr die Zeitpunkte Ihrer Aufträge der letzten Stunde, nur im Arbeitsspeicher und nie auf der Festplatte. Ältere Zeitpunkte verfallen, die Adresse selbst verschwindet spätestens beim Neustart des Dienstes.

Häufige Fragen

Wird mein Video hochgeladen?

Nein. Ihr Browser löst die Tonspur aus dem Video heraus, nur sie geht an den Server. Die gefilterte Tonspur bekommen Sie als Audiodatei zurück und legen sie im Schnittprogramm unter das Video.

Geht das mit WhatsApp-Sprachnachrichten?

Ja. Speichern Sie die Sprachnachricht (Datei mit der Endung .opus) und ziehen Sie sie in das Feld. Das Ergebnis können Sie als MP3 herunterladen und wieder verschicken.

Kann ich damit Musik aus einer Aufnahme entfernen?

Nein. Der Filter ist auf Sprache trainiert und behandelt alles andere als Störung. Musik wird deshalb gedämpft, aber nicht sauber abgetrennt, und Gesang klingt danach verfremdet.

Wie lange dauert das Entrauschen?

Der Filter arbeitet in unseren Messungen etwa 18-mal schneller als Echtzeit. Eine Minute Aufnahme ist nach rund 5 Sekunden fertig, zehn Minuten nach gut einer halben Minute, dazu kommt die Zeit für den Upload.

Werden meine Aufnahmen gespeichert?

Nein. Die Tonspur liegt nur während der Filterung im Arbeitsspeicher eines abgeschotteten Containers ohne Internetzugang und wird direkt danach gelöscht. Protokolliert werden Zeitpunkt, Pfad, Status, Größe und Dauer, nie der Inhalt, der Dateiname oder Ihre IP-Adresse. Die IP-Adresse hält der Dienst nur für das Stundenlimit im Arbeitsspeicher.

Quellen

↑ ↓ auswählenEnter öffnen