Stimmenverzerrer: Tonhöhe, Roboter und Echo

Nimm einen Clip auf oder lade eine Audiodatei. Wähle Streifenhörnchen, tiefe Stimme, Roboter, Echo oder eine eigene Tonhöhe – bei gleicher Dauer – und lade das Ergebnis als WAV herunter.

Die gesamte Verarbeitung läuft offline im Browser mit der Web Audio API. Deine Stimme verlässt nie dein Gerät. Tonhöhe und Tempo sind unabhängig: Eine Tonhöhenänderung erhält die ursprüngliche Dauer.

Stimmenverzerrer: Tonhöhe, Roboter und Echo
Nimm einen Clip auf oder lade eine Audiodatei. Wähle Streifenhörnchen, tiefe Stimme, Roboter, Echo oder eine eigene Tonhöhe – bei gleicher Dauer – und lade das Ergebnis als WAV herunter.
oder

Der Bandmodus koppelt Tonhöhe und Tempo wie bei einer per Resampling veränderten Bandaufnahme: Eine höhere Tonhöhe beschleunigt auch den Clip. Lass ihn aus, um die Originaldauer zu erhalten.

Tonhöhe: ×1.33
Verschiebung: +5 st
Tempo: ×1.00
Dauer bleibt gleich

Tonhöhenfaktor = 2 hoch (Halbtöne ÷ 12): +5 st entspricht etwa ×1.33, +12 st genau ×2.00. Standardmäßig bleibt die Cliplänge beim Transponieren unverändert. Nur Tempo oder Bandmodus ändern die Dauer.

Datenschutz von Anfang an: Aufnahme, Dekodierung und Rendering erfolgen lokal. Nichts wird hochgeladen.

So funktioniert dieser Stimmenverzerrer

Jeder Effekt auf dieser Seite läuft offline in deinem Browser und wird als standardmäßige 16-Bit-WAV-Datei ausgegeben. Die Verarbeitung ist deterministisch: Dieselbe Eingabe mit denselben Einstellungen liefert immer dieselbe Ausgabe. Ein typischer Clip ist in ein bis zwei Sekunden gerendert. Die Tonhöheneffekte erhalten die Dauer. Eine höhere oder tiefere Tonhöhe verändert die Cliplänge NICHT: Eine fünfsekündige Aufnahme bleibt fünf Sekunden lang, auch wenn du sie eine Oktave nach oben oder unten verschiebst. Intern verarbeitet Signalsmith Stretch Tonhöhe und Tempo. Die quelloffene Studio-Engine für Zeitdehnung und Tonhöhenänderung ist als WebAssembly kompiliert und läuft vollständig offline im Browser. Sie analysiert überlappende Audioblöcke spektral und rekonstruiert sie mit neuer Tonhöhe und neuem Tempo. Dadurch bleiben Stimmen auch bei größeren Änderungen natürlich und Transienten präzise. Kann die WASM-Engine wegen eines alten Browsers oder einer WebAssembly-Sperre nicht laden, wechselt das Tool automatisch zum integrierten Zeitbereichsverfahren WSOLA, kurz für Waveform-Similarity Overlap-Add. Das Audio wird in überlappende Körner von etwa 90 Millisekunden zerlegt, deren zeitlicher Abstand angepasst wird. An jeder Naht wird das nächste Korn um bis zu 10 Millisekunden vor- und zurückgeschoben, bis seine Wellenform möglichst gut an die vorherige anschließt. Ein abschließendes Resampling stellt die ursprüngliche Dauer exakt wieder her. In beiden Fällen verschiebt sich jede Frequenz um den angezeigten Faktor: 2 hoch (Halbtonverschiebung geteilt durch 12). Nach der Verarbeitung nennt das Ergebnisfeld die verwendete Engine: Signalsmith (Studioqualität) oder WSOLA (Ersatz). Das Tempo ist ein eigener, unabhängiger Regler. Bei 0.5× oder 2× arbeitet dieselbe Engine als reine Zeitdehnung: Der Clip wird länger oder kürzer, die Tonhöhe bleibt gleich. Beides lässt sich kombinieren: Eine Streifenhörnchenstimme mit +5 Halbtönen bei 1.5× Tempo benötigt nur einen Durchgang. Für den klassischen Klang schaltet der Bandmodus auf Wiedergaberaten-Resampling um. Tonhöhe und Tempo sind dann gekoppelt, genau wie beim Beschleunigen eines Tonbands oder beim Abspielen einer Schallplatte mit falscher Drehzahl. +12 Halbtöne bedeutet dann doppeltes Tempo und halbe Dauer. Die Anzeige zeigt den Dauerfaktor, damit es keine Überraschungen gibt. Der Robotereffekt nutzt Ringmodulation: Deine Stimme wird mit einer 30 Hz-Sinuswelle multipliziert. Statt natürlicher Obertöne entstehen Summen- und Differenzfrequenzen – dieselbe Technik wie bei den Dalek-Stimmen der 1960er-Jahre. Das Echo führt das Signal durch eine Verzögerung von 250 Millisekunden mit 45 Prozent Rückkopplung und fügt eineinhalb Sekunden Ausklang hinzu, damit die letzten Wiederholungen nicht abgeschnitten werden. Die Anwendungen gehen weit über Streiche hinaus: Podcaster anonymisieren Interviewstimmen mit wenigen Halbtönen bei natürlichem Sprechrhythmus, Spieleentwickler erzeugen Kreaturenstimmen in Serie, Lehrkräfte erklären Tonhöhe und Tempo, und Produzenten nutzen den Bandmodus für Lo-Fi-Texturen. Da Granularverarbeitung CPU-intensiv ist, sind Eingaben auf 10 Minuten begrenzt. Alles läuft lokal, sodass sensible Aufnahmen nie einen Server erreichen.

Effekteinstellungen und ihre Wirkung

Die Anzeige nennt Tonhöhenfaktor, effektives Tempo und mögliche Änderungen der Dauer.

EffektErgebnisHinweis
Streifenhörnchen (+5 st)Tonhöhe ×1.33 — höhere Stimme, gleiche DauerDie klassische Cartoonstimme im Originaltempo; am besten bei klarer Sprache.
Tiefe Stimme (−5 st)Tonhöhe ×0.75 — tiefere Stimme, gleiche DauerDie Gravitas eines Filmtrailers ohne das Zeitlupensprechen einer verlangsamten Bandaufnahme.
Roboter (Ringmodulation 30 Hz)Metallische Stimme im Dalek-Stil bei OriginaltempoDie Ringmodulation multipliziert deine Stimme mit einer 30 Hz-Sinuswelle.
Echo (250 ms Verzögerung)Wiederholte Echos mit 45% Abschwächung pro WiederholungDas Rendering ergänzt 1.5 s Ausklang, damit die letzten Echos vollständig verklingen.
Eigene Einstellung +12 stTonhöhe ×2.00 — eine Oktave höher, gleiche DauerIm Bandmodus werden dieselben +12 st mit 2.00× Tempo und halber Dauer abgespielt.
Tempo 0.5×, Tonhöhe unverändertDauer ×2.00 — halbes Tempo bei OriginaltonhöheReine Zeitdehnung: ideal zum Transkribieren oder zum Verlangsamen schneller Sprecher.

So veränderst du deine Stimme

  1. Nimm mit der Aufnahmetaste einen kurzen Clip von bis zu 30 Sekunden auf oder lade eine vorhandene MP3-, WAV-, OGG-, M4A- oder WebM-Datei mit maximal 10 Minuten Länge.
  2. Wähle Streifenhörnchen, Tiefe Stimme, Roboter, Echo oder Eigene Tonhöhe mit dem Regler von −12 bis +12 Halbtönen. Tonhöhenänderungen erhalten die Originaldauer.
  3. Stelle bei Bedarf das Tempo von 0.5× bis 2× ein. Es ändert das Tempo ohne Tonhöhenänderung und lässt sich mit jeder Transposition kombinieren. Aktiviere den Bandmodus für den klassischen Klang mit gekoppeltem Tempo und Tonhöhe.
  4. Prüfe die Anzeige: Sie nennt Tonhöhenfaktor, effektives Tempo und ob die Cliplänge gleich bleibt oder um welchen Faktor sie sich ändert.
  5. Klicke auf Effekt anwenden, höre die Vorschau an und lade das Ergebnis als 16-Bit-WAV-Datei herunter.

Häufige Fragen zum Stimmenverzerrer

Wird meine Stimme schneller, wenn ich die Tonhöhe erhöhe?
Nicht mehr: Standardmäßig erhält die granulare Tonhöhenänderung die ursprüngliche Dauer. +12 Halbtöne klingt also eine Oktave höher, läuft aber exakt im selben Tempo. Für das klassische gekoppelte Verhalten, bei dem höhere Tonhöhe auch schnellere Wiedergabe bedeutet, aktiviere den Bandmodus.
Welche Engine ändert die Tonhöhe, und was ist der WSOLA-Ersatz?
Die Hauptengine ist Signalsmith Stretch, eine quelloffene Bibliothek für Zeitdehnung und Tonhöhenänderung in Studioqualität, kompiliert als WebAssembly. Sie erhält natürliche Stimmen noch dort, wo einfache Verfahren bereits Phasenartefakte erzeugen. Kann sie nicht laden, springt der integrierte WSOLA-Shifter ein: Waveform-Similarity Overlap-Add zerlegt das Audio in überlappende 90 ms-Körner, verändert ihre Abstände und sucht an jeder Naht innerhalb von ±10 ms den besten Anschluss. Das Ergebnisfeld nennt immer die verwendete Engine. Bei beiden verändert sich oberhalb von etwa ±7 Halbtönen die Klangfarbe leicht – der Kompromiss für eine konstante Länge.
Kann ich das Tempo ohne Tonhöhenänderung ändern?
Ja. Die Tempoauswahl von 0.5× bis 2× nutzt granulare Zeitdehnung ohne Resampling-Schritt. Ein Clip bei 2× ist daher bei gleicher Tonhöhe halb so lang. Das Tempo lässt sich mit jedem Preset oder eigenen Halbtonwert kombinieren, und die Anzeige nennt stets den resultierenden Dauerfaktor.
Warum sind Eingabedateien auf 10 Minuten begrenzt?
Der gesamte Clip wird offline in einem Durchgang gerendert. Speicherverbrauch und Rechenzeit steigen mit der Länge – deutlich stärker als bei einfachem Resampling. Damit der Browser-Tab reaktionsfähig bleibt, lehnt das Tool Clips über 10 Minuten ab. Kürze oder teile längere Aufnahmen und verarbeite die Abschnitte einzeln.
Wird meine Aufnahme auf einen Server hochgeladen?
Nein. Mikrofonaufnahme, Dateidekodierung, Granularverarbeitung und WAV-Kodierung laufen mit der Web Audio API vollständig im Browser. Nichts wird übertragen. Beim Schließen des Tabs wird alles verworfen, was du nicht heruntergeladen hast.
Was ist Ringmodulation, und welche Dateiformate kann ich laden?
Ringmodulation multipliziert deine Stimme mit einer konstanten 30 Hz-Sinuswelle. Statt natürlicher Obertöne entstehen Summen- und Differenzfrequenzen: der metallische Dalek-Klang. Du kannst alles laden, was dein Browser dekodiert: MP3, WAV, OGG/Opus, M4A/AAC, WebM und meist FLAC. Der Download ist immer unkomprimiertes 16-Bit-WAV, sodass keine zweite verlustbehaftete Kodierung erfolgt.