Cambiador de voz: tono, robot y efectos de eco

Graba un clip o sube un archivo de audio, aplica voz de ardilla, voz grave, robot, eco o un cambio de tono personalizado sin alterar la duración, y descarga el resultado en WAV.

Todo se procesa sin conexión dentro del navegador con Web Audio API: tu voz nunca sale de tu dispositivo. Tono y velocidad son controles independientes; cambiar el tono conserva la duración original.

Cambiador de voz: tono, robot y efectos de eco
Graba un clip o sube un archivo de audio, aplica voz de ardilla, voz grave, robot, eco o un cambio de tono personalizado sin alterar la duración, y descarga el resultado en WAV.
o

El modo cinta vincula tono y velocidad como una cinta remuestreada: subir el tono también acelera el clip. Déjalo desactivado para conservar la duración original.

Tono: ×1.33
Cambio: +5 st
Velocidad: ×1.00
Duración conservada

Factor de tono = 2 elevado a (semitonos ÷ 12): +5 st equivale aproximadamente a ×1.33 y +12 st exactamente a ×2.00. Por defecto, el cambio de tono mantiene la duración; solo la Velocidad o el Modo cinta la modifican.

Privacidad desde el diseño: grabación, decodificación y renderizado se realizan localmente. No se sube nada.

Cómo funciona este cambiador de voz

Todos los efectos de esta página se ejecutan sin conexión en el navegador y se guardan en un archivo WAV estándar de 16 bits. El procesamiento es determinista: la misma entrada con los mismos ajustes siempre produce la misma salida, y un clip típico se renderiza en uno o dos segundos. Los efectos de tono conservan la duración. Subir o bajar el tono NO cambia cuánto dura el clip: una grabación de cinco segundos sigue durando cinco segundos aunque la subas o bajes una octava. El procesamiento de tono y velocidad utiliza Signalsmith Stretch, un motor abierto de calidad de estudio para estiramiento temporal y cambio de tono, compilado a WebAssembly y ejecutado totalmente sin conexión en el navegador. Analiza el espectro de bloques superpuestos y reconstruye el audio con el nuevo tono y tempo, manteniendo voces naturales y transitorios definidos incluso con cambios grandes. Si WASM no puede cargarse por un navegador antiguo o una política que bloquee WebAssembly, se recurre automáticamente al cambiador temporal WSOLA integrado, siglas de superposición y suma por similitud de forma de onda. El audio se divide en granos superpuestos de unos 90 milisegundos, se ajusta su separación temporal y, en cada unión, el siguiente grano se desplaza hasta 10 milisegundos en ambos sentidos para encontrar la mejor coincidencia con la onda anterior. Un remuestreo final devuelve la duración exactamente a su valor original. En ambos casos, cada frecuencia se mueve según el factor mostrado: 2 elevado a (cambio en semitonos dividido por 12). Tras procesar, el panel indica el motor usado: Signalsmith (calidad de estudio) o WSOLA (alternativo). La velocidad es un control separado e independiente. Elegir 0.5× o 2× ejecuta el mismo motor como estirador temporal puro: el clip se alarga o acorta sin cambiar el tono. Puedes combinar ambos ajustes: una voz de ardilla a +5 semitonos y velocidad 1.5× requiere una sola pasada. Si prefieres el sonido clásico, el Modo cinta activa el remuestreo por velocidad de reproducción, que vincula tono y velocidad como al acelerar una cinta o reproducir un disco a otras RPM. Así, +12 semitonos se reproduce al doble de velocidad y dura la mitad; el indicador muestra el factor de duración para evitar sorpresas. El efecto robot usa modulación en anillo: multiplica tu voz por una onda sinusoidal de 30 Hz y sustituye los armónicos naturales por frecuencias suma y diferencia, la misma técnica de las voces Dalek de los años 1960. El eco pasa la señal por un retardo de 250 milisegundos con un 45 por ciento de realimentación y añade un segundo y medio de cola para que las últimas repeticiones terminen. Sus usos van más allá de las bromas: creadores de pódcast anonimizan voces con unos semitonos sin alterar el ritmo natural, desarrolladores generan voces de criaturas en lote, docentes muestran la relación entre tono y tempo y productores usan el modo cinta para dar textura lo-fi. Como el procesamiento granular exige mucha CPU, la entrada se limita a 10 minutos. Todo es local, de modo que las grabaciones sensibles nunca llegan a un servidor.

Ajustes de efectos y sus resultados

El indicador muestra el factor de tono, la velocidad efectiva y si cambia la duración.

EfectoResultadoNota
Ardilla (+5 st)Tono ×1.33 — voz más aguda, misma duraciónLa clásica voz de dibujos animados al ritmo original; funciona mejor con habla clara.
Voz grave (−5 st)Tono ×0.75 — voz más grave, misma duraciónLa solemnidad de un tráiler sin el habla arrastrada a cámara lenta de una cinta.
Robot (modulación en anillo a 30 Hz)Voz metálica de estilo Dalek a velocidad originalLa modulación en anillo multiplica tu voz por una onda sinusoidal de 30 Hz.
Eco (retardo de 250 ms)Ecos repetidos que decaen un 45% en cada repeticiónEl renderizado añade 1.5 s de cola para que los últimos ecos terminen por completo.
Personalizado +12 stTono ×2.00 — una octava arriba, misma duraciónCon el Modo cinta activado, esos mismos +12 st se reproducen a 2.00× y duran la mitad.
Velocidad 0.5×, tono sin cambiosDuración ×2.00 — media velocidad con el tono originalEstiramiento temporal puro: ideal para transcribir o ralentizar a alguien que habla rápido.

Cómo cambiar tu voz

  1. Graba un clip corto con el botón Grabar (hasta 30 segundos) o sube un archivo MP3, WAV, OGG, M4A o WebM de hasta 10 minutos.
  2. Elige Ardilla, Voz grave, Robot, Eco o Tono personalizado con el deslizador de −12 a +12 semitonos. Los cambios de tono conservan la duración original.
  3. Si quieres, ajusta la Velocidad de 0.5× a 2×: cambia el tempo sin tocar el tono y se combina con cualquier transposición. Activa el Modo cinta si buscas el sonido clásico de tono y velocidad vinculados.
  4. Consulta el indicador: muestra el factor de tono, la velocidad efectiva y si la duración se mantiene o por qué factor cambia.
  5. Pulsa Aplicar efecto, escucha la vista previa y descarga el resultado como WAV de 16 bits.

Preguntas frecuentes sobre el cambiador de voz

¿Subir el tono hace que mi voz vaya más rápido?
Ya no: por defecto, el cambiador granular conserva la duración original. Así, +12 semitonos suena una octava más alto, pero al mismo ritmo exacto. Si quieres el comportamiento clásico en el que un tono más alto también acelera la reproducción, activa el Modo cinta.
¿Qué motor cambia el tono y qué es la alternativa WSOLA?
El principal es Signalsmith Stretch, una biblioteca abierta de calidad de estudio para estiramiento temporal y cambio de tono, compilada a WebAssembly. Mantiene voces naturales incluso donde los métodos simples producen artefactos de fase. Si no carga, se usa WSOLA integrado, superposición y suma por similitud de forma de onda: divide el audio en granos superpuestos de 90 ms, cambia su separación y busca ±10 ms en cada unión para encontrar el mejor encaje. El panel siempre indica el motor usado. Con cualquiera de ellos, más allá de unos ±7 semitonos aparece cierta coloración del timbre: es el compromiso de mantener la duración.
¿Puedo cambiar la velocidad sin cambiar el tono?
Sí. El selector de Velocidad (0.5× a 2×) aplica el estiramiento granular sin remuestreo, de modo que a 2× el clip dura la mitad con el mismo tono. La velocidad se combina libremente con cualquier preajuste o cambio de semitonos, y el indicador siempre muestra el factor de duración resultante.
¿Por qué los archivos de entrada tienen un límite de 10 minutos?
El clip completo se renderiza sin conexión en una pasada. La memoria y el tiempo de procesamiento crecen con la duración, con mucho más trabajo que un simple remuestreo. Para mantener la pestaña ágil, se rechazan clips de más de 10 minutos. Recorta o divide las grabaciones largas y procesa cada parte.
¿Se sube mi grabación a un servidor?
No. La captura del micrófono, la decodificación, el procesamiento granular y la codificación WAV se ejecutan dentro del navegador con Web Audio API. No se transmite nada y, al cerrar la pestaña, se descarta todo lo que no hayas descargado.
¿Qué es la modulación en anillo y qué formatos puedo subir?
La modulación en anillo multiplica tu voz por una onda sinusoidal constante de 30 Hz, generando frecuencias suma y diferencia en lugar de armónicos naturales: el timbre metálico Dalek. Puedes subir cualquier formato que el navegador decodifique: MP3, WAV, OGG/Opus, M4A/AAC, WebM y normalmente FLAC. La descarga siempre es WAV de 16 bits sin comprimir, para no aplicar una segunda codificación con pérdida.