Changeur de voix : hauteur, robot et effets d'écho
Enregistrez un extrait ou importez un fichier audio, appliquez une voix d'écureuil, une voix grave, un robot, un écho ou une transposition personnalisée, sans changer la durée, puis téléchargez le résultat en WAV.
Tout le traitement se fait hors ligne dans votre navigateur avec Web Audio API : votre voix ne quitte jamais votre appareil. Hauteur et vitesse sont indépendantes ; transposer conserve la durée d'origine.
Changeur de voix : hauteur, robot et effets d'écho
Enregistrez un extrait ou importez un fichier audio, appliquez une voix d'écureuil, une voix grave, un robot, un écho ou une transposition personnalisée, sans changer la durée, puis téléchargez le résultat en WAV.
ou
Le mode bande lie hauteur et vitesse comme une bande rééchantillonnée : monter la hauteur accélère aussi l'extrait. Laissez-le désactivé pour conserver la durée d'origine.
Hauteur: ×1.33
Transposition: +5 st
Vitesse: ×1.00
Durée conservée
Facteur de hauteur = 2 puissance (demi-tons ÷ 12) : +5 st vaut environ ×1.33 et +12 st exactement ×2.00. Par défaut, la transposition conserve la longueur de l'extrait ; seuls la Vitesse ou le Mode bande modifient sa durée.
Confidentialité intégrée : enregistrement, décodage et rendu se font localement. Rien n'est envoyé.
Fonctionnement de ce changeur de voix
Chaque effet de cette page fonctionne hors ligne dans votre navigateur et produit un fichier WAV standard de 16 bits. Le traitement est déterministe : une même entrée avec les mêmes réglages donne toujours la même sortie, et un extrait courant est rendu en une ou deux secondes.
Les effets de hauteur conservent la durée : monter ou descendre la voix ne change PAS la longueur de l'extrait. Un enregistrement de cinq secondes reste donc de cinq secondes, même transposé d'une octave vers le haut ou le bas. Le traitement de hauteur et de vitesse repose sur Signalsmith Stretch, un moteur open source de qualité studio pour l'étirement temporel et la transposition, compilé en WebAssembly et exécuté entièrement hors ligne. Il analyse le spectre de blocs superposés et reconstruit l'audio à la nouvelle hauteur et au nouveau tempo, préservant des voix naturelles et des transitoires nets même avec de grands écarts. Si le moteur WASM ne se charge pas à cause d'un ancien navigateur ou d'une politique bloquant WebAssembly, l'outil passe automatiquement au moteur temporel WSOLA intégré, pour « superposition-addition par similarité de forme d'onde ». Le son est découpé en grains superposés d'environ 90 millisecondes, leur espacement est modifié et, à chaque raccord, le grain suivant est déplacé jusqu'à 10 millisecondes dans les deux sens pour s'aligner au mieux sur l'onde précédente. Un rééchantillonnage final ramène exactement la durée à sa valeur initiale. Dans les deux cas, chaque fréquence est multipliée par le facteur affiché : 2 puissance (transposition en demi-tons divisée par 12). Après traitement, le panneau indique le moteur utilisé : Signalsmith (qualité studio) ou WSOLA (secours).
La vitesse est un réglage séparé et indépendant. Choisir 0.5× ou 2× utilise le même moteur pour un pur étirement temporel : l'extrait s'allonge ou se raccourcit sans changer de hauteur. Les deux réglages se combinent : une voix d'écureuil à +5 demi-tons et une vitesse de 1.5× passent une seule fois dans le moteur. Pour retrouver un son à l'ancienne, le Mode bande active le rééchantillonnage classique par vitesse de lecture, qui lie hauteur et vitesse comme une bande accélérée ou un disque lu au mauvais régime. +12 demi-tons donne alors une vitesse double et une durée divisée par deux ; l'affichage indique le facteur de durée pour éviter les surprises.
L'effet robot est une modulation en anneau : votre voix est multipliée par une sinusoïde de 30 Hz, remplaçant les harmoniques naturelles par des fréquences somme et différence. C'est la technique des voix de Daleks des années 1960. L'écho fait passer le signal dans un retard de 250 millisecondes avec 45 pour cent de réinjection et ajoute une seconde et demie de traîne pour laisser finir les répétitions. Les usages dépassent les plaisanteries : des podcasteurs anonymisent une voix avec quelques demi-tons en gardant un débit naturel, des développeurs créent des voix de créatures en série, des enseignants illustrent le lien entre hauteur et tempo, et des producteurs utilisent le mode bande pour une texture lo-fi. Le traitement granulaire sollicitant le processeur, l'entrée est limitée à 10 minutes. Tout reste local : les enregistrements sensibles ne passent jamais par un serveur.
Réglages des effets et résultats
L'affichage indique le facteur de hauteur, la vitesse effective et si la durée change.
Effet
Résultat
Remarque
Écureuil (+5 st)
Hauteur ×1.33 — voix plus aiguë, durée conservée
La voix classique de dessin animé au rythme d'origine ; idéale avec une parole claire.
Voix grave (−5 st)
Hauteur ×0.75 — voix plus grave, durée conservée
La gravité d'une bande-annonce sans la diction traînante d'une bande ralentie.
Robot (modulation en anneau à 30 Hz)
Voix métallique façon Dalek à la vitesse d'origine
La modulation en anneau multiplie votre voix par une sinusoïde de 30 Hz.
Écho (retard de 250 ms)
Échos successifs atténués de 45% à chaque répétition
Le rendu ajoute 1.5 s de traîne pour laisser les derniers échos se terminer.
Personnalisé +12 st
Hauteur ×2.00 — une octave plus haut, durée conservée
Avec le Mode bande activé, les mêmes +12 st donnent une vitesse de 2.00× et une durée divisée par deux.
Vitesse 0.5×, hauteur inchangée
Durée ×2.00 — lecture à demi-vitesse, hauteur d'origine
Pur étirement temporel : idéal pour transcrire ou ralentir une personne qui parle vite.
Comment modifier votre voix
Enregistrez un court extrait avec le bouton d'enregistrement, jusqu'à 30 secondes, ou importez un fichier MP3, WAV, OGG, M4A ou WebM de 10 minutes maximum.
Choisissez Écureuil, Voix grave, Robot, Écho ou Hauteur personnalisée avec le curseur de −12 à +12 demi-tons. La transposition conserve la durée d'origine.
Réglez éventuellement la Vitesse de 0.5× à 2× : elle modifie le tempo sans toucher à la hauteur et se combine avec toute transposition. Activez le Mode bande pour retrouver le son classique liant hauteur et vitesse.
Vérifiez l'affichage : il indique le facteur de hauteur, la vitesse effective et si la durée reste identique ou selon quel facteur elle change.
Appuyez sur Appliquer l'effet, écoutez l'aperçu et téléchargez le résultat en WAV de 16 bits.
Questions fréquentes sur le changeur de voix
Monter la hauteur accélère-t-il ma voix ?
Plus maintenant : par défaut, la transposition granulaire conserve la durée d'origine. +12 demi-tons sonne donc une octave plus haut, mais au même rythme exact. Pour retrouver le comportement classique où une hauteur plus élevée accélère aussi la lecture, activez le Mode bande.
Quel moteur transpose la voix et qu'est-ce que le secours WSOLA ?
Le moteur principal est Signalsmith Stretch, une bibliothèque open source de qualité studio pour l'étirement temporel et la transposition, compilée en WebAssembly. Elle garde les voix naturelles là où les méthodes simples produisent des effets de phase. Si elle ne se charge pas, l'outil utilise WSOLA, une superposition-addition par similarité de forme d'onde : le son est découpé en grains superposés de 90 ms, réespacés, puis chaque raccord recherche sur ±10 ms la meilleure jonction. Le panneau indique toujours le moteur utilisé. Avec l'un ou l'autre, au-delà d'environ ±7 demi-tons, le timbre se colore légèrement : c'est le compromis nécessaire pour conserver la durée.
Puis-je changer la vitesse sans modifier la hauteur ?
Oui. Le sélecteur Vitesse, de 0.5× à 2×, applique l'étirement granulaire sans rééchantillonnage : à 2×, l'extrait est deux fois plus court à hauteur identique. La vitesse se combine librement avec tous les préréglages et transpositions personnalisées, et l'affichage donne toujours le facteur de durée obtenu.
Pourquoi limiter les fichiers d'entrée à 10 minutes ?
L'extrait entier est rendu hors ligne en une passe. La mémoire et le temps de traitement augmentent avec sa longueur, pour un travail bien plus important qu'un simple rééchantillonnage. Afin de garder l'onglet réactif, l'outil refuse les extraits de plus de 10 minutes. Découpez les longs enregistrements et traitez les parties séparément.
Mon enregistrement est-il envoyé à un serveur ?
Non. La capture du microphone, le décodage, le traitement granulaire et l'encodage WAV se font dans le navigateur avec Web Audio API. Rien n'est transmis ; fermer l'onglet supprime tout ce que vous n'avez pas téléchargé.
Qu'est-ce que la modulation en anneau et quels formats importer ?
La modulation en anneau multiplie votre voix par une sinusoïde constante de 30 Hz pour produire des fréquences somme et différence à la place des harmoniques naturelles : le timbre métallique des Daleks. Vous pouvez importer tout format décodable par le navigateur : MP3, WAV, OGG/Opus, M4A/AAC, WebM et généralement FLAC. Le téléchargement est toujours un WAV non compressé de 16 bits, sans seconde compression avec perte.