在线变声器:音高调整、机器人与回声效果

录制片段或上传音频文件,应用松鼠音、低沉人声、机器人、回声或自定义变调效果,保留原时长,并将结果下载为WAV。

所有处理均通过Web Audio API在浏览器内离线完成,你的声音不会离开设备。音高和速度独立控制:变调会保留原有时长。

在线变声器:音高调整、机器人与回声效果
录制片段或上传音频文件,应用松鼠音、低沉人声、机器人、回声或自定义变调效果,保留原时长,并将结果下载为WAV。

磁带模式像磁带重采样一样,让音高与速度联动:升高音高也会加快片段。关闭此模式即可保留原时长。

音高: ×1.33
偏移: +5 st
速度: ×1.00
时长不变

音高倍率 = 2的(半音数 ÷ 12)次方,因此+5 st约为×1.33,+12 st恰好为×2.00。默认情况下,变调器保持片段长度不变;只有速度设置或磁带模式会改变时长。

隐私保护融入设计:录制、解码与渲染均在本地完成,不上传任何内容。

此变声器如何工作

本页所有效果都在浏览器中离线运行,并输出为标准16位WAV文件。处理过程是确定性的,因此相同输入搭配相同设置始终产生相同输出,普通片段通常一两秒即可渲染完成。 变调效果会保留时长:升高或降低音高不会改变片段长度,因此五秒的录音无论升高还是降低一个八度,仍然是五秒。底层音高与速度处理使用Signalsmith Stretch,这是编译为WebAssembly的开源录音室级时间拉伸与变调引擎,完全在浏览器内离线运行。它对重叠音频块进行频谱分析,再以新音高和节奏重建音频,即使变调幅度较大,也能保持人声自然、瞬态清晰。如果WASM引擎因浏览器过旧或策略阻止WebAssembly而无法加载,工具会自动改用内置时域变调器WSOLA,即波形相似性重叠相加算法。它将音频切成约90毫秒的重叠粒子,在时间轴上重新排列间距,并在每个拼接点将下一粒子前后移动最多10毫秒,寻找与前一段波形最匹配的位置,最后通过重采样将时长精确恢复到原值。无论使用哪个引擎,每个频率都会按读数中的倍率移动,即2的(半音偏移除以12)次方。处理后,结果面板会显示生成音频的引擎:Signalsmith(录音室音质)或WSOLA(备用)。 速度是单独且独立的控制项。选择0.5×或2×时,同一引擎会执行纯时间拉伸,使片段变长或变短,同时保持音高。两者可以组合:例如+5半音的松鼠音搭配1.5×速度,只需经过引擎一次。若喜欢复古声音,可开启磁带模式,切换到经典的播放速率重采样,让音高与速度联动,就像加快磁带或用错误转速播放唱片一样。此时+12半音会以双倍速度播放,时长减半,读数也会显示时长倍率,让结果一目了然。 机器人效果采用环形调制:将人声与30 Hz正弦波相乘,以和频及差频取代自然谐波,这也是1960年代戴立克声音所用的技术。回声效果让信号通过250毫秒延迟,反馈为百分之45,并增加一秒半的尾音,让最后几次回声完整衰减。实际用途远不止恶作剧:播客制作者用几个半音的偏移匿名化受访者声音,同时保留自然语速;游戏开发者批量生成生物声音;教师演示音高与节奏的关系;制作人用磁带模式营造低保真质感。由于粒子处理对CPU消耗较大,输入限制为10分钟。所有处理均在本地完成,敏感录音不会接触服务器。

效果设置及其作用

读数会显示音高倍率、实际速度以及时长是否改变。

效果结果说明
松鼠音(+5 st)音高×1.33 — 声音更高,时长不变保持原语速的经典卡通声音,清晰的人声效果最佳。
低沉人声(−5 st)音高×0.75 — 声音更低,时长不变呈现电影预告片般的厚重感,没有磁带式变调造成的慢动作拖腔。
机器人(30 Hz环形调制)保持原速的戴立克式金属人声环形调制将你的人声与30 Hz正弦波相乘。
回声(250 ms延迟)重复回声,每次衰减45%渲染会增加1.5 s尾音,让最后的回声完整响完。
自定义+12 st音高×2.00 — 升高一个八度,时长不变若开启磁带模式,同样的+12 st会以2.00×速度播放,时长减半。
速度0.5×,音高不变时长×2.00 — 原音高下半速播放纯时间拉伸,适合转写或放慢语速较快的人声。

如何改变你的声音

  1. 使用录制按钮录一段短音频,最长30秒;或上传最长10分钟的现有MP3、WAV、OGG、M4A或WebM文件。
  2. 选择松鼠音、低沉人声、机器人、回声,或通过−12至+12半音滑块自定义音高。变调会保留原时长。
  3. 可选设定0.5×至2×的速度,只改变节奏而不影响音高,且可与任何变调组合。若想要传统音高与速度联动的声音,请开启磁带模式。
  4. 查看读数:它会显示音高倍率、实际速度,以及片段长度是否保持不变或按多少倍变化。
  5. 点击“应用效果”,试听结果,再下载为16位WAV文件。

变声器常见问题

升高音高会让我的声音变快吗?
不会了。默认情况下,粒子变调器保留原时长,因此+12半音会高一个八度,但播放速度完全相同。若想要经典的音高越高、播放越快的联动效果,请开启磁带模式。
使用什么变调引擎?WSOLA备用引擎是什么?
主要引擎为Signalsmith Stretch,是编译为WebAssembly的开源录音室级时间拉伸与变调库。即使简单方法已出现明显相位感,它仍能保持人声自然。若无法加载,工具会使用内置WSOLA变调器,即波形相似性重叠相加算法:将音频切为重叠的90 ms粒子,调整间距,并在每个拼接点的±10 ms范围寻找最佳衔接。结果面板始终说明使用了哪个引擎。无论哪种引擎,超过约±7半音后,保留时长的变调都会略微改变音色,这是长度不变所需的权衡。
可以只改变速度而不改变音高吗?
可以。速度选项为0.5×至2×,只应用粒子时间拉伸,不执行重采样,因此2×片段长度减半,音高不变。速度可与任意音高预设或自定义半音偏移自由组合,读数始终显示最终时长倍率。
为什么输入文件限制为10分钟?
整个片段会一次离线渲染,内存用量和处理时间都随长度增加,运算量远大于简单重采样。为保持浏览器标签页响应,工具不接受超过10分钟的片段;请裁剪或拆分较长录音,再分别处理。
我的录音会上传到服务器吗?
不会。麦克风采集、文件解码、粒子处理和WAV编码都通过Web Audio API在浏览器内完成。不传输任何内容,关闭标签页后,尚未下载的内容都会被丢弃。
什么是环形调制?可以上传哪些文件格式?
环形调制将人声与稳定的30 Hz正弦波相乘,产生和频与差频,替代自然谐波,形成戴立克般的金属音色。可以上传浏览器能解码的MP3、WAV、OGG/Opus、M4A/AAC、WebM,以及通常情况下的FLAC;下载始终为未压缩的16位WAV,避免结果再次经过有损编码。