Запишите фрагмент или загрузите аудиофайл, примените голос бурундука, низкий голос, робота, эхо или свой сдвиг тона с сохранением длительности и скачайте результат в WAV.
Вся обработка выполняется офлайн в браузере через Web Audio API — ваш голос не покидает устройство. Тон и скорость независимы: изменение высоты сохраняет исходную длительность.
Изменение голоса: высота тона, робот и эхо
Запишите фрагмент или загрузите аудиофайл, примените голос бурундука, низкий голос, робота, эхо или свой сдвиг тона с сохранением длительности и скачайте результат в WAV.
или
Режим ленты связывает тон и скорость, как при ресэмплинге: повышение тона также ускоряет запись. Оставьте его выключенным, чтобы сохранить исходную длительность.
Высота тона: ×1.33
Сдвиг: +5 st
Скорость: ×1.00
Длительность сохранена
Множитель высоты = 2 в степени (полутоны ÷ 12), поэтому +5 st — примерно ×1.33, а +12 st — ровно ×2.00. По умолчанию сдвиг тона не меняет длину записи; длительность меняют только «Скорость» или «Режим ленты».
Приватность по замыслу: запись, декодирование и рендеринг выполняются локально. Ничего не отправляется на сервер.
Как работает этот инструмент изменения голоса
Все эффекты на этой странице работают офлайн в браузере и сохраняют результат в стандартный 16-битный WAV. Обработка детерминирована: одинаковый вход с одинаковыми настройками всегда даёт одинаковый выход, а обычный короткий фрагмент обрабатывается за одну-две секунды.
Тоновые эффекты сохраняют длительность: повышение или понижение тона НЕ меняет длину фрагмента. Пятисекундная запись остаётся пятисекундной, даже если сдвинуть её на октаву вверх или вниз. За обработку тона и скорости отвечает Signalsmith Stretch — открытый движок студийного качества для растяжения времени и сдвига высоты, скомпилированный в WebAssembly и работающий полностью офлайн в браузере. Он анализирует спектр перекрывающихся блоков и пересобирает звук с новым тоном и темпом, сохраняя естественный голос и чёткие атаки даже при больших сдвигах. Если WASM не загрузится из-за старого браузера или запрета WebAssembly, инструмент автоматически перейдёт на встроенный алгоритм временной области WSOLA — сложение с перекрытием по сходству формы волны. Звук делится на перекрывающиеся гранулы примерно по 90 миллисекунд, расстояния между ними меняются, а на каждом стыке следующая гранула сдвигается вперёд и назад до 10 миллисекунд в поиске лучшего совпадения с предыдущей волной. Финальный ресэмплинг точно возвращает исходную длительность. В обоих случаях каждая частота меняется на указанный множитель: 2 в степени (сдвиг в полутонах, делённый на 12). После обработки панель показывает использованный движок: Signalsmith (студийное качество) или WSOLA (резервный).
Скорость — отдельный независимый регулятор. Выбор 0.5× или 2× запускает тот же движок как чистое растяжение времени: фрагмент становится длиннее или короче без изменения высоты. Оба действия можно совместить: голос бурундука на +5 полутонов со скоростью 1.5× получается за один проход. Для старого характерного звучания включите режим ленты — классический ресэмплинг по скорости воспроизведения, связывающий тон и скорость, как ускоренная магнитная лента или пластинка на неверных оборотах. Тогда +12 полутонов означает двойную скорость и половинную длительность. Индикатор показывает множитель длительности, чтобы результат был предсказуемым.
Эффект робота — это кольцевая модуляция: голос умножается на синусоиду 30 Hz, и вместо естественных гармоник появляются суммарные и разностные частоты. Так создавали голоса далеков в 1960-х. Эхо пропускает сигнал через задержку 250 миллисекунд с обратной связью 45 процентов и добавляет полторы секунды хвоста, чтобы последние повторы успели отзвучать. Применения не ограничиваются шутками: авторы подкастов меняют голос собеседника на несколько полутонов для анонимности, сохраняя естественный ритм, разработчики игр массово создают голоса существ, преподаватели объясняют связь тона и темпа, а продюсеры используют режим ленты для лоу-фай фактуры. Гранулярная обработка сильно нагружает CPU, поэтому вход ограничен 10 минутами. Всё работает локально, и конфиденциальные записи никогда не попадают на сервер.
Настройки эффектов и их действие
Индикатор показывает множитель высоты, фактическую скорость и изменение длительности.
Эффект
Результат
Примечание
Бурундук (+5 st)
Высота ×1.33 — голос выше, длительность сохранена
Классический мультяшный голос в исходном темпе; лучше всего подходит чёткая речь.
Низкий голос (−5 st)
Высота ×0.75 — голос ниже, длительность сохранена
Весомость голоса из кинотрейлера без замедленной, тягучей речи, как при обработке ленты.
Робот (кольцевая модуляция 30 Hz)
Металлический голос в стиле далеков с исходной скоростью
Кольцевая модуляция умножает ваш голос на синусоиду 30 Hz.
Эхо (задержка 250 ms)
Повторяющееся эхо с затуханием на 45% за повтор
При рендеринге добавляется хвост 1.5 s, чтобы последние повторы полностью отзвучали.
Свой сдвиг +12 st
Высота ×2.00 — на октаву выше, длительность сохранена
В режиме ленты те же +12 st воспроизводятся на скорости 2.00× и длятся вдвое меньше.
Скорость 0.5×, высота без изменений
Длительность ×2.00 — половинная скорость с исходной высотой
Чистое растяжение времени: удобно для расшифровки и замедления быстрой речи.
Как изменить свой голос
Запишите короткий фрагмент кнопкой записи, до 30 секунд, или загрузите готовый MP3, WAV, OGG, M4A либо WebM длительностью до 10 минут.
Выберите «Бурундук», «Низкий голос», «Робот», «Эхо» или задайте свой тон ползунком от −12 до +12 полутонов. Сдвиг тона сохраняет исходную длительность.
При желании задайте скорость от 0.5× до 2×: она меняет темп без изменения тона и сочетается с любым сдвигом. Включите режим ленты, если нужен старый эффект связанных тона и скорости.
Посмотрите на индикатор: он показывает множитель высоты, фактическую скорость и то, остаётся ли длина прежней или во сколько раз меняется.
Нажмите «Применить эффект», прослушайте результат и скачайте его как 16-битный WAV.
Вопросы об изменении голоса
Повышение тона ускоряет мой голос?
Теперь нет: по умолчанию гранулярный сдвиг сохраняет исходную длительность, поэтому +12 полутонов звучит на октаву выше, но воспроизводится точно в том же темпе. Если нужно классическое поведение, когда повышение тона ускоряет запись, включите режим ленты.
Какой движок меняет тон и что такое резервный WSOLA?
Основной — Signalsmith Stretch, открытая библиотека студийного качества для растяжения времени и сдвига тона, скомпилированная в WebAssembly. Она сохраняет естественный голос даже там, где простые методы уже дают фазовые артефакты. Если она не загрузится, используется встроенный WSOLA — сложение с перекрытием по сходству формы волны: звук делится на перекрывающиеся гранулы по 90 ms, расстояния меняются, а на каждом стыке в пределах ±10 ms ищется лучшее совпадение. Панель всегда называет использованный движок. В обоих случаях за пределами примерно ±7 полутонов тембр слегка окрашивается — это плата за постоянную длину.
Можно менять скорость без изменения тона?
Да. Выбор скорости от 0.5× до 2× применяет гранулярное растяжение без этапа ресэмплинга: при 2× фрагмент вдвое короче с той же высотой. Скорость свободно сочетается с любым пресетом или сдвигом в полутонах, а индикатор всегда показывает итоговый множитель длительности.
Почему входные файлы ограничены 10 минутами?
Весь фрагмент рендерится офлайн за один проход. Расход памяти и время обработки растут с длиной, а вычислений намного больше, чем при простом ресэмплинге. Чтобы вкладка оставалась отзывчивой, инструмент не принимает фрагменты длиннее 10 минут. Обрежьте или разделите длинную запись и обработайте части отдельно.
Моя запись отправляется на сервер?
Нет. Захват микрофона, декодирование, гранулярная обработка и кодирование WAV выполняются внутри браузера через Web Audio API. Ничего не передаётся, а закрытие вкладки удаляет всё, что вы не скачали.
Что такое кольцевая модуляция и какие форматы можно загрузить?
Кольцевая модуляция умножает голос на постоянную синусоиду 30 Hz, создавая суммарные и разностные частоты вместо естественных гармоник — металлический тембр далеков. Подходит всё, что декодирует браузер: MP3, WAV, OGG/Opus, M4A/AAC, WebM и обычно FLAC. Результат всегда скачивается как несжатый 16-битный WAV, без второго кодирования с потерями.