Нейросеть и звуки для видео: шумы, эффекты и голос диктора
Тишина в ролике заметнее плохой картинки. Разбираем, как сгенерировать шаги, дождь и удары по описанию, как клонировать свой голос и задать интонацию, как попасть звуком в кадр с допуском в три кадра и какие уровни громкости держать, чтобы речь не тонула в музыке.
Короткий ответ: звук ролика собирается из четырёх слоёв — речь, шумы предметов, атмосфера помещения и музыка. Нейросеть закрывает три из них: генерирует эффекты по текстовому описанию отрезками до 20-25 секунд, озвучивает текст голосом, в том числе клонированным с вашей записи, и подбирает подложку. Синхрон с картинкой и уровни громкости остаются ручной работой, на десятиминутный ролик это 40-90 минут.
Из чего складывается звук ролика: речь, шумы, атмосфера и музыка
| Слой | Что это | Что заметит зритель, если слоя нет |
|---|---|---|
| Речь | голос за кадром или синхрон говорящего | ролик непонятен, это единственный обязательный слой |
| Шумы предметов | шаги, дверь, клавиатура, стакан на столе | картинка кажется мёртвой, движение не ощущается |
| Атмосфера | ровный фон места: улица, офис, лес, кафе | на склейках слышны провалы в полную тишину |
| Музыка | подложка, акценты на переходах | ролик распадается на куски, темп не держится |
| Акценты | щелчки, свист, удары под появление текста | титры и графика выглядят приклеенными |
Порядок сборки обратный списку: сначала речь, под неё атмосфера, потом шумы под действия, музыка последней и тише всех. Начинать с музыки — типовая ошибка: под неё уже не подложить речь без ощущения, что диктор кричит из соседней комнаты.
Что генератор звуковых эффектов делает за десять секунд, а что не делает вообще
Текст в звук работает так же, как текст в картинку: вы описываете, что должно звучать, сервис отдаёт несколько вариантов отрезком до 20-25 секунд. Разница по задачам заметная.
- Получается надёжно. Шаги по разным поверхностям, дождь, ветер, огонь, вода, удары, скрипы, гул толпы, фон офиса и улицы, механические щелчки, шелест бумаги.
- Получается через раз. Двигатель конкретной машины, звук животного с характерным поведением, длинная сцена с развитием, ритмичные повторы в темп.
- Не получается. Речь и слова внутри эффекта, узнаваемые фирменные сигналы устройств и систем, точная копия существующего звука, чистая нота нужной высоты.
Отсюда следствие: дождь, шаги и щелчок мыши быстрее скачать из бесплатной библиотеки, чем генерировать и слушать четыре варианта. Генерация выигрывает на редких сочетаниях: «скрип старой деревянной двери в пустом ангаре с эхом».
Как описать звук текстом: материал, расстояние, помещение и длительность
Описание «звук шагов» даёт усреднённые шаги ни по чему. Рабочее описание содержит пять вещей: что происходит, из чего сделана поверхность или предмет, с какого расстояния слышно, в каком помещении, сколько длится.
Пример целиком: «Шаги по мокрому асфальту, женские туфли на невысоком каблуке, спокойный ровный темп, восемь шагов, слышно с двух метров, узкая улица с эхом от стен, лёгкий дождь фоном, 7 секунд, без музыки и без голосов».
Второй пример, под акцент к титру: «Короткий низкий удар с металлическим послезвучием, резкая атака, затухание за полторы секунды, ощущение тяжести, без реверберации помещения, 2 секунды».
Дальше отбирают из вариантов и режут лишнее. На один нужный эффект уходит 2-4 генерации, на ролик с десятком акцентов — 20-30 минут вместе с прослушиванием.
Как клонировать свой голос и что для этого записать
Клонирование даёт возможность озвучивать ролики своим голосом, не садясь к микрофону каждый раз: текст правится в документе, звук пересобирается за минуту. Для роликов, где текст меняется по десять раз, это экономит больше всего.
- Запишите 2-3 минуты речи одним микрофоном, в тихой комнате с мягкой мебелью или шторами. Ванная, кухня и пустая комната с голыми стенами не годятся: эхо запишется вместе с голосом и вылезет в каждой фразе.
- Читайте нейтральный текст с разной длиной предложений, ровным темпом, без пауз на обдумывание. Не надо играть голосом: клон повторит манеру, включая наигрыш.
- Не двигайтесь относительно микрофона и держите одну дистанцию, иначе громкость поплывёт.
- Уберите дыхание и щелчки из образца перед загрузкой, они попадают в модель голоса.
- Для точного клона сервисы просят от получаса записи и отдельное подтверждение, что голос ваш: обычно это фраза, которую надо произнести на камеру или в микрофон.
Русский язык синтезируется хуже английского, и это касается и клонов: смазываются окончания, ударения встают не туда в трёх- и четырёхсложных словах, иностранные фамилии коверкаются. Проверять надо каждый дубль целиком.
Как задать интонацию и паузы: разметка текста, скорость и ударения
- Знаки препинания. Точка даёт паузу длиннее запятой, многоточие — ещё длиннее. Расставлять их надо по дыханию, а не по правилам письменной речи.
- Длина предложения. Фразы длиннее 15 слов синтез читает монотонно. Резать на короткие — самый быстрый способ оживить озвучку.
- Числа и сокращения. Пишутся словами: «двадцать пять процентов», «сто двадцать BYN», иначе прочитается как попало.
- Ударения. Омографы вроде «замок», «дорога», «стоит» надо развести по контексту или заменить синонимом, часть сервисов принимает разметку ударения знаком.
- Скорость. Диапазон 0,9-1,1 от базовой. Дальше слышна перемотка.
- Эмоция. Отдельные сервисы принимают пометку настроения перед абзацем. Работает она грубо: спокойно и уверенно получается, тонкая ирония — нет.
Практический приём: длинный текст режется на куски по 1500-2000 знаков и озвучивается частями. Так проще перегенерировать одну неудачную фразу, не трогая остальное, и легче подгонять паузы под монтаж.
Как свести звук с картинкой: попадание в кадр с допуском в три кадра
При 25 кадрах в секунду один кадр длится 40 миллисекунд. Слух устроен несимметрично: если звук отстаёт от картинки на два-три кадра, зритель этого почти не замечает — в жизни звук тоже приходит позже. А вот опережение слышно уже на одном кадре и читается как брак.
- Ставьте эффект по первому кадру действия, потом сдвигайте на один-два кадра назад по времени и слушайте. Часто становится чище.
- Удары и щелчки выравнивайте по атаке, а не по началу файла: в начале файла бывает тишина в десятки миллисекунд.
- Атмосферу кладите сплошным слоем под всю сцену, а не кусками по клипам, иначе на каждой склейке будет слышен стык.
- На переходах делайте перекрытие в 3-6 кадров с плавным затуханием, резкая смена фона слышна как хлопок.
- Проверяйте в наушниках и через динамик телефона. Половина зрителей услышит ролик именно из телефонного динамика, где низкие частоты пропадают целиком.
Какие уровни громкости держать: -14 LUFS на выходе и речь громче музыки
| Слой | Уровень относительно речи | Что происходит при нарушении |
|---|---|---|
| Речь диктора | основной уровень, к нему подстраивается всё | — |
| Музыка под речью | тише на 12-15 dB | слова тонут, зритель прибавляет громкость и уходит |
| Музыка без речи | тише на 3-6 dB | перепад между сценами бьёт по ушам |
| Атмосфера | тише на 20-25 dB | фон вылезает вперёд и утомляет за минуту |
| Акценты и удары | вровень с речью или чуть громче, короткими всплесками | либо не слышны, либо пугают |
Итог сводят примерно к -14 LUFS с пиками не выше -1 dBTP: площадки всё равно приведут ролик к своему уровню, и слишком громкая сборка будет придавлена вместе с динамикой. Измеритель есть в бесплатных редакторах звука, смотреть надо на интегральное значение по всему ролику, а не на пики.
Чей голос нельзя клонировать и какой звук нельзя брать из чужих роликов
- Свой голос — можно всё, включая коммерческое использование, если это разрешает тариф сервиса.
- Голос диктора, которого вы наняли, — только если право на синтез прописано в договоре отдельным пунктом. Оплата записи сама по себе такого права не даёт.
- Голос известного человека, актёра, блогера — нельзя. Это запрещено правилами всех крупных сервисов и создаёт прямой риск претензии.
- Звук из чужого ролика или фильма — объект чужих прав, включая звуковую дорожку. Вырезать оттуда эффект и вставить к себе нельзя.
- Библиотеки звуков — смотреть на лицензию каждого файла. Часть бесплатных требует указания автора, часть запрещает коммерческое использование.
- Работа на заказ — в переписке с клиентом прямо указывать, что озвучка синтезирована и на каком тарифе. Это снимает половину будущих споров.
Сколько стоит звуковое оформление ролика в Беларуси и что считать экономией
| Работа | Ориентир по рынку | Своими руками с нейросетью |
|---|---|---|
| Озвучка короткого ролика диктором | от 50-100 BYN | 10-15 минут на дубль |
| Час студийной записи в Минске | от 40 BYN | — |
| Шумовое оформление ролика на 2-3 минуты | от 80-200 BYN | 40-90 минут |
| Сведение звука одного ролика | от 60 BYN | 20-40 минут |
| Подписка на синтез речи и генератор эффектов | — | примерно 15-70 BYN в месяц |
Экономия видна не на одном ролике, а на переделках. Клиент правит текст в четвёртый раз — живого диктора надо звать заново и платить заново, синтез пересобирается за минуту. Именно поэтому синтез забирает не всю озвучку, а её самую скучную часть: инструкции, обзоры, объявления, ролики с меняющимся текстом. Живой голос остаётся там, где голос и есть продукт.
Как звуковое оформление становится строкой в счёте, а не бесплатным довеском
Звук почти всегда отдают бесплатно вместе с монтажом, и зря: это отдельная работа с понятным результатом, который слышно с первой секунды. Считать её проще всего пакетом — озвучка, шумы, атмосфера, сведение, две правки текста, срок двое суток. Как собирать такие пакеты по видео и звуку и на чём тренироваться без заказчика, разбирается на странице курса для дизайнеров и видеомейкеров, а как оформить это услугой с ценой, сроком и самозанятостью по белорусскому праву — на странице для фрилансеров. Если непонятно, с какой из четырёх задач начинать, для этого есть бесплатный разбор на 20-30 минут.
Частые вопросы
Дизайнерам: разберём вашу ситуацию бесплатно
Управляемая генерация под бриф, видео без съёмки и сборка сайтов без разработчика.
Подробнее →