Дизайн и видео

Нейросеть и звуки для видео: шумы, эффекты и голос диктора

Тишина в ролике заметнее плохой картинки. Разбираем, как сгенерировать шаги, дождь и удары по описанию, как клонировать свой голос и задать интонацию, как попасть звуком в кадр с допуском в три кадра и какие уровни громкости держать, чтобы речь не тонула в музыке.

Короткий ответ: звук ролика собирается из четырёх слоёв — речь, шумы предметов, атмосфера помещения и музыка. Нейросеть закрывает три из них: генерирует эффекты по текстовому описанию отрезками до 20-25 секунд, озвучивает текст голосом, в том числе клонированным с вашей записи, и подбирает подложку. Синхрон с картинкой и уровни громкости остаются ручной работой, на десятиминутный ролик это 40-90 минут.

Из чего складывается звук ролика: речь, шумы, атмосфера и музыка

Слой Что это Что заметит зритель, если слоя нет
Речь голос за кадром или синхрон говорящего ролик непонятен, это единственный обязательный слой
Шумы предметов шаги, дверь, клавиатура, стакан на столе картинка кажется мёртвой, движение не ощущается
Атмосфера ровный фон места: улица, офис, лес, кафе на склейках слышны провалы в полную тишину
Музыка подложка, акценты на переходах ролик распадается на куски, темп не держится
Акценты щелчки, свист, удары под появление текста титры и графика выглядят приклеенными

Порядок сборки обратный списку: сначала речь, под неё атмосфера, потом шумы под действия, музыка последней и тише всех. Начинать с музыки — типовая ошибка: под неё уже не подложить речь без ощущения, что диктор кричит из соседней комнаты.

Что генератор звуковых эффектов делает за десять секунд, а что не делает вообще

Текст в звук работает так же, как текст в картинку: вы описываете, что должно звучать, сервис отдаёт несколько вариантов отрезком до 20-25 секунд. Разница по задачам заметная.

  • Получается надёжно. Шаги по разным поверхностям, дождь, ветер, огонь, вода, удары, скрипы, гул толпы, фон офиса и улицы, механические щелчки, шелест бумаги.
  • Получается через раз. Двигатель конкретной машины, звук животного с характерным поведением, длинная сцена с развитием, ритмичные повторы в темп.
  • Не получается. Речь и слова внутри эффекта, узнаваемые фирменные сигналы устройств и систем, точная копия существующего звука, чистая нота нужной высоты.

Отсюда следствие: дождь, шаги и щелчок мыши быстрее скачать из бесплатной библиотеки, чем генерировать и слушать четыре варианта. Генерация выигрывает на редких сочетаниях: «скрип старой деревянной двери в пустом ангаре с эхом».

Как описать звук текстом: материал, расстояние, помещение и длительность

Описание «звук шагов» даёт усреднённые шаги ни по чему. Рабочее описание содержит пять вещей: что происходит, из чего сделана поверхность или предмет, с какого расстояния слышно, в каком помещении, сколько длится.

Пример целиком: «Шаги по мокрому асфальту, женские туфли на невысоком каблуке, спокойный ровный темп, восемь шагов, слышно с двух метров, узкая улица с эхом от стен, лёгкий дождь фоном, 7 секунд, без музыки и без голосов».

Второй пример, под акцент к титру: «Короткий низкий удар с металлическим послезвучием, резкая атака, затухание за полторы секунды, ощущение тяжести, без реверберации помещения, 2 секунды».

Дальше отбирают из вариантов и режут лишнее. На один нужный эффект уходит 2-4 генерации, на ролик с десятком акцентов — 20-30 минут вместе с прослушиванием.

Как клонировать свой голос и что для этого записать

Клонирование даёт возможность озвучивать ролики своим голосом, не садясь к микрофону каждый раз: текст правится в документе, звук пересобирается за минуту. Для роликов, где текст меняется по десять раз, это экономит больше всего.

  1. Запишите 2-3 минуты речи одним микрофоном, в тихой комнате с мягкой мебелью или шторами. Ванная, кухня и пустая комната с голыми стенами не годятся: эхо запишется вместе с голосом и вылезет в каждой фразе.
  2. Читайте нейтральный текст с разной длиной предложений, ровным темпом, без пауз на обдумывание. Не надо играть голосом: клон повторит манеру, включая наигрыш.
  3. Не двигайтесь относительно микрофона и держите одну дистанцию, иначе громкость поплывёт.
  4. Уберите дыхание и щелчки из образца перед загрузкой, они попадают в модель голоса.
  5. Для точного клона сервисы просят от получаса записи и отдельное подтверждение, что голос ваш: обычно это фраза, которую надо произнести на камеру или в микрофон.

Русский язык синтезируется хуже английского, и это касается и клонов: смазываются окончания, ударения встают не туда в трёх- и четырёхсложных словах, иностранные фамилии коверкаются. Проверять надо каждый дубль целиком.

Как задать интонацию и паузы: разметка текста, скорость и ударения

  • Знаки препинания. Точка даёт паузу длиннее запятой, многоточие — ещё длиннее. Расставлять их надо по дыханию, а не по правилам письменной речи.
  • Длина предложения. Фразы длиннее 15 слов синтез читает монотонно. Резать на короткие — самый быстрый способ оживить озвучку.
  • Числа и сокращения. Пишутся словами: «двадцать пять процентов», «сто двадцать BYN», иначе прочитается как попало.
  • Ударения. Омографы вроде «замок», «дорога», «стоит» надо развести по контексту или заменить синонимом, часть сервисов принимает разметку ударения знаком.
  • Скорость. Диапазон 0,9-1,1 от базовой. Дальше слышна перемотка.
  • Эмоция. Отдельные сервисы принимают пометку настроения перед абзацем. Работает она грубо: спокойно и уверенно получается, тонкая ирония — нет.

Практический приём: длинный текст режется на куски по 1500-2000 знаков и озвучивается частями. Так проще перегенерировать одну неудачную фразу, не трогая остальное, и легче подгонять паузы под монтаж.

Как свести звук с картинкой: попадание в кадр с допуском в три кадра

При 25 кадрах в секунду один кадр длится 40 миллисекунд. Слух устроен несимметрично: если звук отстаёт от картинки на два-три кадра, зритель этого почти не замечает — в жизни звук тоже приходит позже. А вот опережение слышно уже на одном кадре и читается как брак.

  1. Ставьте эффект по первому кадру действия, потом сдвигайте на один-два кадра назад по времени и слушайте. Часто становится чище.
  2. Удары и щелчки выравнивайте по атаке, а не по началу файла: в начале файла бывает тишина в десятки миллисекунд.
  3. Атмосферу кладите сплошным слоем под всю сцену, а не кусками по клипам, иначе на каждой склейке будет слышен стык.
  4. На переходах делайте перекрытие в 3-6 кадров с плавным затуханием, резкая смена фона слышна как хлопок.
  5. Проверяйте в наушниках и через динамик телефона. Половина зрителей услышит ролик именно из телефонного динамика, где низкие частоты пропадают целиком.

Какие уровни громкости держать: -14 LUFS на выходе и речь громче музыки

Слой Уровень относительно речи Что происходит при нарушении
Речь диктора основной уровень, к нему подстраивается всё
Музыка под речью тише на 12-15 dB слова тонут, зритель прибавляет громкость и уходит
Музыка без речи тише на 3-6 dB перепад между сценами бьёт по ушам
Атмосфера тише на 20-25 dB фон вылезает вперёд и утомляет за минуту
Акценты и удары вровень с речью или чуть громче, короткими всплесками либо не слышны, либо пугают

Итог сводят примерно к -14 LUFS с пиками не выше -1 dBTP: площадки всё равно приведут ролик к своему уровню, и слишком громкая сборка будет придавлена вместе с динамикой. Измеритель есть в бесплатных редакторах звука, смотреть надо на интегральное значение по всему ролику, а не на пики.

Чей голос нельзя клонировать и какой звук нельзя брать из чужих роликов

  • Свой голос — можно всё, включая коммерческое использование, если это разрешает тариф сервиса.
  • Голос диктора, которого вы наняли, — только если право на синтез прописано в договоре отдельным пунктом. Оплата записи сама по себе такого права не даёт.
  • Голос известного человека, актёра, блогера — нельзя. Это запрещено правилами всех крупных сервисов и создаёт прямой риск претензии.
  • Звук из чужого ролика или фильма — объект чужих прав, включая звуковую дорожку. Вырезать оттуда эффект и вставить к себе нельзя.
  • Библиотеки звуков — смотреть на лицензию каждого файла. Часть бесплатных требует указания автора, часть запрещает коммерческое использование.
  • Работа на заказ — в переписке с клиентом прямо указывать, что озвучка синтезирована и на каком тарифе. Это снимает половину будущих споров.

Сколько стоит звуковое оформление ролика в Беларуси и что считать экономией

Работа Ориентир по рынку Своими руками с нейросетью
Озвучка короткого ролика диктором от 50-100 BYN 10-15 минут на дубль
Час студийной записи в Минске от 40 BYN
Шумовое оформление ролика на 2-3 минуты от 80-200 BYN 40-90 минут
Сведение звука одного ролика от 60 BYN 20-40 минут
Подписка на синтез речи и генератор эффектов примерно 15-70 BYN в месяц

Экономия видна не на одном ролике, а на переделках. Клиент правит текст в четвёртый раз — живого диктора надо звать заново и платить заново, синтез пересобирается за минуту. Именно поэтому синтез забирает не всю озвучку, а её самую скучную часть: инструкции, обзоры, объявления, ролики с меняющимся текстом. Живой голос остаётся там, где голос и есть продукт.

Как звуковое оформление становится строкой в счёте, а не бесплатным довеском

Звук почти всегда отдают бесплатно вместе с монтажом, и зря: это отдельная работа с понятным результатом, который слышно с первой секунды. Считать её проще всего пакетом — озвучка, шумы, атмосфера, сведение, две правки текста, срок двое суток. Как собирать такие пакеты по видео и звуку и на чём тренироваться без заказчика, разбирается на странице курса для дизайнеров и видеомейкеров, а как оформить это услугой с ценой, сроком и самозанятостью по белорусскому праву — на странице для фрилансеров. Если непонятно, с какой из четырёх задач начинать, для этого есть бесплатный разбор на 20-30 минут.

Частые вопросы

Может ли нейросеть сгенерировать звук по текстовому описаниюДа, генераторы звуковых эффектов делают отрезок до 20-25 секунд по описанию вроде «шаги по гравию, мужская обувь, спокойный темп». Хорошо получаются шумы, удары, атмосфера помещения. Плохо - речь внутри эффекта, музыка с развитием и узнаваемые сигналы конкретных устройств.
Что нужно записать, чтобы клонировать свой голосДве-три минуты чистой речи одним микрофоном, в тихой комнате, без музыки и эха, ровным темпом. Читать лучше нейтральный текст с разной длиной фраз. Для профессионального клона сервисы просят от получаса записи и отдельное подтверждение согласия.
Насколько звук может отставать от картинкиОтставание до трёх кадров при частоте 25 кадров в секунду, то есть примерно до 120 миллисекунд, зритель почти не замечает. Опережение заметно вдвое раньше: звук, пришедший раньше картинки больше чем на кадр, читается как ошибка.
Какую громкость держать в ролике для соцсетейИтог сводят примерно к -14 LUFS, пики не выше -1 dBTP: площадки всё равно приводят громкость к своему уровню. Музыка под речью тише речи на 12-15 dB, атмосфера и шумы - на 20-25 dB.
Можно ли клонировать голос другого человекаТолько с его письменным согласием, и в договоре с диктором это отдельный пункт. Голос известного человека, актёра или блогера клонировать нельзя: это запрещено правилами сервисов и создаёт прямой юридический риск.

Дизайнерам: разберём вашу ситуацию бесплатно

Управляемая генерация под бриф, видео без съёмки и сборка сайтов без разработчика.

Подробнее