Промпт для аудио

Обновлено

Аудио-модели решают две разные задачи. Одни пишут музыку — инструментал или трек с вокалом. Другие собирают звуковую сцену целиком: реплики персонажей, фоновые шумы, эффекты и музыку одним куском. Промпт для этих задач устроен по-разному, и текст, написанный под одну, на другой даст не тот результат. Какая модель что умеет, видно в каталоге — состав каталога меняется, приёмы ниже остаются.

Промпт для музыки

Музыкальной модели нужно описание самой музыки, а не сюжета или картинки, под которую она пойдёт. Работает набор из пяти вещей: жанр, настроение, инструменты, темп и характер вокала.

An energetic electronic dance track with soaring synth leads, punchy
four-on-the-floor kick drums and a catchy female vocal hook. 128 BPM.

Темп можно задавать числом в BPM или словами — «slow ballad», «fast tempo». Вокал описывается так же прямо: «male vocals», «female soprano», «rap». Если вокал не нужен, это лучше сказать явно.

Голоса реальных исполнителей модель воспроизводить отказывается — запрос «спой голосом такого-то» отклоняется фильтром.

Язык вокала называйте в промпте явно. У каждой модели свой список заявленных языков — у Lyria 3 это английский, немецкий, испанский, французский, хинди, японский, корейский и португальский, — но списком дело не ограничивается: русский вокал она поёт, хотя в заявленных языках его нет.

Промпт для звуковой сцены

Модель звуковой сцены читает промпт как короткий сценарий. Сильный промпт называет обстановку, вводит каждого говорящего с описанием голоса и подачи, а потом даёт саму реплику.

Inside a huge football stadium, with the deafening roar of tens of thousands
of fans in the background. The commentator (middle-aged male, British accent,
rich penetrating voice, extremely exhilarated) shouts: "OH, HE SCORES!"

Что стоит задать про каждый голос: пол, примерный возраст, акцент, тембр, эмоцию и темп речи. Чем конкретнее описание, тем меньше модель выбирает наугад.

Музыка и звуковые эффекты описываются в том же тексте обычными словами — отдельных полей для них нет. Один непрерывный фоновый слой плюс несколько точных эффектов работают лучше, чем десяток разных звуков подряд.

Скорость речи, громкость и высота тона — параметры блока, а не часть промпта. Писать их словами в текст не нужно.

Аудио на входе — это образец голоса

Аудио, подключённое к блоку генерации звука, — это образец голоса: модель повторит его звучание в своей озвучке. Сколько записей принимает модель, показывает сам блок; у Seed Audio 1.0 их до трёх.

Само подключение файла ничего не значит — на образец надо сослаться в тексте промпта. У Seed Audio 1.0 ссылка выглядит как @Audio1, @Audio2, @Audio3, и номер соответствует порядку соединений: первый подключённый файл — @Audio1.

Dex (smooth warm confident broadcaster voice, voiced by @Audio1), relaxed
and amused, says: "Alright, what exactly did you do?"

Промпт без такой ссылки — самая частая ошибка с этой моделью: файл подключён, в тексте о нём ни слова, и озвучка приходит чужим голосом либо генерация обрывается ошибкой.

Каким должен быть образец голоса

Требования к записи жёсткие, и модель отклоняет то, что им не соответствует:

  • не длиннее 30 секунд;
  • ровно один голос — второй говорящий на записи делает её непригодной;
  • без музыки и с минимумом фонового шума;
  • одна эмоция и один тембр на всю запись;
  • ровный уровень записи, естественный темп речи.

Если модель отказалась брать запись, дело почти всегда в этом: в файле музыка, несколько голосов или шумный фон.

Чего аудио на входе не делает

Это не референс стиля. Музыкальный отрывок, подключённый в надежде «сделай похоже по звучанию», задачу не решает: входа для образца музыкального стиля у аудио-моделей нет, стиль задаётся только словами в промпте.

Подключённая к Seed Audio 1.0 запись используется ещё и для работы с готовым звуком — продлить фрагмент, склеить два фрагмента, заменить реплику, сохранив голос и звучание помещения. Всё это тоже задаётся текстом промпта со ссылкой @Audio1.

Изображение вместо аудио

Аудио-модели принимают на вход и изображение. Музыкальной модели картинка задаёт настроение и тему будущего трека — так работает Lyria 3. Модели звуковой сцены она подсказывает характер озвучки: у Seed Audio 1.0 в этом режиме в промпте оставляют только текст, который нужно произнести.

Изображение и аудио одновременно Seed Audio 1.0 не принимает — что-то одно.