Промпт для аудио
Обновлено
Аудио-модели решают две разные задачи. Одни пишут музыку — инструментал или трек с вокалом. Другие собирают звуковую сцену целиком: реплики персонажей, фоновые шумы, эффекты и музыку одним куском. Промпт для этих задач устроен по-разному, и текст, написанный под одну, на другой даст не тот результат. Какая модель что умеет, видно в каталоге — состав каталога меняется, приёмы ниже остаются.
Промпт для музыки
Музыкальной модели нужно описание самой музыки, а не сюжета или картинки, под которую она пойдёт. Работает набор из пяти вещей: жанр, настроение, инструменты, темп и характер вокала.
An energetic electronic dance track with soaring synth leads, punchy
four-on-the-floor kick drums and a catchy female vocal hook. 128 BPM.
Темп можно задавать числом в BPM или словами — «slow ballad», «fast tempo». Вокал описывается так же прямо: «male vocals», «female soprano», «rap». Если вокал не нужен, это лучше сказать явно.
Голоса реальных исполнителей модель воспроизводить отказывается — запрос «спой голосом такого-то» отклоняется фильтром.
Язык вокала называйте в промпте явно. У каждой модели свой список заявленных языков — у Lyria 3 это английский, немецкий, испанский, французский, хинди, японский, корейский и португальский, — но списком дело не ограничивается: русский вокал она поёт, хотя в заявленных языках его нет.
Промпт для звуковой сцены
Модель звуковой сцены читает промпт как короткий сценарий. Сильный промпт называет обстановку, вводит каждого говорящего с описанием голоса и подачи, а потом даёт саму реплику.
Inside a huge football stadium, with the deafening roar of tens of thousands
of fans in the background. The commentator (middle-aged male, British accent,
rich penetrating voice, extremely exhilarated) shouts: "OH, HE SCORES!"
Что стоит задать про каждый голос: пол, примерный возраст, акцент, тембр, эмоцию и темп речи. Чем конкретнее описание, тем меньше модель выбирает наугад.
Музыка и звуковые эффекты описываются в том же тексте обычными словами — отдельных полей для них нет. Один непрерывный фоновый слой плюс несколько точных эффектов работают лучше, чем десяток разных звуков подряд.
Скорость речи, громкость и высота тона — параметры блока, а не часть промпта. Писать их словами в текст не нужно.
Аудио на входе — это образец голоса
Аудио, подключённое к блоку генерации звука, — это образец голоса: модель повторит его звучание в своей озвучке. Сколько записей принимает модель, показывает сам блок; у Seed Audio 1.0 их до трёх.
Само подключение файла ничего не значит — на образец надо сослаться в тексте промпта. У Seed Audio 1.0 ссылка выглядит как @Audio1, @Audio2, @Audio3, и номер соответствует порядку соединений: первый подключённый файл — @Audio1.
Dex (smooth warm confident broadcaster voice, voiced by @Audio1), relaxed
and amused, says: "Alright, what exactly did you do?"
Промпт без такой ссылки — самая частая ошибка с этой моделью: файл подключён, в тексте о нём ни слова, и озвучка приходит чужим голосом либо генерация обрывается ошибкой.
Каким должен быть образец голоса
Требования к записи жёсткие, и модель отклоняет то, что им не соответствует:
- не длиннее 30 секунд;
- ровно один голос — второй говорящий на записи делает её непригодной;
- без музыки и с минимумом фонового шума;
- одна эмоция и один тембр на всю запись;
- ровный уровень записи, естественный темп речи.
Если модель отказалась брать запись, дело почти всегда в этом: в файле музыка, несколько голосов или шумный фон.
Чего аудио на входе не делает
Это не референс стиля. Музыкальный отрывок, подключённый в надежде «сделай похоже по звучанию», задачу не решает: входа для образца музыкального стиля у аудио-моделей нет, стиль задаётся только словами в промпте.
Подключённая к Seed Audio 1.0 запись используется ещё и для работы с готовым звуком — продлить фрагмент, склеить два фрагмента, заменить реплику, сохранив голос и звучание помещения. Всё это тоже задаётся текстом промпта со ссылкой @Audio1.
Изображение вместо аудио
Аудио-модели принимают на вход и изображение. Музыкальной модели картинка задаёт настроение и тему будущего трека — так работает Lyria 3. Модели звуковой сцены она подсказывает характер озвучки: у Seed Audio 1.0 в этом режиме в промпте оставляют только текст, который нужно произнести.
Изображение и аудио одновременно Seed Audio 1.0 не принимает — что-то одно.