Microsoft представила VALL-E — ИИ-модель, которая имитирует голос по маленькому образцу

Microsoft представила модель искусственного интеллекта (ИИ) под названием VALL-E — она преобразует текст в речь, точно имитируя голос человека, а образцом может служить запись продолжительностью всего в три секунды. При этом ИИ сохраняет эмоциональную окраску речи образца.

Microsoft представила VALL-E — ИИ-модель, которая имитирует голос по маленькому образцу

Авторы проекта говорят, что система окажется полезной при разработке приложений с возможностью высококачественного преобразования текста в речь и при создании аудиоконтента в сочетании с другими ИИ-генераторами контента вроде GPT-3. Хотя они также признают, что её можно использовать для редактирования аудиозаписи по расшифровке — модель может «заставить» человека произносить слова, которых он никогда в реальности не говорил.

При создании модели использовалась разработанная Meta* технология EnCodec, которая обеспечивает эффективное сжатие аудиосигнала. В отличие от традиционных методов преобразования текста в речь, VALL-E не конструирует звуковые волны, а анализирует особенности речи человека, разбивает эти данные на отдельные компоненты (так называемые «токены») и генерирует запись на основе того, что уже «знает» об образце — моделирует голос, как он бы мог звучать за пределами трёхсекундного образца. Обучение модели производилось на библиотеке LibriLight, собранной Meta* — она же, в свою очередь, была построена на 60 000 часов англоязычной речи более чем 7000 носителей: данные были позаимствованы преимущественно из коллекции LibriVox.

Microsoft представила VALL-E — ИИ-модель, которая имитирует голос по маленькому образцу

В представленных на сайте проекта образцах колонка «Speaker Prompt» содержит образцы речи; в колонке «Ground Truth» представлена запись необходимого текста в исполнении человека, с которого был записан образец; «Baseline» — образец работы традиционных преобразователей текста в речь, а «VALL-E» — работа новой ИИ-модели. Нейросеть также может предложить несколько вариантов необходимого текста с голосом на образце. Создатели системы добавили, что она не только придаёт голосу на генерируемой записи нужный эмоциональный окрас, но и имитирует «акустическое окружение» образца — если исходная запись была сделана с телефонного разговора, то и результат будет напоминать разговор по телефону.

Из-за опасности злоупотреблений технологией Microsoft не стала публиковать код VALL-E для экспериментов, поэтому все желающие протестировать работу модели не смогут. В компании добавили, что аналогичным образом будут поступать и с другими проектами, если они несут потенциальную угрозу злоупотреблений.

* Внесена в перечень общественных объединений и религиозных организаций, в отношении которых судом принято вступившее в законную силу решение о ликвидации или запрете деятельности по основаниям, предусмотренным Федеральным законом от 25.07.2002 № 114-ФЗ «О противодействии экстремистской деятельности».

Источник

Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *