
Китайские инженеры разработали приложение на основе ИИ под названием Emote Portrait Live, которое может анимировать неподвижный портрет и синхронизировать его с аудиодорожкой.
Технология опирается на генеративные возможности диффузионных моделей (математических моделей, способных анализировать массив данных и на основе этого прогнозировать его изменение), напрямую создавая видео с головой персонажа из предоставленного изображения и любой аудиозаписи. Этот процесс избегает необходимости сложной предварительной обработки или промежуточных генераций, тем самым упрощая создание видео с говорящими головами.

Самое сложное — уловить нюансы и разнообразие движений лица человека во время формирования видео. Традиционные методы упрощают процесс, накладывая ограничения на конечный результат, например, используются 3D-модели для ограничения ключевых точек лица и последовательности движений головы из реальных видео для управления общим движением. Однако это может накладывать ограничения на естественность получаемых выражений лица.
Цель исследовательской группы — разработать систему «говорящей головы», которая сможет улавливать широкий спектр реалистичных выражений лица, включая тонкую мимику, и обеспечивать естественные движения всей головы.
Однако интеграция звука имеет свои проблемы из-за неоднозначной взаимосвязи между звуком и выражениями лица. Это может привести к нестабильности видео, создаваемого моделью, включая искажения в лице или дрожание видеокадра. Чтобы с этим справиться, исследователи включили в свою модель механизм стабилизации, в частности, контроллер скорости и контроллер области лица.
Несмотря на потенциал этой технологии, у нее есть определенные недостатки. Этот процесс требует больше времени, чем методы, основанные не на диффузионных моделях. Кроме того, поскольку нет явных сигналов, управляющих движением персонажа, модель может случайно сгенерировать другие части тела, например руки, что приведет к появлению артефактов в видео.
Группа опубликовала статью пот результатам своей работы, а на этом веб-сайте можно посмотреть другие видеоролики, демонстрирующие возможности Emote Portrait Live, в том числе отрывки с Хоакином Фениксом в роли Джокера, Леонардо Ди Каприо и Одри Хепберн.
Ниже Мона Лиза читает монолог Розалинды из комедии Шекспира «Как вам это понравится».
Источник — techradar.com
