Добавить в корзинуПозвонить
Найти в Дзене
РР-Новости

Google представила ИИ-модель VLOGGER для мгновенного создания видео с говорящими людьми

Google представил новую технологию искусственного интеллекта - VLOGGER. Это программный продукт, который позволит создавать видеоролики с говорящими людьми на основе одного изображения и аудиофайла. Новая система стала возможно благодаря использованию генеративных диффузионных моделей, что отличает VLOGGER от предыдущих разработок. Метод не требует индивидуального обучения для каждого человека и способен работать без обнаружения и обрезки лиц, генерируя полные изображения, включая лицо и туловище, в различных сценариях. Система VLOGGER работает в два этапа: первый этап принимает в качестве входных данных форму аудиосигнала для создания промежуточных элементов управления движением тела, которые отвечают за взгляд, мимику и позу; второй этап представляет собой временную модель преобразования image-to-image, которая предсказывает дальнейшие движения тела для генерации соответствующих кадров. Чтобы привязать процесс к определенной личности, VLOGGER также использует эталонное изображение че

Google представил новую технологию искусственного интеллекта - VLOGGER. Это программный продукт, который позволит создавать видеоролики с говорящими людьми на основе одного изображения и аудиофайла.

Новая система стала возможно благодаря использованию генеративных диффузионных моделей, что отличает VLOGGER от предыдущих разработок. Метод не требует индивидуального обучения для каждого человека и способен работать без обнаружения и обрезки лиц, генерируя полные изображения, включая лицо и туловище, в различных сценариях.

Система VLOGGER работает в два этапа: первый этап принимает в качестве входных данных форму аудиосигнала для создания промежуточных элементов управления движением тела, которые отвечают за взгляд, мимику и позу; второй этап представляет собой временную модель преобразования image-to-image, которая предсказывает дальнейшие движения тела для генерации соответствующих кадров. Чтобы привязать процесс к определенной личности, VLOGGER также использует эталонное изображение человека.

Особое внимание уделено разнообразию и реалистичности генерируемых видео. VLOGGER способен создавать видео с интенсивным движением и высоким уровнем детализации, сохраняя при этом идентичность и временную последовательность. Модель была обучена на новом масштабном наборе данных MENTOR, который включает 2200 часов видео и 800000 личностей, что в 10 раз больше, чем предыдущие наборы данных.

]]>