首页
要闻详情
图标图标

阿里云宣布自研 EMO 模型上线通义 App,用照片 + 音频生成唱歌视频

亚汇网亚汇网
关注
2024-04-26 06:01:37
1598
阿里云今日宣布,通义实验室研发的AI模型——O正式上线通义A,并开放给所有用户免费使用。借助这一功能,用户可以在歌曲、热梗、表情包中任选一款模板,然后通过上传一张肖像照片就能让O合成演戏唱歌视频。据介绍,通义A首批上线了80多个O模板,包括热门歌曲《上春山》《野狼Di
阿里云今日宣布,通义实验室研发的AI模型——EMO正式上线通义App,并开放给所有用户免费使用。借助这一功能,用户可以在歌曲、热梗、表情包中任选一款模板,然后通过上传一张肖像照片就能让EMO合成演戏唱歌视频。据介绍,通义App首批上线了80多个EMO模板,包括热门歌曲《上春山》《野狼Disco》等,还有网络热梗“钵钵鸡”“回手掏”等,但目前暂未不开放自定义音频。指股网附EMO官网入口:官方项目主页:arXiv研究论文:GitHub:EMO的主要特点音频驱动的视频生成:EMO能够根据输入的音频(如说话或唱歌)直接生成视频,无需依赖于预先录制的视频片段或3D面部模型。高表现力和逼真度:EMO生成的视频具有高度的表现力,能够捕捉并再现人类面部表情的细微差别,包括微妙的微表情,以及与音频节奏相匹配的头部运动。无缝帧过渡:EMO确保视频帧之间的过渡自然流畅,避免了面部扭曲或帧间抖动的问题,从而提高了视频的整体质量。身份保持:通过FrameEncoding模块,EMO能够在视频生成过程中保持角色身份的一致性,确保角色的外观与输入的参考图像保持一致。稳定的控制机制:EMO采用了速度控制器和面部区域控制器等稳定控制机制,以增强视频生成过程中的稳定性,避免视频崩溃等问题。灵活的视频时长:EMO可以根据输入音频的长度生成任意时长的视频,为用户提供了灵活的创作空间。跨语言和跨风格:EMO的训练数据集涵盖了多种语言和风格,包括中文和英文,以及现实主义、动漫和3D风格,这使得EMO能够适应不同的文化和艺术风格。广告声明:文内含有的对外跳转链接(包括不限于超链接、二维码、口令等形式),用于传递更多信息,节省甄选时间,结果仅供参考,指股网所有文章均包含本声明。

风险提示及免责声明

文章来源于亚汇网,转载注明原文出处,此文观点与指股网无关,理性阅读,版权属于原作者若无意侵犯媒体或个人知识产权,请联系我们,本站将在第一时间删掉 ,指股网仅提供信息存储空间服务。