可以试试这个开源项目:live speech portraits real-time photo realistic talking-head animation(现场演讲肖像:实时逼真的谈话头像动画)。
该系统仅由超过 30 fps 的音频信号驱动,生成个性化的、逼真的说话头动画。我们的系统包含三个阶段。第一阶段是深度神经网络,提取深度音频特征以及流形投影,将特征投影到目标人的语音空间。在第二阶段,我们从投影的音频特征中学习面部动态和动作。预测的运动包括头部姿势和上身运动,其中前者由自回归概率模型生成,该模型模拟目标人物的头部姿势分布。上半身运动是从头部姿势推断出来的。在最后阶段,我们根据之前的预测生成条件特征图,并将它们与候选图像集一起发送到图像到图像的转换网络,以合成逼真的渲染。我们的方法可以很好地泛化到野外音频并成功合成高保真个性化面部细节,例如皱纹、牙齿。我们的方法还允许明确控制头部姿势。广泛的定性和定量评估以及用户研究证明了我们的方法优于最先进技术。
github地址:https://github.com/YuanxunLu/LiveSpeechPortraits
在线运行示例:点击打开链接
网友回复
python如何调用openai的api实现知识讲解类动画讲解视频的合成?
html如何直接调用openai的api实现海报可视化设计及文本描述生成可编辑海报?
f12前端调试如何找出按钮点击事件触发的那段代码进行调试?
abcjs如何将曲谱播放后导出mid和wav格式音频下载?
python如何将曲子文本生成音乐mp3或wav、mid文件
python中mp3、wav音乐如何转成mid格式?
js在HTML中如何将曲谱生成音乐在线播放并下载本地?
python如何实现在windows上通过键盘来模拟鼠标操作?
python如何给win10电脑增加文件或文件夹右键自定义菜单?
python如何将音乐mp3文件解析获取曲调数据?