可以试试这个开源项目:live speech portraits real-time photo realistic talking-head animation(现场演讲肖像:实时逼真的谈话头像动画)。
该系统仅由超过 30 fps 的音频信号驱动,生成个性化的、逼真的说话头动画。我们的系统包含三个阶段。第一阶段是深度神经网络,提取深度音频特征以及流形投影,将特征投影到目标人的语音空间。在第二阶段,我们从投影的音频特征中学习面部动态和动作。预测的运动包括头部姿势和上身运动,其中前者由自回归概率模型生成,该模型模拟目标人物的头部姿势分布。上半身运动是从头部姿势推断出来的。在最后阶段,我们根据之前的预测生成条件特征图,并将它们与候选图像集一起发送到图像到图像的转换网络,以合成逼真的渲染。我们的方法可以很好地泛化到野外音频并成功合成高保真个性化面部细节,例如皱纹、牙齿。我们的方法还允许明确控制头部姿势。广泛的定性和定量评估以及用户研究证明了我们的方法优于最先进技术。
github地址:https://github.com/YuanxunLu/LiveSpeechPortraits
在线运行示例:点击打开链接
网友回复
如何写ai提示词让大模型根据主题生成视频脚本json,然后让Hyperframe渲染出mp4视频?
有哪些字体使用等宽编程代码展示?
如果让演唱会歌迷的上万手机屏幕和闪光灯一起被现场中控控制闪烁?
Midjourney为啥进军医疗领域了?
python如何跟踪足球比赛指定球员全场运动标注打聚光灯合成
如何将linux服务器的文件目录映射到windows电脑磁盘?
Docling 与 MarkItDown 两个库有啥不同?
豆包收费后国产其他ai软件也会跟进收费吗?
JPEG 与 HEIF图片格式区别?
centos7版本太旧无法安装python3.11,如何在docker中运行python3.11?


