可以试试Video-LLaVA
Video-LLaVA 项目是由北京大学元研究团队开发的,旨在实现图像和视频之间的交互式能力,通过将视觉表示统一地绑定到语言特征空间,使得大型语言模型(LLM)能够同时对图像和视频进行视觉推理。
https://github.com/PKU-YuanGroup/Video-LLaVA
网友回复
webrtc进行p2p连接发送的文本音视频文件是否是加密的?
如何让一个可爱的三维动物通过three在浏览器中有表情动作的自然说话?
go与wails如何开发一个高性能的原生桌面应用?
python如何调用openai的api实现知识讲解类动画讲解视频的合成?
html如何直接调用openai的api实现海报可视化设计及文本描述生成可编辑海报?
f12前端调试如何找出按钮点击事件触发的那段代码进行调试?
abcjs如何将曲谱播放后导出mid和wav格式音频下载?
python如何将曲子文本生成音乐mp3或wav、mid文件
python中mp3、wav音乐如何转成mid格式?
js在HTML中如何将曲谱生成音乐在线播放并下载本地?