回答-BFW问答

可以试试Video-LLaVA

Video-LLaVA 项目是由北京大学元研究团队开发的，旨在实现图像和视频之间的交互式能力，通过将视觉表示统一地绑定到语言特征空间，使得大型语言模型（LLM）能够同时对图像和视频进行视觉推理。

https://github.com/PKU-YuanGroup/Video-LLaVA