可以试试Video-LLaVA
Video-LLaVA 项目是由北京大学元研究团队开发的,旨在实现图像和视频之间的交互式能力,通过将视觉表示统一地绑定到语言特征空间,使得大型语言模型(LLM)能够同时对图像和视频进行视觉推理。
https://github.com/PKU-YuanGroup/Video-LLaVA
网友回复
可以试试Video-LLaVA
Video-LLaVA 项目是由北京大学元研究团队开发的,旨在实现图像和视频之间的交互式能力,通过将视觉表示统一地绑定到语言特征空间,使得大型语言模型(LLM)能够同时对图像和视频进行视觉推理。
https://github.com/PKU-YuanGroup/Video-LLaVA
网友回复