多模态大模型都有这个能力,例如gpt4o,claude3.5,gemini 1.5等。
还有这个项目gptpdf:python编写,直接调用大模型,连pdf里的数学公式都能弄成markdown,不过需要gpt4o的apikey,否则没用。
https://github.com/CosmosShadow/gptpdf
没大模型就用这个OmniParse ,OmniParse 是一个在本地运行的平台,用于将不同格式的未结构化数据转换为结构化数据,以便更好地与生成人工智能(GenAI)框架兼容。它支持多种文件类型,包括文档、图片、视频、音频和网页,并提供了一系列 API 端点来处理这些数据。OmniParse 能够进行表格提取、图像处理、视频音频转录以及网页抓取。该平台可以通过 Docker 和 Skypilot 轻松部署,并且支持 Colab 环境。用户可以通过 pip 或 Docker 安装 OmniParse,并且需要在 Linux 系统上运行。OmniParse 使用了一些开源模型,如 Surya OCR、Florence-2 和 Whisper Small,
https://github.com/adithya-s-k/omniparse
网友回复
python如何调用openai的api实现知识讲解类动画讲解视频的合成?
html如何直接调用openai的api实现海报可视化设计及文本描述生成可编辑海报?
f12前端调试如何找出按钮点击事件触发的那段代码进行调试?
abcjs如何将曲谱播放后导出mid和wav格式音频下载?
python如何将曲子文本生成音乐mp3或wav、mid文件
python中mp3、wav音乐如何转成mid格式?
js在HTML中如何将曲谱生成音乐在线播放并下载本地?
python如何实现在windows上通过键盘来模拟鼠标操作?
python如何给win10电脑增加文件或文件夹右键自定义菜单?
python如何将音乐mp3文件解析获取曲调数据?