多模态大模型都有这个能力,例如gpt4o,claude3.5,gemini 1.5等。
还有这个项目gptpdf:python编写,直接调用大模型,连pdf里的数学公式都能弄成markdown,不过需要gpt4o的apikey,否则没用。
https://github.com/CosmosShadow/gptpdf
没大模型就用这个OmniParse ,OmniParse 是一个在本地运行的平台,用于将不同格式的未结构化数据转换为结构化数据,以便更好地与生成人工智能(GenAI)框架兼容。它支持多种文件类型,包括文档、图片、视频、音频和网页,并提供了一系列 API 端点来处理这些数据。OmniParse 能够进行表格提取、图像处理、视频音频转录以及网页抓取。该平台可以通过 Docker 和 Skypilot 轻松部署,并且支持 Colab 环境。用户可以通过 pip 或 Docker 安装 OmniParse,并且需要在 Linux 系统上运行。OmniParse 使用了一些开源模型,如 Surya OCR、Florence-2 和 Whisper Small,

https://github.com/adithya-s-k/omniparse
网友回复
有没有免费让ai自动帮你接管操作电脑的mcp服务?
mcp为啥用Streamable HTTP 替代 HTTP + SSE?
scratchjr有没有开源的前端html网页版本源代码?
多模态大模型能否根据ui交互视频来来模仿写出前端交互动画效果ui代码?
如何用阿里云oss+函数计算fc+事件总线EventBridge+消息队列+数据库+redis缓存打造一个高并发弹性系统?
阿里云函数计算 FC如何在海外节点搭建一个代理网络?
ai studio中gemini build的代码如何发布到github pages等免费网页托管上 ?
如何在cursor、qoder、trae中使用Claude Skills功能?
有没有不用u盘就能重装系统的开源工具?
python如何固定摄像头实时计算停车场停车位剩余数量?


