通常有两种方案
1、实时音视频通话的api,例如gemini-2.0-flash-live-001或qwen Omni的模型,这就要求实时的音视频接入,tokens消耗量大,但是实时性高。
2、将面试题目一个个发给用户并进行用户答题视频前端录制好,最后结束后一起整理成视频发送给多模态模型进行评估,这个消耗tokens少,而且如果不需要视频,还可以直接将视频中音频剥离给ai大模型评估,甚至准成文字进行评估。
示例代码
网友回复
如何将linux服务器的文件目录映射到windows电脑磁盘?
Docling 与 MarkItDown 两个库有啥不同?
豆包收费后国产其他ai软件也会跟进收费吗?
JPEG 与 HEIF图片格式区别?
centos7版本太旧无法安装python3.11,如何在docker中运行python3.11?
python如何做个RPA按键精灵的程序?
写一个windows的cmd的python代码如何在命令行中捕获获取复制粘贴的图片?
如何将别人爆款的抖音短视频短剧文案提取为seedance2的提示词?
阿里云域名dns云解析10万次日限额如何应对?
windows电脑如何提交上架ipa苹果应用?


