一般基于下面两种,不过openai收购了chrome,会不会出现第三种呢:
1、基于视觉定位,通过视觉大模型读取网页截图,让大模型告诉用户下一步该点击哪?browser-use就是这样:https://github.com/browser-use/browser-use
2、基于dom树解析定位,dom树需要清洗,去掉无用的css与js,保留有用的网页布局代码,让大模型根据class或id来操作元素。
网友回复
js如何流式输出ai的回答并折叠代码块,点击代码块右侧可预览代码?
ai大模型如何将文章转换成可视化一目了然的图片流程图图表?
大模型生成html版本的ui原型图和ppt演示文档的系统提示词怎么写?
rtsp视频直播流如何转换成websocket流在h5页面上观看?
为啥coze会开源工作流agent coze studio?
如何检测网页是通过收藏夹打开的?
python如何实现类似php的http动态脚本请求处理响应代码?
js如何实现类似php的http动态脚本请求处理响应代码?
trae与solo有啥区别不同?
vue如何让ai动态生成问卷调查多步骤表单式收集基础信息自动规划执行任务?