Astra 操控电脑不是简单给模型接鼠标键盘,核心是训练它学会看屏幕、拆任务、动手操作、出错重试的闭环能力。
第一步是基础预训练,用海量图文、软件操作素材打底,让模型看懂截图里的按钮、弹窗、菜单,理解各类软件界面逻辑,建立对电脑操作的常识。第二步监督学习,投喂大量人类操作录屏:人怎么点鼠标、输入文字、切换窗口,让 AI 模仿人的操作步骤,学会基础点击、输入动作。
第三步强化学习,在虚拟电脑环境里反复试错。AI 每完成一步就看屏幕变化:点对了就给奖励;点错按钮、弹出意外窗口、任务卡住就扣分,倒逼模型自己发现问题、调整方案。还加入 AI 自训练,用更强模型生成高质量操作轨迹,持续扩充训练数据。
它的关键突破是长任务闭环:做完一步,立刻重新看屏幕,判断结果,再规划下一步。遇到弹窗、界面变动不会直接崩盘,能动态修正计划,连续完成几十步复杂软件操作,所以看起来操控电脑很强。
网友回复


