跳到主要内容

AI Vision(AI 视觉)

就屏幕上有什么提问,并以流程能分支的形状作答。

其它检测节点问的都是你已经知道答案的问题:这张图在不在Find Image)、这个框里是哪些字符Read Text)、这个矩形是不是红的Check Region)。AI Vision 用于那些没法这样表述的问题——我现在在哪个界面在一个从没见过的布局里 Continue 按钮在哪这个对话框是报错还是奖励

两个工作区都可用。

答案是受约束的,不是自由文本

这正是它在自动化里可用的原因。你给节点一个任务和一份关注目标清单;这些目标就成了答案唯一允许的取值。一个能用任意句子回答的模型对流程毫无用处——你得在运行时解析散文。而在这里,"这三个界面中的哪一个"只能回到这三个之中。

任务你需要提供用途
识别当前屏幕关注目标——你预期的那些界面"我在商店、地图,还是登录墙?"
定位元素关注目标——要找的东西在会移动、或你没有模板的布局里找控件
提取字段关注目标——字段名一次把面板里多个带标签的值取出来
回答问题一个问题一次性判断:"队列空了吗?"
描述画面诊断与 Run Evidence:一句话说明当时屏幕上是什么
自定义(JSON schema)你自己的答案 schema以上形状都不合适时

一行一个目标。 目标是一个短语,其中的逗号是内容而不是分隔符——与 Open App 的参数同一条规则。

设置

设置类型范围默认作用
任务选择上述六项识别当前屏幕必填。 决定问什么,以及答案的形状
关注目标字符串列表每行 ≤ 60 字符任务所针对的状态、元素、字段或选项
问题字符串≤ 300 字符回答问题自定义使用
查看区域矩形整屏看哪里。不填即整屏
Timeoutinteger1000–300000 ms等答案多久

两个专家级旋钮——自定义任务的 schema 与图像 token 预算——保存的流程接受,但面板不提供。它们有合理的默认值,而你手写的值编辑器绝不覆写。

框紧一点。 区域是可选的、默认整屏,这对识别界面是对的,对读一小块面板则很差。在一道验证码上实测:框住整张卡片读回的是标题而不是码;只框住图片才读回码。

端口

端口走它的时机必接
Success模型给出了符合 schema 的答案
Failure拿不到画面、连不上运行时,或模型无法满足 schema
Cancelled提问途中运行被停否——永不被走
Fatal配置无效否——永不被走
Success 不等于"你希望的那个答案"

"屏幕是商店"和"屏幕不是商店"都是成功的读取——节点成功地看了一眼。请用 If 对绑定变量按内容分支,就像你在 Read Text 之后做的那样。一个按答案取值来路由的节点,得为每种可能状态各开一个端口。

基础示例

在决定任何事之前先弄清自己在哪个界面:

  • 任务:识别当前屏幕
  • 关注目标:商店地图登录墙
  • 把答案存入变量,再用 If 按它的值分支。

常见错误

错误后果修复
需要目标的任务却没填答案没有可被约束的范围为识别 / 定位 / 提取填上关注目标
目标之间语义重叠多次运行答案不稳定让它们互斥
按端口而不是按取值分支两种答案都从 Success 出来用 If 对绑定变量分支
一小块面板却用整屏模型回答的是别的东西围着面板画一个区域
模板够用的地方用它比像素更慢也更不确定固定图形用 Find Image

相关节点

  • Find Image——当你手上就有那些像素
  • Read Text——当你要的是框里的字符
  • If——按拿回来的内容分支
  • Check Region——颜色与变化,不需要模型