帮助文档

从安装到写脚本、从识别原理到工作室集群,这里是 VsrTap 的全部使用说明。

从这里开始

VsrTap 是一款运行在云手机 / 安卓真机上的视觉驱动型自动化 App。 你不需要写代码,只用纯文本指令描述操作流程,App 会自动完成画面识别、触控执行与结果校验。

核心概念

三步强制闭环

每一条动作指令都会经历 前置识别 → 执行动作 → 后置校验。 目标不存在就不点击;点击后画面没变化就整行重试;重试耗尽则暂停脚本并保存失败截图。 这条规则由引擎锁死,脚本无法跳过。

视觉分层调用

识别方式调用频率典型用途端侧耗时
YOLO高频 5~10 fps按钮、图标、怪物、NPC 等固定目标80~150 ms/帧
OCR中频,按需弹窗文字、任务描述、数值、倒计时200~500 ms/次
VL 大模型低频,≥5 秒/次复杂场景理解、开放式判断3~10 秒/次
VL 推理成本高、内存占用大,仅在 YOLO/OCR 无法判断时兜底调用。 内存小于 4GB 的设备会自动禁用 VL,避免 OOM。

脚本与数据分离

脚本只描述操作逻辑,不包含账号密码;账号存放在独立的「数据源」中,运行时绑定。 ${account}${password} 只允许在登录阶段使用, 进入游戏后引用会被语法检查标红。