从这里开始
VsrTap 是一款运行在云手机 / 安卓真机上的视觉驱动型自动化 App。 你不需要写代码,只用纯文本指令描述操作流程,App 会自动完成画面识别、触控执行与结果校验。
快速开始
四步跑通第一个脚本:下载安装 → 开权限 → 写脚本 → 运行。
权限配置
无障碍、悬浮窗、屏幕录制、电池优化的开启方式与常见问题。
DSL 语法手册
全部关键字速查:简写指令、完整写法、控制流、识别条件与变量。
数据源与多账号
粘贴账号文本即可自动解析,支持五种分隔符混排与自动轮询切号。
脚本示例
可直接复制的完整脚本,含每日日常、公会任务与多账号轮询版本。
模型管理
YOLO 标注训练、模型导入、OCR 内置说明与 VL 模型按需下载。
工作室版
用注册密钥批量部署设备,云端脚本库与账号池统一调度。
常见问题
识别失败、脚本暂停、设备掉线、额度与封号风险等高频问题。
核心概念
三步强制闭环
每一条动作指令都会经历 前置识别 → 执行动作 → 后置校验。 目标不存在就不点击;点击后画面没变化就整行重试;重试耗尽则暂停脚本并保存失败截图。 这条规则由引擎锁死,脚本无法跳过。
视觉分层调用
| 识别方式 | 调用频率 | 典型用途 | 端侧耗时 |
|---|---|---|---|
| YOLO | 高频 5~10 fps | 按钮、图标、怪物、NPC 等固定目标 | 80~150 ms/帧 |
| OCR | 中频,按需 | 弹窗文字、任务描述、数值、倒计时 | 200~500 ms/次 |
| VL 大模型 | 低频,≥5 秒/次 | 复杂场景理解、开放式判断 | 3~10 秒/次 |
VL 推理成本高、内存占用大,仅在 YOLO/OCR 无法判断时兜底调用。
内存小于 4GB 的设备会自动禁用 VL,避免 OOM。
脚本与数据分离
脚本只描述操作逻辑,不包含账号密码;账号存放在独立的「数据源」中,运行时绑定。
${account} 与 ${password} 只允许在登录阶段使用,
进入游戏后引用会被语法检查标红。