无需 API,VisFlow 如何靠看懂页面完成网页操作

360 AI Research
2026-08-27 5 阅读
无需 API,VisFlow 如何靠看懂页面完成网页操作

很多企业网页自动化项目,第一步不是写流程,而是先问一句,这个系统有没有 API。

有 API,数据可以直接读写,流程容易做成接口调用。没有 API,遇到动态弹窗、Canvas、自绘控件或经常变化的页面,固定脚本就容易找不到按钮,任务也常常卡在最后一步。

VisFlow 选择了另一条路。它不要求业务系统先开放专用 API,而是像人一样观察浏览器里真实显示的页面,理解当前状态,再决定下一步怎么操作。

页面能被人操作,不代表一定有 API

员工每天使用 OA、ERP 和各种业务后台,通常不需要知道页面背后有没有接口。看到输入框就输入,看到下拉菜单就选择,看到提交按钮就点击。人依赖的是页面画面和上下文,而不是系统是否提供了标准接口。

VisFlow 也从这个入口开始工作。用户可以用自然语言描述目标,也可以亲手演示一次标准流程。VisFlow 通过浏览器看到页面中的文字、按钮、表格、弹窗和位置关系,判断哪些内容与任务有关,再执行点击、输入、滚动和跳转。

所以,业务系统没有专门为自动化改造,也不必先等待接口开发完成,VisFlow 仍然有机会处理真实网页任务。

它不是只截一张图,而是持续判断页面状态

纯视觉执行并不是把一张截图交给模型,然后让模型猜一个坐标。一个网页任务通常包含多个连续状态。

打开页面后,VisFlow 需要判断页面是否加载完成。点击菜单后,它要确认菜单是否展开。提交表单后,它还要识别成功提示、校验错误或新的待处理页面。

可以把它理解成一个持续循环的过程。先看当前页面,再理解任务相关区域,接着选择一个动作,执行后重新观察页面变化,然后决定是否继续。每一步都根据最新画面调整,而不是机械回放一串固定坐标。

这也是它适合复杂网页的原因。页面按钮位置变化、弹窗出现或页面局部刷新时,VisFlow 关注的是当前真正呈现出来的内容,而不是只依赖一组过期的定位规则。

视觉负责看懂,页面结构负责补充

页面画面适合回答「用户现在看到了什么」。但遇到很长的页面、密集表格或结构化表单,仅靠画面逐一确认并不够。

VisFlow 采用视觉优先、页面结构补充的方式。它先以最终画面判断页面状态和可操作元素,再参考页面结构补充长页面中的内容关系和表格信息。这样既能处理普通网页,也能兼顾企业后台中的表单和数据区域。

这里的重点不是完全放弃页面结构,而是不把业务系统必须提供稳定 API 作为前提。对于 Canvas、自绘控件等页面,视觉信息尤其重要。对于表格和表单,结构信息可以帮助它更准确地找到内容和操作位置。

一次演示,把人的经验交给浏览器

很多流程难,不是因为步骤多,而是因为其中藏着只有熟悉业务的人才知道的判断。例如先选择哪一类申请,再填写哪些字段,遇到提示后应该返回修改,还是继续提交。

用户演示一次,VisFlow 就可以把这次操作作为任务样例。后续遇到相似页面和相似目标时,它不必从零摸索,而是参考已经学到的操作经验,并结合当前页面状态执行。

这和固定录制不同。固定录制更像逐帧回放,页面稍有变化就可能失效。VisFlow 复用的是目标、页面理解和操作经验,执行时仍会根据当下看到的内容做判断。

自动执行,但关键一步仍由人把关

网页能被看懂,不代表所有动作都应该自动完成。提交、审批、删除、支付和发布等动作可能带来实际业务影响。

VisFlow 支持过程可见、暂停、单步调试和人工接管,并可在高风险动作前进行确认。它负责减少重复点击和等待,人仍然掌握关键决策权。基于现有浏览器登录态运行,也让它处在用户已有的权限范围内,而不是自行获得额外权限。

因此,VisFlow 的价值不只是「不用 API 也能操作网页」,更是把视觉理解、经验复用和人工控制放在同一个执行过程中。

当企业后台没有稳定接口,或者流程经验难以写成脚本时,可以先从一条重复流程开始。打开网页,描述目标,演示一次,再观察 VisFlow 如何看懂页面并完成任务。让浏览器拥有一双会干活的眼睛,网页上的重复工作就不必每次都从头做起。

体验地址 https://research.360.cn/products/VisFlow