一、功能概述
浏览器自动化执行台可以将自然语言任务描述拆解为浏览器动作计划,并通过 Chrome 扩展自动执行。支持打开页面、点击元素、填写表单、下拉选择、滚动、等待、按键等操作,并具备敏感操作暂停、人工接管等安全保护机制。
二、扩展安装
浏览器自动化依赖 Chrome 扩展程序执行步骤。首次使用前必须先安装扩展。
2.1 Chrome 浏览器安装
browser_extension.zip 到本地。chrome://extensions/ 并按回车,打开扩展管理页。browser_extension 文件夹。2.2 Edge 浏览器安装
browser_extension.zip(步骤同 Chrome)。edge://extensions/ 打开扩展管理页。browser_extension 文件夹即可。2.3 360 极速浏览器安装
browser_extension.zip。chrome://extensions/ 或通过菜单 → 工具 → 扩展管理进入。三、任务输入与配置
在「任务输入与执行」区域填写指令并配置参数,是生成自动化计划的前置步骤。
3.1 目标页面地址
「目标页面地址」输入框为可选字段。填写后,系统会自动生成一个「打开页面」步骤作为第一步。不填写时,扩展会在当前标签页执行操作。
3.2 任务指令编写
在「浏览器任务指令」文本框中用自然语言描述需要完成的操作。建议包含以下信息:
- 目标网站:要操作的网站名称或网址。
- 操作内容:要点击的文字、要填写的字段和值。
- 执行顺序:按顺序描述多个步骤。
示例:"打开 12306,搜索北京到上海的车票,查看余票信息。"
3.3 AI 模型选择
模型选择下拉框默认使用系统的 LLM 配置。开启「自动」模式时,系统会自动选择合适的模型。建议保持自动模式开启。
3.4 自动模式开关
自动模式开启后,非敏感任务将全自动执行,遇到敏感步骤(如登录、支付等)会自动暂停等待人工确认。
四、计划生成
系统采用双层策略生成自动化计划,确保在各种情况下都能输出可执行的步骤。
4.1 LLM 生成(DeepSeek)
系统优先使用 DeepSeek 等大语言模型解析任务指令,将自然语言转化为结构化的步骤 JSON。LLM 能理解复杂的语义,生成准确的步骤参数。
4.2 本地规则回退
当 LLM 不可用时,系统会自动回退到本地正则匹配方案。如果本地规则也无法匹配,会生成一个包含「等待 + 人工处理」的安全步骤对,确保不会在不明情况下执行危险操作。
4.3 查看与核对计划
计划生成后,左侧「实时步骤时间线」区域会以卡片形式展示每个步骤。右侧「步骤」区域以文本形式列出所有步骤的详细信息。请仔细核对步骤是否符合预期,再执行。
五、执行模式
系统提供四种执行模式,适用于不同场景。
5.1 一键执行
点击「一键执行」按钮,系统会自动完成:生成计划 → 发送到扩展 → 自动开始执行。这是最快捷的方式,适合已熟悉流程的用户。
5.2 生成计划
点击「生成计划」只生成步骤不自动执行。适合需要先核对步骤再决定是否执行的场景。生成后可以点击「一键执行」或「发送到扩展」来执行。
5.3 发送到扩展
将已生成的步骤发送到扩展的本地存储中,然后可以在扩展弹窗中手动点击「执行计划」来启动。
5.4 继续执行
当执行因敏感操作暂停时,该按钮会自动出现。处理完人工操作后点击「继续执行」,扩展会恢复自动化流程。
六、步骤类型参考
系统支持以下步骤类型:
| 类型 | 中文名称 | 说明 |
|---|---|---|
navigate | 打开页面 | 在浏览器中打开指定 URL |
click_text | 点击元素 | 根据文字内容点击页面上的按钮或链接 |
type_field | 填写字段 | 在输入框中填入指定值 |
select_option | 下拉选择 | 从下拉列表中选择指定选项 |
press_key | 按回车 | 在当前焦点元素上触发按键 |
wait | 等待 | 等待指定秒数,用于页面加载或延时 |
need_human | 人工接管 | 暂停执行等待用户手动操作,完成后继续 |
scroll | 滚动页面 | 按方向滚动页面指定距离 |
七、步骤监控
「实时步骤时间线」区域提供完整的执行过程可视化监控。
7.1 步骤卡片
每个步骤以独立卡片展示,包含步骤序号、标题、详细参数和当前状态。卡片颜色随状态变化,便于快速识别执行进展。
7.2 状态指示
步骤有以下状态:
- 待执行 — 步骤已就绪,等待执行。
- 执行中 — 当前正在执行的步骤。
- 已完成 — 步骤执行成功。
- 失败 — 步骤执行出错。
- 等待人工 — 步骤暂停,需要人工处理后继续。
7.3 进度追踪
顶部状态面板显示执行阶段(待命/计划就绪/执行中/已暂停/已完成/执行失败)、目标页面、执行引擎和当前步骤。进度显示为「已完成/总步骤数」。
八、安全特性
系统内置多层安全保护机制,确保自动化过程安全可控。
8.1 敏感词检测
系统内置敏感词库(支付、付款、登录、验证码、密码、转账等)。当步骤涉及敏感内容时,会自动添加「人工接管」步骤,暂停执行等待用户确认。
8.2 手动接管
执行暂停后,浏览器会显示一个半透明覆盖层,提示「需要人工操作」。手动完成操作后点击「Continue Execution」按钮即可继续。也可以在页面中点击「继续执行」按钮恢复。
8.3 暂停与恢复
除自动暂停外,系统支持运行过程中随时手动恢复执行。「继续执行」按钮仅在暂停状态下可见。
九、故障排查
9.1 扩展未检测到
扩展状态显示「未检测到扩展」时,请检查:
- 扩展是否已在扩展管理页中加载(确认有「Jerry 浏览器自动化」卡片)。
- 扩展的开发者模式是否开启。
- 点击「刷新扩展状态」按钮重新检测。
- 重新加载扩展(扩展管理页中点击刷新图标)。
9.2 计划生成失败
如果生成计划失败:
- 检查 LLM 配置是否正常。
- 检查任务指令是否清晰,尝试更详细的描述。
- 查看「步骤」区域的错误信息了解具体原因。
- 系统会自动切换到本地规则模式,但生成质量可能下降。
9.3 执行卡住
如果执行过程中长时间无响应:
- 检查目标页面是否正常加载。
- 检查扩展管理页中是否有错误提示。
- 点击「重置状态」重新开始。
9.4 单步执行失败
单个步骤失败通常是因为:
- 要点击的文字不存在或页面未加载完成。
- 要填写的字段名称不匹配。
- 建议重新生成计划或调整指令描述。
十、常见问题
问:支持哪些浏览器?
支持 Chrome、Edge 和 360 极速浏览器等基于 Chromium 内核的浏览器。
问:扩展只加载一次还是每次都要加载?
扩展只需要安装一次。重新打开浏览器后,扩展会自动运行,无需再次加载。
问:为什么不直接把扩展发布到应用商店?
当前扩展处于开发阶段。后续会考虑上架 Chrome 网上应用店和 Edge 加载项商店。
问:生成计划一定要联网吗?
LLM 生成需要联网。如果 LLM 不可用,系统会自动切换到本地规则模式。
问:远程用户如何安装扩展?
点击「下载扩展」按钮下载 zip 包,解压后按本手册的安装步骤在浏览器中加载即可。
问:敏感操作一定会暂停吗?
系统会检测步骤内容是否包含敏感关键词。如果包含登录、支付、密码等相关内容,会自动插入人工接管步骤。
问:执行过程中可以中途取消吗?
可以。点击「重置状态」按钮可以停止当前执行并清除所有步骤。
↑ 返回顶部