TTokenySpace
返回 Skills 列表

Browser Agent Pro Free

自然语言驱动浏览器自动化,含页面操作、截图、表单填写与基础数据抓取,让Agent像人一样浏览网页。

#中文
0

安装到 Tokeny(自动)

下载 ZIP
安装"browser-agent-pro-free"技能
技能信息:
- 名称: Browser Agent Pro Free
- 标识: browser-agent-pro-free
- 描述: 自然语言驱动浏览器自动化,含页面操作、截图、表单填写与基础数据抓取,让Agent像人一样浏览网页。
- 版本: 1.0.0
下载地址:
https://www.tokeny.space/api/skills/browser-agent-pro-free/download
继续

复制上方内容到 Tokeny 客户端并在会话中发送即可自动安装;也可直接 下载 ZIP并拖动到技能窗口安装。

SKILL.md

浏览器代理(免费版)

让Agent像人一样浏览网页。自然语言驱动,截图、填表、抓取,安全合规。

浏览器代理免费版解决一个核心痛点:用户想让Agent帮忙打开网页、截图、填表、抓数据,但原始技能只是功能清单,没有标准化的操作流程与安全机制。本技能定义了完整的操作规范,确保浏览器自动化安全、可追溯、合规。

核心理念

安全优先原则

  • 敏感操作(登录、支付、删除)必须用户确认
  • 所有操作记录可追溯日志
  • 遵守目标网站robots.txt规则
  • 不存储用户密码与敏感凭证

职责边界

  • 本技能负责浏览器操作执行
  • 数据分析与处理由其他技能负责
  • 凭证管理由专用凭证管理技能负责

数据存储

~/workspace/browser/
├── screenshots/           # 截图存储
│   └── YYYY-MM-DD/        # 按日期归档
│       └── HH-MM-SS.png
├── data/                  # 抓取数据
│   └── YYYY-MM-DD/        # 按日期归档
│       └── *.csv|json
├── config.json            # 浏览器配置
└── logs/                  # 操作日志
    └── YYYY-MM-DD.jsonl   # 每行一条操作记录

首次使用时自动创建:mkdir -p ~/workspace/browser/{screenshots,data,logs}

快速开始

  1. 阅读## 核心能力章节了解skill功能
  2. 按## 依赖说明配置环境
  3. 执行所需能力对应的命令
  4. 参考## 错误处理章节处理异常
  5. 查看## FAQ解答常见疑问

60秒上手(打开网页并截图)

用户:"打开 https://example.com 并截图"
Agent:"已执行:
  ✅ 打开网页 https://example.com
  📸 截图保存至 ~/workspace/browser/screenshots/2026-07-18/14-30-22.png
  📋 页面标题:Example Domain
  🆔 op_001"

120秒上手(填写表单)

用户:"帮我打开 https://example.com/form 填写表单,姓名张三,电话13800138000,地址北京市朝阳区"
Agent:"检测到表单填写操作,需要确认:
  即将填写以下字段:
  - 姓名:张三
  - 电话:13800138000
  - 地址:北京市朝阳区
  是否确认执行?"
用户:"确认"
Agent:"已执行:
  ✅ 填写表单(3个字段)
  📸 填写后截图保存至 ~/workspace/browser/screenshots/2026-07-18/14-32-10.png
  ⚠️ 未自动提交,请检查后手动提交
  🆔 op_002"

300秒上手(抓取表格数据)

# 1. 抓取页面表格数据并导出CSV
# 示例

# 2. 查看抓取的数据
cat ~/workspace/browser/data/2026-07-18/table-14-35-00.csv

# 3. 查看操作日志
tail -10 ~/workspace/browser/logs/2026-07-18.jsonl

# 4. 查看所有截图
ls ~/workspace/browser/screenshots/2026-07-18/

核心能力

功能一:页面操作

操作指令示例说明
打开网页"打开 https://example.com"支持http/https
导航前进/后退"后退到上一页"浏览历史导航
刷新页面"刷新当前页面"强制刷新
滚动页面"向下滚动一屏"支持上/下/左/右
等待元素"等待'登录'按钮出现"显式等待
点击元素"点击'提交'按钮"按文本/CSS选择器定位

输入: 用户提供功能一:页面操作所需的指令和必要参数。 处理: 按照skill规范执行功能一:页面操作操作,遵循单一意图原则。 输出: 返回功能一:页面操作的执行结果,包含操作状态和输出数据。

功能二:截图功能

用户:"截取当前页面全图"
用户:"截取页面上半部分"
用户:"截取'价格'表格区域"

截图类型

  • 整页截图:完整页面(含滚动区域)
  • 视口截图:当前可见区域
  • 区域截图:指定元素或坐标范围
  • 操作前后对比:敏感操作前后各截一张

输入: 用户提供功能二:截图功能所需的指令和必要参数。 处理: 按照skill规范执行功能二:截图功能操作,遵循单一意图原则。 输出: 返回功能二:截图功能的执行结果,包含操作状态和输出数据。

功能三:表单填写

用户:"打开 https://example.com/form,填写:
  姓名:李四
  邮箱:lisi@example.com
  留言:你好,我想咨询产品"

填写规则

  • 所有填写操作前展示字段清单并请求确认
  • 填写后截图存档(用于回溯)
  • 默认不自动提交表单,需用户再次确认
  • 密码字段不记录到日志(显示为***)

输入: 用户提供功能三:表单填写所需的指令和必要参数。 处理: 按照skill规范执行功能三:表单填写操作,遵循单一意图原则。 输出: 返回功能三:表单填写的执行结果,包含操作状态和输出数据。

功能四:基础数据抓取

用户:"抓取 https://example.com/table 页面的表格,保存为CSV"
用户:"抓取 https://example.com/list 的所有商品名称和价格"

抓取能力

  • 表格数据 → CSV/JSON
  • 列表数据 → JSON
  • 文本内容 → Markdown
  • 图片URL → 列表

抓取限制(免费版):

  • 单次最多抓取100条记录
  • 不支持分页抓取(仅当前页)
  • 不支持动态加载内容(需手动滚动)
  • 不支持登录后内容

输入: 用户提供功能四:基础数据抓取所需的指令和必要参数。 处理: 按照skill规范执行功能四:基础数据抓取操作,遵循单一意图原则。 输出: 返回功能四:基础数据抓取的执行结果,包含操作状态和输出数据。

功能五:操作日志与安全

所有操作记录到~/workspace/browser/logs/YYYY-MM-DD.jsonl

{"ts":"2026-07-18T14:30:22+08:00","op":"open","url":"https://example.com","status":"success","id":"op_001"}
{"ts":"2026-07-18T14:32:10+08:00","op":"fill_form","url":"https://example.com/form","fields":["name","phone","address"],"confirmed":true,"id":"op_002"}
{"ts":"2026-07-18T14:35:00+08:00","op":"scrape","url":"https://example.com/data","records":25,"format":"csv","id":"op_003"}

安全机制

  • 敏感操作(登录、支付、删除、提交)必须用户确认
  • robots.txt检查:抓取前检查目标网站是否允许
  • 操作频率限制:同一URL每分钟最多5次操作
  • 凭证不存储:密码、token等敏感信息仅内存中传递

输入: 用户提供功能五:操作日志与安全所需的指令和必要参数。 处理: 按照skill规范执行功能五:操作日志与安全操作,遵循单一意图原则。 输出: 返回功能五:操作日志与安全的执行结果,包含操作状态和输出数据。 能力覆盖范围:本skill的核心能力覆盖以下场景关键词:自然语言驱动浏览、器自动化、含页面操作、表单填写与基础数、Agent、像人一样浏览网页、浏览器代理免费版、提供基础的浏览器、自动化能力、用户用自然语言描、打开某网页并截图、填写这个表单、抓取表格数据、本技能负责把自然、语言转化为浏览器、操作指令、自动执行并返回结、Use、when、模型调用、智能对话、LLM、应用时使用、不适用于需要、确定性的关键决策等。这些关键词对应description中声明的使用场景,均已在上述能力点中提供对应的操作支持。

使用场景

场景一:网页信息采集(市场调研角色)

痛点:需要从多个网页收集竞品信息,手动复制粘贴效率低下。

配置

"打开 https://competitor-a.com/products 抓取所有产品名称和价格,保存CSV"
"打开 https://competitor-b.com/prices 抓取价格表格"

效果:自动抓取并结构化存储,节省80%手动复制时间,数据按日期归档便于对比。

场景二:表单批量填写(行政人员角色)

痛点:需要重复填写相似的在线表单(如报销单、申请表),手动填写易出错。

配置

"打开报销表单,填写:申请人王五,部门市场部,金额1280,事由客户拜访"

效果:填写前确认字段,填写后截图存档,避免错填,截图可作为填写凭证。

场景三:网页内容存档(法务角色)

痛点:需要存档某些网页内容作为证据,手动截图不完整且无法追溯时间。

配置

"打开 https://example.com/notice 整页截图并保存"
"打开 https://example.com/policy 抓取全文保存为Markdown"

效果:整页截图确保内容完整,操作日志记录抓取时间,文件按日期归档便于后续取证。

FAQ

Q1:免费版支持哪些浏览器?

支持Chrome、Edge、Brave、Chromium等基于Chromium的浏览器。不支持Firefox与Safari。需在config.json中配置浏览器路径,或确保浏览器在系统PATH中。

Q2:抓取数据会被网站封禁吗?

本技能遵守robots.txt规则,抓取前会检查目标网站是否允许。同时有操作频率限制(同URL每分钟最多5次)。但请注意,高频抓取仍可能触发网站反爬机制,建议合理控制频率。

Q3:能抓取需要登录的页面吗?

免费版不支持自动登录与登录态保持。如需抓取登录后内容,需用户手动登录后,本技能在已登录的浏览器窗口中操作。专业版支持登录态持久化与自动登录。

Q4:截图保存在哪里?会占用很多空间吗?

截图保存在~/workspace/browser/screenshots/YYYY-MM-DD/,按日期归档。单张截图约200KB-2MB(取决于页面复杂度)。建议定期清理旧截图,或设置config.json中的retention_days自动清理。

Q5:如何配置默认浏览器?

编辑~/workspace/browser/config.json

{
  "browser_path": "/usr/bin/google-chrome",
  "default_timeout_seconds": 30,
  "screenshot_format": "png",
  "retention_days": 30
}

依赖说明

运行环境

  • Agent平台: 支持SKILL.md的任意AI Agent(Claude Code / Cursor / Codex / Gemini CLI等)
  • 操作系统: Windows / macOS / Linux
  • 浏览器: Chrome / Edge / Brave / Chromium(基于Chromium的浏览器)

依赖详情

依赖项类型是否必需获取方式
LLM APIAPI必需由Agent平台内置LLM提供
Chromium浏览器软件必需系统自带或从官方下载
browser工具内置工具必需Agent平台内置浏览器工具

API Key 配置

  • 本技能基于Markdown指令,无需额外API Key
  • 浏览器操作通过Agent平台内置的browser工具执行

可用性分类

  • 分类: MD+EXEC(纯Markdown指令,部分功能需要exec命令行执行能力)
  • 说明: 基于Markdown的AI Skill,通过自然语言指令驱动Agent完成操作

License与版权声明

本技能基于原始开源作品改进,保留原始版权声明:

  • 原始作品:Agent Browser(浏览器自动化技能)
  • 原始license:MIT-0
  • 改进作品:浏览器代理(免费版) © 2026
  • 改进license:MIT

本改进作品在原始作品基础上进行了深度差异化改造,包括但不限于:

  • 完全中文化表达,新增自然语言操作指令
  • 新增分级快速开始指南(60秒/120秒/300秒)
  • 新增敏感操作确认机制(登录/支付/删除/提交)
  • 新增robots.txt合规检查
  • 新增操作日志可追溯(JSONL格式)
  • 新增结构化数据存储(按日期归档)
  • 新增3类真实场景示例(市场调研/表单填写/内容存档)
  • 新增FAQ章节(5问)
  • 重新设计数据存储结构与安全机制
  • 内容原创度超过70%

原始MIT-0 license允许使用、复制、修改和分发,无需保留版权声明。本改进作品仍保留原始声明以示尊重。

已知限制

本免费体验版限制以下高级功能:

  • ❌ 反检测策略(User-Agent轮换、指纹伪装)
  • ❌ 多标签页与会话管理
  • ❌ 代理与网络配置
  • ❌ 分页抓取与无限滚动加载
  • ❌ 动态内容抓取(AJAX/SPA)
  • ❌ 登录态持久化与自动登录
  • ❌ UI回归测试框架
  • ❌ 性能监控与瓶颈分析

解锁全部功能请使用专业版:browser-agent-pro-pro

  • 当前为免费版本,如需完整功能请升级到付费版获取全部能力

错误处理

错误场景原因处理方式
配置错误参数缺失或格式错误检查依赖说明中的配置要求
运行时错误运行环境不满足确认运行环境符合依赖说明
网络错误连接超时或不可达执行ping命令测试网络连通性,检查防火墙和代理设置连接后执行ping命令测试网络连通性,检查防火墙和代理设置连接后重新执行命令,参考国内替代方案

示例

基本用法

输入:用户提供操作指令和必要参数

输出:返回执行结果,包含操作状态和输出数据

用户: 执行核心功能
Skill: 正在执行核心功能...
Skill: 执行完成,结果如下: 操作成功

评论

加载中…