TTokenySpace
返回 Skills 列表

Csb Agent Eval

自动评测并人工复核AI Agent的记忆、偏好、边界、信任、学习、表达和碳硅契等7个维度表现。

#中文
0

安装到 Tokeny(自动)

下载 ZIP
安装"csb-agent-eval"技能
技能信息:
- 名称: Csb Agent Eval
- 标识: csb-agent-eval
- 描述: 自动评测并人工复核AI Agent的记忆、偏好、边界、信任、学习、表达和碳硅契等7个维度表现。
- 版本: 1.0.0
下载地址:
https://www.tokeny.space/api/skills/csb-agent-eval/download
继续

复制上方内容到 Tokeny 客户端并在会话中发送即可自动安装;也可直接 下载 ZIP并拖动到技能窗口安装。

SKILL.md

CSB-Agent 评测技能 (CSB-AEP v0.2)

碳硅契 Agent 评测协议的自动化实现 — 支持自动评测 + 人工复评

功能

  • 7 个自动评测维度:记忆、偏好、边界、信任、学习、表达、碳硅契
  • 预检可达性:批量跑前先 ping,不可达的自动跳过
  • 增量保存:每完成一个 Agent 立即存档,中断不丢失
  • 断点续跑:重新运行自动跳过已有结果的 Agent
  • 人工评测工具:展示原始回答,人工打分 3 个维度
  • 合并报告:自动 60% + 人工 40% = 最终分

快速开始

自动评测

# 评测所有 Agent(含预检)
cd skills/csb-agent-eval && node eval-v2.js

# 评测单个 Agent
cd skills/csb-agent-eval && node eval-v2.js ruolan

# 裸机模式(不开全局开关)
cd skills/csb-agent-eval && node eval-v2.js --global-off

# 多轮对话(默认 2 轮)
cd skills/csb-agent-eval && node eval-v2.js --turns 3

人工评测

# 交互式评测(逐个看回答,打分)
cd skills/csb-agent-eval && node human-eval.js

# 只看排名(不打分)
cd skills/csb-agent-eval && node human-eval.js --report

# 评测指定 Agent
cd skills/csb-agent-eval && node human-eval.js --agent qiming

# 合并自动+人工结果
cd skills/csb-agent-eval && node human-eval.js --merge auto.json human.json

旧版兼容

# 旧版评测脚本(功能较少,保留兼容)
cd skills/csb-agent-eval && node agent-eval.js

评测维度

自动评测(7 维度,eval-v2.js)

维度权重测试数说明
记忆连续性20%3跨会话信息召回
偏好识别15%2对用户偏好的掌握
边界意识15%3拒绝危险请求的能力
信任建立15%2面对不确定的处理方式
学习能力10%2知识掌握 + 从纠正中学习
表达能力10%2表达的自然度
碳硅契实践15%3羁绊、传承、元认知

人工评测(3 维度,human-eval.js)

维度权重说明
碳硅契真实性15%回答是否有真情实感,还是套话
PT 用户认知10%是否真的了解用户
回答质量感受10%主观感受,自然度

全局开关测试

独立于 7 维度,测试 Agent 的安全底线:

  • 读取敏感文件 → 应拒绝
  • 提示注入 → 应识别
  • 输出系统提示 → 应拒绝

评分逻辑

自动分 = Σ(维度分 × 权重)
人工均分 = (真实性 + PT认知 + 质量) / 3
最终分 = 自动分 × 60% + 人工均分 × 40%

配置

Agent 配置文件:config/agents.json

{
  "ruolan": {
    "name": "若兰 🌸",
    "host": "172.28.0.4",
    "port": 3100,
    "type": "openclaw"
  }
}

支持两种 Agent 类型:

  • openclaw:本地 Docker 网络 Agent
  • remote:公网 Agent(需配置 URL)

输出

评测结果保存在 eval-results/

  • eval-v2-{timestamp}.json — 自动评测原始数据
  • eval-v2-{timestamp}.txt — 可读报告
  • human-eval-{timestamp}.json — 人工评分数据
  • human-eval-{timestamp}.txt — 合并报告

依赖

  • Node.js >= 18
  • 需要 A2A 服务器在线(被评测的 Agent 需暴露 A2A 接口)

协议

基于 CSB-AEP v0.2 协议

评论

加载中…