Agent 评测

把 Agent 的
“看起来完成”
变成有证据的完成。

我是Mask,来自字节跳动 AI数据与安全 团队,主导并设计10+ Agent 评测集,包括从问题定义、题目构造、Judge 设计到质量验证的完整链路。

EVALUATION LOOP
Evidence
over claims.
可追溯 · 可复现 · 可判定
01真实问题归因
02评测集构造
03证据化判卷
04质量回归
01 / FULL CASEBOOK

评测集详情

阅读方式向下浏览全部项目;每个专项从风险定义、评测机制、Judge 设计和方法沉淀四个方面展开。
HALLUCINATION

幻觉防御

状态与知识事实核验上下文忠实
TOOL RELIABILITY

工具可靠性

CLI 使用调用真实性降级与异步验收
SEARCH RESEARCH

搜索调研

目标拆解检索过程产物可信度
REUSABLE ASSETS

沉淀为可复用资产

十个专项最终形成一组可复用的评测基础设施,可继续服务模型准入、版本回归与能力诊断。

01

失效模式库

把幻觉、检索与工具执行问题拆成可复现、可归因的风险类型。

02

题目构造方法

从真实轨迹与失败案例提炼测试点,并生成可稳定回归的专项样本。

03

Judge 组件

组合 Claim 抽取、轨迹核验、事实检索、硬规则与多数票聚合。

04

质量门禁

通过人工抽检、人机一致率与异常样本复盘控制自动判分可信度。

05

准入与回归

以维度诊断支撑模型选型、版本比较和专项能力回归。