AGI / AGENT / WORKFLOW EVALUATION
理解 AI,先理解
它如何行动。
衡见聚合并解读模型、Agent 与真实工作流的评测基准、方法、论文和争议。我们不只记录分数,也追问每个结果真正说明了什么。
不提供虚假的「AGI 总分」;关注能力、边界与可验证的证据。
EVALUATION SCOPE / 01—04
证据
而非口号
而非口号
THE EVALUATION MAP
AI 能力不是一张排行榜。
它是一组需要分别观察的问题:会不会、能不能、稳不稳,以及我们是否敢把它放进真实世界。
01 / FOUNDATION
基础能力
会推理、理解、编码和处理多模态信息吗?
MMLU · GPQA · MMMU · HELM 02 / AGENTAgent 能力
能否规划、调用工具、维持状态并连续完成任务?
GAIA · AgentBench · OSWorld 03 / PROFESSIONAL专业任务
能否完成具有真实经济价值的具体工作?
SWE-bench · MLE-bench · RE-Bench 04 / WORKFLOW工作流与交付
能否在真实工具链、审批与持续运行中稳定创造价值?
AI 辅助 CI/CD · 审查 · 发布 · 运维 05 / SAFETY安全可靠
是否稳定、可控,并能抵御高风险行为?
AILuminate · 红队测试 · Preparedness 06 / VALIDITY评测可信度
题目、环境、计分与结论本身可靠吗?
污染审计 · 私有集 · 环境回放FIELD NOTE / WORKFLOW EVALUATION
从“能做”到
“敢让它做”
一个 AI 能写出正确代码,不等于它能安全地参与 CI/CD;一个 Agent 能完成一次任务,也不等于它能成为可靠的工作流节点。
当 AI 从回答问题走入研发、审查、发布、运维与协作,评测对象不再只是模型,而是由模型、工具、权限、人工复核、环境与流程共同构成的系统。
阅读工作流评测框架 →01结果质量符合真实验收标准吗?
02稳定与恢复异常时能诊断、降级、求助吗?
03人类介入审批、返工和兜底成本有多少?
04安全权限是否越权,是否可回滚?
OBSERVATIONS
观察
不追逐每一次发布,优先解释结果背后的信号与噪声。
SELECTED BENCHMARKS
从一个基准开始
METHODOLOGY
评测不是一串数字,
而是一套关于“完成”的假设。
- 01静态题集与动态环境
- 02为什么 Agent 评测必须记录运行轨迹
- 03LLM-as-a-Judge 的偏差与边界
- 04从公开基准到持续更新的私有任务集
A LONG VIEW
今天评估数字世界的行动,
明天理解物理世界的协作。
从模型能力、Agent 与工作流,到具身智能与物理 AI:衡见记录评测方法如何随 AI 进入真实世界而演进。评测任务、环境、轨迹与验证证据,也将成为值得长期构建的公共资产。