ClawBench 测到了什么?从真实网页任务到 Judge 可靠性审计
从真实任务、模型表现和评分链路拆解 ClawBench,并通过混淆矩阵重新审视 Agent-as-Judge 的可靠性证据。
约 14 分钟 / #agent#benchmark#LLM-as-Judge / 🌐 zh-CN
A collection of 1 post about benchmark.
从真实任务、模型表现和评分链路拆解 ClawBench,并通过混淆矩阵重新审视 Agent-as-Judge 的可靠性证据。