‹ 首页

agent-evaluation

@danstrem2 · 收录于 2 周前 · 上游提交 5 个月前

Testing and benchmarking LLM agents including behavioral testing, capability assessment, reliability metrics, and production monitoring—where even top agents achieve less than 50% on real-world benchmarks Use when: agent testing, agent evaluation, benchmark agents, agent reliability, test agent.

适合你,如果需要系统化测试和评估LLM智能体的性能与可靠性

/ 通过 npx 安装 校验哈希
npx oh-my-skill add danstrem2/clawdbot-skill-master-pack/agent-evaluation
/ 通过 bash 安装
curl -fsSL https://oh-my-skill.com/install.sh | bash -s -- danstrem2/clawdbot-skill-master-pack/agent-evaluation
/ 已经装过?验证本机副本,不用重装
npx oh-my-skill verify danstrem2/clawdbot-skill-master-pack/agent-evaluation
安装目标可用 --agent / --scope 或 --to 明确指定;省略时只会在唯一已存在的 agent 目录上自动选择,零命中或多命中会停止并提示。content_hash 缺失或不一致均拒装。
1GitHub stars
~373上下文体积 · 单文件
索引托管

怎么用

商店整理自技能原文 · 版本 91d2f76 · 表述以原文为准
它做什么

安装后,Claude 会像一位质量工程师,帮你测试和评估 AI 代理(agent)的行为、能力、可靠性,并监控生产环境中的表现。它会设计测试框架,发现代理在真实场景中的问题。

什么时候触发

当你需要测试、评估或基准测试 AI 代理,或者想了解代理的可靠性时触发。

装好后可以这样说
Claude 会设计可靠性测试并运行。
Claude 会进行基准测试并分析结果。

评论

登录即可评论;带「已验证安装」的,是发布者名下有本店的安装或持有记录。