‹ 首页

ml-model-eval-benchmark

@0x-professor · 收录于 3 周前

Compare model candidates using weighted metrics and deterministic ranking outputs. Use for benchmark leaderboards and model promotion decisions.

适合你,如果需要在多个模型间做量化对比和排名决策。

/ 通过 npx 安装 校验哈希
npx oh-my-skill add 0x-professor/agent-skills-hub/ml-model-eval-benchmark
/ 通过 bash 安装
curl -fsSL https://oh-my-skill.com/install.sh | bash -s -- 0x-professor/agent-skills-hub/ml-model-eval-benchmark
/ 已经装过?验证本机副本,不用重装
npx oh-my-skill verify 0x-professor/agent-skills-hub/ml-model-eval-benchmark
安装目标可用 --agent / --scope 或 --to 明确指定;省略时只会在唯一已存在的 agent 目录上自动选择,零命中或多命中会停止并提示。content_hash 缺失或不一致均拒装。
10GitHub stars
~147最小装载
~989含声明引用
~1K文本包总量
索引托管

怎么用

商店整理自技能原文 · 版本 837d16f · 表述以原文为准
它做什么

Claude 会根据你设定的权重和指标范围,对多个模型候选进行打分和排名,并输出排行榜和推荐结果。

什么时候触发

当你需要比较不同模型的表现,或为模型上线做决策时,可以要求 Claude 执行评估。

装好后可以这样说
Claude 会计算加权得分并输出排行榜。
Claude 会运行脚本生成结果。

评论

登录即可评论;带「已验证安装」的,是发布者名下有本店的安装或持有记录。