实测!这款"skill-selector"真的能帮我管理 5 个以上的 Skill
1. 测评对象
skill-selector v1.0.0 — Skill 选择与管理元技能
GitHub:skill-selector-master(本地测评)
链接地址:
2. 测评结论
值得一试。 Bootstrap → Cache 两层架构让 Skill 选择从"盲目试错"变成"一步到位",token 消耗降低 95%,适合拥有 5 个以上 Skill 的项目。但缺少 evals 测试集和 references 目录,完整度还有提升空间。
3. 测评过程
使用路径:
我在 SOLO 中输入了:“帮我选一个合适的 Skill 处理飞书文档”,skill-selector 自动读取缓存 → 匹配关键词"飞书" → 推荐 lark-doc → 一步到位调用。
又测试了:“检查一下我的 Skill 有没有问题”,触发废弃检测和互斥校验,发现 lark-doc-legacy 与 lark-doc 重叠度 95%,推荐安全删除 legacy。
使用效果:
| 维度 | 使用前 | 使用后 |
|---|---|---|
| 每次选择 Skill token 消耗 | ~5000 tokens | ~200 tokens(缓存命中) |
| 选择准确率 | 盲目试错,多次尝试 | 一步到位,P0-P4 优先级匹配 |
| 废弃 Skill 处理 | 静默占用空间 | 自动检测 + 推荐清理 |
| 新建 Skill 依据 | 凭感觉 | 三层评估模型(项目价值→效率指标→可行性) |
实际测试:
- 输入:“帮我处理一下这个飞书文档” → 缓存命中 → 直接调用 lark-doc
(1 步) - 输入:“帮我写个登录函数” → 无 skill 相关词汇 → 不触发,直接处理编码请求
(正确过滤) - 输入:“看看有没有重复的 Skill” → 触发去重分析 → 输出覆盖度矩阵

4. 测评发现
亮点:
- Token 优化效果显著:Bootstrap → Cache 架构让后续调用从 ~5000 token 降至 ~200 token,节省 95%,这在元技能中是顶级设计
- 决策框架完整且可配置:P0-P4 五级优先级、三层评估模型、6 维度废弃判定、5 种互斥检测,每个决策都有阈值和依据,不是"拍脑袋"
- 大模型过时淘汰机制:检测 Skill 是否已被 LLM 原生能力替代(如 json-formatter 被 GPT-4o 原生支持),这是其他元技能没有的创新点
- Bug 修复记录透明:主动记录 3 个 Bug 及修复方案,体现工程质量意识
改进建议:
- 补充 evals 测试集:目前缺少
evals/目录,建议添加 5 条标准化测试用例(2 core + 1 boundary + 2 edge),确保可验证性 - 创建 references 目录:SKILL.md 正文 1160 行偏长,建议将算法细节、配置项说明抽取到
references/目录,按需加载减少首次加载成本 - 优化 description 触发词:补充"审查"、“评分”、"评估"等常见需求词,提高语义匹配覆盖率
5. 综合打分
| 维度 | 评分 | 说明 |
|---|---|---|
| 实用性 | 解决真实痛点:5+ Skill 项目的选择困难,token 节省 95% | |
| 易用性 | 手动触发关键词清晰,README 有快速开始,但 SKILL.md 偏长影响首次加载 | |
| 创新性 | Bootstrap → Cache 架构、大模型过时淘汰机制、三层评估模型,均为原创设计 | |
| 综合 | 值得一试,适合 5+ Skill 项目 |
一句话总结: 如果你的项目积累了 5 个以上 Skill,skill-selector 能帮你从"盲目试错"升级到"智能匹配",token 节省 95% 是实打实的收益。建议作者补充 evals 测试集和 references 目录,冲击 A 级评价。
