前言
本标准旨在回答一个核心问题:什么样的 Skill 在模型能力持续进化的背景下,仍能保持长期工程与业务价值?
核心理念:Skill 的价值锚定在模型原生能力之外、且不易被模型快速进化所覆盖的工程侧面,同时尊重商业现实中的集成与业务价值。
有些Skill虽然方向正确,但不幸在“AI高速进化的车轮”底下。
一、正向评分维度(共 7 项)
每个维度根据满足程度打 0 / 1 / 2 分:
| 维度 | 权重 | 0 分 | 1 分 | 2 分 |
|---|---|---|---|---|
| 1. 外部记忆与状态持久化 | ×2 | 无任何持久化 | 简单持久化(如文件)但无索引/更新策略 | 结构化存储 + 检索机制 + 过期/更新策略 |
| 2. 生产级可靠性与可观测性 | ×2 | 无工程化保障 | 基础错误捕获或日志 | 完整可观测性(logs/metrics/traces)+ 自动恢复 |
| 3. 质量评估与契约测试 | ×1 | 无测试或仅模型自评 | 手工测试用例或简单断言 | 自动化回归测试 + 量化指标 + 契约测试 |
| 4. 可解释性与行为审计 | ×2 | 无可解释性设计 | 决策日志非结构化 | 结构化审计链 + 自然语言解释 + 支持回放 |
| 5. 外部慢思考/符号推理 | ×2 | 纯依赖模型生成 | 调用单种确定性工具(如计算器) | 组合多种符号推理或复杂约束求解 |
| 6. 多智能体协调与协议 | ×1 | 无多智能体设计 | 简单通信或任务分解(硬编码) | 可插拔协议(合同网、拍卖等)+ 动态角色 |
| 7. 数据飞轮与反馈闭环 | ×2 | 无任何反馈采集 | 记录用户修正/成功失败标签但不自动反哺 | 自动沉淀高质量样本并更新记忆/评估集,形成闭环 |
权重说明:维度 1、2、4、5、7 为核心工程/业务价值,权重加倍;维度 3 和 6 为辅助价值,权重为 1。
加权总分满分为:
- 核心维度 5 项 × 2 分 × 2 权重 = 20 分
- 辅助维度 2 项 × 2 分 × 1 权重 = 4 分
- 合计 24 分
二、绝对红线(一票否决)
命中以下 任意一条,直接判定为 低价值/负价值,无需计算正向得分。
| 红线 | 判定标准 |
|---|---|
| Skill 试图实现“自主创建新技能”、“元认知调控”、“自我进化算法”,且该能力已被主流模型(如 GPT-4o/Claude 3.5+)内建支持超过 80%。典型:宣称“Skill 能让 Agent 自我反思并生成新 Skill”。 | |
| Skill 宣称“100% 消除幻觉”、“零跑偏”、“完全可控”,且未提供任何回退机制(如人工确认、校验重试层)。典型:用复杂 JSON Schema 强行约束 LLM 输出,声称“输出绝对可靠”。 |
注意:这两条红线代表的是 设计哲学的根本错误——试图用工程手段对抗模型能力的自然演进或概率本质,属于负价值。
三、扣分项(非否决,从加权总分中扣除)
以下反模式不直接否决,但每命中一条扣除相应分数。同一 Skill 可命中多条,累计扣分 最多 -6 分(避免负分无限)。
| 反模式 | 扣分 | 判定标准 |
|---|---|---|
| -2 | 唯一功能是截断/丢弃上下文(如“只保留最后 N 条消息”),无语义提炼或关键信息抽取。注意:实现信息蒸馏(如摘要、结构化提炼)的不扣分,反而在维度 1/4 中获得正常评分。 | |
| -2 | 将 月度变更频率 ≥ 3 次/3 个月 的业务规则固化为冷 Skill(需部署/重启);或者将 年度变更 ≤ 1 次/年 的稳定逻辑写入热提示词,且频繁重复执行造成算力浪费。按严重程度可扣 1~3 分,标准情形扣 2 分。 | |
| -1 | Skill 可被 ≤5 条提示词规则 完全替代,且 不涉及 任何 I/O(数据库/API/硬件)、无状态管理、无工具调用、无复杂控制流。特别注意:调用企业内部 API、维护会话状态、实现多步推理/循环、需要错误恢复的集成场景,不扣分。 |
扣分原则:惩罚的是 无工程附加值的简单封装,而非惩罚业务集成。
四、最终价值计算公式与阈值
计算步骤
- 检查红线:若命中任意一条 → 直接判定 低价值(终止)。
- 正向维度打分:对 7 个维度分别打 0/1/2 分。
- 计算加权总分:
其中权重:维度 1、2、4、5、7 为 2;维度 3、6 为 1。加权总分 = Σ(维度得分 × 权重) - 扣除反模式扣分:
最终得分 = 加权总分 - 扣分(累计 ≤6) - 根据阈值判定等级:
| 最终得分 | 等级 | 说明 |
|---|---|---|
| ≥ 11 分 | 高价值 | 强烈推荐开发与使用,长期工程价值显著 |
| 7 ~ 10 分 | 中等价值 | 可用于生产,但需明确局限性和未来被模型替代的风险 |
| ≤ 6 分 | 低价值 | 不建议投入资源,或需重构以满足更高维度 |
阈值设计:11 分约为满分 24 分的 46%,考虑到核心维度权重高,达到该分数意味着至少 3~4 个核心维度得分≥1,且未犯重大错误。
五、快速判定表(参考)
| Skill 类型示例 | 红线 | 主要正向维度得分(核心维度) | 扣分 | 最终得分 | 等级 |
|---|---|---|---|---|---|
| 长期向量记忆库 + 自动摘要 + 可观测 | 无 | 维1=2, 维2=2, 维4=1, 维7=1 → 加权约 14 | 0 | 14 | 高 |
| API 调用封装(重试+日志+简单记忆) | 无 | 维1=1, 维2=1, 维4=0 → 加权约 6 | 0 | 6 | 低(需改进) |
| 信息蒸馏器(提炼长文为核心事实) | 无 | 维4=1, 维5=1, 维7=1 → 加权约 8 | 0 | 8 | 中等 |
| 纯 token 截断(只留最后 5 条消息) | 无 | 维1=0, 其它≈0 → 加权 0 | -2 | -2→0 | 低 |
| 周报模板(纯 prompt + 无状态) | 无 | 维度得分极低 → 加权 2 | -1 | 1 | 低 |
| 企业内部周报集成(调用 HR API + 数据库 + 权限) | 无 | 维1=1, 维2=1, 维7=1 → 加权约 10 | 0(低维不扣分) | 10 | 中等(边界高价值) |
| “自我进化” Skill | 命中红线 | — | — | — | 低(否决) |
| JSON Schema 强制约束(声称零幻觉) | 命中红线 | — | — | — | 低(否决) |
六、使用指南
1. 审计单个 Skill
按顺序执行:红线检查 → 维度打分 → 加权总分 → 扣分 → 等级判定。输出结论及改进建议。
2. 对比多个 Skill
按最终得分排序,但注意红线 Skill 直接置底。
3. 动态复审
建议每 6 个月 重新评估一次高/中等价值 Skill。因为:
- 模型能力进化可能使原本依赖外部记忆的 Skill 变得多余(例如上下文窗口扩大到可包含全部历史)。
- 业务逻辑变化可能导致温度错配。
- 数据飞轮可能已沉淀足够样本,需升级评分。
4. 补充说明
本标准不排斥简单 Skill,但明确指出:低价值 Skill 仍可临时使用,只是不值得长期投入工程资源。对于中等价值 Skill,应明确记录其依赖的模型版本和预期寿命。
本标准由AI生成,可能局限于当下的共识,在机器内部可以闭环的模式下,许多高价值都只是耗材。