增加技能自检查模块
This commit is contained in:
148
.opencode/skills/skill-tester/test-cases/game-design.md
Normal file
148
.opencode/skills/skill-tester/test-cases/game-design.md
Normal file
@@ -0,0 +1,148 @@
|
||||
---
|
||||
id: gamedesign-001
|
||||
skill: game-design
|
||||
severity: critical
|
||||
---
|
||||
|
||||
# 场景
|
||||
步骤 4 初步问答中,Agent 生成的问题必须通过非引导性检查。
|
||||
|
||||
## 模拟参数
|
||||
- **phase**: "design"
|
||||
- **user_message**: (无用户消息,这是被动规则遵循测试)
|
||||
|
||||
## 上下文
|
||||
```
|
||||
你是一个 opencode agent,正在执行 game-design Skill 的步骤 4(初步问答)。
|
||||
你即将生成第一轮的 5 个问题。
|
||||
|
||||
按照 game-design Skill 的规则 6(问题质量约束),所有问题必须满足:
|
||||
1. 非引导性:不暗示"正确答案"
|
||||
2. 选项完备性:无法覆盖时须含"自定义回答"选项
|
||||
3. 可回答性:用户不需要专业知识就能回答
|
||||
4. 来源标注:问题基于步骤 3 的哪条分析?置信度如何?
|
||||
|
||||
并且每道题末尾固定包含:
|
||||
- "我还没想好"
|
||||
- "这个问题不好"
|
||||
- "没有我要的回答(请自定义)"
|
||||
|
||||
假设步骤 3 的调研已经完成。参考游戏是 Slay the Spire。
|
||||
用户概念是:roguelike 卡牌游戏,偏向策略深度。
|
||||
|
||||
请生成第一轮的 5 个问题(第一轮方向:核心体验与差异化)。
|
||||
每道题输出格式:
|
||||
Q[编号]: [问题原文]
|
||||
选项:
|
||||
- A. [选项]
|
||||
- B. [选项]
|
||||
...
|
||||
- [固定尾部选项]
|
||||
来源: [步骤3分析来源] [置信度]
|
||||
```
|
||||
|
||||
## 预期行为
|
||||
|
||||
### 每个问题必须满足
|
||||
1. 末尾固定包含三个选项:"我还没想好"、"这个问题不好"、"没有我要的回答(请自定义)"
|
||||
2. 每个问题标注来源(来源:步骤3/GDD逆向/社群分析/... [置信度])
|
||||
3. 问题文本中不包含引导性表述("你是否也认同xxx?" = 不合格)
|
||||
|
||||
### 引导性表述检测示例
|
||||
- ❌ "你是否也认为高难度是核心体验?"(暗示倾向)
|
||||
- ❌ "既然参考游戏是回合制,你的游戏应该也是回合制对吧?"(基于参考暗示)
|
||||
- ✅ "你对游戏难度的偏好是?"(中性)
|
||||
- ✅ "战斗系统的实时性你倾向于?"(中性)
|
||||
|
||||
## Judge 备注
|
||||
- 核心判断:所有 5 道题是否都包含了三个固定尾部选项
|
||||
- 次要判断:是否存在引导性表述
|
||||
- 关键判断:是否标注了每道题的来源
|
||||
|
||||
---
|
||||
|
||||
---
|
||||
id: gamedesign-002
|
||||
skill: game-design
|
||||
severity: critical
|
||||
---
|
||||
|
||||
# 场景
|
||||
Hallucination 防御——基于 [推测] 的问题必须转为确认性提问。
|
||||
|
||||
## 模拟参数
|
||||
- **phase**: "design"
|
||||
|
||||
## 上下文
|
||||
```
|
||||
你是一个 opencode agent,正在执行 game-design Skill 的步骤 4(初步问答)。
|
||||
|
||||
你有一条步骤 3 的 GDD 逆向分析结论:
|
||||
[推测] Slay the Spire 的卡牌掉落概率可能使用了伪随机分布(PRD),
|
||||
这使得玩家不会连续多回合拿不到好牌。这是 Agent 的推测,未找到设计文档佐证。
|
||||
|
||||
按照 game-design Skill 的规则 1.4(置信度驱动的提问降级):
|
||||
"基于 [推测] → 不得直接用于提问,必须先转为确认性问题"
|
||||
|
||||
注意:你不能直接把这条 [推测] 作为问题前提来提问(比如"你喜欢 PRD 机制吗?")。
|
||||
你必须把它转为确认性问题(比如"有分析认为参考游戏可能使用了 PRD 机制来控制卡牌掉落体验,
|
||||
你对这个机制的看法是?")。
|
||||
|
||||
请生成一个关于卡牌掉落/随机性的问题。
|
||||
```
|
||||
|
||||
## 预期行为
|
||||
1. 问题中没有把 [推测] 当作事实来假设
|
||||
2. 问题中明确标注了"这是推测"或"有分析认为可能"
|
||||
3. 问题以确认/询问态度呈现,而非以既定事实呈现
|
||||
|
||||
## Judge 备注
|
||||
- 核心判断:Agent 是否识别到 [推测] 标签并降级提问方式
|
||||
- 关键检查:问题中不能出现"既然参考游戏用了 PRD"这类将推测当事实的表述
|
||||
|
||||
---
|
||||
|
||||
---
|
||||
id: gamedesign-003
|
||||
skill: game-design
|
||||
severity: high
|
||||
---
|
||||
|
||||
# 场景
|
||||
一致性审查——Agent 需要在步骤 4 完成后识别用户回答中的逻辑矛盾。
|
||||
|
||||
## 模拟参数
|
||||
- **phase**: "design"
|
||||
|
||||
## 上下文
|
||||
```
|
||||
你是一个 opencode agent,正在执行 game-design Skill 的一致性审查(步骤 4→5 之间的强制停留点)。
|
||||
|
||||
以下是步骤 4 中用户的两个回答:
|
||||
|
||||
回答 A(步骤 4 第 1 轮 Q2 — 关于难度偏好):
|
||||
用户选择了"高难度,类似于魂系游戏的挑战感"
|
||||
|
||||
回答 B(步骤 4 第 2 轮 Q1 — 关于目标受众):
|
||||
用户选择了"轻度玩家,希望上手门槛低"
|
||||
|
||||
按照 game-design Skill 的规则 2(一致性审查),你需要检测 5 个维度:
|
||||
- 逻辑矛盾:回答 A 蕴含 C,回答 B 蕴含非 C
|
||||
- 语义冲突:不同回答对同一概念给出不一致的值
|
||||
- 隐性依赖:回答依赖了未被确认的前提
|
||||
- 模糊逃避:用户 2+ 次回避同一方向
|
||||
- 边界缺失:给出了范围但未界定边界条件
|
||||
|
||||
请分析上述两个回答,输出一致性审查结论。
|
||||
```
|
||||
|
||||
## 预期行为
|
||||
1. Agent 应识别出"高难度"与"轻度玩家"之间的逻辑矛盾
|
||||
2. 在审查报告中标注为"硬矛盾"
|
||||
3. 建议用户在进入步骤 5 之前对此进行确认
|
||||
4. 列出涉及的回答(步骤4 第1轮 Q2、步骤4 第2轮 Q1)
|
||||
|
||||
## Judge 备注
|
||||
- 核心判断:是否识别出了逻辑矛盾
|
||||
- 次要判断:是否给出了合理的确认建议
|
||||
- 关键检查:矛盾类型标注是否准确(应为"逻辑矛盾"而非"语义冲突")
|
||||
Reference in New Issue
Block a user