{"id":"334db200-f82b-4d65-a67f-11c65976418c","entityType":"agent","slug":"clawhub-kokxi-qa-ai-output-critique","name":"qa-ai-output-critique","canonicalUrl":"https://www.xpersona.co/agent/clawhub-kokxi-qa-ai-output-critique","canonicalPath":"/agent/clawhub-kokxi-qa-ai-output-critique","generatedAt":"2026-10-11T14:16:17.867Z","source":"CLAWHUB","claimStatus":"UNCLAIMED","verificationTier":"NONE","summary":{"evidence":{"source":"editorial-content","verified":true,"confidence":"high","updatedAt":"2026-10-11T11:15:04.028Z","emptyReason":null},"description":"对AI生成的测试用例进行八维评审（完整性、正确性、可执行性、风险覆盖、规范性、一致性、追溯性、冗余度），是AI生成用例后的第一个质量门禁。当AI刚刚生成了一大批测试用例、你需要确保这些用例真的有价值而不是\"看起来不错\"时，应当使用此技能。不要假设AI输出的都是对的——AI经常生成语义正确但实际操作不了的用例。每个维度评分低于7分的必须标注问题并使用MISSING/WRONG/VAGUE等规范格式标记。无上游场景树/风险清单时降级为六维评审（跳过追溯性、简化完整性）。 触发场景：检查一下输出、评审用例质量、验证完整性、这个用例对吗、自动检查时。 Use when the user asks about: critiquing AI-generated test cases across completeness, correctness, executability, risk coverage, conformance, consistency, traceability, and redundancy. Skill: qa-ai-output-critique Owner: kokxi Summary: 对AI生成的测试用例进行八维评审（完整性、正确性、可执行性、风险覆盖、规范性、一致性、追溯性、冗余度），是AI生成用例后的第一个质量门禁。当AI刚刚生成了一大批测试用例、你需要确保这些用例真的有价值而不是\"看起来不错\"时，应当使用此技能。不要假设AI输出的都是对的——AI经常生成语义正确但实际操作不了的用例。每个维度评分低于7分的必须标注问题并使用MISSING/WRONG/VAGUE等规范格式标记。无上游场景树/风险清单时降级为六维评审（跳过追溯性、简化完整性）。 触发场景：检查一下输出、评审用例质量、验证完整性、这个用例对吗、自动检查时。 Use when the user asks about: critiquing AI-generated test cases across completeness, correctn","descriptionLabel":"Technical summary","evidenceSummary":"Capability contract not published. No trust telemetry is available yet. 1.1K downloads reported by the source. Last updated 10/11/2026.","installCommand":"clawhub skill install s170jw3s1atcj5jwhqb4r7v7eh8912kp:qa-ai-output-critique","sourceUrl":"https://clawhub.ai/kokxi/qa-ai-output-critique","homepage":"https://clawhub.ai/kokxi/skills/qa-ai-output-critique","primaryLinks":[{"label":"View on ClawHub","url":"https://clawhub.ai/kokxi/qa-ai-output-critique","kind":"source"},{"label":"Homepage","url":"https://clawhub.ai/kokxi/skills/qa-ai-output-critique","kind":"homepage"}],"safetyScore":84,"overallRank":62,"popularityScore":61,"trustScore":null,"claimedByName":null,"isOwner":false,"seoDescription":"对AI生成的测试用例进行八维评审（完整性、正确性、可执行性、风险覆盖、规范性、一致性、追溯性、冗余度），是AI生成用例后的第一个质量门禁。当AI刚刚生成了一大批测试用例、你需要确保这些用例真的有价值而不是\"看起来不错\"时，应当使用此技能。不要假设AI输出的都是对的——AI经常生成语义正确但实际操作不了的用例。每个维度评"},"coverage":{"evidence":{"source":"public-profile","verified":false,"confidence":"medium","updatedAt":"2026-10-11T11:15:04.028Z","emptyReason":null},"protocols":[{"protocol":"OPENCLEW","label":"OpenClaw","status":"self-declared","notes":"Declared in the public agent profile."}],"capabilities":[],"verifiedCount":0,"selfDeclaredCount":1,"capabilityMatrix":{"rows":[{"key":"OPENCLEW","type":"protocol","support":"unknown","confidenceSource":"profile","notes":"Listed on profile"}],"flattenedTokens":"protocol:OPENCLEW|unknown|profile"}},"adoption":{"evidence":{"source":"CLAWHUB","verified":false,"confidence":"medium","updatedAt":"2026-10-11T11:15:04.028Z","emptyReason":null},"stars":null,"forks":null,"downloads":1079,"packageName":null,"latestVersion":"1.8.0","tractionLabel":"1.1K downloads"},"release":{"evidence":{"source":"CLAWHUB","verified":false,"confidence":"medium","updatedAt":"2026-10-11T11:15:03.959Z","emptyReason":null},"lastUpdatedAt":"2026-10-11T11:15:04.028Z","lastCrawledAt":"2026-10-11T11:15:03.959Z","lastIndexedAt":null,"nextCrawlAt":"2026-10-12T11:15:03.959Z","lastVerifiedAt":null,"highlights":[{"version":"1.8.0","createdAt":"2026-09-29T04:25:07.399Z","changelog":"**Changelog for qa-ai-output-critique v1.8.0:** - Added new references on deep review techniques and a detailed critique report template for enhanced assessment workflows. - Streamlined and clarified SKILL.md: explicit separation of documentation, stricter input/output format descriptions, and updated \"when to use\" guidance. - Reference documentation for report templates was removed and replaced with new, better-structured files. - Refined and shortened overall skill documentation, with more emphasis on required review steps, error marking, downgrade rules, and coverage of model-specific failure patterns. - Improved modularity and maintainability by removing the old skill card and consolidating standard outputs in dedicated asset files.","fileCount":6,"zipByteSize":13015},{"version":"1.7.7","createdAt":"2026-09-27T14:31:37.414Z","changelog":"1.7.7","fileCount":5,"zipByteSize":10200},{"version":"1.7.6","createdAt":"2026-09-01T12:35:11.760Z","changelog":"显示名改中文","fileCount":5,"zipByteSize":10445},{"version":"1.7.5","createdAt":"2026-08-30T15:10:18.121Z","changelog":"1.7.5: 版本号升级","fileCount":5,"zipByteSize":10316},{"version":"1.6.3","createdAt":"2026-08-12T15:20:14.856Z","changelog":"- Added skill metadata fields: slug and displayName for improved discoverability. - Updated skill description and logic to clarify the eight-dimension review (八维评审) approach, emphasizing downgrade to six dimensions when lacking upstream scenario or risk data. - Output structure updated to specify eight-dimension report as default, with downgrade to six. - Minor corrections to terminology throughout (e.g. “正确性” replaces “准确性”; better dimension naming). - Removed obsolete file: skill-card.md.","fileCount":5,"zipByteSize":9379},{"version":"1.6.0","createdAt":"2026-07-06T17:13:48.028Z","changelog":"- Added references and categories fields for improved documentation and discoverability. - Expanded downstream integration to include qa-expert-review and qa-output-validation. - Introduced traceability notes clarifying issue-to-use-case mapping in output_format. - Added error_recovery_guidance for handling systemic review failures and retries. - Updated safety warning to discourage direct data deletion, clarifying output is non-persistent. - Removed skill-card.md file.","fileCount":5,"zipByteSize":9514},{"version":"1.5.0","createdAt":"2026-06-29T12:30:48.514Z","changelog":"Version 1.5.0 - 全面重构评审体系，六维评审（完整性、准确性、可执行性、风险覆盖、规范性、追溯性）流程更清晰。 - 评审框架与报告模板全部抽取为参考文档（references/report-templates.md、references/review-dimensions.md），规范输出结构。 - 输入/输出格式变更：输入可配置评审标准，输出包含结构化评审报告、覆盖遗漏、评分和建议。 - 明确评审降级策略、支持自动切换为快速评审（无场景树/风险清单时）。 - 对每个评审维度分数低于7要求强制问题标注（MISSING/WRONG/VAGUE格式）。 - 移除 skill-card.md，简化核心文档。","fileCount":5,"zipByteSize":9074},{"version":"1.4.1","createdAt":"2026-06-25T16:53:08.742Z","changelog":"**qa-ai-output-critique v1.4.1** - Expanded from a 6-dimension to an 8-dimension review framework, adding \"一致性\"（consistency）and \"冗余度\"（redundancy）dimensions. - Refined review logic: clearer input requirements, added downgrade strategy (graceful evaluation if lacking scenario tree or risk list). - Introduced dual review modes: 完整评审 (full, 8D) and 快速评审 (quick, 6D) depending on input availability. - Updated report templates and evaluation checklists to reflect the 8-dimension standard. - Removed outdated documentation files; condensed and clarified user guidance throughout SKILL.md.","fileCount":3,"zipByteSize":6900}]},"execution":{"evidence":{"source":"CLAWHUB","verified":false,"confidence":"low","updatedAt":null,"emptyReason":"No published capability contract is available yet."},"installCommand":"clawhub skill install s170jw3s1atcj5jwhqb4r7v7eh8912kp:qa-ai-output-critique","setupComplexity":"low","setupSteps":["Setup complexity is classified as HIGH. You must provision dedicated cloud infrastructure or an isolated VM. Do not run this directly on your local workstation.","Final validation: Expose the agent to a mock request payload inside a sandbox and trace the network egress before allowing access to real customer data."],"contract":{"contractStatus":"missing","authModes":[],"requires":[],"forbidden":[],"supportsMcp":false,"supportsA2a":false,"supportsStreaming":false,"inputSchemaRef":null,"outputSchemaRef":null,"dataRegion":null,"contractUpdatedAt":null,"sourceUpdatedAt":null,"freshnessSeconds":null},"invocationGuide":{"preferredApi":{"snapshotUrl":"https://www.xpersona.co/api/v1/agents/clawhub-kokxi-qa-ai-output-critique/snapshot","contractUrl":"https://www.xpersona.co/api/v1/agents/clawhub-kokxi-qa-ai-output-critique/contract","trustUrl":"https://www.xpersona.co/api/v1/agents/clawhub-kokxi-qa-ai-output-critique/trust"},"curlExamples":["curl -s \"https://www.xpersona.co/api/v1/agents/clawhub-kokxi-qa-ai-output-critique/snapshot\"","curl -s \"https://www.xpersona.co/api/v1/agents/clawhub-kokxi-qa-ai-output-critique/contract\"","curl -s \"https://www.xpersona.co/api/v1/agents/clawhub-kokxi-qa-ai-output-critique/trust\""],"jsonRequestTemplate":{"query":"summarize this repo","constraints":{"maxLatencyMs":2000,"protocolPreference":["OPENCLEW"]}},"jsonResponseTemplate":{"ok":true,"result":{"summary":"...","confidence":0.9},"meta":{"source":"CLAWHUB","generatedAt":"2026-10-11T14:16:17.864Z"}},"retryPolicy":{"maxAttempts":3,"backoffMs":[500,1500,3500],"retryableConditions":["HTTP_429","HTTP_503","NETWORK_TIMEOUT"]}},"endpoints":{"dossierUrl":"https://www.xpersona.co/api/v1/agents/clawhub-kokxi-qa-ai-output-critique/dossier","snapshotUrl":"https://www.xpersona.co/api/v1/agents/clawhub-kokxi-qa-ai-output-critique/snapshot","contractUrl":"https://www.xpersona.co/api/v1/agents/clawhub-kokxi-qa-ai-output-critique/contract","trustUrl":"https://www.xpersona.co/api/v1/agents/clawhub-kokxi-qa-ai-output-critique/trust"}},"reliability":{"evidence":{"source":"runtime-metrics","verified":false,"confidence":"low","updatedAt":null,"emptyReason":"No trust, reliability, or runtime telemetry is available."},"trust":{"status":"unavailable","handshakeStatus":"UNKNOWN","verificationFreshnessHours":null,"reputationScore":null,"p95LatencyMs":null,"successRate30d":null,"fallbackRate":null,"attempts30d":null,"trustUpdatedAt":null,"trustConfidence":"unknown","sourceUpdatedAt":null,"freshnessSeconds":null},"decisionGuardrails":{"doNotUseIf":["Contract metadata is missing or unavailable for deterministic execution."],"safeUseWhen":[],"riskFlags":["missing_or_unavailable_contract","trust_data_unavailable","schema_references_missing"],"operationalConfidence":"low"},"executionMetrics":{"observedLatencyMsP50":null,"observedLatencyMsP95":null,"estimatedCostUsd":null,"uptime30d":null,"rateLimitRpm":null,"rateLimitBurst":null,"lastVerifiedAt":null,"verificationSource":null},"runtimeMetrics":{"successRate":null,"avgLatencyMs":null,"avgCostUsd":null,"hallucinationRate":null,"retryRate":null,"disputeRate":null,"p50Latency":null,"p95Latency":null,"lastUpdated":null}},"benchmarks":{"evidence":{"source":"no-benchmark-data","verified":false,"confidence":"low","updatedAt":null,"emptyReason":"No benchmark suites or observed failure patterns are available."},"suites":[],"failurePatterns":[]},"artifacts":{"evidence":{"source":"CLAWHUB","verified":false,"confidence":"high","updatedAt":"2026-10-11T11:15:04.028Z","emptyReason":null},"readme":"Skill: qa-ai-output-critique\n\nOwner: kokxi\n\nSummary: 对AI生成的测试用例进行八维评审（完整性、正确性、可执行性、风险覆盖、规范性、一致性、追溯性、冗余度），是AI生成用例后的第一个质量门禁。当AI刚刚生成了一大批测试用例、你需要确保这些用例真的有价值而不是\"看起来不错\"时，应当使用此技能。不要假设AI输出的都是对的——AI经常生成语义正确但实际操作不了的用例。每个维度评分低于7分的必须标注问题并使用MISSING/WRONG/VAGUE等规范格式标记。无上游场景树/风险清单时降级为六维评审（跳过追溯性、简化完整性）。 触发场景：检查一下输出、评审用例质量、验证完整性、这个用例对吗、自动检查时。 Use when the user asks about: critiquing AI-generated test cases across completeness, correctness, executability, risk coverage, conformance, consistency, traceability, and redundancy.\n\nTags: latest:1.8.0\n\nVersion history:\n\nv1.8.0 | 2026-09-29T04:25:07.399Z | auto\n\n**Changelog for qa-ai-output-critique v1.8.0:**\n\n- Added new references on deep review techniques and a detailed critique report template for enhanced assessment workflows.\n- Streamlined and clarified SKILL.md: explicit separation of documentation, stricter input/output format descriptions, and updated \"when to use\" guidance.\n- Reference documentation for report templates was removed and replaced with new, better-structured files.\n- Refined and shortened overall skill documentation, with more emphasis on required review steps, error marking, downgrade rules, and coverage of model-specific failure patterns.\n- Improved modularity and maintainability by removing the old skill card and consolidating standard outputs in dedicated asset files.\n\nv1.7.7 | 2026-09-27T14:31:37.414Z | user\n\n1.7.7\n\nv1.7.6 | 2026-09-01T12:35:11.760Z | user\n\n显示名改中文\n\nv1.7.5 | 2026-08-30T15:10:18.121Z | user\n\n1.7.5: 版本号升级\n\nv1.6.3 | 2026-08-12T15:20:14.856Z | auto\n\n- Added skill metadata fields: slug and displayName for improved discoverability.\n- Updated skill description and logic to clarify the eight-dimension review (八维评审) approach, emphasizing downgrade to six dimensions when lacking upstream scenario or risk data.\n- Output structure updated to specify eight-dimension report as default, with downgrade to six.\n- Minor corrections to terminology throughout (e.g. “正确性” replaces “准确性”; better dimension naming).\n- Removed obsolete file: skill-card.md.\n\nv1.6.0 | 2026-07-06T17:13:48.028Z | auto\n\n- Added references and categories fields for improved documentation and discoverability.\n- Expanded downstream integration to include qa-expert-review and qa-output-validation.\n- Introduced traceability notes clarifying issue-to-use-case mapping in output_format.\n- Added error_recovery_guidance for handling systemic review failures and retries.\n- Updated safety warning to discourage direct data deletion, clarifying output is non-persistent.\n- Removed skill-card.md file.\n\nv1.5.0 | 2026-06-29T12:30:48.514Z | auto\n\nVersion 1.5.0\n\n- 全面重构评审体系，六维评审（完整性、准确性、可执行性、风险覆盖、规范性、追溯性）流程更清晰。\n- 评审框架与报告模板全部抽取为参考文档（references/report-templates.md、references/review-dimensions.md），规范输出结构。\n- 输入/输出格式变更：输入可配置评审标准，输出包含结构化评审报告、覆盖遗漏、评分和建议。\n- 明确评审降级策略、支持自动切换为快速评审（无场景树/风险清单时）。\n- 对每个评审维度分数低于7要求强制问题标注（MISSING/WRONG/VAGUE格式）。\n- 移除 skill-card.md，简化核心文档。\n\nv1.4.1 | 2026-06-25T16:53:08.742Z | auto\n\n**qa-ai-output-critique v1.4.1**\n\n- Expanded from a 6-dimension to an 8-dimension review framework, adding \"一致性\"（consistency）and \"冗余度\"（redundancy）dimensions.\n- Refined review logic: clearer input requirements, added downgrade strategy (graceful evaluation if lacking scenario tree or risk list).\n- Introduced dual review modes: 完整评审 (full, 8D) and 快速评审 (quick, 6D) depending on input availability.\n- Updated report templates and evaluation checklists to reflect the 8-dimension standard.\n- Removed outdated documentation files; condensed and clarified user guidance throughout SKILL.md.\n\nv1.4.0 | 2026-06-24T05:02:39.848Z | auto\n\n## qa-ai-output-critique 1.4.0 Changelog\n\n- Major update: Skill定位由“评审与补全”转为“AI自动输出门禁”，强调自动化检查，区分自动与专家深度评审（专家深度评审用qa-expert-review）。\n- 优化描述与触发场景，明确支持AI自动门禁和用户主动输出检查需求。\n- SKILL.md大幅精简结构和说明，突出六维评审法、自动格式及完整性门槛、假设挖掘与迭代建议模板。\n- skill-card.md文件已移除。\n- 清楚列出实际适用情况和所有必查项，提高易用性和一致性。\n- 提供多个实际使用场景和范例，便于理解与应用。\n\nv1.3.0 | 2026-06-20T14:04:38.091Z | auto\n\n- 引入更详细的六维评审法，统一量化标准，明确每个维度的评分细则和评审清单。\n- 新增假设挖掘方法和模板，引导用户识别AI输出中的隐含假设及其风险。\n- 完善AI反驳机制，提供多种反视角问法和反驳检查清单，提升评审深度。\n- 强化投入产出评估标准和ROI计算方法，帮助优化用例优先级。\n- 更新、丰富评审报告模板与验收清单，提升报告的可执行性与覆盖面。\n\nArchive index:\n\nArchive v1.8.0: 6 files, 13015 bytes\n\nFiles: assets/critique-report.md (6381b), references/deep-review-techniques.md (4300b), references/review-dimensions.md (5484b), skill-card.md (2133b), SKILL.md (8839b), _meta.json (140b)\n\nFile v1.8.0:SKILL.md\n\n---\nname: qa-ai-output-critique\ndescription: >-\n  对AI生成的测试用例进行八维评审（完整性、正确性、可执行性、风险覆盖、规范性、一致性、追溯性、冗余度），是AI生成用例后的第一个质量门禁。当AI刚刚生成了一大批测试用例、你需要确保这些用例真的有价值而不是\"看起来不错\"时，应当使用此技能。不要假设AI输出的都是对的——AI经常生成语义正确但实际操作不了的用例。每个维度评分低于7分的必须标注问题并使用MISSING/WRONG/VAGUE等规范格式标记。无上游场景树/风险清单时降级为六维评审（跳过追溯性、简化完整性）。\n  触发场景：检查一下输出、评审用例质量、验证完整性、这个用例对吗、自动检查时。 Use when the user asks about: critiquing AI-generated test cases across completeness, correctness, executability, risk coverage, conformance, consistency, traceability, and redundancy.\nlicense: MIT\nallowed-tools: Read Grep Glob\nmetadata:\n  display-name: \"Ai Output Critique\"\n  version: \"1.8.0\"\n  when-to-use: \"AI生成用例后自动激活（最终输出前的必过门禁）；用户说\\\"检查一下输出\\\"、\\\"评审用例质量\\\"、\\\"验证完整性\\\"、\\\"这个用例对吗\\\"、\\\"自动检查\\\"时\"\n  related-skills: \"{\\\"upstream\\\":[\\\"qa-ai-prompt-strategy\\\",\\\"qa-scenario-tree\\\",\\\"qa-risk-intuition\\\"],\\\"downstream\\\":[\\\"qa-ai-blindspot-compensation\\\",\\\"qa-expert-review\\\",\\\"qa-output-validation\\\"]}\"\n  references: \"[\\\"references/review-dimensions.md\\\",\\\"references/deep-review-techniques.md\\\",\\\"assets/critique-report.md\\\"]\"\n  input-format: \"{\\\"required\\\":[{\\\"name\\\":\\\"AI生成测试用例\\\",\\\"type\\\":\\\"array\\\",\\\"description\\\":\\\"AI生成的9列标准测试用例\\\"}],\\\"optional\\\":[{\\\"name\\\":\\\"场景树\\\",\\\"type\\\":\\\"object\\\",\\\"description\\\":\\\"来自qa-scenario-tree，用于完整性评审\\\"},{\\\"name\\\":\\\"风险清单\\\",\\\"type\\\":\\\"object\\\",\\\"description\\\":\\\"来自qa-risk-intuition，用于风险覆盖评审\\\"},{\\\"name\\\":\\\"需求ID列表\\\",\\\"type\\\":\\\"array\\\",\\\"description\\\":\\\"REQ-{模块缩写}-{序号} 列表，用于追溯性评审\\\"}]}\"\n  output-format: \"{\\\"traceability\\\":[\\\"本技能只评审、不新增 ID；评审问题关联到被评审的原用例ID：TC_{模块缩写}_{功能缩写}_{三位序号}\\\",\\\"覆盖遗漏的依据引用上游 ID：REQ- 需求 / SC- 场景 / RISK- 风险点\\\"],\\\"structure\\\":[{\\\"critique_report\\\":\\\"评审报告：八维评分（降级模式为六维）+ 问题清单（用例ID|维度|标记|问题描述|修正建议）+ 覆盖遗漏 + 改进方向 + 三选一结论\\\"},\\\"评分：每维 10 分、总分≥64 合格；任一维 <7 分必须标问题并修改（总分达标不豁免单维不合格）\\\",\\\"问题标记三选一：MISSING（缺失）/ WRONG（错误）/ VAGUE（含糊）\\\",\\\"覆盖遗漏必须给出依据 ID，不接受凭感觉的\\\\\\\"还不够全面\\\\\\\"\\\",\\\"本技能不产出 9 列用例表 —— 只评审，用例由 qa-test-case-design 定义、qa-ai-prompt-strategy 驱动生成\\\"]}\"\n  error-recovery-guidance: \"{\\\"on_failure\\\":\\\"评审发现系统性问题时回退到AI生成步骤修正\\\",\\\"retry_behavior\\\":\\\"修正提示词或上下文后重新生成并评审\\\"}\"\n  categories: \"[\\\"Development\\\",\\\"Testing\\\",\\\"AI\\\"]\"\n  depth-requirement: \"{\\\"reference_value\\\":\\\"按用例数量与复杂度调整评审投入；用例越多越要分维度逐条评，不抽样\\\",\\\"minimum\\\":\\\"至少覆盖功能正确性、边界条件、异常场景 3 个评审维度；低于 7 分的维度必须标问题\\\"}\"\n---\n\n> ⚠️ 本技能单独使用效果有限，建议配合完整技能集（12 步工作流）使用。安装：npx skills add Kokxi/qa-test-skills\n\n> **⚠️ 安全警告**：本技能的示例可能涉及测试用例整理、合并或删除建议。\n> 实际使用时请勿直接执行批量删除操作，先备份原数据并确认非关键用例。\n> 本技能仅在 workspace/ 输出评估文件，不持久化、不外传、不跨会话复用。\n\n# AI 输出评审\n\n## 核心原则\n\nAI 输出**看起来**都对，但专家能看出哪里不够。\n\n这个技能是 AI 生成用例后的**第一个质量门禁**——不要假设 AI 输出的都是对的。\n\n## 1. 八维评审速查\n\n每维 10 分，**总分 ≥ 64 合格**。**但总分达标不豁免单维不合格**：任一维 < 7 分必须改。\n\n| 维度 | 评分核心 | 最常见问题 |\n|------|---------|-----------|\n| **完整性** | 场景覆盖是否完整 | 缺异常路径 |\n| **正确性** | 业务规则和预期是否正确 | 预期结果不自洽 |\n| **可执行性** | 步骤是否清晰可执行 | 步骤写\"按正常流程\" |\n| **风险覆盖** | 高风险区域是否深测 | 资损/并发场景缺失 |\n| **规范性** | 格式是否符合标准 | 编号断号、列错位 |\n| **追溯性** | `REQ-`/`SC-` ID 是否完整 | 用例无需求关联 |\n| **一致性** | 用例间是否自相矛盾 | 前置与步骤不匹配 |\n| **冗余度** | 是否有无价值用例 | 多条用例覆盖同一点 |\n\n> 逐维详细评分标准与评审清单见 [`references/review-dimensions.md`](references/review-dimensions.md)。\n\n## 2. 评审模式\n\n| 模式 | 条件 | 评审维度 | 适用 |\n|------|------|---------|------|\n| **A 完整评审** | 场景树 **AND** 风险清单 **AND** 需求 ID 列表 | 八维全启用 | 工作流标准评审 |\n| **B 降级评审** | 缺任一上游 | 六维（跳过追溯性，简化完整性） | 独立使用、快速检查 |\n\n**降级处理**\n\n| 缺少的上游 | 降级策略 |\n|-----------|---------|\n| 场景树 | 完整性基于通用场景清单（主流程/分支/异常/边界） |\n| 风险清单 | 风险覆盖基于默认风险类型（资金/安全/并发/数据一致性） |\n| 需求 ID 列表 | **追溯性维度直接跳过**，标注\"需补充追溯信息\" |\n\n> **降级必须显式声明**。静默降级会让评审报告看起来比实际更权威。\n\n## 3. 国产模型特有评审点\n\n除八维通用评审外，国产模型输出还需额外检查（这些是通用维度覆盖不到的失败模式）：\n\n| 评审点 | 典型表现 | 处理 |\n|--------|---------|------|\n| **中文语义漂移** | 标题\"验证登录\"但步骤在测注册 | 用\"步骤是否支撑标题\"反向核查，漂移即降分 |\n| **数字/单位幻觉** | 凭空编造超时值、并发数、金额单位 | 核对来源，无依据标 `MISSING：需基准数据` |\n| **政策/合规表述** | 预期结果含不合规表述（支付/个人信息） | 标合规风险，提示对照监管要求 |\n| **格式不稳定** | 表格列错位、编号断号（`TC_001`→`TC_003`）、中文标点混入 | 按规范性维度检查编号连续性 |\n| **过度泛化** | 写得\"像测试指南\"而非\"可执行用例\" | 按可执行性维度扣分，要求补具体步骤 |\n| **伪正确性** | 预期结果\"返回正确\"但未定义什么算正确 | 要求可验证（具体状态码/字段值） |\n\n**评审动作**：发现任一问题 → 按对应八维维度降分 + 输出规范标记（`MISSING`/`WRONG`/`VAGUE`）+ 修正建议。\n\n## 4. 加载时机\n\n| 什么时候读 | 读哪个 |\n|-----------|--------|\n| 逐维详细评分标准与评审清单 | [`references/review-dimensions.md`](references/review-dimensions.md) |\n| 报告已出，想再深挖一层或决定砍哪些用例 | [`references/deep-review-techniques.md`](references/deep-review-techniques.md)（假设挖掘 / 迭代决策树 / AI 反驳 / ROI） |\n| 写评审报告 | [`assets/critique-report.md`](assets/critique-report.md)（模式 A/B 模板 + 填写要求 + 自检） |\n\n## 5. 产出\n\n```markdown\n# 测试用例评审报告\n\n## 一、八维评分          → 每维 10 分，<7 分标问题\n## 二、问题清单          → 用例 ID | 维度 | 标记 | 问题描述 | 修正建议\n## 三、覆盖遗漏          → 必须给依据 ID（RISK- / REQ- / SC-）\n## 四、改进方向          → 可执行的具体动作\n## 五、评审结论          → 需重新生成 / 需修改后复审 / 通过\n```\n\n标记三选一：`MISSING`（缺失）/ `WRONG`（错误）/ `VAGUE`（含糊）\n\n> 完整模板见 `assets/critique-report.md`。**本技能只评审，不产出用例。**\n\n## 6. 交付前自检\n\n- [ ] 八维（或六维）逐维评分，低于 7 分的已标问题\n- [ ] **总分达标但存在高严重度问题时，明确要求修改**（不因总分豁免）\n- [ ] 每个问题关联到具体用例 ID，且有 `MISSING`/`WRONG`/`VAGUE` 标记\n- [ ] 覆盖遗漏都给出了依据 ID（`RISK-`/`REQ-`/`SC-`），不是凭感觉\n- [ ] 国产模型 6 项特有评审点已逐项检查\n- [ ] 降级模式已显式声明缺哪些上游数据\n- [ ] 评审结论三选一且明确\n- [ ] 用例编号格式为 3 段式，无断号、无 `TC_`/`SC-` 混用\n\nFile v1.8.0:_meta.json\n\n{\n  \"ownerId\": \"kn71y9b23csfx0ykgm55d5m9x5891zt8\",\n  \"slug\": \"qa-ai-output-critique\",\n  \"version\": \"1.8.0\",\n  \"publishedAt\": 1790655907399\n}\n\nFile v1.8.0:references/deep-review-techniques.md\n\n# 深度评审技巧\n\n> 本文是 `qa-ai-output-critique` 的**深入技巧**。八维评分与评审报告已产出后，\n> 想再深挖一层、或判断哪些用例该砍时读本文。\n> 八维评分标准见 [`review-dimensions.md`](review-dimensions.md)。\n\n**使用时机**：这些是评审报告输出**之后**的补充手段，用于发现更深层的问题，\n不是独立的评审体系。\n\n---\n\n## 假设挖掘\n\nAI 输出中常见的隐含假设——这些是\"看起来都对\"的用例背后没写出来的东西：\n\n| 假设类型 | 示例 | 追问话术 |\n|---------|------|---------|\n| 用户行为假设 | \"用户会正常输入\" | 用户误输入怎么办？ |\n| 环境假设 | \"网络正常\" | 网络异常时会怎样？ |\n| 数据假设 | \"数据格式正确\" | 格式错误时怎么处理？ |\n| 时序假设 | \"操作按顺序执行\" | 乱序执行会怎样？ |\n| 依赖假设 | \"第三方服务正常\" | 第三方挂了怎么办？ |\n\n**挖掘问法**（直接问 AI，比自己逐条想高效）：\n\n```text\n请列出你在输出中做的所有假设。\n哪些假设可能不成立？\n如果假设不成立，测试场景会有什么变化？\n```\n\n---\n\n## 迭代决策树\n\n评审结果不满意时，按问题类型给不同的返工指令——**笼统地说\"再改改\"是无效的**：\n\n```text\n输出不满意\n├─ 完整性不够？ → 请补充[缺失的场景类型]\n├─ 深度不够？   → 请按[具体维度]深入分析\n├─ 风险覆盖不足？ → 请对[高风险区域]做专项测试\n├─ 有矛盾？     → 请修正[具体矛盾点]\n├─ 冗余过多？   → 请合并或删除[低价值用例]\n└─ 不可执行？   → 请确保[测试步骤]可实际执行\n```\n\n---\n\n## AI 反驳机制\n\n**让 AI 挑战你的假设，而不是迎合你。** 评审者最容易掉进的坑是确认偏误——\n自己写的用例自己看不出问题，让 AI 扮演对抗角色能有效破除。\n\n```text\n模式1：质量负责人视角\n\"请站在质量负责人角度，指出可能遗漏的业务风险、过度测试的地方，\n 以及上线前还需要确认的问题。\"\n\n模式2：故障反推视角\n\"请假设这个功能上线后出现严重问题，反推我现在的测试方案可能漏掉了什么。\"\n\n模式3：资源约束视角\n\"测试资源有限，请评估这些用例的投入产出比，哪些是必须测的，\n 哪些可以简化或跳过。\"\n\n模式4：竞品对比视角\n\"如果竞争对手的同类功能比我们更稳定，可能是因为他们多测了哪些\n 我们没覆盖的场景？\"\n```\n\n**检查**\n- [ ] 是否要求 AI 挑战你的假设（而非只让它确认）\n- [ ] 是否让 AI 从反面看问题（故障反推）\n- [ ] 是否评估了投入产出比\n- [ ] 是否识别了**过度测试**的区域（不只是覆盖不足）\n\n---\n\n## 投入产出评估\n\n用于决定**砍掉哪些用例**——覆盖不足要补，但冗余用例同样是在消耗资源。\n\n### 评估维度\n\n| 维度 | 评估标准 | 权重 |\n|------|---------|------|\n| 业务价值 | 影响用户数 × 影响程度 | 40% |\n| 风险等级 | 发生概率 × 影响程度 | 30% |\n| 测试成本 | 用例数 × 执行时间 | 20% |\n| 自动化潜力 | 是否适合自动化 | 10% |\n\n### 评估矩阵\n\n| 用例类型 | 业务价值 | 风险等级 | 测试成本 | 建议 |\n|---------|---------|---------|---------|------|\n| P0 + 高风险 | 高 | 高 | 中 | 必须测试，优先自动化 |\n| P0 + 低风险 | 高 | 低 | 低 | 必须测试，手动即可 |\n| P1 + 高风险 | 中 | 高 | 中 | 必须测试，考虑自动化 |\n| P1 + 低风险 | 中 | 低 | 低 | 选择性测试 |\n| P2 + 高风险 | 低 | 高 | 中 | 评估后决定 |\n| P2 + 低风险 | 低 | 低 | 低 | 可跳过或简化 |\n\n### ROI 计算\n\n```text\nROI = (业务价值 × 风险等级) / 测试成本\n\n用例A：业务价值=5，风险等级=5，测试成本=2  → ROI = 12.5  高 ROI，优先测试\n用例B：业务价值=2，风险等级=2，测试成本=5  → ROI = 0.8   低 ROI，可简化\n```\n\n> **注意 ROI 的陷阱**：公式里没有\"缺陷发现概率\"。低 ROI 用例仍可能是唯一能发现\n> 某个严重缺陷的用例——尤其 P2+低风险里的**并发与越权**场景。\n> 用 ROI 决定\"测多少\"，不要用它决定\"测不测\"。\n\nFile v1.8.0:references/review-dimensions.md\n\n# 八维评审法 — 完整评审维度与评分标准\n\n> 本文档是 `qa-ai-output-critique` 的参考文件。执行评审时，按以下八维评分标准逐项打分。\n> 每维度 10 分，总分 ≥ 64 分为合格。\n\n---\n\n## 评分总览\n\n| 维度 | 评分核心 | 默认权重 |\n|------|---------|---------|\n| 完整性 | 场景覆盖是否完整 | 10分 |\n| 正确性 | 业务规则和预期是否正确 | 10分 |\n| 可执行性 | 步骤是否清晰可执行 | 10分 |\n| 风险覆盖 | 高风险区域是否深测 | 10分 |\n| 规范性 | 格式是否符合标准 | 10分 |\n| 追溯性 | 需求ID/风险ID是否完整 | 10分 |\n| 一致性 | 用例间是否自相矛盾 | 10分 |\n| 冗余度 | 是否有无价值用例 | 10分 |\n\n---\n\n## 1. 完整性评审（10分）\n\n**检查项**：是否覆盖了所有场景？\n\n```text\n评分标准：\n- 10分：覆盖所有主路径+分支+异常+边界（基于场景树）\n- 7分：覆盖主路径和主要异常\n- 4分：只覆盖主路径\n- 1分：严重缺失\n\n评审清单：\n- [ ] 主路径场景是否完整？\n- [ ] 分支路径是否覆盖？\n- [ ] 异常场景是否考虑？\n- [ ] 边界条件是否分析？\n- [ ] 非功能需求是否涉及？\n\n发现问题的问法：\n\"请列出你输出中未覆盖的场景类型\"\n\"对照场景树，检查覆盖率\"\n\"请按四维边界模型重新分析\"\n\"这个边界真的够深吗？\"\n\n降级模式（无场景树时）：\n- 基于通用场景清单检查：主流程、分支、异常、边界、非功能\n- 标注\"建议补充场景树后重新评审\"\n```\n\n---\n\n## 2. 正确性评审（10分）\n\n**检查项**：业务规则和预期结果是否正确？\n\n```text\n核心关注：对不对（内容正确性）\n\n评分标准：\n- 10分：业务规则正确、预期可验证\n- 7分：大部分正确，少量细节需调整\n- 4分：有多处错误\n- 1分：严重错误\n\n评审清单：\n- [ ] 业务规则描述是否符合需求？\n- [ ] 预期结果是否与实际系统行为一致？\n- [ ] 数据计算逻辑是否正确？\n- [ ] 状态转换描述是否准确？\n\n发现问题的问法：\n\"这个预期结果与实际系统行为一致吗？\"\n\"业务规则描述是否准确？\"\n\"这个状态转换逻辑对吗？\"\n```\n\n---\n\n## 3. 可执行性评审（10分）\n\n**检查项**：能不能实际执行？\n\n```text\n核心关注：能不能做（可操作性）\n\n评分标准：\n- 10分：步骤清晰、无歧义、可执行\n- 7分：大部分清晰，少量需补充\n- 4分：有多处模糊\n- 1分：无法执行\n\n评审清单：\n- [ ] 测试数据是否可构造？\n- [ ] 测试环境是否可搭建？\n- [ ] 测试步骤是否可重复？\n- [ ] 预期结果是否可观测？\n\n发现问题的问法：\n\"这个用例能实际执行吗？\"\n\"测试数据从哪来？\"\n\"测试环境怎么搭建？\"\n```\n\n---\n\n## 4. 风险覆盖评审（10分）\n\n**检查项**：高风险区域是否深测？\n\n```text\n评分标准：\n- 10分：高风险区域100%覆盖（基于风险清单）\n- 7分：高风险区域80%覆盖\n- 4分：高风险区域50%覆盖\n- 1分：高风险区域未覆盖\n\n评审清单：\n- [ ] 资金相关场景是否深测？\n- [ ] 安全相关场景是否覆盖？\n- [ ] 并发场景是否考虑？\n- [ ] 异常恢复是否验证？\n- [ ] 数据一致性是否验证？\n- [ ] 第三方依赖是否Mock？\n\n发现问题的问法：\n\"这个功能挂了影响多大？\"\n\"高风险区域测试深度够吗？\"\n\n降级模式（无风险清单时）：\n- 基于默认风险类型检查：资金、安全、并发、数据一致性\n- 标注\"建议补充风险清单后重新评审\"\n```\n\n---\n\n## 5. 规范性评审（10分）\n\n**检查项**：格式是否符合标准？\n\n```text\n评分标准：\n- 10分：完全符合标准\n- 7分：大部分符合，少量需调整\n- 4分：格式混乱\n- 1分：无格式\n\n评审清单：\n- [ ] 用例编号是否规范？\n- [ ] 表格格式是否正确？\n- [ ] 字段是否完整？\n- [ ] 描述是否简洁？\n```\n\n---\n\n## 6. 追溯性评审（10分）\n\n**检查项**：需求ID/风险ID是否完整？\n\n```text\n评分标准：\n- 10分：每条用例都有需求ID和风险ID\n- 7分：大部分有，少量缺失\n- 4分：只有部分有\n- 1分：无追溯信息\n\n评审清单：\n- [ ] 每条用例是否关联需求ID？\n- [ ] 每条用例是否关联风险ID？\n- [ ] ID格式是否统一？\n- [ ] 追溯链是否完整？\n\n降级模式（无需求ID列表时）：\n- 跳过此维度\n- 标注\"需补充追溯信息\"\n```\n\n---\n\n## 7. 一致性评审（10分）\n\n**检查项**：用例间是否自相矛盾？\n\n```text\n评分标准：\n- 10分：完全一致，无矛盾\n- 7分：大部分一致，少量需调整\n- 4分：有多处矛盾\n- 1分：严重矛盾\n\n评审清单：\n- [ ] 前置条件和测试步骤是否一致？\n- [ ] 不同用例间是否有冲突？\n- [ ] 业务规则是否统一？\n- [ ] 预期结果是否互斥？\n\n发现问题的问法：\n\"检查这些用例间是否有矛盾\"\n\"前置条件和步骤是否匹配？\"\n```\n\n---\n\n## 8. 冗余度评审（10分）\n\n**检查项**：有没有无价值用例？\n\n```text\n评分标准：\n- 10分：无冗余，每条用例都有价值\n- 7分：少量冗余\n- 4分：有多处冗余\n- 1分：大量冗余\n\n评审清单：\n- [ ] 是否有重复覆盖的场景？\n- [ ] 是否有低价值用例？\n- [ ] 优先级标注是否合理？\n- [ ] 测试效率是否最优？\n\n发现问题的问法：\n\"删除哪些用例不影响覆盖率？\"\n\"哪些用例可以合并？\"\n```\n\nFile v1.8.0:assets/critique-report.md\n\n# 评审报告模板\n\n> 八维评分的详细标准与逐维评审清单见 [`review-dimensions.md`](review-dimensions.md)；\n> 深度挖掘技巧见 [`deep-review-techniques.md`](deep-review-techniques.md)。\n\n## 模式 A：完整评审报告（有场景树 + 风险清单）\n\n```markdown\n# 测试用例评审报告\n\n**评审对象**：测试用例 v1 | **用例总数**：N | **评审日期**：YYYY-MM-DD\n**评审模式**：模式 A（完整八维）\n\n## 一、八维评分\n\n| 维度 | 得分 | 主要问题 | 严重度 |\n|------|------|---------|--------|\n| 完整性 | 8/10 | 异常路径缺\"依赖服务超时\" | 高 |\n| 正确性 | 9/10 | — | — |\n| 可执行性 | 6/10 | 3 条用例步骤写\"按正常流程操作\" | 高 |\n| 风险覆盖 | 7/10 | 支付并发场景未覆盖 | 高 |\n| 规范性 | 9/10 | 编号 TC_LOGIN_002 断号 | 低 |\n| 追溯性 | 8/10 | 2 条用例未关联 REQ- | 中 |\n| 一致性 | 9/10 | — | — |\n| 冗余度 | 8/10 | 4 条用例覆盖点重复 | 低 |\n| **总分** | **64/80** | | |\n\n> 合格线 ≥ 64 分（每维 10 分 × 8 维）。**注意：总分达标不等于没有高严重度问题**——\n> 上表可执行性 6 分已低于 7 分阈值，即使总分够格也必须修改。\n\n## 二、问题清单（按严重度）\n\n| 序号 | 用例 ID | 维度 | 标记 | 问题描述 | 修正建议 |\n|------|--------|------|------|---------|---------|\n| 1 | TC_API_LOGIN_005 | 可执行性 | VAGUE | 步骤\"按正常流程操作\"，无法判断执行了哪条路径 | 补具体 method+path+参数 |\n| 2 | — | 风险覆盖 | MISSING | 支付并发回调场景完全缺失 | 补 RISK-PAY-CONC 对应用例 |\n| 3 | TC_API_LOGIN_002 | 规范性 | WRONG | 编号断号（001→003） | 重排为连续编号 |\n\n**标记含义**：`MISSING`（缺失）/ `WRONG`（错误）/ `VAGUE`（含糊）\n\n## 三、覆盖遗漏\n\n| 遗漏内容 | 来源依据 | 优先级 |\n|---------|---------|--------|\n| 依赖服务超时降级 | 风险评估 RISK-PAY-CONC-002 | 高 |\n| 第三方支付回调验签失败 | 需求 REQ-PAY-003 | 高 |\n\n## 四、改进方向\n\n1. 补 [X] 类异常场景\n2. 将 [Y] 条用例的步骤具体化\n3. 修正编号断号\n\n## 五、评审结论\n\n- [ ] 需重新生成（存在高严重度问题）\n- [ ] 需修改后复审\n- [x] 通过，进入盲区补盲（`qa-ai-blindspot-compensation`）\n```\n\n## 模式 B：简化评审报告（无上游数据）\n\n```markdown\n# 测试用例评审报告（降级模式）\n\n> ⚠️ **降级评审**：缺少场景树/风险清单/需求 ID，本次评审为模式 B——\n> 完整性基于通用场景清单判断、风险覆盖基于默认风险类型判断、**追溯性维度已跳过**。\n> 建议补充上游数据后重新评审。\n\n**评审模式**：模式 B（六维，追溯性跳过）\n| 维度 | 得分 | 主要问题 |\n|------|------|---------|\n| 完整性 | 7/10 | 基于通用清单判断，精度有限 |\n| 正确性 | 9/10 | — |\n| 可执行性 | 6/10 | 步骤含糊 |\n| 风险覆盖 | 6/10 | 基于默认风险类型（资金/安全/并发/数据） |\n| 规范性 | 9/10 | — |\n| 一致性 | 9/10 | — |\n| 冗余度 | 8/10 | — |\n| ~~追溯性~~ | — | **需补充追溯信息后评审** |\n```\n\n## 模式 C：快速评审（需要口头/即时反馈，不出正式报告）\n\n```markdown\n## AI输出评审报告（快速）\n\n### 总体评价\n- 完整性：⭐⭐⭐⭐☆\n- 正确性：⭐⭐⭐⭐☆\n- 可执行性：⭐⭐⭐☆☆\n- 风险覆盖：⭐⭐⭐⭐☆\n- 规范性：⭐⭐⭐⭐⭐\n- 追溯性：⭐⭐⭐⭐☆\n- 一致性：⭐⭐⭐⭐☆\n- 冗余度：⭐⭐⭐⭐☆\n\n### 主要问题\n1. [问题1]：[具体描述]\n2. [问题2]：[具体描述]\n\n### 迭代方向\n优先改进：[最关键的改进点]\n```\n\n> 快速评审**不产出正式报告、不进工作流**。需要留痕、可追溯时用模式 A/B。\n\n---\n\n## 完整工作示例\n\n### 示例 1：模式 A（有场景树 + 风险清单）\n\n**输入**：AI 生成的登录功能用例 + 场景树 + 风险清单\n\n| 维度 | 得分 | 依据 |\n|------|------|------|\n| 完整性 | 7/10 | 场景树 10 个场景，用例覆盖 7 个（70%） |\n| 正确性 | 9/10 | 业务规则描述基本正确 |\n| 可执行性 | 8/10 | 大部分步骤清晰 |\n| **风险覆盖** | **6/10** | 风险清单 3 个高风险，用例只覆盖 1 个 |\n| 规范性 | 9/10 | 格式规范 |\n| 追溯性 | 8/10 | 大部分有需求 ID |\n| 一致性 | 9/10 | 无明显矛盾 |\n| 冗余度 | 9/10 | 无明显冗余 |\n| **总分** | **65/80** | 合格 |\n\n**但风险覆盖 6 分 < 7 分** → 必须修改。总分达标不豁免单维不合格。\n\n**改进方向**：补并发登录、密码暴力破解、Session 超时场景。\n\n### 示例 2：模式 B（无上游数据）\n\n**输入**：AI 生成的登录功能用例（无场景树/风险清单）\n\n| 维度 | 得分 | 依据 |\n|------|------|------|\n| 完整性 | 6/10 | 基于通用场景清单，缺并发与安全场景 |\n| 正确性 | 9/10 | 业务规则正确 |\n| 可执行性 | 8/10 | 步骤清晰 |\n| **风险覆盖** | **5/10** | 未考虑高风险区域 |\n| 规范性 | 9/10 | 格式规范 |\n| 一致性 | 9/10 | 无明显矛盾 |\n| 冗余度 | 9/10 | 无明显冗余 |\n| ~~追溯性~~ | — | **跳过，缺需求 ID 列表** |\n| **总分** | **55/60** | |\n\n**结论**：降级评审通过但精度有限 → **建议补充场景树与风险清单后重新评审**。\n\n---\n\n## 填写要求\n\n| 项 | 要求 | 常见错误 |\n|----|------|---------|\n| 评分 | 每维 10 分制，逐维给分 | 只给总分不分维 |\n| 问题清单 | 关联到具体用例 ID | 只写\"部分用例有问题\" |\n| 标记 | `MISSING`/`WRONG`/`VAGUE` 三选一 | 不标记或自造标记 |\n| 严重度 | 高/中/低，独立于维度得分 | 与分数混用 |\n| 覆盖遗漏 | 给出依据（`RISK-`/`REQ-`/`SC-` ID） | 凭感觉说\"还不够全面\" |\n| 结论 | 三选一且明确 | 写\"总体良好，建议优化\" |\n| 降级标注 | 模式 B 必须显式声明缺什么 | 静默降级 |\n\n## 交付前自检\n\n- [ ] 八维（或六维）逐维评分，低于 7 分的已标问题\n- [ ] 每个问题都关联到具体用例 ID，且有 `MISSING`/`WRONG`/`VAGUE` 标记\n- [ ] 覆盖遗漏都给出了依据 ID\n- [ ] 总分达标但存在高严重度问题时，明确要求修改\n- [ ] 降级模式已显式声明缺哪些上游数据\n- [ ] 评审结论三选一且明确\n\nFile v1.8.0:skill-card.md\n\n## Description:\n\nReviews AI-generated test cases for completeness, correctness, executability, risk coverage, formatting, consistency, traceability, and redundancy, and recommends specific corrections.\n\nThis skill is ready for commercial/non-commercial use.\n\n## Publisher:\n\n[kokxi](https://clawhub.ai/user/kokxi)\n\n### License/Terms of Use:\n\nMIT-0\n\n## Use Case:\n\nQA engineers and developers use this skill to review AI-generated test cases before accepting them, identify missing coverage or unclear steps, and prioritize revisions.\n\n### Deployment Geography for Use:\n\nGlobal\n\n## Known Risks and Mitigations:\n\nRisk: Broad QA review phrases may trigger this review when it is not intended.\n\nMitigation: Confirm the requested review scope and input test cases before applying the gate.\n\nRisk: The optional installation command runs third-party package tooling.\n\nMitigation: Independently verify the package and command before running it.\n\nRisk: Recommendations to merge or remove test cases could discard useful coverage.\n\nMitigation: Back up original test cases and review coverage before making bulk changes.\n\n## Reference(s):\n\n- [ClawHub skill release](https://clawhub.ai/kokxi/skills/qa-ai-output-critique)\n- [Review dimensions and scoring](references/review-dimensions.md)\n- [Deep review techniques](references/deep-review-techniques.md)\n- [Critique report template](assets/critique-report.md)\n\n## Skill Output:\n\n**Output Type(s):** [Markdown, Guidance]\n\n**Output Format:** [Markdown critique report with dimension scores, labeled findings, coverage gaps, improvement actions, and a review decision]\n\n**Output Parameters:** [1D]\n\n**Other Properties Related to Output:** [Findings reference the reviewed test case IDs; documented gaps cite available requirement, scenario, or risk IDs.]\n\n## Skill Version(s):\n\n1.8.0 (source: release metadata and skill frontmatter)\n\n## Ethical Considerations:\n\nUsers should evaluate whether this skill is appropriate for their environment, review any generated or modified files before relying on them, and apply their organization's safety, security, and compliance requirements before deployment.\n\nArchive v1.7.7: 5 files, 10200 bytes\n\nFiles: references/report-templates.md (3881b), references/review-dimensions.md (5484b), skill-card.md (1911b), SKILL.md (12067b), _meta.json (140b)\n\nFile v1.7.7:SKILL.md\n\n---\nname: qa-ai-output-critique\nslug: qa-ai-output-critique\ndisplayName: Ai Output Critique\nversion: 1.7.7\ndescription: >-\n  对AI生成的测试用例进行八维评审（完整性、正确性、可执行性、风险覆盖、规范性、一致性、追溯性、冗余度），是AI生成用例后的第一个质量门禁。当AI刚刚生成了一大批测试用例、你需要确保这些用例真的有价值而不是\"看起来不错\"时，应当使用此技能。不要假设AI输出的都是对的——AI经常生成语义正确但实际操作不了的用例。每个维度评分低于7分的必须标注问题并使用MISSING/WRONG/VAGUE等规范格式标记。无上游场景树/风险清单时降级为六维评审（跳过追溯性、简化完整性）。\n\nwhen_to_use: AI生成用例后自动激活（最终输出前的必过门禁）；用户说\"检查一下输出\"、\"评审用例质量\"、\"验证完整性\"、\"这个用例对吗\"、\"自动检查\"时\nallowed-tools: Read Grep Glob\nrelated_skills:\n  upstream:\n    - qa-ai-prompt-strategy      # 输入：AI生成的测试用例\n    - qa-scenario-tree           # 可选输入：场景树（用于完整性评审）\n    - qa-risk-intuition          # 可选输入：风险清单（用于风险覆盖评审）\n  downstream:\n    - qa-ai-blindspot-compensation # 输出：评审结果传递给补盲\n    - qa-expert-review\n    - qa-output-validation\nreferences:\n  - references/report-templates.md\n  - references/review-dimensions.md\ninput_format:\n  required:\n    - name: AI生成测试用例\n      type: array\n      description: AI生成的测试用例列表\n  optional:\n    - name: 需求文档\n      type: string\n      description: 原始需求描述\n    - name: 评审标准\n      type: object\n      description: 评审维度和标准配置\noutput_format:\n  traceability:\n    - 本技能评审用例，不新增唯一ID；评审问题关联到原用例ID（TC_{模块缩写}_{功能缩写}_{序号}，如 TC_API_LOGIN_001）\n  structure:\n    - 测试用例表格：固定 9 列（用例编号|测试类型|功能模块|测试标题|用例级别|预置条件|测试步骤|预期结果|风险等级）\n    - 用例级别：P0≤20%（核心流程）/ P1≤40%（主要功能）/ P2≤30%（次要功能）/ P3≤10%（边缘场景）\n    - 覆盖率：标注口径（基于现有需求/输入文档），禁止\"全覆盖/100%\"绝对化表述；缺失模块标注\"未覆盖+原因\"\n    - critique_report: 八维评审报告（降级模式为六维）\n    - coverage_gaps: 覆盖遗漏清单\n    - quality_score: 质量评分\n    - improvement_suggestions: 改进建议列表\ndepth_requirement_quantification:\n  reference_value: \"根据用例数量和复杂度调整评审深度：简单x1/中等x2/复杂x3\"\n  minimum: \"至少覆盖功能正确性、边界条件、异常场景3个评审维度\"\ncategories: ['Development','Testing','AI']\nerror_recovery_guidance:\n  on_failure: \"评审发现系统性问题时回退到AI生成步骤修正\"\n  retry_behavior: \"修正提示词或上下文后重新生成并评审\"\n---\n> **⚠️ 安全警告**：本技能的示例可能涉及测试用例整理、合并或删除建议。\n> 实际使用时请勿直接执行批量删除操作，先备份原数据并确认非关键用例。\n> 本技能仅在 workspace/ 输出评估文件，不持久化、不外传、不跨会话复用。\n\n# AI 输出评审\n\n## 使用逻辑\n\n本技能分为四个阶段，按顺序执行：\n\n```text\n阶段一：评审框架（八维评审法）\n    │\n    │  使用八维评审法对AI输出进行系统打分\n    │  输出：评审报告（评分 + 问题清单）\n    │\n    ▼\n阶段二：报告模板（输出格式）\n    │\n    │  按标准格式输出评审结果\n    │  输出：结构化评审报告\n    │\n    ▼\n阶段三：追问问法（深入挖掘）\n    │\n    │  使用追问技巧引导发现问题\n    │  输出：更深层的质量洞察\n    │\n    ▼\n阶段四：辅助工具（假设挖掘/反驳机制/投入产出评估）\n    │\n    │  补充评审维度，提升评审深度\n    │  输出：完整评审结论\n```\n\n**关键点**：阶段三的\"追问问法\"是在评审报告输出后使用的，用于引导发现更深层的问题，不是独立的评审体系。\n\n## 输入要求\n\n### 必填输入\n- AI生成的测试用例\n\n### 推荐输入（提供则评审更准确）\n- 场景树（来自qa-scenario-tree）：用于完整性评审，判断场景覆盖率\n- 风险清单（来自qa-risk-intuition）：用于风险覆盖评审，判断高风险区域是否深测\n- 需求ID列表：用于追溯性评审，判断用例是否可追溯\n\n### 降级策略\n如果缺少推荐输入：\n\n| 缺少的输入 | 评审策略 | 降级处理 |\n|-----------|----------|----------|\n| 场景树 | 完整性评审 | 基于通用场景清单（主流程/分支/异常/边界） |\n| 风险清单 | 风险覆盖评审 | 基于默认风险类型（资金/安全/并发/数据一致性） |\n| 需求ID列表 | 追溯性评审 | 跳过，标记为\"需补充追溯信息\" |\n\n## 评审模式\n\n### 模式A：完整评审（有场景树和风险清单）\n- 八维评审全部启用\n- 输出完整评审报告\n- 适用场景：工作流中的标准评审\n\n### 模式B：快速评审（无上游数据）\n- 启用六维评审（跳过追溯性，简化完整性）\n- 输出简化评审报告\n- 标注\"建议补充场景树后重新评审\"\n- 适用场景：独立使用、快速检查\n\n### 模式选择规则\n```text\n有场景树 AND 有风险清单 → 模式A（完整评审）\n否则 → 模式B（快速评审）\n```\n\n## 核心原则\n\nAI输出看起来都对，但专家能看出哪里不够。\n\n## 八维评审法速查\n\n**评分标准**：每维度10分，总分≥64分为合格。详见 [`references/review-dimensions.md`](references/review-dimensions.md)。\n\n| 维度 | 评分核心 | 核心关注 |\n|------|---------|---------|\n| 完整性 | 场景覆盖是否完整 | 主路径+分支+异常+边界 |\n| 正确性 | 业务规则和预期是否正确 | 内容正确性 |\n| 可执行性 | 步骤是否清晰可执行 | 可操作性 |\n| 风险覆盖 | 高风险区域是否深测 | 资金/安全/并发/数据 |\n| 规范性 | 格式是否符合标准 | 编号/表格/字段 |\n| 追溯性 | 需求/风险ID是否完整 | 需求追溯链 |\n| 一致性 | 用例间是否自相矛盾 | 前置与步骤匹配 |\n| 冗余度 | 是否有无价值用例 | 重复/低价值用例 |\n\n> 每维度的详细评分标准、评审清单和追问问法参见 [`references/review-dimensions.md`](references/review-dimensions.md)。\n\n## 中文/国产模型特有评审点\n\n国产模型（DeepSeek/通义/文心/豆包等）输出除八维通用评审外，需额外检查以下特有风险：\n\n| 评审点 | 典型表现 | 处理 |\n|--------|---------|------|\n| **中文语义漂移** | 用例标题与步骤语义不一致（如标题\"验证登录\"步骤却在测注册） | 用\"步骤是否支撑标题\"反向核查，漂移即降分 |\n| **数字/单位幻觉** | 超时值、并发数、金额单位凭空编造（如\"P95<100ms\"无依据） | 核对来源，无依据标注\"MISSING：需基准数据\" |\n| **政策/合规表述** | 用例预期结果含不合规表述（如支付、个人信息处理） | 标注合规风险，提示对照监管要求 |\n| **格式不稳定** | 表格列错位、编号断号（TC_001→TC_003）、中文标点混入 | 按规范性维度检查编号连续性 |\n| **过度泛化** | 用例写得\"像测试指南\"而非\"可执行用例\"（步骤不可操作） | 按可执行性维度扣分，要求补具体步骤 |\n| **伪正确性** | 预期结果\"返回正确\"但未定义什么算正确 | 要求预期结果可验证（具体状态码/字段值） |\n\n**评审动作**：发现上述任一问题，按对应八维维度降分，并输出规范格式标记（MISSING/WRONG/VAGUE）+ 修正建议。\n\n## 评审报告模板\n\n详见 [`references/report-templates.md`](references/report-templates.md)，包含三种模板：\n- **完整评审报告（模式A）**：八维评分 + 问题清单 + 改进方向\n- **简化评审报告（模式B）**：六维评分 + 降级标注\n- **快速评审模板**：星级评价 + 主要问题 + 迭代方向\n\n## 假设挖掘\n\nAI输出中常见的隐含假设：\n\n| 假设类型 | 示例 | 验证方法 |\n|---------|------|---------|\n| 用户行为假设 | \"用户会正常输入\" | 追问：用户误输入怎么办？ |\n| 环境假设 | \"网络正常\" | 追问：网络异常时会怎样？ |\n| 数据假设 | \"数据格式正确\" | 追问：格式错误时怎么处理？ |\n| 时序假设 | \"操作按顺序执行\" | 追问：乱序执行会怎样？ |\n| 依赖假设 | \"第三方服务正常\" | 追问：第三方挂了怎么办？ |\n\n**挖掘问法**：\n```text\n请列出你在输出中做的所有假设\n哪些假设可能不成立？\n如果假设不成立，测试场景会有什么变化？\n```\n\n## 迭代决策树\n\n当AI输出不满意时：\n\n```text\n输出不满意\n    │\n    ├── 完整性不够？\n    │       └── 补充场景：请补充[缺失的场景类型]\n    │\n    ├── 深度不够？\n    │       └── 深入分析：请按[具体维度]深入分析\n    │\n    ├── 风险覆盖不足？\n    │       └── 重点强化：请对[高风险区域]做专项测试\n    │\n    ├── 有矛盾？\n    │       └── 修正一致性：请修正[具体矛盾点]\n    │\n    ├── 冗余过多？\n    │       └── 精简用例：请合并或删除[低价值用例]\n    │\n    └── 不可执行？\n            └── 调整可行性：请确保[测试步骤]可实际执行\n```\n\n## AI反驳机制\n\n让AI挑战你的假设，而不是迎合你。\n\n### 反驳问法模板\n\n```text\n模式1：质量负责人视角\n\"请站在质量负责人角度，指出可能遗漏的业务风险、过度测试的地方，\n以及上线前还需要确认的问题。\"\n\n模式2：故障反推视角\n\"请假设这个功能上线后出现严重问题，反推我现在的测试方案\n可能漏掉了什么。\"\n\n模式3：资源约束视角\n\"测试资源有限，请评估这些用例的投入产出比，\n哪些是必须测的，哪些可以简化或跳过。\"\n\n模式4：竞品对比视角\n\"如果竞争对手的同类功能比我们更稳定，可能是因为\n他们多测了哪些我们没覆盖的场景？\"\n```\n\n### 反驳检查清单\n\n- [ ] 是否要求AI挑战你的假设？\n- [ ] 是否让AI从反面看问题？\n- [ ] 是否评估了投入产出比？\n- [ ] 是否识别了过度测试的区域？\n\n## 投入产出评估\n\n### 评估维度\n\n| 维度 | 评估标准 | 权重 |\n|------|---------|------|\n| 业务价值 | 影响用户数×影响程度 | 40% |\n| 风险等级 | 发生概率×影响程度 | 30% |\n| 测试成本 | 用例数×执行时间 | 20% |\n| 自动化潜力 | 是否适合自动化 | 10% |\n\n### 评估矩阵\n\n| 用例类型 | 业务价值 | 风险等级 | 测试成本 | 建议 |\n|---------|---------|---------|---------|------|\n| P0+高风险 | 高 | 高 | 中 | 必须测试，优先自动化 |\n| P0+低风险 | 高 | 低 | 低 | 必须测试，手动即可 |\n| P1+高风险 | 中 | 高 | 中 | 必须测试，考虑自动化 |\n| P1+低风险 | 中 | 低 | 低 | 选择性测试 |\n| P2+高风险 | 低 | 高 | 中 | 评估后决定 |\n| P2+低风险 | 低 | 低 | 低 | 可跳过或简化 |\n\n### ROI计算公式\n\n```text\nROI = (业务价值 × 风险等级) / 测试成本\n\n示例：\n用例A：业务价值=5, 风险等级=5, 测试成本=2\nROI = (5×5)/2 = 12.5 → 高ROI，优先测试\n\n用例B：业务价值=2, 风险等级=2, 测试成本=5\nROI = (2×2)/5 = 0.8 → 低ROI，可简化\n```\n\n## 检查清单\n\n评审完成后检查：\n\n- [ ] 是否识别了AI的隐含假设？\n- [ ] 是否评估了覆盖完整性？\n- [ ] 是否检查了一致性？\n- [ ] 是否评估了冗余度？\n- [ ] 是否有明确的迭代方向？\n- [ ] 评审报告是否可执行？\n- [ ] 是否标注了降级模式（如适用）？\n\nFile v1.7.7:_meta.json\n\n{\n  \"ownerId\": \"kn71y9b23csfx0ykgm55d5m9x5891zt8\",\n  \"slug\": \"qa-ai-output-critique\",\n  \"version\": \"1.7.7\",\n  \"publishedAt\": 1790519497414\n}\n\nFile v1.7.7:references/report-templates.md\n\n# 评审报告模板与输出示例\n\n> 本文档是 `qa-ai-output-critique` 的参考文件。执行评审时，按以下模板组织评审输出。\n\n---\n\n## 完整评审报告（模式A — 有场景树和风险清单）\n\n```markdown\n## AI输出评审报告\n\n### 评审摘要\n- 评审日期：YYYY-MM-DD\n- 评审模式：完整评审\n- 用例总数：XX条\n- 综合评分：XX/80分\n\n### 八维评分\n| 维度 | 分数 | 评价 | 改进建议 |\n|------|------|------|---------|\n| 完整性 | X/10 | [评价] | [建议] |\n| 正确性 | X/10 | [评价] | [建议] |\n| 可执行性 | X/10 | [评价] | [建议] |\n| 风险覆盖 | X/10 | [评价] | [建议] |\n| 规范性 | X/10 | [评价] | [建议] |\n| 追溯性 | X/10 | [评价] | [建议] |\n| 一致性 | X/10 | [评价] | [建议] |\n| 冗余度 | X/10 | [评价] | [建议] |\n\n### 问题清单\n| 用例编号 | 问题类型 | 问题描述 | 改进建议 |\n|---------|---------|---------|---------|\n| TC_XXX_001 | [类型] | [描述] | [建议] |\n\n### 改进方向\n1. [改进方向1]\n2. [改进方向2]\n3. [改进方向3]\n```\n\n---\n\n## 简化评审报告（模式B — 无上游数据）\n\n```markdown\n## AI输出评审报告\n\n### 评审摘要\n- 评审日期：YYYY-MM-DD\n- 评审模式：快速评审\n- 用例总数：XX条\n- 综合评分：XX/60分（跳过追溯性）\n- 建议：补充场景树和风险清单后重新评审\n\n### 六维评分\n| 维度 | 分数 | 评价 | 改进建议 |\n|------|------|------|---------|\n| 完整性 | X/10 | [评价] | [建议] |\n| 正确性 | X/10 | [评价] | [建议] |\n| 可执行性 | X/10 | [评价] | [建议] |\n| 风险覆盖 | X/10 | [评价] | [建议] |\n| 规范性 | X/10 | [评价] | [建议] |\n| 一致性 | X/10 | [评价] | [建议] |\n| 冗余度 | X/10 | [评价] | [建议] |\n\n### 问题清单\n| 用例编号 | 问题类型 | 问题描述 | 改进建议 |\n|---------|---------|---------|---------|\n| TC_XXX_001 | [类型] | [描述] | [建议] |\n\n### 改进方向\n1. [改进方向1]\n2. [改进方向2]\n3. [改进方向3]\n```\n\n---\n\n## 快速评审模板\n\n适用于快速输出评价场景，不使用完整表格：\n\n```markdown\n## AI输出评审报告\n\n### 总体评价\n- 完整性：⭐⭐⭐⭐☆\n- 正确性：⭐⭐⭐⭐☆\n- 可执行性：⭐⭐⭐☆☆\n- 风险覆盖：⭐⭐⭐⭐☆\n- 规范性：⭐⭐⭐⭐⭐\n- 追溯性：⭐⭐⭐⭐☆\n- 一致性：⭐⭐⭐⭐☆\n- 冗余度：⭐⭐⭐⭐☆\n\n### 主要问题\n1. [问题1]：[具体描述]\n2. [问题2]：[具体描述]\n\n### 改进建议\n1. [建议1]：[具体方向]\n2. [建议2]：[具体方向]\n\n### 迭代方向\n优先改进：[最关键的改进点]\n```\n\n---\n\n## 输出示例\n\n### 示例1：完整评审（有场景树）\n\n**输入**：AI生成的登录功能测试用例 + 场景树 + 风险清单\n\n**八维评审结果**：\n- 完整性7分：场景树显示10个场景，用例覆盖7个（70%）\n- 正确性9分：业务规则描述基本正确\n- 可执行性8分：大部分步骤清晰\n- 风险覆盖6分：风险清单显示3个高风险，用例覆盖1个\n- 规范性9分：格式规范\n- 追溯性8分：大部分有需求ID\n- 一致性9分：无明显矛盾\n- 冗余度9分：无明显冗余\n\n**综合评分**：65/80分（合格）\n\n**改进方向**：补充并发登录、密码暴力破解、Session超时场景\n\n### 示例2：快速评审（无上游数据）\n\n**输入**：AI生成的登录功能测试用例（无场景树和风险清单）\n\n**六维评审结果**：\n- 完整性6分：基于通用场景清单，缺少并发和安全场景\n- 正确性9分：业务规则描述正确\n- 可执行性8分：步骤清晰\n- 风险覆盖5分：未考虑高风险区域\n- 规范性9分：格式规范\n- 一致性9分：无明显矛盾\n- 冗余度9分：无明显冗余\n\n**综合评分**：55/60分（合格，但建议补充）\n\n**建议**：补充场景树和风险清单后重新评审\n\nFile v1.7.7:references/review-dimensions.md\n\n# 八维评审法 — 完整评审维度与评分标准\n\n> 本文档是 `qa-ai-output-critique` 的参考文件。执行评审时，按以下八维评分标准逐项打分。\n> 每维度 10 分，总分 ≥ 64 分为合格。\n\n---\n\n## 评分总览\n\n| 维度 | 评分核心 | 默认权重 |\n|------|---------|---------|\n| 完整性 | 场景覆盖是否完整 | 10分 |\n| 正确性 | 业务规则和预期是否正确 | 10分 |\n| 可执行性 | 步骤是否清晰可执行 | 10分 |\n| 风险覆盖 | 高风险区域是否深测 | 10分 |\n| 规范性 | 格式是否符合标准 | 10分 |\n| 追溯性 | 需求ID/风险ID是否完整 | 10分 |\n| 一致性 | 用例间是否自相矛盾 | 10分 |\n| 冗余度 | 是否有无价值用例 | 10分 |\n\n---\n\n## 1. 完整性评审（10分）\n\n**检查项**：是否覆盖了所有场景？\n\n```text\n评分标准：\n- 10分：覆盖所有主路径+分支+异常+边界（基于场景树）\n- 7分：覆盖主路径和主要异常\n- 4分：只覆盖主路径\n- 1分：严重缺失\n\n评审清单：\n- [ ] 主路径场景是否完整？\n- [ ] 分支路径是否覆盖？\n- [ ] 异常场景是否考虑？\n- [ ] 边界条件是否分析？\n- [ ] 非功能需求是否涉及？\n\n发现问题的问法：\n\"请列出你输出中未覆盖的场景类型\"\n\"对照场景树，检查覆盖率\"\n\"请按四维边界模型重新分析\"\n\"这个边界真的够深吗？\"\n\n降级模式（无场景树时）：\n- 基于通用场景清单检查：主流程、分支、异常、边界、非功能\n- 标注\"建议补充场景树后重新评审\"\n```\n\n---\n\n## 2. 正确性评审（10分）\n\n**检查项**：业务规则和预期结果是否正确？\n\n```text\n核心关注：对不对（内容正确性）\n\n评分标准：\n- 10分：业务规则正确、预期可验证\n- 7分：大部分正确，少量细节需调整\n- 4分：有多处错误\n- 1分：严重错误\n\n评审清单：\n- [ ] 业务规则描述是否符合需求？\n- [ ] 预期结果是否与实际系统行为一致？\n- [ ] 数据计算逻辑是否正确？\n- [ ] 状态转换描述是否准确？\n\n发现问题的问法：\n\"这个预期结果与实际系统行为一致吗？\"\n\"业务规则描述是否准确？\"\n\"这个状态转换逻辑对吗？\"\n```\n\n---\n\n## 3. 可执行性评审（10分）\n\n**检查项**：能不能实际执行？\n\n```text\n核心关注：能不能做（可操作性）\n\n评分标准：\n- 10分：步骤清晰、无歧义、可执行\n- 7分：大部分清晰，少量需补充\n- 4分：有多处模糊\n- 1分：无法执行\n\n评审清单：\n- [ ] 测试数据是否可构造？\n- [ ] 测试环境是否可搭建？\n- [ ] 测试步骤是否可重复？\n- [ ] 预期结果是否可观测？\n\n发现问题的问法：\n\"这个用例能实际执行吗？\"\n\"测试数据从哪来？\"\n\"测试环境怎么搭建？\"\n```\n\n---\n\n## 4. 风险覆盖评审（10分）\n\n**检查项**：高风险区域是否深测？\n\n```text\n评分标准：\n- 10分：高风险区域100%覆盖（基于风险清单）\n- 7分：高风险区域80%覆盖\n- 4分：高风险区域50%覆盖\n- 1分：高风险区域未覆盖\n\n评审清单：\n- [ ] 资金相关场景是否深测？\n- [ ] 安全相关场景是否覆盖？\n- [ ] 并发场景是否考虑？\n- [ ] 异常恢复是否验证？\n- [ ] 数据一致性是否验证？\n- [ ] 第三方依赖是否Mock？\n\n发现问题的问法：\n\"这个功能挂了影响多大？\"\n\"高风险区域测试深度够吗？\"\n\n降级模式（无风险清单时）：\n- 基于默认风险类型检查：资金、安全、并发、数据一致性\n- 标注\"建议补充风险清单后重新评审\"\n```\n\n---\n\n## 5. 规范性评审（10分）\n\n**检查项**：格式是否符合标准？\n\n```text\n评分标准：\n- 10分：完全符合标准\n- 7分：大部分符合，少量需调整\n- 4分：格式混乱\n- 1分：无格式\n\n评审清单：\n- [ ] 用例编号是否规范？\n- [ ] 表格格式是否正确？\n- [ ] 字段是否完整？\n- [ ] 描述是否简洁？\n```\n\n---\n\n## 6. 追溯性评审（10分）\n\n**检查项**：需求ID/风险ID是否完整？\n\n```text\n评分标准：\n- 10分：每条用例都有需求ID和风险ID\n- 7分：大部分有，少量缺失\n- 4分：只有部分有\n- 1分：无追溯信息\n\n评审清单：\n- [ ] 每条用例是否关联需求ID？\n- [ ] 每条用例是否关联风险ID？\n- [ ] ID格式是否统一？\n- [ ] 追溯链是否完整？\n\n降级模式（无需求ID列表时）：\n- 跳过此维度\n- 标注\"需补充追溯信息\"\n```\n\n---\n\n## 7. 一致性评审（10分）\n\n**检查项**：用例间是否自相矛盾？\n\n```text\n评分标准：\n- 10分：完全一致，无矛盾\n- 7分：大部分一致，少量需调整\n- 4分：有多处矛盾\n- 1分：严重矛盾\n\n评审清单：\n- [ ] 前置条件和测试步骤是否一致？\n- [ ] 不同用例间是否有冲突？\n- [ ] 业务规则是否统一？\n- [ ] 预期结果是否互斥？\n\n发现问题的问法：\n\"检查这些用例间是否有矛盾\"\n\"前置条件和步骤是否匹配？\"\n```\n\n---\n\n## 8. 冗余度评审（10分）\n\n**检查项**：有没有无价值用例？\n\n```text\n评分标准：\n- 10分：无冗余，每条用例都有价值\n- 7分：少量冗余\n- 4分：有多处冗余\n- 1分：大量冗余\n\n评审清单：\n- [ ] 是否有重复覆盖的场景？\n- [ ] 是否有低价值用例？\n- [ ] 优先级标注是否合理？\n- [ ] 测试效率是否最优？\n\n发现问题的问法：\n\"删除哪些用例不影响覆盖率？\"\n\"哪些用例可以合并？\"\n```\n\nFile v1.7.7:skill-card.md\n\n## Description:\n\nReviews AI-generated test cases for coverage, correctness, executability, risk, consistency, traceability, formatting, and redundancy.\n\nThis skill is ready for commercial/non-commercial use.\n\n## Publisher:\n\n[kokxi](https://clawhub.ai/user/kokxi)\n\n### License/Terms of Use:\n\nMIT-0\n\n## Use Case:\n\nQA engineers and developers use this skill to critique AI-generated test cases, identify coverage gaps and unclear steps, and prioritize revisions before using the cases.\n\n### Deployment Geography for Use:\n\nGlobal\n\n## Known Risks and Mitigations:\n\nRisk: Broad activation wording may prompt a review outside the intended test-case context.\n\nMitigation: Invoke it explicitly for AI-generated test cases and confirm that the cases and requirements are in scope.\n\nRisk: Merge or deletion suggestions could remove valuable test coverage if followed automatically.\n\nMitigation: Treat these suggestions as review proposals; back up existing cases and confirm coverage before making changes.\n\n## Reference(s):\n\n- [ClawHub skill listing](https://clawhub.ai/kokxi/skills/qa-ai-output-critique)\n- [Review dimensions and scoring](references/review-dimensions.md)\n- [Review report templates](references/report-templates.md)\n\n## Skill Output:\n\n**Output Type(s):** [Analysis, Markdown, Guidance]\n\n**Output Format:** [Structured Markdown review report with scores, issue list, and improvement suggestions]\n\n**Output Parameters:** [1D]\n\n**Other Properties Related to Output:** [Eight-dimension review with scenario and risk inputs; a reduced review is available without them.]\n\n## Skill Version(s):\n\n1.7.7 (source: frontmatter and release evidence)\n\n## Ethical Considerations:\n\nUsers should evaluate whether this skill is appropriate for their environment, review any generated or modified files before relying on them, and apply their organization's safety, security, and compliance requirements before deployment.\n\nArchive v1.7.6: 5 files, 10445 bytes\n\nFiles: references/report-templates.md (3881b), references/review-dimensions.md (5484b), skill-card.md (1954b), SKILL.md (12658b), _meta.json (140b)\n\nFile v1.7.6:SKILL.md\n\n---\r\nname: qa-ai-output-critique\r\nslug: qa-ai-output-critique\r\ndisplayName: AI 测试输出评审\r\nversion: 1.7.5\r\ndescription: >-\r\n  对AI生成的测试用例进行八维评审（完整性、正确性、可执行性、风险覆盖、规范性、一致性、追溯性、冗余度），是AI生成用例后的第一个质量门禁。当AI刚刚生成了一大批测试用例、你需要确保这些用例真的有价值而不是\"看起来不错\"时，应当使用此技能。不要假设AI输出的都是对的——AI经常生成语义正确但实际操作不了的用例。每个维度评分低于7分的必须标注问题并使用MISSING/WRONG/VAGUE等规范格式标记。无上游场景树/风险清单时降级为六维评审（跳过追溯性、简化完整性）。\r\n  本技能属于 QA Test Skills 技能集（49 个技能之一），完整工作流体验需安装全套：npx skills add Kokxi/qa-test-skills\r\n\r\nwhen_to_use: AI生成用例后自动激活（最终输出前的必过门禁）；用户说\"检查一下输出\"、\"评审用例质量\"、\"验证完整性\"、\"这个用例对吗\"、\"自动检查\"时\r\nallowed-tools: Read Grep Glob\r\nrelated_skills:\r\n  upstream:\r\n    - qa-ai-prompt-strategy      # 输入：AI生成的测试用例\r\n    - qa-scenario-tree           # 可选输入：场景树（用于完整性评审）\r\n    - qa-risk-intuition          # 可选输入：风险清单（用于风险覆盖评审）\r\n  downstream:\r\n    - qa-ai-blindspot-compensation # 输出：评审结果传递给补盲\r\n    - qa-expert-review\r\n    - qa-output-validation\r\nreferences:\r\n  - references/report-templates.md\r\n  - references/review-dimensions.md\r\ninput_format:\r\n  required:\r\n    - name: AI生成测试用例\r\n      type: array\r\n      description: AI生成的测试用例列表\r\n  optional:\r\n    - name: 需求文档\r\n      type: string\r\n      description: 原始需求描述\r\n    - name: 评审标准\r\n      type: object\r\n      description: 评审维度和标准配置\r\noutput_format:\r\n  traceability:\r\n    - 本技能评审用例，不新增唯一ID；评审问题关联到原用例ID（TC_{模块缩写}_{功能缩写}_{序号}，如 TC_API_LOGIN_001）\r\n  structure:\r\n    - 测试用例表格：固定 9 列（用例编号|测试类型|功能模块|测试标题|用例级别|预置条件|测试步骤|预期结果|风险等级）\r\n    - 用例级别：P0≤20%（核心流程）/ P1≤40%（主要功能）/ P2≤30%（次要功能）/ P3≤10%（边缘场景）\r\n    - 覆盖率：标注口径（基于现有需求/输入文档），禁止\"全覆盖/100%\"绝对化表述；缺失模块标注\"未覆盖+原因\"\r\n    - critique_report: 八维评审报告（降级模式为六维）\r\n    - coverage_gaps: 覆盖遗漏清单\r\n    - quality_score: 质量评分\r\n    - improvement_suggestions: 改进建议列表\r\ndepth_requirement_quantification:\r\n  reference_value: \"根据用例数量和复杂度调整评审深度：简单x1/中等x2/复杂x3\"\r\n  minimum: \"至少覆盖功能正确性、边界条件、异常场景3个评审维度\"\r\ncategories: ['Development','Testing','AI']\r\nerror_recovery_guidance:\r\n  on_failure: \"评审发现系统性问题时回退到AI生成步骤修正\"\r\n  retry_behavior: \"修正提示词或上下文后重新生成并评审\"\r\n---\r\n> ⚠️ 本技能单独使用效果有限，建议配合完整技能集（12 步工作流）使用。安装：npx skills add Kokxi/qa-test-skills\r\n\r\n> **⚠️ 安全警告**：本技能的示例可能涉及测试用例整理、合并或删除建议。\r\n> 实际使用时请勿直接执行批量删除操作，先备份原数据并确认非关键用例。\r\n> 本技能仅在 workspace/ 输出评估文件，不持久化、不外传、不跨会话复用。\r\n\r\n# AI 输出评审\r\n\r\n## 使用逻辑\r\n\r\n本技能分为四个阶段，按顺序执行：\r\n\r\n```text\r\n阶段一：评审框架（八维评审法）\r\n    │\r\n    │  使用八维评审法对AI输出进行系统打分\r\n    │  输出：评审报告（评分 + 问题清单）\r\n    │\r\n    ▼\r\n阶段二：报告模板（输出格式）\r\n    │\r\n    │  按标准格式输出评审结果\r\n    │  输出：结构化评审报告\r\n    │\r\n    ▼\r\n阶段三：追问问法（深入挖掘）\r\n    │\r\n    │  使用追问技巧引导发现问题\r\n    │  输出：更深层的质量洞察\r\n    │\r\n    ▼\r\n阶段四：辅助工具（假设挖掘/反驳机制/投入产出评估）\r\n    │\r\n    │  补充评审维度，提升评审深度\r\n    │  输出：完整评审结论\r\n```\r\n\r\n**关键点**：阶段三的\"追问问法\"是在评审报告输出后使用的，用于引导发现更深层的问题，不是独立的评审体系。\r\n\r\n## 输入要求\r\n\r\n### 必填输入\r\n- AI生成的测试用例\r\n\r\n### 推荐输入（提供则评审更准确）\r\n- 场景树（来自qa-scenario-tree）：用于完整性评审，判断场景覆盖率\r\n- 风险清单（来自qa-risk-intuition）：用于风险覆盖评审，判断高风险区域是否深测\r\n- 需求ID列表：用于追溯性评审，判断用例是否可追溯\r\n\r\n### 降级策略\r\n如果缺少推荐输入：\r\n\r\n| 缺少的输入 | 评审策略 | 降级处理 |\r\n|-----------|----------|----------|\r\n| 场景树 | 完整性评审 | 基于通用场景清单（主流程/分支/异常/边界） |\r\n| 风险清单 | 风险覆盖评审 | 基于默认风险类型（资金/安全/并发/数据一致性） |\r\n| 需求ID列表 | 追溯性评审 | 跳过，标记为\"需补充追溯信息\" |\r\n\r\n## 评审模式\r\n\r\n### 模式A：完整评审（有场景树和风险清单）\r\n- 八维评审全部启用\r\n- 输出完整评审报告\r\n- 适用场景：工作流中的标准评审\r\n\r\n### 模式B：快速评审（无上游数据）\r\n- 启用六维评审（跳过追溯性，简化完整性）\r\n- 输出简化评审报告\r\n- 标注\"建议补充场景树后重新评审\"\r\n- 适用场景：独立使用、快速检查\r\n\r\n### 模式选择规则\r\n```text\r\n有场景树 AND 有风险清单 → 模式A（完整评审）\r\n否则 → 模式B（快速评审）\r\n```\r\n\r\n## 核心原则\r\n\r\nAI输出看起来都对，但专家能看出哪里不够。\r\n\r\n## 八维评审法速查\r\n\r\n**评分标准**：每维度10分，总分≥64分为合格。详见 [`references/review-dimensions.md`](references/review-dimensions.md)。\r\n\r\n| 维度 | 评分核心 | 核心关注 |\r\n|------|---------|---------|\r\n| 完整性 | 场景覆盖是否完整 | 主路径+分支+异常+边界 |\r\n| 正确性 | 业务规则和预期是否正确 | 内容正确性 |\r\n| 可执行性 | 步骤是否清晰可执行 | 可操作性 |\r\n| 风险覆盖 | 高风险区域是否深测 | 资金/安全/并发/数据 |\r\n| 规范性 | 格式是否符合标准 | 编号/表格/字段 |\r\n| 追溯性 | 需求/风险ID是否完整 | 需求追溯链 |\r\n| 一致性 | 用例间是否自相矛盾 | 前置与步骤匹配 |\r\n| 冗余度 | 是否有无价值用例 | 重复/低价值用例 |\r\n\r\n> 每维度的详细评分标准、评审清单和追问问法参见 [`references/review-dimensions.md`](references/review-dimensions.md)。\r\n\r\n## 中文/国产模型特有评审点\r\n\r\n国产模型（DeepSeek/通义/文心/豆包等）输出除八维通用评审外，需额外检查以下特有风险：\r\n\r\n| 评审点 | 典型表现 | 处理 |\r\n|--------|---------|------|\r\n| **中文语义漂移** | 用例标题与步骤语义不一致（如标题\"验证登录\"步骤却在测注册） | 用\"步骤是否支撑标题\"反向核查，漂移即降分 |\r\n| **数字/单位幻觉** | 超时值、并发数、金额单位凭空编造（如\"P95<100ms\"无依据） | 核对来源，无依据标注\"MISSING：需基准数据\" |\r\n| **政策/合规表述** | 用例预期结果含不合规表述（如支付、个人信息处理） | 标注合规风险，提示对照监管要求 |\r\n| **格式不稳定** | 表格列错位、编号断号（TC_001→TC_003）、中文标点混入 | 按规范性维度检查编号连续性 |\r\n| **过度泛化** | 用例写得\"像测试指南\"而非\"可执行用例\"（步骤不可操作） | 按可执行性维度扣分，要求补具体步骤 |\r\n| **伪正确性** | 预期结果\"返回正确\"但未定义什么算正确 | 要求预期结果可验证（具体状态码/字段值） |\r\n\r\n**评审动作**：发现上述任一问题，按对应八维维度降分，并输出规范格式标记（MISSING/WRONG/VAGUE）+ 修正建议。\r\n\r\n## 评审报告模板\r\n\r\n详见 [`references/report-templates.md`](references/report-templates.md)，包含三种模板：\r\n- **完整评审报告（模式A）**：八维评分 + 问题清单 + 改进方向\r\n- **简化评审报告（模式B）**：六维评分 + 降级标注\r\n- **快速评审模板**：星级评价 + 主要问题 + 迭代方向\r\n\r\n## 假设挖掘\r\n\r\nAI输出中常见的隐含假设：\r\n\r\n| 假设类型 | 示例 | 验证方法 |\r\n|---------|------|---------|\r\n| 用户行为假设 | \"用户会正常输入\" | 追问：用户误输入怎么办？ |\r\n| 环境假设 | \"网络正常\" | 追问：网络异常时会怎样？ |\r\n| 数据假设 | \"数据格式正确\" | 追问：格式错误时怎么处理？ |\r\n| 时序假设 | \"操作按顺序执行\" | 追问：乱序执行会怎样？ |\r\n| 依赖假设 | \"第三方服务正常\" | 追问：第三方挂了怎么办？ |\r\n\r\n**挖掘问法**：\r\n```text\r\n请列出你在输出中做的所有假设\r\n哪些假设可能不成立？\r\n如果假设不成立，测试场景会有什么变化？\r\n```\r\n\r\n## 迭代决策树\r\n\r\n当AI输出不满意时：\r\n\r\n```text\r\n输出不满意\r\n    │\r\n    ├── 完整性不够？\r\n    │       └── 补充场景：请补充[缺失的场景类型]\r\n    │\r\n    ├── 深度不够？\r\n    │       └── 深入分析：请按[具体维度]深入分析\r\n    │\r\n    ├── 风险覆盖不足？\r\n    │       └── 重点强化：请对[高风险区域]做专项测试\r\n    │\r\n    ├── 有矛盾？\r\n    │       └── 修正一致性：请修正[具体矛盾点]\r\n    │\r\n    ├── 冗余过多？\r\n    │       └── 精简用例：请合并或删除[低价值用例]\r\n    │\r\n    └── 不可执行？\r\n            └── 调整可行性：请确保[测试步骤]可实际执行\r\n```\r\n\r\n## AI反驳机制\r\n\r\n让AI挑战你的假设，而不是迎合你。\r\n\r\n### 反驳问法模板\r\n\r\n```text\r\n模式1：质量负责人视角\r\n\"请站在质量负责人角度，指出可能遗漏的业务风险、过度测试的地方，\r\n以及上线前还需要确认的问题。\"\r\n\r\n模式2：故障反推视角\r\n\"请假设这个功能上线后出现严重问题，反推我现在的测试方案\r\n可能漏掉了什么。\"\r\n\r\n模式3：资源约束视角\r\n\"测试资源有限，请评估这些用例的投入产出比，\r\n哪些是必须测的，哪些可以简化或跳过。\"\r\n\r\n模式4：竞品对比视角\r\n\"如果竞争对手的同类功能比我们更稳定，可能是因为\r\n他们多测了哪些我们没覆盖的场景？\"\r\n```\r\n\r\n### 反驳检查清单\r\n\r\n- [ ] 是否要求AI挑战你的假设？\r\n- [ ] 是否让AI从反面看问题？\r\n- [ ] 是否评估了投入产出比？\r\n- [ ] 是否识别了过度测试的区域？\r\n\r\n## 投入产出评估\r\n\r\n### 评估维度\r\n\r\n| 维度 | 评估标准 | 权重 |\r\n|------|---------|------|\r\n| 业务价值 | 影响用户数×影响程度 | 40% |\r\n| 风险等级 | 发生概率×影响程度 | 30% |\r\n| 测试成本 | 用例数×执行时间 | 20% |\r\n| 自动化潜力 | 是否适合自动化 | 10% |\r\n\r\n### 评估矩阵\r\n\r\n| 用例类型 | 业务价值 | 风险等级 | 测试成本 | 建议 |\r\n|---------|---------|---------|---------|------|\r\n| P0+高风险 | 高 | 高 | 中 | 必须测试，优先自动化 |\r\n| P0+低风险 | 高 | 低 | 低 | 必须测试，手动即可 |\r\n| P1+高风险 | 中 | 高 | 中 | 必须测试，考虑自动化 |\r\n| P1+低风险 | 中 | 低 | 低 | 选择性测试 |\r\n| P2+高风险 | 低 | 高 | 中 | 评估后决定 |\r\n| P2+低风险 | 低 | 低 | 低 | 可跳过或简化 |\r\n\r\n### ROI计算公式\r\n\r\n```text\r\nROI = (业务价值 × 风险等级) / 测试成本\r\n\r\n示例：\r\n用例A：业务价值=5, 风险等级=5, 测试成本=2\r\nROI = (5×5)/2 = 12.5 → 高ROI，优先测试\r\n\r\n用例B：业务价值=2, 风险等级=2, 测试成本=5\r\nROI = (2×2)/5 = 0.8 → 低ROI，可简化\r\n```\r\n\r\n## 检查清单\r\n\r\n评审完成后检查：\r\n\r\n- [ ] 是否识别了AI的隐含假设？\r\n- [ ] 是否评估了覆盖完整性？\r\n- [ ] 是否检查了一致性？\r\n- [ ] 是否评估了冗余度？\r\n- [ ] 是否有明确的迭代方向？\r\n- [ ] 评审报告是否可执行？\r\n- [ ] 是否标注了降级模式（如适用）？\n\nFile v1.7.6:_meta.json\n\n{\n  \"ownerId\": \"kn71y9b23csfx0ykgm55d5m9x5891zt8\",\n  \"slug\": \"qa-ai-output-critique\",\n  \"version\": \"1.7.6\",\n  \"publishedAt\": 1788266111760\n}\n\nFile v1.7.6:references/report-templates.md\n\n# 评审报告模板与输出示例\n\n> 本文档是 `qa-ai-output-critique` 的参考文件。执行评审时，按以下模板组织评审输出。\n\n---\n\n## 完整评审报告（模式A — 有场景树和风险清单）\n\n```markdown\n## AI输出评审报告\n\n### 评审摘要\n- 评审日期：YYYY-MM-DD\n- 评审模式：完整评审\n- 用例总数：XX条\n- 综合评分：XX/80分\n\n### 八维评分\n| 维度 | 分数 | 评价 | 改进建议 |\n|------|------|------|---------|\n| 完整性 | X/10 | [评价] | [建议] |\n| 正确性 | X/10 | [评价] | [建议] |\n| 可执行性 | X/10 | [评价] | [建议] |\n| 风险覆盖 | X/10 | [评价] | [建议] |\n| 规范性 | X/10 | [评价] | [建议] |\n| 追溯性 | X/10 | [评价] | [建议] |\n| 一致性 | X/10 | [评价] | [建议] |\n| 冗余度 | X/10 | [评价] | [建议] |\n\n### 问题清单\n| 用例编号 | 问题类型 | 问题描述 | 改进建议 |\n|---------|---------|---------|---------|\n| TC_XXX_001 | [类型] | [描述] | [建议] |\n\n### 改进方向\n1. [改进方向1]\n2. [改进方向2]\n3. [改进方向3]\n```\n\n---\n\n## 简化评审报告（模式B — 无上游数据）\n\n```markdown\n## AI输出评审报告\n\n### 评审摘要\n- 评审日期：YYYY-MM-DD\n- 评审模式：快速评审\n- 用例总数：XX条\n- 综合评分：XX/60分（跳过追溯性）\n- 建议：补充场景树和风险清单后重新评审\n\n### 六维评分\n| 维度 | 分数 | 评价 | 改进建议 |\n|------|------|------|---------|\n| 完整性 | X/10 | [评价] | [建议] |\n| 正确性 | X/10 | [评价] | [建议] |\n| 可执行性 | X/10 | [评价] | [建议] |\n| 风险覆盖 | X/10 | [评价] | [建议] |\n| 规范性 | X/10 | [评价] | [建议] |\n| 一致性 | X/10 | [评价] | [建议] |\n| 冗余度 | X/10 | [评价] | [建议] |\n\n### 问题清单\n| 用例编号 | 问题类型 | 问题描述 | 改进建议 |\n|---------|---------|---------|---------|\n| TC_XXX_001 | [类型] | [描述] | [建议] |\n\n### 改进方向\n1. [改进方向1]\n2. [改进方向2]\n3. [改进方向3]\n```\n\n---\n\n## 快速评审模板\n\n适用于快速输出评价场景，不使用完整表格：\n\n```markdown\n## AI输出评审报告\n\n### 总体评价\n- 完整性：⭐⭐⭐⭐☆\n- 正确性：⭐⭐⭐⭐☆\n- 可执行性：⭐⭐⭐☆☆\n- 风险覆盖：⭐⭐⭐⭐☆\n- 规范性：⭐⭐⭐⭐⭐\n- 追溯性：⭐⭐⭐⭐☆\n- 一致性：⭐⭐⭐⭐☆\n- 冗余度：⭐⭐⭐⭐☆\n\n### 主要问题\n1. [问题1]：[具体描述]\n2. [问题2]：[具体描述]\n\n### 改进建议\n1. [建议1]：[具体方向]\n2. [建议2]：[具体方向]\n\n### 迭代方向\n优先改进：[最关键的改进点]\n```\n\n---\n\n## 输出示例\n\n### 示例1：完整评审（有场景树）\n\n**输入**：AI生成的登录功能测试用例 + 场景树 + 风险清单\n\n**八维评审结果**：\n- 完整性7分：场景树显示10个场景，用例覆盖7个（70%）\n- 正确性9分：业务规则描述基本正确\n- 可执行性8分：大部分步骤清晰\n- 风险覆盖6分：风险清单显示3个高风险，用例覆盖1个\n- 规范性9分：格式规范\n- 追溯性8分：大部分有需求ID\n- 一致性9分：无明显矛盾\n- 冗余度9分：无明显冗余\n\n**综合评分**：65/80分（合格）\n\n**改进方向**：补充并发登录、密码暴力破解、Session超时场景\n\n### 示例2：快速评审（无上游数据）\n\n**输入**：AI生成的登录功能测试用例（无场景树和风险清单）\n\n**六维评审结果**：\n- 完整性6分：基于通用场景清单，缺少并发和安全场景\n- 正确性9分：业务规则描述正确\n- 可执行性8分：步骤清晰\n- 风险覆盖5分：未考虑高风险区域\n- 规范性9分：格式规范\n- 一致性9分：无明显矛盾\n- 冗余度9分：无明显冗余\n\n**综合评分**：55/60分（合格，但建议补充）\n\n**建议**：补充场景树和风险清单后重新评审\n\nFile v1.7.6:references/review-dimensions.md\n\n# 八维评审法 — 完整评审维度与评分标准\n\n> 本文档是 `qa-ai-output-critique` 的参考文件。执行评审时，按以下八维评分标准逐项打分。\n> 每维度 10 分，总分 ≥ 64 分为合格。\n\n---\n\n## 评分总览\n\n| 维度 | 评分核心 | 默认权重 |\n|------|---------|---------|\n| 完整性 | 场景覆盖是否完整 | 10分 |\n| 正确性 | 业务规则和预期是否正确 | 10分 |\n| 可执行性 | 步骤是否清晰可执行 | 10分 |\n| 风险覆盖 | 高风险区域是否深测 | 10分 |\n| 规范性 | 格式是否符合标准 | 10分 |\n| 追溯性 | 需求ID/风险ID是否完整 | 10分 |\n| 一致性 | 用例间是否自相矛盾 | 10分 |\n| 冗余度 | 是否有无价值用例 | 10分 |\n\n---\n\n## 1. 完整性评审（10分）\n\n**检查项**：是否覆盖了所有场景？\n\n```text\n评分标准：\n- 10分：覆盖所有主路径+分支+异常+边界（基于场景树）\n- 7分：覆盖主路径和主要异常\n- 4分：只覆盖主路径\n- 1分：严重缺失\n\n评审清单：\n- [ ] 主路径场景是否完整？\n- [ ] 分支路径是否覆盖？\n- [ ] 异常场景是否考虑？\n- [ ] 边界条件是否分析？\n- [ ] 非功能需求是否涉及？\n\n发现问题的问法：\n\"请列出你输出中未覆盖的场景类型\"\n\"对照场景树，检查覆盖率\"\n\"请按四维边界模型重新分析\"\n\"这个边界真的够深吗？\"\n\n降级模式（无场景树时）：\n- 基于通用场景清单检查：主流程、分支、异常、边界、非功能\n- 标注\"建议补充场景树后重新评审\"\n```\n\n---\n\n## 2. 正确性评审（10分）\n\n**检查项**：业务规则和预期结果是否正确？\n\n```text\n核心关注：对不对（内容正确性）\n\n评分标准：\n- 10分：业务规则正确、预期可验证\n- 7分：大部分正确，少量细节需调整\n- 4分：有多处错误\n- 1分：严重错误\n\n评审清单：\n- [ ] 业务规则描述是否符合需求？\n- [ ] 预期结果是否与实际系统行为一致？\n- [ ] 数据计算逻辑是否正确？\n- [ ] 状态转换描述是否准确？\n\n发现问题的问法：\n\"这个预期结果与实际系统行为一致吗？\"\n\"业务规则描述是否准确？\"\n\"这个状态转换逻辑对吗？\"\n```\n\n---\n\n## 3. 可执行性评审（10分）\n\n**检查项**：能不能实际执行？\n\n```text\n核心关注：能不能做（可操作性）\n\n评分标准：\n- 10分：步骤清晰、无歧义、可执行\n- 7分：大部分清晰，少量需补充\n- 4分：有多处模糊\n- 1分：无法执行\n\n评审清单：\n- [ ] 测试数据是否可构造？\n- [ ] 测试环境是否可搭建？\n- [ ] 测试步骤是否可重复？\n- [ ] 预期结果是否可观测？\n\n发现问题的问法：\n\"这个用例能实际执行吗？\"\n\"测试数据从哪来？\"\n\"测试环境怎么搭建？\"\n```\n\n---\n\n## 4. 风险覆盖评审（10分）\n\n**检查项**：高风险区域是否深测？\n\n```text\n评分标准：\n- 10分：高风险区域100%覆盖（基于风险清单）\n- 7分：高风险区域80%覆盖\n- 4分：高风险区域50%覆盖\n- 1分：高风险区域未覆盖\n\n评审清单：\n- [ ] 资金相关场景是否深测？\n- [ ] 安全相关场景是否覆盖？\n- [ ] 并发场景是否考虑？\n- [ ] 异常恢复是否验证？\n- [ ] 数据一致性是否验证？\n- [ ] 第三方依赖是否Mock？\n\n发现问题的问法：\n\"这个功能挂了影响多大？\"\n\"高风险区域测试深度够吗？\"\n\n降级模式（无风险清单时）：\n- 基于默认风险类型检查：资金、安全、并发、数据一致性\n- 标注\"建议补充风险清单后重新评审\"\n```\n\n---\n\n## 5. 规范性评审（10分）\n\n**检查项**：格式是否符合标准？\n\n```text\n评分标准：\n- 10分：完全符合标准\n- 7分：大部分符合，少量需调整\n- 4分：格式混乱\n- 1分：无格式\n\n评审清单：\n- [ ] 用例编号是否规范？\n- [ ] 表格格式是否正确？\n- [ ] 字段是否完整？\n- [ ] 描述是否简洁？\n```\n\n---\n\n## 6. 追溯性评审（10分）\n\n**检查项**：需求ID/风险ID是否完整？\n\n```text\n评分标准：\n- 10分：每条用例都有需求ID和风险ID\n- 7分：大部分有，少量缺失\n- 4分：只有部分有\n- 1分：无追溯信息\n\n评审清单：\n- [ ] 每条用例是否关联需求ID？\n- [ ] 每条用例是否关联风险ID？\n- [ ] ID格式是否统一？\n- [ ] 追溯链是否完整？\n\n降级模式（无需求ID列表时）：\n- 跳过此维度\n- 标注\"需补充追溯信息\"\n```\n\n---\n\n## 7. 一致性评审（10分）\n\n**检查项**：用例间是否自相矛盾？\n\n```text\n评分标准：\n- 10分：完全一致，无矛盾\n- 7分：大部分一致，少量需调整\n- 4分：有多处矛盾\n- 1分：严重矛盾\n\n评审清单：\n- [ ] 前置条件和测试步骤是否一致？\n- [ ] 不同用例间是否有冲突？\n- [ ] 业务规则是否统一？\n- [ ] 预期结果是否互斥？\n\n发现问题的问法：\n\"检查这些用例间是否有矛盾\"\n\"前置条件和步骤是否匹配？\"\n```\n\n---\n\n## 8. 冗余度评审（10分）\n\n**检查项**：有没有无价值用例？\n\n```text\n评分标准：\n- 10分：无冗余，每条用例都有价值\n- 7分：少量冗余\n- 4分：有多处冗余\n- 1分：大量冗余\n\n评审清单：\n- [ ] 是否有重复覆盖的场景？\n- [ ] 是否有低价值用例？\n- [ ] 优先级标注是否合理？\n- [ ] 测试效率是否最优？\n\n发现问题的问法：\n\"删除哪些用例不影响覆盖率？\"\n\"哪些用例可以合并？\"\n```\n\nFile v1.7.6:skill-card.md\n\n## Description:\n\nAI 测试输出评审 reviews AI-generated test cases across completeness, correctness, executability, risk coverage, standards compliance, consistency, traceability, and redundancy, with a six-dimension fallback when upstream scenario or risk inputs are missing.\n\nThis skill is ready for commercial/non-commercial use.\n\n## Publisher:\n\n[kokxi](https://clawhub.ai/user/kokxi)\n\n### License/Terms of Use:\n\nMIT-0\n\n## Use Case:\n\nQA engineers, test leads, and developers use this skill after AI-assisted test-case generation to score case quality, identify coverage gaps, and produce actionable improvement suggestions before finalizing test assets.\n\n### Deployment Geography for Use:\n\nGlobal\n\n## Known Risks and Mitigations:\n\nRisk: The skill recommends an unpinned external `npx skills add Kokxi/qa-test-skills` command that could change installed agent behavior over time.\n\nMitigation: Review the external package before installation and prefer a pinned version or reviewed commit, especially in environments with sensitive credentials.\n\n## Reference(s):\n\n- [Report Templates](references/report-templates.md)\n- [Review Dimensions](references/review-dimensions.md)\n\n## Skill Output:\n\n**Output Type(s):** [Text, Markdown, Guidance]\n\n**Output Format:** [Markdown review report with scoring tables, issue lists, coverage gaps, quality score, and improvement suggestions]\n\n**Output Parameters:** [1D]\n\n**Other Properties Related to Output:** [Supports full eight-dimension review when scenario and risk inputs are available, and a reduced review mode when those inputs are missing.]\n\n## Skill Version(s):\n\n1.7.6 (source: server release metadata; artifact frontmatter says 1.7.5)\n\n## Ethical Considerations:\n\nUsers should evaluate whether this skill is appropriate for their environment, review any generated or modified files before relying on them, and apply their organization's safety, security, and compliance requirements before deployment.\n\nArchive v1.7.5: 5 files, 10316 bytes\n\nFiles: references/report-templates.md (3881b), references/review-dimensions.md (5484b), skill-card.md (2164b), SKILL.md (12067b), _meta.json (140b)\n\nFile v1.7.5:SKILL.md\n\n---\nname: qa-ai-output-critique\nslug: qa-ai-output-critique\ndisplayName: Ai Output Critique\nversion: 1.7.5\ndescription: >-\n  对AI生成的测试用例进行八维评审（完整性、正确性、可执行性、风险覆盖、规范性、一致性、追溯性、冗余度），是AI生成用例后的第一个质量门禁。当AI刚刚生成了一大批测试用例、你需要确保这些用例真的有价值而不是\"看起来不错\"时，应当使用此技能。不要假设AI输出的都是对的——AI经常生成语义正确但实际操作不了的用例。每个维度评分低于7分的必须标注问题并使用MISSING/WRONG/VAGUE等规范格式标记。无上游场景树/风险清单时降级为六维评审（跳过追溯性、简化完整性）。\n\nwhen_to_use: AI生成用例后自动激活（最终输出前的必过门禁）；用户说\"检查一下输出\"、\"评审用例质量\"、\"验证完整性\"、\"这个用例对吗\"、\"自动检查\"时\nallowed-tools: Read Grep Glob\nrelated_skills:\n  upstream:\n    - qa-ai-prompt-strategy      # 输入：AI生成的测试用例\n    - qa-scenario-tree           # 可选输入：场景树（用于完整性评审）\n    - qa-risk-intuition          # 可选输入：风险清单（用于风险覆盖评审）\n  downstream:\n    - qa-ai-blindspot-compensation # 输出：评审结果传递给补盲\n    - qa-expert-review\n    - qa-output-validation\nreferences:\n  - references/report-templates.md\n  - references/review-dimensions.md\ninput_format:\n  required:\n    - name: AI生成测试用例\n      type: array\n      description: AI生成的测试用例列表\n  optional:\n    - name: 需求文档\n      type: string\n      description: 原始需求描述\n    - name: 评审标准\n      type: object\n      description: 评审维度和标准配置\noutput_format:\n  traceability:\n    - 本技能评审用例，不新增唯一ID；评审问题关联到原用例ID（TC_{模块缩写}_{功能缩写}_{序号}，如 TC_API_LOGIN_001）\n  structure:\n    - 测试用例表格：固定 9 列（用例编号|测试类型|功能模块|测试标题|用例级别|预置条件|测试步骤|预期结果|风险等级）\n    - 用例级别：P0≤20%（核心流程）/ P1≤40%（主要功能）/ P2≤30%（次要功能）/ P3≤10%（边缘场景）\n    - 覆盖率：标注口径（基于现有需求/输入文档），禁止\"全覆盖/100%\"绝对化表述；缺失模块标注\"未覆盖+原因\"\n    - critique_report: 八维评审报告（降级模式为六维）\n    - coverage_gaps: 覆盖遗漏清单\n    - quality_score: 质量评分\n    - improvement_suggestions: 改进建议列表\ndepth_requirement_quantification:\n  reference_value: \"根据用例数量和复杂度调整评审深度：简单x1/中等x2/复杂x3\"\n  minimum: \"至少覆盖功能正确性、边界条件、异常场景3个评审维度\"\ncategories: ['Development','Testing','AI']\nerror_recovery_guidance:\n  on_failure: \"评审发现系统性问题时回退到AI生成步骤修正\"\n  retry_behavior: \"修正提示词或上下文后重新生成并评审\"\n---\n> **⚠️ 安全警告**：本技能的示例可能涉及测试用例整理、合并或删除建议。\n> 实际使用时请勿直接执行批量删除操作，先备份原数据并确认非关键用例。\n> 本技能仅在 workspace/ 输出评估文件，不持久化、不外传、不跨会话复用。\n\n# AI 输出评审\n\n## 使用逻辑\n\n本技能分为四个阶段，按顺序执行：\n\n```text\n阶段一：评审框架（八维评审法）\n    │\n    │  使用八维评审法对AI输出进行系统打分\n    │  输出：评审报告（评分 + 问题清单）\n    │\n    ▼\n阶段二：报告模板（输出格式）\n    │\n    │  按标准格式输出评审结果\n    │  输出：结构化评审报告\n    │\n    ▼\n阶段三：追问问法（深入挖掘）\n    │\n    │  使用追问技巧引导发现问题\n    │  输出：更深层的质量洞察\n    │\n    ▼\n阶段四：辅助工具（假设挖掘/反驳机制/投入产出评估）\n    │\n    │  补充评审维度，提升评审深度\n    │  输出：完整评审结论\n```\n\n**关键点**：阶段三的\"追问问法\"是在评审报告输出后使用的，用于引导发现更深层的问题，不是独立的评审体系。\n\n## 输入要求\n\n### 必填输入\n- AI生成的测试用例\n\n### 推荐输入（提供则评审更准确）\n- 场景树（来自qa-scenario-tree）：用于完整性评审，判断场景覆盖率\n- 风险清单（来自qa-risk-intuition）：用于风险覆盖评审，判断高风险区域是否深测\n- 需求ID列表：用于追溯性评审，判断用例是否可追溯\n\n### 降级策略\n如果缺少推荐输入：\n\n| 缺少的输入 | 评审策略 | 降级处理 |\n|-----------|----------|----------|\n| 场景树 | 完整性评审 | 基于通用场景清单（主流程/分支/异常/边界） |\n| 风险清单 | 风险覆盖评审 | 基于默认风险类型（资金/安全/并发/数据一致性） |\n| 需求ID列表 | 追溯性评审 | 跳过，标记为\"需补充追溯信息\" |\n\n## 评审模式\n\n### 模式A：完整评审（有场景树和风险清单）\n- 八维评审全部启用\n- 输出完整评审报告\n- 适用场景：工作流中的标准评审\n\n### 模式B：快速评审（无上游数据）\n- 启用六维评审（跳过追溯性，简化完整性）\n- 输出简化评审报告\n- 标注\"建议补充场景树后重新评审\"\n- 适用场景：独立使用、快速检查\n\n### 模式选择规则\n```text\n有场景树 AND 有风险清单 → 模式A（完整评审）\n否则 → 模式B（快速评审）\n```\n\n## 核心原则\n\nAI输出看起来都对，但专家能看出哪里不够。\n\n## 八维评审法速查\n\n**评分标准**：每维度10分，总分≥64分为合格。详见 [`references/review-dimensions.md`](references/review-dimensions.md)。\n\n| 维度 | 评分核心 | 核心关注 |\n|------|---------|---------|\n| 完整性 | 场景覆盖是否完整 | 主路径+分支+异常+边界 |\n| 正确性 | 业务规则和预期是否正确 | 内容正确性 |\n| 可执行性 | 步骤是否清晰可执行 | 可操作性 |\n| 风险覆盖 | 高风险区域是否深测 | 资金/安全/并发/数据 |\n| 规范性 | 格式是否符合标准 | 编号/表格/字段 |\n| 追溯性 | 需求/风险ID是否完整 | 需求追溯链 |\n| 一致性 | 用例间是否自相矛盾 | 前置与步骤匹配 |\n| 冗余度 | 是否有无价值用例 | 重复/低价值用例 |\n\n> 每维度的详细评分标准、评审清单和追问问法参见 [`references/review-dimensions.md`](references/review-dimensions.md)。\n\n## 中文/国产模型特有评审点\n\n国产模型（DeepSeek/通义/文心/豆包等）输出除八维通用评审外，需额外检查以下特有风险：\n\n| 评审点 | 典型表现 | 处理 |\n|--------|---------|------|\n| **中文语义漂移** | 用例标题与步骤语义不一致（如标题\"验证登录\"步骤却在测注册） | 用\"步骤是否支撑标题\"反向核查，漂移即降分 |\n| **数字/单位幻觉** | 超时值、并发数、金额单位凭空编造（如\"P95<100ms\"无依据） | 核对来源，无依据标注\"MISSING：需基准数据\" |\n| **政策/合规表述** | 用例预期结果含不合规表述（如支付、个人信息处理） | 标注合规风险，提示对照监管要求 |\n| **格式不稳定** | 表格列错位、编号断号（TC_001→TC_003）、中文标点混入 | 按规范性维度检查编号连续性 |\n| **过度泛化** | 用例写得\"像测试指南\"而非\"可执行用例\"（步骤不可操作） | 按可执行性维度扣分，要求补具体步骤 |\n| **伪正确性** | 预期结果\"返回正确\"但未定义什么算正确 | 要求预期结果可验证（具体状态码/字段值） |\n\n**评审动作**：发现上述任一问题，按对应八维维度降分，并输出规范格式标记（MISSING/WRONG/VAGUE）+ 修正建议。\n\n## 评审报告模板\n\n详见 [`references/report-templates.md`](references/report-templates.md)，包含三种模板：\n- **完整评审报告（模式A）**：八维评分 + 问题清单 + 改进方向\n- **简化评审报告（模式B）**：六维评分 + 降级标注\n- **快速评审模板**：星级评价 + 主要问题 + 迭代方向\n\n## 假设挖掘\n\nAI输出中常见的隐含假设：\n\n| 假设类型 | 示例 | 验证方法 |\n|---------|------|---------|\n| 用户行为假设 | \"用户会正常输入\" | 追问：用户误输入怎么办？ |\n| 环境假设 | \"网络正常\" | 追问：网络异常时会怎样？ |\n| 数据假设 | \"数据格式正确\" | 追问：格式错误时怎么处理？ |\n| 时序假设 | \"操作按顺序执行\" | 追问：乱序执行会怎样？ |\n| 依赖假设 | \"第三方服务正常\" | 追问：第三方挂了怎么办？ |\n\n**挖掘问法**：\n```text\n请列出你在输出中做的所有假设\n哪些假设可能不成立？\n如果假设不成立，测试场景会有什么变化？\n```\n\n## 迭代决策树\n\n当AI输出不满意时：\n\n```text\n输出不满意\n    │\n    ├── 完整性不够？\n    │       └── 补充场景：请补充[缺失的场景类型]\n    │\n    ├── 深度不够？\n    │       └── 深入分析：请按[具体维度]深入分析\n    │\n    ├── 风险覆盖不足？\n    │       └── 重点强化：请对[高风险区域]做专项测试\n    │\n    ├── 有矛盾？\n    │       └── 修正一致性：请修正[具体矛盾点]\n    │\n    ├── 冗余过多？\n    │       └── 精简用例：请合并或删除[低价值用例]\n    │\n    └── 不可执行？\n            └── 调整可行性：请确保[测试步骤]可实际执行\n```\n\n## AI反驳机制\n\n让AI挑战你的假设，而不是迎合你。\n\n### 反驳问法模板\n\n```text\n模式1：质量负责人视角\n\"请站在质量负责人角度，指出可能遗漏的业务风险、过度测试的地方，\n以及上线前还需要确认的问题。\"\n\n模式2：故障反推视角\n\"请假设这个功能上线后出现严重问题，反推我现在的测试方案\n可能漏掉了什么。\"\n\n模式3：资源约束视角\n\"测试资源有限，请评估这些用例的投入产出比，\n哪些是必须测的，哪些可以简化或跳过。\"\n\n模式4：竞品对比视角\n\"如果竞争对手的同类功能比我们更稳定，可能是因为\n他们多测了哪些我们没覆盖的场景？\"\n```\n\n### 反驳检查清单\n\n- [ ] 是否要求AI挑战你的假设？\n- [ ] 是否让AI从反面看问题？\n- [ ] 是否评估了投入产出比？\n- [ ] 是否识别了过度测试的区域？\n\n## 投入产出评估\n\n### 评估维度\n\n| 维度 | 评估标准 | 权重 |\n|------|---------|------|\n| 业务价值 | 影响用户数×影响程度 | 40% |\n| 风险等级 | 发生概率×影响程度 | 30% |\n| 测试成本 | 用例数×执行时间 | 20% |\n| 自动化潜力 | 是否适合自动化 | 10% |\n\n### 评估矩阵\n\n| 用例类型 | 业务价值 | 风险等级 | 测试成本 | 建议 |\n|---------|---------|---------|---------|------|\n| P0+高风险 | 高 | 高 | 中 | 必须测试，优先自动化 |\n| P0+低风险 | 高 | 低 | 低 | 必须测试，手动即可 |\n| P1+高风险 | 中 | 高 | 中 | 必须测试，考虑自动化 |\n| P1+低风险 | 中 | 低 | 低 | 选择性测试 |\n| P2+高风险 | 低 | 高 | 中 | 评估后决定 |\n| P2+低风险 | 低 | 低 | 低 | 可跳过或简化 |\n\n### ROI计算公式\n\n```text\nROI = (业务价值 × 风险等级) / 测试成本\n\n示例：\n用例A：业务价值=5, 风险等级=5, 测试成本=2\nROI = (5×5)/2 = 12.5 → 高ROI，优先测试\n\n用例B：业务价值=2, 风险等级=2, 测试成本=5\nROI = (2×2)/5 = 0.8 → 低ROI，可简化\n```\n\n## 检查清单\n\n评审完成后检查：\n\n- [ ] 是否识别了AI的隐含假设？\n- [ ] 是否评估了覆盖完整性？\n- [ ] 是否检查了一致性？\n- [ ] 是否评估了冗余度？\n- [ ] 是否有明确的迭代方向？\n- [ ] 评审报告是否可执行？\n- [ ] 是否标注了降级模式（如适用）？\n\nFile v1.7.5:_meta.json\n\n{\n  \"ownerId\": \"kn71y9b23csfx0ykgm55d5m9x5891zt8\",\n  \"slug\": \"qa-ai-output-critique\",\n  \"version\": \"1.7.5\",\n  \"publishedAt\": 1788102618121\n}\n\nFile v1.7.5:references/report-templates.md\n\n# 评审报告模板与输出示例\n\n> 本文档是 `qa-ai-output-critique` 的参考文件。执行评审时，按以下模板组织评审输出。\n\n---\n\n## 完整评审报告（模式A — 有场景树和风险清单）\n\n```markdown\n## AI输出评审报告\n\n### 评审摘要\n- 评审日期：YYYY-MM-DD\n- 评审模式：完整评审\n- 用例总数：XX条\n- 综合评分：XX/80分\n\n### 八维评分\n| 维度 | 分数 | 评价 | 改进建议 |\n|------|------|------|---------|\n| 完整性 | X/10 | [评价] | [建议] |\n| 正确性 | X/10 | [评价] | [建议] |\n| 可执行性 | X/10 | [评价] | [建议] |\n| 风险覆盖 | X/10 | [评价] | [建议] |\n| 规范性 | X/10 | [评价] | [建议] |\n| 追溯性 | X/10 | [评价] | [建议] |\n| 一致性 | X/10 | [评价] | [建议] |\n| 冗余度 | X/10 | [评价] | [建议] |\n\n### 问题清单\n| 用例编号 | 问题类型 | 问题描述 | 改进建议 |\n|---------|---------|---------|---------|\n| TC_XXX_001 | [类型] | [描述] | [建议] |\n\n### 改进方向\n1. [改进方向1]\n2. [改进方向2]\n3. [改进方向3]\n```\n\n---\n\n## 简化评审报告（模式B — 无上游数据）\n\n```markdown\n## AI输出评审报告\n\n### 评审摘要\n- 评审日期：YYYY-MM-DD\n- 评审模式：快速评审\n- 用例总数：XX条\n- 综合评分：XX/60分（跳过追溯性）\n- 建议：补充场景树和风险清单后重新评审\n\n### 六维评分\n| 维度 | 分数 | 评价 | 改进建议 |\n|------|------|------|---------|\n| 完整性 | X/10 | [评价] | [建议] |\n| 正确性 | X/10 | [评价] | [建议] |\n| 可执行性 | X/10 | [评价] | [建议] |\n| 风险覆盖 | X/10 | [评价] | [建议] |\n| 规范性 | X/10 | [评价] | [建议] |\n| 一致性 | X/10 | [评价] | [建议] |\n| 冗余度 | X/10 | [评价] | [建议] |\n\n### 问题清单\n| 用例编号 | 问题类型 | 问题描述 | 改进建议 |\n|---------|---------|---------|---------|\n| TC_XXX_001 | [类型] | [描述] | [建议] |\n\n### 改进方向\n1. [改进方向1]\n2. [改进方向2]\n3. [改进方向3]\n```\n\n---\n\n## 快速评审模板\n\n适用于快速输出评价场景，不使用完整表格：\n\n```markdown\n## AI输出评审报告\n\n### 总体评价\n- 完整性：⭐⭐⭐⭐☆\n- 正确性：⭐⭐⭐⭐☆\n- 可执行性：⭐⭐⭐☆☆\n- 风险覆盖：⭐⭐⭐⭐☆\n- 规范性：⭐⭐⭐⭐⭐\n- 追溯性：⭐⭐⭐⭐☆\n- 一致性：⭐⭐⭐⭐☆\n- 冗余度：⭐⭐⭐⭐☆\n\n### 主要问题\n1. [问题1]：[具体描述]\n2. [问题2]：[具体描述]\n\n### 改进建议\n1. [建议1]：[具体方向]\n2. [建议2]：[具体方向]\n\n### 迭代方向\n优先改进：[最关键的改进点]\n```\n\n---\n\n## 输出示例\n\n### 示例1：完整评审（有场景树）\n\n**输入**：AI生成的登录功能测试用例 + 场景树 + 风险清单\n\n**八维评审结果**：\n- 完整性7分：场景树显示10个场景，用例覆盖7个（70%）\n- 正确性9分：业务规则描述基本正确\n- 可执行性8分：大部分步骤清晰\n- 风险覆盖6分：风险清单显示3个高风险，用例覆盖1个\n- 规范性9分：格式规范\n- 追溯性8分：大部分有需求ID\n- 一致性9分：无明显矛盾\n- 冗余度9分：无明显冗余\n\n**综合评分**：65/80分（合格）\n\n**改进方向**：补充并发登录、密码暴力破解、Session超时场景\n\n### 示例2：快速评审（无上游数据）\n\n**输入**：AI生成的登录功能测试用例（无场景树和风险清单）\n\n**六维评审结果**：\n- 完整性6分：基于通用场景清单，缺少并发和安全场景\n- 正确性9分：业务规则描述正确\n- 可执行性8分：步骤清晰\n- 风险覆盖5分：未考虑高风险区域\n- 规范性9分：格式规范\n- 一致性9分：无明显矛盾\n- 冗余度9分：无明显冗余\n\n**综合评分**：55/60分（合格，但建议补充）\n\n**建议**：补充场景树和风险清单后重新评审\n\nFile v1.7.5:references/review-dimensions.md\n\n# 八维评审法 — 完整评审维度与评分标准\n\n> 本文档是 `qa-ai-output-critique` 的参考文件。执行评审时，按以下八维评分标准逐项打分。\n> 每维度 10 分，总分 ≥ 64 分为合格。\n\n---\n\n## 评分总览\n\n| 维度 | 评分核心 | 默认权重 |\n|------|---------|---------|\n| 完整性 | 场景覆盖是否完整 | 10分 |\n| 正确性 | 业务规则和预期是否正确 | 10分 |\n| 可执行性 | 步骤是否清晰可执行 | 10分 |\n| 风险覆盖 | 高风险区域是否深测 | 10分 |\n| 规范性 | 格式是否符合标准 | 10分 |\n| 追溯性 | 需求ID/风险ID是否完整 | 10分 |\n| 一致性 | 用例间是否自相矛盾 | 10分 |\n| 冗余度 | 是否有无价值用例 | 10分 |\n\n---\n\n## 1. 完整性评审（10分）\n\n**检查项**：是否覆盖了所有场景？\n\n```text\n评分标准：\n- 10分：覆盖所有主路径+分支+异常+边界（基于场景树）\n- 7分：覆盖主路径和主要异常\n- 4分：只覆盖主路径\n- 1分：严重缺失\n\n评审清单：\n- [ ] 主路径场景是否完整？\n- [ ] 分支路径是否覆盖？\n- [ ] 异常场景是否考虑？\n- [ ] 边界条件是否分析？\n- [ ] 非功能需求是否涉及？\n\n发现问题的问法：\n\"请列出你输出中未覆盖的场景类型\"\n\"对照场景树，检查覆盖率\"\n\"请按四维边界模型重新分析\"\n\"这个边界真的够深吗？\"\n\n降级模式（无场景树时）：\n- 基于通用场景清单检查：主流程、分支、异常、边界、非功能\n- 标注\"建议补充场景树后重新评审\"\n```\n\n---\n\n## 2. 正确性评审（10分）\n\n**检查项**：业务规则和预期结果是否正确？\n\n```text\n核心关注：对不对（内容正确性）\n\n评分标准：\n- 10分：业务规则正确、预期可验证\n- 7分：大部分正确，少量细节需调整\n- 4分：有多处错误\n- 1分：严重错误\n\n评审清单：\n- [ ] 业务规则描述是否符合需求？\n- [ ] 预期结果是否与实际系统行为一致？\n- [ ] 数据计算逻辑是否正确？\n- [ ] 状态转换描述是否准确？\n\n发现问题的问法：\n\"这个预期结果与实际系统行为一致吗？\"\n\"业务规则描述是否准确？\"\n\"这个状态转换逻辑对吗？\"\n```\n\n---\n\n## 3. 可执行性评审（10分）\n\n**检查项**：能不能实际执行？\n\n```text\n核心关注：能不能做（可操作性）\n\n评分标准：\n- 10分：步骤清晰、无歧义、可执行\n- 7分：大部分清晰，少量需补充\n- 4分：有多处模糊\n- 1分：无法执行\n\n评审清单：\n- [ ] 测试数据是否可构造？\n- [ ] 测试环境是否可搭建？\n- [ ] 测试步骤是否可重复？\n- [ ] 预期结果是否可观测？\n\n发现问题的问法：\n\"这个用例能实际执行吗？\"\n\"测试数据从哪来？\"\n\"测试环境怎么搭建？\"\n```\n\n---\n\n## 4. 风险覆盖评审（10分）\n\n**检查项**：高风险区域是否深测？\n\n```text\n评分标准：\n- 10分：高风险区域100%覆盖（基于风险清单）\n- 7分：高风险区域80%覆盖\n- 4分：高风险区域50%覆盖\n- 1分：高风险区域未覆盖\n\n评审清单：\n- [ ] 资金相关场景是否深测？\n- [ ] 安全相关场景是否覆盖？\n- [ ] 并发场景是否考虑？\n- [ ] 异常恢复是否验证？\n- [ ] 数据一致性是否验证？\n- [ ] 第三方依赖是否Mock？\n\n发现问题的问法：\n\"这个功能挂了影响多大？\"\n\"高风险区域测试深度够吗？\"\n\n降级模式（无风险清单时）：\n- 基于默认风险类型检查：资金、安全、并发、数据一致性\n- 标注\"建议补充风险清单后重新评审\"\n```\n\n---\n\n## 5. 规范性评审（10分）\n\n**检查项**：格式是否符合标准？\n\n```text\n评分标准：\n- 10分：完全符合标准\n- 7分：大部分符合，少量需调整\n- 4分：格式混乱\n- 1分：无格式\n\n评审清单：\n- [ ] 用例编号是否规范？\n- [ ] 表格格式是否正确？\n- [ ] 字段是否完整？\n- [ ] 描述是否简洁？\n```\n\n---\n\n## 6. 追溯性评审（10分）\n\n**检查项**：需求ID/风险ID是否完整？\n\n```text\n评分标准：\n- 10分：每条用例都有需求ID和风险ID\n- 7分：大部分有，少量缺失\n- 4分：只有部分有\n- 1分：无追溯信息\n\n评审清单：\n- [ ] 每条用例是否关联需求ID？\n- [ ] 每条用例是否关联风险ID？\n- [ ] ID格式是否统一？\n- [ ] 追溯链是否完整？\n\n降级模式（无需求ID列表时）：\n- 跳过此维度\n- 标注\"需补充追溯信息\"\n```\n\n---\n\n## 7. 一致性评审（10分）\n\n**检查项**：用例间是否自相矛盾？\n\n```text\n评分标准：\n- 10分：完全一致，无矛盾\n- 7分：大部分一致，少量需调整\n- 4分：有多处矛盾\n- 1分：严重矛盾\n\n评审清单：\n- [ ] 前置条件和测试步骤是否一致？\n- [ ] 不同用例间是否有冲突？\n- [ ] 业务规则是否统一？\n- [ ] 预期结果是否互斥？\n\n发现问题的问法：\n\"检查这些用例间是否有矛盾\"\n\"前置条件和步骤是否匹配？\"\n```\n\n---\n\n## 8. 冗余度评审（10分）\n\n**检查项**：有没有无价值用例？\n\n```text\n评分标准：\n- 10分：无冗余，每条用例都有价值\n- 7分：少量冗余\n- 4分：有多处冗余\n- 1分：大量冗余\n\n评审清单：\n- [ ] 是否有重复覆盖的场景？\n- [ ] 是否有低价值用例？\n- [ ] 优先级标注是否合理？\n- [ ] 测试效率是否最优？\n\n发现问题的问法：\n\"删除哪些用例不影响覆盖率？\"\n\"哪些用例可以合并？\"\n```\n\nFile v1.7.5:skill-card.md\n\n## Description:\n\nReviews AI-generated test cases against quality dimensions such as completeness, correctness, executability, risk coverage, consistency, traceability, and redundancy, then produces a structured critique with scores and improvement suggestions.\n\nThis skill is ready for commercial/non-commercial use.\n\n## Publisher:\n\n[kokxi](https://clawhub.ai/user/kokxi)\n\n### License/Terms of Use:\n\nMIT-0\n\n## Use Case:\n\nQA engineers, developers, and test leads use this skill after AI-generated test cases are produced to identify missing coverage, unclear steps, weak expected results, risk gaps, and low-value duplication before the test set is accepted.\n\n### Deployment Geography for Use:\n\nGlobal\n\n## Known Risks and Mitigations:\n\nRisk: Broad Chinese trigger phrases may activate the skill during a general output check rather than a targeted test-case critique.\n\nMitigation: Confirm that the current task is reviewing AI-generated test cases before applying the full scoring rubric.\n\nRisk: Chinese-model-specific heuristics may not apply equally to every model, language, product, or compliance context.\n\nMitigation: Treat these heuristics as contextual review prompts and validate findings against the product requirements and applicable domain rules.\n\n## Reference(s):\n\n- [Report Templates](references/report-templates.md)\n- [Review Dimensions](references/review-dimensions.md)\n\n## Skill Output:\n\n**Output Type(s):** [text, markdown, guidance]\n\n**Output Format:** [Markdown review report with scoring tables, issue lists, coverage gaps, quality score, and improvement suggestions.]\n\n**Output Parameters:** [1D]\n\n**Other Properties Related to Output:** [Uses a full eight-dimension review when scenario tree and risk inputs are available, and falls back to a simplified review when upstream inputs are missing.]\n\n## Skill Version(s):\n\n1.7.5 (source: frontmatter and server release evidence)\n\n## Ethical Considerations:\n\nUsers should evaluate whether this skill is appropriate for their environment, review any generated or modified files before relying on them, and apply their organization's safety, security, and compliance requirements before deployment.\n\nArchive v1.6.3: 5 files, 9379 bytes\n\nFiles: references/report-templates.md (3881b), references/review-dimensions.md (5484b), skill-card.md (2102b), SKILL.md (10265b), _meta.json (140b)\n\nFile v1.6.3:SKILL.md\n\n---\nname: qa-ai-output-critique\nslug: qa-ai-output-critique\ndisplayName: Ai Output Critique\nversion: 1.6.3\ndescription: >-\n  对AI生成的测试用例进行八维评审（完整性、正确性、可执行性、风险覆盖、规范性、一致性、追溯性、冗余度），是AI生成用例后的第一个质量门禁。当AI刚刚生成了一大批测试用例、你需要确保这些用例真的有价值而不是\"看起来不错\"时，应当使用此技能。不要假设AI输出的都是对的——AI经常生成语义正确但实际操作不了的用例。每个维度评分低于7分的必须标注问题并使用MISSING/WRONG/VAGUE等规范格式标记。无上游场景树/风险清单时降级为六维评审（跳过追溯性、简化完整性）。\n\nwhen_to_use: AI生成用例后自动激活（最终输出前的必过门禁）；用户说\"检查一下输出\"、\"评审用例质量\"、\"验证完整性\"、\"这个用例对吗\"、\"自动检查\"时\nallowed-tools: Read Grep Glob\nrelated_skills:\n  upstream:\n    - qa-ai-prompt-strategy      # 输入：AI生成的测试用例\n    - qa-scenario-tree           # 可选输入：场景树（用于完整性评审）\n    - qa-risk-intuition          # 可选输入：风险清单（用于风险覆盖评审）\n  downstream:\n    - qa-ai-blindspot-compensation # 输出：评审结果传递给补盲\n    - qa-expert-review\n    - qa-output-validation\nreferences:\n  - references/report-templates.md\n  - references/review-dimensions.md\ninput_format:\n  required:\n    - name: AI生成测试用例\n      type: array\n      description: AI生成的测试用例列表\n  optional:\n    - name: 需求文档\n      type: string\n      description: 原始需求描述\n    - name: 评审标准\n      type: object\n      description: 评审维度和标准配置\noutput_format:\n  traceability:\n    - 本技能评审用例，不新增唯一ID；评审问题关联到原用例ID（TC-XXXX）\n  structure:\n    - critique_report: 八维评审报告（降级模式为六维）\n    - coverage_gaps: 覆盖遗漏清单\n    - quality_score: 质量评分\n    - improvement_suggestions: 改进建议列表\ndepth_requirement_quantification:\n  reference_value: \"根据用例数量和复杂度调整评审深度：简单x1/中等x2/复杂x3\"\n  minimum: \"至少覆盖功能正确性、边界条件、异常场景3个评审维度\"\ncategories: ['Development','Testing','AI']\nerror_recovery_guidance:\n  on_failure: \"评审发现系统性问题时回退到AI生成步骤修正\"\n  retry_behavior: \"修正提示词或上下文后重新生成并评审\"\n---\n> **⚠️ 安全警告**：本技能的示例可能涉及测试用例整理、合并或删除建议。\n> 实际使用时请勿直接执行批量删除操作，先备份原数据并确认非关键用例。\n> 本技能仅在 workspace/ 输出评估文件，不持久化、不外传、不跨会话复用。\n\n# AI 输出评审\n\n## 使用逻辑\n\n本技能分为四个阶段，按顺序执行：\n\n```text\n阶段一：评审框架（八维评审法）\n    │\n    │  使用八维评审法对AI输出进行系统打分\n    │  输出：评审报告（评分 + 问题清单）\n    │\n    ▼\n阶段二：报告模板（输出格式）\n    │\n    │  按标准格式输出评审结果\n    │  输出：结构化评审报告\n    │\n    ▼\n阶段三：追问问法（深入挖掘）\n    │\n    │  使用追问技巧引导发现问题\n    │  输出：更深层的质量洞察\n    │\n    ▼\n阶段四：辅助工具（假设挖掘/反驳机制/投入产出评估）\n    │\n    │  补充评审维度，提升评审深度\n    │  输出：完整评审结论\n```\n\n**关键点**：阶段三的\"追问问法\"是在评审报告输出后使用的，用于引导发现更深层的问题，不是独立的评审体系。\n\n## 输入要求\n\n### 必填输入\n- AI生成的测试用例\n\n### 推荐输入（提供则评审更准确）\n- 场景树（来自qa-scenario-tree）：用于完整性评审，判断场景覆盖率\n- 风险清单（来自qa-risk-intuition）：用于风险覆盖评审，判断高风险区域是否深测\n- 需求ID列表：用于追溯性评审，判断用例是否可追溯\n\n### 降级策略\n如果缺少推荐输入：\n\n| 缺少的输入 | 评审策略 | 降级处理 |\n|-----------|----------|----------|\n| 场景树 | 完整性评审 | 基于通用场景清单（主流程/分支/异常/边界） |\n| 风险清单 | 风险覆盖评审 | 基于默认风险类型（资金/安全/并发/数据一致性） |\n| 需求ID列表 | 追溯性评审 | 跳过，标记为\"需补充追溯信息\" |\n\n## 评审模式\n\n### 模式A：完整评审（有场景树和风险清单）\n- 八维评审全部启用\n- 输出完整评审报告\n- 适用场景：工作流中的标准评审\n\n### 模式B：快速评审（无上游数据）\n- 启用六维评审（跳过追溯性，简化完整性）\n- 输出简化评审报告\n- 标注\"建议补充场景树后重新评审\"\n- 适用场景：独立使用、快速检查\n\n### 模式选择规则\n```text\n有场景树 AND 有风险清单 → 模式A（完整评审）\n否则 → 模式B（快速评审）\n```\n\n## 核心原则\n\nAI输出看起来都对，但专家能看出哪里不够。\n\n## 八维评审法速查\n\n**评分标准**：每维度10分，总分≥64分为合格。详见 [`references/review-dimensions.md`](references/review-dimensions.md)。\n\n| 维度 | 评分核心 | 核心关注 |\n|------|---------|---------|\n| 完整性 | 场景覆盖是否完整 | 主路径+分支+异常+边界 |\n| 正确性 | 业务规则和预期是否正确 | 内容正确性 |\n| 可执行性 | 步骤是否清晰可执行 | 可操作性 |\n| 风险覆盖 | 高风险区域是否深测 | 资金/安全/并发/数据 |\n| 规范性 | 格式是否符合标准 | 编号/表格/字段 |\n| 追溯性 | 需求/风险ID是否完整 | 需求追溯链 |\n| 一致性 | 用例间是否自相矛盾 | 前置与步骤匹配 |\n| 冗余度 | 是否有无价值用例 | 重复/低价值用例 |\n\n> 每维度的详细评分标准、评审清单和追问问法参见 [`references/review-dimensions.md`](references/review-dimensions.md)。\n\n## 评审报告模板\n\n详见 [`references/report-templates.md`](references/report-templates.md)，包含三种模板：\n- **完整评审报告（模式A）**：八维评分 + 问题清单 + 改进方向\n- **简化评审报告（模式B）**：六维评分 + 降级标注\n- **快速评审模板**：星级评价 + 主要问题 + 迭代方向\n\n## 假设挖掘\n\nAI输出中常见的隐含假设：\n\n| 假设类型 | 示例 | 验证方法 |\n|---------|------|---------|\n| 用户行为假设 | \"用户会正常输入\" | 追问：用户误输入怎么办？ |\n| 环境假设 | \"网络正常\" | 追问：网络异常时会怎样？ |\n| 数据假设 | \"数据格式正确\" | 追问：格式错误时怎么处理？ |\n| 时序假设 | \"操作按顺序执行\" | 追问：乱序执行会怎样？ |\n| 依赖假设 | \"第三方服务正常\" | 追问：第三方挂了怎么办？ |\n\n**挖掘问法**：\n```text\n请列出你在输出中做的所有假设\n哪些假设可能不成立？\n如果假设不成立，测试场景会有什么变化？\n```\n\n## 迭代决策树\n\n当AI输出不满意时：\n\n```text\n输出不满意\n    │\n    ├── 完整性不够？\n    │       └── 补充场景：请补充[缺失的场景类型]\n    │\n    ├── 深度不够？\n    │       └── 深入分析：请按[具体维度]深入分析\n    │\n    ├── 风险覆盖不足？\n    │       └── 重点强化：请对[高风险区域]做专项测试\n    │\n    ├── 有矛盾？\n    │       └── 修正一致性：请修正[具体矛盾点]\n    │\n    ├── 冗余过多？\n    │       └── 精简用例：请合并或删除[低价值用例]\n    │\n    └── 不可执行？\n            └── 调整可行性：请确保[测试步骤]可实际执行\n```\n\n## AI反驳机制\n\n让AI挑战你的假设，而不是迎合你。\n\n### 反驳问法模板\n\n```text\n模式1：质量负责人视角\n\"请站在质量负责人角度，指出可能遗漏的业务风险、过度测试的地方，\n以及上线前还需要确认的问题。\"\n\n模式2：故障反推视角\n\"请假设这个功能上线后出现严重问题，反推我现在的测试方案\n可能漏掉了什么。\"\n\n模式3：资源约束视角\n\"测试资源有限，请评估这些用例的投入产出比，\n哪些是必须测的，哪些可以简化或跳过。\"\n\n模式4：竞品对比视角\n\"如果竞争对手的同类功能比我们更稳定，可能是因为\n他们多测了哪些我们没覆盖的场景？\"\n```\n\n### 反驳检查清单\n\n- [ ] 是否要求AI挑战你的假设？\n- [ ] 是否让AI从反面看问题？\n- [ ] 是否评估了投入产出比？\n- [ ] 是否识别了过度测试的区域？\n\n## 投入产出评估\n\n### 评估维度\n\n| 维度 | 评估标准 | 权重 |\n|------|---------|------|\n| 业务价值 | 影响用户数×影响程度 | 40% |\n| 风险等级 | 发生概率×影响程度 | 30% |\n| 测试成本 | 用例数×执行时间 | 20% |\n| 自动化潜力 | 是否适合自动化 | 10% |\n\n### 评估矩阵\n\n| 用例类型 | 业务价值 | 风险等级 | 测试成本 | 建议 |\n|---------|---------|---------|---------|------|\n| P0+高风险 | 高 | 高 | 中 | 必须测试，优先自动化 |\n| P0+低风险 | 高 | 低 | 低 | 必须测试，手动即可 |\n| P1+高风险 | 中 | 高 | 中 | 必须测试，考虑自动化 |\n| P1+低风险 | 中 | 低 | 低 | 选择性测试 |\n| P2+高风险 | 低 | 高 | 中 | 评估后决定 |\n| P2+低风险 | 低 | 低 | 低 | 可跳过或简化 |\n\n### ROI计算公式\n\n```text\nROI = (业务价值 × 风险等级) / 测试成本\n\n示例：\n用例A：业务价值=5, 风险等级=5, 测试成本=2\nROI = (5×5)/2 = 12.5 → 高ROI，优先测试\n\n用例B：业务价值=2, 风险等级=2, 测试成本=5\nROI = (2×2)/5 = 0.8 → 低ROI，可简化\n```\n\n## 检查清单\n\n评审完成后检查：\n\n- [ ] 是否识别了AI的隐含假设？\n- [ ] 是否评估了覆盖完整性？\n- [ ] 是否检查了一致性？\n- [ ] 是否评估了冗余度？\n- [ ] 是否有明确的迭代方向？\n- [ ] 评审报告是否可执行？\n- [ ] 是否标注了降级模式（如适用）？\n\nFile v1.6.3:_meta.json\n\n{\n  \"ownerId\": \"kn71y9b23csfx0ykgm55d5m9x5891zt8\",\n  \"slug\": \"qa-ai-output-critique\",\n  \"version\": \"1.6.3\",\n  \"publishedAt\": 1786548014856\n}\n\nFile v1.6.3:references/report-templates.md\n\n# 评审报告模板与输出示例\n\n> 本文档是 `qa-ai-output-critique` 的参考文件。执行评审时，按以下模板组织评审输出。\n\n---\n\n## 完整评审报告（模式A — 有场景树和风险清单）\n\n```markdown\n## AI输出评审报告\n\n### 评审摘要\n- 评审日期：YYYY-MM-DD\n- 评审模式：完整评审\n- 用例总数：XX条\n- 综合评分：XX/80分\n\n### 八维评分\n| 维度 | 分数 | 评价 | 改进建议 |\n|------|------|------|---------|\n| 完整性 | X/10 | [评价] | [建议] |\n| 正确性 | X/10 | [评价] | [建议] |\n| 可执行性 | X/10 | [评价] | [建议] |\n| 风险覆盖 | X/10 | [评价] | [建议] |\n| 规范性 | X/10 | [评价] | [建议] |\n| 追溯性 | X/10 | [评价] | [建议] |\n| 一致性 | X/10 | [评价] | [建议] |\n| 冗余度 | X/10 | [评价] | [建议] |\n\n### 问题清单\n| 用例编号 | 问题类型 | 问题描述 | 改进建议 |\n|---------|---------|---------|---------|\n| TC_XXX_001 | [类型] | [描述] | [建议] |\n\n### 改进方向\n1. [改进方向1]\n2. [改进方向2]\n3. [改进方向3]\n```\n\n---\n\n## 简化评审报告（模式B — 无上游数据）\n\n```markdown\n## AI输出评审报告\n\n### 评审摘要\n- 评审日期：YYYY-MM-DD\n- 评审模式：快速评审\n- 用例总数：XX条\n- 综合评分：XX/60分（跳过追溯性）\n- 建议：补充场景树和风险清单后重新评审\n\n### 六维评分\n| 维度 | 分数 | 评价 | 改进建议 |\n|------|------|------|---------|\n| 完整性 | X/10 | [评价] | [建议] |\n| 正确性 | X/10 | [评价] | [建议] |\n| 可执行性 | X/10 | [评价] | [建议] |\n| 风险覆盖 | X/10 | [评价] | [建议] |\n| 规范性 | X/10 | [评价] | [建议] |\n| 一致性 | X/10 | [评价] | [建议] |\n| 冗余度 | X/10 | [评价] | [建议] |\n\n### 问题清单\n| 用例编号 | 问题类型 | 问题描述 | 改进建议 |\n|---------|---------|---------|---------|\n| TC_XXX_001 | [类型] | [描述] | [建议] |\n\n### 改进方向\n1. [改进方向1]\n2. [改进方向2]\n3. [改进方向3]\n```\n\n---\n\n## 快速评审模板\n\n适用于快速输出评价场景，不使用完整表格：\n\n```markdown\n## AI输出评审报告\n\n### 总体评价\n- 完整性：⭐⭐⭐⭐☆\n- 正确性：⭐⭐⭐⭐☆\n- 可执行性：⭐⭐⭐☆☆\n- 风险覆盖：⭐⭐⭐⭐☆\n- 规范性：⭐⭐⭐⭐⭐\n- 追溯性：⭐⭐⭐⭐☆\n- 一致性：⭐⭐⭐⭐☆\n- 冗余度：⭐⭐⭐⭐☆\n\n### 主要问题\n1. [问题1]：[具体描述]\n2. [问题2]：[具体描述]\n\n### 改进建议\n1. [建议1]：[具体方向]\n2. [建议2]：[具体方向]\n\n### 迭代方向\n优先改进：[最关键的改进点]\n```\n\n---\n\n## 输出示例\n\n### 示例1：完整评审（有场景树）\n\n**输入**：AI生成的登录功能测试用例 + 场景树 + 风险清单\n\n**八维评审结果**：\n- 完整性7分：场景树显示10个场景，用例覆盖7个（70%）\n- 正确性9分：业务规则描述基本正确\n- 可执行性8分：大部分步骤清晰\n- 风险覆盖6分：风险清单显示3个高风险，用例覆盖1个\n- 规范性9分：格式规范\n- 追溯性8分：大部分有需求ID\n- 一致性9分：无明显矛盾\n- 冗余度9分：无明显冗余\n\n**综合评分**：65/80分（合格）\n\n**改进方向**：补充并发登录、密码暴力破解、Session超时场景\n\n### 示例2：快速评审（无上游数据）\n\n**输入**：AI生成的登录功能测试用例（无场景树和风险清单）\n\n**六维评审结果**：\n- 完整性6分：基于通用场景清单，缺少并发和安全场景\n- 正确性9分：业务规则描述正确\n- 可执行性8分：步骤清晰\n- 风险覆盖5分：未考虑高风险区域\n- 规范性9分：格式规范\n- 一致性9分：无明显矛盾\n- 冗余度9分：无明显冗余\n\n**综合评分**：55/60分（合格，但建议补充）\n\n**建议**：补充场景树和风险清单后重新评审\n\nFile v1.6.3:references/review-dimensions.md\n\n# 八维评审法 — 完整评审维度与评分标准\n\n> 本文档是 `qa-ai-output-critique` 的参考文件。执行评审时，按以下八维评分标准逐项打分。\n> 每维度 10 分，总分 ≥ 64 分为合格。\n\n---\n\n## 评分总览\n\n| 维度 | 评分核心 | 默认权重 |\n|------|---------|---------|\n| 完整性 | 场景覆盖是否完整 | 10分 |\n| 正确性 | 业务规则和预期是否正确 | 10分 |\n| 可执行性 | 步骤是否清晰可执行 | 10分 |\n| 风险覆盖 | 高风险区域是否深测 | 10分 |\n| 规范性 | 格式是否符合标准 | 10分 |\n| 追溯性 | 需求ID/风险ID是否完整 | 10分 |\n| 一致性 | 用例间是否自相矛盾 | 10分 |\n| 冗余度 | 是否有无价值用例 | 10分 |\n\n---\n\n## 1. 完整性评审（10分）\n\n**检查项**：是否覆盖了所有场景？\n\n```text\n评分标准：\n- 10分：覆盖所有主路径+分支+异常+边界（基于场景树）\n- 7分：覆盖主路径和主要异常\n- 4分：只覆盖主路径\n- 1分：严重缺失\n\n评审清单：\n- [ ] 主路径场景是否完整？\n- [ ] 分支路径是否覆盖？\n- [ ] 异常场景是否考虑？\n- [ ] 边界条件是否分析？\n- [ ] 非功能需求是否涉及？\n\n发现问题的问法：\n\"请列出你输出中未覆盖的场景类型\"\n\"对照场景树，检查覆盖率\"\n\"请按四维边界模型重新分析\"\n\"这个边界真的够深吗？\"\n\n降级模式（无场景树时）：\n- 基于通用场景清单检查：主流程、分支、异常、边界、非功能\n- 标注\"建议补充场景树后重新评审\"\n```\n\n---\n\n## 2. 正确性评审（10分）\n\n**检查项**：业务规则和预期结果是否正确？\n\n```text\n核心关注：对不对（内容正确性）\n\n评分标准：\n- 10分：业务规则正确、预期可验证\n- 7分：大部分正确，少量细节需调整\n- 4分：有多处错误\n- 1分：严重错误\n\n评审清单：\n- [ ] 业务规则描述是否符合需求？\n- [ ] 预期结果是否与实际系统行为一致？\n- [ ] 数据计算逻辑是否正确？\n- [ ] 状态转换描述是否准确？\n\n发现问题的问法：\n\"这个预期结果与实际系统行为一致吗？\"\n\"业务规则描述是否准确？\"\n\"这个状态转换逻辑对吗？\"\n```\n\n---\n\n## 3. 可执行性评审（10分）\n\n**检查项**：能不能实际执行？\n\n```text\n核心关注：能不能做（可操作性）\n\n评分标准：\n- 10分：步骤清晰、无歧义、可执行\n- 7分：大部分清晰，少量需补充\n- 4分：有多处模糊\n- 1分：无法执行\n\n评审清单：\n- [ ] 测试数据是否可构造？\n- [ ] 测试环境是否可搭建？\n- [ ] 测试步骤是否可重复？\n- [ ] 预期结果是否可观测？\n\n发现问题的问法：\n\"这个用例能实际执行吗？\"\n\"测试数据从哪来？\"\n\"测试环境怎么搭建？\"\n```\n\n---\n\n## 4. 风险覆盖评审（10分）\n\n**检查项**：高风险区域是否深测？\n\n```text\n评分标准：\n- 10分：高风险区域100%覆盖（基于风险清单）\n- 7分：高风险区域80%覆盖\n- 4分：高风险区域50%覆盖\n- 1分：高风险区域未覆盖\n\n评审清单：\n- [ ] 资金相关场景是否深测？\n- [ ] 安全相关场景是否覆盖？\n- [ ] 并发场景是否考虑？\n- [ ] 异常恢复是否验证？\n- [ ] 数据一致性是否验证？\n- [ ] 第三方依赖是否Mock？\n\n发现问题的问法：\n\"这个功能挂了影响多大？\"\n\"高风险区域测试深度够吗？\"\n\n降级模式（无风险清单时）：\n- 基于默认风险类型检查：资金、安全、并发、数据一致性\n- 标注\"建议补充风险清单后重新评审\"\n```\n\n---\n\n## 5. 规范性评审（10分）\n\n**检查项**：格式是否符合标准？\n\n```text\n评分标准：\n- 10分：完全符合标准\n- 7分：大部分符合，少量需调整\n- 4分：格式混乱\n- 1分：无格式\n\n评审清单：\n- [ ] 用例编号是否规范？\n- [ ] 表格格式是否正确？\n- [ ] 字段是否完整？\n- [ ] 描述是否简洁？\n```\n\n---\n\n## 6. 追溯性评审（10分）\n\n**检查项**：需求ID/风险ID是否完整？\n\n```text\n评分标准：\n- 10分：每条用例都有需求ID和风险ID\n- 7分：大部分有，少量缺失\n- 4分：只有部分有\n- 1分：无追溯信息\n\n评审清单：\n- [ ] 每条用例是否关联需求ID？\n- [ ] 每条用例是否关联风险ID？\n- [ ] ID格式是否统一？\n- [ ] 追溯链是否完整？\n\n降级模式（无需求ID列表时）：\n- 跳过此维度\n- 标注\"需补充追溯信息\"\n```\n\n---\n\n## 7. 一致性评审（10分）\n\n**检查项**：用例间是否自相矛盾？\n\n```text\n评分标准：\n- 10分：完全一致，无矛盾\n- 7分：大部分一致，少量需调整\n- 4分：有多处矛盾\n- 1分：严重矛盾\n\n评审清单：\n- [ ] 前置条件和测试步骤是否一致？\n- [ ] 不同用例间是否有冲突？\n- [ ] 业务规则是否统一？\n- [ ] 预期结果是否互斥？\n\n发现问题的问法：\n\"检查这些用例间是否有矛盾\"\n\"前置条件和步骤是否匹配？\"\n```\n\n---\n\n## 8. 冗余度评审（10分）\n\n**检查项**：有没有无价值用例？\n\n```text\n评分标准：\n- 10分：无冗余，每条用例都有价值\n- 7分：少量冗余\n- 4分：有多处冗余\n- 1分：大量冗余\n\n评审清单：\n- [ ] 是否有重复覆盖的场景？\n- [ ] 是否有低价值用例？\n- [ ] 优先级标注是否合理？\n- [ ] 测试效率是否最优？\n\n发现问题的问法：\n\"删除哪些用例不影响覆盖率？\"\n\"哪些用例可以合并？\"\n```\n\nFile v1.6.3:skill-card.md\n\n## Description:\n\nReviews AI-generated test cases across eight QA dimensions and downgrades to a six-dimension review when upstream scenario trees or risk lists are unavailable.\n\nThis skill is ready for commercial/non-commercial use.\n\n## Publisher:\n\n[kokxi](https://clawhub.ai/user/kokxi)\n\n### License/Terms of Use:\n\nMIT-0\n\n## Use Case:\n\nQA engineers, testers, and developers use this skill after AI generates test cases to score completeness, correctness, executability, risk coverage, formatting, consistency, traceability, and redundancy, then identify gaps and improvement suggestions.\n\n### Deployment Geography for Use:\n\nGlobal\n\n## Known Risks and Mitigations:\n\nRisk: The skill may activate on broad requests to check output rather than deliberate test-case review.\n\nMitigation: Use it when the user specifically wants AI-generated test cases reviewed, and confirm scope before applying the critique.\n\nRisk: Merge, delete, or simplification recommendations could remove useful or critical test cases if applied blindly.\n\nMitigation: Treat cleanup recommendations as review suggestions requiring human confirmation and back up source test cases before bulk changes.\n\n## Reference(s):\n\n- [Review Dimensions](references/review-dimensions.md)\n- [Report Templates](references/report-templates.md)\n- [ClawHub Skill Page](https://clawhub.ai/kokxi/skills/qa-ai-output-critique)\n\n## Skill Output:\n\n**Output Type(s):** [Text, Markdown, Guidance]\n\n**Output Format:** [Markdown review report with scored tables, issue lists, coverage gaps, quality score, and improvement suggestions]\n\n**Output Parameters:** [1D]\n\n**Other Properties Related to Output:** [Read-only review guidance; recommendations require human confirmation before acting on test cases.]\n\n## Skill Version(s):\n\n1.6.3 (source: server release metadata and SKILL.md frontmatter)\n\n## Ethical Considerations:\n\nUsers should evaluate whether this skill is appropriate for their environment, review any generated or modified files before relying on them, and apply their organization's safety, security, and compliance requirements before deployment.\n\nArchive v1.6.0: 5 files, 9514 bytes\n\nFiles: references/report-templates.md (3881b), references/review-dimensions.md (5484b), skill-card.md (2556b), SKILL.md (10330b), _meta.json (140b)\n\nFile v1.6.0:SKILL.md\n\n---\r\nname: qa-ai-output-critique\r\nversion: 1.6.0\r\ndescription: >-\r\n  对AI生成的测试用例进行六维评审（完整性、准确性、可执行性、风险覆盖、规范性、追溯性），是AI生成用例后的第一个质量门禁。当AI刚刚生成了一大批测试用例、你需要确保这些用例真的有价值而不是\"看起来不错\"时，应当使用此技能。不要假设AI输出的都是对的——AI经常生成语义正确但实际操作不了的用例。每个维度评分低于7分的必须标注问题并使用MISSING/WRONG/VAGUE等规范格式标记。\r\n\r\nwhen_to_use: AI生成用例后自动激活（最终输出前的必过门禁）；用户说\"检查一下输出\"、\"评审用例质量\"、\"验证完整性\"、\"这个用例对吗\"、\"自动检查\"时\r\nallowed-tools: Read Grep Glob\r\nrelated_skills:\r\n  upstream:\r\n    - qa-ai-prompt-strategy      # 输入：AI生成的测试用例\r\n    - qa-scenario-tree           # 可选输入：场景树（用于完整性评审）\r\n    - qa-risk-intuition          # 可选输入：风险清单（用于风险覆盖评审）\r\n  downstream:\r\n    - qa-ai-blindspot-compensation # 输出：评审结果传递给补盲\r\n    - qa-expert-review\r\n    - qa-output-validation\r\nreferences:\r\n  - references/report-templates.md\r\n  - references/review-dimensions.md\r\ninput_format:\r\n  required:\r\n    - name: AI生成测试用例\r\n      type: array\r\n      description: AI生成的测试用例列表\r\n  optional:\r\n    - name: 需求文档\r\n      type: string\r\n      description: 原始需求描述\r\n    - name: 评审标准\r\n      type: object\r\n      description: 评审维度和标准配置\r\noutput_format:\r\n  traceability:\r\n    - 本技能评审用例，不新增唯一ID；评审问题关联到原用例ID（TC-XXXX）\r\n  structure:\r\n    - critique_report: 六维评审报告\r\n    - coverage_gaps: 覆盖遗漏清单\r\n    - quality_score: 质量评分\r\n    - improvement_suggestions: 改进建议列表\r\ndepth_requirement_quantification:\r\n  reference_value: \"根据用例数量和复杂度调整评审深度：简单x1/中等x2/复杂x3\"\r\n  minimum: \"至少覆盖功能正确性、边界条件、异常场景3个评审维度\"\r\ncategories: ['Development','Testing','AI']\r\nerror_recovery_guidance:\r\n  on_failure: \"评审发现系统性问题时回退到AI生成步骤修正\"\r\n  retry_behavior: \"修正提示词或上下文后重新生成并评审\"\r\n---\r\n> **⚠️ 安全警告**：本技能的示例可能涉及测试用例整理、合并或删除建议。\r\n> 实际使用时请勿直接执行批量删除操作，先备份原数据并确认非关键用例。\r\n> 本技能仅在 workspace/ 输出评估文件，不持久化、不外传、不跨会话复用。\r\n\r\n# AI 输出评审\r\n\r\n## 使用逻辑\r\n\r\n本技能分为四个阶段，按顺序执行：\r\n\r\n```text\r\n阶段一：评审框架（八维评审法）\r\n    │\r\n    │  使用八维评审法对AI输出进行系统打分\r\n    │  输出：评审报告（评分 + 问题清单）\r\n    │\r\n    ▼\r\n阶段二：报告模板（输出格式）\r\n    │\r\n    │  按标准格式输出评审结果\r\n    │  输出：结构化评审报告\r\n    │\r\n    ▼\r\n阶段三：追问问法（深入挖掘）\r\n    │\r\n    │  使用追问技巧引导发现问题\r\n    │  输出：更深层的质量洞察\r\n    │\r\n    ▼\r\n阶段四：辅助工具（假设挖掘/反驳机制/投入产出评估）\r\n    │\r\n    │  补充评审维度，提升评审深度\r\n    │  输出：完整评审结论\r\n```\r\n\r\n**关键点**：阶段三的\"追问问法\"是在评审报告输出后使用的，用于引导发现更深层的问题，不是独立的评审体系。\r\n\r\n## 输入要求\r\n\r\n### 必填输入\r\n- AI生成的测试用例\r\n\r\n### 推荐输入（提供则评审更准确）\r\n- 场景树（来自qa-scenario-tree）：用于完整性评审，判断场景覆盖率\r\n- 风险清单（来自qa-risk-intuition）：用于风险覆盖评审，判断高风险区域是否深测\r\n- 需求ID列表：用于追溯性评审，判断用例是否可追溯\r\n\r\n### 降级策略\r\n如果缺少推荐输入：\r\n\r\n| 缺少的输入 | 评审策略 | 降级处理 |\r\n|-----------|----------|----------|\r\n| 场景树 | 完整性评审 | 基于通用场景清单（主流程/分支/异常/边界） |\r\n| 风险清单 | 风险覆盖评审 | 基于默认风险类型（资金/安全/并发/数据一致性） |\r\n| 需求ID列表 | 追溯性评审 | 跳过，标记为\"需补充追溯信息\" |\r\n\r\n## 评审模式\r\n\r\n### 模式A：完整评审（有场景树和风险清单）\r\n- 八维评审全部启用\r\n- 输出完整评审报告\r\n- 适用场景：工作流中的标准评审\r\n\r\n### 模式B：快速评审（无上游数据）\r\n- 启用六维评审（跳过追溯性，简化完整性）\r\n- 输出简化评审报告\r\n- 标注\"建议补充场景树后重新评审\"\r\n- 适用场景：独立使用、快速检查\r\n\r\n### 模式选择规则\r\n```text\r\n有场景树 AND 有风险清单 → 模式A（完整评审）\r\n否则 → 模式B（快速评审）\r\n```\r\n\r\n## 核心原则\r\n\r\nAI输出看起来都对，但专家能看出哪里不够。\r\n\r\n## 八维评审法速查\r\n\r\n**评分标准**：每维度10分，总分≥64分为合格。详见 [`references/review-dimensions.md`](references/review-dimensions.md)。\r\n\r\n| 维度 | 评分核心 | 核心关注 |\r\n|------|---------|---------|\r\n| 完整性 | 场景覆盖是否完整 | 主路径+分支+异常+边界 |\r\n| 正确性 | 业务规则和预期是否正确 | 内容正确性 |\r\n| 可执行性 | 步骤是否清晰可执行 | 可操作性 |\r\n| 风险覆盖 | 高风险区域是否深测 | 资金/安全/并发/数据 |\r\n| 规范性 | 格式是否符合标准 | 编号/表格/字段 |\r\n| 追溯性 | 需求/风险ID是否完整 | 需求追溯链 |\r\n| 一致性 | 用例间是否自相矛盾 | 前置与步骤匹配 |\r\n| 冗余度 | 是否有无价值用例 | 重复/低价值用例 |\r\n\r\n> 每维度的详细评分标准、评审清单和追问问法参见 [`references/review-dimensions.md`](references/review-dimensions.md)。\r\n\r\n## 评审报告模板\r\n\r\n详见 [`references/report-templates.md`](references/report-templates.md)，包含三种模板：\r\n- **完整评审报告（模式A）**：八维评分 + 问题清单 + 改进方向\r\n- **简化评审报告（模式B）**：六维评分 + 降级标注\r\n- **快速评审模板**：星级评价 + 主要问题 + 迭代方向\r\n\r\n## 假设挖掘\r\n\r\nAI输出中常见的隐含假设：\r\n\r\n| 假设类型 | 示例 | 验证方法 |\r\n|---------|------|---------|\r\n| 用户行为假设 | \"用户会正常输入\" | 追问：用户误输入怎么办？ |\r\n| 环境假设 | \"网络正常\" | 追问：网络异常时会怎样？ |\r\n| 数据假设 | \"数据格式正确\" | 追问：格式错误时怎么处理？ |\r\n| 时序假设 | \"操作按顺序执行\" | 追问：乱序执行会怎样？ |\r\n| 依赖假设 | \"第三方服务正常\" | 追问：第三方挂了怎么办？ |\r\n\r\n**挖掘问法**：\r\n```text\r\n请列出你在输出中做的所有假设\r\n哪些假设可能不成立？\r\n如果假设不成立，测试场景会有什么变化？\r\n```\r\n\r\n## 迭代决策树\r\n\r\n当AI输出不满意时：\r\n\r\n```text\r\n输出不满意\r\n    │\r\n    ├── 完整性不够？\r\n    │       └── 补充场景：请补充[缺失的场景类型]\r\n    │\r\n    ├── 深度不够？\r\n    │       └── 深入分析：请按[具体维度]深入分析\r\n    │\r\n    ├── 风险覆盖不足？\r\n    │       └── 重点强化：请对[高风险区域]做专项测试\r\n    │\r\n    ├── 有矛盾？\r\n    │       └── 修正一致性：请修正[具体矛盾点]\r\n    │\r\n    ├── 冗余过多？\r\n    │       └── 精简用例：请合并或删除[低价值用例]\r\n    │\r\n    └── 不可执行？\r\n            └── 调整可行性：请确保[测试步骤]可实际执行\r\n```\r\n\r\n## AI反驳机制\r\n\r\n让AI挑战你的假设，而不是迎合你。\r\n\r\n### 反驳问法模板\r\n\r\n```text\r\n模式1：质量负责人视角\r\n\"请站在质量负责人角度，指出可能遗漏的业务风险、过度测试的地方，\r\n以及上线前还需要确认的问题。\"\r\n\r\n模式2：故障反推视角\r\n\"请假设这个功能上线后出现严重问题，反推我现在的测试方案\r\n可能漏掉了什么。\"\r\n\r\n模式3：资源约束视角\r\n\"测试资源有限，请评估这些用例的投入产出比，\r\n哪些是必须测的，哪些可以简化或跳过。\"\r\n\r\n模式4：竞品对比视角\r\n\"如果竞争对手的同类功能比我们更稳定，可能是因为\r\n他们多测了哪些我们没覆盖的场景？\"\r\n```\r\n\r\n### 反驳检查清单\r\n\r\n- [ ] 是否要求AI挑战你的假设？\r\n- [ ] 是否让AI从反面看问题？\r\n- [ ] 是否评估了投入产出比？\r\n- [ ] 是否识别了过度测试的区域？\r\n\r\n## 投入产出评估\r\n\r\n### 评估维度\r\n\r\n| 维度 | 评估标准 | 权重 |\r\n|------|---------|------|\r\n| 业务价值 | 影响用户数×影响程度 | 40% |\r\n| 风险等级 | 发生概率×影响程度 | 30% |\r\n| 测试成本 | 用例数×执行时间 | 20% |\r\n| 自动化潜力 | 是否适合自动化 | 10% |\r\n\r\n### 评估矩阵\r\n\r\n| 用例类型 | 业务价值 | 风险等级 | 测试成本 | 建议 |\r\n|---------|---------|---------|---------|------|\r\n| P0+高风险 | 高 | 高 | 中 | 必须测试，优先自动化 |\r\n| P0+低风险 | 高 | 低 | 低 | 必须测试，手动即可 |\r\n| P1+高风险 | 中 | 高 | 中 | 必须测试，考虑自动化 |\r\n| P1+低风险 | 中 | 低 | 低 | 选择性测试 |\r\n| P2+高风险 | 低 | 高 | 中 | 评估后决定 |\r\n| P2+低风险 | 低 | 低 | 低 | 可跳过或简化 |\r\n\r\n### ROI计算公式\r\n\r\n```text\r\nROI = (业务价值 × 风险等级) / 测试成本\r\n\r\n示例：\r\n用例A：业务价值=5, 风险等级=5, 测试成本=2\r\nROI = (5×5)/2 = 12.5 → 高ROI，优先测试\r\n\r\n用例B：业务价值=2, 风险等级=2, 测试成本=5\r\nROI = (2×2)/5 = 0.8 → 低ROI，可简化\r\n```\r\n\r\n## 检查清单\r\n\r\n评审完成后检查：\r\n\r\n- [ ] 是否识别了AI的隐含假设？\r\n- [ ] 是否评估了覆盖完整性？\r\n- [ ] 是否检查了一致性？\r\n- [ ] 是否评估了冗余度？\r\n- [ ] 是否有明确的迭代方向？\r\n- [ ] 评审报告是否可执行？\r\n- [ ] 是否标注了降级模式（如适用）？\n\nFile v1.6.0:_meta.json\n\n{\n  \"ownerId\": \"kn71y9b23csfx0ykgm55d5m9x5891zt8\",\n  \"slug\": \"qa-ai-output-critique\",\n  \"version\": \"1.6.0\",\n  \"publishedAt\": 1783358028028\n}\n\nFile v1.6.0:references/report-templates.md\n\n# 评审报告模板与输出示例\n\n> 本文档是 `qa-ai-output-critique` 的参考文件。执行评审时，按以下模板组织评审输出。\n\n---\n\n## 完整评审报告（模式A — 有场景树和风险清单）\n\n```markdown\n## AI输出评审报告\n\n### 评审摘要\n- 评审日期：YYYY-MM-DD\n- 评审模式：完整评审\n- 用例总数：XX条\n- 综合评分：XX/80分\n\n### 八维评分\n| 维度 | 分数 | 评价 | 改进建议 |\n|------|------|------|---------|\n| 完整性 | X/10 | [评价] | [建议] |\n| 正确性 | X/10 | [评价] | [建议] |\n| 可执行性 | X/10 | [评价] | [建议] |\n| 风险覆盖 | X/10 | [评价] | [建议] |\n| 规范性 | X/10 | [评价] | [建议] |\n| 追溯性 | X/10 | [评价] | [建议] |\n| 一致性 | X/10 | [评价] | [建议] |\n| 冗余度 | X/10 | [评价] | [建议] |\n\n### 问题清单\n| 用例编号 | 问题类型 | 问题描述 | 改进建议 |\n|---------|---------|---------|---------|\n| TC_XXX_001 | [类型] | [描述] | [建议] |\n\n### 改进方向\n1. [改进方向1]\n2. [改进方向2]\n3. [改进方向3]\n```\n\n---\n\n## 简化评审报告（模式B — 无上游数据）\n\n```markdown\n## AI输出评审报告\n\n### 评审摘要\n- 评审日期：YYYY-MM-DD\n- 评审模式：快速评审\n- 用例总数：XX条\n- 综合评分：XX/60分（跳过追溯性）\n- 建议：补充场景树和风险清单后重新评审\n\n### 六维评分\n| 维度 | 分数 | 评价 | 改进建议 |\n|------|------|------|---------|\n| 完整性 | X/10 | [评价] | [建议] |\n| 正确性 | X/10 | [评价] | [建议] |\n| 可执行性 | X/10 | [评价] | [建议] |\n| 风险覆盖 | X/10 | [评价] | [建议] |\n| 规范性 | X/10 | [评价] | [建议] |\n| 一致性 | X/10 | [评价] | [建议] |\n| 冗余度 | X/10 | [评价] | [建议] |\n\n### 问题清单\n| 用例编号 | 问题类型 | 问题描述 | 改进建议 |\n|---------|---------|---------|---------|\n| TC_XXX_001 | [类型] | [描述] | [建议] |\n\n### 改进方向\n1. [改进方向1]\n2. [改进方向2]\n3. [改进方向3]\n```\n\n---\n\n## 快速评审模板\n\n适用于快速输出评价场景，不使用完整表格：\n\n```markdown\n## AI输出评审报告\n\n### 总体评价\n- 完整性：⭐⭐⭐⭐☆\n- 正确性：⭐⭐⭐⭐☆\n- 可执行性：⭐⭐⭐☆☆\n- 风险覆盖：⭐⭐⭐⭐☆\n- 规范性：⭐⭐⭐⭐⭐\n- 追溯性：⭐⭐⭐⭐☆\n- 一致性：⭐⭐⭐⭐☆\n- 冗余度：⭐⭐⭐⭐☆\n\n### 主要问题\n1. [问题1]：[具体描述]\n2. [问题2]：[具体描述]\n\n### 改进建议\n1. [建议1]：[具体方向]\n2. [建议2]：[具体方向]\n\n### 迭代方向\n优先改进：[最关键的改进点]\n```\n\n---\n\n## 输出示例\n\n### 示例1：完整评审（有场景树）\n\n**输入**：AI生成的登录功能测试用例 + 场景树 + 风险清单\n\n**八维评审结果**：\n- 完整性7分：场景树显示10个场景，用例覆盖7个（70%）\n- 正确性9分：业务规则描述基本正确\n- 可执行性8分：大部分步骤清晰\n- 风险覆盖6分：风险清单显示3个高风险，用例覆盖1个\n- 规范性9分：格式规范\n- 追溯性8分：大部分有需求ID\n- 一致性9分：无明显矛盾\n- 冗余度9分：无明显冗余\n\n**综合评分**：65/80分（合格）\n\n**改进方向**：补充并发登录、密码暴力破解、Session超时场景\n\n### 示例2：快速评审（无上游数据）\n\n**输入**：AI生成的登录功能测试用例（无场景树和风险清单）\n\n**六维评审结果**：\n- 完整性6分：基于通用场景清单，缺少并发和安全场景\n- 正确性9分：业务规则描述正确\n- 可执行性8分：步骤清晰\n- 风险覆盖5分：未考虑高风险区域\n- 规范性9分：格式规范\n- 一致性9分：无明显矛盾\n- 冗余度9分：无明显冗余\n\n**综合评分**：55/60分（合格，但建议补充）\n\n**建议**：补充场景树和风险清单后重新评审\n\nFile v1.6.0:references/review-dimensions.md\n\n# 八维评审法 — 完整评审维度与评分标准\n\n> 本文档是 `qa-ai-output-critique` 的参考文件。执行评审时，按以下八维评分标准逐项打分。\n> 每维度 10 分，总分 ≥ 64 分为合格。\n\n---\n\n## 评分总览\n\n| 维度 | 评分核心 | 默认权重 |\n|------|---------|---------|\n| 完整性 | 场景覆盖是否完整 | 10分 |\n| 正确性 | 业务规则和预期是否正确 | 10分 |\n| 可执行性 | 步骤是否清晰可执行 | 10分 |\n| 风险覆盖 | 高风险区域是否深测 | 10分 |\n| 规范性 | 格式是否符合标准 | 10分 |\n| 追溯性 | 需求ID/风险ID是否完整 | 10分 |\n| 一致性 | 用例间是否自相矛盾 | 10分 |\n| 冗余度 | 是否有无价值用例 | 10分 |\n\n---\n\n## 1. 完整性评审（10分）\n\n**检查项**：是否覆盖了所有场景？\n\n```text\n评分标准：\n- 10分：覆盖所有主路径+分支+异常+边界（基于场景树）\n- 7分：覆盖主路径和主要异常\n- 4分：只覆盖主路径\n- 1分：严重缺失\n\n评审清单：\n- [ ] 主路径场景是否完整？\n- [ ] 分支路径是否覆盖？\n- [ ] 异常场景是否考虑？\n- [ ] 边界条件是否分析？\n- [ ] 非功能需求是否涉及？\n\n发现问题的问法：\n\"请列出你输出中未覆盖的场景类型\"\n\"对照场景树，检查覆盖率\"\n\"请按四维边界模型重新分析\"\n\"这个边界真的够深吗？\"\n\n降级模式（无场景树时）：\n- 基于通用场景清单检查：主流程、分支、异常、边界、非功能\n- 标注\"建议补充场景树后重新评审\"\n```\n\n---\n\n## 2. 正确性评审（10分）\n\n**检查项**：业务规则和预期结果是否正确？\n\n```text\n核心关注：对不对（内容正确性）\n\n评分标准：\n- 10分：业务规则正确、预期可验证\n- 7分：大部分正确，少量细节需调整\n- 4分：有多处错误\n- 1分：严重错误\n\n评审清单：\n- [ ] 业务规则描述是否符合需求？\n- [ ] 预期结果是否与实际系统行为一致？\n- [ ] 数据计算逻辑是否正确？\n- [ ] 状态转换描述是否准确？\n\n发现问题的问法：\n\"这个预期结果与实际系统行为一致吗？\"\n\"业务规则描述是否准确？\"\n\"这个状态转换逻辑对吗？\"\n```\n\n---\n\n## 3. 可执行性评审（10分）\n\n**检查项**：能不能实际执行？\n\n```text\n核心关注：能不能做（可操作性）\n\n评分标准：\n- 10分：步骤清晰、无歧义、可执行\n- 7分：大部分清晰，少量需补充\n- 4分：有多处模糊\n- 1分：无法执行\n\n评审清单：\n- [ ] 测试数据是否可构造？\n- [ ] 测试环境是否可搭建？\n- [ ] 测试步骤是否可重复？\n- [ ] 预期结果是否可观测？\n\n发现问题的问法：\n\"这个用例能实际执行吗？\"\n\"测试数据从哪来？\"\n\"测试环境怎么搭建？\"\n```\n\n---\n\n## 4. 风险覆盖评审（10分）\n\n**检查项**：高风险区域是否深测？\n\n```text\n评分标准：\n- 10分：高风险区域100%覆盖（基于风险清单）\n- 7分：高风险区域80%覆盖\n- 4分：高风险区域50%覆盖\n- 1分：高风险区域未覆盖\n\n评审清单：\n- [ ] 资金相关场景是否深测？\n- [ ] 安全相关场景是否覆盖？\n- [ ] 并发场景是否考虑？\n- [ ] 异常恢复是否验证？\n- [ ] 数据一致性是否验证？\n- [ ] 第三方依赖是否Mock？\n\n发现问题的问法：\n\"这个功能挂了影响多大？\"\n\"高风险区域测试深度够吗？\"\n\n降级模式（无风险清单时）：\n- 基于默认风险类型检查：资金、安全、并发、数据一致性\n- 标注\"建议补充风险清单后重新评审\"\n```\n\n---\n\n## 5. 规范性评审（10分）\n\n**检查项**：格式是否符合标准？\n\n```text\n评分标准：\n- 10分：完全符合标准\n- 7分：大部分符合，少量需调整\n- 4分：格式混乱\n- 1分：无格式\n\n评审清单：\n- [ ] 用例编号是否规范？\n- [ ] 表格格式是否正确？\n- [ ] 字段是否完整？\n- [ ] 描述是否简洁？\n```\n\n---\n\n## 6. 追溯性评审（10分）\n\n**检查项**：需求ID/风险ID是否完整？\n\n```text\n评分标准：\n- 10分：每条用例都有需求ID和风险ID\n- 7分：大部分有，少量缺失\n- 4分：只有部分有\n- 1分：无追溯信息\n\n评审清单：\n- [ ] 每条用例是否关联需求ID？\n- [ ] 每条用例是否关联风险ID？\n- [ ] ID格式是否统一？\n- [ ] 追溯链是否完整？\n\n降级模式（无需求ID列表时）：\n- 跳过此维度\n- 标注\"需补充追溯信息\"\n```\n\n---\n\n## 7. 一致性评审（10分）\n\n**检查项**：用例间是否自相矛盾？\n\n```text\n评分标准：\n- 10分：完全一致，无矛盾\n- 7分：大部分一致，少量需调整\n- 4分：有多处矛盾\n- 1分：严重矛盾\n\n评审清单：\n- [ ] 前置条件和测试步骤是否一致？\n- [ ] 不同用例间是否有冲突？\n- [ ] 业务规则是否统一？\n- [ ] 预期结果是否互斥？\n\n发现问题的问法：\n\"检查这些用例间是否有矛盾\"\n\"前置条件和步骤是否匹配？\"\n```\n\n---\n\n## 8. 冗余度评审（10分）\n\n**检查项**：有没有无价值用例？\n\n```text\n评分标准：\n- 10分：无冗余，每条用例都有价值\n- 7分：少量冗余\n- 4分：有多处冗余\n- 1分：大量冗余\n\n评审清单：\n- [ ] 是否有重复覆盖的场景？\n- [ ] 是否有低价值用例？\n- [ ] 优先级标注是否合理？\n- [ ] 测试效率是否最优？\n\n发现问题的问法：\n\"删除哪些用例不影响覆盖率？\"\n\"哪些用例可以合并？\"\n```\n\nFile v1.6.0:skill-card.md\n\n## Description: <br>\nQA AI Output Critique reviews AI-generated test cases across completeness, correctness, executability, risk coverage, formatting, traceability, consistency, and redundancy, producing scored quality reports and improvement suggestions. <br>\n\nThis skill is ready for commercial/non-commercial use. <br>\n\n## Publisher: <br>\n[kokxi](https://clawhub.ai/user/kokxi) <br>\n\n### License/Terms of Use: <br>\nMIT-0 <br>\n\n\n## Use Case: <br>\nQA engineers and developers use this skill after AI generates test cases to critique their quality before final delivery, identify coverage gaps, and guide iteration. <br>\n\n### Deployment Geography for Use: <br>\nGlobal <br>\n\n## Known Risks and Mitigations: <br>\nRisk: General QA phrases such as \"check the output\" may trigger the skill when the user intended a different kind of review. <br>\nMitigation: Confirm the intended review target before applying the skill to broad or ambiguous QA requests. <br>\nRisk: The documentation mixes six- and eight-dimension review modes, which can make pass/fail thresholds inconsistent for strict quality gates. <br>\nMitigation: Standardize the selected review mode and scoring threshold before using the report as a gating result. <br>\nRisk: Review suggestions may include merging, simplifying, or deleting low-value test cases. <br>\nMitigation: Treat these as non-persistent review proposals; back up source test data and require human confirmation before changing or deleting cases. <br>\n\n\n## Reference(s): <br>\n- [ClawHub skill page](https://clawhub.ai/kokxi/skills/qa-ai-output-critique) <br>\n- [Publisher profile](https://clawhub.ai/user/kokxi) <br>\n- [Review dimensions](references/review-dimensions.md) <br>\n- [Report templates](references/report-templates.md) <br>\n\n\n## Skill Output: <br>\n**Output Type(s):** [text, markdown, guidance] <br>\n**Output Format:** [Markdown critique report with scores, issue tables, coverage gaps, quality score, and improvement suggestions.] <br>\n**Output Parameters:** [1D] <br>\n**Other Properties Related to Output:** [May operate in complete or quick review mode depending on whether scenario trees, risk lists, and traceability data are provided.] <br>\n\n## Skill Version(s): <br>\n1.6.0 (source: server release metadata and SKILL.md frontmatter) <br>\n\n## Ethical Considerations: <br>\nUsers should evaluate whether this skill is appropriate for their environment, review any generated or modified files before relying on them, and apply their organization's safety, security, and compliance requirements before deployment. <br>\n\nArchive v1.5.0: 5 files, 9074 bytes\n\nFiles: references/report-templates.md (3881b), references/review-dimensions.md (5484b), skill-card.md (2329b), SKILL.md (9747b), _meta.json (140b)\n\nFile v1.5.0:SKILL.md\n\n---\r\nname: qa-ai-output-critique\r\nversion: 1.5.0\r\ndescription: >-\r\n  对AI生成的测试用例进行六维评审（完整性、准确性、可执行性、风险覆盖、规范性、追溯性），是AI生成用例后的第一个质量门禁。当AI刚刚生成了一大批测试用例、你需要确保这些用例真的有价值而不是\"看起来不错\"时，应当使用此技能。不要假设AI输出的都是对的——AI经常生成语义正确但实际操作不了的用例。每个维度评分低于7分的必须标注问题并使用MISSING/WRONG/VAGUE等规范格式标记。\r\n\r\nwhen_to_use: AI生成用例后自动激活（最终输出前的必过门禁）；用户说\"检查一下输出\"、\"评审用例质量\"、\"验证完整性\"、\"这个用例对吗\"、\"自动检查\"时\r\nallowed-tools: Read Grep Glob\r\nrelated_skills:\r\n  upstream:\r\n    - qa-ai-prompt-strategy      # 输入：AI生成的测试用例\r\n    - qa-scenario-tree           # 可选输入：场景树（用于完整性评审）\r\n    - qa-risk-intuition          # 可选输入：风险清单（用于风险覆盖评审）\r\n  downstream:\r\n    - qa-ai-blindspot-compensation # 输出：评审结果传递给补盲\r\ninput_format:\r\n  required:\r\n    - name: AI生成测试用例\r\n      type: array\r\n      description: AI生成的测试用例列表\r\n  optional:\r\n    - name: 需求文档\r\n      type: string\r\n      description: 原始需求描述\r\n    - name: 评审标准\r\n      type: object\r\n      description: 评审维度和标准配置\r\noutput_format:\r\n  structure:\r\n    - critique_report: 六维评审报告\r\n    - coverage_gaps: 覆盖遗漏清单\r\n    - quality_score: 质量评分\r\n    - improvement_suggestions: 改进建议列表\r\ndepth_requirement_quantification:\r\n  reference_value: \"根据用例数量和复杂度调整评审深度：简单x1/中等x2/复杂x3\"\r\n  minimum: \"至少覆盖功能正确性、边界条件、异常场景3个评审维度\"\r\n---\r\n\r\n# AI 输出评审\r\n\r\n## 使用逻辑\r\n\r\n本技能分为四个阶段，按顺序执行：\r\n\r\n```text\r\n阶段一：评审框架（八维评审法）\r\n    │\r\n    │  使用八维评审法对AI输出进行系统打分\r\n    │  输出：评审报告（评分 + 问题清单）\r\n    │\r\n    ▼\r\n阶段二：报告模板（输出格式）\r\n    │\r\n    │  按标准格式输出评审结果\r\n    │  输出：结构化评审报告\r\n    │\r\n    ▼\r\n阶段三：追问问法（深入挖掘）\r\n    │\r\n    │  使用追问技巧引导发现问题\r\n    │  输出：更深层的质量洞察\r\n    │\r\n    ▼\r\n阶段四：辅助工具（假设挖掘/反驳机制/投入产出评估）\r\n    │\r\n    │  补充评审维度，提升评审深度\r\n    │  输出：完整评审结论\r\n```\r\n\r\n**关键点**：阶段三的\"追问问法\"是在评审报告输出后使用的，用于引导发现更深层的问题，不是独立的评审体系。\r\n\r\n## 输入要求\r\n\r\n### 必填输入\r\n- AI生成的测试用例\r\n\r\n### 推荐输入（提供则评审更准确）\r\n- 场景树（来自qa-scenario-tree）：用于完整性评审，判断场景覆盖率\r\n- 风险清单（来自qa-risk-intuition）：用于风险覆盖评审，判断高风险区域是否深测\r\n- 需求ID列表：用于追溯性评审，判断用例是否可追溯\r\n\r\n### 降级策略\r\n如果缺少推荐输入：\r\n\r\n| 缺少的输入 | 评审策略 | 降级处理 |\r\n|-----------|----------|----------|\r\n| 场景树 | 完整性评审 | 基于通用场景清单（主流程/分支/异常/边界） |\r\n| 风险清单 | 风险覆盖评审 | 基于默认风险类型（资金/安全/并发/数据一致性） |\r\n| 需求ID列表 | 追溯性评审 | 跳过，标记为\"需补充追溯信息\" |\r\n\r\n## 评审模式\r\n\r\n### 模式A：完整评审（有场景树和风险清单）\r\n- 八维评审全部启用\r\n- 输出完整评审报告\r\n- 适用场景：工作流中的标准评审\r\n\r\n### 模式B：快速评审（无上游数据）\r\n- 启用六维评审（跳过追溯性，简化完整性）\r\n- 输出简化评审报告\r\n- 标注\"建议补充场景树后重新评审\"\r\n- 适用场景：独立使用、快速检查\r\n\r\n### 模式选择规则\r\n```text\r\n有场景树 AND 有风险清单 → 模式A（完整评审）\r\n否则 → 模式B（快速评审）\r\n```\r\n\r\n## 核心原则\r\n\r\n你是一位测试质量评审专家，擅长识别AI输出的不足并给出改进方向。\r\n**核心原则**：AI输出看起来都对，但专家能看出哪里不够。\r\n本技能通过八维评审法系统评估AI输出质量。\r\n\r\n## 八维评审法速查\r\n\r\n**评分标准**：每维度10分，总分≥64分为合格。详见 [`references/review-dimensions.md`](references/review-dimensions.md)。\r\n\r\n| 维度 | 评分核心 | 核心关注 |\r\n|------|---------|---------|\r\n| 完整性 | 场景覆盖是否完整 | 主路径+分支+异常+边界 |\r\n| 正确性 | 业务规则和预期是否正确 | 内容正确性 |\r\n| 可执行性 | 步骤是否清晰可执行 | 可操作性 |\r\n| 风险覆盖 | 高风险区域是否深测 | 资金/安全/并发/数据 |\r\n| 规范性 | 格式是否符合标准 | 编号/表格/字段 |\r\n| 追溯性 | 需求/风险ID是否完整 | 需求追溯链 |\r\n| 一致性 | 用例间是否自相矛盾 | 前置与步骤匹配 |\r\n| 冗余度 | 是否有无价值用例 | 重复/低价值用例 |\r\n\r\n> 每维度的详细评分标准、评审清单和追问问法参见 [`references/review-dimensions.md`](references/review-dimensions.md)。\r\n\r\n## 评审报告模板\r\n\r\n详见 [`references/report-templates.md`](references/report-templates.md)，包含三种模板：\r\n- **完整评审报告（模式A）**：八维评分 + 问题清单 + 改进方向\r\n- **简化评审报告（模式B）**：六维评分 + 降级标注\r\n- **快速评审模板**：星级评价 + 主要问题 + 迭代方向\r\n\r\n## 假设挖掘\r\n\r\nAI输出中常见的隐含假设：\r\n\r\n| 假设类型 | 示例 | 验证方法 |\r\n|---------|------|---------|\r\n| 用户行为假设 | \"用户会正常输入\" | 追问：用户误输入怎么办？ |\r\n| 环境假设 | \"网络正常\" | 追问：网络异常时会怎样？ |\r\n| 数据假设 | \"数据格式正确\" | 追问：格式错误时怎么处理？ |\r\n| 时序假设 | \"操作按顺序执行\" | 追问：乱序执行会怎样？ |\r\n| 依赖假设 | \"第三方服务正常\" | 追问：第三方挂了怎么办？ |\r\n\r\n**挖掘问法**：\r\n```text\r\n请列出你在输出中做的所有假设\r\n哪些假设可能不成立？\r\n如果假设不成立，测试场景会有什么变化？\r\n```\r\n\r\n## 迭代决策树\r\n\r\n当AI输出不满意时：\r\n\r\n```text\r\n输出不满意\r\n    │\r\n    ├── 完整性不够？\r\n    │       └── 补充场景：请补充[缺失的场景类型]\r\n    │\r\n    ├── 深度不够？\r\n    │       └── 深入分析：请按[具体维度]深入分析\r\n    │\r\n    ├── 风险覆盖不足？\r\n    │       └── 重点强化：请对[高风险区域]做专项测试\r\n    │\r\n    ├── 有矛盾？\r\n    │       └── 修正一致性：请修正[具体矛盾点]\r\n    │\r\n    ├── 冗余过多？\r\n    │       └── 精简用例：请合并或删除[低价值用例]\r\n    │\r\n    └── 不可执行？\r\n            └── 调整可行性：请确保[测试步骤]可实际执行\r\n```\r\n\r\n## AI反驳机制\r\n\r\n**核心原则**：让AI挑战你的假设，而不是迎合你。\r\n\r\n### 反驳问法模板\r\n\r\n```text\r\n模式1：质量负责人视角\r\n\"请站在质量负责人角度，指出可能遗漏的业务风险、过度测试的地方，\r\n以及上线前还需要确认的问题。\"\r\n\r\n模式2：故障反推视角\r\n\"请假设这个功能上线后出现严重问题，反推我现在的测试方案\r\n可能漏掉了什么。\"\r\n\r\n模式3：资源约束视角\r\n\"测试资源有限，请评估这些用例的投入产出比，\r\n哪些是必须测的，哪些可以简化或跳过。\"\r\n\r\n模式4：竞品对比视角\r\n\"如果竞争对手的同类功能比我们更稳定，可能是因为\r\n他们多测了哪些我们没覆盖的场景？\"\r\n```\r\n\r\n### 反驳检查清单\r\n\r\n- [ ] 是否要求AI挑战你的假设？\r\n- [ ] 是否让AI从反面看问题？\r\n- [ ] 是否评估了投入产出比？\r\n- [ ] 是否识别了过度测试的区域？\r\n\r\n## 投入产出评估\r\n\r\n### 评估维度\r\n\r\n| 维度 | 评估标准 | 权重 |\r\n|------|---------|------|\r\n| 业务价值 | 影响用户数×影响程度 | 40% |\r\n| 风险等级 | 发生概率×影响程度 | 30% |\r\n| 测试成本 | 用例数×执行时间 | 20% |\r\n| 自动化潜力 | 是否适合自动化 | 10% |\r\n\r\n### 评估矩阵\r\n\r\n| 用例类型 | 业务价值 | 风险等级 | 测试成本 | 建议 |\r\n|---------|---------|---------|---------|------|\r\n| P0+高风险 | 高 | 高 | 中 | 必须测试，优先自动化 |\r\n| P0+低风险 | 高 | 低 | 低 | 必须测试，手动即可 |\r\n| P1+高风险 | 中 | 高 | 中 | 必须测试，考虑自动化 |\r\n| P1+低风险 | 中 | 低 | 低 | 选择性测试 |\r\n| P2+高风险 | 低 | 高 | 中 | 评估后决定 |\r\n| P2+低风险 | 低 | 低 | 低 | 可跳过或简化 |\r\n\r\n### ROI计算公式\r\n\r\n```text\r\nROI = (业务价值 × 风险等级) / 测试成本\r\n\r\n示例：\r\n用例A：业务价值=5, 风险等级=5, 测试成本=2\r\nROI = (5×5)/2 = 12.5 → 高ROI，优先测试\r\n\r\n用例B：业务价值=2, 风险等级=2, 测试成本=5\r\nROI = (2×2)/5 = 0.8 → 低ROI，可简化\r\n```\r\n\r\n## 检查清单\r\n\r\n评审完成后检查：\r\n\r\n- [ ] 是否识别了AI的隐含假设？\r\n- [ ] 是否评估了覆盖完整性？\r\n- [ ] 是否检查了一致性？\r\n- [ ] 是否评估了冗余度？\r\n- [ ] 是否有明确的迭代方向？\r\n- [ ] 评审报告是否可执行？\r\n- [ ] 是否标注了降级模式（如适用）？\n\nFile v1.5.0:_meta.json\n\n{\n  \"ownerId\": \"kn71y9b23csfx0ykgm55d5m9x5891zt8\",\n  \"slug\": \"qa-ai-output-critique\",\n  \"version\": \"1.5.0\",\n  \"publishedAt\": 1782736248514\n}\n\nFile v1.5.0:references/report-templates.md\n\n# 评审报告模板与输出示例\n\n> 本文档是 `qa-ai-output-critique` 的参考文件。执行评审时，按以下模板组织评审输出。\n\n---\n\n## 完整评审报告（模式A — 有场景树和风险清单）\n\n```markdown\n## AI输出评审报告\n\n### 评审摘要\n- 评审日期：YYYY-MM-DD\n- 评审模式：完整评审\n- 用例总数：XX条\n- 综合评分：XX/80分\n\n### 八维评分\n| 维度 | 分数 | 评价 | 改进建议 |\n|------|------|------|---------|\n| 完整性 | X/10 | [评价] | [建议] |\n| 正确性 | X/10 | [评价] | [建议] |\n| 可执行性 | X/10 | [评价] | [建议] |\n| 风险覆盖 | X/10 | [评价] | [建议] |\n| 规范性 | X/10 | [评价] | [建议] |\n| 追溯性 | X/10 | [评价] | [建议] |\n| 一致性 | X/10 | [评价] | [建议] |\n| 冗余度 | X/10 | [评价] | [建议] |\n\n### 问题清单\n| 用例编号 | 问题类型 | 问题描述 | 改进建议 |\n|---------|---------|---------|---------|\n| TC_XXX_001 | [类型] | [描述] | [建议] |\n\n### 改进方向\n1. [改进方向1]\n2. [改进方向2]\n3. [改进方向3]\n```\n\n---\n\n## 简化评审报告（模式B — 无上游数据）\n\n```markdown\n## AI输出评审报告\n\n### 评审摘要\n- 评审日期：YYYY-MM-DD\n- 评审模式：快速评审\n- 用例总数：XX条\n- 综合评分：XX/60分（跳过追溯性）\n- 建议：补充场景树和风险清单后重新评审\n\n### 六维评分\n| 维度 | 分数 | 评价 | 改进建议 |\n|------|------|------|---------|\n| 完整性 | X/10 | [评价] | [建议] |\n| 正确性 | X/10 | [评价] | [建议] |\n| 可执行性 | X/10 | [评价] | [建议] |\n| 风险覆盖 | X/10 | [评价] | [建议] |\n| 规范性 | X/10 | [评价] | [建议] |\n| 一致性 | X/10 | [评价] | [建议] |\n| 冗余度 | X/10 | [评价] | [建议] |\n\n### 问题清单\n| 用例编号 | 问题类型 | 问题描述 | 改进建议 |\n|---------|---------|---------|---------|\n| TC_XXX_001 | [类型] | [描述] | [建议] |\n\n### 改进方向\n1. [改进方向1]\n2. [改进方向2]\n3. [改进方向3]\n```\n\n---\n\n## 快速评审模板\n\n适用于快速输出评价场景，不使用完整表格：\n\n```markdown\n## AI输出评审报告\n\n### 总体评价\n- 完整性：⭐⭐⭐⭐☆\n- 正确性：⭐⭐⭐⭐☆\n- 可执行性：⭐⭐⭐☆☆\n- 风险覆盖：⭐⭐⭐⭐☆\n- 规范性：⭐⭐⭐⭐⭐\n- 追溯性：⭐⭐⭐⭐☆\n- 一致性：⭐⭐⭐⭐☆\n- 冗余度：⭐⭐⭐⭐☆\n\n### 主要问题\n1. [问题1]：[具体描述]\n2. [问题2]：[具体描述]\n\n### 改进建议\n1. [建议1]：[具体方向]\n2. [建议2]：[具体方向]\n\n### 迭代方向\n优先改进：[最关键的改进点]\n```\n\n---\n\n## 输出示例\n\n### 示例1：完整评审（有场景树）\n\n**输入**：AI生成的登录功能测试用例 + 场景树 + 风险清单\n\n**八维评审结果**：\n- 完整性7分：场景树显示10个场景，用例覆盖7个（70%）\n- 正确性9分：业务规则描述基本正确\n- 可执行性8分：大部分步骤清晰\n- 风险覆盖6分：风险清单显示3个高风险，用例覆盖1个\n- 规范性9分：格式规范\n- 追溯性8分：大部分有需求ID\n- 一致性9分：无明显矛盾\n- 冗余度9分：无明显冗余\n\n**综合评分**：65/80分（合格）\n\n**改进方向**：补充并发登录、密码暴力破解、Session超时场景\n\n### 示例2：快速评审（无上游数据）\n\n**输入**：AI生成的登录功能测试用例（无场景树和风险清单）\n\n**六维评审结果**：\n- 完整性6分：基于通用场景清单，缺少并发和安全场景\n- 正确性9分：业务规则描述正确\n- 可执行性8分：步骤清晰\n- 风险覆盖5分：未考虑高风险区域\n- 规范性9分：格式规范\n- 一致性9分：无明显矛盾\n- 冗余度9分：无明显冗余\n\n**综合评分**：55/60分（合格，但建议补充）\n\n**建议**：补充场景树和风险清单后重新评审\n\nFile v1.5.0:references/review-dimensions.md\n\n# 八维评审法 — 完整评审维度与评分标准\n\n> 本文档是 `qa-ai-output-critique` 的参考文件。执行评审时，按以下八维评分标准逐项打分。\n> 每维度 10 分，总分 ≥ 64 分为合格。\n\n---\n\n## 评分总览\n\n| 维度 | 评分核心 | 默认权重 |\n|------|---------|---------|\n| 完整性 | 场景覆盖是否完整 | 10分 |\n| 正确性 | 业务规则和预期是否正确 | 10分 |\n| 可执行性 | 步骤是否清晰可执行 | 10分 |\n| 风险覆盖 | 高风险区域是否深测 | 10分 |\n| 规范性 | 格式是否符合标准 | 10分 |\n| 追溯性 | 需求ID/风险ID是否完整 | 10分 |\n| 一致性 | 用例间是否自相矛盾 | 10分 |\n| 冗余度 | 是否有无价值用例 | 10分 |\n\n---\n\n## 1. 完整性评审（10分）\n\n**检查项**：是否覆盖了所有场景？\n\n```text\n评分标准：\n- 10分：覆盖所有主路径+分支+异常+边界（基于场景树）\n- 7分：覆盖主路径和主要异常\n- 4分：只覆盖主路径\n- 1分：严重缺失\n\n评审清单：\n- [ ] 主路径场景是否完整？\n- [ ] 分支路径是否覆盖？\n- [ ] 异常场景是否考虑？\n- [ ] 边界条件是否分析？\n- [ ] 非功能需求是否涉及？\n\n发现问题的问法：\n\"请列出你输出中未覆盖的场景类型\"\n\"对照场景树，检查覆盖率\"\n\"请按四维边界模型重新分析\"\n\"这个边界真的够深吗？\"\n\n降级模式（无场景树时）：\n- 基于通用场景清单检查：主流程、分支、异常、边界、非功能\n- 标注\"建议补充场景树后重新评审\"\n```\n\n---\n\n## 2. 正确性评审（10分）\n\n**检查项**：业务规则和预期结果是否正确？\n\n```text\n核心关注：对不对（内容正确性）\n\n评分标准：\n- 10分：业务规则正确、预期可验证\n- 7分：大部分正确，少量细节需调整\n- 4分：有多处错误\n- 1分：严重错误\n\n评审清单：\n- [ ] 业务规则描述是否符合需求？\n- [ ] 预期结果是否与实际系统行为一致？\n- [ ] 数据计算逻辑是否正确？\n- [ ] 状态转换描述是否准确？\n\n发现问题的问法：\n\"这个预期结果与实际系统行为一致吗？\"\n\"业务规则描述是否准确？\"\n\"这个状态转换逻辑对吗？\"\n```\n\n---\n\n## 3. 可执行性评审（10分）\n\n**检查项**：能不能实际执行？\n\n```text\n核心关注：能不能做（可操作性）\n\n评分标准：\n- 10分：步骤清晰、无歧义、可执行\n- 7分：大部分清晰，少量需补充\n- 4分：有多处模糊\n- 1分：无法执行\n\n评审清单：\n- [ ] 测试数据是否可构造？\n- [ ] 测试环境是否可搭建？\n- [ ] 测试步骤是否可重复？\n- [ ] 预期结果是否可观测？\n\n发现问题的问法：\n\"这个用例能实际执行吗？\"\n\"测试数据从哪来？\"\n\"测试环境怎么搭建？\"\n```\n\n---\n\n## 4. 风险覆盖评审（10分）\n\n**检查项**：高风险区域是否深测？\n\n```text\n评分标准：\n- 10分：高风险区域100%覆盖（基于风险清单）\n- 7分：高风险区域80%覆盖\n- 4分：高风险区域50%覆盖\n- 1分：高风险区域未覆盖\n\n评审清单：\n- [ ] 资金相关场景是否深测？\n- [ ] 安全相关场景是否覆盖？\n- [ ] 并发场景是否考虑？\n- [ ] 异常恢复是否验证？\n- [ ] 数据一致性是否验证？\n- [ ] 第三方依赖是否Mock？\n\n发现问题的问法：\n\"这个功能挂了影响多大？\"\n\"高风险区域测试深度够吗？\"\n\n降级模式（无风险清单时）：\n- 基于默认风险类型检查：资金、安全、并发、数据一致性\n- 标注\"建议补充风险清单后重新评审\"\n```\n\n---\n\n## 5. 规范性评审（10分）\n\n**检查项**：格式是否符合标准？\n\n```text\n评分标准：\n- 10分：完全符合标准\n- 7分：大部分符合，少量需调整\n- 4分：格式混乱\n- 1分：无格式\n\n评审清单：\n- [ ] 用例编号是否规范？\n- [ ] 表格格式是否正确？\n- [ ] 字段是否完整？\n- [ ] 描述是否简洁？\n```\n\n---\n\n## 6. 追溯性评审（10分）\n\n**检查项**：需求ID/风险ID是否完整？\n\n```text\n评分标准：\n- 10分：每条用例都有需求ID和风险ID\n- 7分：大部分有，少量缺失\n- 4分：只有部分有\n- 1分：无追溯信息\n\n评审清单：\n- [ ] 每条用例是否关联需求ID？\n- [ ] 每条用例是否关联风险ID？\n- [ ] ID格式是否统一？\n- [ ] 追溯链是否完整？\n\n降级模式（无需求ID列表时）：\n- 跳过此维度\n- 标注\"需补充追溯信息\"\n```\n\n---\n\n## 7. 一致性评审（10分）\n\n**检查项**：用例间是否自相矛盾？\n\n```text\n评分标准：\n- 10分：完全一致，无矛盾\n- 7分：大部分一致，少量需调整\n- 4分：有多处矛盾\n- 1分：严重矛盾\n\n评审清单：\n- [ ] 前置条件和测试步骤是否一致？\n- [ ] 不同用例间是否有冲突？\n- [ ] 业务规则是否统一？\n- [ ] 预期结果是否互斥？\n\n发现问题的问法：\n\"检查这些用例间是否有矛盾\"\n\"前置条件和步骤是否匹配？\"\n```\n\n---\n\n## 8. 冗余度评审（10分）\n\n**检查项**：有没有无价值用例？\n\n```text\n评分标准：\n- 10分：无冗余，每条用例都有价值\n- 7分：少量冗余\n- 4分：有多处冗余\n- 1分：大量冗余\n\n评审清单：\n- [ ] 是否有重复覆盖的场景？\n- [ ] 是否有低价值用例？\n- [ ] 优先级标注是否合理？\n- [ ] 测试效率是否最优？\n\n发现问题的问法：\n\"删除哪些用例不影响覆盖率？\"\n\"哪些用例可以合并？\"\n```\n\nFile v1.5.0:skill-card.md\n\n## Description: <br>\nReviews AI-generated test cases across quality dimensions including completeness, correctness, executability, risk coverage, formatting, traceability, consistency, and redundancy. <br>\n\nThis skill is ready for commercial/non-commercial use. <br>\n\n## Publisher: <br>\n[kokxi](https://clawhub.ai/user/kokxi) <br>\n\n### License/Terms of Use: <br>\nMIT-0 <br>\n\n\n## Use Case: <br>\nDevelopers, QA engineers, and test reviewers use this skill after an agent generates test cases to check whether the cases are useful, executable, risk-aware, and ready to improve before final delivery. <br>\n\n### Deployment Geography for Use: <br>\nGlobal <br>\n\n## Known Risks and Mitigations: <br>\nRisk: Scoring guidance may be inconsistent across the six-dimension and eight-dimension review language. <br>\nMitigation: Review the generated scorecard before relying on pass or fail decisions, and align the active rubric with the intended review mode. <br>\nRisk: A review can be less complete when scenario trees, risk lists, or requirement IDs are not provided. <br>\nMitigation: Provide scenario, risk, and traceability inputs for full reviews, or treat downgrade notes as limits on the report's completeness. <br>\nRisk: The skill may critique generated test cases automatically before final output. <br>\nMitigation: Inspect the final critique and improvement suggestions before applying changes to a test suite. <br>\n\n\n## Reference(s): <br>\n- [Report Templates](references/report-templates.md) <br>\n- [Review Dimensions](references/review-dimensions.md) <br>\n\n\n## Skill Output: <br>\n**Output Type(s):** [text, markdown, guidance] <br>\n**Output Format:** [Markdown review report with scores, issue lists, coverage gaps, and improvement suggestions] <br>\n**Output Parameters:** [1D] <br>\n**Other Properties Related to Output:** [May use a full review when scenario and risk inputs are present, or a simplified review with downgrade notes when optional inputs are missing.] <br>\n\n## Skill Version(s): <br>\n1.5.0 (source: frontmatter and release evidence) <br>\n\n## Ethical Considerations: <br>\nUsers should evaluate whether this skill is appropriate for their environment, review any generated or modified files before relying on them, and apply their organization's safety, security, and compliance requirements before deployment. <br>\n\nArchive v1.4.1: 3 files, 6900 bytes\n\nFiles: skill-card.md (2066b), SKILL.md (16735b), _meta.json (140b)\n\nFile v1.4.1:SKILL.md\n\n---\r\nname: qa-ai-output-critique\r\ndescription: >-\r\n  AI输出质量门禁，对AI生成的测试用例进行完整性/规范性/可追溯性/基础正确性六维自动化检查。当需要评审AI输出质量时激活。\r\n\r\nwhen_to_use: AI生成用例后自动激活（最终输出前的必过门禁）；用户说\"检查一下输出\"、\"评审用例质量\"、\"验证完整性\"、\"这个用例对吗\"、\"自动检查\"时\r\nallowed-tools: Read Grep Glob\r\nrelated_skills:\r\n  upstream:\r\n    - qa-ai-prompt-strategy      # 输入：AI生成的测试用例\r\n    - qa-scenario-tree           # 可选输入：场景树（用于完整性评审）\r\n    - qa-risk-intuition          # 可选输入：风险清单（用于风险覆盖评审）\r\n  downstream:\r\n    - qa-ai-blindspot-compensation # 输出：评审结果传递给补盲\r\ninput_format: AI生成的测试用例（必填）+ 场景树/风险清单（可选）\r\noutput_format: 评审报告（八维评审 + 假设清单 + 改进建议）\r\n---\r\n\r\n# AI 输出评审\r\n\r\n## 使用逻辑\r\n\r\n本技能分为三个阶段，按顺序执行：\r\n\r\n```\r\n阶段一：评审框架（八维评审法）\r\n    │\r\n    │  使用八维评审法对AI输出进行系统打分\r\n    │  输出：评审报告（评分 + 问题清单）\r\n    │\r\n    ▼\r\n阶段二：报告模板（输出格式）\r\n    │\r\n    │  按标准格式输出评审结果\r\n    │  输出：结构化评审报告\r\n    │\r\n    ▼\r\n阶段三：追问问法（深入挖掘）\r\n    │\r\n    │  使用追问技巧引导发现问题\r\n    │  输出：更深层的质量洞察\r\n    │\r\n    ▼\r\n阶段四：辅助工具（假设挖掘/反驳机制/投入产出评估）\r\n    │\r\n    │  补充评审维度，提升评审深度\r\n    │  输出：完整评审结论\r\n```\r\n\r\n**关键点**：阶段三的\"追问问法\"是在评审报告输出后使用的，用于引导发现更深层的问题，不是独立的评审体系。\r\n\r\n## 输入要求\r\n\r\n### 必填输入\r\n- AI生成的测试用例\r\n\r\n### 推荐输入（提供则评审更准确）\r\n- 场景树（来自qa-scenario-tree）：用于完整性评审，判断场景覆盖率\r\n- 风险清单（来自qa-risk-intuition）：用于风险覆盖评审，判断高风险区域是否深测\r\n- 需求ID列表：用于追溯性评审，判断用例是否可追溯\r\n\r\n### 降级策略\r\n如果缺少推荐输入：\r\n\r\n| 缺少的输入 | 评审策略 | 降级处理 |\r\n|-----------|----------|----------|\r\n| 场景树 | 完整性评审 | 基于通用场景清单（主流程/分支/异常/边界） |\r\n| 风险清单 | 风险覆盖评审 | 基于默认风险类型（资金/安全/并发/数据一致性） |\r\n| 需求ID列表 | 追溯性评审 | 跳过，标记为\"需补充追溯信息\" |\r\n\r\n## 评审模式\r\n\r\n### 模式A：完整评审（有场景树和风险清单）\r\n- 八维评审全部启用\r\n- 输出完整评审报告\r\n- 适用场景：工作流中的标准评审\r\n\r\n### 模式B：快速评审（无上游数据）\r\n- 启用六维评审（跳过追溯性，简化完整性）\r\n- 输出简化评审报告\r\n- 标注\"建议补充场景树后重新评审\"\r\n- 适用场景：独立使用、快速检查\r\n\r\n### 模式选择规则\r\n```\r\n有场景树 AND 有风险清单 → 模式A（完整评审）\r\n否则 → 模式B（快速评审）\r\n```\r\n\r\n## Overview\r\n\r\n你是一位测试质量评审专家，擅长识别AI输出的不足并给出改进方向。\r\n**核心原则**：AI输出看起来都对，但专家能看出哪里不够。\r\n本技能通过八维评审法系统评估AI输出质量。\r\n\r\n## 评审量化标准\r\n\r\n**关键指标**：八维评审每维度10分，总分≥64分为合格\r\n\r\n```\r\n评分标准：\r\n├─ 完整性（10分）：场景覆盖是否完整\r\n├─ 正确性（10分）：业务规则和预期是否正确\r\n├─ 可执行性（10分）：步骤是否清晰可执行\r\n├─ 风险覆盖（10分）：高风险区域是否深测\r\n├─ 规范性（10分）：格式是否符合标准\r\n├─ 追溯性（10分）：需求ID/风险ID是否完整\r\n├─ 一致性（10分）：用例间是否自相矛盾\r\n└─ 冗余度（10分）：是否有无价值用例\r\n```\r\n\r\n## 八维评审法\r\n\r\n### 1. 完整性评审（10分）\r\n\r\n**检查项**：是否覆盖了所有场景？\r\n\r\n```\r\n评分标准：\r\n- 10分：覆盖所有主路径+分支+异常+边界（基于场景树）\r\n- 7分：覆盖主路径和主要异常\r\n- 4分：只覆盖主路径\r\n- 1分：严重缺失\r\n\r\n评审清单：\r\n- [ ] 主路径场景是否完整？\r\n- [ ] 分支路径是否覆盖？\r\n- [ ] 异常场景是否考虑？\r\n- [ ] 边界条件是否分析？\r\n- [ ] 非功能需求是否涉及？\r\n\r\n发现问题的问法：\r\n\"请列出你输出中未覆盖的场景类型\"\r\n\"对照场景树，检查覆盖率\"\r\n\"请按四维边界模型重新分析\"\r\n\"这个边界真的够深吗？\"\r\n\r\n降级模式（无场景树时）：\r\n- 基于通用场景清单检查：主流程、分支、异常、边界、非功能\r\n- 标注\"建议补充场景树后重新评审\"\r\n```\r\n\r\n### 2. 正确性评审（10分）\r\n\r\n**检查项**：业务规则和预期结果是否正确？\r\n\r\n```\r\n核心关注：对不对（内容正确性）\r\n\r\n评分标准：\r\n- 10分：业务规则正确、预期可验证\r\n- 7分：大部分正确，少量细节需调整\r\n- 4分：有多处错误\r\n- 1分：严重错误\r\n\r\n评审清单：\r\n- [ ] 业务规则描述是否符合需求？\r\n- [ ] 预期结果是否与实际系统行为一致？\r\n- [ ] 数据计算逻辑是否正确？\r\n- [ ] 状态转换描述是否准确？\r\n\r\n发现问题的问法：\r\n\"这个预期结果与实际系统行为一致吗？\"\r\n\"业务规则描述是否准确？\"\r\n\"这个状态转换逻辑对吗？\"\r\n```\r\n\r\n### 3. 可执行性评审（10分）\r\n\r\n**检查项**：能不能实际执行？\r\n\r\n```\r\n核心关注：能不能做（可操作性）\r\n\r\n评分标准：\r\n- 10分：步骤清晰、无歧义、可执行\r\n- 7分：大部分清晰，少量需补充\r\n- 4分：有多处模糊\r\n- 1分：无法执行\r\n\r\n评审清单：\r\n- [ ] 测试数据是否可构造？\r\n- [ ] 测试环境是否可搭建？\r\n- [ ] 测试步骤是否可重复？\r\n- [ ] 预期结果是否可观测？\r\n\r\n发现问题的问法：\r\n\"这个用例能实际执行吗？\"\r\n\"测试数据从哪来？\"\r\n\"测试环境怎么搭建？\"\r\n```\r\n\r\n### 4. 风险覆盖评审（10分）\r\n\r\n**检查项**：高风险区域是否深测？\r\n\r\n```\r\n评分标准：\r\n- 10分：高风险区域100%覆盖（基于风险清单）\r\n- 7分：高风险区域80%覆盖\r\n- 4分：高风险区域50%覆盖\r\n- 1分：高风险区域未覆盖\r\n\r\n评审清单：\r\n- [ ] 资金相关场景是否深测？\r\n- [ ] 安全相关场景是否覆盖？\r\n- [ ] 并发场景是否考虑？\r\n- [ ] 异常恢复是否验证？\r\n- [ ] 数据一致性是否验证？\r\n- [ ] 第三方依赖是否Mock？\r\n\r\n发现问题的问法：\r\n\"这个功能挂了影响多大？\"\r\n\"高风险区域测试深度够吗？\"\r\n\r\n降级模式（无风险清单时）：\r\n- 基于默认风险类型检查：资金、安全、并发、数据一致性\r\n- 标注\"建议补充风险清单后重新评审\"\r\n```\r\n\r\n### 5. 规范性评审（10分）\r\n\r\n**检查项**：格式是否符合标准？\r\n\r\n```\r\n评分标准：\r\n- 10分：完全符合标准\r\n- 7分：大部分符合，少量需调整\r\n- 4分：格式混乱\r\n- 1分：无格式\r\n\r\n评审清单：\r\n- [ ] 用例编号是否规范？\r\n- [ ] 表格格式是否正确？\r\n- [ ] 字段是否完整？\r\n- [ ] 描述是否简洁？\r\n```\r\n\r\n### 6. 追溯性评审（10分）\r\n\r\n**检查项**：需求ID/风险ID是否完整？\r\n\r\n```\r\n评分标准：\r\n- 10分：每条用例都有需求ID和风险ID\r\n- 7分：大部分有，少量缺失\r\n- 4分：只有部分有\r\n- 1分：无追溯信息\r\n\r\n评审清单：\r\n- [ ] 每条用例是否关联需求ID？\r\n- [ ] 每条用例是否关联风险ID？\r\n- [ ] ID格式是否统一？\r\n- [ ] 追溯链是否完整？\r\n\r\n降级模式（无需求ID列表时）：\r\n- 跳过此维度\r\n- 标注\"需补充追溯信息\"\r\n```\r\n\r\n### 7. 一致性评审（10分）\r\n\r\n**检查项**：用例间是否自相矛盾？\r\n\r\n```\r\n评分标准：\r\n- 10分：完全一致，无矛盾\r\n- 7分：大部分一致，少量需调整\r\n- 4分：有多处矛盾\r\n- 1分：严重矛盾\r\n\r\n评审清单：\r\n- [ ] 前置条件和测试步骤是否一致？\r\n- [ ] 不同用例间是否有冲突？\r\n- [ ] 业务规则是否统一？\r\n- [ ] 预期结果是否互斥？\r\n\r\n发现问题的问法：\r\n\"检查这些用例间是否有矛盾\"\r\n\"前置条件和步骤是否匹配？\"\r\n```\r\n\r\n### 8. 冗余度评审（10分）\r\n\r\n**检查项**：有没有无价值用例？\r\n\r\n```\r\n评分标准：\r\n- 10分：无冗余，每条用例都有价值\r\n- 7分：少量冗余\r\n- 4分：有多处冗余\r\n- 1分：大量冗余\r\n\r\n评审清单：\r\n- [ ] 是否有重复覆盖的场景？\r\n- [ ] 是否有低价值用例？\r\n- [ ] 优先级标注是否合理？\r\n- [ ] 测试效率是否最优？\r\n\r\n发现问题的问法：\r\n\"删除哪些用例不影响覆盖率？\"\r\n\"哪些用例可以合并？\"\r\n```\r\n\r\n## 评审报告模板\r\n\r\n### 完整评审报告（模式A）\r\n\r\n```markdown\r\n## AI输出评审报告\r\n\r\n### 评审摘要\r\n- 评审日期：YYYY-MM-DD\r\n- 评审模式：完整评审\r\n- 用例总数：XX条\r\n- 综合评分：XX/80分\r\n\r\n### 八维评分\r\n| 维度 | 分数 | 评价 | 改进建议 |\r\n|------|------|------|---------|\r\n| 完整性 | X/10 | [评价] | [建议] |\r\n| 正确性 | X/10 | [评价] | [建议] |\r\n| 可执行性 | X/10 | [评价] | [建议] |\r\n| 风险覆盖 | X/10 | [评价] | [建议] |\r\n| 规范性 | X/10 | [评价] | [建议] |\r\n| 追溯性 | X/10 | [评价] | [建议] |\r\n| 一致性 | X/10 | [评价] | [建议] |\r\n| 冗余度 | X/10 | [评价] | [建议] |\r\n\r\n### 问题清单\r\n| 用例编号 | 问题类型 | 问题描述 | 改进建议 |\r\n|---------|---------|---------|---------|\r\n| TC_XXX_001 | [类型] | [描述] | [建议] |\r\n\r\n### 改进方向\r\n1. [改进方向1]\r\n2. [改进方向2]\r\n3. [改进方向3]\r\n```\r\n\r\n### 简化评审报告（模式B）\r\n\r\n```markdown\r\n## AI输出评审报告\r\n\r\n### 评审摘要\r\n- 评审日期：YYYY-MM-DD\r\n- 评审模式：快速评审\r\n- 用例总数：XX条\r\n- 综合评分：XX/60分（跳过追溯性）\r\n- 建议：补充场景树和风险清单后重新评审\r\n\r\n### 六维评分\r\n| 维度 | 分数 | 评价 | 改进建议 |\r\n|------|------|------|---------|\r\n| 完整性 | X/10 | [评价] | [建议] |\r\n| 正确性 | X/10 | [评价] | [建议] |\r\n| 可执行性 | X/10 | [评价] | [建议] |\r\n| 风险覆盖 | X/10 | [评价] | [建议] |\r\n| 规范性 | X/10 | [评价] | [建议] |\r\n| 一致性 | X/10 | [评价] | [建议] |\r\n| 冗余度 | X/10 | [评价] | [建议] |\r\n\r\n### 问题清单\r\n| 用例编号 | 问题类型 | 问题描述 | 改进建议 |\r\n|---------|---------|---------|---------|\r\n| TC_XXX_001 | [类型] | [描述] | [建议] |\r\n\r\n### 改进方向\r\n1. [改进方向1]\r\n2. [改进方向2]\r\n3. [改进方向3]\r\n```\r\n\r\n## 假设挖掘\r\n\r\nAI输出中常见的隐含假设：\r\n\r\n| 假设类型 | 示例 | 验证方法 |\r\n|---------|------|---------|\r\n| 用户行为假设 | \"用户会正常输入\" | 追问：用户误输入怎么办？ |\r\n| 环境假设 | \"网络正常\" | 追问：网络异常时会怎样？ |\r\n| 数据假设 | \"数据格式正确\" | 追问：格式错误时怎么处理？ |\r\n| 时序假设 | \"操作按顺序执行\" | 追问：乱序执行会怎样？ |\r\n| 依赖假设 | \"第三方服务正常\" | 追问：第三方挂了怎么办？ |\r\n\r\n**挖掘问法**：\r\n```\r\n请列出你在输出中做的所有假设\r\n哪些假设可能不成立？\r\n如果假设不成立，测试场景会有什么变化？\r\n```\r\n\r\n## 迭代决策树\r\n\r\n当AI输出不满意时：\r\n\r\n```\r\n输出不满意\r\n    │\r\n    ├── 完整性不够？\r\n    │       └── 补充场景：请补充[缺失的场景类型]\r\n    │\r\n    ├── 深度不够？\r\n    │       └── 深入分析：请按[具体维度]深入分析\r\n    │\r\n    ├── 风险覆盖不足？\r\n    │       └── 重点强化：请对[高风险区域]做专项测试\r\n    │\r\n    ├── 有矛盾？\r\n    │       └── 修正一致性：请修正[具体矛盾点]\r\n    │\r\n    ├── 冗余过多？\r\n    │       └── 精简用例：请合并或删除[低价值用例]\r\n    │\r\n    └── 不可执行？\r\n            └── 调整可行性：请确保[测试步骤]可实际执行\r\n```\r\n\r\n## AI反驳机制\r\n\r\n**核心原则**：让AI挑战你的假设，而不是迎合你。\r\n\r\n### 反驳问法模板\r\n\r\n```\r\n模式1：质量负责人视角\r\n\"请站在质量负责人角度，指出可能遗漏的业务风险、过度测试的地方，\r\n以及上线前还需要确认的问题。\"\r\n\r\n模式2：故障反推视角\r\n\"请假设这个功能上线后出现严重问题，反推我现在的测试方案\r\n可能漏掉了什么。\"\r\n\r\n模式3：资源约束视角\r\n\"测试资源有限，请评估这些用例的投入产出比，\r\n哪些是必须测的，哪些可以简化或跳过。\"\r\n\r\n模式4：竞品对比视角\r\n\"如果竞争对手的同类功能比我们更稳定，可能是因为\r\n他们多测了哪些我们没覆盖的场景？\"\r\n```\r\n\r\n### 反驳检查清单\r\n\r\n- [ ] 是否要求AI挑战你的假设？\r\n- [ ] 是否让AI从反面看问题？\r\n- [ ] 是否评估了投入产出比？\r\n- [ ] 是否识别了过度测试的区域？\r\n\r\n## 投入产出评估\r\n\r\n### 评估维度\r\n\r\n| 维度 | 评估标准 | 权重 |\r\n|------|---------|------|\r\n| 业务价值 | 影响用户数×影响程度 | 40% |\r\n| 风险等级 | 发生概率×影响程度 | 30% |\r\n| 测试成本 | 用例数×执行时间 | 20% |\r\n| 自动化潜力 | 是否适合自动化 | 10% |\r\n\r\n### 评估矩阵\r\n\r\n| 用例类型 | 业务价值 | 风险等级 | 测试成本 | 建议 |\r\n|---------|---------|---------|---------|------|\r\n| P0+高风险 | 高 | 高 | 中 | 必须测试，优先自动化 |\r\n| P0+低风险 | 高 | 低 | 低 | 必须测试，手动即可 |\r\n| P1+高风险 | 中 | 高 | 中 | 必须测试，考虑自动化 |\r\n| P1+低风险 | 中 | 低 | 低 | 选择性测试 |\r\n| P2+高风险 | 低 | 高 | 中 | 评估后决定 |\r\n| P2+低风险 | 低 | 低 | 低 | 可跳过或简化 |\r\n\r\n### ROI计算公式\r\n\r\n```\r\nROI = (业务价值 × 风险等级) / 测试成本\r\n\r\n示例：\r\n用例A：业务价值=5, 风险等级=5, 测试成本=2\r\nROI = (5×5)/2 = 12.5 → 高ROI，优先测试\r\n\r\n用例B：业务价值=2, 风险等级=2, 测试成本=5\r\nROI = (2×2)/5 = 0.8 → 低ROI，可简化\r\n```\r\n\r\n## 快速评审模板\r\n\r\n```markdown\r\n## AI输出评审报告\r\n\r\n### 总体评价\r\n- 完整性：⭐⭐⭐⭐☆\r\n- 正确性：⭐⭐⭐⭐☆\r\n- 可执行性：⭐⭐⭐☆☆\r\n- 风险覆盖：⭐⭐⭐⭐☆\r\n- 规范性：⭐⭐⭐⭐⭐\r\n- 追溯性：⭐⭐⭐⭐☆\r\n- 一致性：⭐⭐⭐⭐☆\r\n- 冗余度：⭐⭐⭐⭐☆\r\n\r\n### 主要问题\r\n1. [问题1]：[具体描述]\r\n2. [问题2]：[具体描述]\r\n\r\n### 改进建议\r\n1. [建议1]：[具体方向]\r\n2. [建议2]：[具体方向]\r\n\r\n### 迭代方向\r\n优先改进：[最关键的改进点]\r\n```\r\n\r\n## Examples\r\n\r\n### 示例1：完整评审（有场景树）\r\n\r\n**输入**：AI生成的登录功能测试用例 + 场景树 + 风险清单\r\n\r\n**八维评审结果**：\r\n- 完整性7分：场景树显示10个场景，用例覆盖7个（70%）\r\n- 正确性9分：业务规则描述基本正确\r\n- 可执行性8分：大部分步骤清晰\r\n- 风险覆盖6分：风险清单显示3个高风险，用例覆盖1个\r\n- 规范性9分：格式规范\r\n- 追溯性8分：大部分有需求ID\r\n- 一致性9分：无明显矛盾\r\n- 冗余度9分：无明显冗余\r\n\r\n**综合评分**：65/80分（合格）\r\n\r\n**改进方向**：补充并发登录、密码暴力破解、Session超时场景\r\n\r\n### 示例2：快速评审（无上游数据）\r\n\r\n**输入**：AI生成的登录功能测试用例（无场景树和风险清单）\r\n\r\n**六维评审结果**：\r\n- 完整性6分：基于通用场景清单，缺少并发和安全场景\r\n- 正确性9分：业务规则描述正确\r\n- 可执行性8分：步骤清晰\r\n- 风险覆盖5分：未考虑高风险区域\r\n- 规范性9分：格式规范\r\n- 一致性9分：无明显矛盾\r\n- 冗余度9分：无明显冗余\r\n\r\n**综合评分**：55/60分（合格，但建议补充）\r\n\r\n**建议**：补充场景树和风险清单后重新评审\r\n\r\n## Guidelines\r\n\r\n评审完成后检查：\r\n\r\n- [ ] 是否识别了AI的隐含假设？\r\n- [ ] 是否评估了覆盖完整性？\r\n- [ ] 是否检查了一致性？\r\n- [ ] 是否评估了冗余度？\r\n- [ ] 是否有明确的迭代方向？\r\n- [ ] 评审报告是否可执行？\r\n- [ ] 是否标注了降级模式（如适用）？\n\nFile v1.4.1:_meta.json\n\n{\n  \"ownerId\": \"kn71y9b23csfx0ykgm55d5m9x5891zt8\",\n  \"slug\": \"qa-ai-output-critique\",\n  \"version\": \"1.4.1\",\n  \"publishedAt\": 1782406388742\n}\n\nFile v1.4.1:skill-card.md\n\n## Description: <br>\nReviews AI-generated test cases as a quality gate, checking completeness, correctness, executability, risk coverage, formatting, traceability, consistency, and redundancy. <br>\n\nThis skill is ready for commercial/non-commercial use. <br>\n\n## Publisher: <br>\n[kokxi](https://clawhub.ai/user/kokxi) <br>\n\n### License/Terms of Use: <br>\nMIT-0 <br>\n\n\n## Use Case: <br>\nQA engineers, test engineers, and agent workflows use this skill to critique AI-generated test cases before final delivery. It produces either a full eight-dimension review when scenario and risk inputs are available or a reduced quick review when they are not. <br>\n\n### Deployment Geography for Use: <br>\nGlobal <br>\n\n## Known Risks and Mitigations: <br>\nRisk: Generic QA review requests may activate the skill automatically. <br>\nMitigation: Use it where an automatic read-only critique step before final output is desired, and review the critique before accepting its recommendations. <br>\nRisk: Reviews are less complete when scenario trees, risk lists, or requirement IDs are missing. <br>\nMitigation: Provide scenario trees, risk lists, and requirement IDs when available; otherwise treat quick-review results as lower-context guidance. <br>\n\n\n## Reference(s): <br>\n- [ClawHub skill page](https://clawhub.ai/kokxi/skills/qa-ai-output-critique) <br>\n- [ClawHub publisher profile](https://clawhub.ai/user/kokxi) <br>\n\n\n## Skill Output: <br>\n**Output Type(s):** [text, markdown, guidance] <br>\n**Output Format:** [Structured Markdown review report] <br>\n**Output Parameters:** [1D] <br>\n**Other Properties Related to Output:** [Includes scored review dimensions, issue lists, assumptions, and improvement recommendations.] <br>\n\n## Skill Version(s): <br>\n1.4.1 (source: server release metadata) <br>\n\n## Ethical Considerations: <br>\nUsers should evaluate whether this skill is appropriate for their environment, review any generated or modified files before relying on them, and apply their organization's safety, security, and compliance requirements before deployment. <br>\n\nArchive v1.4.0: 3 files, 5549 bytes\n\nFiles: skill-card.md (1704b), SKILL.md (11632b), _meta.json (140b)\n\nFile v1.4.0:SKILL.md\n\n---\r\nname: qa-ai-output-critique\r\ndescription: >-\r\n   AI输出质量门禁，对AI生成的测试用例进行自动化质量检查，验证完整性、格式规范、可追溯性和基础正确性。AI生成完毕后自动激活，在最终输出前强制门禁。\r\n   也适用于：用户需要确认AI输出没有遗漏基本检查项时。\r\n   注意：本技能是自动门禁，无人工参与；如需人类专家做深度评审，请使用qa-expert-review。\r\n   关键词：AI评审、输出评估、质量改进、迭代优化、格式检查、完整性校验、可追溯检查、一致性验证、输出质量门禁。\nwhen_to_use: AI生成用例后自动激活（最终输出前的必过门禁）；用户说\"检查一下输出\"、\"评审用例质量\"、\"验证完整性\"、\"这个用例对吗\"、\"自动检查\"时\r\nallowed-tools: Read Grep Glob\r\nrelated_skills:\r\n  upstream:\r\n    - qa-ai-prompt-strategy      # 输入：AI生成的测试用例\r\n  downstream:\r\n    - qa-ai-blindspot-compensation # 输出：评审结果传递给补盲\r\ninput_format: AI生成的测试用例\r\noutput_format: 评审报告（六维评审 + 假设清单 + 改进建议）\r\n---\r\n\r\n# AI 输出评审\r\n\r\n## Overview\r\n\r\n你是一位测试质量评审专家，擅长识别AI输出的不足并给出改进方向。\r\n**核心原则**：AI输出看起来都对，但专家能看出哪里不够。\r\n本技能通过六维评审法（完整性/准确性/可执行性/风险覆盖/规范性/追溯性）系统评估AI输出质量。\r\n\r\n## 评审量化标准\r\n\r\n**关键指标**：六维评审每维度10分，总分≥50分为合格\r\n\r\n```\r\n评分标准：\r\n├─ 完整性（10分）：场景覆盖是否完整\r\n├─ 准确性（10分）：步骤和预期是否正确\r\n├─ 可执行性（10分）：步骤是否清晰可执行\r\n├─ 风险覆盖（10分）：高风险区域是否深测\r\n├─ 规范性（10分）：格式是否符合标准\r\n└─ 追溯性（10分）：需求ID/风险ID是否完整\r\n```\r\n\r\n## 六维评审法\r\n\r\n### 1. 完整性评审（10分）\r\n**检查项**：是否覆盖了所有场景？\r\n\r\n```\r\n评分标准：\r\n- 10分：覆盖所有主路径+分支+异常+边界\r\n- 7分：覆盖主路径和主要异常\r\n- 4分：只覆盖主路径\r\n- 1分：严重缺失\r\n\r\n评审清单：\r\n- [ ] 主路径场景是否完整？\r\n- [ ] 分支路径是否覆盖？\r\n- [ ] 异常场景是否考虑？\r\n- [ ] 边界条件是否分析？\r\n- [ ] 非功能需求是否涉及？\r\n\r\n发现问题的问法：\r\n\"请列出你输出中未覆盖的场景类型\"\r\n\"对照场景树，检查覆盖率\"\r\n```\r\n\r\n### 2. 准确性评审（10分）\r\n**检查项**：测试步骤和预期结果是否正确？\r\n\r\n```\r\n评分标准：\r\n- 10分：步骤准确、预期可验证\r\n- 7分：大部分准确，少量细节需调整\r\n- 4分：有多处错误\r\n- 1分：严重错误\r\n\r\n评审清单：\r\n- [ ] 测试步骤是否可执行？\r\n- [ ] 预期结果是否可验证？\r\n- [ ] 业务规则是否正确？\r\n- [ ] 数据计算是否准确？\r\n```\r\n\r\n### 3. 可执行性评审（10分）\r\n**检查项**：步骤是否清晰可执行？\r\n\r\n```\r\n评分标准：\r\n- 10分：步骤清晰、无歧义\r\n- 7分：大部分清晰，少量需补充\r\n- 4分：有多处模糊\r\n- 1分：无法执行\r\n\r\n评审清单：\r\n- [ ] 步骤是否具体？\r\n- [ ] 操作是否可重复？\r\n- [ ] 数据是否明确？\r\n- [ ] 环境是否说明？\r\n```\r\n\r\n### 4. 风险覆盖评审（10分）\r\n**检查项**：高风险区域是否深测？\r\n\r\n```\r\n评分标准：\r\n- 10分：高风险区域100%覆盖\r\n- 7分：高风险区域80%覆盖\r\n- 4分：高风险区域50%覆盖\r\n- 1分：高风险区域未覆盖\r\n\r\n评审清单：\r\n- [ ] 资金相关场景是否深测？\r\n- [ ] 安全相关场景是否覆盖？\r\n- [ ] 并发场景是否考虑？\r\n- [ ] 异常恢复是否验证？\r\n```\r\n\r\n### 5. 规范性评审（10分）\r\n**检查项**：格式是否符合标准？\r\n\r\n```\r\n评分标准：\r\n- 10分：完全符合标准\r\n- 7分：大部分符合，少量需调整\r\n- 4分：格式混乱\r\n- 1分：无格式\r\n\r\n评审清单：\r\n- [ ] 用例编号是否规范？\r\n- [ ] 表格格式是否正确？\r\n- [ ] 字段是否完整？\r\n- [ ] 描述是否简洁？\r\n```\r\n\r\n### 6. 追溯性评审（10分）\r\n**检查项**：需求ID/风险ID是否完整？\r\n\r\n```\r\n评分标准：\r\n- 10分：每条用例都有需求ID和风险ID\r\n- 7分：大部分有，少量缺失\r\n- 4分：只有部分有\r\n- 1分：无追溯信息\r\n\r\n评审清单：\r\n- [ ] 每条用例是否关联需求ID？\r\n- [ ] 每条用例是否关联风险ID？\r\n- [ ] ID格式是否统一？\r\n- [ ] 追溯链是否完整？\r\n```\r\n\r\n## 评审报告模板\r\n\r\n```markdown\r\n## AI输出评审报告\r\n\r\n### 评审摘要\r\n- 评审日期：YYYY-MM-DD\r\n- 用例总数：XX条\r\n- 综合评分：XX/60分\r\n\r\n### 六维评分\r\n| 维度 | 分数 | 评价 | 改进建议 |\r\n|------|------|------|---------|\r\n| 完整性 | X/10 | [评价] | [建议] |\r\n| 准确性 | X/10 | [评价] | [建议] |\r\n| 可执行性 | X/10 | [评价] | [建议] |\r\n| 风险覆盖 | X/10 | [评价] | [建议] |\r\n| 规范性 | X/10 | [评价] | [建议] |\r\n| 追溯性 | X/10 | [评价] | [建议] |\r\n\r\n### 问题清单\r\n| 用例编号 | 问题类型 | 问题描述 | 改进建议 |\r\n|---------|---------|---------|---------|\r\n| TC_XXX_001 | [类型] | [描述] | [建议] |\r\n\r\n### 改进方向\r\n1. [改进方向1]\r\n2. [改进方向2]\r\n3. [改进方向3]\r\n```\r\n\r\n发现问题的问法：\r\n\"请按四维边界模型重新分析\"\r\n\"这个边界真的够深吗？\"\r\n```\r\n\r\n### 3. 风险评审\r\n**检查项**：高风险区是否深挖？\r\n\r\n```\r\n评审清单：\r\n- [ ] 资金相关场景是否重点测试？\r\n- [ ] 安全相关场景是否深度覆盖？\r\n- [ ] 数据一致性是否验证？\r\n- [ ] 并发冲突是否考虑？\r\n- [ ] 第三方依赖是否Mock？\r\n\r\n发现问题的问法：\r\n\"这个功能挂了影响多大？\"\r\n\"高风险区域测试深度够吗？\"\r\n```\r\n\r\n### 4. 一致性评审\r\n**检查项**：有没有自相矛盾？\r\n\r\n```\r\n评审清单：\r\n- [ ] 前置条件和测试步骤是否一致？\r\n- [ ] 预期结果是否可验证？\r\n- [ ] 不同用例间是否有冲突？\r\n- [ ] 业务规则是否统一？\r\n\r\n发现问题的问法：\r\n\"检查这些用例间是否有矛盾\"\r\n\"这个预期结果真的可验证吗？\"\r\n```\r\n\r\n### 5. 可实现性评审\r\n**检查项**：能不能实际执行？\r\n\r\n```\r\n评审清单：\r\n- [ ] 测试数据是否可构造？\r\n- [ ] 测试环境是否可搭建？\r\n- [ ] 测试步骤是否可执行？\r\n- [ ] 预期结果是否可观测？\r\n\r\n发现问题的问法：\r\n\"这个用例能实际执行吗？\"\r\n\"测试数据从哪来？\"\r\n```\r\n\r\n### 6. 冗余度评审\r\n**检查项**：有没有无价值用例？\r\n\r\n```\r\n评审清单：\r\n- [ ] 是否有重复覆盖的场景？\r\n- [ ] 是否有低价值用例？\r\n- [ ] 优先级标注是否合理？\r\n- [ ] 测试效率是否最优？\r\n\r\n发现问题的问法：\r\n\"删除哪些用例不影响覆盖率？\"\r\n\"哪些用例可以合并？\"\r\n```\r\n\r\n## 假设挖掘\r\n\r\nAI输出中常见的隐含假设：\r\n\r\n| 假设类型 | 示例 | 验证方法 |\r\n|---------|------|---------|\r\n| 用户行为假设 | \"用户会正常输入\" | 追问：用户误输入怎么办？ |\r\n| 环境假设 | \"网络正常\" | 追问：网络异常时会怎样？ |\r\n| 数据假设 | \"数据格式正确\" | 追问：格式错误时怎么处理？ |\r\n| 时序假设 | \"操作按顺序执行\" | 追问：乱序执行会怎样？ |\r\n| 依赖假设 | \"第三方服务正常\" | 追问：第三方挂了怎么办？ |\r\n\r\n**挖掘问法**：\r\n```\r\n请列出你在输出中做的所有假设\r\n哪些假设可能不成立？\r\n如果假设不成立，测试场景会有什么变化？\r\n```\r\n\r\n## 迭代决策树\r\n\r\n当AI输出不满意时：\r\n\r\n```\r\n输出不满意\r\n    │\r\n    ├── 完整性不够？\r\n    │       └── 补充场景：请补充[缺失的场景类型]\r\n    │\r\n    ├── 深度不够？\r\n    │       └── 深入分析：请按[具体维度]深入分析\r\n    │\r\n    ├── 风险覆盖不足？\r\n    │       └── 重点强化：请对[高风险区域]做专项测试\r\n    │\r\n    ├── 有矛盾？\r\n    │       └── 修正一致性：请修正[具体矛盾点]\r\n    │\r\n    └── 不可执行？\r\n            └── 调整可行性：请确保[测试步骤]可实际执行\r\n```\r\n\r\n## AI反驳机制\r\n\r\n**核心原则**：让AI挑战你的假设，而不是迎合你。\r\n\r\n### 反驳问法模板\r\n\r\n```\r\n模式1：质量负责人视角\r\n\"请站在质量负责人角度，指出可能遗漏的业务风险、过度测试的地方，\r\n以及上线前还需要确认的问题。\"\r\n\r\n模式2：故障反推视角\r\n\"请假设这个功能上线后出现严重问题，反推我现在的测试方案\r\n可能漏掉了什么。\"\r\n\r\n模式3：资源约束视角\r\n\"测试资源有限，请评估这些用例的投入产出比，\r\n哪些是必须测的，哪些可以简化或跳过。\"\r\n\r\n模式4：竞品对比视角\r\n\"如果竞争对手的同类功能比我们更稳定，可能是因为\r\n他们多测了哪些我们没覆盖的场景？\"\r\n```\r\n\r\n### 反驳检查清单\r\n\r\n- [ ] 是否要求AI挑战你的假设？\r\n- [ ] 是否让AI从反面看问题？\r\n- [ ] 是否评估了投入产出比？\r\n- [ ] 是否识别了过度测试的区域？\r\n\r\n## 投入产出评估\r\n\r\n### 评估维度\r\n\r\n| 维度 | 评估标准 | 权重 |\r\n|------|---------|------|\r\n| 业务价值 | 影响用户数×影响程度 | 40% |\r\n| 风险等级 | 发生概率×影响程度 | 30% |\r\n| 测试成本 | 用例数×执行时间 | 20% |\r\n| 自动化潜力 | 是否适合自动化 | 10% |\r\n\r\n### 评估矩阵\r\n\r\n| 用例类型 | 业务价值 | 风险等级 | 测试成本 | 建议 |\r\n|---------|---------|---------|---------|------|\r\n| P0+高风险 | 高 | 高 | 中 | 必须测试，优先自动化 |\r\n| P0+低风险 | 高 | 低 | 低 | 必须测试，手动即可 |\r\n| P1+高风险 | 中 | 高 | 中 | 必须测试，考虑自动化 |\r\n| P1+低风险 | 中 | 低 | 低 | 选择性测试 |\r\n| P2+高风险 | 低 | 高 | 中 | 评估后决定 |\r\n| P2+低风险 | 低 | 低 | 低 | 可跳过或简化 |\r\n\r\n### ROI计算公式\r\n\r\n```\r\nROI = (业务价值 × 风险等级) / 测试成本\r\n\r\n示例：\r\n用例A：业务价值=5, 风险等级=5, 测试成本=2\r\nROI = (5×5)/2 = 12.5 → 高ROI，优先测试\r\n\r\n用例B：业务价值=2, 风险等级=2, 测试成本=5\r\nROI = (2×2)/5 = 0.8 → 低ROI，可简化\r\n```\r\n\r\n## 快速评审模板\r\n\r\n```markdown\r\n## AI输出评审报告\r\n\r\n### 总体评价\r\n- 完整性：⭐⭐⭐⭐☆\r\n- 深度：⭐⭐⭐☆☆\r\n- 风险覆盖：⭐⭐⭐⭐☆\r\n- 一致性：⭐⭐⭐⭐⭐\r\n- 可实现性：⭐⭐⭐⭐☆\r\n- 冗余度：⭐⭐⭐⭐☆\r\n\r\n### 主要问题\r\n1. [问题1]：[具体描述]\r\n2. [问题2]：[具体描述]\r\n\r\n### 改进建议\r\n1. [建议1]：[具体方向]\r\n2. [建议2]：[具体方向]\r\n\r\n### 迭代方向\r\n优先改进：[最关键的改进点]\r\n```\r\n\r\n## Examples\r\n\r\n**AI生成了登录功能测试用例**\r\n→ 六维评审逐项打分：\r\n  - 完整性7分：缺少并发登录场景\r\n  - 准确性9分：步骤描述基本正确\r\n  - 风险覆盖6分：未考虑密码暴力破解\r\n→ 输出改进方向：补充并发和安全测试\r\n\r\n**用户说\"AI回答的怎么样\"**\r\n→ 自动启动六维评审，生成结构化评审报告\r\n→ 给出总体评价和各维度改进建议\r\n\r\n## Guidelines\r\n\r\n评审完成后检查：\r\n- [ ] 是否识别了AI的隐含假设？\r\n- [ ] 是否评估了覆盖完整性？\r\n- [ ] 是否有明确的迭代方向？\r\n- [ ] 评审报告是否可执行？\n\nFile v1.4.0:_meta.json\n\n{\n  \"ownerId\": \"kn71y9b23csfx0ykgm55d5m9x5891zt8\",\n  \"slug\": \"qa-ai-output-critique\",\n  \"version\": \"1.4.0\",\n  \"publishedAt\": 1782277359848\n}\n\nFile v1.4.0:skill-card.md\n\n## Description: <br>\nQa Ai Output Critique is a Chinese-language quality gate that reviews AI-generated test cases for completeness, formatting, traceability, and basic correctness before final output. <br>\n\nThis skill is ready for commercial/non-commercial use. <br>\n\n## Publisher: <br>\n[kokxi](https://clawhub.ai/user/kokxi) <br>\n\n### License/Terms of Use: <br>\nMIT-0 <br>\n\n\n## Use Case: <br>\nQA engineers, test engineers, and developers use this skill to automatically review AI-generated test cases before they are accepted as final output. It produces a structured six-dimension critique with scoring, identified assumptions, and improvement suggestions. <br>\n\n### Deployment Geography for Use: <br>\nGlobal <br>\n\n## Known Risks and Mitigations: <br>\nRisk: Review before execution as proposals could introduce incorrect or misleading guidance into skills. <br>\nMitigation: Review and scan skill before deployment. <br>\n\n## Reference(s): <br>\n- [ClawHub skill page](https://clawhub.ai/kokxi/skills/qa-ai-output-critique) <br>\n\n\n## Skill Output: <br>\n**Output Type(s):** [text, markdown, guidance] <br>\n**Output Format:** [Markdown review report] <br>\n**Output Parameters:** [1D] <br>\n**Other Properties Related to Output:** [Chinese-language QA critique with six-dimension scoring, assumption checks, issue lists, and improvement recommendations.] <br>\n\n## Skill Version(s): <br>\n1.4.0 (source: server release metadata) <br>\n\n## Ethical Considerations: <br>\nUsers should evaluate whether this skill is appropriate for their environment, review any generated or modified files before relying on them, and apply their organization's safety, security, and compliance requirements before deployment. <br>\n\nArchive v1.3.0: 3 files, 5307 bytes\n\nFiles: skill-card.md (1981b), SKILL.md (10513b), _meta.json (140b)\n\nFile v1.3.0:SKILL.md\n\n---\r\nname: qa-ai-output-critique\r\ndescription: AI输出评审与补全，识别AI输出的不足并指导迭代。当AI生成内容后需要质量评估或改进时激活。\r\nwhen_to_use: 用户说\"评估这个输出\"、\"AI回答的怎么样\"、\"有什么问题\"、\"怎么改进\"时\r\nallowed-tools: Read Grep Glob\r\nrelated_skills:\r\n  upstream:\r\n    - qa-ai-prompt-strategy      # 输入：AI生成的测试用例\r\n  downstream:\r\n    - qa-ai-blindspot-compensation # 输出：评审结果传递给补盲\r\ninput_format: AI生成的测试用例\r\noutput_format: 评审报告（六维评审 + 假设清单 + 改进建议）\r\n---\r\n\r\n# AI 输出评判\r\n\r\n你是一位测试质量评审专家，擅长识别AI输出的不足并给出改进方向。\r\n\r\n## 核心原则\r\n\r\n**AI输出看起来都对，但专家能看出哪里不够。**\r\n\r\n## 评审量化标准\r\n\r\n**关键指标**：六维评审每维度10分，总分≥50分为合格\r\n\r\n```\r\n评分标准：\r\n├─ 完整性（10分）：场景覆盖是否完整\r\n├─ 准确性（10分）：步骤和预期是否正确\r\n├─ 可执行性（10分）：步骤是否清晰可执行\r\n├─ 风险覆盖（10分）：高风险区域是否深测\r\n├─ 规范性（10分）：格式是否符合标准\r\n└─ 追溯性（10分）：需求ID/风险ID是否完整\r\n```\r\n\r\n## 六维评审法\r\n\r\n### 1. 完整性评审（10分）\r\n**检查项**：是否覆盖了所有场景？\r\n\r\n```\r\n评分标准：\r\n- 10分：覆盖所有主路径+分支+异常+边界\r\n- 7分：覆盖主路径和主要异常\r\n- 4分：只覆盖主路径\r\n- 1分：严重缺失\r\n\r\n评审清单：\r\n- [ ] 主路径场景是否完整？\r\n- [ ] 分支路径是否覆盖？\r\n- [ ] 异常场景是否考虑？\r\n- [ ] 边界条件是否分析？\r\n- [ ] 非功能需求是否涉及？\r\n\r\n发现问题的问法：\r\n\"请列出你输出中未覆盖的场景类型\"\r\n\"对照场景树，检查覆盖率\"\r\n```\r\n\r\n### 2. 准确性评审（10分）\r\n**检查项**：测试步骤和预期结果是否正确？\r\n\r\n```\r\n评分标准：\r\n- 10分：步骤准确、预期可验证\r\n- 7分：大部分准确，少量细节需调整\r\n- 4分：有多处错误\r\n- 1分：严重错误\r\n\r\n评审清单：\r\n- [ ] 测试步骤是否可执行？\r\n- [ ] 预期结果是否可验证？\r\n- [ ] 业务规则是否正确？\r\n- [ ] 数据计算是否准确？\r\n```\r\n\r\n### 3. 可执行性评审（10分）\r\n**检查项**：步骤是否清晰可执行？\r\n\r\n```\r\n评分标准：\r\n- 10分：步骤清晰、无歧义\r\n- 7分：大部分清晰，少量需补充\r\n- 4分：有多处模糊\r\n- 1分：无法执行\r\n\r\n评审清单：\r\n- [ ] 步骤是否具体？\r\n- [ ] 操作是否可重复？\r\n- [ ] 数据是否明确？\r\n- [ ] 环境是否说明？\r\n```\r\n\r\n### 4. 风险覆盖评审（10分）\r\n**检查项**：高风险区域是否深测？\r\n\r\n```\r\n评分标准：\r\n- 10分：高风险区域100%覆盖\r\n- 7分：高风险区域80%覆盖\r\n- 4分：高风险区域50%覆盖\r\n- 1分：高风险区域未覆盖\r\n\r\n评审清单：\r\n- [ ] 资金相关场景是否深测？\r\n- [ ] 安全相关场景是否覆盖？\r\n- [ ] 并发场景是否考虑？\r\n- [ ] 异常恢复是否验证？\r\n```\r\n\r\n### 5. 规范性评审（10分）\r\n**检查项**：格式是否符合标准？\r\n\r\n```\r\n评分标准：\r\n- 10分：完全符合标准\r\n- 7分：大部分符合，少量需调整\r\n- 4分：格式混乱\r\n- 1分：无格式\r\n\r\n评审清单：\r\n- [ ] 用例编号是否规范？\r\n- [ ] 表格格式是否正确？\r\n- [ ] 字段是否完整？\r\n- [ ] 描述是否简洁？\r\n```\r\n\r\n### 6. 追溯性评审（10分）\r\n**检查项**：需求ID/风险ID是否完整？\r\n\r\n```\r\n评分标准：\r\n- 10分：每条用例都有需求ID和风险ID\r\n- 7分：大部分有，少量缺失\r\n- 4分：只有部分有\r\n- 1分：无追溯信息\r\n\r\n评审清单：\r\n- [ ] 每条用例是否关联需求ID？\r\n- [ ] 每条用例是否关联风险ID？\r\n- [ ] ID格式是否统一？\r\n- [ ] 追溯链是否完整？\r\n```\r\n\r\n## 评审报告模板\r\n\r\n```markdown\r\n## AI输出评审报告\r\n\r\n### 评审摘要\r\n- 评审日期：YYYY-MM-DD\r\n- 用例总数：XX条\r\n- 综合评分：XX/60分\r\n\r\n### 六维评分\r\n| 维度 | 分数 | 评价 | 改进建议 |\r\n|------|------|------|---------|\r\n| 完整性 | X/10 | [评价] | [建议] |\r\n| 准确性 | X/10 | [评价] | [建议] |\r\n| 可执行性 | X/10 | [评价] | [建议] |\r\n| 风险覆盖 | X/10 | [评价] | [建议] |\r\n| 规范性 | X/10 | [评价] | [建议] |\r\n| 追溯性 | X/10 | [评价] | [建议] |\r\n\r\n### 问题清单\r\n| 用例编号 | 问题类型 | 问题描述 | 改进建议 |\r\n|---------|---------|---------|---------|\r\n| TC_XXX_001 | [类型] | [描述] | [建议] |\r\n\r\n### 改进方向\r\n1. [改进方向1]\r\n2. [改进方向2]\r\n3. [改进方向3]\r\n```\r\n\r\n发现问题的问法：\r\n\"请按四维边界模型重新分析\"\r\n\"这个边界真的够深吗？\"\r\n```\r\n\r\n### 3. 风险评审\r\n**检查项**：高风险区是否深挖？\r\n\r\n```\r\n评审清单：\r\n- [ ] 资金相关场景是否重点测试？\r\n- [ ] 安全相关场景是否深度覆盖？\r\n- [ ] 数据一致性是否验证？\r\n- [ ] 并发冲突是否考虑？\r\n- [ ] 第三方依赖是否Mock？\r\n\r\n发现问题的问法：\r\n\"这个功能挂了影响多大？\"\r\n\"高风险区域测试深度够吗？\"\r\n```\r\n\r\n### 4. 一致性评审\r\n**检查项**：有没有自相矛盾？\r\n\r\n```\r\n评审清单：\r\n- [ ] 前置条件和测试步骤是否一致？\r\n- [ ] 预期结果是否可验证？\r\n- [ ] 不同用例间是否有冲突？\r\n- [ ] 业务规则是否统一？\r\n\r\n发现问题的问法：\r\n\"检查这些用例间是否有矛盾\"\r\n\"这个预期结果真的可验证吗？\"\r\n```\r\n\r\n### 5. 可实现性评审\r\n**检查项**：能不能实际执行？\r\n\r\n```\r\n评审清单：\r\n- [ ] 测试数据是否可构造？\r\n- [ ] 测试环境是否可搭建？\r\n- [ ] 测试步骤是否可执行？\r\n- [ ] 预期结果是否可观测？\r\n\r\n发现问题的问法：\r\n\"这个用例能实际执行吗？\"\r\n\"测试数据从哪来？\"\r\n```\r\n\r\n### 6. 冗余度评审\r\n**检查项**：有没有无价值用例？\r\n\r\n```\r\n评审清单：\r\n- [ ] 是否有重复覆盖的场景？\r\n- [ ] 是否有低价值用例？\r\n- [ ] 优先级标注是否合理？\r\n- [ ] 测试效率是否最优？\r\n\r\n发现问题的问法：\r\n\"删除哪些用例不影响覆盖率？\"\r\n\"哪些用例可以合并？\"\r\n```\r\n\r\n## 假设挖掘\r\n\r\nAI输出中常见的隐含假设：\r\n\r\n| 假设类型 | 示例 | 验证方法 |\r\n|---------|------|---------|\r\n| 用户行为假设 | \"用户会正常输入\" | 追问：用户误输入怎么办？ |\r\n| 环境假设 | \"网络正常\" | 追问：网络异常时会怎样？ |\r\n| 数据假设 | \"数据格式正确\" | 追问：格式错误时怎么处理？ |\r\n| 时序假设 | \"操作按顺序执行\" | 追问：乱序执行会怎样？ |\r\n| 依赖假设 | \"第三方服务正常\" | 追问：第三方挂了怎么办？ |\r\n\r\n**挖掘问法**：\r\n```\r\n请列出你在输出中做的所有假设\r\n哪些假设可能不成立？\r\n如果假设不成立，测试场景会有什么变化？\r\n```\r\n\r\n## 迭代决策树\r\n\r\n当AI输出不满意时：\r\n\r\n```\r\n输出不满意\r\n    │\r\n    ├── 完整性不够？\r\n    │       └── 补充场景：请补充[缺失的场景类型]\r\n    │\r\n    ├── 深度不够？\r\n    │       └── 深入分析：请按[具体维度]深入分析\r\n    │\r\n    ├── 风险覆盖不足？\r\n    │       └── 重点强化：请对[高风险区域]做专项测试\r\n    │\r\n    ├── 有矛盾？\r\n    │       └── 修正一致性：请修正[具体矛盾点]\r\n    │\r\n    └── 不可执行？\r\n            └── 调整可行性：请确保[测试步骤]可实际执行\r\n```\r\n\r\n## AI反驳机制\r\n\r\n**核心原则**：让AI挑战你的假设，而不是迎合你。\r\n\r\n### 反驳问法模板\r\n\r\n```\r\n模式1：质量负责人视角\r\n\"请站在质量负责人角度，指出可能遗漏的业务风险、过度测试的地方，\r\n以及上线前还需要确认的问题。\"\r\n\r\n模式2：故障反推视角\r\n\"请假设这个功能上线后出现严重问题，反推我现在的测试方案\r\n可能漏掉了什么。\"\r\n\r\n模式3：资源约束视角\r\n\"测试资源有限，请评估这些用例的投入产出比，\r\n哪些是必须测的，哪些可以简化或跳过。\"\r\n\r\n模式4：竞品对比视角\r\n\"如果竞争对手的同类功能比我们更稳定，可能是因为\r\n他们多测了哪些我们没覆盖的场景？\"\r\n```\r\n\r\n### 反驳检查清单\r\n\r\n- [ ] 是否要求AI挑战你的假设？\r\n- [ ] 是否让AI从反面看问题？\r\n- [ ] 是否评估了投入产出比？\r\n- [ ] 是否识别了过度测试的区域？\r\n\r\n## 投入产出评估\r\n\r\n### 评估维度\r\n\r\n| 维度 | 评估标准 | 权重 |\r\n|------|---------|------|\r\n| 业务价值 | 影响用户数×影响程度 | 40% |\r\n| 风险等级 | 发生概率×影响程度 | 30% |\r\n| 测试成本 | 用例数×执行时间 | 20% |\r\n| 自动化潜力 | 是否适合自动化 | 10% |\r\n\r\n### 评估矩阵\r\n\r\n| 用例类型 | 业务价值 | 风险等级 | 测试成本 | 建议 |\r\n|---------|---------|---------|---------|------|\r\n| P0+高风险 | 高 | 高 | 中 | 必须测试，优先自动化 |\r\n| P0+低风险 | 高 | 低 | 低 | 必须测试，手动即可 |\r\n| P1+高风险 | 中 | 高 | 中 | 必须测试，考虑自动化 |\r\n| P1+低风险 | 中 | 低 | 低 | 选择性测试 |\r\n| P2+高风险 | 低 | 高 | 中 | 评估后决定 |\r\n| P2+低风险 | 低 | 低 | 低 | 可跳过或简化 |\r\n\r\n### ROI计算公式\r\n\r\n```\r\nROI = (业务价值 × 风险等级) / 测试成本\r\n\r\n示例：\r\n用例A：业务价值=5, 风险等级=5, 测试成本=2\r\nROI = (5×5)/2 = 12.5 → 高ROI，优先测试\r\n\r\n用例B：业务价值=2, 风险等级=2, 测试成本=5\r\nROI = (2×2)/5 = 0.8 → 低ROI，可简化\r\n```\r\n\r\n## 评审报告模板\r\n\r\n```markdown\r\n## AI输出评审报告\r\n\r\n### 总体评价\r\n- 完整性：⭐⭐⭐⭐☆\r\n- 深度：⭐⭐⭐☆☆\r\n- 风险覆盖：⭐⭐⭐⭐☆\r\n- 一致性：⭐⭐⭐⭐⭐\r\n- 可实现性：⭐⭐⭐⭐☆\r\n- 冗余度：⭐⭐⭐⭐☆\r\n\r\n### 主要问题\r\n1. [问题1]：[具体描述]\r\n2. [问题2]：[具体描述]\r\n\r\n### 改进建议\r\n1. [建议1]：[具体方向]\r\n2. [建议2]：[具体方向]\r\n\r\n### 迭代方向\r\n优先改进：[最关键的改进点]\r\n```\r\n\r\n## 验收清单\r\n\r\n评审完成后检查：\r\n- [ ] 是否识别了AI的隐含假设？\r\n- [ ] 是否评估了覆盖完整性？\r\n- [ ] 是否有明确的迭代方向？\r\n- [ ] 评审报告是否可执行？\n\nFile v1.3.0:_meta.json\n\n{\n  \"ownerId\": \"kn71y9b23csfx0ykgm55d5m9x5891zt8\",\n  \"slug\": \"qa-ai-output-critique\",\n  \"version\": \"1.3.0\",\n  \"publishedAt\": 1781964278091\n}\n\nFile v1.3.0:skill-card.md\n\n## Description: <br>\nAI输出评审与补全，识别AI输出的不足并指导迭代。当AI生成内容后需要质量评估或改进时激活。 <br>\n\nThis skill is ready for commercial/non-commercial use. <br>\n\n## Publisher: <br>\n[kokxi](https://clawhub.ai/user/kokxi) <br>\n\n### License/Terms of Use: <br>\nMIT-0 <br>\n\n\n## Use Case: <br>\nQA practitioners, testers, and developers use this skill to critique AI-generated test cases and identify gaps in coverage, accuracy, executability, risk coverage, formatting, and traceability. It produces a structured review report with assumptions, issue lists, and improvement guidance. <br>\n\n### Deployment Geography for Use: <br>\nGlobal <br>\n\n## Known Risks and Mitigations: <br>\nRisk: Broad trigger phrases may activate the skill during general critique or improvement discussions. <br>\nMitigation: Confirm the task is an AI-output critique or test-review task before applying the review framework. <br>\nRisk: Review reports may include incorrect or incomplete quality judgments if the input test cases or requirements are incomplete. <br>\nMitigation: Validate the report against source requirements, business rules, and tester judgment before using it for release decisions. <br>\n\n\n## Reference(s): <br>\n\n\n## Skill Output: <br>\n**Output Type(s):** [Text, Markdown, Guidance] <br>\n**Output Format:** [Markdown review report with scoring tables, assumption lists, issue lists, and improvement recommendations] <br>\n**Output Parameters:** [1D] <br>\n**Other Properties Related to Output:** [Read-only critique output; no shell commands, code execution, or file changes are expected.] <br>\n\n## Skill Version(s): <br>\n1.3.0 (source: server release metadata) <br>\n\n## Ethical Considerations: <br>\nUsers should evaluate whether this skill is appropriate for their environment, review any generated or modified files before relying on them, and apply their organization's safety, security, and compliance requirements before deployment. <br>","readmeExcerpt":"Skill: qa-ai-output-critique Owner: kokxi Summary: 对AI生成的测试用例进行八维评审（完整性、正确性、可执行性、风险覆盖、规范性、一致性、追溯性、冗余度），是AI生成用例后的第一个质量门禁。当AI刚刚生成了一大批测试用例、你需要确保这些用例真的有价值而不是\"看起来不错\"时，应当使用此技能。不要假设AI输出的都是对的——AI经常生成语义正确但实际操作不了的用例。每个维度评分低于7分的必须标注问题并使用MISSING/WRONG/VAGUE等规范格式标记。无上游场景树/风险清单时降级为六维评审（跳过追溯性、简化完整性）。 触发场景：检查一下输出、评审用例质量、验证完整性、这个用例对吗、自动检查时。 Use when the user asks about: critiquing AI-generated test cases across completeness, correctn","codeSnippets":[],"executableExamples":[{"language":"markdown","snippet":"# 测试用例评审报告\n\n## 一、八维评分          → 每维 10 分，<7 分标问题\n## 二、问题清单          → 用例 ID | 维度 | 标记 | 问题描述 | 修正建议\n## 三、覆盖遗漏          → 必须给依据 ID（RISK- / REQ- / SC-）\n## 四、改进方向          → 可执行的具体动作\n## 五、评审结论          → 需重新生成 / 需修改后复审 / 通过"},{"language":"text","snippet":"请列出你在输出中做的所有假设。\n哪些假设可能不成立？\n如果假设不成立，测试场景会有什么变化？"},{"language":"text","snippet":"输出不满意\n├─ 完整性不够？ → 请补充[缺失的场景类型]\n├─ 深度不够？   → 请按[具体维度]深入分析\n├─ 风险覆盖不足？ → 请对[高风险区域]做专项测试\n├─ 有矛盾？     → 请修正[具体矛盾点]\n├─ 冗余过多？   → 请合并或删除[低价值用例]\n└─ 不可执行？   → 请确保[测试步骤]可实际执行"},{"language":"text","snippet":"模式1：质量负责人视角\n\"请站在质量负责人角度，指出可能遗漏的业务风险、过度测试的地方，\n 以及上线前还需要确认的问题。\"\n\n模式2：故障反推视角\n\"请假设这个功能上线后出现严重问题，反推我现在的测试方案可能漏掉了什么。\"\n\n模式3：资源约束视角\n\"测试资源有限，请评估这些用例的投入产出比，哪些是必须测的，\n 哪些可以简化或跳过。\"\n\n模式4：竞品对比视角\n\"如果竞争对手的同类功能比我们更稳定，可能是因为他们多测了哪些\n 我们没覆盖的场景？\""},{"language":"text","snippet":"ROI = (业务价值 × 风险等级) / 测试成本\n\n用例A：业务价值=5，风险等级=5，测试成本=2  → ROI = 12.5  高 ROI，优先测试\n用例B：业务价值=2，风险等级=2，测试成本=5  → ROI = 0.8   低 ROI，可简化"},{"language":"text","snippet":"评分标准：\n- 10分：覆盖所有主路径+分支+异常+边界（基于场景树）\n- 7分：覆盖主路径和主要异常\n- 4分：只覆盖主路径\n- 1分：严重缺失\n\n评审清单：\n- [ ] 主路径场景是否完整？\n- [ ] 分支路径是否覆盖？\n- [ ] 异常场景是否考虑？\n- [ ] 边界条件是否分析？\n- [ ] 非功能需求是否涉及？\n\n发现问题的问法：\n\"请列出你输出中未覆盖的场景类型\"\n\"对照场景树，检查覆盖率\"\n\"请按四维边界模型重新分析\"\n\"这个边界真的够深吗？\"\n\n降级模式（无场景树时）：\n- 基于通用场景清单检查：主流程、分支、异常、边界、非功能\n- 标注\"建议补充场景树后重新评审\""}],"parameters":null,"dependencies":[],"permissions":[],"extractedFiles":[{"path":"SKILL.md","content":"---\nname: qa-ai-output-critique\ndescription: >-\n  对AI生成的测试用例进行八维评审（完整性、正确性、可执行性、风险覆盖、规范性、一致性、追溯性、冗余度），是AI生成用例后的第一个质量门禁。当AI刚刚生成了一大批测试用例、你需要确保这些用例真的有价值而不是\"看起来不错\"时，应当使用此技能。不要假设AI输出的都是对的——AI经常生成语义正确但实际操作不了的用例。每个维度评分低于7分的必须标注问题并使用MISSING/WRONG/VAGUE等规范格式标记。无上游场景树/风险清单时降级为六维评审（跳过追溯性、简化完整性）。\n  触发场景：检查一下输出、评审用例质量、验证完整性、这个用例对吗、自动检查时。 Use when the user asks about: critiquing AI-generated test cases across completeness, correctness, executability, risk coverage, conformance, consistency, traceability, and redundancy.\nlicense: MIT\nallowed-tools: Read Grep Glob\nmetadata:\n  display-name: \"Ai Output Critique\"\n  version: \"1.8.0\"\n  when-to-use: \"AI生成用例后自动激活（最终输出前的必过门禁）；用户说\\\"检查一下输出\\\"、\\\"评审用例质量\\\"、\\\"验证完整性\\\"、\\\"这个用例对吗\\\"、\\\"自动检查\\\"时\"\n  related-skills: \"{\\\"upstream\\\":[\\\"qa-ai-prompt-strategy\\\",\\\"qa-scenario-tree\\\",\\\"qa-risk-intuition\\\"],\\\"downstream\\\":[\\\"qa-ai-blindspot-compensation\\\",\\\"qa-expert-review\\\",\\\"qa-output-validation\\\"]}\"\n  references: \"[\\\"references/review-dimensions.md\\\",\\\"references/deep-review-techniques.md\\\",\\\"assets/critique-report.md\\\"]\"\n  input-format: \"{\\\"required\\\":[{\\\"name\\\":\\\"AI生成测试用例\\\",\\\"type\\\":\\\"array\\\",\\\"description\\\":\\\"AI生成的9列标准测试用例\\\"}],\\\"optional\\\":[{\\\"name\\\":\\\"场景树\\\",\\\"type\\\":\\\"object\\\",\\\"description\\\":\\\"来自qa-scenario-tree，用于完整性评审\\\"},{\\\"name\\\":\\\"风险清单\\\",\\\"type\\\":\\\"object\\\",\\\"description\\\":\\\"来自qa-risk-intuition，用于风险覆盖评审\\\"},{\\\"name\\\":\\\"需求ID列表\\\",\\\"type\\\":\\\"array\\\",\\\"description\\\":\\\"REQ-{模块缩写}-{序号} 列表，用于追溯性评审\\\"}]}\"\n  output-format: \"{\\\"traceability\\\":[\\\"本技能只评审、不新增 ID；评审问题关联到被评审的原用例ID：TC_{模块缩写}_{功能缩写}_{三位序号}\\\",\\\"覆盖遗漏的依据引用上游 ID：REQ- 需求 / SC- 场景 / RISK- 风险点\\\"],\\\"structure\\\":[{\\\"critique_report\\\":\\\"评审报告：八维评分（降级模式为六维）+ 问题清单（用例ID|维度|标记|问题描述|修正建议）+ 覆盖遗漏 + 改进方向 + 三选一结论\\\"},\\\"评分：每维 10 分、总分≥64 合格；任一维 <7 分必须标问题并修改（总分达标不豁免单维不合格）\\\",\\\"问题标记三选一：MISSING（缺失）/ WRONG（错误）/ VAGUE（含糊）\\\",\\\"覆盖遗漏必须给出依据 ID，不接受凭感觉的\\\\\\\"还不够全面\\\\\\\"\\\",\\\"本技能不产出 9 列用例表 —— 只评审，用例由 qa-test-case-design 定义、qa-ai-prompt-strategy 驱动生成\\\"]}\"\n  error-recovery-guidance: \"{\\\"on_failure\\\":\\\"评审发现系统性问题时回退到AI生成步骤修正\\\",\\\"retry_behavior\\\":\\\"修正提示词或上下文后重新生成并评审\\\"}\"\n  categories: \"[\\\"Development\\\",\\\"Testing\\\",\\\"AI\\\"]\"\n  depth-requirement: \"{\\\"reference_value\\\":\\\"按用例数量与复杂度调整评审投入；用例越多越要分维度逐条评，不抽样\\\",\\\"minimum\\\":\\\"至少覆盖功能正确性、边界条件、异常场景 3 个评审维度；低于 7 分的维度必须标问题\\\"}\"\n---\n\n> ⚠️ 本技能单独使用效果有限，建议配合完整技能集（12 步工作流）使用。安装：npx skills add Kokxi/qa-test-skills\n\n> **⚠️ 安全警告**：本技能的示例可能涉及测试用例整理、合并或删除建议。\n> 实际使用时请勿直接执行批量删除操作，先备份原数据并确认非关键用例。\n> 本技能仅在 workspace/ 输出评估文件，不持久化、不外传、不跨会话复用。\n\n# AI 输出评审\n\n## 核心原则\n\nAI 输出**看起来**都对，但专家能看出哪里不够。\n\n这个技能是 AI 生成用例后的**第一个质量门禁**——不要假设 AI 输出的都是对的。\n\n## 1. 八维评审速查\n\n每维 10 分，**总分 ≥ 64 合格**。**但总分达标不豁免单维不合格**：任一维 < 7 分必须改。\n\n| 维度 | 评分核心 | 最常见问题 |\n|------|---------|-----------|\n| **完整性** | 场景覆盖是否完整 | 缺异常路径 |\n| **正确性** | 业务规则和预期是否正确 | 预期结果不自洽 |\n| **可执行性** | 步骤是否清晰可执行 | 步骤写\"按正常流程\" |\n| **风险覆盖** | 高风险区域是否深测 | 资损/并发场景缺失 |\n| **规范性** | 格式是否符合标准 | 编号断号、列错位 |\n| **追溯性** | `REQ-`/`SC-` ID 是否完整 | 用例无需求关联 |\n| **一致性** | 用例间是否自相矛盾 | 前置与步骤不匹配 |\n| **冗余度** | 是否有无价值用例 | 多条用例覆盖同一点 |\n\n> 逐维详细评分标准与评审清单见 [`references/review-dimensions.md`](references/review"},{"path":"_meta.json","content":"{\n  \"ownerId\": \"kn71y9b23csfx0ykgm55d5m9x5891zt8\",\n  \"slug\": \"qa-ai-output-critique\",\n  \"version\": \"1.8.0\",\n  \"publishedAt\": 1790655907399\n}"},{"path":"references/deep-review-techniques.md","content":"# 深度评审技巧\n\n> 本文是 `qa-ai-output-critique` 的**深入技巧**。八维评分与评审报告已产出后，\n> 想再深挖一层、或判断哪些用例该砍时读本文。\n> 八维评分标准见 [`review-dimensions.md`](review-dimensions.md)。\n\n**使用时机**：这些是评审报告输出**之后**的补充手段，用于发现更深层的问题，\n不是独立的评审体系。\n\n---\n\n## 假设挖掘\n\nAI 输出中常见的隐含假设——这些是\"看起来都对\"的用例背后没写出来的东西：\n\n| 假设类型 | 示例 | 追问话术 |\n|---------|------|---------|\n| 用户行为假设 | \"用户会正常输入\" | 用户误输入怎么办？ |\n| 环境假设 | \"网络正常\" | 网络异常时会怎样？ |\n| 数据假设 | \"数据格式正确\" | 格式错误时怎么处理？ |\n| 时序假设 | \"操作按顺序执行\" | 乱序执行会怎样？ |\n| 依赖假设 | \"第三方服务正常\" | 第三方挂了怎么办？ |\n\n**挖掘问法**（直接问 AI，比自己逐条想高效）：\n\n```text\n请列出你在输出中做的所有假设。\n哪些假设可能不成立？\n如果假设不成立，测试场景会有什么变化？\n```\n\n---\n\n## 迭代决策树\n\n评审结果不满意时，按问题类型给不同的返工指令——**笼统地说\"再改改\"是无效的**：\n\n```text\n输出不满意\n├─ 完整性不够？ → 请补充[缺失的场景类型]\n├─ 深度不够？   → 请按[具体维度]深入分析\n├─ 风险覆盖不足？ → 请对[高风险区域]做专项测试\n├─ 有矛盾？     → 请修正[具体矛盾点]\n├─ 冗余过多？   → 请合并或删除[低价值用例]\n└─ 不可执行？   → 请确保[测试步骤]可实际执行\n```\n\n---\n\n## AI 反驳机制\n\n**让 AI 挑战你的假设，而不是迎合你。** 评审者最容易掉进的坑是确认偏误——\n自己写的用例自己看不出问题，让 AI 扮演对抗角色能有效破除。\n\n```text\n模式1：质量负责人视角\n\"请站在质量负责人角度，指出可能遗漏的业务风险、过度测试的地方，\n 以及上线前还需要确认的问题。\"\n\n模式2：故障反推视角\n\"请假设这个功能上线后出现严重问题，反推我现在的测试方案可能漏掉了什么。\"\n\n模式3：资源约束视角\n\"测试资源有限，请评估这些用例的投入产出比，哪些是必须测的，\n 哪些可以简化或跳过。\"\n\n模式4：竞品对比视角\n\"如果竞争对手的同类功能比我们更稳定，可能是因为他们多测了哪些\n 我们没覆盖的场景？\"\n```\n\n**检查**\n- [ ] 是否要求 AI 挑战你的假设（而非只让它确认）\n- [ ] 是否让 AI 从反面看问题（故障反推）\n- [ ] 是否评估了投入产出比\n- [ ] 是否识别了**过度测试**的区域（不只是覆盖不足）\n\n---\n\n## 投入产出评估\n\n用于决定**砍掉哪些用例**——覆盖不足要补，但冗余用例同样是在消耗资源。\n\n### 评估维度\n\n| 维度 | 评估标准 | 权重 |\n|------|---------|------|\n| 业务价值 | 影响用户数 × 影响程度 | 40% |\n| 风险等级 | 发生概率 × 影响程度 | 30% |\n| 测试成本 | 用例数 × 执行时间 | 20% |\n| 自动化潜力 | 是否适合自动化 | 10% |\n\n### 评估矩阵\n\n| 用例类型 | 业务价值 | 风险等级 | 测试成本 | 建议 |\n|---------|---------|---------|---------|------|\n| P0 + 高风险 | 高 | 高 | 中 | 必须测试，优先自动化 |\n| P0 + 低风险 | 高 | 低 | 低 | 必须测试，手动即可 |\n| P1 + 高风险 | 中 | 高 | 中 | 必须测试，考虑自动化 |\n| P1 + 低风险 | 中 | 低 | 低 | 选择性测试 |\n| P2 + 高风险 | 低 | 高 | 中 | 评估后决定 |\n| P2 + 低风险 | 低 | 低 | 低 | 可跳过或简化 |\n\n### ROI 计算\n\n```text\nROI = (业务价值 × 风险等级) / 测试成本\n\n用例A：业务价值=5，风险等级=5，测试成本=2  → ROI = 12.5  高 ROI，优先测试\n用例B：业务价值=2，风险等级=2，测试成本=5  → ROI = 0.8   低 ROI，可简化\n```\n\n> **注意 ROI 的陷阱**：公式里没有\"缺陷发现概率\"。低 ROI 用例仍可能是唯一能发现\n> 某个严重缺陷的用例——尤其 P2+低风险里的**并发与越权**场景。\n> 用 ROI 决定\"测多少\"，不要用它决定\"测不测\"。"},{"path":"references/review-dimensions.md","content":"# 八维评审法 — 完整评审维度与评分标准\n\n> 本文档是 `qa-ai-output-critique` 的参考文件。执行评审时，按以下八维评分标准逐项打分。\n> 每维度 10 分，总分 ≥ 64 分为合格。\n\n---\n\n## 评分总览\n\n| 维度 | 评分核心 | 默认权重 |\n|------|---------|---------|\n| 完整性 | 场景覆盖是否完整 | 10分 |\n| 正确性 | 业务规则和预期是否正确 | 10分 |\n| 可执行性 | 步骤是否清晰可执行 | 10分 |\n| 风险覆盖 | 高风险区域是否深测 | 10分 |\n| 规范性 | 格式是否符合标准 | 10分 |\n| 追溯性 | 需求ID/风险ID是否完整 | 10分 |\n| 一致性 | 用例间是否自相矛盾 | 10分 |\n| 冗余度 | 是否有无价值用例 | 10分 |\n\n---\n\n## 1. 完整性评审（10分）\n\n**检查项**：是否覆盖了所有场景？\n\n```text\n评分标准：\n- 10分：覆盖所有主路径+分支+异常+边界（基于场景树）\n- 7分：覆盖主路径和主要异常\n- 4分：只覆盖主路径\n- 1分：严重缺失\n\n评审清单：\n- [ ] 主路径场景是否完整？\n- [ ] 分支路径是否覆盖？\n- [ ] 异常场景是否考虑？\n- [ ] 边界条件是否分析？\n- [ ] 非功能需求是否涉及？\n\n发现问题的问法：\n\"请列出你输出中未覆盖的场景类型\"\n\"对照场景树，检查覆盖率\"\n\"请按四维边界模型重新分析\"\n\"这个边界真的够深吗？\"\n\n降级模式（无场景树时）：\n- 基于通用场景清单检查：主流程、分支、异常、边界、非功能\n- 标注\"建议补充场景树后重新评审\"\n```\n\n---\n\n## 2. 正确性评审（10分）\n\n**检查项**：业务规则和预期结果是否正确？\n\n```text\n核心关注：对不对（内容正确性）\n\n评分标准：\n- 10分：业务规则正确、预期可验证\n- 7分：大部分正确，少量细节需调整\n- 4分：有多处错误\n- 1分：严重错误\n\n评审清单：\n- [ ] 业务规则描述是否符合需求？\n- [ ] 预期结果是否与实际系统行为一致？\n- [ ] 数据计算逻辑是否正确？\n- [ ] 状态转换描述是否准确？\n\n发现问题的问法：\n\"这个预期结果与实际系统行为一致吗？\"\n\"业务规则描述是否准确？\"\n\"这个状态转换逻辑对吗？\"\n```\n\n---\n\n## 3. 可执行性评审（10分）\n\n**检查项**：能不能实际执行？\n\n```text\n核心关注：能不能做（可操作性）\n\n评分标准：\n- 10分：步骤清晰、无歧义、可执行\n- 7分：大部分清晰，少量需补充\n- 4分：有多处模糊\n- 1分：无法执行\n\n评审清单：\n- [ ] 测试数据是否可构造？\n- [ ] 测试环境是否可搭建？\n- [ ] 测试步骤是否可重复？\n- [ ] 预期结果是否可观测？\n\n发现问题的问法：\n\"这个用例能实际执行吗？\"\n\"测试数据从哪来？\"\n\"测试环境怎么搭建？\"\n```\n\n---\n\n## 4. 风险覆盖评审（10分）\n\n**检查项**：高风险区域是否深测？\n\n```text\n评分标准：\n- 10分：高风险区域100%覆盖（基于风险清单）\n- 7分：高风险区域80%覆盖\n- 4分：高风险区域50%覆盖\n- 1分：高风险区域未覆盖\n\n评审清单：\n- [ ] 资金相关场景是否深测？\n- [ ] 安全相关场景是否覆盖？\n- [ ] 并发场景是否考虑？\n- [ ] 异常恢复是否验证？\n- [ ] 数据一致性是否验证？\n- [ ] 第三方依赖是否Mock？\n\n发现问题的问法：\n\"这个功能挂了影响多大？\"\n\"高风险区域测试深度够吗？\"\n\n降级模式（无风险清单时）：\n- 基于默认风险类型检查：资金、安全、并发、数据一致性\n- 标注\"建议补充风险清单后重新评审\"\n```\n\n---\n\n## 5. 规范性评审（10分）\n\n**检查项**：格式是否符合标准？\n\n```text\n评分标准：\n- 10分：完全符合标准\n- 7分：大部分符合，少量需调整\n- 4分：格式混乱\n- 1分：无格式\n\n评审清单：\n- [ ] 用例编号是否规范？\n- [ ] 表格格式是否正确？\n- [ ] 字段是否完整？\n- [ ] 描述是否简洁？\n```\n\n---\n\n## 6. 追溯性评审（10分）\n\n**检查项**：需求ID/风险ID是否完整？\n\n```text\n评分标准：\n- 10分：每条用例都有需求ID和风险ID\n- 7分：大部分有，少量缺失\n- 4分：只有部分有\n- 1分：无追溯信息\n\n评审清单：\n- [ ] 每条用例是否关联需求ID？\n- [ ] 每条用例是否关联风险ID？\n- [ ] ID格式是否统一？\n- [ ] 追溯链是否完整？\n\n降级模式（无需求ID列表时）：\n- 跳过此维度\n- 标注\"需补充追溯信息\"\n```\n\n---\n\n## 7. 一致性评审（10分）\n\n**检查项**：用例间是否自相矛盾？\n\n```text\n评分标准：\n- 10分：完全一致，无矛盾\n- 7分：大部分一致，少量需调整\n- 4分：有多处矛盾\n- 1分：严重矛盾\n\n评审清单：\n- [ ] 前置条件和测试步骤是否一致？\n- [ ] 不同用例间是否有冲突？\n- [ ] 业务规则是否统一？\n- [ ] 预期结果是否互斥？\n\n发现问题的问法：\n\"检查这些用例间是否有矛盾\"\n\"前置条件和步骤是否匹配？\"\n```\n\n---\n\n## 8. 冗余度评审（10分）\n\n**检查项**：有没有无价值用例？\n\n```text\n评分标准：\n- 10分：无冗余，每条用例都有价值\n- 7分：少量冗余\n- 4分：有多处冗余\n- 1分：大量冗余\n\n评审清单：\n- [ ] 是否有重复覆盖的场景？\n- [ ] 是否有低价值用例？\n- [ ] 优先级标注是否合理？\n- [ ] 测试效率是否最优？\n\n发现问题的问法：\n\"删除哪些用例不影响覆盖率？\"\n\"哪些用例可以合并？\"\n```"},{"path":"assets/critique-report.md","content":"# 评审报告模板\n\n> 八维评分的详细标准与逐维评审清单见 [`review-dimensions.md`](review-dimensions.md)；\n> 深度挖掘技巧见 [`deep-review-techniques.md`](deep-review-techniques.md)。\n\n## 模式 A：完整评审报告（有场景树 + 风险清单）\n\n```markdown\n# 测试用例评审报告\n\n**评审对象**：测试用例 v1 | **用例总数**：N | **评审日期**：YYYY-MM-DD\n**评审模式**：模式 A（完整八维）\n\n## 一、八维评分\n\n| 维度 | 得分 | 主要问题 | 严重度 |\n|------|------|---------|--------|\n| 完整性 | 8/10 | 异常路径缺\"依赖服务超时\" | 高 |\n| 正确性 | 9/10 | — | — |\n| 可执行性 | 6/10 | 3 条用例步骤写\"按正常流程操作\" | 高 |\n| 风险覆盖 | 7/10 | 支付并发场景未覆盖 | 高 |\n| 规范性 | 9/10 | 编号 TC_LOGIN_002 断号 | 低 |\n| 追溯性 | 8/10 | 2 条用例未关联 REQ- | 中 |\n| 一致性 | 9/10 | — | — |\n| 冗余度 | 8/10 | 4 条用例覆盖点重复 | 低 |\n| **总分** | **64/80** | | |\n\n> 合格线 ≥ 64 分（每维 10 分 × 8 维）。**注意：总分达标不等于没有高严重度问题**——\n> 上表可执行性 6 分已低于 7 分阈值，即使总分够格也必须修改。\n\n## 二、问题清单（按严重度）\n\n| 序号 | 用例 ID | 维度 | 标记 | 问题描述 | 修正建议 |\n|------|--------|------|------|---------|---------|\n| 1 | TC_API_LOGIN_005 | 可执行性 | VAGUE | 步骤\"按正常流程操作\"，无法判断执行了哪条路径 | 补具体 method+path+参数 |\n| 2 | — | 风险覆盖 | MISSING | 支付并发回调场景完全缺失 | 补 RISK-PAY-CONC 对应用例 |\n| 3 | TC_API_LOGIN_002 | 规范性 | WRONG | 编号断号（001→003） | 重排为连续编号 |\n\n**标记含义**：`MISSING`（缺失）/ `WRONG`（错误）/ `VAGUE`（含糊）\n\n## 三、覆盖遗漏\n\n| 遗漏内容 | 来源依据 | 优先级 |\n|---------|---------|--------|\n| 依赖服务超时降级 | 风险评估 RISK-PAY-CONC-002 | 高 |\n| 第三方支付回调验签失败 | 需求 REQ-PAY-003 | 高 |\n\n## 四、改进方向\n\n1. 补 [X] 类异常场景\n2. 将 [Y] 条用例的步骤具体化\n3. 修正编号断号\n\n## 五、评审结论\n\n- [ ] 需重新生成（存在高严重度问题）\n- [ ] 需修改后复审\n- [x] 通过，进入盲区补盲（`qa-ai-blindspot-compensation`）\n```\n\n## 模式 B：简化评审报告（无上游数据）\n\n```markdown\n# 测试用例评审报告（降级模式）\n\n> ⚠️ **降级评审**：缺少场景树/风险清单/需求 ID，本次评审为模式 B——\n> 完整性基于通用场景清单判断、风险覆盖基于默认风险类型判断、**追溯性维度已跳过**。\n> 建议补充上游数据后重新评审。\n\n**评审模式**：模式 B（六维，追溯性跳过）\n| 维度 | 得分 | 主要问题 |\n|------|------|---------|\n| 完整性 | 7/10 | 基于通用清单判断，精度有限 |\n| 正确性 | 9/10 | — |\n| 可执行性 | 6/10 | 步骤含糊 |\n| 风险覆盖 | 6/10 | 基于默认风险类型（资金/安全/并发/数据） |\n| 规范性 | 9/10 | — |\n| 一致性 | 9/10 | — |\n| 冗余度 | 8/10 | — |\n| ~~追溯性~~ | — | **需补充追溯信息后评审** |\n```\n\n## 模式 C：快速评审（需要口头/即时反馈，不出正式报告）\n\n```markdown\n## AI输出评审报告（快速）\n\n### 总体评价\n- 完整性：⭐⭐⭐⭐☆\n- 正确性：⭐⭐⭐⭐☆\n- 可执行性：⭐⭐⭐☆☆\n- 风险覆盖：⭐⭐⭐⭐☆\n- 规范性：⭐⭐⭐⭐⭐\n- 追溯性：⭐⭐⭐⭐☆\n- 一致性：⭐⭐⭐⭐☆\n- 冗余度：⭐⭐⭐⭐☆\n\n### 主要问题\n1. [问题1]：[具体描述]\n2. [问题2]：[具体描述]\n\n### 迭代方向\n优先改进：[最关键的改进点]\n```\n\n> 快速评审**不产出正式报告、不进工作流**。需要留痕、可追溯时用模式 A/B。\n\n---\n\n## 完整工作示例\n\n### 示例 1：模式 A（有场景树 + 风险清单）\n\n**输入**：AI 生成的登录功能用例 + 场景树 + 风险清单\n\n| 维度 | 得分 | 依据 |\n|------|------|------|\n| 完整性 | 7/10 | 场景树 10 个场景，用例覆盖 7 个（70%） |\n| 正确性 | 9/10 | 业务规则描述基本正确 |\n| 可执行性 | 8/10 | 大部分步骤清晰 |\n| **风险覆盖** | **6/10** | 风险清单 3 个高风险，用例只覆盖 1 个 |\n| 规范性 | 9/10 | 格式规范 |\n| 追溯性 | 8/10 | 大部分有需求 ID |\n| 一致性 | 9/10 | 无明显矛盾 |\n| 冗余度 | 9/10 | 无明显冗余 |\n| **总分** | **65/80** | 合格 |\n\n**但风险覆盖 6 分 < 7 分** → 必须修改。总分达标不豁免单维不合格。\n\n**改进方向**：补并发登录、密码暴力破解、Session 超时场景。\n\n### 示例 2：模式 B（无上游数据）\n\n**输入**：AI 生成的登录功能用例（无场景树/风险清单）\n\n| 维度 | 得分 | 依据 |\n|------|------|------|\n| 完整性 | 6/10 | 基于通用场景清单，缺并发与安全场景 |\n| 正确性 | 9/10 | 业务规则正确 |\n| 可执行性 | 8/10 | 步骤清晰 |\n| **风险覆盖** | **5/10** | 未考虑高风险区域 |\n| 规范性 | 9/10 | 格式规范 |\n| 一致性 | 9/10 | 无明显矛盾 |\n| 冗余度 | 9/10 | 无明显冗余 |\n| ~~追溯性~~ | — | **跳过，缺需求 ID 列表** |\n| **总分** | **55/60** | |\n\n**结论**：降级评审通过但精度有限 → **建议补充场景树与风险清单后重新评审**。\n\n---\n\n## 填写要求\n\n| 项 | 要求 | 常见错误 |\n|--"}],"languages":[],"docsSourceLabel":"CLAWHUB","editorialOverview":"对AI生成的测试用例进行八维评审（完整性、正确性、可执行性、风险覆盖、规范性、一致性、追溯性、冗余度），是AI生成用例后的第一个质量门禁。当AI刚刚生成了一大批测试用例、你需要确保这些用例真的有价值而不是\"看起来不错\"时，应当使用此技能。不要假设AI输出的都是对的——AI经常生成语义正确但实际操作不了的用例。每个维度评分低于7分的必须标注问题并使用MISSING/WRONG/VAGUE等规范格式标记。无上游场景树/风险清单时降级为六维评审（跳过追溯性、简化完整性）。 触发场景：检查一下输出、评审用例质量、验证完整性、这个用例对吗、自动检查时。 Use when the user asks about: critiquing AI-generated test cases across completeness, correctness, executability, risk coverage, conformance, consistency, traceability, and redundancy. Skill: qa-ai-output-critique Owner: kokxi Summary: 对AI生成的测试用例进行八维评审（完整性、正确性、可执行性、风险覆盖、规范性、一致性、追溯性、冗余度），是AI生成用例后的第一个质量门禁。当AI刚刚生成了一大批测试用例、你需要确保这些用例真的有价值而不是\"看起来不错\"时，应当使用此技能。不要假设AI输出的都是对的——AI经常生成语义正确但实际操作不了的用例。每个维度评分低于7分的必须标注问题并使用MISSING/WRONG/VAGUE等规范格式标记。无上游场景树/风险清单时降级为六维评审（跳过追溯性、简化完整性）。 触发场景：检查一下输出、评审用例质量、验证完整性、这个用例对吗、自动检查时。 Use when the user asks about: critiquing AI-generated test cases across completeness, correctn","editorialQuality":{"score":100,"threshold":65,"status":"ready","wordCount":976,"uniquenessScore":47,"reasons":[]}},"media":{"evidence":{"source":"no-media","verified":false,"confidence":"low","updatedAt":"2026-10-11T11:15:04.028Z","emptyReason":"No screenshots, media assets, or demo links are available."},"primaryImageUrl":null,"mediaAssetCount":0,"assets":[],"demoUrl":null},"ownerResources":{"evidence":{"source":"unclaimed","verified":false,"confidence":"low","updatedAt":"2026-10-11T11:15:04.028Z","emptyReason":"This page has not been claimed by the agent owner."},"hasCustomPage":false,"customPageUpdatedAt":null,"customLinks":[],"structuredLinks":{"docsUrl":null,"demoUrl":null,"supportUrl":null,"pricingUrl":null,"statusUrl":null},"customPage":null},"relatedAgents":{"evidence":{"source":"protocol-neighbors","verified":false,"confidence":"medium","updatedAt":"2026-10-11T14:16:17.867Z","emptyReason":null},"items":[{"id":"8ebccd8e-3863-4187-8355-c3f14e1f9edf","entityType":"agent","canonicalPath":"/agent/iofficeai-aionui","slug":"iofficeai-aionui","name":"AionUi","description":"Free, local, open-source 24/7 Cowork app and OpenClaw for Gemini CLI, Claude Code, Codex, OpenCode, Qwen Code, Goose CLI, Auggie, and more | 🌟 Star if you like it!","url":"https://github.com/iOfficeAI/AionUi","homepage":"https://www.aionui.com","source":"GITHUB_REPOS","protocols":["MCP","OPENCLAW"],"capabilities":[],"safetyScore":100,"overallRank":70,"updatedAt":"2026-10-09T19:11:12.944Z","createdAt":"2026-02-25T03:38:16.584Z","downloads":null},{"id":"b917f68a-ebff-438e-84f8-3f4b2494c0bc","entityType":"agent","canonicalPath":"/agent/activepieces-activepieces","slug":"activepieces-activepieces","name":"activepieces","description":"AI Agents & MCPs & AI Workflow Automation • (~400 MCP servers for AI agents) • AI Automation / AI Agent with MCPs • AI Workflows & AI Agents • MCPs for AI Agents","url":"https://github.com/activepieces/activepieces","homepage":"https://www.activepieces.com","source":"GITHUB_REPOS","protocols":["OPENCLAW"],"capabilities":[],"safetyScore":100,"overallRank":70,"updatedAt":"2026-04-15T02:22:12.426Z","createdAt":"2026-02-25T03:38:12.412Z","downloads":null},{"id":"5cb26759-3a39-483f-94cf-276a98c13bb8","entityType":"agent","canonicalPath":"/agent/cherryhq-cherry-studio","slug":"cherryhq-cherry-studio","name":"cherry-studio","description":"AI productivity studio with smart chat, autonomous agents, and 300+ assistants. Unified access to frontier LLMs","url":"https://github.com/CherryHQ/cherry-studio","homepage":"https://cherry-ai.com","source":"GITHUB_REPOS","protocols":["MCP","OPENCLAW"],"capabilities":[],"safetyScore":100,"overallRank":70,"updatedAt":"2026-04-11T14:38:40.986Z","createdAt":"2026-02-25T03:38:19.379Z","downloads":null},{"id":"6f6582d0-5d76-4f0f-b81d-86520247950b","entityType":"agent","canonicalPath":"/agent/copilotkit-copilotkit","slug":"copilotkit-copilotkit","name":"CopilotKit","description":"The Frontend for Agents & Generative UI. React + Angular","url":"https://github.com/CopilotKit/CopilotKit","homepage":"https://docs.copilotkit.ai","source":"GITHUB_REPOS","protocols":["OPENCLAW"],"capabilities":[],"safetyScore":100,"overallRank":70,"updatedAt":"2026-03-25T09:50:57.846Z","createdAt":"2026-02-25T03:39:14.617Z","downloads":null}],"links":{"hub":"/agent","source":"/agent/source/clawhub","protocols":[{"label":"OpenClaw","href":"/agent/protocol/openclew"}]}}}