qa-ai-output-critique
对AI生成的测试用例进行八维评审(完整性、正确性、可执行性、风险覆盖、规范性、一致性、追溯性、冗余度),是AI生成用例后的第一个质量门禁。当AI刚刚生成了一大批测试用例、你需要确保这些用例真的有价值而不是"看起来不错"时,应当使用此技能。不要假设AI输出的都是对的——AI经常生成语义正确但实际操作不了的用例。每个维度评分低于7分的必须标注问题并使用MISSING/WRONG/VAGUE等规范格式标记。无上游场景树/风险清单时降级为六维评审(跳过追溯性、简化完整性)。 触发场景:检查一下输出、评审用例质量、验证完整性、这个用例对吗、自动检查时。 Use when the user asks about: critiquing AI-generated test cases across completeness, correctness, executability, risk coverage, conformance, consistency, traceability, and redundancy. Skill: qa-ai-output-critique Owner: kokxi Summary: 对AI生成的测试用例进行八维评审(完整性、正确性、可执行性、风险覆盖、规范性、一致性、追溯性、冗余度),是AI生成用例后的第一个质量门禁。当AI刚刚生成了一大批测试用例、你需要确保这些用例真的有价值而不是"看起来不错"时,应当使用此技能。不要假设AI输出的都是对的——AI经常生成语义正确但实际操作不了的用例。每个维度评分低于7分的必须标注问题并使用MISSING/WRONG/VAGUE等规范格式标记。无上游场景树/风险清单时降级为六维评审(跳过追溯性、简化完整性)。 触发场景:检查一下输出、评审用例质量、验证完整性、这个用例对吗、自动检查时。 Use when the user asks about: critiquing AI-generated test cases across completeness, correctn
Rank
62
Safety
84
Downloads
1.1k
Updated
Oct 11, 2026
Version
1.8.0
Source
CLAWHUB
About
What it does, and when to use it.
Capability contract not published. No trust telemetry is available yet. 1.1K downloads reported by the source. Last updated 10/11/2026.
Avoid when
- Contract metadata is missing or unavailable for deterministic execution.
Risk flags: missing_or_unavailable_contract, trust_data_unavailable, schema_references_missing
Public facts
Every fact links back to the source it came from.
- Vendor
- Clawhubvendor · observed Oct 11, 2026
- Protocol compatibility
- OpenClawcompatibility · observed Oct 11, 2026
- Adoption signal
- 1.1K downloadsadoption · observed Oct 11, 2026
- Latest release
- 1.8.0release · observed Sep 29, 2026
- Handshake status
- UNKNOWNsecurity
Install and run
Setup complexity: low.
clawhub skill install s170jw3s1atcj5jwhqb4r7v7eh8912kp:qa-ai-output-critique- Setup complexity is classified as HIGH. You must provision dedicated cloud infrastructure or an isolated VM. Do not run this directly on your local workstation.
- Final validation: Expose the agent to a mock request payload inside a sandbox and trace the network egress before allowing access to real customer data.
Contract: missing
curl -s "https://www.xpersona.co/api/v1/agents/clawhub-kokxi-qa-ai-output-critique/snapshot"
Documentation
CLAWHUB
123,789 characters of source documentation, loaded on request.
Extracted files
5 files captured from the source.
SKILL.md
---
name: qa-ai-output-critique
description: >-
对AI生成的测试用例进行八维评审(完整性、正确性、可执行性、风险覆盖、规范性、一致性、追溯性、冗余度),是AI生成用例后的第一个质量门禁。当AI刚刚生成了一大批测试用例、你需要确保这些用例真的有价值而不是"看起来不错"时,应当使用此技能。不要假设AI输出的都是对的——AI经常生成语义正确但实际操作不了的用例。每个维度评分低于7分的必须标注问题并使用MISSING/WRONG/VAGUE等规范格式标记。无上游场景树/风险清单时降级为六维评审(跳过追溯性、简化完整性)。
触发场景:检查一下输出、评审用例质量、验证完整性、这个用例对吗、自动检查时。 Use when the user asks about: critiquing AI-generated test cases across completeness, correctness, executability, risk coverage, conformance, consistency, traceability, and redundancy.
license: MIT
allowed-tools: Read Grep Glob
metadata:
display-name: "Ai Output Critique"
version: "1.8.0"
when-to-use: "AI生成用例后自动激活(最终输出前的必过门禁);用户说\"检查一下输出\"、\"评审用例质量\"、\"验证完整性\"、\"这个用例对吗\"、\"自动检查\"时"
related-skills: "{\"upstream\":[\"qa-ai-prompt-strategy\",\"qa-scenario-tree\",\"qa-risk-intuition\"],\"downstream\":[\"qa-ai-blindspot-compensation\",\"qa-expert-review\",\"qa-output-validation\"]}"
references: "[\"references/review-dimensions.md\",\"references/deep-review-techniques.md\",\"assets/critique-report.md\"]"
input-format: "{\"required\":[{\"name\":\"AI生成测试用例\",\"type\":\"array\",\"description\":\"AI生成的9列标准测试用例\"}],\"optional\":[{\"name\":\"场景树\",\"type\":\"object\",\"description\":\"来自qa-scenario-tree,用于完整性评审\"},{\"name\":\"风险清单\",\"type\":\"object\",\"description\":\"来自qa-risk-intuition,用于风险覆盖评审\"},{\"name\":\"需求ID列表\",\"type\":\"array\",\"description\":\"REQ-{模块缩写}-{序号} 列表,用于追溯性评审\"}]}"
output-format: "{\"traceability\":[\"本技能只评审、不新增 ID;评审问题关联到被评审的原用例ID:TC_{模块缩写}_{功能缩写}_{三位序号}\",\"覆盖遗漏的依据引用上游 ID:REQ- 需求 / SC- 场景 / RISK- 风险点\"],\"structure\":[{\"critique_report\":\"评审报告:八维评分(降级模式为六维)+ 问题清单(用例ID|维度|标记|问题描述|修正建议)+ 覆盖遗漏 + 改进方向 + 三选一结论\"},\"评分:每维 10 分、总分≥64 合格;任一维 <7 分必须标问题并修改(总分达标不豁免单维不合格)\",\"问题标记三选一:MISSING(缺失)/ WRONG(错误)/ VAGUE(含糊)\",\"覆盖遗漏必须给出依据 ID,不接受凭感觉的\\\"还不够全面\\\"\",\"本技能不产出 9 列用例表 —— 只评审,用例由 qa-test-case-design 定义、qa-ai-prompt-strategy 驱动生成\"]}"
error-recovery-guidance: "{\"on_failure\":\"评审发现系统性问题时回退到AI生成步骤修正\",\"retry_behavior\":\"修正提示词或上下文后重新生成并评审\"}"
categories: "[\"Development\",\"Testing\",\"AI\"]"
depth-requirement: "{\"reference_value\":\"按用例数量与复杂度调整评审投入;用例越多越要分维度逐条评,不抽样\",\"minimum\":\"至少覆盖功能正确性、边界条件、异常场景 3 个评审维度;低于 7 分的维度必须标问题\"}"
---
> ⚠️ 本技能单独使用效果有限,建议配合完整技能集(12 步工作流)使用。安装:npx skills add Kokxi/qa-test-skills
> **⚠️ 安全警告**:本技能的示例可能涉及测试用例整理、合并或删除建议。
> 实际使用时请勿直接执行批量删除操作,先备份原数据并确认非关键用例。
> 本技能仅在 workspace/ 输出评估文件,不持久化、不外传、不跨会话复用。
# AI 输出评审
## 核心原则
AI 输出**看起来**都对,但专家能看出哪里不够。
这个技能是 AI 生成用例后的**第一个质量门禁**——不要假设 AI 输出的都是对的。
## 1. 八维评审速查
每维 10 分,**总分 ≥ 64 合格**。**但总分达标不豁免单维不合格**:任一维 < 7 分必须改。
| 维度 | 评分核心 | 最常见问题 |
|------|---------|-----------|
| **完整性** | 场景覆盖是否完整 | 缺异常路径 |
| **正确性** | 业务规则和预期是否正确 | 预期结果不自洽 |
| **可执行性** | 步骤是否清晰可执行 | 步骤写"按正常流程" |
| **风险覆盖** | 高风险区域是否深测 | 资损/并发场景缺失 |
| **规范性** | 格式是否符合标准 | 编号断号、列错位 |
| **追溯性** | `REQ-`/`SC-` ID 是否完整 | 用例无需求关联 |
| **一致性** | 用例间是否自相矛盾 | 前置与步骤不匹配 |
| **冗余度** | 是否有无价值用例 | 多条用例覆盖同一点 |
> 逐维详细评分标准与评审清单见 [`references/review-dimensions.md`](references/review_meta.json
{
"ownerId": "kn71y9b23csfx0ykgm55d5m9x5891zt8",
"slug": "qa-ai-output-critique",
"version": "1.8.0",
"publishedAt": 1790655907399
}references/deep-review-techniques.md
# 深度评审技巧 > 本文是 `qa-ai-output-critique` 的**深入技巧**。八维评分与评审报告已产出后, > 想再深挖一层、或判断哪些用例该砍时读本文。 > 八维评分标准见 [`review-dimensions.md`](review-dimensions.md)。 **使用时机**:这些是评审报告输出**之后**的补充手段,用于发现更深层的问题, 不是独立的评审体系。 --- ## 假设挖掘 AI 输出中常见的隐含假设——这些是"看起来都对"的用例背后没写出来的东西: | 假设类型 | 示例 | 追问话术 | |---------|------|---------| | 用户行为假设 | "用户会正常输入" | 用户误输入怎么办? | | 环境假设 | "网络正常" | 网络异常时会怎样? | | 数据假设 | "数据格式正确" | 格式错误时怎么处理? | | 时序假设 | "操作按顺序执行" | 乱序执行会怎样? | | 依赖假设 | "第三方服务正常" | 第三方挂了怎么办? | **挖掘问法**(直接问 AI,比自己逐条想高效): ```text 请列出你在输出中做的所有假设。 哪些假设可能不成立? 如果假设不成立,测试场景会有什么变化? ``` --- ## 迭代决策树 评审结果不满意时,按问题类型给不同的返工指令——**笼统地说"再改改"是无效的**: ```text 输出不满意 ├─ 完整性不够? → 请补充[缺失的场景类型] ├─ 深度不够? → 请按[具体维度]深入分析 ├─ 风险覆盖不足? → 请对[高风险区域]做专项测试 ├─ 有矛盾? → 请修正[具体矛盾点] ├─ 冗余过多? → 请合并或删除[低价值用例] └─ 不可执行? → 请确保[测试步骤]可实际执行 ``` --- ## AI 反驳机制 **让 AI 挑战你的假设,而不是迎合你。** 评审者最容易掉进的坑是确认偏误—— 自己写的用例自己看不出问题,让 AI 扮演对抗角色能有效破除。 ```text 模式1:质量负责人视角 "请站在质量负责人角度,指出可能遗漏的业务风险、过度测试的地方, 以及上线前还需要确认的问题。" 模式2:故障反推视角 "请假设这个功能上线后出现严重问题,反推我现在的测试方案可能漏掉了什么。" 模式3:资源约束视角 "测试资源有限,请评估这些用例的投入产出比,哪些是必须测的, 哪些可以简化或跳过。" 模式4:竞品对比视角 "如果竞争对手的同类功能比我们更稳定,可能是因为他们多测了哪些 我们没覆盖的场景?" ``` **检查** - [ ] 是否要求 AI 挑战你的假设(而非只让它确认) - [ ] 是否让 AI 从反面看问题(故障反推) - [ ] 是否评估了投入产出比 - [ ] 是否识别了**过度测试**的区域(不只是覆盖不足) --- ## 投入产出评估 用于决定**砍掉哪些用例**——覆盖不足要补,但冗余用例同样是在消耗资源。 ### 评估维度 | 维度 | 评估标准 | 权重 | |------|---------|------| | 业务价值 | 影响用户数 × 影响程度 | 40% | | 风险等级 | 发生概率 × 影响程度 | 30% | | 测试成本 | 用例数 × 执行时间 | 20% | | 自动化潜力 | 是否适合自动化 | 10% | ### 评估矩阵 | 用例类型 | 业务价值 | 风险等级 | 测试成本 | 建议 | |---------|---------|---------|---------|------| | P0 + 高风险 | 高 | 高 | 中 | 必须测试,优先自动化 | | P0 + 低风险 | 高 | 低 | 低 | 必须测试,手动即可 | | P1 + 高风险 | 中 | 高 | 中 | 必须测试,考虑自动化 | | P1 + 低风险 | 中 | 低 | 低 | 选择性测试 | | P2 + 高风险 | 低 | 高 | 中 | 评估后决定 | | P2 + 低风险 | 低 | 低 | 低 | 可跳过或简化 | ### ROI 计算 ```text ROI = (业务价值 × 风险等级) / 测试成本 用例A:业务价值=5,风险等级=5,测试成本=2 → ROI = 12.5 高 ROI,优先测试 用例B:业务价值=2,风险等级=2,测试成本=5 → ROI = 0.8 低 ROI,可简化 ``` > **注意 ROI 的陷阱**:公式里没有"缺陷发现概率"。低 ROI 用例仍可能是唯一能发现 > 某个严重缺陷的用例——尤其 P2+低风险里的**并发与越权**场景。 > 用 ROI 决定"测多少",不要用它决定"测不测"。
references/review-dimensions.md
# 八维评审法 — 完整评审维度与评分标准 > 本文档是 `qa-ai-output-critique` 的参考文件。执行评审时,按以下八维评分标准逐项打分。 > 每维度 10 分,总分 ≥ 64 分为合格。 --- ## 评分总览 | 维度 | 评分核心 | 默认权重 | |------|---------|---------| | 完整性 | 场景覆盖是否完整 | 10分 | | 正确性 | 业务规则和预期是否正确 | 10分 | | 可执行性 | 步骤是否清晰可执行 | 10分 | | 风险覆盖 | 高风险区域是否深测 | 10分 | | 规范性 | 格式是否符合标准 | 10分 | | 追溯性 | 需求ID/风险ID是否完整 | 10分 | | 一致性 | 用例间是否自相矛盾 | 10分 | | 冗余度 | 是否有无价值用例 | 10分 | --- ## 1. 完整性评审(10分) **检查项**:是否覆盖了所有场景? ```text 评分标准: - 10分:覆盖所有主路径+分支+异常+边界(基于场景树) - 7分:覆盖主路径和主要异常 - 4分:只覆盖主路径 - 1分:严重缺失 评审清单: - [ ] 主路径场景是否完整? - [ ] 分支路径是否覆盖? - [ ] 异常场景是否考虑? - [ ] 边界条件是否分析? - [ ] 非功能需求是否涉及? 发现问题的问法: "请列出你输出中未覆盖的场景类型" "对照场景树,检查覆盖率" "请按四维边界模型重新分析" "这个边界真的够深吗?" 降级模式(无场景树时): - 基于通用场景清单检查:主流程、分支、异常、边界、非功能 - 标注"建议补充场景树后重新评审" ``` --- ## 2. 正确性评审(10分) **检查项**:业务规则和预期结果是否正确? ```text 核心关注:对不对(内容正确性) 评分标准: - 10分:业务规则正确、预期可验证 - 7分:大部分正确,少量细节需调整 - 4分:有多处错误 - 1分:严重错误 评审清单: - [ ] 业务规则描述是否符合需求? - [ ] 预期结果是否与实际系统行为一致? - [ ] 数据计算逻辑是否正确? - [ ] 状态转换描述是否准确? 发现问题的问法: "这个预期结果与实际系统行为一致吗?" "业务规则描述是否准确?" "这个状态转换逻辑对吗?" ``` --- ## 3. 可执行性评审(10分) **检查项**:能不能实际执行? ```text 核心关注:能不能做(可操作性) 评分标准: - 10分:步骤清晰、无歧义、可执行 - 7分:大部分清晰,少量需补充 - 4分:有多处模糊 - 1分:无法执行 评审清单: - [ ] 测试数据是否可构造? - [ ] 测试环境是否可搭建? - [ ] 测试步骤是否可重复? - [ ] 预期结果是否可观测? 发现问题的问法: "这个用例能实际执行吗?" "测试数据从哪来?" "测试环境怎么搭建?" ``` --- ## 4. 风险覆盖评审(10分) **检查项**:高风险区域是否深测? ```text 评分标准: - 10分:高风险区域100%覆盖(基于风险清单) - 7分:高风险区域80%覆盖 - 4分:高风险区域50%覆盖 - 1分:高风险区域未覆盖 评审清单: - [ ] 资金相关场景是否深测? - [ ] 安全相关场景是否覆盖? - [ ] 并发场景是否考虑? - [ ] 异常恢复是否验证? - [ ] 数据一致性是否验证? - [ ] 第三方依赖是否Mock? 发现问题的问法: "这个功能挂了影响多大?" "高风险区域测试深度够吗?" 降级模式(无风险清单时): - 基于默认风险类型检查:资金、安全、并发、数据一致性 - 标注"建议补充风险清单后重新评审" ``` --- ## 5. 规范性评审(10分) **检查项**:格式是否符合标准? ```text 评分标准: - 10分:完全符合标准 - 7分:大部分符合,少量需调整 - 4分:格式混乱 - 1分:无格式 评审清单: - [ ] 用例编号是否规范? - [ ] 表格格式是否正确? - [ ] 字段是否完整? - [ ] 描述是否简洁? ``` --- ## 6. 追溯性评审(10分) **检查项**:需求ID/风险ID是否完整? ```text 评分标准: - 10分:每条用例都有需求ID和风险ID - 7分:大部分有,少量缺失 - 4分:只有部分有 - 1分:无追溯信息 评审清单: - [ ] 每条用例是否关联需求ID? - [ ] 每条用例是否关联风险ID? - [ ] ID格式是否统一? - [ ] 追溯链是否完整? 降级模式(无需求ID列表时): - 跳过此维度 - 标注"需补充追溯信息" ``` --- ## 7. 一致性评审(10分) **检查项**:用例间是否自相矛盾? ```text 评分标准: - 10分:完全一致,无矛盾 - 7分:大部分一致,少量需调整 - 4分:有多处矛盾 - 1分:严重矛盾 评审清单: - [ ] 前置条件和测试步骤是否一致? - [ ] 不同用例间是否有冲突? - [ ] 业务规则是否统一? - [ ] 预期结果是否互斥? 发现问题的问法: "检查这些用例间是否有矛盾" "前置条件和步骤是否匹配?" ``` --- ## 8. 冗余度评审(10分) **检查项**:有没有无价值用例? ```text 评分标准: - 10分:无冗余,每条用例都有价值 - 7分:少量冗余 - 4分:有多处冗余 - 1分:大量冗余 评审清单: - [ ] 是否有重复覆盖的场景? - [ ] 是否有低价值用例? - [ ] 优先级标注是否合理? - [ ] 测试效率是否最优? 发现问题的问法: "删除哪些用例不影响覆盖率?" "哪些用例可以合并?" ```
assets/critique-report.md
# 评审报告模板 > 八维评分的详细标准与逐维评审清单见 [`review-dimensions.md`](review-dimensions.md); > 深度挖掘技巧见 [`deep-review-techniques.md`](deep-review-techniques.md)。 ## 模式 A:完整评审报告(有场景树 + 风险清单) ```markdown # 测试用例评审报告 **评审对象**:测试用例 v1 | **用例总数**:N | **评审日期**:YYYY-MM-DD **评审模式**:模式 A(完整八维) ## 一、八维评分 | 维度 | 得分 | 主要问题 | 严重度 | |------|------|---------|--------| | 完整性 | 8/10 | 异常路径缺"依赖服务超时" | 高 | | 正确性 | 9/10 | — | — | | 可执行性 | 6/10 | 3 条用例步骤写"按正常流程操作" | 高 | | 风险覆盖 | 7/10 | 支付并发场景未覆盖 | 高 | | 规范性 | 9/10 | 编号 TC_LOGIN_002 断号 | 低 | | 追溯性 | 8/10 | 2 条用例未关联 REQ- | 中 | | 一致性 | 9/10 | — | — | | 冗余度 | 8/10 | 4 条用例覆盖点重复 | 低 | | **总分** | **64/80** | | | > 合格线 ≥ 64 分(每维 10 分 × 8 维)。**注意:总分达标不等于没有高严重度问题**—— > 上表可执行性 6 分已低于 7 分阈值,即使总分够格也必须修改。 ## 二、问题清单(按严重度) | 序号 | 用例 ID | 维度 | 标记 | 问题描述 | 修正建议 | |------|--------|------|------|---------|---------| | 1 | TC_API_LOGIN_005 | 可执行性 | VAGUE | 步骤"按正常流程操作",无法判断执行了哪条路径 | 补具体 method+path+参数 | | 2 | — | 风险覆盖 | MISSING | 支付并发回调场景完全缺失 | 补 RISK-PAY-CONC 对应用例 | | 3 | TC_API_LOGIN_002 | 规范性 | WRONG | 编号断号(001→003) | 重排为连续编号 | **标记含义**:`MISSING`(缺失)/ `WRONG`(错误)/ `VAGUE`(含糊) ## 三、覆盖遗漏 | 遗漏内容 | 来源依据 | 优先级 | |---------|---------|--------| | 依赖服务超时降级 | 风险评估 RISK-PAY-CONC-002 | 高 | | 第三方支付回调验签失败 | 需求 REQ-PAY-003 | 高 | ## 四、改进方向 1. 补 [X] 类异常场景 2. 将 [Y] 条用例的步骤具体化 3. 修正编号断号 ## 五、评审结论 - [ ] 需重新生成(存在高严重度问题) - [ ] 需修改后复审 - [x] 通过,进入盲区补盲(`qa-ai-blindspot-compensation`) ``` ## 模式 B:简化评审报告(无上游数据) ```markdown # 测试用例评审报告(降级模式) > ⚠️ **降级评审**:缺少场景树/风险清单/需求 ID,本次评审为模式 B—— > 完整性基于通用场景清单判断、风险覆盖基于默认风险类型判断、**追溯性维度已跳过**。 > 建议补充上游数据后重新评审。 **评审模式**:模式 B(六维,追溯性跳过) | 维度 | 得分 | 主要问题 | |------|------|---------| | 完整性 | 7/10 | 基于通用清单判断,精度有限 | | 正确性 | 9/10 | — | | 可执行性 | 6/10 | 步骤含糊 | | 风险覆盖 | 6/10 | 基于默认风险类型(资金/安全/并发/数据) | | 规范性 | 9/10 | — | | 一致性 | 9/10 | — | | 冗余度 | 8/10 | — | | ~~追溯性~~ | — | **需补充追溯信息后评审** | ``` ## 模式 C:快速评审(需要口头/即时反馈,不出正式报告) ```markdown ## AI输出评审报告(快速) ### 总体评价 - 完整性:⭐⭐⭐⭐☆ - 正确性:⭐⭐⭐⭐☆ - 可执行性:⭐⭐⭐☆☆ - 风险覆盖:⭐⭐⭐⭐☆ - 规范性:⭐⭐⭐⭐⭐ - 追溯性:⭐⭐⭐⭐☆ - 一致性:⭐⭐⭐⭐☆ - 冗余度:⭐⭐⭐⭐☆ ### 主要问题 1. [问题1]:[具体描述] 2. [问题2]:[具体描述] ### 迭代方向 优先改进:[最关键的改进点] ``` > 快速评审**不产出正式报告、不进工作流**。需要留痕、可追溯时用模式 A/B。 --- ## 完整工作示例 ### 示例 1:模式 A(有场景树 + 风险清单) **输入**:AI 生成的登录功能用例 + 场景树 + 风险清单 | 维度 | 得分 | 依据 | |------|------|------| | 完整性 | 7/10 | 场景树 10 个场景,用例覆盖 7 个(70%) | | 正确性 | 9/10 | 业务规则描述基本正确 | | 可执行性 | 8/10 | 大部分步骤清晰 | | **风险覆盖** | **6/10** | 风险清单 3 个高风险,用例只覆盖 1 个 | | 规范性 | 9/10 | 格式规范 | | 追溯性 | 8/10 | 大部分有需求 ID | | 一致性 | 9/10 | 无明显矛盾 | | 冗余度 | 9/10 | 无明显冗余 | | **总分** | **65/80** | 合格 | **但风险覆盖 6 分 < 7 分** → 必须修改。总分达标不豁免单维不合格。 **改进方向**:补并发登录、密码暴力破解、Session 超时场景。 ### 示例 2:模式 B(无上游数据) **输入**:AI 生成的登录功能用例(无场景树/风险清单) | 维度 | 得分 | 依据 | |------|------|------| | 完整性 | 6/10 | 基于通用场景清单,缺并发与安全场景 | | 正确性 | 9/10 | 业务规则正确 | | 可执行性 | 8/10 | 步骤清晰 | | **风险覆盖** | **5/10** | 未考虑高风险区域 | | 规范性 | 9/10 | 格式规范 | | 一致性 | 9/10 | 无明显矛盾 | | 冗余度 | 9/10 | 无明显冗余 | | ~~追溯性~~ | — | **跳过,缺需求 ID 列表** | | **总分** | **55/60** | | **结论**:降级评审通过但精度有限 → **建议补充场景树与风险清单后重新评审**。 --- ## 填写要求 | 项 | 要求 | 常见错误 | |--
AionUi
Free, local, open-source 24/7 Cowork app and OpenClaw for Gemini CLI, Claude Code, Codex, OpenCode, Qwen Code, Goose CLI, Auggie, and more | 🌟 Star if you like it!
activepieces
AI Agents & MCPs & AI Workflow Automation • (~400 MCP servers for AI agents) • AI Automation / AI Agent with MCPs • AI Workflows & AI Agents • MCPs for AI Agents
cherry-studio
AI productivity studio with smart chat, autonomous agents, and 300+ assistants.
CopilotKit
The Frontend for Agents & Generative UI. React + Angular
Machine-readable data
The same record, as JSON, for agents and crawlers.
{
"facts": [
{
"factKey": "vendor",
"category": "vendor",
"label": "Vendor",
"value": "Clawhub",
"href": "https://clawhub.ai/kokxi/skills/qa-ai-output-critique",
"sourceUrl": "https://clawhub.ai/kokxi/skills/qa-ai-output-critique",
"sourceType": "profile",
"confidence": "medium",
"observedAt": "2026-10-11T11:15:04.028Z",
"isPublic": true
},
{
"factKey": "protocols",
"category": "compatibility",
"label": "Protocol compatibility",
"value": "OpenClaw",
"href": "https://www.xpersona.co/api/v1/agents/clawhub-kokxi-qa-ai-output-critique/contract",
"sourceUrl": "https://www.xpersona.co/api/v1/agents/clawhub-kokxi-qa-ai-output-critique/contract",
"sourceType": "contract",
"confidence": "medium",
"observedAt": "2026-10-11T11:15:04.028Z",
"isPublic": true
},
{
"factKey": "traction",
"category": "adoption",
"label": "Adoption signal",
"value": "1.1K downloads",
"href": "https://clawhub.ai/kokxi/qa-ai-output-critique",
"sourceUrl": "https://clawhub.ai/kokxi/qa-ai-output-critique",
"sourceType": "profile",
"confidence": "medium",
"observedAt": "2026-10-11T11:15:04.028Z",
"isPublic": true
},
{
"factKey": "latest_release",
"category": "release",
"label": "Latest release",
"value": "1.8.0",
"href": "https://clawhub.ai/kokxi/qa-ai-output-critique",
"sourceUrl": "https://clawhub.ai/kokxi/qa-ai-output-critique",
"sourceType": "release",
"confidence": "medium",
"observedAt": "2026-09-29T04:25:07.399Z",
"isPublic": true
},
{
"factKey": "handshake_status",
"category": "security",
"label": "Handshake status",
"value": "UNKNOWN",
"href": "https://www.xpersona.co/api/v1/agents/clawhub-kokxi-qa-ai-output-critique/trust",
"sourceUrl": "https://www.xpersona.co/api/v1/agents/clawhub-kokxi-qa-ai-output-critique/trust",
"sourceType": "trust",
"confidence": "medium",
"observedAt": null,
"isPublic": true
}
],
"events": [
{
"eventType": "release",
"title": "Release 1.8.0",
"description": "**Changelog for qa-ai-output-critique v1.8.0:** - Added new references on deep review techniques and a detailed critique report template for enhanced assessment workflows. - Streamlined and clarified SKILL.md: explicit separation of documentation, stricter input/output format descriptions, and updated \"when to use\" guidance. - Reference documentation for report templates was removed and replaced with new, better-structured files. - Refined and shortened overall skill documentation, with more emphasis on required review steps, error marking, downgrade rules, and coverage of model-specific failure patterns. - Improved modularity and maintainability by removing the old skill card and consolidating standard outputs in dedicated asset files.",
"href": "https://clawhub.ai/kokxi/qa-ai-output-critique",
"sourceUrl": "https://clawhub.ai/kokxi/qa-ai-output-critique",
"sourceType": "release",
"confidence": "medium",
"observedAt": "2026-09-29T04:25:07.399Z",
"isPublic": true
}
]
}Record generated Oct 11, 2026.
