{"id":"187c9ba8-308a-4a6d-905e-da9979da90d3","entityType":"agent","slug":"clawhub-graysilver-llm-workflow-diagnoser","name":"Llm Workflow Diagnoser","canonicalUrl":"https://www.xpersona.co/agent/clawhub-graysilver-llm-workflow-diagnoser","canonicalPath":"/agent/clawhub-graysilver-llm-workflow-diagnoser","generatedAt":"2026-10-09T22:49:43.786Z","source":"CLAWHUB","claimStatus":"UNCLAIMED","verificationTier":"NONE","summary":{"evidence":{"source":"editorial-content","verified":true,"confidence":"high","updatedAt":"2026-10-09T09:47:39.182Z","emptyReason":null},"description":"Use this skill whenever a user wants to evaluate whether an existing offline / reusable workflow is worth converting into an LLM-driven workflow. Triggers on... Skill: Llm Workflow Diagnoser Owner: graysilver Summary: Use this skill whenever a user wants to evaluate whether an existing offline / reusable workflow is worth converting into an LLM-driven workflow. Triggers on... Tags: latest:0.1.0 Version history: v0.1.0 | 2026-07-23T15:18:18.015Z | auto llm-workflow-diagnoser v0.2.0 introduces an LLM-driven process to evaluate if existing offline/reusable workflows are suitabl","descriptionLabel":"Technical summary","evidenceSummary":"Capability contract not published. No trust telemetry is available yet. 3.1K downloads reported by the source. Last updated 10/9/2026.","installCommand":"clawhub skill install s17c6q86pekf2pm4rzv7z5wrsd8b36w8:llm-workflow-diagnoser","sourceUrl":"https://clawhub.ai/graysilver/llm-workflow-diagnoser","homepage":"https://clawhub.ai/graysilver/skills/llm-workflow-diagnoser","primaryLinks":[{"label":"View on ClawHub","url":"https://clawhub.ai/graysilver/llm-workflow-diagnoser","kind":"source"},{"label":"Homepage","url":"https://clawhub.ai/graysilver/skills/llm-workflow-diagnoser","kind":"homepage"}],"safetyScore":84,"overallRank":62,"popularityScore":70,"trustScore":null,"claimedByName":null,"isOwner":false,"seoDescription":"Use this skill whenever a user wants to evaluate whether an existing offline / reusable workflow is worth converting into an LLM-driven workflow. Triggers on..."},"coverage":{"evidence":{"source":"public-profile","verified":false,"confidence":"medium","updatedAt":"2026-10-09T09:47:39.182Z","emptyReason":null},"protocols":[{"protocol":"OPENCLEW","label":"OpenClaw","status":"self-declared","notes":"Declared in the public agent profile."}],"capabilities":[],"verifiedCount":0,"selfDeclaredCount":1,"capabilityMatrix":{"rows":[{"key":"OPENCLEW","type":"protocol","support":"unknown","confidenceSource":"profile","notes":"Listed on profile"}],"flattenedTokens":"protocol:OPENCLEW|unknown|profile"}},"adoption":{"evidence":{"source":"CLAWHUB","verified":false,"confidence":"medium","updatedAt":"2026-10-09T09:47:39.182Z","emptyReason":null},"stars":null,"forks":null,"downloads":3096,"packageName":null,"latestVersion":"0.1.0","tractionLabel":"3.1K downloads"},"release":{"evidence":{"source":"CLAWHUB","verified":false,"confidence":"medium","updatedAt":"2026-10-09T09:47:39.182Z","emptyReason":null},"lastUpdatedAt":"2026-10-09T09:47:39.182Z","lastCrawledAt":"2026-10-09T09:47:39.182Z","lastIndexedAt":null,"nextCrawlAt":"2026-10-10T09:47:39.182Z","lastVerifiedAt":null,"highlights":[{"version":"0.1.0","createdAt":"2026-07-23T15:18:18.015Z","changelog":"llm-workflow-diagnoser v0.2.0 introduces an LLM-driven process to evaluate if existing offline/reusable workflows are suitable for LLM transformation. - Adds a step-by-step workflow: entry clarification, up to 6 rounds of 8-dimension questioning, LLM-based judgment with difficulty/ROI scoring, and structured report output. - Defines strict trigger/exclusion criteria to ensure correct activation only for reusable workflows seeking LLM transformation assessment. - Report output standardized into six fixed sections, including clear ROI score (0–10) and detailed difficulty ratings across five dimensions. - Integrates safeguard rules: prohibits skipping questions, using only rules-based scoring, or outputting reports to files. - Includes comprehensive guidance on boundary cases, mandatory question structure, and stepwise interaction flow.","fileCount":16,"zipByteSize":21060}]},"execution":{"evidence":{"source":"CLAWHUB","verified":false,"confidence":"low","updatedAt":null,"emptyReason":"No published capability contract is available yet."},"installCommand":"clawhub skill install s17c6q86pekf2pm4rzv7z5wrsd8b36w8:llm-workflow-diagnoser","setupComplexity":"low","setupSteps":["Setup complexity is LOW. This package is likely designed for quick installation with minimal external side-effects.","Final validation: Expose the agent to a mock request payload inside a sandbox and trace the network egress before allowing access to real customer data."],"contract":{"contractStatus":"missing","authModes":[],"requires":[],"forbidden":[],"supportsMcp":false,"supportsA2a":false,"supportsStreaming":false,"inputSchemaRef":null,"outputSchemaRef":null,"dataRegion":null,"contractUpdatedAt":null,"sourceUpdatedAt":null,"freshnessSeconds":null},"invocationGuide":{"preferredApi":{"snapshotUrl":"https://www.xpersona.co/api/v1/agents/clawhub-graysilver-llm-workflow-diagnoser/snapshot","contractUrl":"https://www.xpersona.co/api/v1/agents/clawhub-graysilver-llm-workflow-diagnoser/contract","trustUrl":"https://www.xpersona.co/api/v1/agents/clawhub-graysilver-llm-workflow-diagnoser/trust"},"curlExamples":["curl -s \"https://www.xpersona.co/api/v1/agents/clawhub-graysilver-llm-workflow-diagnoser/snapshot\"","curl -s \"https://www.xpersona.co/api/v1/agents/clawhub-graysilver-llm-workflow-diagnoser/contract\"","curl -s \"https://www.xpersona.co/api/v1/agents/clawhub-graysilver-llm-workflow-diagnoser/trust\""],"jsonRequestTemplate":{"query":"summarize this repo","constraints":{"maxLatencyMs":2000,"protocolPreference":["OPENCLEW"]}},"jsonResponseTemplate":{"ok":true,"result":{"summary":"...","confidence":0.9},"meta":{"source":"CLAWHUB","generatedAt":"2026-10-09T22:49:43.786Z"}},"retryPolicy":{"maxAttempts":3,"backoffMs":[500,1500,3500],"retryableConditions":["HTTP_429","HTTP_503","NETWORK_TIMEOUT"]}},"endpoints":{"dossierUrl":"https://www.xpersona.co/api/v1/agents/clawhub-graysilver-llm-workflow-diagnoser/dossier","snapshotUrl":"https://www.xpersona.co/api/v1/agents/clawhub-graysilver-llm-workflow-diagnoser/snapshot","contractUrl":"https://www.xpersona.co/api/v1/agents/clawhub-graysilver-llm-workflow-diagnoser/contract","trustUrl":"https://www.xpersona.co/api/v1/agents/clawhub-graysilver-llm-workflow-diagnoser/trust"}},"reliability":{"evidence":{"source":"runtime-metrics","verified":false,"confidence":"low","updatedAt":null,"emptyReason":"No trust, reliability, or runtime telemetry is available."},"trust":{"status":"unavailable","handshakeStatus":"UNKNOWN","verificationFreshnessHours":null,"reputationScore":null,"p95LatencyMs":null,"successRate30d":null,"fallbackRate":null,"attempts30d":null,"trustUpdatedAt":null,"trustConfidence":"unknown","sourceUpdatedAt":null,"freshnessSeconds":null},"decisionGuardrails":{"doNotUseIf":["Contract metadata is missing or unavailable for deterministic execution."],"safeUseWhen":[],"riskFlags":["missing_or_unavailable_contract","trust_data_unavailable","schema_references_missing"],"operationalConfidence":"low"},"executionMetrics":{"observedLatencyMsP50":null,"observedLatencyMsP95":null,"estimatedCostUsd":null,"uptime30d":null,"rateLimitRpm":null,"rateLimitBurst":null,"lastVerifiedAt":null,"verificationSource":null},"runtimeMetrics":{"successRate":null,"avgLatencyMs":null,"avgCostUsd":null,"hallucinationRate":null,"retryRate":null,"disputeRate":null,"p50Latency":null,"p95Latency":null,"lastUpdated":null}},"benchmarks":{"evidence":{"source":"no-benchmark-data","verified":false,"confidence":"low","updatedAt":null,"emptyReason":"No benchmark suites or observed failure patterns are available."},"suites":[],"failurePatterns":[]},"artifacts":{"evidence":{"source":"CLAWHUB","verified":false,"confidence":"high","updatedAt":"2026-10-09T09:47:39.182Z","emptyReason":null},"readme":"Skill: Llm Workflow Diagnoser\n\nOwner: graysilver\n\nSummary: Use this skill whenever a user wants to evaluate whether an existing offline / reusable workflow is worth converting into an LLM-driven workflow. Triggers on...\n\nTags: latest:0.1.0\n\nVersion history:\n\nv0.1.0 | 2026-07-23T15:18:18.015Z | auto\n\nllm-workflow-diagnoser v0.2.0 introduces an LLM-driven process to evaluate if existing offline/reusable workflows are suitable for LLM transformation.\n\n- Adds a step-by-step workflow: entry clarification, up to 6 rounds of 8-dimension questioning, LLM-based judgment with difficulty/ROI scoring, and structured report output.\n- Defines strict trigger/exclusion criteria to ensure correct activation only for reusable workflows seeking LLM transformation assessment.\n- Report output standardized into six fixed sections, including clear ROI score (0–10) and detailed difficulty ratings across five dimensions.\n- Integrates safeguard rules: prohibits skipping questions, using only rules-based scoring, or outputting reports to files.\n- Includes comprehensive guidance on boundary cases, mandatory question structure, and stepwise interaction flow.\n\nArchive index:\n\nArchive v0.1.0: 16 files, 21060 bytes\n\nFiles: evals (0b), evals/evals.json (4803b), README.md (2833b), references (0b), references/examples (0b), references/examples/full_replace.md (2912b), references/examples/not_suitable.md (2662b), references/examples/partial_replace.md (3026b), references/question_bank.md (2850b), references/report_template.md (3430b), references/scoring_rubric.md (2776b), scripts (0b), scripts/diagnose.py (1233b), skill-card.md (2449b), SKILL.md (8767b), _meta.json (141b)\n\nFile v0.1.0:SKILL.md\n\n---\nname: llm-workflow-diagnoser\ndescription: |\n  Use this skill whenever a user wants to evaluate whether an existing offline / reusable workflow is worth converting into an LLM-driven workflow. Triggers on phrases like\n  \"这个流程要不要交给大模型做\", \"我有个跑得很熟的脚本流程, 能不能用 LLM 改造\", \"我想把这套离线流程升级成 LLM 工作流\", \"判断一下现在流程合不合适交给大模型\",\n  \"LLM 改造 ROI 诊断\", \"评估一下大模型介入的成本收益\". Always trigger when the user describes a reusable workflow and wants a go / partial / no-go decision\n  plus ROI reasoning, even if they don't ask for the words \"diagnose\" or \"ROI\" explicitly. Do not trigger for one-off prompts that are not a reusable workflow,\n  and do not trigger for general writing / coding tasks.\nmetadata:\n  version: 0.2.0\n---\n\n# LLM Workflow Diagnoser\n\n把一个已有的「离线 / 可复用流程」拆开，看它是否值得交给 LLM，输出**全量改造 / 部分改造 / 不适合**的结论 + ROI 分数 + 改造难度评级 + 落地 MVP 路线图。\n\n整套流程由 LLM 主判，叠加一份 8 题追问清单做骨架；不允许用纯规则打分硬给结论。\n\n## 何时使用 / 何时不使用\n\n**触发**：\n\n- 用户说一个明确可复用流程（\"我每周跑一次的报告生成脚本\"、\"我们客服有一套固定 FAQ 回复流程\"、\"我每天把日志按模板整理成周报\"）。\n- 用户想判断它\"能不能 / 该不该 / 值不值得\"被 LLM 改造成工作流。\n- 用户描述里同时存在触发频率 + 输入来源 + 输出形式 + 错误成本。\n\n**不触发**：\n\n- 一次性 prompt（\"帮我写一封邮件\"），不是可复用流程。\n- 单纯的代码重构 / bug 修复 / 写文章（请走 `clean-code-skill` / `mubai-writer-v2` / `technical-report-writer`）。\n- 用户只是想做技术选型，没问\"LLM 改造\"。\n\n---\n\n## 主路径（4 步）\n\n### Step 0：入口澄清\n\n如果用户描述里没有提到「流程名 / 触发频率 / 输出形式」中的任意两项，先问一句：\n\n> 你这次想诊断的「离线流程」大致叫什么名字？多久跑一次？输出长什么样？\n\n不准默认脑补流程主题。不准直接进入追问。\n\n### Step 1：追问（最多 6 轮，每轮 3-4 题一批）\n\n按 `references/question_bank.md` 的 8 维度出第一组问题，每轮给 3-4 个题，用户可一次答完。\n\nLLM 在收到回答后可补问 0-3 题，针对信息缺口。\n\n**退出准则**（明确写进追问流程）：\n\n- 已收集到 ≥ 6 个有效回答。\n- 每个维度至少有一个具体答案（不能全是\"不知道 / 看情况\"）。\n- 没有明显冲突的假设（例如用户同时说\"完全不能错\"和\"全自动跑\"）。\n\n任意一项不满足 → 继续追问；满足 → 进入诊断。\n\n### Step 2：LLM 主判\n\nLLM 综合判断改造建议 + 5 维度难度评级：\n\n- **输入多样性**（难度 0-10）：输入多样性越高，难度越大。\n- **输出一致性要求**（难度 0-10）：一致性要求越严格，难度越大。\n- **容错率**（难度 0-10）：容错率越低（错误代价越高），难度越大。\n- **决策密度**（难度 0-10）：决策越复杂 / 主观，难度越大。\n- **可验证性**（难度 0-10）：越难量化验证，难度越大。\n\n按下列标准给最终建议：\n\n| 建议 | 触发条件 |\n|---|---|\n| 全量改造 | 5 维度难度均值 ≤ 4 + 没有命中任何「不适合」硬护栏 + ROI 分数 ≥ 7 |\n| 部分改造 | 命中 1-2 个硬护栏，或难度均值 5-7，或 ROI 分数 4-6 |\n| 不适合 | 命中 ≥ 3 个硬护栏，或 ROI 分数 ≤ 3，或难度均值 ≥ 8 |\n\n### Step 3：报告输出（必须按固定结构原文输出，**不写 .md**）\n\n按 `references/report_template.md` 的固定结构，把六个章节**原文贴在对话回复里**：\n\n1. 诊断说明（含 ROI 分数 xx/10）\n2. LLM 介入边界\n3. 改造难度评级（5 维度 xx/10 表格）\n4. 落地 MVP 路线图\n5. 风险清单\n6. 信息缺口 / 需补充追问（如有）\n\n**章节标题必须完全一致**。不要写 `.md` 文件、不要重命名、不要拼接、不要保存到磁盘。\n\n---\n\n## LLM 介入边界地图（写入报告）\n\n报告\"LLM 介入边界\"章节必须按四个分类组织：\n\n| 分类 | 含义 |\n|---|---|\n| **硬护栏护住** | 监管 / 合规 / 实时 / 高精度场景，LLM 不能介入；保留原人工或规则路径 |\n| **仅部分场景适用** | LLM 可生成候选 / 提供多版本，但必须人工裁决 |\n| **全量适用** | 决策 / 执行 / 润色都可交给 LLM，必要时保留少量校验 |\n| **AI 可护住** | LLM 能补充的具体能力（生成 / 翻译 / 命名 / 检索 / 推理 / 提炼 / 数据能力边界等） |\n\n---\n\n## ROI 分数（强制 xx/10）\n\nROI 分数填在\"诊断说明\"章节，**必须**是 0-10 整数或一位小数：\n\n- 9-10：极高（投入低、收益高、立即回收）\n- 7-8：高（投入低-中、收益中-高、月级回收）\n- 5-6：中（投入中、收益中、季级回收）\n- 3-4：低（投入高、收益低、年级回收）\n- 1-2：极低（投入高、收益微、不可回收）\n- 0：信息不足，无法判断\n\nROI 分数**只允许写在\"诊断说明 - ROI 分数\"那一行**，其他章节不要再写一遍 ROI。\n\n---\n\n## 难度评级（强制 xx/10）\n\n报告\"改造难度评级\"章节必须使用 Markdown 表格，列固定为：\n\n`维度 ｜ 难度值（xx/10，10为满分） ｜ 解释`\n\n5 个维度固定：\n\n| 维度 | 难度 0 | 难度 10 |\n|---|---|---|\n| 输入多样性 | 高度结构化 | 自由文本 / 多模态 |\n| 输出一致性要求 | 允许多版本 | 严格统一 |\n| 容错率 | 高容错 | 零容错 |\n| 决策密度 | 机械转换 | 多步推理 / 创造性 |\n| 可验证性 | 指标完整 | 难以量化 |\n\n---\n\n## 追问清单（references/question_bank.md 摘要）\n\n8 个必问维度：\n\n1. **执行方与频率**：谁在跑？多久一次？\n2. **输入来源**：来自哪里？是否结构化？多样性？\n3. **输出形式**：长什么样？可不可以表达成文字 / 结构化语言？是否依赖身体感知 / 物理动作 / 高精度控制？\n4. **关键瓶颈**：最耗时 / 最容易出错 / 最依赖经验的环节？\n5. **错误成本**：能否被人工兜底？出错会不会直接进生产路径？\n6. **约束**：是否需要私有数据 / 离线部署 / 合规约束？\n7. **改造目标**：期望提升的是质量 / 效率 / 人力 / 新场景能力？\n8. **可观察数据**：有没有日志 / 反馈 / 评分数据可以衡量改造前后？\n\n---\n\n## 多轮诊断历史\n\n每次诊断都在对话里原文输出；同主题多次诊断时，新诊断开头用一行\"相比上轮变化\"做对比，再进入六章节。\n\n---\n\n## 核心反模式\n\n- ❌ **跳过追问直接给结论** → ✅ 至少 6 个有效回答 + 每个维度有具体答案才下判断\n- ❌ **用纯规则打分直接给\"全量 / 部分 / 不适合\"** → ✅ LLM 主判，维度评分仅做解释\n- ❌ **把 ROI 算成精确数字或具体金额** → ✅ 仅给 xx/10 分数\n- ❌ **报告塞假案例 / 假数据** → ✅ 关键假设和未答问题显式列出\n- ❌ **推荐\"未来需要时再加 LLM\"这种偷懒话术** → ✅ 给出具体最小可验证动作\n- ❌ **不区分\"全量 / 部分 / 不适合\"硬护栏** → ✅ 命中 ≥ 3 个硬护栏必须落到\"不适合\"\n- ❌ **追问里一次只问一题** → ✅ 每轮 3-4 题一批，最多 6 轮\n- ❌ **报告输出到 .md 文件** → ✅ 原文贴在 Chat 里\n- ❌ **章节标题改名 / 拼接 / 增删** → ✅ 完全照抄 report_template 的固定结构\n- ❌ **ROI 写具体金额** → ✅ 仅 xx/10 分数\n- ❌ **难度评级只写\"中 / 高\"** → ✅ 必须 xx/10 数字\n\n---\n\n## 文件索引\n\n按需加载，不要预先全部读：\n\n| 文件 | 用途 | 何时读 |\n|---|---|---|\n| `references/question_bank.md` | 8 维度必问清单 + 退出准则 | 追问阶段必读 |\n| `references/scoring_rubric.md` | 5 维度难度评级描述 + 改造建议触发表 | 诊断阶段读 |\n| `references/report_template.md` | 报告六章节固定结构（原文 Chat 输出） | 出报告时必读 |\n| `references/examples/full_replace.md` | \"全量改造\"样例 | 写报告前对照风格 |\n| `references/examples/partial_replace.md` | \"部分改造\"样例 | 同上 |\n| `references/examples/not_suitable.md` | \"不适合\"样例 | 同上 |\n| `scripts/diagnose.py` | 打印追问清单 + 报告骨架（辅助） | 调试或人工查看时用 |\n\n---\n\n## 一句话总结\n\n> 入口澄清 → 8 维度追问最多 6 轮 → LLM 主判给建议 + 5 维度难度评级 + ROI 分数 → 按固定结构原文贴在 Chat 输出，不写 .md。\n\nFile v0.1.0:README.md\n\n# 我手头有套脚本，要不要交给 LLM？🤔\n\n每次刷到「不接入 AI 就被淘汰」「让大模型改造一切」就开始焦虑。\n\n但你手头那套流程跑了 N 个月，稳得一批，到底要不要冒险改造一次？\n\n我最近发现一个**免费的诊断小工具**，专门治这种纠结。\n\n\n它叫 **LLM工作流诊断工具**，专门用于诊断LLM能不能改造你工作流的Skill。\n\n![](https://obs-piccc.oss-cn-hangzhou.aliyuncs.com/20260723225056366.png)\n\n\n## 一句话讲清楚它是干啥的\n\n把你手上的「离线可复用流程」丢给它，它帮你做一次 **LLM 改造 ROI 体检**。\n\n最后给你一句话结论：**全量改造 / 部分改造 / 不适合**，再加 ROI 分数、5 个维度难度评级、一份落地 MVP 路线图。\n\n不是「AI 万能」的鸡汤，也不是「看情况」就完事的废话。\n\n## 怎么用，4 步走\n![](https://obs-piccc.oss-cn-hangzhou.aliyuncs.com/20260723225136982.png)\n\n不用下载不用注册，装上 Skill 直接用。\n\n**Step 0，入口澄清**\n\n问你：你这套流程叫啥、多久跑一次、输出长啥样。老实交代就行。\n\n**Step 1，8 维度追问，最多 6 轮**\n\n从执行方、输入、输出、瓶颈、容错、约束、目标、可观察数据，8 个角度连环问。每轮 3-4 题一批，你一次答完就行。\n\n**Step 2，LLM 主判**\n\n不靠纯规则打分，综合所有回答给：\n- ROI 分数（xx/10）\n- 改造建议（全量 / 部分 / 不适合）\n- 5 维度难度评分（输入多样性、输出一致性、容错率、决策密度、可验证性）\n\n**Step 3，原文输出报告**\n\n一份六章节诊断报告直接贴在对话里，不写 .md。你看完心里就有数了。\n\n## 我特别喜欢的几个细节\n\n**有硬护栏**，监管、合规、实时、高精度场景，它直接劝你别上 LLM。不会为了讨好你说\"都可以试试\"。\n\n**追问有退出准则**，6 个有效回答 + 每个维度有具体答案才下结论。不会你才说了两句它就拍脑袋给判断。\n\n**报告不写假数据**，关键假设和没问到的问题会显式列出来，让你知道哪里还藏着雷。\n\n![](https://obs-piccc.oss-cn-hangzhou.aliyuncs.com/20260723225244692.png)\n\n## 适合谁用\n\n✅ 每周/每天跑同一套脚本流程的工程师\n✅ 客服有固定 FAQ 回复流程的运营\n✅ 想把日志/数据整理成周报的数据同学\n✅ 任何手里有「可复用流程 + 想过要不要上 LLM」的人\n\n❌ 一次性 prompt（\"帮我写封邮件\"那种不算流程）\n❌ 单纯想重构代码或修 bug\n❌ 只是想做技术选型，没问\"LLM 改造\"\n\n---\n\n过去纠结「该不该上 LLM」这种事，要么靠老板拍脑袋，要么靠朋友支招，要么靠自己 YY。\n\n现在有个**免费 + 结构化**的诊断工具直接拿过来用，挺香。\n\nFile v0.1.0:_meta.json\n\n{\n  \"ownerId\": \"kn7d9j0s3r1dyyhk54hpgdpe358b27pz\",\n  \"slug\": \"llm-workflow-diagnoser\",\n  \"version\": \"0.1.0\",\n  \"publishedAt\": 1784819898015\n}\n\nFile v0.1.0:references/examples/full_replace.md\n\n# 全量改造示例：跨平台营销文案流水线\n\n> 用途：写报告前对照风格，不内嵌到主报告里。\n> 注意：示例展示的是\"报告原文贴在 Chat\"的效果，章节标题、表格格式必须完全一致。\n\n## 用户上下文\n\n- 流程名：跨平台营销文案生成。\n- 触发：每周一次，运营手动写 20 条推文 / 朋友圈 / 小红书。\n- 输入：本周产品更新要点 + 受众标签。\n- 输出：3 个平台各 1 套文案 + 配图建议。\n- 错误成本：低（人工可改，可回滚）。\n- 改造目标：把\"20 条文案从 4 小时压缩到 30 分钟\"。\n\n---\n\n## 报告原文示例（应直接复制此结构）\n\n```text\n# 诊断说明\n- 一句话说明：跨平台文案生成是高容错 + 多样化输出的典型 LLM 全量改造场景，可压到月级回收。\n- 改造步骤：\n  - 步骤 1：固化「产品要点 + 受众标签 → 三平台文案」的 prompt 模板\n  - 步骤 2：用最近 4 周历史素材做对照验证，统计一次通过率\n  - 步骤 3：灰度 50% 流量到 LLM 路径，老流程并行兜底\n  - 步骤 4：监控互动率后下线老流程\n- ROI 分数：8/10（10为满分）\n- 改造关键：\n  - 关键 1：受众多样化 + 文案允许多版本，LLM 能直接打主力\n  - 关键 2：互动率可量化衡量改造效果\n  - 关键 3：人工兜底成本可接受\n- 下一步建议：\n  - 建议 1：先跑 1 周端到端验证\n  - 建议 2：建立「一次通过率 / 互动率」两道监控\n  - 建议 3：法务相关文案保留人工复核\n\n# LLM 介入边界\n- 硬护栏护住：无\n- 仅部分场景适用：法务 / 行业合规相关文案，需人工复核\n- 全量适用：跨平台改写、文案初稿、配图建议、CTA 优化\n- AI 可护住：生成（多平台文案）、推理（CTA 排序）、设计（多版本对比）、检索（历史高互动素材）\n\n# 改造难度评级\n\n维度\t｜ 难度值（xx/10，10为满分）｜解释\n输入多样性\t｜ 3/10（10为满分）｜ 产品要点半结构化，受众标签可控\n输出一致性要求\t｜ 2/10（10为满分）｜ 多平台风格本身要求多样化\n容错率\t｜ 2/10（10为满分）｜ 文案可人工润色，可回滚\n决策密度\t｜ 4/10（10为满分）｜ 需判断\"哪个角度最能打\"\n可验证性\t｜ 3/10（10为满分）｜ 有 CTR / 互动率数据\n\n# 落地 MVP 路线图\n- MVP 步骤 1：拿最近 1 周产品更新，让 LLM 生成 3 平台 × 5 版文案，人工对比\n- MVP 步骤 2：运营在新流程上跑 2 周，老流程并行作对照\n- MVP 步骤 3：下线老流程，保留人工兜底通道与互动率监控\n\n# 风险清单\n- 风险 1：LLM 文案风格漂移 → 缓解：固化 prompt + 风格样例库\n- 风险 2：互动率不升反降 → 缓解：保留老流程做 4 周 A/B 对照\n- 风险 3：法务合规文案误用 → 缓解：合规相关字段强制人工审核\n```\n\nFile v0.1.0:references/examples/not_suitable.md\n\n# 不适合示例：高频交易信号生成\n\n> 用途：写报告前对照风格，不内嵌到主报告里。\n> 注意：示例展示的是\"报告原文贴在 Chat\"的效果，章节标题、表格格式必须完全一致。\n\n## 用户上下文\n\n- 流程名：高频交易信号生成。\n- 触发：每秒数百次。\n- 输入：实时行情（结构化数值流）。\n- 输出：买入 / 卖出 / 持仓信号。\n- 错误成本：极高（一次错信号可能造成重大资金损失）。\n- 改造目标：希望用 LLM \"更快\" 出信号。\n\n---\n\n## 报告原文示例（应直接复制此结构）\n\n```text\n# 诊断说明\n- 一句话说明：高频交易信号同时命中实时 + 高精度 + 高合规三个硬护栏，LLM 不能进生产路径。\n- 改造步骤：\n  - 步骤 1：保持原实时信号生成脚本不变\n  - 步骤 2：把 LLM 隔离在盘后复盘场景，不进生产路径\n  - 步骤 3：用 LLM 做异常信号归因与策略回顾\n- ROI 分数：1/10（10为满分）\n- 改造关键：\n  - 关键 1：实时性 + 零容错 + 高合规三大硬护栏同时命中\n  - 关键 2：LLM 推理延迟不可能压到毫秒级\n  - 关键 3：错信号直接进生产路径，无法批量回滚\n- 下一步建议：\n  - 建议 1：放弃「让 LLM 直接出信号」的想法\n  - 建议 2：把 LLM 用在盘后复盘 / 异常归因\n  - 建议 3：保留当前脚本与回放框架，不引入 LLM 链路\n\n# LLM 介入边界\n- 硬护栏护住：实时信号生成、毫秒级决策、生产路径写入\n- 仅部分场景适用：盘后复盘报告、异常信号归因\n- 全量适用：无\n- AI 可护住：检索（复盘历史）、推理（归因假设），但都不可直接进生产路径\n\n# 改造难度评级\n\n维度\t｜ 难度值（xx/10，10为满分）｜解释\n输入多样性\t｜ 2/10（10为满分）｜ 行情字段固定\n输出一致性要求\t｜ 9/10（10为满分）｜ 信号必须严格一致\n容错率\t｜ 10/10（10为满分）｜ 错信号直接进生产路径\n决策密度\t｜ 5/10（10为满分）｜ 信号生成有规则\n可验证性\t｜ 2/10（10为满分）｜ 有完整回测与回放框架\n\n# 落地 MVP 路线图\n- MVP 步骤 1：明确把 LLM 隔离在盘后复盘场景\n- MVP 步骤 2：用 LLM 做异常信号归因，输出归因假设给人工审核\n- MVP 步骤 3：不引入任何进生产路径的 LLM 链路\n\n# 风险清单\n- 风险 1：把 LLM 引入实时链路造成延迟 → 缓解：明确隔离边界\n- 风险 2：复盘归因被误用为生产信号 → 缓解：复盘输出必须经人工审核才可入决策\n- 风险 3：误判 ROI 偏高 → 缓解：以实时性 / 合规为否决项\n```\n\nFile v0.1.0:references/examples/partial_replace.md\n\n# 部分改造示例：合同条款抽取 + 风险标记\n\n> 用途：写报告前对照风格，不内嵌到主报告里。\n> 注意：示例展示的是\"报告原文贴在 Chat\"的效果，章节标题、表格格式必须完全一致。\n\n## 用户上下文\n\n- 流程名：合同条款抽取 + 风险标记。\n- 触发：每天 30-50 份合同。\n- 输入：合同 PDF / docx（半结构化长文本）。\n- 输出：抽取字段表（甲方 / 乙方 / 金额 / 履约期）+ 风险条款高亮。\n- 错误成本：中（错误的金额字段会被法务复核）。\n- 改造目标：把抽取字段的人工耗时砍掉，但风险条款判断保留人工。\n\n---\n\n## 报告原文示例（应直接复制此结构）\n\n```text\n# 诊断说明\n- 一句话说明：字段抽取适合 LLM 全自动，但风险条款判断属于高合规边界，必须保留人工。\n- 改造步骤：\n  - 步骤 1：固化 JSON schema + prompt，做字段抽取的 LLM 化\n  - 步骤 2：保留风险条款判断为人工环节，LLM 仅生成候选\n  - 步骤 3：建立「抽取准确率 / 复核一次通过率」两道监控\n- ROI 分数：6/10（10为满分）\n- 改造关键：\n  - 关键 1：字段抽取结构化强、可量化\n  - 关键 2：风险条款判断属合规边界，不能交给 LLM\n  - 关键 3：法务复核通道必须保留\n- 下一步建议：\n  - 建议 1：先抽 50 份历史合同做对照验证\n  - 建议 2：把风险条款判断明确从 LLM 流程中隔离\n  - 建议 3：上线前法务跑一轮 dry-run\n\n# LLM 介入边界\n- 硬护栏护住：风险条款最终判断（合规边界）\n- 仅部分场景适用：风险条款候选生成 + 多版本对比；法务裁决\n- 全量适用：字段抽取、字段标准化、命名规整\n- AI 可护住：检索（找相似条款）、生成（候选风险描述）、数据能力边界（限定 JSON schema）\n\n# 改造难度评级\n\n维度\t｜ 难度值（xx/10，10为满分）｜解释\n输入多样性\t｜ 5/10（10为满分）｜ 合同格式多样但字段稳定\n输出一致性要求\t｜ 7/10（10为满分）｜ 字段抽取必须严格统一\n容错率\t｜ 5/10（10为满分）｜ 字段抽取错会被法务复核\n决策密度\t｜ 4/10（10为满分）｜ 风险条款判断需要经验\n可验证性\t｜ 2/10（10为满分）｜ 有抽取字段表与人工复核率\n\n# 落地 MVP 路线图\n- MVP 步骤 1：固化 JSON schema + prompt，抽取字段表\n- MVP 步骤 2：风险条款判断环节保留人工，LLM 仅生成候选\n- MVP 步骤 3：上线后跑 4 周 A/B，统计抽取准确率与人工耗时\n\n# 风险清单\n- 风险 1：字段抽取错 → 缓解：固化 JSON schema + 校验脚本\n- 风险 2：风险条款误判 → 缓解：判断环节必须人工裁决\n- 风险 3：法务对 LLM 输出不信任 → 缓解：dry-run + 复核通道\n\n# 信息缺口 / 需补充追问\n- 缺口 1：未告知合同主要类型（采购 / 销售 / 服务），不同类型风险条款差异大\n- 缺口 2：未告知当前人工抽取耗时基线\n```\n\nFile v0.1.0:references/question_bank.md\n\n# 8 维度追问清单\n\n按这个清单出第一组问题。每轮 3-4 个题一批，最多 6 轮。LLM 收到回答后可视情况补 0-3 题。\n\n## 退出准则（必查）\n\n满足以下全部条件后才能进入诊断：\n\n1. 已收集到 ≥ 6 个有效回答。\n2. 每个维度至少有一个具体答案（不能全是\"不知道 / 看情况\"）。\n3. 没有明显冲突的假设（例如\"完全不能错\" + \"全自动跑\"）。\n\n任意一项不满足 → 继续追问；满足 → 进入诊断。\n\n---\n\n## 维度 1：执行方与频率\n\n- 这个流程现在由谁执行？人 / 脚本 / 外部服务 / 混合？\n- 触发频率？一次性 / 每天 / 每周 / 不定期？\n- 单次耗时大概多久？\n\n## 维度 2：输入来源\n\n- 输入主要来自哪里？数据库 / 文档 / 用户提交 / 第三方 API？\n- 输入是否结构化？多样性有多高？\n- 输入体量（单次多少条 / 多大）？\n\n## 维度 3：输出形式\n\n- 输出长什么样？文档 / 数据 / 代码 / 文案 / 决策？\n- 输出能不能被表达成文字 / 结构化语言？\n- 输出是否依赖身体感知 / 物理动作 / 高精度控制？（= 强信号：不合适）\n- 对输出一致性的要求有多高？必须严格统一还是允许多样？\n\n## 维度 4：关键瓶颈\n\n- 流程里最耗时 / 最容易出错 / 最依赖经验的环节是哪些？\n- 是否有明显的\"决策树 / 主观判断\"步骤？\n- 现有规则或脚本的瓶颈在哪一步？\n\n## 维度 5：错误成本\n\n- 错误成本有多高？出错能不能被人工兜底？\n- 是否允许部分错误被人工复核后修正？\n- 出错会不会直接进生产路径？（= 强信号：需要更严格护栏）\n\n## 维度 6：约束\n\n- 是否需要私有数据 / 离线部署 / 合规约束？\n- 是否有监管 / 行业准入要求？\n- 是否需要实时响应？\n\n## 维度 7：改造目标\n\n- 期望提升的是质量 / 效率 / 人力 / 新场景能力？\n- 现有流程的最大痛点是什么？\n- 改造成功对你意味着什么？\n\n## 维度 8：可观察数据\n\n- 当前是否有日志 / 反馈 / 评分 / 业务指标可以衡量改造前后？\n- 是否有历史输入样本可以脱敏后做仿真？\n- 是否能定义 1-2 个定性指标判断\"改造是否成功\"？\n\n---\n\n## LLM 现场补问方向（最多 3 题）\n\n- 流程里是否有\"决策树 / 专业判断 / 边界判断\"步骤？\n- 现有规则 / 脚本的瓶颈在哪一步？为什么没自动化？\n- 改造后是否接受引入少量错误？哪些环节必须零错误？\n- 是否已有 prompt / LLM 调用经验？还是完全新接触？\n\n---\n\n## 追问风格\n\n- 用用户的语言问，不要预设术语。\n- 一次给 3-4 题，每题简短。\n- 不要解释为什么问；用户能自己看懂。\n- 用户答完后，给一句\"已记录 X / Y / Z，还差 X / Y\"，再决定是否继续。\n\nFile v0.1.0:references/report_template.md\n\n# 报告输出格式（强制结构）\n\n诊断报告**不输出 .md 文件**，直接以**纯文本 / Chat 输出**形式贴在最终回复里。\n\n必须按下面六个章节顺序输出，**章节标题完全一致**，不要增删、不要重命名、不要拼接。\n\n---\n\n## 报告骨架（照抄即可）\n\n```text\n# 诊断说明\n- 一句话说明：\n- 改造步骤：\n- ROI分数： xx/10（10为满分）\n- 改造关键：\n- 下一步建议：\n\n# LLM介入边界\n\n\n# 改造难度评级\n\n维度\t｜ 难度值（xx/10，10为满分）｜解释\n\n\n\n# 落地MVP路线图\n\n\n\n# 风险清单\n\n```\n\n---\n\n## 各章节填充规范\n\n### 1. 诊断说明（必须每行都填）\n\n- **一句话说明**：用 1 句话说清\"应该全量 / 部分 / 不适合\"的核心判断与核心理由，≤ 50 字。\n- **改造步骤**：用「步骤 1 / 步骤 2 / ...」列出 2-4 步，按推进顺序，不超过 4 步。\n- **ROI 分数**：xx/10，10 为满分；定性量级映射建议：\n  - 9-10：极高\n  - 7-8：高\n  - 5-6：中\n  - 3-4：低\n  - 1-2：极低 / 信息不足\n- **改造关键**：列出 1-3 条\"决定改造是否成立的关键点\"，每条独立一行。\n- **下一步建议**：列出 2-3 条用户马上可以做的最小动作，每条独立一行。\n\n### 2. LLM 介入边界\n\n按四个分类组织，每个分类至少 1 条（没命中也要写\"无\"）：\n\n- 硬护栏护住：监管 / 合规 / 实时 / 高精度场景，LLM 不能介入。\n- 仅部分场景适用：LLM 生成候选 / 多版本，人工裁决。\n- 全量适用：决策 / 执行 / 润色都可交给 LLM。\n- AI 可护住：LLM 能补充的具体能力（生成 / 推理 / 检索 / 设计 / 数据能力边界 / 翻译 / 命名 / 提炼 等）。\n\n### 3. 改造难度评级（必须使用 Markdown 表格）\n\n列固定为「维度 ｜ 难度值（xx/10，10为满分） ｜ 解释」。\n\n维度固定 5 项：输入多样性、输出一致性要求、容错率、决策密度、可验证性。\n\n- 难度值 0 = 完全无难度（高度结构化 + 高容错 + 高一致性 + 高可验证）\n- 难度值 10 = 改造极难（高多样性 + 强一致性 + 零容错 + 高决策密度 + 难验证）\n- 解释：1 句话说明打分依据。\n\n### 4. 落地 MVP 路线图\n\n按时间顺序列 3-5 个最小动作，每条独立一行：\n\n- MVP 步骤 1：...\n- MVP 步骤 2：...\n- ...\n\n只写最小可验证路径，不写\"未来需要时再加 LLM\"。\n\n### 5. 风险清单\n\n列出 2-5 条具体风险，每条独立一行：\n\n- 风险 1 + 缓解方案\n- 风险 2 + 缓解方案\n\n禁止\"未来还有很多工作要做\"这类空话。\n\n### 6. 信息缺口 / 需补充追问（如有）\n\n如果信息不足导致建议存在显著不确定，必须额外加这个小节：\n\n```\n# 信息缺口 / 需补充追问\n\n- 缺口 1：...\n- 缺口 2：...\n```\n\n---\n\n## 输出语言\n\n- 中文正文 + 英文术语保留（如 ROI / MVP / LLM / CTR）。\n- 不要输出 `.md` 文件；直接把上面 6 个章节贴在对话回复里。\n\n---\n\n## 核心反模式\n\n- ❌ 输出到 .md 文件 → ✅ 原文贴在 Chat 里\n- ❌ 章节顺序 / 标题改动 → ✅ 完全照抄章节结构\n- ❌ 改造步骤写\"未来再决定\" → ✅ 2-4 步可执行动作\n- ❌ 难度评级不填具体分数或只写\"中\" → ✅ 必须 xx/10\n- ❌ ROI 写具体金额 → ✅ xx/10 分数 + 定性量级\n- ❌ 风险写\"还有很多工作要做\" → ✅ 具体风险 + 缓解方案\n\nFile v0.1.0:references/scoring_rubric.md\n\n# 5 维度难度评级 + 改造建议触发表\n\n## 5 维度难度评级（xx/10，仅做解释，不做硬阈值）\n\n每个维度给 0-10 的\"难度值\"，让用户看懂 LLM 的判断逻辑，不要硬卡阈值。\n\n### 输入多样性\n\n- 难度 0-3：输入高度结构化（数据库表、字段固定、模板填空）。\n- 难度 4-6：输入半结构化（部分字段固定 + 部分自由文本）。\n- 难度 7-10：输入是自由文本 / 多模态 / 来源多样。\n\n### 输出一致性要求\n\n- 难度 0-3：允许多版本 / 多风格输出。\n- 难度 4-6：允许部分字段变化，主结构稳定。\n- 难度 7-10：必须严格统一（如合同条款、合规文本、像素级输出）。\n\n### 容错率\n\n- 难度 0-3：错误可以批量回滚 / 重新生成。\n- 难度 4-6：错误可被人工复核 / 兜底，但成本高。\n- 难度 7-10：错误直接进生产路径或高价值资产（财务报表、医疗诊断）。\n\n### 决策密度\n\n- 难度 0-3：流程主要做机械转换（提取、搬运、格式化）。\n- 难度 4-6：需要少量主观判断（分类、命名、摘要）。\n- 难度 7-10：需要多步推理 / 多条件权衡 / 创造性方案。\n\n### 可验证性\n\n- 难度 0-3：指标体系完整、可对比、可追溯。\n- 难度 4-6：有少量指标但口径不统一。\n- 难度 7-10：没有可量化指标。\n\n---\n\n## 改造建议触发表\n\n按以下规则决定最终建议：\n\n| 建议 | 触发条件 |\n|---|---|\n| **全量改造** | 5 维度难度均值 ≤ 4 + 没有命中任何「不适合」硬护栏 + ROI 分数 ≥ 7 |\n| **部分改造** | 命中 1-2 个硬护栏，或难度均值 5-7，或 ROI 分数 4-6 |\n| **不适合** | 命中 ≥ 3 个硬护栏，或 ROI 分数 ≤ 3，或难度均值 ≥ 8 |\n\n### 「不适合」硬护栏\n\n任意一项命中即计入硬护栏计数：\n\n- 监管 / 合规要求严格（医疗诊断、财务报表、司法结论）。\n- 实时性硬要求（毫秒级决策、高频交易、运动控制）。\n- 高精度 / 严格一致性（像素级比对、精确数值计算、零容错生产路径）。\n\n### 「可改造」强信号\n\n任意一项命中即增强改造信心：\n\n- 输入高度结构化 / 输出允许多样。\n- 决策步骤多 / 现有规则瓶颈明显。\n- 有可量化指标衡量改造前后。\n- 错误可被人工兜底或批量回滚。\n\n---\n\n## ROI 分数（xx/10）映射\n\n| 分数 | 定性 | 含义 |\n|---|---|---|\n| 9-10 | 极高 | 投入低、收益高、立即回收 |\n| 7-8 | 高 | 投入低-中、收益中-高、月级回收 |\n| 5-6 | 中 | 投入中、收益中、季级回收 |\n| 3-4 | 低 | 投入高、收益低、年级回收 |\n| 1-2 | 极低 | 投入高、收益微、不可回收 |\n| 0 | 信息不足 | 关键信息缺失，无法判断 |\n\nFile v0.1.0:skill-card.md\n\n## Description:\n\nEvaluates whether a reusable offline workflow is worth converting into an LLM-driven workflow and returns a full, partial, or no-go recommendation with ROI, difficulty ratings, risks, and an MVP roadmap.\n\nThis skill is ready for commercial/non-commercial use.\n\n## Publisher:\n\n[graysilver](https://clawhub.ai/user/graysilver)\n\n### License/Terms of Use:\n\nMIT-0\n\n## Use Case:\n\nDevelopers, operations teams, and workflow owners use this skill to assess repeatable offline processes before investing in an LLM-based transformation. It guides the conversation through structured clarification and produces an inline diagnostic report.\n\n### Deployment Geography for Use:\n\nGlobal\n\n## Known Risks and Mitigations:\n\nRisk: The workflow may answer in Chinese by default, which can be unsuitable for users expecting another language.\n\nMitigation: Set the desired response language explicitly before using the diagnostic flow.\n\nRisk: The artifact does not explicitly declare tool permissions.\n\nMitigation: Review the skill before deployment and keep execution limited to the conversational diagnostic behavior described in the artifacts.\n\nRisk: A diagnosis based on sparse or conflicting workflow details can produce misleading ROI or suitability guidance.\n\nMitigation: Follow the required clarification and questioning steps before accepting a recommendation.\n\n## Reference(s):\n\n- [Server-resolved GitHub provenance](https://github.com/GraySilver/llm-workflow-diagnoser)\n- [ClawHub skill page](https://clawhub.ai/graysilver/skills/llm-workflow-diagnoser)\n- [Question bank](references/question_bank.md)\n- [Scoring rubric](references/scoring_rubric.md)\n- [Report template](references/report_template.md)\n\n## Skill Output:\n\n**Output Type(s):** [text, markdown, guidance]\n\n**Output Format:** [Inline Markdown diagnostic report]\n\n**Output Parameters:** [1D]\n\n**Other Properties Related to Output:** [The report uses fixed sections for diagnosis, LLM boundaries, difficulty ratings, MVP roadmap, risks, and information gaps; it is returned in chat rather than written to a Markdown file.]\n\n## Skill Version(s):\n\n0.1.0 (source: server release metadata; artifact metadata states 0.2.0)\n\n## Ethical Considerations:\n\nUsers should evaluate whether this skill is appropriate for their environment, review any generated or modified files before relying on them, and apply their organization's safety, security, and compliance requirements before deployment.\n\nFile v0.1.0:evals/evals.json\n\n{\n  \"skill_name\": \"llm-workflow-diagnoser\",\n  \"evals\": [\n    {\n      \"id\": 1,\n      \"prompt\": \"我想把我每周跑一次的「跨平台营销文案生成」流程交给大模型做：运营根据本周产品更新要点 + 受众标签，手动写 20 条推文 / 朋友圈 / 小红书，单次耗时 4 小时；错误成本低，文案可人工润色；希望把耗时砍到 30 分钟。\",\n      \"expected_output\": \"skill 走 4 步主路径。追问阶段一次性问 3-4 题一批，至少 6 个有效回答。最终报告按六个固定章节（诊断说明 / LLM介入边界 / 改造难度评级 / 落地MVP路线图 / 风险清单）原文贴在 Chat 里，不输出 .md；ROI 分数填 xx/10；改造难度评级用 Markdown 表格，五维度均给 xx/10。\",\n      \"files\": [],\n      \"assertions\": [\n        {\n          \"name\": \"ask multiple questions per round\",\n          \"text\": \"追问阶段一次问 3-4 题，不是一题一题地问\"\n        },\n        {\n          \"name\": \"collect enough answers before diagnosing\",\n          \"text\": \"在给出最终建议前，skill 至少收集到 6 个有效回答\"\n        },\n        {\n          \"name\": \"recommend full replacement\",\n          \"text\": \"最终建议是「全量改造」\"\n        },\n        {\n          \"name\": \"report inline not md file\",\n          \"text\": \"报告原文贴在 Chat 回复里，不输出 .md 文件\"\n        },\n        {\n          \"name\": \"exact section headings\",\n          \"text\": \"报告使用六个固定章节标题：诊断说明 / LLM介入边界 / 改造难度评级 / 落地MVP路线图 / 风险清单，标题必须完全一致\"\n        },\n        {\n          \"name\": \"ROI score uses xx/10 format\",\n          \"text\": \"诊断说明章节包含「ROI分数：xx/10（10为满分）」\"\n        },\n        {\n          \"name\": \"5-dimension difficulty table\",\n          \"text\": \"改造难度评级章节使用 Markdown 表格，列固定为「维度 ｜ 难度值（xx/10，10为满分） ｜ 解释」\"\n        },\n        {\n          \"name\": \"LLM boundary map exists\",\n          \"text\": \"LLM 介入边界章节按四分类组织：硬护栏护住 / 仅部分场景适用 / 全量适用 / AI 可护住\"\n        },\n        {\n          \"name\": \"MVP roadmap concrete steps\",\n          \"text\": \"落地 MVP 路线图列 3-5 个具体动作，每条独立一行\"\n        }\n      ]\n    },\n    {\n      \"id\": 2,\n      \"prompt\": \"我想把我这套离线流程升级成 LLM 工作流。\",\n      \"expected_output\": \"skill 必须先做入口澄清，问用户流程名 / 触发频率 / 输出形式，再进入追问；如果用户继续含糊，则继续追问直到每个维度都有具体答案。不准直接给结论。\",\n      \"files\": [],\n      \"assertions\": [\n        {\n          \"name\": \"must do entry clarification first\",\n          \"text\": \"skill 第一步先问「流程名 / 触发频率 / 输出形式」，不准默认脑补\"\n        },\n        {\n          \"name\": \"max 6 rounds of questioning\",\n          \"text\": \"追问最多 6 轮；进入诊断前检查退出准则\"\n        },\n        {\n          \"name\": \"no premature verdict\",\n          \"text\": \"在信息不足时，skill 不直接给出「全量 / 部分 / 不适合」结论\"\n        }\n      ]\n    },\n    {\n      \"id\": 3,\n      \"prompt\": \"我有一套高频交易信号生成的脚本：每秒数百次行情输入，输出买入 / 卖出 / 持仓信号，要求毫秒级响应，错信号直接进生产路径。我想用 LLM 改造。\",\n      \"expected_output\": \"skill 必须识别出 3 个硬护栏（实时 / 高精度 / 高合规），最终建议是「不适合」。报告必须显式列出硬护栏、ROI 分数 ≤ 3，并给出「仅在盘后复盘场景可让 LLM 介入」的边界建议。\",\n      \"files\": [],\n      \"assertions\": [\n        {\n          \"name\": \"must identify hard guardrails\",\n          \"text\": \"报告显式列出命中硬护栏：实时 / 高精度 / 高合规\"\n        },\n        {\n          \"name\": \"final recommendation is not_suitable\",\n          \"text\": \"最终建议是「不适合」\"\n        },\n        {\n          \"name\": \"ROI score <= 3\",\n          \"text\": \"ROI 分数 ≤ 3/10\"\n        },\n        {\n          \"name\": \"explicit LLM capability boundary map\",\n          \"text\": \"LLM 介入边界章节按四分类组织\"\n        },\n        {\n          \"name\": \"no false promise of LLM upgrade\",\n          \"text\": \"报告不准暗示「加 LLM 就能提速」「未来需要时再加 LLM」\"\n        },\n        {\n          \"name\": \"report inline not md file\",\n          \"text\": \"报告原文贴在 Chat 回复里，不输出 .md 文件\"\n        },\n        {\n          \"name\": \"exact section headings\",\n          \"text\": \"报告使用六个固定章节标题，标题完全一致\"\n        }\n      ]\n    }\n  ]\n}","readmeExcerpt":"Skill: Llm Workflow Diagnoser Owner: graysilver Summary: Use this skill whenever a user wants to evaluate whether an existing offline / reusable workflow is worth converting into an LLM-driven workflow. Triggers on... Tags: latest:0.1.0 Version history: v0.1.0 | 2026-07-23T15:18:18.015Z | auto llm-workflow-diagnoser v0.2.0 introduces an LLM-driven process to evaluate if existing offline/reusable workflows are suitabl","codeSnippets":[],"executableExamples":[{"language":"text","snippet":"# 诊断说明\n- 一句话说明：跨平台文案生成是高容错 + 多样化输出的典型 LLM 全量改造场景，可压到月级回收。\n- 改造步骤：\n  - 步骤 1：固化「产品要点 + 受众标签 → 三平台文案」的 prompt 模板\n  - 步骤 2：用最近 4 周历史素材做对照验证，统计一次通过率\n  - 步骤 3：灰度 50% 流量到 LLM 路径，老流程并行兜底\n  - 步骤 4：监控互动率后下线老流程\n- ROI 分数：8/10（10为满分）\n- 改造关键：\n  - 关键 1：受众多样化 + 文案允许多版本，LLM 能直接打主力\n  - 关键 2：互动率可量化衡量改造效果\n  - 关键 3：人工兜底成本可接受\n- 下一步建议：\n  - 建议 1：先跑 1 周端到端验证\n  - 建议 2：建立「一次通过率 / 互动率」两道监控\n  - 建议 3：法务相关文案保留人工复核\n\n# LLM 介入边界\n- 硬护栏护住：无\n- 仅部分场景适用：法务 / 行业合规相关文案，需人工复核\n- 全量适用：跨平台改写、文案初稿、配图建议、CTA 优化\n- AI 可护住：生成（多平台文案）、推理（CTA 排序）、设计（多版本对比）、检索（历史高互动素材）\n\n# 改造难度评级\n\n维度\t｜ 难度值（xx/10，10为满分）｜解释\n输入多样性\t｜ 3/10（10为满分）｜ 产品要点半结构化，受众标签可控\n输出一致性要求\t｜ 2/10（10为满分）｜ 多平台风格本身要求多样化\n容错率\t｜ 2/10（10为满分）｜ 文案可人工润色，可回滚\n决策密度\t｜ 4/10（10为满分）｜ 需判断\"哪个角度最能打\"\n可验证性\t｜ 3/10（10为满分）｜ 有 CTR / 互动率数据\n\n# 落地 MVP 路线图\n- MVP 步骤 1：拿最近 1 周产品更新，让 LLM 生成 3 平台 × 5 版文案，人工对比\n- MVP 步骤 2：运营在新流程上跑 2 周，老流程并行作对照\n- MVP 步骤 3：下线老流程，保留人工兜底通道与互动率监控\n\n# 风险清单\n- 风险 1：LLM 文案风格漂移 → 缓解：固化 prompt + 风格样例库\n- 风险 2：互动率不升反降 → 缓解：保留老流程做 4 周 A/B 对照\n- 风险 3：法务合规文案误用 → 缓解：合规相关字段强制人工审核"},{"language":"text","snippet":"# 诊断说明\n- 一句话说明：高频交易信号同时命中实时 + 高精度 + 高合规三个硬护栏，LLM 不能进生产路径。\n- 改造步骤：\n  - 步骤 1：保持原实时信号生成脚本不变\n  - 步骤 2：把 LLM 隔离在盘后复盘场景，不进生产路径\n  - 步骤 3：用 LLM 做异常信号归因与策略回顾\n- ROI 分数：1/10（10为满分）\n- 改造关键：\n  - 关键 1：实时性 + 零容错 + 高合规三大硬护栏同时命中\n  - 关键 2：LLM 推理延迟不可能压到毫秒级\n  - 关键 3：错信号直接进生产路径，无法批量回滚\n- 下一步建议：\n  - 建议 1：放弃「让 LLM 直接出信号」的想法\n  - 建议 2：把 LLM 用在盘后复盘 / 异常归因\n  - 建议 3：保留当前脚本与回放框架，不引入 LLM 链路\n\n# LLM 介入边界\n- 硬护栏护住：实时信号生成、毫秒级决策、生产路径写入\n- 仅部分场景适用：盘后复盘报告、异常信号归因\n- 全量适用：无\n- AI 可护住：检索（复盘历史）、推理（归因假设），但都不可直接进生产路径\n\n# 改造难度评级\n\n维度\t｜ 难度值（xx/10，10为满分）｜解释\n输入多样性\t｜ 2/10（10为满分）｜ 行情字段固定\n输出一致性要求\t｜ 9/10（10为满分）｜ 信号必须严格一致\n容错率\t｜ 10/10（10为满分）｜ 错信号直接进生产路径\n决策密度\t｜ 5/10（10为满分）｜ 信号生成有规则\n可验证性\t｜ 2/10（10为满分）｜ 有完整回测与回放框架\n\n# 落地 MVP 路线图\n- MVP 步骤 1：明确把 LLM 隔离在盘后复盘场景\n- MVP 步骤 2：用 LLM 做异常信号归因，输出归因假设给人工审核\n- MVP 步骤 3：不引入任何进生产路径的 LLM 链路\n\n# 风险清单\n- 风险 1：把 LLM 引入实时链路造成延迟 → 缓解：明确隔离边界\n- 风险 2：复盘归因被误用为生产信号 → 缓解：复盘输出必须经人工审核才可入决策\n- 风险 3：误判 ROI 偏高 → 缓解：以实时性 / 合规为否决项"},{"language":"text","snippet":"# 诊断说明\n- 一句话说明：字段抽取适合 LLM 全自动，但风险条款判断属于高合规边界，必须保留人工。\n- 改造步骤：\n  - 步骤 1：固化 JSON schema + prompt，做字段抽取的 LLM 化\n  - 步骤 2：保留风险条款判断为人工环节，LLM 仅生成候选\n  - 步骤 3：建立「抽取准确率 / 复核一次通过率」两道监控\n- ROI 分数：6/10（10为满分）\n- 改造关键：\n  - 关键 1：字段抽取结构化强、可量化\n  - 关键 2：风险条款判断属合规边界，不能交给 LLM\n  - 关键 3：法务复核通道必须保留\n- 下一步建议：\n  - 建议 1：先抽 50 份历史合同做对照验证\n  - 建议 2：把风险条款判断明确从 LLM 流程中隔离\n  - 建议 3：上线前法务跑一轮 dry-run\n\n# LLM 介入边界\n- 硬护栏护住：风险条款最终判断（合规边界）\n- 仅部分场景适用：风险条款候选生成 + 多版本对比；法务裁决\n- 全量适用：字段抽取、字段标准化、命名规整\n- AI 可护住：检索（找相似条款）、生成（候选风险描述）、数据能力边界（限定 JSON schema）\n\n# 改造难度评级\n\n维度\t｜ 难度值（xx/10，10为满分）｜解释\n输入多样性\t｜ 5/10（10为满分）｜ 合同格式多样但字段稳定\n输出一致性要求\t｜ 7/10（10为满分）｜ 字段抽取必须严格统一\n容错率\t｜ 5/10（10为满分）｜ 字段抽取错会被法务复核\n决策密度\t｜ 4/10（10为满分）｜ 风险条款判断需要经验\n可验证性\t｜ 2/10（10为满分）｜ 有抽取字段表与人工复核率\n\n# 落地 MVP 路线图\n- MVP 步骤 1：固化 JSON schema + prompt，抽取字段表\n- MVP 步骤 2：风险条款判断环节保留人工，LLM 仅生成候选\n- MVP 步骤 3：上线后跑 4 周 A/B，统计抽取准确率与人工耗时\n\n# 风险清单\n- 风险 1：字段抽取错 → 缓解：固化 JSON schema + 校验脚本\n- 风险 2：风险条款误判 → 缓解：判断环节必须人工裁决\n- 风险 3：法务对 LLM 输出不信任 → 缓解：dry-run + 复核通道\n\n# 信息缺口 / 需补充追问\n- 缺口 1：未告知合同主要类型（采购 / 销售 / 服务），不同类型风险条款差异大\n- 缺口 2：未告知当前人工抽取耗时基线"},{"language":"text","snippet":"# 诊断说明\n- 一句话说明：\n- 改造步骤：\n- ROI分数： xx/10（10为满分）\n- 改造关键：\n- 下一步建议：\n\n# LLM介入边界\n\n\n# 改造难度评级\n\n维度\t｜ 难度值（xx/10，10为满分）｜解释\n\n\n\n# 落地MVP路线图\n\n\n\n# 风险清单"},{"language":"text","snippet":"# 信息缺口 / 需补充追问\n\n- 缺口 1：...\n- 缺口 2：..."}],"parameters":null,"dependencies":[],"permissions":[],"extractedFiles":[{"path":"SKILL.md","content":"---\nname: llm-workflow-diagnoser\ndescription: |\n  Use this skill whenever a user wants to evaluate whether an existing offline / reusable workflow is worth converting into an LLM-driven workflow. Triggers on phrases like\n  \"这个流程要不要交给大模型做\", \"我有个跑得很熟的脚本流程, 能不能用 LLM 改造\", \"我想把这套离线流程升级成 LLM 工作流\", \"判断一下现在流程合不合适交给大模型\",\n  \"LLM 改造 ROI 诊断\", \"评估一下大模型介入的成本收益\". Always trigger when the user describes a reusable workflow and wants a go / partial / no-go decision\n  plus ROI reasoning, even if they don't ask for the words \"diagnose\" or \"ROI\" explicitly. Do not trigger for one-off prompts that are not a reusable workflow,\n  and do not trigger for general writing / coding tasks.\nmetadata:\n  version: 0.2.0\n---\n\n# LLM Workflow Diagnoser\n\n把一个已有的「离线 / 可复用流程」拆开，看它是否值得交给 LLM，输出**全量改造 / 部分改造 / 不适合**的结论 + ROI 分数 + 改造难度评级 + 落地 MVP 路线图。\n\n整套流程由 LLM 主判，叠加一份 8 题追问清单做骨架；不允许用纯规则打分硬给结论。\n\n## 何时使用 / 何时不使用\n\n**触发**：\n\n- 用户说一个明确可复用流程（\"我每周跑一次的报告生成脚本\"、\"我们客服有一套固定 FAQ 回复流程\"、\"我每天把日志按模板整理成周报\"）。\n- 用户想判断它\"能不能 / 该不该 / 值不值得\"被 LLM 改造成工作流。\n- 用户描述里同时存在触发频率 + 输入来源 + 输出形式 + 错误成本。\n\n**不触发**：\n\n- 一次性 prompt（\"帮我写一封邮件\"），不是可复用流程。\n- 单纯的代码重构 / bug 修复 / 写文章（请走 `clean-code-skill` / `mubai-writer-v2` / `technical-report-writer`）。\n- 用户只是想做技术选型，没问\"LLM 改造\"。\n\n---\n\n## 主路径（4 步）\n\n### Step 0：入口澄清\n\n如果用户描述里没有提到「流程名 / 触发频率 / 输出形式」中的任意两项，先问一句：\n\n> 你这次想诊断的「离线流程」大致叫什么名字？多久跑一次？输出长什么样？\n\n不准默认脑补流程主题。不准直接进入追问。\n\n### Step 1：追问（最多 6 轮，每轮 3-4 题一批）\n\n按 `references/question_bank.md` 的 8 维度出第一组问题，每轮给 3-4 个题，用户可一次答完。\n\nLLM 在收到回答后可补问 0-3 题，针对信息缺口。\n\n**退出准则**（明确写进追问流程）：\n\n- 已收集到 ≥ 6 个有效回答。\n- 每个维度至少有一个具体答案（不能全是\"不知道 / 看情况\"）。\n- 没有明显冲突的假设（例如用户同时说\"完全不能错\"和\"全自动跑\"）。\n\n任意一项不满足 → 继续追问；满足 → 进入诊断。\n\n### Step 2：LLM 主判\n\nLLM 综合判断改造建议 + 5 维度难度评级：\n\n- **输入多样性**（难度 0-10）：输入多样性越高，难度越大。\n- **输出一致性要求**（难度 0-10）：一致性要求越严格，难度越大。\n- **容错率**（难度 0-10）：容错率越低（错误代价越高），难度越大。\n- **决策密度**（难度 0-10）：决策越复杂 / 主观，难度越大。\n- **可验证性**（难度 0-10）：越难量化验证，难度越大。\n\n按下列标准给最终建议：\n\n| 建议 | 触发条件 |\n|---|---|\n| 全量改造 | 5 维度难度均值 ≤ 4 + 没有命中任何「不适合」硬护栏 + ROI 分数 ≥ 7 |\n| 部分改造 | 命中 1-2 个硬护栏，或难度均值 5-7，或 ROI 分数 4-6 |\n| 不适合 | 命中 ≥ 3 个硬护栏，或 ROI 分数 ≤ 3，或难度均值 ≥ 8 |\n\n### Step 3：报告输出（必须按固定结构原文输出，**不写 .md**）\n\n按 `references/report_template.md` 的固定结构，把六个章节**原文贴在对话回复里**：\n\n1. 诊断说明（含 ROI 分数 xx/10）\n2. LLM 介入边界\n3. 改造难度评级（5 维度 xx/10 表格）\n4. 落地 MVP 路线图\n5. 风险清单\n6. 信息缺口 / 需补充追问（如有）\n\n**章节标题必须完全一致**。不要写 `.md` 文件、不要重命名、不要拼接、不要保存到磁盘。\n\n---\n\n## LLM 介入边界地图（写入报告）\n\n报告\"LLM 介入边界\"章节必须按四个分类组织：\n\n| 分类 | 含义 |\n|---|---|\n| **硬护栏护住** | 监管 / 合规 / 实时 / 高精度场景，LLM 不能介入；保留原人工或规则路径 |\n| **仅部分场景适用** | LLM 可生成候选 / 提供多版本，但必须人工裁决 |\n| **全量适用** | 决策 / 执行 / 润色都可交给 LLM，必要时保留少量校验 |\n| **AI 可护住** | LLM 能补充的具体能力（生成 / 翻译 / 命名 / 检索 / 推理 / 提炼 / 数据能力边界等） |\n\n---\n\n## ROI 分数（强制 xx/10）\n\nROI 分数填在\"诊断说明\"章节，**必须**是 0-10 整数或一位小数：\n\n- 9-10：极高（投入低、收益高、立即回收）\n- 7-8：高（投入低-中、收益中-高、月级回收）\n- 5-6：中（投入中、收益中、季级回收）\n- 3-4：低（投入高、收益低、年级回收）\n- 1-2：极低（投入高、收益微、不可回收）\n- 0：信息不足，无法判断\n\nROI 分数**只允许写在\"诊断说明 - ROI 分数\"那一行**，其他章节不要再写一遍 ROI。\n\n---\n\n## 难度评级（强制 xx/10）\n\n报告\"改造难度评级\"章节必须使用 Markdown 表格，列固定为：\n\n`维度 ｜ 难度值（xx/10，10为满分） ｜ 解释`\n\n5 个维度固定：\n\n| 维度 | 难度 0 | 难度 10 |\n|---|---|---|\n| 输入多样性 | 高度结构化 | 自由文本 / 多模态 |\n| 输出一致性要求 | 允许"},{"path":"README.md","content":"# 我手头有套脚本，要不要交给 LLM？🤔\n\n每次刷到「不接入 AI 就被淘汰」「让大模型改造一切」就开始焦虑。\n\n但你手头那套流程跑了 N 个月，稳得一批，到底要不要冒险改造一次？\n\n我最近发现一个**免费的诊断小工具**，专门治这种纠结。\n\n\n它叫 **LLM工作流诊断工具**，专门用于诊断LLM能不能改造你工作流的Skill。\n\n![](https://obs-piccc.oss-cn-hangzhou.aliyuncs.com/20260723225056366.png)\n\n\n## 一句话讲清楚它是干啥的\n\n把你手上的「离线可复用流程」丢给它，它帮你做一次 **LLM 改造 ROI 体检**。\n\n最后给你一句话结论：**全量改造 / 部分改造 / 不适合**，再加 ROI 分数、5 个维度难度评级、一份落地 MVP 路线图。\n\n不是「AI 万能」的鸡汤，也不是「看情况」就完事的废话。\n\n## 怎么用，4 步走\n![](https://obs-piccc.oss-cn-hangzhou.aliyuncs.com/20260723225136982.png)\n\n不用下载不用注册，装上 Skill 直接用。\n\n**Step 0，入口澄清**\n\n问你：你这套流程叫啥、多久跑一次、输出长啥样。老实交代就行。\n\n**Step 1，8 维度追问，最多 6 轮**\n\n从执行方、输入、输出、瓶颈、容错、约束、目标、可观察数据，8 个角度连环问。每轮 3-4 题一批，你一次答完就行。\n\n**Step 2，LLM 主判**\n\n不靠纯规则打分，综合所有回答给：\n- ROI 分数（xx/10）\n- 改造建议（全量 / 部分 / 不适合）\n- 5 维度难度评分（输入多样性、输出一致性、容错率、决策密度、可验证性）\n\n**Step 3，原文输出报告**\n\n一份六章节诊断报告直接贴在对话里，不写 .md。你看完心里就有数了。\n\n## 我特别喜欢的几个细节\n\n**有硬护栏**，监管、合规、实时、高精度场景，它直接劝你别上 LLM。不会为了讨好你说\"都可以试试\"。\n\n**追问有退出准则**，6 个有效回答 + 每个维度有具体答案才下结论。不会你才说了两句它就拍脑袋给判断。\n\n**报告不写假数据**，关键假设和没问到的问题会显式列出来，让你知道哪里还藏着雷。\n\n![](https://obs-piccc.oss-cn-hangzhou.aliyuncs.com/20260723225244692.png)\n\n## 适合谁用\n\n✅ 每周/每天跑同一套脚本流程的工程师\n✅ 客服有固定 FAQ 回复流程的运营\n✅ 想把日志/数据整理成周报的数据同学\n✅ 任何手里有「可复用流程 + 想过要不要上 LLM」的人\n\n❌ 一次性 prompt（\"帮我写封邮件\"那种不算流程）\n❌ 单纯想重构代码或修 bug\n❌ 只是想做技术选型，没问\"LLM 改造\"\n\n---\n\n过去纠结「该不该上 LLM」这种事，要么靠老板拍脑袋，要么靠朋友支招，要么靠自己 YY。\n\n现在有个**免费 + 结构化**的诊断工具直接拿过来用，挺香。"},{"path":"_meta.json","content":"{\n  \"ownerId\": \"kn7d9j0s3r1dyyhk54hpgdpe358b27pz\",\n  \"slug\": \"llm-workflow-diagnoser\",\n  \"version\": \"0.1.0\",\n  \"publishedAt\": 1784819898015\n}"},{"path":"references/examples/full_replace.md","content":"# 全量改造示例：跨平台营销文案流水线\n\n> 用途：写报告前对照风格，不内嵌到主报告里。\n> 注意：示例展示的是\"报告原文贴在 Chat\"的效果，章节标题、表格格式必须完全一致。\n\n## 用户上下文\n\n- 流程名：跨平台营销文案生成。\n- 触发：每周一次，运营手动写 20 条推文 / 朋友圈 / 小红书。\n- 输入：本周产品更新要点 + 受众标签。\n- 输出：3 个平台各 1 套文案 + 配图建议。\n- 错误成本：低（人工可改，可回滚）。\n- 改造目标：把\"20 条文案从 4 小时压缩到 30 分钟\"。\n\n---\n\n## 报告原文示例（应直接复制此结构）\n\n```text\n# 诊断说明\n- 一句话说明：跨平台文案生成是高容错 + 多样化输出的典型 LLM 全量改造场景，可压到月级回收。\n- 改造步骤：\n  - 步骤 1：固化「产品要点 + 受众标签 → 三平台文案」的 prompt 模板\n  - 步骤 2：用最近 4 周历史素材做对照验证，统计一次通过率\n  - 步骤 3：灰度 50% 流量到 LLM 路径，老流程并行兜底\n  - 步骤 4：监控互动率后下线老流程\n- ROI 分数：8/10（10为满分）\n- 改造关键：\n  - 关键 1：受众多样化 + 文案允许多版本，LLM 能直接打主力\n  - 关键 2：互动率可量化衡量改造效果\n  - 关键 3：人工兜底成本可接受\n- 下一步建议：\n  - 建议 1：先跑 1 周端到端验证\n  - 建议 2：建立「一次通过率 / 互动率」两道监控\n  - 建议 3：法务相关文案保留人工复核\n\n# LLM 介入边界\n- 硬护栏护住：无\n- 仅部分场景适用：法务 / 行业合规相关文案，需人工复核\n- 全量适用：跨平台改写、文案初稿、配图建议、CTA 优化\n- AI 可护住：生成（多平台文案）、推理（CTA 排序）、设计（多版本对比）、检索（历史高互动素材）\n\n# 改造难度评级\n\n维度\t｜ 难度值（xx/10，10为满分）｜解释\n输入多样性\t｜ 3/10（10为满分）｜ 产品要点半结构化，受众标签可控\n输出一致性要求\t｜ 2/10（10为满分）｜ 多平台风格本身要求多样化\n容错率\t｜ 2/10（10为满分）｜ 文案可人工润色，可回滚\n决策密度\t｜ 4/10（10为满分）｜ 需判断\"哪个角度最能打\"\n可验证性\t｜ 3/10（10为满分）｜ 有 CTR / 互动率数据\n\n# 落地 MVP 路线图\n- MVP 步骤 1：拿最近 1 周产品更新，让 LLM 生成 3 平台 × 5 版文案，人工对比\n- MVP 步骤 2：运营在新流程上跑 2 周，老流程并行作对照\n- MVP 步骤 3：下线老流程，保留人工兜底通道与互动率监控\n\n# 风险清单\n- 风险 1：LLM 文案风格漂移 → 缓解：固化 prompt + 风格样例库\n- 风险 2：互动率不升反降 → 缓解：保留老流程做 4 周 A/B 对照\n- 风险 3：法务合规文案误用 → 缓解：合规相关字段强制人工审核\n```"},{"path":"references/examples/not_suitable.md","content":"# 不适合示例：高频交易信号生成\n\n> 用途：写报告前对照风格，不内嵌到主报告里。\n> 注意：示例展示的是\"报告原文贴在 Chat\"的效果，章节标题、表格格式必须完全一致。\n\n## 用户上下文\n\n- 流程名：高频交易信号生成。\n- 触发：每秒数百次。\n- 输入：实时行情（结构化数值流）。\n- 输出：买入 / 卖出 / 持仓信号。\n- 错误成本：极高（一次错信号可能造成重大资金损失）。\n- 改造目标：希望用 LLM \"更快\" 出信号。\n\n---\n\n## 报告原文示例（应直接复制此结构）\n\n```text\n# 诊断说明\n- 一句话说明：高频交易信号同时命中实时 + 高精度 + 高合规三个硬护栏，LLM 不能进生产路径。\n- 改造步骤：\n  - 步骤 1：保持原实时信号生成脚本不变\n  - 步骤 2：把 LLM 隔离在盘后复盘场景，不进生产路径\n  - 步骤 3：用 LLM 做异常信号归因与策略回顾\n- ROI 分数：1/10（10为满分）\n- 改造关键：\n  - 关键 1：实时性 + 零容错 + 高合规三大硬护栏同时命中\n  - 关键 2：LLM 推理延迟不可能压到毫秒级\n  - 关键 3：错信号直接进生产路径，无法批量回滚\n- 下一步建议：\n  - 建议 1：放弃「让 LLM 直接出信号」的想法\n  - 建议 2：把 LLM 用在盘后复盘 / 异常归因\n  - 建议 3：保留当前脚本与回放框架，不引入 LLM 链路\n\n# LLM 介入边界\n- 硬护栏护住：实时信号生成、毫秒级决策、生产路径写入\n- 仅部分场景适用：盘后复盘报告、异常信号归因\n- 全量适用：无\n- AI 可护住：检索（复盘历史）、推理（归因假设），但都不可直接进生产路径\n\n# 改造难度评级\n\n维度\t｜ 难度值（xx/10，10为满分）｜解释\n输入多样性\t｜ 2/10（10为满分）｜ 行情字段固定\n输出一致性要求\t｜ 9/10（10为满分）｜ 信号必须严格一致\n容错率\t｜ 10/10（10为满分）｜ 错信号直接进生产路径\n决策密度\t｜ 5/10（10为满分）｜ 信号生成有规则\n可验证性\t｜ 2/10（10为满分）｜ 有完整回测与回放框架\n\n# 落地 MVP 路线图\n- MVP 步骤 1：明确把 LLM 隔离在盘后复盘场景\n- MVP 步骤 2：用 LLM 做异常信号归因，输出归因假设给人工审核\n- MVP 步骤 3：不引入任何进生产路径的 LLM 链路\n\n# 风险清单\n- 风险 1：把 LLM 引入实时链路造成延迟 → 缓解：明确隔离边界\n- 风险 2：复盘归因被误用为生产信号 → 缓解：复盘输出必须经人工审核才可入决策\n- 风险 3：误判 ROI 偏高 → 缓解：以实时性 / 合规为否决项\n```"}],"languages":[],"docsSourceLabel":"CLAWHUB","editorialOverview":"Use this skill whenever a user wants to evaluate whether an existing offline / reusable workflow is worth converting into an LLM-driven workflow. Triggers on... Skill: Llm Workflow Diagnoser Owner: graysilver Summary: Use this skill whenever a user wants to evaluate whether an existing offline / reusable workflow is worth converting into an LLM-driven workflow. Triggers on... Tags: latest:0.1.0 Version history: v0.1.0 | 2026-07-23T15:18:18.015Z | auto llm-workflow-diagnoser v0.2.0 introduces an LLM-driven process to evaluate if existing offline/reusable workflows are suitabl","editorialQuality":{"score":100,"threshold":65,"status":"ready","wordCount":717,"uniquenessScore":53,"reasons":[]}},"media":{"evidence":{"source":"no-media","verified":false,"confidence":"low","updatedAt":"2026-10-09T09:47:39.182Z","emptyReason":"No screenshots, media assets, or demo links are available."},"primaryImageUrl":null,"mediaAssetCount":0,"assets":[],"demoUrl":null},"ownerResources":{"evidence":{"source":"unclaimed","verified":false,"confidence":"low","updatedAt":"2026-10-09T09:47:39.182Z","emptyReason":"This page has not been claimed by the agent owner."},"hasCustomPage":false,"customPageUpdatedAt":null,"customLinks":[],"structuredLinks":{"docsUrl":null,"demoUrl":null,"supportUrl":null,"pricingUrl":null,"statusUrl":null},"customPage":null},"relatedAgents":{"evidence":{"source":"protocol-neighbors","verified":false,"confidence":"medium","updatedAt":"2026-10-09T22:49:43.786Z","emptyReason":null},"items":[{"id":"8ebccd8e-3863-4187-8355-c3f14e1f9edf","entityType":"agent","canonicalPath":"/agent/iofficeai-aionui","slug":"iofficeai-aionui","name":"AionUi","description":"Free, local, open-source 24/7 Cowork app and OpenClaw for Gemini CLI, Claude Code, Codex, OpenCode, Qwen Code, Goose CLI, Auggie, and more | 🌟 Star if you like it!","url":"https://github.com/iOfficeAI/AionUi","homepage":"https://www.aionui.com","source":"GITHUB_REPOS","protocols":["MCP","OPENCLAW"],"capabilities":[],"safetyScore":100,"overallRank":70,"updatedAt":"2026-10-09T19:11:12.944Z","createdAt":"2026-02-25T03:38:16.584Z","downloads":null},{"id":"b917f68a-ebff-438e-84f8-3f4b2494c0bc","entityType":"agent","canonicalPath":"/agent/activepieces-activepieces","slug":"activepieces-activepieces","name":"activepieces","description":"AI Agents & MCPs & AI Workflow Automation • (~400 MCP servers for AI agents) • AI Automation / AI Agent with MCPs • AI Workflows & AI Agents • MCPs for AI Agents","url":"https://github.com/activepieces/activepieces","homepage":"https://www.activepieces.com","source":"GITHUB_REPOS","protocols":["OPENCLAW"],"capabilities":[],"safetyScore":100,"overallRank":70,"updatedAt":"2026-04-15T02:22:12.426Z","createdAt":"2026-02-25T03:38:12.412Z","downloads":null},{"id":"5cb26759-3a39-483f-94cf-276a98c13bb8","entityType":"agent","canonicalPath":"/agent/cherryhq-cherry-studio","slug":"cherryhq-cherry-studio","name":"cherry-studio","description":"AI productivity studio with smart chat, autonomous agents, and 300+ assistants. Unified access to frontier LLMs","url":"https://github.com/CherryHQ/cherry-studio","homepage":"https://cherry-ai.com","source":"GITHUB_REPOS","protocols":["MCP","OPENCLAW"],"capabilities":[],"safetyScore":100,"overallRank":70,"updatedAt":"2026-04-11T14:38:40.986Z","createdAt":"2026-02-25T03:38:19.379Z","downloads":null},{"id":"6f6582d0-5d76-4f0f-b81d-86520247950b","entityType":"agent","canonicalPath":"/agent/copilotkit-copilotkit","slug":"copilotkit-copilotkit","name":"CopilotKit","description":"The Frontend for Agents & Generative UI. React + Angular","url":"https://github.com/CopilotKit/CopilotKit","homepage":"https://docs.copilotkit.ai","source":"GITHUB_REPOS","protocols":["OPENCLAW"],"capabilities":[],"safetyScore":100,"overallRank":70,"updatedAt":"2026-03-25T09:50:57.846Z","createdAt":"2026-02-25T03:39:14.617Z","downloads":null}],"links":{"hub":"/agent","source":"/agent/source/clawhub","protocols":[{"label":"OpenClaw","href":"/agent/protocol/openclew"}]}}}