{"id":"c2c85b44-d7f7-4214-91c5-c9deaaf2abf3","entityType":"agent","slug":"clawhub-alchaincyf-darwin-skill","name":"达尔文.skill","canonicalUrl":"https://www.xpersona.co/agent/clawhub-alchaincyf-darwin-skill","canonicalPath":"/agent/clawhub-alchaincyf-darwin-skill","generatedAt":"2026-10-09T10:17:38.630Z","source":"CLAWHUB","claimStatus":"UNCLAIMED","verificationTier":"NONE","summary":{"evidence":{"source":"editorial-content","verified":true,"confidence":"high","updatedAt":"2026-10-09T06:17:13.033Z","emptyReason":null},"description":"Autonomous skill optimizer inspired by Karpathy's autoresearch. Evaluates SKILL.md files using an 8-dimension rubric (structure + effectiveness), runs hill-c... Skill: 达尔文.skill Owner: alchaincyf Summary: Autonomous skill optimizer inspired by Karpathy's autoresearch. Evaluates SKILL.md files using an 8-dimension rubric (structure + effectiveness), runs hill-c... Tags: autoresearch:1.0.0, darwin:1.0.0, latest:1.0.0, optimization:1.0.0, skill:1.0.0 Version history: v1.0.0 | 2026-04-13T14:33:32.290Z | user Initial release: autoresearch-inspired autonomous skill optimization sy","descriptionLabel":"Technical summary","evidenceSummary":"Capability contract not published. No trust telemetry is available yet. 4K downloads reported by the source. Last updated 10/9/2026.","installCommand":"clawhub skill install s175vj0ymzerswhb0n313k9eq9848avz:darwin-skill","sourceUrl":"https://clawhub.ai/alchaincyf/darwin-skill","homepage":"https://clawhub.ai/alchaincyf/skills/darwin-skill","primaryLinks":[{"label":"View on ClawHub","url":"https://clawhub.ai/alchaincyf/darwin-skill","kind":"source"},{"label":"Homepage","url":"https://clawhub.ai/alchaincyf/skills/darwin-skill","kind":"homepage"}],"safetyScore":84,"overallRank":62,"popularityScore":44,"trustScore":null,"claimedByName":null,"isOwner":false,"seoDescription":"Autonomous skill optimizer inspired by Karpathy's autoresearch. Evaluates SKILL.md files using an 8-dimension rubric (structure + effectiveness), runs hill-c..."},"coverage":{"evidence":{"source":"public-profile","verified":false,"confidence":"medium","updatedAt":"2026-10-09T06:17:13.033Z","emptyReason":null},"protocols":[{"protocol":"OPENCLEW","label":"OpenClaw","status":"self-declared","notes":"Declared in the public agent profile."}],"capabilities":[],"verifiedCount":0,"selfDeclaredCount":1,"capabilityMatrix":{"rows":[{"key":"OPENCLEW","type":"protocol","support":"unknown","confidenceSource":"profile","notes":"Listed on profile"}],"flattenedTokens":"protocol:OPENCLEW|unknown|profile"}},"adoption":{"evidence":{"source":"CLAWHUB","verified":false,"confidence":"medium","updatedAt":"2026-10-09T06:17:13.033Z","emptyReason":null},"stars":null,"forks":null,"downloads":3963,"packageName":null,"latestVersion":"1.0.0","tractionLabel":"4K downloads"},"release":{"evidence":{"source":"CLAWHUB","verified":false,"confidence":"medium","updatedAt":"2026-10-09T06:17:13.033Z","emptyReason":null},"lastUpdatedAt":"2026-10-09T06:17:13.033Z","lastCrawledAt":"2026-10-09T06:17:13.033Z","lastIndexedAt":null,"nextCrawlAt":"2026-10-10T06:17:13.033Z","lastVerifiedAt":null,"highlights":[{"version":"1.0.0","createdAt":"2026-04-13T14:33:32.290Z","changelog":"Initial release: autoresearch-inspired autonomous skill optimization system","fileCount":11,"zipByteSize":36473}]},"execution":{"evidence":{"source":"CLAWHUB","verified":false,"confidence":"low","updatedAt":null,"emptyReason":"No published capability contract is available yet."},"installCommand":"clawhub skill install s175vj0ymzerswhb0n313k9eq9848avz:darwin-skill","setupComplexity":"low","setupSteps":["Setup complexity is LOW. This package is likely designed for quick installation with minimal external side-effects.","Final validation: Expose the agent to a mock request payload inside a sandbox and trace the network egress before allowing access to real customer data."],"contract":{"contractStatus":"missing","authModes":[],"requires":[],"forbidden":[],"supportsMcp":false,"supportsA2a":false,"supportsStreaming":false,"inputSchemaRef":null,"outputSchemaRef":null,"dataRegion":null,"contractUpdatedAt":null,"sourceUpdatedAt":null,"freshnessSeconds":null},"invocationGuide":{"preferredApi":{"snapshotUrl":"https://www.xpersona.co/api/v1/agents/clawhub-alchaincyf-darwin-skill/snapshot","contractUrl":"https://www.xpersona.co/api/v1/agents/clawhub-alchaincyf-darwin-skill/contract","trustUrl":"https://www.xpersona.co/api/v1/agents/clawhub-alchaincyf-darwin-skill/trust"},"curlExamples":["curl -s \"https://www.xpersona.co/api/v1/agents/clawhub-alchaincyf-darwin-skill/snapshot\"","curl -s \"https://www.xpersona.co/api/v1/agents/clawhub-alchaincyf-darwin-skill/contract\"","curl -s \"https://www.xpersona.co/api/v1/agents/clawhub-alchaincyf-darwin-skill/trust\""],"jsonRequestTemplate":{"query":"summarize this repo","constraints":{"maxLatencyMs":2000,"protocolPreference":["OPENCLEW"]}},"jsonResponseTemplate":{"ok":true,"result":{"summary":"...","confidence":0.9},"meta":{"source":"CLAWHUB","generatedAt":"2026-10-09T10:17:38.630Z"}},"retryPolicy":{"maxAttempts":3,"backoffMs":[500,1500,3500],"retryableConditions":["HTTP_429","HTTP_503","NETWORK_TIMEOUT"]}},"endpoints":{"dossierUrl":"https://www.xpersona.co/api/v1/agents/clawhub-alchaincyf-darwin-skill/dossier","snapshotUrl":"https://www.xpersona.co/api/v1/agents/clawhub-alchaincyf-darwin-skill/snapshot","contractUrl":"https://www.xpersona.co/api/v1/agents/clawhub-alchaincyf-darwin-skill/contract","trustUrl":"https://www.xpersona.co/api/v1/agents/clawhub-alchaincyf-darwin-skill/trust"}},"reliability":{"evidence":{"source":"runtime-metrics","verified":false,"confidence":"low","updatedAt":null,"emptyReason":"No trust, reliability, or runtime telemetry is available."},"trust":{"status":"unavailable","handshakeStatus":"UNKNOWN","verificationFreshnessHours":null,"reputationScore":null,"p95LatencyMs":null,"successRate30d":null,"fallbackRate":null,"attempts30d":null,"trustUpdatedAt":null,"trustConfidence":"unknown","sourceUpdatedAt":null,"freshnessSeconds":null},"decisionGuardrails":{"doNotUseIf":["Contract metadata is missing or unavailable for deterministic execution."],"safeUseWhen":[],"riskFlags":["missing_or_unavailable_contract","trust_data_unavailable","schema_references_missing"],"operationalConfidence":"low"},"executionMetrics":{"observedLatencyMsP50":null,"observedLatencyMsP95":null,"estimatedCostUsd":null,"uptime30d":null,"rateLimitRpm":null,"rateLimitBurst":null,"lastVerifiedAt":null,"verificationSource":null},"runtimeMetrics":{"successRate":null,"avgLatencyMs":null,"avgCostUsd":null,"hallucinationRate":null,"retryRate":null,"disputeRate":null,"p50Latency":null,"p95Latency":null,"lastUpdated":null}},"benchmarks":{"evidence":{"source":"no-benchmark-data","verified":false,"confidence":"low","updatedAt":null,"emptyReason":"No benchmark suites or observed failure patterns are available."},"suites":[],"failurePatterns":[]},"artifacts":{"evidence":{"source":"CLAWHUB","verified":false,"confidence":"high","updatedAt":"2026-10-09T06:17:13.033Z","emptyReason":null},"readme":"Skill: 达尔文.skill\n\nOwner: alchaincyf\n\nSummary: Autonomous skill optimizer inspired by Karpathy's autoresearch. Evaluates SKILL.md files using an 8-dimension rubric (structure + effectiveness), runs hill-c...\n\nTags: autoresearch:1.0.0, darwin:1.0.0, latest:1.0.0, optimization:1.0.0, skill:1.0.0\n\nVersion history:\n\nv1.0.0 | 2026-04-13T14:33:32.290Z | user\n\nInitial release: autoresearch-inspired autonomous skill optimization system\n\nArchive index:\n\nArchive v1.0.0: 11 files, 36473 bytes\n\nFiles: assets/banner.svg (6342b), assets/chart-loop.html (8794b), assets/chart-phases.html (4444b), assets/chart-ratchet.html (7599b), assets/chart-rubric.html (7865b), docs/index.html (30396b), README.md (7134b), showcase.html (30396b), skill-card.md (2382b), SKILL.md (12973b), _meta.json (131b)\n\nFile v1.0.0:SKILL.md\n\n---\nname: darwin-skill\ndescription: Autonomous skill optimizer inspired by Karpathy's autoresearch. Evaluates SKILL.md files using an 8-dimension rubric (structure + effectiveness), runs hill-climbing with git version control, and validates improvements through test prompts. Use when user mentions \"优化skill\", \"skill评分\", \"自动优化\", \"auto optimize skills\", \"skill质量检查\", \"这个skill写得不好\", \"帮我改改skill\", \"skill怎么样\", \"提升skill质量\", \"skill review\", \"skill打分\".\n---\n\n# 达尔文.skill\n\n> 借鉴 Karpathy autoresearch 的自主实验循环，对 skills 进行持续优化。\n> 核心理念：**评估 → 改进 → 实测验证 → 人类确认 → 保留或回滚**\n\n---\n\n## 设计哲学\n\nautoresearch 的精髓：\n1. **单一可编辑资产** — 每次只改一个 SKILL.md\n2. **双重评估** — 结构评分（静态分析）+ 效果验证（跑测试看输出）\n3. **棘轮机制** — 只保留改进，自动回滚退步\n4. **独立评分** — 评分用子agent，避免「自己改自己评」的偏差\n5. **人在回路** — 每个skill优化完后暂停，用户确认再继续\n\n与纯结构审查的区别：不只看 SKILL.md 写得规不规范，更看改完后**实际跑出来的效果是否更好**。\n\n---\n\n## 评估 Rubric（8维度，总分100）\n\n### 结构维度（60分）— 静态分析\n\n| # | 维度 | 权重 | 评分标准 |\n|---|------|------|---------|\n| 1 | **Frontmatter质量** | 8 | name规范、description包含做什么+何时用+触发词、≤1024字符 |\n| 2 | **工作流清晰度** | 15 | 步骤明确可执行、有序号、每步有明确输入/输出 |\n| 3 | **边界条件覆盖** | 10 | 处理异常情况、有fallback路径、错误恢复 |\n| 4 | **检查点设计** | 7 | 关键决策前有用户确认、防止自主失控 |\n| 5 | **指令具体性** | 15 | 不模糊、有具体参数/格式/示例、可直接执行 |\n| 6 | **资源整合度** | 5 | references/scripts/assets引用正确、路径可达 |\n\n### 效果维度（40分）— 需要实测\n\n| # | 维度 | 权重 | 评分标准 |\n|---|------|------|---------|\n| 7 | **整体架构** | 15 | 结构层次清晰、不冗余不遗漏、与花叔生态一致 |\n| 8 | **实测表现** | 25 | 用测试prompt跑一遍，输出质量是否符合skill宣称的能力 |\n\n### 评分规则\n- 维度1-7：每个维度打 1-10 分，乘以权重得到该维度得分\n- 维度8（实测表现）：跑2-3个测试prompt，按输出质量打1-10分\n- **总分 = Σ(维度分 × 权重) / 10**，满分100\n- 改进后总分必须 **严格高于** 改进前才保留\n\n### 关于「实测表现」维度\n\n这是与纯结构评分最大的区别。评分方式：\n\n1. 为每个skill设计2-3个**典型用户prompt**（不是边缘case，是最常见的使用场景）\n2. 用子agent执行：一个带skill跑，一个不带skill跑（baseline）\n3. 对比输出质量，从以下角度打分：\n   - 输出是否完成了用户意图？\n   - 相比不带skill的baseline，质量提升明显吗？\n   - 有没有skill引入的负面影响（过度冗余、跑偏、格式奇怪）？\n\n如果无法跑子agent（时间/资源限制），可以退化为「干跑验证」：读完skill后模拟一个典型prompt的执行思路，判断流程是否合理。但要在results.tsv中标注 `dry_run`。\n\n---\n\n## 自主优化循环\n\n### Phase 0: 初始化\n\n```\n1. 确认优化范围：\n   - 全部skills → 扫描 .claude/skills/*/SKILL.md\n   - 指定skills → 用户指定列表\n2. 创建 git 分支：auto-optimize/YYYYMMDD-HHMM\n3. 初始化 results.tsv（如不存在）\n4. 读取现有 results.tsv 了解历史优化记录\n```\n\n### Phase 0.5: 测试Prompt设计\n\n在评估之前，为每个skill设计测试prompt。这步很关键——没有测试prompt，「实测表现」维度就打不了分。\n\n```\nfor each skill:\n  1. 读取 SKILL.md，理解它做什么\n  2. 设计2-3个测试prompt，覆盖：\n     - 最典型的使用场景（happy path）\n     - 一个稍复杂或有歧义的场景\n  3. 保存到 skill目录/test-prompts.json：\n     [\n       {\"id\": 1, \"prompt\": \"用户会说的话\", \"expected\": \"期望输出的简短描述\"},\n       {\"id\": 2, \"prompt\": \"...\", \"expected\": \"...\"}\n     ]\n```\n\n展示所有测试prompt给用户，**确认后再进入评估**。测试prompt的质量决定了优化方向是否正确。\n\n### Phase 1: 基线评估（Baseline）\n\n```\nfor each skill in 优化范围:\n\n  # 结构评分（主agent可以做）\n  1. 读取 SKILL.md 全文\n  2. 按维度1-7逐项打分（附简短理由）\n\n  # 效果评分（用子agent做，独立于主agent）\n  3. 对每个测试prompt，spawn子agent：\n     - with_skill: 带着SKILL.md执行测试prompt\n     - baseline: 不带skill执行同一prompt\n  4. 对比两组输出，打维度8的分\n\n  # 汇总\n  5. 计算加权总分\n  6. 记录到 results.tsv\n```\n\n**如果子agent不可用**（超时、环境限制），维度8用干跑验证打分，标注 `dry_run`。不要因为跑不了测试就跳过这个维度——哪怕是模拟推演也比完全不看效果好。\n\n基线评估完成后，展示评分卡：\n\n```\n┌──────────────────────────┬───────┬──────────────┬──────────────┐\n│ Skill                    │ Score │ 结构短板      │ 效果短板      │\n├──────────────────────────┼───────┼──────────────┼──────────────┤\n│ huashu-proofreading      │ 78    │ 边界条件      │ 测试prompt2  │\n│ huashu-slides            │ 72    │ 指令具体性    │ baseline持平  │\n├──────────────────────────┼───────┼──────────────┼──────────────┤\n│ 平均                     │ 75    │              │              │\n└──────────────────────────┴───────┴──────────────┴──────────────┘\n```\n\n**暂停等用户确认，再进入优化循环。**\n\n### Phase 2: 优化循环\n\n用户确认后，按基线分数从低到高排序，先优化最弱的。\n\n```\nfor each skill:\n  round = 0\n  while round < MAX_ROUNDS (默认3):\n    round += 1\n\n    # Step 1: 诊断\n    找出得分最低的维度（结构或效果都算）\n\n    # Step 2: 提出改进方案\n    针对最低维度，生成1个具体改进方案：\n      - 改什么（具体段落/行）\n      - 为什么改（对应rubric哪条）\n      - 预期提升多少分\n\n    # Step 3: 执行改进\n    编辑 SKILL.md\n    git add + commit（message: \"optimize {skill}: {改进摘要}\"）\n\n    # Step 4: 重新评估\n    - 结构维度：主agent重新打分\n    - 效果维度：spawn独立子agent重跑测试prompt（关键！不能自己评自己）\n\n    # Step 5: 决策\n    if 新总分 > 旧总分:\n      status = \"keep\"，更新旧总分\n    else:\n      status = \"revert\"\n      git revert HEAD（创建新commit回滚，不用reset --hard）\n      记录失败尝试到 results.tsv\n      break  # 该skill到瓶颈，跳到下一个\n\n    # Step 6: 日志\n    results.tsv 追加行\n\n  # === 每个skill优化完后的人类检查点 ===\n  展示该skill的改动摘要：\n    - git diff（改前 vs 改后）\n    - 分数变化（哪些维度提升/下降）\n    - 测试prompt输出对比（如果跑过的话）\n  等用户确认 OK 再继续下一个skill。\n  如果用户说\"不好\"，回滚到该skill的优化前版本。\n```\n\n### Phase 2.5: 探索性重写（可选）\n\n当 hill-climbing 连续2个skill都在 round 1 就 break（涨不动）时，提议一次「探索性重写」：\n\n```\n1. 选一个瓶颈skill\n2. git stash 保存当前最优版本\n3. 从头重写SKILL.md（不是微调，是重新组织结构和表达方式）\n4. 重新评估\n5. if 重写版 > stash版: 采用重写版\n   else: git stash pop 恢复\n```\n\n这解决了 hill-climbing 的局部最优问题——有时候需要「先拆后建」才能突破瓶颈。\n**必须征得用户同意后才执行。**\n\n### Phase 3: 汇总报告\n\n```\n## 优化报告\n\n### 总览\n- 优化skills数：N\n- 总实验次数：M\n- 保留改进：X（Y%）\n- 回滚次数：Z\n- 实测验证：A次完整测试 / B次干跑\n\n### 分数变化\n┌──────────────────────────┬────────┬────────┬────────┐\n│ Skill                    │ Before │ After  │ Δ      │\n├──────────────────────────┼────────┼────────┼────────┤\n│ huashu-proofreading      │ 78     │ 87     │ +9     │\n│ huashu-slides            │ 72     │ 83     │ +11    │\n├──────────────────────────┼────────┼────────┼────────┤\n│ 平均                     │ 75     │ 85     │ +10    │\n└──────────────────────────┴────────┴────────┴────────┘\n\n### 主要改进\n1. [skill-A] 补充了边界条件处理，测试输出质量提升明显\n2. [skill-B] 重组了workflow结构，baseline对比优势增大\n```\n\n---\n\n## results.tsv 格式\n\n```tsv\ntimestamp\tcommit\tskill\told_score\tnew_score\tstatus\tdimension\tnote\teval_mode\n2026-03-31T10:00\tbaseline\thuashu-proofreading\t-\t78\tbaseline\t-\t初始评估\tfull_test\n2026-03-31T10:05\ta1b2c3d\thuashu-proofreading\t78\t84\tkeep\t边界条件\t补充fallback\tfull_test\n2026-03-31T10:10\tb2c3d4e\thuashu-proofreading\t84\t82\trevert\t指令具体性\t过度细化\tdry_run\n```\n\n新增 `eval_mode` 列：`full_test`（跑了子agent测试）或 `dry_run`（模拟推演）。\n文件位置：`.claude/skills/auto-optimize-results.tsv`\n\n---\n\n## 优化策略库\n\n按优先级排序，每轮只做最高优先级的一个：\n\n### P0: 效果问题（实测发现的）\n- 测试输出偏离用户意图 → 检查skill是否有误导性指令\n- 带skill比不带还差 → skill可能过度约束，考虑精简\n- 输出格式不符合预期 → 补充明确的输出模板\n\n### P1: 结构性问题\n- Frontmatter缺少触发词 → 补充中英文触发词\n- 缺少Phase/Step结构 → 重组为线性流程\n- 缺少用户确认检查点 → 在关键决策处插入\n\n### P2: 具体性问题\n- 步骤模糊（\"处理图片\"）→ 改为具体操作和参数\n- 缺少输入/输出规格 → 补充格式、路径、示例\n- 缺少异常处理 → 补充 \"如果X失败，则Y\"\n\n### P3: 可读性问题\n- 段落过长 → 拆分+用表格\n- 重复描述 → 合并去重\n- 缺少速查 → 添加TL;DR或决策树\n\n---\n\n## 约束规则\n\n1. **不改变skill的核心功能和用途** — 只优化\"怎么写\"和\"怎么执行\"，不改\"做什么\"\n2. **不引入新依赖** — 不添加skill原本没有的scripts或references文件\n3. **每轮只改一个维度** — 避免多个变更导致无法归因\n4. **保持文件大小合理** — 优化后SKILL.md不应超过原始大小的150%\n5. **尊重花叔风格** — 中文为主、简洁为上\n6. **可回滚** — 所有改动在git分支上，用git revert而非reset --hard\n7. **评分独立性** — 效果维度必须用子agent或至少干跑验证，不能在同一上下文里「改完直接评」\n\n---\n\n## 使用方式\n\n### 全量优化（推荐首次使用）\n```\n用户：\"优化所有skills\"\n→ Phase 0-3 完整流程\n→ 建议：先基线评估，选择分数最低的5-10个重点优化\n```\n\n### 单个优化\n```\n用户：\"优化 huashu-slides 这个skill\"\n→ 只对指定skill执行 Phase 0.5-2\n```\n\n### 仅评估不改\n```\n用户：\"评估所有skills的质量\"\n→ 只执行 Phase 0.5-1（设计测试prompt + 基线评估），不进入优化循环\n```\n\n### 查看历史\n```\n用户：\"看看skill优化历史\"\n→ 读取并展示 results.tsv\n```\n\n---\n\n## 设计灵感\n\n> \"You write the goals and constraints in program.md; let an agent generate and test code deltas indefinitely; keep only what measurably improves the objective.\"\n> — Karpathy, autoresearch\n\n本skill的对应关系：\n- **program.md** → 本文件（评估rubric和约束规则）\n- **train.py** → 每个SKILL.md\n- **val_bpb** → 8维加权总分（含实测表现）\n- **git ratchet** → 只保留有改进的commit\n- **test set** → 每个skill的test-prompts.json\n\n区别：增加了人在回路（autoresearch是全自主的，skill优化需要人的判断力），以及双重评估机制（结构+效果），因为skill的「好坏」比loss数值更微妙。\n\nFile v1.0.0:README.md\n\n![达尔文.skill](assets/banner.svg)\n\n# 达尔文.skill\n\n**像训练模型一样优化你的 Claude Code Skills。**\n\n受 [Andrej Karpathy 的 autoresearch](https://github.com/karpathy/autoresearch) 启发，将自主实验循环从模型训练搬到 Skill 优化领域。一个只能向前转的棘轮。\n\n---\n\n## 核心循环\n\n![Core Loop](assets/chart-loop.png)\n\n---\n\n## 为什么做这个\n\nClaude Code 的 Skill 生态在快速扩张。当你有 10 个 Skills 时可以手动维护；当你有 60+ 个 Skills 时，你需要一个系统。\n\n传统的 Skill 审查是**纯结构性的**：检查格式对不对、步骤有没有编号、路径能不能访问。但一个格式完美的 Skill，跑出来的效果可能很差。\n\n达尔文.skill 同时评估**结构质量**和**实际效果**，然后只保留真正有改进的修改。\n\n---\n\n## 从 autoresearch 到 Skill Optimizer\n\n这个项目直接受 Karpathy autoresearch 启发。autoresearch 的做法是：写一个 `program.md` 定义目标和约束，让 agent 自主生成和测试代码变更，只保留可测量的改进。\n\n我们把同样的思路搬到了 Skill 优化：\n\n| autoresearch | 达尔文.skill | 为什么这样映射 |\n|:---|:---|:---|\n| `program.md` | 本 SKILL.md | 定义评估标准和约束规则 |\n| `train.py` | 每个待优化的 SKILL.md | 被优化的资产，每次实验只改它 |\n| `val_bpb` | 8 维加权总分（满分100） | 可量化的优化目标 |\n| `git ratchet` | keep / revert 机制 | 只保留有改进的 commit |\n| `test set` | test-prompts.json | 验证改进是否真的有效 |\n| 全自主运行 | **人在回路** | Skill 的好坏比 loss 更微妙，需要人的判断 |\n\n关键区别：autoresearch 全自主运行（loss 可以自动比较），Skill 优化增加了**人在回路**。因为 Skill 的「好坏」不像 loss 那样可以纯数值判断。\n\n---\n\n## 五条核心原则\n\n| # | 原则 | 说明 |\n|:---|:---|:---|\n| 01 | **单一可编辑资产** | 每次只改一个 SKILL.md，变量可控，改进可归因 |\n| 02 | **双重评估** | 结构评分（静态分析）+ 效果验证（跑测试看输出） |\n| 03 | **棘轮机制** | 只保留改进，自动回滚退步，分数只升不降 |\n| 04 | **独立评分** | 评分用子 agent，避免「自己改自己评」的偏差 |\n| 05 | **人在回路** | 每个 Skill 优化完后暂停，用户确认再继续下一个 |\n\n---\n\n## 8 维度评估体系\n\n总分 100。结构维度靠静态分析（60分），效果维度必须实测（40分）。\n\n![Evaluation Rubric](assets/chart-rubric.png)\n\n> 实测表现权重最高（25分）。Skill 写得再漂亮，跑出来效果不好就是零。\n\n---\n\n## 优化循环：5 个阶段\n\n系统在每个阶段内自主运行，但在阶段之间暂停等待人类确认。\n\n![Optimization Lifecycle](assets/chart-phases.png)\n\n**Phase 2 的核心逻辑**：\n\n1. 找出得分最低的维度\n2. 针对该维度生成 1 个具体改进方案\n3. 编辑 SKILL.md，git commit\n4. 子 agent 独立重新评分\n5. 新分 > 旧分 → 保留；否则 → git revert\n6. 每个 Skill 完成后暂停，展示 diff + 分数变化，等用户确认\n\n---\n\n## 棘轮机制\n\n分数只能上升。每一轮要么改进 Skill，要么干净地回滚。不会随时间积累局部退化。\n\n![Ratchet Mechanism](assets/chart-ratchet.png)\n\n轮次 2 的 75 分低于当前最优的 78 分，被自动回滚。有效基线始终锁定在 78，后续改进从 78 继续。\n\n---\n\n## 快速开始\n\n### 安装\n\n```bash\n# 将 SKILL.md 放入 Claude Code Skills 目录\nmkdir -p ~/.claude/skills/darwin-skill\ncp SKILL.md ~/.claude/skills/darwin-skill/SKILL.md\n```\n\n### 使用\n\n```\n# 评估所有 Skills（只评估不改）\n> 评估所有 skills\n\n# 优化指定 Skill\n> 优化 huashu-slides 这个 skill\n\n# 全量优化（推荐首次使用）\n> 优化所有 skills\n\n# 查看历史\n> 看看 skill 优化历史\n```\n\n### 输出示例\n\n```\n┌──────────────────────────┬────────┬────────┬────────┐\n│ Skill                    │ Before │ After  │ Δ      │\n├──────────────────────────┼────────┼────────┼────────┤\n│ huashu-proofreading      │ 78     │ 87     │ +9     │\n│ huashu-slides            │ 72     │ 83     │ +11    │\n│ huashu-publish           │ 81     │ 88     │ +7     │\n├──────────────────────────┼────────┼────────┼────────┤\n│ 平均                     │ 77     │ 86     │ +9     │\n└──────────────────────────┴────────┴────────┴────────┘\n```\n\n---\n\n## 设计灵感\n\n这个项目的设计直接受 **Andrej Karpathy 的 [autoresearch](https://github.com/karpathy/autoresearch)** 启发。\n\nautoresearch 证明了一个优雅的想法：你可以把「写论文」这件事变成一个自主实验循环。定义目标（`program.md`），让 agent 不断生成和测试变更（`train.py`），用可量化的指标（`val_bpb`）决定保留还是回滚。\n\n达尔文.skill 把同样的思路搬到了 Claude Code Skill 优化。区别在于：\n\n1. **评估更复杂**：需要 8 个维度的加权评分，单一数值说不清楚\n2. **需要实测**：结构评分只是一半，另一半必须跑真实 prompt 看效果\n3. **人在回路**：Skill 的「好」是主观的，需要人来做最终判断\n\n核心机制完全相同：**只保留可测量的改进，其余全部回滚。**\n\n---\n\n## 约束规则\n\n1. 不改变 Skill 的核心功能和用途\n2. 不引入新依赖\n3. 每轮只改一个维度，避免多变更无法归因\n4. 优化后 SKILL.md 不超过原始大小的 150%\n5. 所有改动在 git 分支上，用 git revert 回滚\n6. 效果维度必须用子 agent 评分，不能自己改完自己评\n\n---\n\n## 文件结构\n\n```\ndarwin-skill/\n├── README.md              # 你正在看的文件\n├── SKILL.md               # 核心：评估标准 + 优化流程 + 约束规则\n├── showcase.html          # Pentagram 风格的可视化展示页（可本地打开）\n├── docs/                  # GitHub Pages（公开后可访问）\n│   └── index.html\n└── assets/\n    ├── banner.svg         # README 头图\n    ├── chart-loop.png     # 核心循环流程图\n    ├── chart-rubric.png   # 8 维度评估体系\n    ├── chart-phases.png   # 5 阶段优化时间线\n    └── chart-ratchet.png  # 棘轮机制可视化\n```\n\n---\n\n## 致谢\n\n- [Andrej Karpathy](https://github.com/karpathy) 的 [autoresearch](https://github.com/karpathy/autoresearch) 提供了核心设计灵感\n- [Claude Code](https://claude.ai/code) 的 Skill 生态提供了优化场景\n- [花叔](https://x.com/AlchainHust) 的 60+ Skills 实践提供了真实测试环境\n\n---\n\n**License**: MIT\n\nFile v1.0.0:_meta.json\n\n{\n  \"ownerId\": \"kn790wwtqpc4wthzy7rq6s5yp5849443\",\n  \"slug\": \"darwin-skill\",\n  \"version\": \"1.0.0\",\n  \"publishedAt\": 1776090812290\n}\n\nFile v1.0.0:skill-card.md\n\n## Description:\n\nAutonomous skill optimizer inspired by Karpathy's autoresearch that evaluates SKILL.md files with an 8-dimension rubric, runs hill-climbing with git version control, and validates changes through test prompts.\n\nThis skill is ready for commercial/non-commercial use.\n\n## Publisher:\n\n[alchaincyf](https://clawhub.ai/user/alchaincyf)\n\n### License/Terms of Use:\n\nMIT-0\n\n## Use Case:\n\nDevelopers and skill maintainers use this skill to evaluate and improve Claude Code skills by designing test prompts, scoring structure and behavior, proposing focused edits, and retaining only improvements after review.\n\n### Deployment Geography for Use:\n\nGlobal\n\n## Known Risks and Mitigations:\n\nRisk: The workflow can broadly inspect and modify installed skill files.\n\nMitigation: Run it first on a named skill or reviewed allowlist, and avoid full-scan optimization unless all local skill instructions are acceptable inputs.\n\nRisk: Generated edits may introduce incorrect or lower-quality skill guidance.\n\nMitigation: Review generated test prompts, score changes, diffs, and sample outputs before accepting changes.\n\nRisk: The workflow creates git branches and commits while optimizing skills.\n\nMitigation: Inspect the generated branch and commits before merging or deploying, and rely on revert behavior for changes that do not improve the score.\n\n## Reference(s):\n\n- [ClawHub skill page](https://clawhub.ai/alchaincyf/skills/darwin-skill)\n- [Publisher profile](https://clawhub.ai/user/alchaincyf)\n- [Karpathy autoresearch](https://github.com/karpathy/autoresearch)\n- [Claude Code](https://claude.ai/code)\n\n## Skill Output:\n\n**Output Type(s):** [Text, Markdown, Code, Shell commands, Configuration, Guidance]\n\n**Output Format:** [Markdown with inline code blocks, tabular scoring summaries, JSON or TSV artifacts, and proposed file edits.]\n\n**Output Parameters:** [1D]\n\n**Other Properties Related to Output:** [May create git branches, commits, test-prompts.json, results.tsv, and SKILL.md changes when the user approves the optimization workflow.]\n\n## Skill Version(s):\n\n1.0.0 (source: ClawHub release evidence)\n\n## Ethical Considerations:\n\nUsers should evaluate whether this skill is appropriate for their environment, review any generated or modified files before relying on them, and apply their organization's safety, security, and compliance requirements before deployment.","readmeExcerpt":"Skill: 达尔文.skill Owner: alchaincyf Summary: Autonomous skill optimizer inspired by Karpathy's autoresearch. Evaluates SKILL.md files using an 8-dimension rubric (structure + effectiveness), runs hill-c... Tags: autoresearch:1.0.0, darwin:1.0.0, latest:1.0.0, optimization:1.0.0, skill:1.0.0 Version history: v1.0.0 | 2026-04-13T14:33:32.290Z | user Initial release: autoresearch-inspired autonomous skill optimization sy","codeSnippets":[],"executableExamples":[{"language":"text","snippet":"1. 确认优化范围：\n   - 全部skills → 扫描 .claude/skills/*/SKILL.md\n   - 指定skills → 用户指定列表\n2. 创建 git 分支：auto-optimize/YYYYMMDD-HHMM\n3. 初始化 results.tsv（如不存在）\n4. 读取现有 results.tsv 了解历史优化记录"},{"language":"text","snippet":"for each skill:\n  1. 读取 SKILL.md，理解它做什么\n  2. 设计2-3个测试prompt，覆盖：\n     - 最典型的使用场景（happy path）\n     - 一个稍复杂或有歧义的场景\n  3. 保存到 skill目录/test-prompts.json：\n     [\n       {\"id\": 1, \"prompt\": \"用户会说的话\", \"expected\": \"期望输出的简短描述\"},\n       {\"id\": 2, \"prompt\": \"...\", \"expected\": \"...\"}\n     ]"},{"language":"text","snippet":"for each skill in 优化范围:\n\n  # 结构评分（主agent可以做）\n  1. 读取 SKILL.md 全文\n  2. 按维度1-7逐项打分（附简短理由）\n\n  # 效果评分（用子agent做，独立于主agent）\n  3. 对每个测试prompt，spawn子agent：\n     - with_skill: 带着SKILL.md执行测试prompt\n     - baseline: 不带skill执行同一prompt\n  4. 对比两组输出，打维度8的分\n\n  # 汇总\n  5. 计算加权总分\n  6. 记录到 results.tsv"},{"language":"text","snippet":"┌──────────────────────────┬───────┬──────────────┬──────────────┐\n│ Skill                    │ Score │ 结构短板      │ 效果短板      │\n├──────────────────────────┼───────┼──────────────┼──────────────┤\n│ huashu-proofreading      │ 78    │ 边界条件      │ 测试prompt2  │\n│ huashu-slides            │ 72    │ 指令具体性    │ baseline持平  │\n├──────────────────────────┼───────┼──────────────┼──────────────┤\n│ 平均                     │ 75    │              │              │\n└──────────────────────────┴───────┴──────────────┴──────────────┘"},{"language":"text","snippet":"for each skill:\n  round = 0\n  while round < MAX_ROUNDS (默认3):\n    round += 1\n\n    # Step 1: 诊断\n    找出得分最低的维度（结构或效果都算）\n\n    # Step 2: 提出改进方案\n    针对最低维度，生成1个具体改进方案：\n      - 改什么（具体段落/行）\n      - 为什么改（对应rubric哪条）\n      - 预期提升多少分\n\n    # Step 3: 执行改进\n    编辑 SKILL.md\n    git add + commit（message: \"optimize {skill}: {改进摘要}\"）\n\n    # Step 4: 重新评估\n    - 结构维度：主agent重新打分\n    - 效果维度：spawn独立子agent重跑测试prompt（关键！不能自己评自己）\n\n    # Step 5: 决策\n    if 新总分 > 旧总分:\n      status = \"keep\"，更新旧总分\n    else:\n      status = \"revert\"\n      git revert HEAD（创建新commit回滚，不用reset --hard）\n      记录失败尝试到 results.tsv\n      break  # 该skill到瓶颈，跳到下一个\n\n    # Step 6: 日志\n    results.tsv 追加行\n\n  # === 每个skill优化完后的人类检查点 ===\n  展示该skill的改动摘要：\n    - git diff（改前 vs 改后）\n    - 分数变化（哪些维度提升/下降）\n    - 测试prompt输出对比（如果跑过的话）\n  等用户确认 OK 再继续下一个skill。\n  如果用户说\"不好\"，回滚到该skill的优化前版本。"},{"language":"text","snippet":"1. 选一个瓶颈skill\n2. git stash 保存当前最优版本\n3. 从头重写SKILL.md（不是微调，是重新组织结构和表达方式）\n4. 重新评估\n5. if 重写版 > stash版: 采用重写版\n   else: git stash pop 恢复"}],"parameters":null,"dependencies":[],"permissions":[],"extractedFiles":[{"path":"SKILL.md","content":"---\nname: darwin-skill\ndescription: Autonomous skill optimizer inspired by Karpathy's autoresearch. Evaluates SKILL.md files using an 8-dimension rubric (structure + effectiveness), runs hill-climbing with git version control, and validates improvements through test prompts. Use when user mentions \"优化skill\", \"skill评分\", \"自动优化\", \"auto optimize skills\", \"skill质量检查\", \"这个skill写得不好\", \"帮我改改skill\", \"skill怎么样\", \"提升skill质量\", \"skill review\", \"skill打分\".\n---\n\n# 达尔文.skill\n\n> 借鉴 Karpathy autoresearch 的自主实验循环，对 skills 进行持续优化。\n> 核心理念：**评估 → 改进 → 实测验证 → 人类确认 → 保留或回滚**\n\n---\n\n## 设计哲学\n\nautoresearch 的精髓：\n1. **单一可编辑资产** — 每次只改一个 SKILL.md\n2. **双重评估** — 结构评分（静态分析）+ 效果验证（跑测试看输出）\n3. **棘轮机制** — 只保留改进，自动回滚退步\n4. **独立评分** — 评分用子agent，避免「自己改自己评」的偏差\n5. **人在回路** — 每个skill优化完后暂停，用户确认再继续\n\n与纯结构审查的区别：不只看 SKILL.md 写得规不规范，更看改完后**实际跑出来的效果是否更好**。\n\n---\n\n## 评估 Rubric（8维度，总分100）\n\n### 结构维度（60分）— 静态分析\n\n| # | 维度 | 权重 | 评分标准 |\n|---|------|------|---------|\n| 1 | **Frontmatter质量** | 8 | name规范、description包含做什么+何时用+触发词、≤1024字符 |\n| 2 | **工作流清晰度** | 15 | 步骤明确可执行、有序号、每步有明确输入/输出 |\n| 3 | **边界条件覆盖** | 10 | 处理异常情况、有fallback路径、错误恢复 |\n| 4 | **检查点设计** | 7 | 关键决策前有用户确认、防止自主失控 |\n| 5 | **指令具体性** | 15 | 不模糊、有具体参数/格式/示例、可直接执行 |\n| 6 | **资源整合度** | 5 | references/scripts/assets引用正确、路径可达 |\n\n### 效果维度（40分）— 需要实测\n\n| # | 维度 | 权重 | 评分标准 |\n|---|------|------|---------|\n| 7 | **整体架构** | 15 | 结构层次清晰、不冗余不遗漏、与花叔生态一致 |\n| 8 | **实测表现** | 25 | 用测试prompt跑一遍，输出质量是否符合skill宣称的能力 |\n\n### 评分规则\n- 维度1-7：每个维度打 1-10 分，乘以权重得到该维度得分\n- 维度8（实测表现）：跑2-3个测试prompt，按输出质量打1-10分\n- **总分 = Σ(维度分 × 权重) / 10**，满分100\n- 改进后总分必须 **严格高于** 改进前才保留\n\n### 关于「实测表现」维度\n\n这是与纯结构评分最大的区别。评分方式：\n\n1. 为每个skill设计2-3个**典型用户prompt**（不是边缘case，是最常见的使用场景）\n2. 用子agent执行：一个带skill跑，一个不带skill跑（baseline）\n3. 对比输出质量，从以下角度打分：\n   - 输出是否完成了用户意图？\n   - 相比不带skill的baseline，质量提升明显吗？\n   - 有没有skill引入的负面影响（过度冗余、跑偏、格式奇怪）？\n\n如果无法跑子agent（时间/资源限制），可以退化为「干跑验证」：读完skill后模拟一个典型prompt的执行思路，判断流程是否合理。但要在results.tsv中标注 `dry_run`。\n\n---\n\n## 自主优化循环\n\n### Phase 0: 初始化\n\n```\n1. 确认优化范围：\n   - 全部skills → 扫描 .claude/skills/*/SKILL.md\n   - 指定skills → 用户指定列表\n2. 创建 git 分支：auto-optimize/YYYYMMDD-HHMM\n3. 初始化 results.tsv（如不存在）\n4. 读取现有 results.tsv 了解历史优化记录\n```\n\n### Phase 0.5: 测试Prompt设计\n\n在评估之前，为每个skill设计测试prompt。这步很关键——没有测试prompt，「实测表现」维度就打不了分。\n\n```\nfor each skill:\n  1. 读取 SKILL.md，理解它做什么\n  2. 设计2-3个测试prompt，覆盖：\n     - 最典型的使用场景（happy path）\n     - 一个稍复杂或有歧义的场景\n  3. 保存到 skill目录/test-prompts.json：\n     [\n       {\"id\": 1, \"prompt\": \"用户会说的话\", \"expected\": \"期望输出的简短描述\"},\n       {\"id\": 2, \"prompt\": \"...\", \"expected\": \"...\"}\n     ]\n```\n\n展示所有测试prompt给用户，**确认后再进入评估**。测试prompt的质量决定了优化方向是否正确。\n\n### Phase 1: 基线评估（Baseline）\n\n```\nfor each skill in 优化范围:\n\n  # 结构评分（主agent可以做）\n  1. 读取 SKILL.md 全文\n  2. 按维度1-7逐项打分（附简短理由）\n\n  # 效果评分（用子agent做，独立于主agent）\n  3. 对每个测试prompt，spawn子agent：\n     - with_skill: 带着SKILL.md执行测试prompt\n     - baseline: 不带skill执行同一prompt\n  4. 对比两组输出，打维度8的分\n\n  # 汇总\n  5. 计算加权总分\n  6. 记录到 results.tsv\n```\n\n**如果子agent不可用**（超时、环境限制），维度8用干跑验证打分，标注 `dry_run`。不要因为跑不了测试就跳过这个维度——哪怕是模拟推演也比完全不看效果好。\n\n基线评估完成后，展示评分卡：\n\n```\n┌──────────────────────────┬───"},{"path":"README.md","content":"![达尔文.skill](assets/banner.svg)\n\n# 达尔文.skill\n\n**像训练模型一样优化你的 Claude Code Skills。**\n\n受 [Andrej Karpathy 的 autoresearch](https://github.com/karpathy/autoresearch) 启发，将自主实验循环从模型训练搬到 Skill 优化领域。一个只能向前转的棘轮。\n\n---\n\n## 核心循环\n\n![Core Loop](assets/chart-loop.png)\n\n---\n\n## 为什么做这个\n\nClaude Code 的 Skill 生态在快速扩张。当你有 10 个 Skills 时可以手动维护；当你有 60+ 个 Skills 时，你需要一个系统。\n\n传统的 Skill 审查是**纯结构性的**：检查格式对不对、步骤有没有编号、路径能不能访问。但一个格式完美的 Skill，跑出来的效果可能很差。\n\n达尔文.skill 同时评估**结构质量**和**实际效果**，然后只保留真正有改进的修改。\n\n---\n\n## 从 autoresearch 到 Skill Optimizer\n\n这个项目直接受 Karpathy autoresearch 启发。autoresearch 的做法是：写一个 `program.md` 定义目标和约束，让 agent 自主生成和测试代码变更，只保留可测量的改进。\n\n我们把同样的思路搬到了 Skill 优化：\n\n| autoresearch | 达尔文.skill | 为什么这样映射 |\n|:---|:---|:---|\n| `program.md` | 本 SKILL.md | 定义评估标准和约束规则 |\n| `train.py` | 每个待优化的 SKILL.md | 被优化的资产，每次实验只改它 |\n| `val_bpb` | 8 维加权总分（满分100） | 可量化的优化目标 |\n| `git ratchet` | keep / revert 机制 | 只保留有改进的 commit |\n| `test set` | test-prompts.json | 验证改进是否真的有效 |\n| 全自主运行 | **人在回路** | Skill 的好坏比 loss 更微妙，需要人的判断 |\n\n关键区别：autoresearch 全自主运行（loss 可以自动比较），Skill 优化增加了**人在回路**。因为 Skill 的「好坏」不像 loss 那样可以纯数值判断。\n\n---\n\n## 五条核心原则\n\n| # | 原则 | 说明 |\n|:---|:---|:---|\n| 01 | **单一可编辑资产** | 每次只改一个 SKILL.md，变量可控，改进可归因 |\n| 02 | **双重评估** | 结构评分（静态分析）+ 效果验证（跑测试看输出） |\n| 03 | **棘轮机制** | 只保留改进，自动回滚退步，分数只升不降 |\n| 04 | **独立评分** | 评分用子 agent，避免「自己改自己评」的偏差 |\n| 05 | **人在回路** | 每个 Skill 优化完后暂停，用户确认再继续下一个 |\n\n---\n\n## 8 维度评估体系\n\n总分 100。结构维度靠静态分析（60分），效果维度必须实测（40分）。\n\n![Evaluation Rubric](assets/chart-rubric.png)\n\n> 实测表现权重最高（25分）。Skill 写得再漂亮，跑出来效果不好就是零。\n\n---\n\n## 优化循环：5 个阶段\n\n系统在每个阶段内自主运行，但在阶段之间暂停等待人类确认。\n\n![Optimization Lifecycle](assets/chart-phases.png)\n\n**Phase 2 的核心逻辑**：\n\n1. 找出得分最低的维度\n2. 针对该维度生成 1 个具体改进方案\n3. 编辑 SKILL.md，git commit\n4. 子 agent 独立重新评分\n5. 新分 > 旧分 → 保留；否则 → git revert\n6. 每个 Skill 完成后暂停，展示 diff + 分数变化，等用户确认\n\n---\n\n## 棘轮机制\n\n分数只能上升。每一轮要么改进 Skill，要么干净地回滚。不会随时间积累局部退化。\n\n![Ratchet Mechanism](assets/chart-ratchet.png)\n\n轮次 2 的 75 分低于当前最优的 78 分，被自动回滚。有效基线始终锁定在 78，后续改进从 78 继续。\n\n---\n\n## 快速开始\n\n### 安装\n\n```bash\n# 将 SKILL.md 放入 Claude Code Skills 目录\nmkdir -p ~/.claude/skills/darwin-skill\ncp SKILL.md ~/.claude/skills/darwin-skill/SKILL.md\n```\n\n### 使用\n\n```\n# 评估所有 Skills（只评估不改）\n> 评估所有 skills\n\n# 优化指定 Skill\n> 优化 huashu-slides 这个 skill\n\n# 全量优化（推荐首次使用）\n> 优化所有 skills\n\n# 查看历史\n> 看看 skill 优化历史\n```\n\n### 输出示例\n\n```\n┌──────────────────────────┬────────┬────────┬────────┐\n│ Skill                    │ Before │ After  │ Δ      │\n├──────────────────────────┼────────┼────────┼────────┤\n│ huashu-proofreading      │ 78     │ 87     │ +9     │\n│ huashu-slides            │ 72     │ 83     │ +11    │\n│ huashu-publish           │ 81     │ 88     │ +7     │\n├──────────────────────────┼────────┼────────┼────────┤\n│ 平均                     │ 77     │ 86     │ +9     │\n└──────────────────────────┴────────┴────────┴────────┘\n```\n\n---\n\n## 设计灵感\n\n这个项目的设计直接受 **Andrej Karpathy 的 [autoresearch](https://github.com/karpathy/autoresearch)** 启发。\n\nautoresearch 证明了一个优雅的想法：你可以把「写论文」这件事变成一个自主实验循环。定义目标（`program.md`），让 agent 不断生成和测试变更（`train.py`），用可量化的指标（`val_bpb`）决定保留还是回滚"},{"path":"_meta.json","content":"{\n  \"ownerId\": \"kn790wwtqpc4wthzy7rq6s5yp5849443\",\n  \"slug\": \"darwin-skill\",\n  \"version\": \"1.0.0\",\n  \"publishedAt\": 1776090812290\n}"},{"path":"skill-card.md","content":"## Description:\n\nAutonomous skill optimizer inspired by Karpathy's autoresearch that evaluates SKILL.md files with an 8-dimension rubric, runs hill-climbing with git version control, and validates changes through test prompts.\n\nThis skill is ready for commercial/non-commercial use.\n\n## Publisher:\n\n[alchaincyf](https://clawhub.ai/user/alchaincyf)\n\n### License/Terms of Use:\n\nMIT-0\n\n## Use Case:\n\nDevelopers and skill maintainers use this skill to evaluate and improve Claude Code skills by designing test prompts, scoring structure and behavior, proposing focused edits, and retaining only improvements after review.\n\n### Deployment Geography for Use:\n\nGlobal\n\n## Known Risks and Mitigations:\n\nRisk: The workflow can broadly inspect and modify installed skill files.\n\nMitigation: Run it first on a named skill or reviewed allowlist, and avoid full-scan optimization unless all local skill instructions are acceptable inputs.\n\nRisk: Generated edits may introduce incorrect or lower-quality skill guidance.\n\nMitigation: Review generated test prompts, score changes, diffs, and sample outputs before accepting changes.\n\nRisk: The workflow creates git branches and commits while optimizing skills.\n\nMitigation: Inspect the generated branch and commits before merging or deploying, and rely on revert behavior for changes that do not improve the score.\n\n## Reference(s):\n\n- [ClawHub skill page](https://clawhub.ai/alchaincyf/skills/darwin-skill)\n- [Publisher profile](https://clawhub.ai/user/alchaincyf)\n- [Karpathy autoresearch](https://github.com/karpathy/autoresearch)\n- [Claude Code](https://claude.ai/code)\n\n## Skill Output:\n\n**Output Type(s):** [Text, Markdown, Code, Shell commands, Configuration, Guidance]\n\n**Output Format:** [Markdown with inline code blocks, tabular scoring summaries, JSON or TSV artifacts, and proposed file edits.]\n\n**Output Parameters:** [1D]\n\n**Other Properties Related to Output:** [May create git branches, commits, test-prompts.json, results.tsv, and SKILL.md changes when the user approves the optimization workflow.]\n\n## Skill Version(s):\n\n1.0.0 (source: ClawHub release evidence)\n\n## Ethical Considerations:\n\nUsers should evaluate whether this skill is appropriate for their environment, review any generated or modified files before relying on them, and apply their organization's safety, security, and compliance requirements before deployment."}],"languages":[],"docsSourceLabel":"CLAWHUB","editorialOverview":"Autonomous skill optimizer inspired by Karpathy's autoresearch. Evaluates SKILL.md files using an 8-dimension rubric (structure + effectiveness), runs hill-c... Skill: 达尔文.skill Owner: alchaincyf Summary: Autonomous skill optimizer inspired by Karpathy's autoresearch. Evaluates SKILL.md files using an 8-dimension rubric (structure + effectiveness), runs hill-c... Tags: autoresearch:1.0.0, darwin:1.0.0, latest:1.0.0, optimization:1.0.0, skill:1.0.0 Version history: v1.0.0 | 2026-04-13T14:33:32.290Z | user Initial release: autoresearch-inspired autonomous skill optimization sy","editorialQuality":{"score":100,"threshold":65,"status":"ready","wordCount":839,"uniquenessScore":54,"reasons":[]}},"media":{"evidence":{"source":"no-media","verified":false,"confidence":"low","updatedAt":"2026-10-09T06:17:13.033Z","emptyReason":"No screenshots, media assets, or demo links are available."},"primaryImageUrl":null,"mediaAssetCount":0,"assets":[],"demoUrl":null},"ownerResources":{"evidence":{"source":"unclaimed","verified":false,"confidence":"low","updatedAt":"2026-10-09T06:17:13.033Z","emptyReason":"This page has not been claimed by the agent owner."},"hasCustomPage":false,"customPageUpdatedAt":null,"customLinks":[],"structuredLinks":{"docsUrl":null,"demoUrl":null,"supportUrl":null,"pricingUrl":null,"statusUrl":null},"customPage":null},"relatedAgents":{"evidence":{"source":"protocol-neighbors","verified":false,"confidence":"medium","updatedAt":"2026-10-09T10:17:38.630Z","emptyReason":null},"items":[{"id":"b917f68a-ebff-438e-84f8-3f4b2494c0bc","entityType":"agent","canonicalPath":"/agent/activepieces-activepieces","slug":"activepieces-activepieces","name":"activepieces","description":"AI Agents & MCPs & AI Workflow Automation • (~400 MCP servers for AI agents) • AI Automation / AI Agent with MCPs • AI Workflows & AI Agents • MCPs for AI Agents","url":"https://github.com/activepieces/activepieces","homepage":"https://www.activepieces.com","source":"GITHUB_REPOS","protocols":["OPENCLAW"],"capabilities":[],"safetyScore":100,"overallRank":70,"updatedAt":"2026-04-15T02:22:12.426Z","createdAt":"2026-02-25T03:38:12.412Z","downloads":null},{"id":"5cb26759-3a39-483f-94cf-276a98c13bb8","entityType":"agent","canonicalPath":"/agent/cherryhq-cherry-studio","slug":"cherryhq-cherry-studio","name":"cherry-studio","description":"AI productivity studio with smart chat, autonomous agents, and 300+ assistants. Unified access to frontier LLMs","url":"https://github.com/CherryHQ/cherry-studio","homepage":"https://cherry-ai.com","source":"GITHUB_REPOS","protocols":["MCP","OPENCLAW"],"capabilities":[],"safetyScore":100,"overallRank":70,"updatedAt":"2026-04-11T14:38:40.986Z","createdAt":"2026-02-25T03:38:19.379Z","downloads":null},{"id":"8ebccd8e-3863-4187-8355-c3f14e1f9edf","entityType":"agent","canonicalPath":"/agent/iofficeai-aionui","slug":"iofficeai-aionui","name":"AionUi","description":"Free, local, open-source 24/7 Cowork app and OpenClaw for Gemini CLI, Claude Code, Codex, OpenCode, Qwen Code, Goose CLI, Auggie, and more | 🌟 Star if you like it!","url":"https://github.com/iOfficeAI/AionUi","homepage":"https://www.aionui.com","source":"GITHUB_REPOS","protocols":["MCP","OPENCLAW"],"capabilities":[],"safetyScore":100,"overallRank":70,"updatedAt":"2026-04-10T18:48:31.762Z","createdAt":"2026-02-25T03:38:16.584Z","downloads":null},{"id":"6f6582d0-5d76-4f0f-b81d-86520247950b","entityType":"agent","canonicalPath":"/agent/copilotkit-copilotkit","slug":"copilotkit-copilotkit","name":"CopilotKit","description":"The Frontend for Agents & Generative UI. React + Angular","url":"https://github.com/CopilotKit/CopilotKit","homepage":"https://docs.copilotkit.ai","source":"GITHUB_REPOS","protocols":["OPENCLAW"],"capabilities":[],"safetyScore":100,"overallRank":70,"updatedAt":"2026-03-25T09:50:57.846Z","createdAt":"2026-02-25T03:39:14.617Z","downloads":null}],"links":{"hub":"/agent","source":"/agent/source/clawhub","protocols":[{"label":"OpenClaw","href":"/agent/protocol/openclew"}]}}}