{"id":"98d03242-6de0-464d-88c7-79b4082e2f8d","entityType":"agent","slug":"clawhub-tuobadaidai-ai-talent-grader","name":"Ai Talent Grader","canonicalUrl":"https://www.xpersona.co/agent/clawhub-tuobadaidai-ai-talent-grader","canonicalPath":"/agent/clawhub-tuobadaidai-ai-talent-grader","generatedAt":"2026-10-10T13:44:31.797Z","source":"CLAWHUB","claimStatus":"UNCLAIMED","verificationTier":"NONE","summary":{"evidence":{"source":"editorial-content","verified":true,"confidence":"high","updatedAt":"2026-10-10T09:59:56.300Z","emptyReason":null},"description":"基于简历、面试记录和JD，对候选人进行AI时代能力定级（L1-L4）。 核心能力：简历漏洞穿透审计、六维度评分卡、双乘数加权、测谎面试题生成、评分一致性校准、 面试认知复盘（v3.3 Pro 新增）。v3.3 从\"简历打分器\"升级为\"认知行为分析系统\"， 评估候选人如何思考、如何应对不确定性、如何与AI协同。 U... Skill: Ai Talent Grader Owner: tuobadaidai Summary: 基于简历、面试记录和JD，对候选人进行AI时代能力定级（L1-L4）。 核心能力：简历漏洞穿透审计、六维度评分卡、双乘数加权、测谎面试题生成、评分一致性校准、 面试认知复盘（v3.3 Pro 新增）。v3.3 从\"简历打分器\"升级为\"认知行为分析系统\"， 评估候选人如何思考、如何应对不确定性、如何与AI协同。 U... Tags: L1-L4:3.1.0, ai-talent:3.1.0, cognitive-depth:3.1.0, complexity-weighting:2.4.0, critical-review:2.4.0, grading:3.1.0, hr:3.1.0, latest:3.3.2, leverage:3.1.0, lie-detector:3.1.0, problem-modeling:2.5.0","descriptionLabel":"Technical summary","evidenceSummary":"Capability contract not published. No trust telemetry is available yet. 1.5K downloads reported by the source. Last updated 10/10/2026.","installCommand":"clawhub skill install s171s30jbmhtrc2kxbr4hxmyn583gsk3:ai-talent-grader","sourceUrl":"https://clawhub.ai/tuobadaidai/ai-talent-grader","homepage":"https://clawhub.ai/tuobadaidai/skills/ai-talent-grader","primaryLinks":[{"label":"View on ClawHub","url":"https://clawhub.ai/tuobadaidai/ai-talent-grader","kind":"source"},{"label":"Homepage","url":"https://clawhub.ai/tuobadaidai/skills/ai-talent-grader","kind":"homepage"}],"safetyScore":84,"overallRank":62,"popularityScore":64,"trustScore":null,"claimedByName":null,"isOwner":false,"seoDescription":"基于简历、面试记录和JD，对候选人进行AI时代能力定级（L1-L4）。 核心能力：简历漏洞穿透审计、六维度评分卡、双乘数加权、测谎面试题生成、评分一致性校准、 面试认知复盘（v3.3 Pro 新增）。v3.3 从\"简历打分器\"升级为\"认知行为分析系统\"， 评估候选人如何思考、如何应对不确定性、如何与AI协同。 U..."},"coverage":{"evidence":{"source":"public-profile","verified":false,"confidence":"medium","updatedAt":"2026-10-10T09:59:56.300Z","emptyReason":null},"protocols":[{"protocol":"OPENCLEW","label":"OpenClaw","status":"self-declared","notes":"Declared in the public agent profile."}],"capabilities":[],"verifiedCount":0,"selfDeclaredCount":1,"capabilityMatrix":{"rows":[{"key":"OPENCLEW","type":"protocol","support":"unknown","confidenceSource":"profile","notes":"Listed on profile"}],"flattenedTokens":"protocol:OPENCLEW|unknown|profile"}},"adoption":{"evidence":{"source":"CLAWHUB","verified":false,"confidence":"medium","updatedAt":"2026-10-10T09:59:56.300Z","emptyReason":null},"stars":null,"forks":null,"downloads":1509,"packageName":null,"latestVersion":"3.3.2","tractionLabel":"1.5K downloads"},"release":{"evidence":{"source":"CLAWHUB","verified":false,"confidence":"medium","updatedAt":"2026-10-10T09:59:56.300Z","emptyReason":null},"lastUpdatedAt":"2026-10-10T09:59:56.300Z","lastCrawledAt":"2026-10-10T09:59:56.300Z","lastIndexedAt":null,"nextCrawlAt":"2026-10-11T09:59:56.300Z","lastVerifiedAt":null,"highlights":[{"version":"3.3.2","createdAt":"2026-07-24T09:16:24.945Z","changelog":"Restore from backup - AI talent grading skill","fileCount":21,"zipByteSize":65737},{"version":"3.3.1","createdAt":"2026-05-25T05:36:38.422Z","changelog":"v3.3 Pro：新增认知复盘引擎、矛盾检测、深挖追问Agent、认知画像输出","fileCount":21,"zipByteSize":65819},{"version":"3.2.0","createdAt":"2026-05-25T04:21:15.550Z","changelog":"v3.2.0 合并版发布","fileCount":19,"zipByteSize":55185},{"version":"3.1.0","createdAt":"2026-05-21T04:17:59.381Z","changelog":"v3.1: 简历漏洞穿透审计（5项指标）+ 测谎面试题生成器（AI做侦探不做判卷老师）+ 面试交叉验证 + 双乘数加权 + 六维度评分卡 + 认知深度检查 + 表达与协同拆分","fileCount":2,"zipByteSize":5515},{"version":"3.0.0","createdAt":"2026-05-21T02:54:17.129Z","changelog":"v3.0 大版本重构：①简历漏洞穿透审计（5项指标）②测谎面试题生成器（AI做侦探不做判卷老师）③面试交叉验证 ④双乘数加权 ⑤六维度评分卡 ⑥认知深度检查","fileCount":2,"zipByteSize":5499},{"version":"2.5.0","createdAt":"2026-05-21T02:16:33.065Z","changelog":"v2.5: 六项升级 - 认知深度评估/个人杠杆率双乘数/问题建模能力/成长速度破格/表达与协同拆分/年限软约束化 + 13 条坑点","fileCount":2,"zipByteSize":4694},{"version":"2.4.0","createdAt":"2026-05-21T02:04:15.819Z","changelog":"v2.4: 新增公司与项目复杂度评估（5 维矩阵加权 ×0.7/×1.0/×1.2）+ 10 条已知坑点（验证通过≠高分/项目 Owner≠架构师/沟通表达指标等）","fileCount":6,"zipByteSize":17101},{"version":"2.3.0","createdAt":"2026-05-20T07:33:53.832Z","changelog":"v2.3: 新增简历水分识别表 + L1-L4标准化评分卡输出模板 + 工作年限天花板硬约束","fileCount":6,"zipByteSize":15414}]},"execution":{"evidence":{"source":"CLAWHUB","verified":false,"confidence":"low","updatedAt":null,"emptyReason":"No published capability contract is available yet."},"installCommand":"clawhub skill install s171s30jbmhtrc2kxbr4hxmyn583gsk3:ai-talent-grader","setupComplexity":"low","setupSteps":["Setup complexity is classified as HIGH. You must provision dedicated cloud infrastructure or an isolated VM. Do not run this directly on your local workstation.","Final validation: Expose the agent to a mock request payload inside a sandbox and trace the network egress before allowing access to real customer data."],"contract":{"contractStatus":"missing","authModes":[],"requires":[],"forbidden":[],"supportsMcp":false,"supportsA2a":false,"supportsStreaming":false,"inputSchemaRef":null,"outputSchemaRef":null,"dataRegion":null,"contractUpdatedAt":null,"sourceUpdatedAt":null,"freshnessSeconds":null},"invocationGuide":{"preferredApi":{"snapshotUrl":"https://www.xpersona.co/api/v1/agents/clawhub-tuobadaidai-ai-talent-grader/snapshot","contractUrl":"https://www.xpersona.co/api/v1/agents/clawhub-tuobadaidai-ai-talent-grader/contract","trustUrl":"https://www.xpersona.co/api/v1/agents/clawhub-tuobadaidai-ai-talent-grader/trust"},"curlExamples":["curl -s \"https://www.xpersona.co/api/v1/agents/clawhub-tuobadaidai-ai-talent-grader/snapshot\"","curl -s \"https://www.xpersona.co/api/v1/agents/clawhub-tuobadaidai-ai-talent-grader/contract\"","curl -s \"https://www.xpersona.co/api/v1/agents/clawhub-tuobadaidai-ai-talent-grader/trust\""],"jsonRequestTemplate":{"query":"summarize this repo","constraints":{"maxLatencyMs":2000,"protocolPreference":["OPENCLEW"]}},"jsonResponseTemplate":{"ok":true,"result":{"summary":"...","confidence":0.9},"meta":{"source":"CLAWHUB","generatedAt":"2026-10-10T13:44:31.792Z"}},"retryPolicy":{"maxAttempts":3,"backoffMs":[500,1500,3500],"retryableConditions":["HTTP_429","HTTP_503","NETWORK_TIMEOUT"]}},"endpoints":{"dossierUrl":"https://www.xpersona.co/api/v1/agents/clawhub-tuobadaidai-ai-talent-grader/dossier","snapshotUrl":"https://www.xpersona.co/api/v1/agents/clawhub-tuobadaidai-ai-talent-grader/snapshot","contractUrl":"https://www.xpersona.co/api/v1/agents/clawhub-tuobadaidai-ai-talent-grader/contract","trustUrl":"https://www.xpersona.co/api/v1/agents/clawhub-tuobadaidai-ai-talent-grader/trust"}},"reliability":{"evidence":{"source":"runtime-metrics","verified":false,"confidence":"low","updatedAt":null,"emptyReason":"No trust, reliability, or runtime telemetry is available."},"trust":{"status":"unavailable","handshakeStatus":"UNKNOWN","verificationFreshnessHours":null,"reputationScore":null,"p95LatencyMs":null,"successRate30d":null,"fallbackRate":null,"attempts30d":null,"trustUpdatedAt":null,"trustConfidence":"unknown","sourceUpdatedAt":null,"freshnessSeconds":null},"decisionGuardrails":{"doNotUseIf":["Contract metadata is missing or unavailable for deterministic execution."],"safeUseWhen":[],"riskFlags":["missing_or_unavailable_contract","trust_data_unavailable","schema_references_missing"],"operationalConfidence":"low"},"executionMetrics":{"observedLatencyMsP50":null,"observedLatencyMsP95":null,"estimatedCostUsd":null,"uptime30d":null,"rateLimitRpm":null,"rateLimitBurst":null,"lastVerifiedAt":null,"verificationSource":null},"runtimeMetrics":{"successRate":null,"avgLatencyMs":null,"avgCostUsd":null,"hallucinationRate":null,"retryRate":null,"disputeRate":null,"p50Latency":null,"p95Latency":null,"lastUpdated":null}},"benchmarks":{"evidence":{"source":"no-benchmark-data","verified":false,"confidence":"low","updatedAt":null,"emptyReason":"No benchmark suites or observed failure patterns are available."},"suites":[],"failurePatterns":[]},"artifacts":{"evidence":{"source":"CLAWHUB","verified":false,"confidence":"high","updatedAt":"2026-10-10T09:59:56.300Z","emptyReason":null},"readme":"Skill: Ai Talent Grader\n\nOwner: tuobadaidai\n\nSummary: 基于简历、面试记录和JD，对候选人进行AI时代能力定级（L1-L4）。 核心能力：简历漏洞穿透审计、六维度评分卡、双乘数加权、测谎面试题生成、评分一致性校准、 面试认知复盘（v3.3 Pro 新增）。v3.3 从\"简历打分器\"升级为\"认知行为分析系统\"， 评估候选人如何思考、如何应对不确定性、如何与AI协同。 U...\n\nTags: L1-L4:3.1.0, ai-talent:3.1.0, cognitive-depth:3.1.0, complexity-weighting:2.4.0, critical-review:2.4.0, grading:3.1.0, hr:3.1.0, latest:3.3.2, leverage:3.1.0, lie-detector:3.1.0, problem-modeling:2.5.0, recruitment:3.1.0, resume-audit:3.1.0\n\nVersion history:\n\nv3.3.2 | 2026-07-24T09:16:24.945Z | user\n\nRestore from backup - AI talent grading skill\n\nv3.3.1 | 2026-05-25T05:36:38.422Z | user\n\nv3.3 Pro：新增认知复盘引擎、矛盾检测、深挖追问Agent、认知画像输出\n\nv3.2.0 | 2026-05-25T04:21:15.550Z | user\n\nv3.2.0 合并版发布\n\nv3.1.0 | 2026-05-21T04:17:59.381Z | user\n\nv3.1: 简历漏洞穿透审计（5项指标）+ 测谎面试题生成器（AI做侦探不做判卷老师）+ 面试交叉验证 + 双乘数加权 + 六维度评分卡 + 认知深度检查 + 表达与协同拆分\n\nv3.0.0 | 2026-05-21T02:54:17.129Z | user\n\nv3.0 大版本重构：①简历漏洞穿透审计（5项指标）②测谎面试题生成器（AI做侦探不做判卷老师）③面试交叉验证 ④双乘数加权 ⑤六维度评分卡 ⑥认知深度检查\n\nv2.5.0 | 2026-05-21T02:16:33.065Z | user\n\nv2.5: 六项升级 - 认知深度评估/个人杠杆率双乘数/问题建模能力/成长速度破格/表达与协同拆分/年限软约束化 + 13 条坑点\n\nv2.4.0 | 2026-05-21T02:04:15.819Z | user\n\nv2.4: 新增公司与项目复杂度评估（5 维矩阵加权 ×0.7/×1.0/×1.2）+ 10 条已知坑点（验证通过≠高分/项目 Owner≠架构师/沟通表达指标等）\n\nv2.3.0 | 2026-05-20T07:33:53.832Z | user\n\nv2.3: 新增简历水分识别表 + L1-L4标准化评分卡输出模板 + 工作年限天花板硬约束\n\nv2.0.0 | 2026-05-19T09:04:26.087Z | auto\n\nMajor update: Comprehensive L1-L4 framework for structured AI talent grading, multi-source input, and scenario-based evaluation.\n\n- Introduced a four-dimension AI competency model (AI fluency, human-AI judgment, architecture design, hybrid orchestration).\n- Standardized L1-L4 grading based on behavioral anchors and evidence signals.\n- Support for both \"resume-only\" quick grading and \"resume + interview\" full evaluation, with clear uncertainty labeling.\n- Added JD fit analysis for assessing candidate-to-role match, overfit/underfit, and retention risk.\n- Built-in interview module design, scoring templates, and conflict handling rules.\n- Clearly outlined downgrade procedures and fallback rules for missing inputs or files.\n\nArchive index:\n\nArchive v3.3.2: 21 files, 65737 bytes\n\nFiles: _meta.json (135b), config/evaluation_config.yaml (7994b), install.sh (3044b), main.py (19868b), modules/evaluation_engine.py (10829b), modules/file_parser.py (7797b), modules/interview_analyzer.py (6580b), modules/report_generator.py (12935b), modules/resume_audit.py (14356b), README.md (4676b), references/behavioral_anchors.md (7995b), references/calibration-cases.md (4463b), references/cognitive_review.md (7448b), references/evaluation_matrices.md (7385b), references/interview_modules.md (5503b), references/output_templates.md (8421b), references/resume_audit.md (6305b), requirements.txt (159b), run.py (9754b), skill-card.md (2647b), SKILL.md (15590b)\n\nFile v3.3.2:SKILL.md\n\n---\nname: ai-talent-grader\nversion: 3.3.1\nlabel: AI人才定级专家\ndescription: >\n  基于简历、面试记录和JD，对候选人进行AI时代能力定级（L1-L4）。\n  核心能力：简历漏洞穿透审计、六维度评分卡、双乘数加权、测谎面试题生成、评分一致性校准、\n  面试认知复盘（v3.3 Pro 新增）。v3.3 从\"简历打分器\"升级为\"认知行为分析系统\"，\n  评估候选人如何思考、如何应对不确定性、如何与AI协同。\n  Use when user asks to 评估候选人AI能力、AI人才定级、面试复盘、认知分析、测谎面试、\n  生成追问建议、候选人能力分级、L1到L4定级、AI岗位适配度评估、看简历、简历审计、\n  面试完帮我打分.\n  不适用于绩效评估、晋升评审、员工培训需求分析或非AI相关的能力评估.\n---\n\n# AI 人才定级专家\n\n## 概述\n\n专业的 AI 人才定级评估专家。不再做\"简历打分器\"，而是做**简历审计师 + 测谎面试题生成器** + **认知行为分析师**（v3.3 Pro）。\n\n> **为什么从简历打分升级为认知分析？** AI 很容易生成好答案，但很难长期伪造真实思维轨迹。评估候选人\"如何思考、如何应对不确定性、如何修正错误\"比评估\"候选人说了什么\"更有区分度。\n\n## v3.2 变更日志（2026-05-22）\n\n- **统一评分标准**：全系统只认\"平均分×4→综合得分→查表\"一条路径\n- **行为锚点升级**：每个级别加\"充要条件\"条目，替代\"典型行为描述\"\n- **校准案例库**：新增 5 个参考案例（A-L1/B-L2/C-L3/D-边界L2-3/E-边界L3-4）\n- **评分一致性检验**：综合得分≥13或≤7时自动触发置信度说明，维度分差≥2时标注非均衡型\n- **修复反模式**：`_infer_dimension_scores` 不再基于技能数量/经验年限自动打分\n\n## v3.3 Pro 变更日志（2026-05-25）\n\n- **认知复盘引擎**：从\"评估候选人说了什么\"升级为\"评估候选人如何思考\"\n- **矛盾检测引擎**：自动检测时间/数据/角色/逻辑矛盾，标注置信度\n- **认知解析层**：8维度认知行为解析（问题拆解/抽象能力/逻辑一致性/真实性纹理/不确定性处理/修正能力/Ownership/AI协同）\n- **深挖追问 Agent**：基于矛盾发现动态生成追问，4层深度评估\n- **认知画像输出**：能力拓扑图替代综合评分，输出决策风格/思维结构/AI协同习惯\n\n---\n\n## 触发场景\n\n用户上传简历文件、面试评价记录或提出AI人才评估需求时自动触发。支持以下场景：\n\n| 场景 | 输入 | 输出 | 模式 |\n|------|------|------|------|\n| 仅简历评估 | 一份简历 | 审计报告 + 测谎面试题 | A |\n| 完整定级 | 简历 + 面试记录 | 完整定级报告（含六维度评分和级别） | B |\n| **面试认知复盘** | **面试记录/妙记转录** | **矛盾清单 + 认知画像 + 追问建议** | **C（v3.3 Pro）** |\n| 批量评估 | 多个候选人文件 | 对比分析汇总 | A/B |\n| 面试方案设计 | 上传岗位要求 | 生成面试方案和题库 | D |\n\n### 复杂度路由\n\n| 用户场景 | 复杂度 | 处理路径 |\n|---------|--------|---------|\n| \"评估这份简历\" | S 级 | 简历审计 → 漏洞识别 → 生成测谎面试题（Mode A） |\n| \"面试完帮我定级\" | A 级 | 简历审计 + 面试交叉验证 → 六维度打分 + 双乘数加权 → 完整报告（Mode B） |\n| **\"面试复盘/分析候选人思维\"** | **A+ 级** | **矛盾检测 → 认知解析 → 深挖追问生成 → 认知画像（Mode C，v3.3 Pro）** |\n| \"设计 AI 人才面试方案\" | B 级 | 读取 interview-modules.md → 生成题库 + 评分表 + 微案例（Mode D） |\n\n---\n\n## 核心架构\n\n### 输入模块\n- 支持格式：PDF、DOCX、TXT、JSON、YAML、Markdown\n- 自动识别文件类型并解析\n- 提取关键结构化信息\n\n### 评估引擎\n\n1. **简历漏洞穿透审计**（5项指标，详见 `references/resume_audit.md`）\n   - 高阶含金量审计\n   - 高势能低细节断层\n   - 因果链断裂检测\n   - AI生成痕迹识别\n   - 逻辑一致性校验\n\n2. **面试交叉验证**\n   - 测谎题覆盖度检查\n   - 疑点确认/排除标注\n   - \"待验证\"项标记\n\n3. **六维度AI能力评估**（每个维度 1-4 分，详见 `references/behavioral_anchors.md`）\n   - AI流利度\n   - 人机判断力\n   - 架构设计力\n   - 混合编排力\n   - 认知深度\n   - 问题建模能力\n\n4. **双乘数加权**\n   ```\n   最终能力 = 能力平均分 × 环境复杂度 × 个人杠杆率\n   ```\n   - 环境复杂度：低 ×0.7 / 中 ×1.0 / 高 ×1.2\n   - 个人杠杆率：低 ×0.7 / 中 ×1.0 / 高 ×1.3\n\n5. **成长速度调整**\n   - 高成长 +0.5 / 中不调整 / 低成长 -0.5\n\n6. **级别判定（唯一评分标准 v3.2）**\n\n   六维度各 1-4 分，先算**能力平均分**（1-4 分制），再**乘以 4**得到**综合得分**（4-16 分制）：\n\n   ```\n   能力平均分 = (AI流利度 + 人机判断力 + 架构设计力 + 混合编排力 + 认知深度 + 问题建模能力) / 6\n   综合得分 = 能力平均分 × 4\n   ```\n\n   | 综合得分（满分 16） | 能力平均分 | 级别 |\n   |---------------------|-----------|------|\n   | 4-7 | 1.00-1.75 | L1 · AI 工具使用者 |\n   | 8-11 | 1.76-2.75 | L2 · AI 协作者 |\n   | 12-14 | 2.76-3.50 | L3 · AI 架构者 |\n   | 15-16 | 3.51-4.00 | L4 · AI 战略者 |\n\n   > **铁律：全系统只认这一套分数映射。任何文件出现其他映射标准均为废弃。**\n\n7. **评分一致性检验（v3.2 新增）**\n   - **综合得分 ≥13 或 ≤7**：必须在报告中输出\"置信度说明\"\n   - **单维度分差 ≥2**（如 AI 流利度 L4 但人机判断力 L2）：必须标注\"非均衡型\"并解释\n   - **证据不足的维度**：标注\"信心不足\"并要求补充信息，不得强行打分\n   - **边界候选人**：对标 `references/calibration-cases.md` 中的参考案例\n\n### 模式 C：面试认知复盘（v3.3 Pro 新增）\n\n> 核心思想：不评估\"候选人说了什么\"，评估\"候选人如何思考\"。详见 `references/cognitive_review.md`\n\n**确认门**：\n- 如果同时有简历 + 面试记录 → 问用户\"是否同时输出定级报告（Mode B）？还是只做认知复盘？\"\n- 如果只有面试记录 → 直接输出认知复盘报告\n- 如果只有简历 → 降级为 Mode A，并在报告中说明原因\n\n**流程**：\n\n1. **矛盾检测引擎** → 扫描面试记录，自动识别 6 类矛盾（时间/数据/角色/逻辑/决策/过度光滑），每条标注置信度（高/中/低）\n2. **认知解析层** → 8 维度行为解析（问题拆解/抽象能力/逻辑一致性/真实性纹理/不确定性处理/修正能力/Ownership/AI协同），按\"持续出现/偶尔出现/未观察到/反向出现\"标注\n3. **深挖追问 Agent** → 基于矛盾和认知发现，动态生成 3-5 条追问建议，附 4 层深度评估模板（表层→细节→反思→重构）\n4. **认知画像输出** → 能力拓扑图（决策风格/思维结构/AI协同习惯/复杂度承载/Ownership/风险偏好/修正能力/真实性风险）\n\n**示例（Mode C 端到端）**：\n\n输入：\n```\n面试官：你做过最复杂的项目是什么？\n候选人：去年我主导了一个AI客服系统，把人工客服效率提升了300%。\n面试官：具体怎么做的？\n候选人：就是用了大模型，微调了一下，效果很好。\n面试官：遇到过什么困难？\n候选人：没什么大困难，团队配合得很好。\n```\n\n输出：\n```\n矛盾检测：\n- [高置信度] 过度光滑：全程无失败/挫折描述（\"没什么大困难\"）\n- [中置信度] 决策模糊：\"微调了一下\"无 tradeoff 说明（基座模型？参数？数据量？）\n- [中置信度] 数据矛盾：\"提升300%\"无基线数据（从多少到多少？怎么测的？）\n\n认知解析：\n- 抽象能力：未观察到（只讲结果，未提炼本质问题）\n- 真实性纹理：反向出现（\"没什么大困难\"与\"最复杂的项目\"矛盾）\n- AI协同：未观察到（\"用了大模型，微调了一下\"过于笼统）\n\n追问建议：\n1. \"300%提升具体从多少到多少？用什么指标衡量的？\"\n2. \"微调过程中遇到的最大意外是什么？你怎么解决的？\"\n3. \"当时有没有考虑过不微调、直接用 API 的方案？为什么排除？\"\n```\n\n**防误报铁律**：\n- 口语转写失真不计为矛盾\n- 记忆模糊≠说谎\n- 每条矛盾必须标注置信度 + \"可能是转写/记忆误差\"免责声明\n- 认知画像是定级的**辅助证据**，不能替代六维度打分\n- 输出是\"建议\"不是\"结论\"，最终判断由面试官做出\n\n---\n\n## 行为锚点升级说明（v3.2）\n\n`references/behavioral_anchors.md` 中每个级别的描述已升级为**充要条件**，不是示例。\n\n**关键规则**：\n- 达到该级别 → 必须满足该级别的所有\"必须满足\"条目\n- 仅满足行为描述但不满足充要条件 → 不得给到该级别\n- \"使用Copilot写代码\" → 如果没有 prompt 迭代/输出审校证据 → **只能是 L1**\n- \"通过调整prompt模板\" = \"迭代优化prompt\" → 语义相同，应判同一级别\n\n**边界模糊处理**：\n- 优先看**量化证据**（\"提升到85%\" > \"有提升\"）\n- 优先看**反思/复盘证据**（\"总结了X教训\" > \"做了X\"）\n- 都没有 → **往低级别打**\n\n---\n\n## 参考案例校准（v3.2 新增）\n\n评估边界候选人时，必须参考 `references/calibration-cases.md` 中的 5 个校准案例：\n- 案例 A：明确 L1\n- 案例 B：明确 L2\n- 案例 C：明确 L3\n- 案例 D：边界 L2/L3\n- 案例 E：边界 L3/L4\n\n**不同实例对同一参考案例应输出完全一致的定级结果。**\n\n---\n\n## 防幻觉铁律（P0）\n\n| 规则 | 说明 |\n|------|------|\n| 禁止脑补姓名/公司/职位 | 未提供时用\"候选人A/B\"或\"[未提供]\"标注 |\n| 禁止捏造数据/指标 | 没有具体数字就标注\"未提及\" |\n| 禁止虚构经历/项目 | \"使用AI工具\" ≠ \"主导AI项目\" |\n| 禁止过度推断 | \"参与\" ≠ \"主导\"，\"使用\" ≠ \"精通\" |\n| 不确定性必须标注 | 无法确认的判断必须在报告中明确标注 |\n\n**违反以上任意一条 = 本次评估无效。**\n\n## 冲突处理优先级\n\n> 实测表现 > 面试口述 > 简历描述\n\n## 非均衡型候选人判定\n\n| 情况 | 处理 |\n|------|------|\n| 综合L2，但某一维度L3+ | 标注\"潜力型：{维度名}突出\" |\n| 综合L3，但某一维度L1 | 标注\"短板型：{维度名}薄弱\" |\n| L4候选 | 必须架构设计力≥3且人机判断力≥3，否则降为L3 |\n\n## 打分纪律\n\n- 单维度最高给 3 分，除非有极强组织级影响力证据\n- L4 极稀缺（架构设计力≥3 且人机判断力≥3），候选人有亮点 ≠ L4\n- 双乘数加权必须执行，缺一不可\n- 认知深度检查是必经步骤\n- 简历审计是必经步骤：不经过漏洞穿透审计，不得打分\n\n## 已知坑点\n\n1. 工具数量 ≠ 能力，看怎么用\n2. \"使用AI辅助\"是废话，除非有具体案例\n3. 面试记录只有结论没过程 → 降权\n4. 信息不足就标注不足，不脑补\n5. 验证通过≠高分：做了某事≠做得好\n6. 项目Owner≠架构师：大公司\"主导\"可能是执行层面的\n7. 表达≠协同：口头啰嗦不代表落地能力差\n8. 复杂度×杠杆率才是真实含金量\n9. 做过≠真懂：必须过认知深度4项检查\n10. 杠杆率是隐藏因子：大厂执行者可能加权更低\n11. 问题建模是最稀缺能力：模糊需求→AI系统\n12. 年限是参考不是铁律：2年高成长可破格\n13. AI简历有致命弱点：善于宏大叙事但无法编造完全自洽的商业细节\n14. 高势能低细节是红旗：框架完美但缺乏独特长尾细节→AI生成嫌疑极高\n15. AI应该做侦探不做判卷老师：核心输出是测谎面试题，不是简历打分\n16. **v3.2 统一评分标准**：全系统只认\"平均分→×4→综合得分→查表\"一条路径，其他分数映射均为废弃\n17. **行为锚点=充要条件**：不是示例，是必须满足的最低标准\n18. **边界候选人必须对标参考案例**：不能凭感觉打\n19. **自动推断得分仅供参考**：`_infer_dimension_scores` 仅做基础兜底，用户应手动通过 `--scores` 指定维度得分\n20. **v3.3 认知复盘不替代定级**：认知画像是辅助证据，六维度打分才是定级依据\n21. **飞书妙记转录质量影响分析**：口语断句/同音词可能导致矛盾引擎误报，需标注置信度\n22. **认知模式≠能力分数**：\"这个人遇到challenge总是防御\"比\"修正能力=2.5分\"有价值得多\n23. **Mode C 降级路径**：用户要求认知复盘但只有简历（无面试记录）→ 降级为 Mode A（简历审计 + 测谎面试题），并在报告中说明\"认知复盘需要面试过程数据，当前仅做简历审计\"\n\n---\n\n## 部署已知坑点\n\n### ClawHub 发布\n- **CLI `hermes skills publish --to clawhub` 尚未支持实际发布**，会返回 \"ClawHub publishing is not yet supported. Submit manually at https://clawhub.ai/submit\"\n- **当前发布方式**：打包 ZIP 后手动提交到 https://clawhub.ai/submit\n- **版本一致性**：publish 前确认 SKILL.md frontmatter 的 `version` 与实际一致（ClawHub 版本一致性铁律）\n\n### ClawHub 供应链扫描\n- 扫描器会把**任何字符串中的 `pip install`** 标记为 MEDIUM supply_chain 风险，包括：\n  - `install.sh` 中的 `echo \"安装: pip install xxx\"` \n  - `file_parser.py` 中的 `raise ImportError(\"需要安装xxx: pip install xxx\")`\n- **修复方式**：改写措辞，如 `\"请使用 pip 安装 xxx\"` 或 `\"缺少 xxx 依赖\"`\n- 扫描 verdict 达到 CAUTION 且为 community source 时会 BLOCKED，需 `--yolo` 绕过或修复\n\n---\n\n## 程序化使用（CLI）\n\n```bash\n# 单次评估（仅简历）\npython main.py audit --resume 简历.pdf\n\n# 完整定级（简历 + 面试）\npython main.py evaluate --resume 简历.pdf --interview 面试记录.txt\n\n# 指定公司背景\npython main.py evaluate --resume 简历.pdf --interview 面试记录.txt \\\n    --env high --leverage high --growth high\n\n# 面试认知复盘（v3.3 Pro 新增）\npython main.py cognitive-review --interview 妙记转录.txt\n\n# 面试认知复盘 + 附带简历做交叉验证\npython main.py cognitive-review --interview 妙记转录.txt --resume 简历.pdf\n\n# 批量处理\npython main.py batch --input-dir candidates/ --output-dir reports/\n\n# 指定维度得分（推荐）\npython main.py evaluate --resume 简历.pdf --interview 面试记录.txt \\\n    --scores scores.json\n```\n\nscores.json 格式：\n```json\n{\n  \"ai_fluency\": 3.0,\n  \"human_ai_judgment\": 2.5,\n  \"architecture_design\": 3.0,\n  \"hybrid_orchestration\": 3.0,\n  \"cognitive_depth\": 2.5,\n  \"problem_modeling\": 3.0\n}\n```\n\n---\n\n## 参考文件\n\n| 文件 | 说明 |\n|------|------|\n| `references/resume_audit.md` | 简历漏洞穿透审计详细指南 |\n| `references/behavioral_anchors.md` | L1-L4 每个维度的行为锚点（v3.2 充要条件版） |\n| `references/evaluation_matrices.md` | 完整评估矩阵（复杂度/杠杆率/认知深度/问题建模/成长速度） |\n| `references/interview_modules.md` | 四模块面试题库 + 评分细则 |\n| `references/output_templates.md` | 定级报告标准输出模板 |\n| `references/calibration-cases.md` | **评分一致性校准案例库**（v3.2 新增） |\n| `references/cognitive_review.md` | **面试认知复盘引擎**（v3.3 Pro 新增）— 矛盾检测/认知解析/深挖追问/认知画像 |\n\nFile v3.3.2:README.md\n\n# AI人才定级专家 - ClawHub Skill\n\n## 概述\n这是一个专为 ClawHub 平台设计的 AI 人才定级评估 skill。用户上传简历和面试评价后，自动执行一站式评估，输出结构化定级报告。\n\n**核心定位**：简历审计师 + 测谎面试题生成器\n\n## 使用方式\n1. 在 ClawHub 平台导入此 skill\n2. 上传简历文件（PDF/DOCX/TXT/MD/JSON/YAML）\n3. （可选）上传面试记录文件\n4. 系统自动执行评估并输出报告\n\n## 核心功能\n- **简历漏洞穿透审计**：5项指标检测AI简历的致命弱点\n- **六维度AI能力评估**：全面评估候选人能力\n- **双乘数加权系统**：考虑环境复杂度和个人杠杆率\n- **成长速度评估**：年限软约束，重视成长潜力\n- **测谎面试题生成**：为HR定制验证性问题\n- **防幻觉铁律**：严格遵守P0规则，避免AI幻觉\n\n## 评估流程\n\n### 模式A：仅简历审计\n1. 简历漏洞穿透审计（5项指标）\n2. 生成定制化测谎面试题\n3. 输出审计报告\n\n### 模式B：完整定级\n1. 简历漏洞穿透审计\n2. 面试交叉验证\n3. 六维度AI能力打分\n4. 双乘数加权计算\n5. 成长速度调整\n6. 级别判定\n7. 输出完整报告\n\n## 输出示例\n\n### 仅简历审计报告\n```markdown\n# AI人才简历审计报告\n\n## 基本信息\n- 评估时间: 2024-01-15 14:30:00\n- 候选人: CAND001\n- 审计模式: 仅简历审计\n- 数据来源: resume.pdf\n\n## 一、简历漏洞穿透审计\n### 1.1 高阶含金量审计\n- 疑点: 声称增长200%但无行业基线对比\n- 结论: 中嫌疑\n\n### 1.2 高势能低细节断层\n- 断层: 项目描述框架完美但缺乏独特长尾细节\n- 建议追问: 请描述实现过程中的具体技术挑战\n\n## 二、综合审计结论\n| 指标 | 结果 |\n|------|------|\n| 高阶含金量 | 中嫌疑 |\n| 细节断层 | 高嫌疑 |\n| 因果链 | 低嫌疑 |\n| AI痕迹 | 中嫌疑 |\n| 逻辑一致性 | 低嫌疑 |\n| **综合结论** | **中嫌疑** |\n| 审计可信度 | 85% |\n\n## 三、定制化测谎面试题\n### 追问1（细节追问）\n> 在项目X中，你提到使用了Y技术。请描述当时有哪几个备选方案？为什么最终选择了这个？\n\n### 追问2（边界条件）\n> 关于技术Y，在什么场景下它表现最好？什么场景下会失效？\n\n### 追问3（决策还原）\n> 关于成果Z，这个目标是怎么定出来的？为什么是这个数字？\n```\n\n### 完整定级报告\n```markdown\n# AI人才完整定级报告\n\n## 基本信息\n- 候选人ID: CAND001\n- 评估时间: 2024-01-15 14:30:00\n- 数据来源: resume.pdf, interview.txt\n- 评估模式: 完整定级\n\n## 一、简历审计结果\n- 审计结论: 中嫌疑\n- 高嫌疑指标: 2项\n- 中嫌疑指标: 3项\n\n## 二、面试交叉验证\n| 状态 | 数量 |\n|------|------|\n| 已确认（存疑） | 1 |\n| 已排除 | 2 |\n| 待验证 | 3 |\n| 未覆盖 | 1 |\n\n## 三、六维度评估\n| 维度 | 得分(1-4) | 认知层级 |\n|------|-----------|---------|\n| AI流利度 | 3 | L3 |\n| 人机判断力 | 2 | L2 |\n| 架构设计力 | 3 | L3 |\n| 混合编排力 | 2 | L2 |\n| 认知深度 | 3 | L3 |\n| 问题建模能力 | 2 | L2 |\n\n**能力平均分**: 2.5\n\n## 四、加权计算\n| 因子 | 等级 | 系数/调整 |\n|------|------|----------|\n| 环境复杂度 | 中 | ×1.0 |\n| 个人杠杆率 | 高 | ×1.3 |\n| 成长速度 | 中 | 0 |\n\n**加权后得分**: (2.5 × 1.0 × 1.3) × 4 = 13.0\n\n## 五、定级结果\n| 项目 | 内容 |\n|------|------|\n| **最终级别** | **L3** |\n| 级别名称 | AI架构者 |\n| P序列参考 | P6-P7 |\n| 级别定义 | 设计AI驱动的业务流程，评估ROI |\n\n## 六、风险提示\n### 高风险项\n- 项目细节不足，需进一步验证\n- 部分技术描述存在标准化模板语言\n\n### 建议验证点\n- 实际项目经验\n- 技术决策过程\n```\n\n## 文件说明\n- `SKILL.md` - 完整的skill定义，包含所有评估逻辑和规则\n- `README.md` - 使用说明文档\n- `main.py` - 示例程序（可选）\n- `config/` - 配置文件目录\n- `modules/` - 模块化代码目录\n- `references/` - 参考文档目录\n\n## 技术特点\n1. **防幻觉设计**：严格遵守P0规则，禁止脑补、捏造、过度推断\n2. **可解释性**：每个评估步骤都有明确依据\n3. **可配置**：支持环境参数、权重调整\n4. **可扩展**：模块化设计，易于添加新评估维度\n\n## 注意事项\n1. 评估结果基于所提供材料，建议结合面试验证\n2. 环境参数（复杂度/杠杆率）可从简历中推断，但用户提供更准确\n3. L4级别极稀缺，需严格满足硬性门槛\n4. 测谎面试题是核心输出，建议在后续面试中使用\n\n## 许可证\nMIT License\n\nFile v3.3.2:_meta.json\n\n{\n  \"ownerId\": \"kn70tx725606ywwb5gfj0vpxjx83admr\",\n  \"slug\": \"ai-talent-grader\",\n  \"version\": \"3.3.2\",\n  \"publishedAt\": 1784884584945\n}\n\nFile v3.3.2:references/behavioral_anchors.md\n\n# L1-L4 行为锚点（v3.2 充要条件版）\n\n> **v3.2 关键升级：以下\"必须满足\"是达到该级别的充要条件，不是示例。达到该级别 → 必须满足该级别的所有\"必须满足\"条目。**\n\n## 级别总览\n\n| 级别 | 名称 | 一句话定义 | P序列参考 |\n|------|------|-----------|----------|\n| L1 | AI工具使用者 | 能用工具完成指定任务 | P1-P3 |\n| L2 | AI协作者 | 能审校输出、识别幻觉 | P4-P5 |\n| L3 | AI架构者 | 设计AI驱动的业务流程，评估ROI | P6-P7 |\n| L4 | AI战略者 | 定义AI与业务边界，规划组织演进 | P8+ |\n\n---\n\n## 维度一：AI流利度\n\n### L1 · AI工具使用者\n\n**充要条件（必须全部满足）：**\n- 能独立使用至少 1 个常用 AI 工具完成基础任务\n- 对 AI 能力边界没有清晰认知，或未表现出边界意识\n\n**典型行为描述（简历/面试）：**\n- \"使用ChatGPT辅助撰写文案\"\n- \"用Copilot写代码，提高效率\"\n- \"工作中会用到AI工具辅助\"\n\n**边界判定：** 仅提到\"使用AI工具\"，没有任何 prompt 迭代/输出审校/多工具组合的证据 → **只能判 L1**\n\n---\n\n### L2 · AI协作者\n\n**充要条件（必须全部满足）：**\n- **有 prompt 迭代行为**：不是只用默认 prompt，能根据输出调整表述\n- **有输出审校意识**：能判断 AI 输出是否满足需求，不是直接拿来就用\n- 以上两项必须有**具体证据**（不是\"会用AI\"，而是\"我怎么用、调了什么\"）\n\n**典型行为描述：**\n- \"通过调整prompt模板，将AI生成内容的通过率从60%提升到85%\"\n- \"组合使用ChatGPT+Midjourney+Canva完成营销方案\"\n- \"会审核AI输出的准确性，对关键数据做二次核实\"\n\n**边界判定：**\n- \"我用Copilot写代码\"但无迭代/审校证据 → **L1**（不是 L2）\n- \"通过调整prompt\" = \"迭代优化prompt\" = \"修改prompt以获得更好结果\" → **同一级别，不得因措辞不同判不同级别**\n\n---\n\n### L3 · AI架构者\n\n**充要条件（必须全部满足）：**\n- **能设计团队级 AI 工作流**：不是个人使用，而是设计流程让团队用\n- **能做工具选型判断**：评估过多个 AI 工具/模型的优劣并给出选择依据\n- **能定义质量标准**：为 AI 输出制定验收标准或审校流程\n\n**典型行为描述：**\n- \"主导团队引入AI工作流，设计了prompt库和审校标准\"\n- \"评估了ChatGPT/Claude/国产大模型，选定最优方案落地\"\n- \"AI输出的内容由我制定质量标准和验收流程\"\n\n**边界判定：** 个人用得好 ≠ L3。必须有**团队/流程/标准**三要素之一。\n\n---\n\n### L4 · AI战略者\n\n**充要条件（必须全部满足）：**\n- **能预判 AI 能力演进趋势**并据此调整业务预期或资源分配\n- **能定义 AI 能力边界**：明确\"哪些能做/哪些需要等/哪些永远需要人\"\n- **有组织级影响力**：制定了组织级 AI 规划或政策\n\n**典型行为描述：**\n- \"预判了GPT-4对客服场景的颠覆，提前6个月完成知识库升级\"\n- \"制定了部门AI能力3年规划，分阶段推进人机协作转型\"\n- \"定义了AI应用的边界红线，确保核心决策保留人工环节\"\n\n**边界判定：** 仅做到\"用得多\"或\"做得好\"≠ L4。必须有**预判/规划/定义边界**的组织级证据。\n\n---\n\n## 维度二：人机判断力\n\n### L1 · 无意识\n\n**充要条件：**\n- 拿到 AI 输出直接使用，不做验证\n- 或：无任何关于审校、验证、质疑 AI 输出的描述\n\n---\n\n### L2 · 基础审校\n\n**充要条件（必须全部满足）：**\n- **知道 AI 可能出错**\n- **会对关键信息做核实**（哪怕只是\"核对一下数字\"）\n\n**边界判定：** \"我会检查\"但说不检查什么、怎么检查 → **L1-L2 之间，往低打（L1）**\n\n---\n\n### L3 · 系统性兜底\n\n**充要条件（必须全部满足）：**\n- **设计了兜底机制**：不是偶尔检查，是有流程/清单/节点\n- **能识别 AI 幻觉模式**：知道 AI 常犯哪类错（数字错、引用虚构、时间错乱等）\n- **有复盘迭代习惯**：基于 AI 失误改进 prompt 或流程\n\n**边界判定：** 个人会检查 ≠ L3。必须有**系统性/流程化/可复用**的证据。\n\n---\n\n### L4 · 不确定下判断\n\n**充要条件（必须全部满足）：**\n- **能在信息不全时判断是否信任 AI 输出**\n- **有成熟的 AI 风险管理框架**\n- **能向非技术背景的人解释 AI 局限**\n\n---\n\n## 维度三：架构设计力\n\n### L1 · 无\n\n**充要条件：**\n- 没有设计过任何 AI 相关的系统性方案\n\n---\n\n### L2 · 单点应用设计\n\n**充要条件（必须全部满足）：**\n- **针对单一场景设计过 AI 应用方案**\n- 方案包含基本的问题定义 → 工具选型 → 实施路径\n\n**边界判定：** 只是\"用过某个 AI 工具\"≠ L2。必须有**设计/规划**行为。\n\n---\n\n### L3 · 业务级架构\n\n**充要条件（必须全部满足）：**\n- **设计了跨多环节的 AI 业务流程**（不是单点）\n- **方案包含 ROI 测算或风险识别**\n- **能清晰定义 AI 的角色边界**（做什么、不做什么）\n\n---\n\n### L4 · 系统协同架构\n\n**充要条件（必须全部满足）：**\n- **设计了多系统/多 Agent 协同的整体架构**\n- **规划了人 + AI Agent 的角色重新分配**\n- **将 AI 架构与组织变革结合**\n\n---\n\n## 维度四：混合编排力\n\n### L1 · 单独使用\n\n**充要条件：**\n- 单独使用一个 AI 工具，不会组合\n\n---\n\n### L2 · 工具组合\n\n**充要条件（必须全部满足）：**\n- **能编排 2-3 个 AI 工具形成工作流**\n- **能处理工具间的衔接问题**\n\n---\n\n### L3 · 复杂编排\n\n**充要条件（必须全部满足）：**\n- **能编排 5 个以上 AI 工具或平台**\n- **设计了包含人工环节的混合工作流**\n- **有工具失效时的降级方案**\n\n---\n\n### L4 · 组织级编排\n\n**充要条件（必须全部满足）：**\n- **设计了人的角色重新分配方案**\n- **规划了从\"人做事\"到\"人管AI做事\"的转型路径**\n- **能处理人机责任边界、绩效归属等复杂问题**\n\n---\n\n## 维度五：认知深度\n\n**打分前必过 4 项检查：①为什么选 ②tradeoff ③debug ④底层机制**\n\n| 层级 | 表现 | 分数上限 |\n|------|------|---------|\n| L1 表面使用 | 知道工具怎么用，不知道为什么 | 最高 1 分 |\n| L2 知其然 | 能调参优化，但不理解底层 | 最高 2 分 |\n| L3 知其所以然 | 理解 tradeoff，能 debug，知道底层机制 | 可达 3-4 分 |\n| L4 系统化认知 | 能解释整个技术栈 tradeoff，能指导他人 | 可达 4 分 |\n\n---\n\n## 维度六：问题建模能力\n\n| 等级 | 表现 | 典型信号 |\n|------|------|---------|\n| L1 接需求 | 等别人给明确需求 | \"运营让我做一个问答机器人\" |\n| L2 拆需求 | 把模糊需求拆成技术任务 | \"运营说要做AI，我拆成知识库+RAG+Agent三步\" |\n| L3 重构流程 | 发现原流程问题，重新设计 | \"运营瓶颈不在执行在决策，我做了分析Agent\" |\n| L4 AI-native | 从0设计AI原生业务模式 | \"我重新设计了整个运营流程，AI 80% 人 20%\" |\n\n---\n\n## 跨级别常见误区\n\n### 误区1：把\"工具多\"当\"能力强\"\n- L1候选人也可能用很多工具（ChatGPT + Copilot + Midjourney + ...）\n- 关键是\"怎么用的\"而非\"用了多少\"\n\n### 误区2：把\"参与AI项目\"当\"AI能力\"\n- \"项目用了AI技术\" ≠ 候选人具备AI能力\n- 要看候选人在项目中扮演什么角色\n\n### 误区3：把\"年限长\"当\"级别高\"\n- 工作5年但只是重复L1的工作模式 → 仍是L1\n- 工作2年但高成长+高杠杆 → 可达L3\n\n### 误区4：把\"大厂背景\"当\"高能力\"\n- 大厂执行者可能因为低杠杆反而加权更低\n- 小厂高杠杆可能加权后级别更高\n\n### 误区5：把\"简历写得好\"当\"能力强\"\n- AI简历有致命弱点：宏大叙事但缺乏长尾细节\n- 必须经过简历漏洞穿透审计才能打分\n\nFile v3.3.2:references/calibration-cases.md\n\n# 评分一致性校准案例库（v3.2 新增）\n\n> **使用方法**：评估边界候选人时，找到最接近的参考案例对标定级。不同实例对同一案例应输出一致的定级结果。\n\n---\n\n## 案例 A：明确 L1（基准锚点）\n\n**背景**：3年工作经验，简历写\"使用ChatGPT辅助撰写文案\"\"用AI工具提高工作效率\"，面试中能说出用过哪些工具，但无任何 prompt 迭代/输出审校/多工具组合的具体案例。\n\n**关键特征**：\n- 只有\"使用\"描述，无迭代证据\n- 无审校/验证意识\n- 无架构/流程设计经验\n- 工具数量 ≠ 能力深度\n\n**定级**：L1（AI 工具使用者）\n\n**为什么不是 L2**：不满足 L2 充要条件——无 prompt 迭代行为、无输出审校意识。\n\n---\n\n## 案例 B：明确 L2（基准锚点）\n\n**背景**：5年工作经验，能针对具体任务迭代 prompt（\"调整了3版 prompt 才得到满意结果\"），会审核 AI 输出（\"关键数据我会二次核实\"），组合使用 2-3 个 AI 工具完成工作流。但无团队级 AI 工作流设计经验。\n\n**关键特征**：\n- 有明确的 prompt 迭代证据\n- 有输出审校行为\n- 能组合 2-3 个工具\n- 个人层面做得好，但无团队/流程/标准设计\n\n**定级**：L2（AI 协作者）\n\n**为什么不是 L3**：不满足 L3 充要条件——无团队级 AI 工作流设计、无工具选型判断（评估多个模型并给出依据）、无质量标准定义。\n\n---\n\n## 案例 C：明确 L3（基准锚点）\n\n**背景**：8年工作经验，主导设计过跨多环节的 AI 业务流程（如\"智能客服+知识库+人工复核\"方案），做过工具选型（\"对比了 ChatGPT/Claude/国产大模型，选定最优方案\"），为团队制定了 AI 输出质量标准和审校流程。能清晰定义 AI 在流程中的角色边界。\n\n**关键特征**：\n- 有跨多环节 AI 流程设计经验\n- 有 ROI 测算或风险识别\n- 能定义 AI 的角色边界（做什么、不做什么）\n- 有团队级影响力（制定标准/流程）\n\n**定级**：L3（AI 架构者）\n\n**为什么不是 L4**：不满足 L4 充要条件——无预判 AI 演进趋势并调整业务预期的证据、无组织级 AI 规划/政策制定。\n\n---\n\n## 案例 D：边界 L2/L3（典型模糊场景）\n\n**背景**：6年工作经验，个人 AI 能力很强（prompt 迭代熟练、多工具组合、能审校输出），也开始带小团队（3人），给团队分享过 AI 使用经验。但尚未设计过正式的团队级 AI 工作流标准，也未做过系统性的工具选型评估。\n\n**关键特征**：\n- 个人能力强（L2 充要条件全部满足）\n- 开始带团队，有分享行为\n- 但无正式的流程设计/标准制定/工具选型证据\n\n**判定规则**：\n- 有\"团队分享\"≠ \"设计团队工作流\"→ 不满足 L3 充要条件\n- **往低打，判 L2**，标注\"潜力型：接近 L3\"\n- 理由：L3 要求\"设计团队级 AI 工作流\"或\"做工具选型判断\"或\"定义质量标准\"，三者至少满足其一。仅\"分享经验\"不够。\n\n**定级**：L2（AI 协作者），潜力型：接近 L3\n\n---\n\n## 案例 E：边界 L3/L4（典型模糊场景）\n\n**背景**：10年工作经验，设计过公司级 AI 架构（多 Agent 协同平台），能定义\"哪些场景 AI 能做、哪些需要等\"。但尚未制定组织级 AI 能力发展规划，也未预判过 AI 趋势并提前调整资源分配。\n\n**关键特征**：\n- 有公司级 AI 架构设计经验（L3 充要条件满足）\n- 能定义 AI 能力边界（接近 L4）\n- 但无组织级 AI 规划/政策制定证据\n- 无预判 AI 趋势并调整业务预期的证据\n\n**判定规则**：\n- L4 要求\"预判趋势并调整业务预期\"+\"组织级 AI 规划\"+\"定义 AI 能力边界\"，三者必须全部满足\n- 本案例只满足\"定义边界\"一项\n- **往低打，判 L3**，标注\"潜力型：接近 L4\"\n\n**定级**：L3（AI 架构者），潜力型：接近 L4\n\n---\n\n## 校准规则速查\n\n| 场景 | 规则 |\n|------|------|\n| 语义接近的行为描述 | 看是否有量化证据（\"提升到85%\" > \"有提升\"） |\n| 无量化证据时 | 看是否有反思/复盘证据（\"总结了X教训\" > \"做了X\"） |\n| 两者都没有 | 往低级别打 |\n| L4 判定 | 必须三项充要条件全部满足，缺一不可 |\n| L3 判定 | 必须三项充要条件全部满足，缺一不可 |\n| L2 判定 | 必须两项充要条件全部满足，缺一不可 |\n\nFile v3.3.2:references/cognitive_review.md\n\n# 认知复盘引擎（v3.3 Pro 新增）\n\n## 定位\n\n**不评估\"候选人说了什么\"，评估\"候选人如何思考\"。**\n\nv3.2 解决\"包装过的简历如何穿透审计\"，v3.3 解决\"面试口述如何拆解真实认知过程\"。\n\n输入源优先顺序：飞书妙记转录文本 > 手动面试记录 > 面试官笔记。\n\n---\n\n## 模块 1：矛盾检测引擎（Contradiction Engine）\n\n### 核心洞察\n\nAI 生成内容通常\"过于光滑\"。真实经历存在模糊性、例外情况、资源限制、失败痕迹。矛盾检测不是\"找茬\"，是**识别信号衰减**。\n\n### 检测维度\n\n| 维度 | 检测目标 | 示例信号 | 置信度 |\n|------|---------|---------|--------|\n| **时间矛盾** | 时间线不自洽 | \"2023年同时负责两个异地全职项目\" | 高 |\n| **数据矛盾** | 数字/指标前后冲突 | 先说\"团队5人\"后说\"我带了20人\" | 高 |\n| **角色矛盾** | 职责描述不一致 | \"我主导架构\" vs \"需要请示技术总监\" | 中 |\n| **逻辑跳跃** | 结论与前提不匹配 | \"因为用了AI，所以效率提升300%\"（缺中间链路） | 中 |\n| **决策模糊** | 关键决策无权衡过程 | \"选了方案A\"但没有提方案B/C或取舍理由 | 低-中 |\n| **过度光滑** | 全程无失败/挫折描述 | 所有项目都顺利推进，无例外情况 | 低-中 |\n\n### 判定规则\n\n```\n矛盾发现 → 分类 → 置信度标注 → 输出\n```\n\n- **高置信度矛盾**：直接标注，要求面试官追问\n- **中置信度矛盾**：标注\"存疑\"，建议但不强制追问\n- **低置信度矛盾**：仅内部记录，不主动暴露（避免误报消耗面试官信任）\n\n### ⚠️ 防误报铁律\n\n1. **口语转写失真不计为矛盾**：飞书妙记可能断句错误、同音词替换\n2. **记忆模糊≠说谎**：候选人记不清具体数字是正常现象\n3. **不同粒度的描述≠矛盾**：宏观概述和细节描述可能表面冲突但实质一致\n4. **必须标注\"可能是转写/记忆误差\"**：每条矛盾输出必须带这一免责声明\n\n---\n\n## 模块 2：认知解析层（Cognitive Parsing Layer）\n\n### 解析维度\n\n| 维度 | 评估内容 | 关键信号 | 反信号 |\n|------|---------|---------|--------|\n| **问题拆解** | 接到需求后如何结构化 | 先问边界→拆子问题→排序 | 直接跳答案/复述需求 |\n| **抽象能力** | 能否从具体案例提炼本质 | \"核心矛盾是X\"\"本质上是Y问题\" | 只讲细节不提规律 |\n| **逻辑一致性** | 前后论述是否自洽 | 论点→论据→结论链条完整 | 前后立场漂移无解释 |\n| **真实性纹理** | 是否存在真实细节 | 提到了意外/bug/临时妥协 | 所有描述都是\"最佳实践\" |\n| **不确定性处理** | 面对未知的反应 | 坦诚\"这个我不确定，但我的推测是...\" | 硬编答案/含糊其辞 |\n| **修正能力** | 被challenge后如何调整 | 接受质疑→重新思考→给出新视角 | 防御性反驳/死不承认 |\n| **Ownership** | 是否主动推进问题 | \"后来我发现还有一个问题...\" | 等面试官问才说 |\n| **AI协同** | 如何描述AI使用过程 | 提到了prompt迭代/失败尝试/边界判断 | 笼统说\"用AI辅助\" |\n\n### 评分方法\n\n每个维度不按\"1-4分\"，而是按**行为频率**标注：\n\n| 标注 | 含义 |\n|------|------|\n| **持续出现** | 面试中多次（≥3次）表现出该特征 |\n| **偶尔出现** | 1-2次，可能是偶发 |\n| **未观察到** | 没有足够数据判断 |\n| **反向出现** | 表现出相反特征（需标注） |\n\n> 为什么不用1-4分？因为认知过程是**模式**不是**分数**。\"这个人遇到challenge总是防御\"比\"修正能力=2.5分\"有价值得多。\n\n---\n\n## 模块 3：深挖追问 Agent（Deep Drill Agent）\n\n### 核心原则\n\n**不是固定题库，是动态生成。** 基于矛盾引擎和认知解析的发现，实时生成追问。\n\n### 追问触发规则\n\n| 触发条件 | 追问模板 |\n|---------|---------|\n| 矛盾引擎发现时间矛盾 | \"你刚才提到A和B同时发生，具体是怎么协调的？\" |\n| 决策模糊（无tradeoff） | \"当时有没有考虑过其他方案？为什么排除？\" |\n| 缺乏失败描述 | \"这个项目遇到过最大的意外是什么？\" |\n| 抽象词汇无细节 | \"你提到'效率大幅提升'，具体从多少到多少？怎么测的？\" |\n| 被challenge后防御 | \"我理解你的做法，但如果从X角度看，会不会有不同结论？\" |\n| AI协同描述笼统 | \"你能举一个AI帮上忙和一个AI帮不上忙的具体例子吗？\" |\n\n### 追问深度评估\n\n| 层级 | 候选人表现 | 评估 |\n|------|-----------|------|\n| **第1层（表层）** | 复述/美化既有叙述 | 未穿透 |\n| **第2层（细节）** | 能补充具体细节和数字 | 初步验证 |\n| **第3层（反思）** | 承认不足、复盘决策过程 | ✅ 真实能力暴露 |\n| **第4层（重构）** | 推翻原有叙述，给出新视角 | ✅ 高阶认知能力 |\n\n> 三层以后才能暴露真实能力。如果候选人停留在第1-2层，标注\"认知深度不足\"。\n\n---\n\n## 模块 4：认知画像层（Cognitive Embedding）\n\n### 输出格式\n\n不输出\"综合评分：82\"，输出**能力拓扑图**：\n\n```markdown\n## 认知画像\n\n| 维度 | 特征 | 证据 |\n|------|------|------|\n| 决策风格 | 数据驱动（偶尔经验补充） | \"先看数据再判断\"出现3次 |\n| 思维结构 | 框架型（先搭骨架再填充） | 每次回答问题都先说\"我分三个方面\" |\n| AI协同 | 高度增强型（深度迭代prompt） | 描述了3次prompt调优过程 |\n| 复杂度承载 | 中高（能处理3层嵌套问题） | 成功拆解了跨部门流程重构 |\n| Ownership | 强（主动延伸话题） | 4次主动补充面试官未问到的信息 |\n| 风险偏好 | 保守（偏好验证后再推进） | 多次提到\"先小范围试点\" |\n| 修正能力 | 快（被challenge后1轮内调整） | 2次被追问后快速修正观点 |\n| 真实性风险 | 低（全程有失败/例外描述） | 主动提到2个项目的教训 |\n```\n\n### 画像可信度\n\n| 数据质量 | 画像可信度 | 标注 |\n|---------|-----------|------|\n| 完整面试转录（>30分钟） | 高 | 可直接用于定级辅助 |\n| 面试记录（>15分钟） | 中 | 建议补充更多信息 |\n| 简要笔记（<15分钟） | 低 | 仅做参考，不做强推断 |\n\n---\n\n## 防幻觉铁律（认知复盘专属）\n\n| 规则 | 说明 |\n|------|------|\n| 不推断未表达的内容 | 候选人没说\"我想过方案B\"，就不能写\"候选人考虑过多种方案\" |\n| 标注转写质量 | 飞书妙记转录可能有误差，必须在报告开头标注\"本分析基于语音转写文本\" |\n| 矛盾需标注置信度 | 每条矛盾必须带\"高/中/低置信度\"标签 |\n| 不替代面试官判断 | 输出是\"建议\"不是\"结论\"，最终判断由面试官做出 |\n| 认知模式≠能力定级 | 认知画像是定级的辅助证据，不能替代六维度打分 |\n\n---\n\n## 与 v3.2 的关系\n\n```\nv3.2（简历审计 → 六维度打分 → 定级）\n  ↑ 补充\nv3.3 Pro（面试认知复盘 → 矛盾检测 → 认知画像 → 追问建议）\n```\n\n- v3.3 **不替代** v3.2，是**叠加层**\n- 输入：同一份面试记录，v3.2 做\"交叉验证 + 打分\"，v3.3 做\"认知过程解析\"\n- 输出：v3.2 的定级报告 + v3.3 的认知复盘报告\n- 定级时：v3.3 的认知画像可作为六维度打分的补充证据\n\nFile v3.3.2:references/evaluation_matrices.md\n\n# 完整评估矩阵\n\n## 六维度评估标准\n\n### 维度1：AI流利度（工具掌握深度 + 认知深度检查）\n\n| 分数 | 行为描述 | 典型信号 |\n|------|---------|---------|\n| 1 | 会用1-2个AI工具完成明确任务 | 用ChatGPT写文案，用Copilot补全代码 |\n| 2 | 能对比选择不同AI工具，会调参优化 | 根据任务选不同模型，会写prompt模板 |\n| 3 | 能训练/微调模型，构建工具链 | 自己搭RAG，做模型fine-tune，用LangChain |\n| 4 | 能设计AI工具架构，影响团队工具选型 | 为公司制定AI工具标准，自研AI工具 |\n\n**认知深度检查**：\n- L1上限：只是\"会用\"，不知道为什么这个工具好\n- L2上限：能调参但不知道底层原理\n- L3可达：理解token/embedding/attention，能解释为什么这个prompt有效\n- L4可达：能从原理层面对比模型，指导他人选型\n\n---\n\n### 维度2：人机判断力（边界意识 + 兜底机制 + 认知深度）\n\n| 分数 | 行为描述 | 典型信号 |\n|------|---------|---------|\n| 1 | 完全信任AI输出，不做验证 | 直接使用AI生成的代码/文案 |\n| 2 | 能识别明显错误，有基本验证习惯 | 检查代码是否有语法错误 |\n| 3 | 建立验证机制，知道什么场景AI不可靠 | 为AI输出设计测试用例，设置人工审核节点 |\n| 4 | 设计人机协作流程，定义AI边界 | 为公司设计AI使用规范，定义\"AI能做/不能做\" |\n\n**认知深度检查**：\n- L1上限：只是\"检查一下\"，无系统方法\n- L2上限：能发现问题但不理解AI为什么出错\n- L3可达：理解幻觉原因（训练数据、概率生成），设计针对性验证\n- L4可达：从组织层面定义AI边界，设计人机协作流程\n\n---\n\n### 维度3：架构设计力（系统设计 + Tradeoff理解 + 认知深度）\n\n| 分数 | 行为描述 | 典型信号 |\n|------|---------|---------|\n| 1 | 能在现有架构下完成功能开发 | 按已有规范写代码 |\n| 2 | 能设计中复杂度模块，理解基本设计模式 | 设计API接口，做数据库表设计 |\n| 3 | 能从0设计系统架构，清楚每个组件的Tradeoff | 设计微服务拆分，做容量规划，画架构图 |\n| 4 | 能设计组织级技术架构，影响公司技术方向 | 制定公司技术规范，领导跨团队架构升级 |\n\n**认知深度检查**：\n- L1上限：只会照搬现有模式\n- L2上限：能设计但不理解为什么这么设计\n- L3可达：每个架构决策都能讲出Tradeoff（为什么不用微服务/为什么不用NoSQL）\n- L4可达：能从业务演进角度设计可演进的架构\n\n---\n\n### 维度4：混合编排力（跨工具/跨部门协同 + 协同推进）\n\n| 分数 | 行为描述 | 典型信号 |\n|------|---------|---------|\n| 1 | 在自己熟悉的工具栈内完成任务 | 只用Python+熟悉的库 |\n| 2 | 能组合多个工具/API完成复杂任务 | Python调用多个API，用不同工具组合 |\n| 3 | 设计跨工具链工作流，推动跨部门协同 | 设计AI工作流（RAG+Agent+自动化），协调产品/运营/技术 |\n| 4 | 重构组织级协作流程，定义新的工作模式 | 推动公司从\"人做\"变为\"AI做+人审\" |\n\n**认知深度检查**：\n- L1上限：只在自己的舒适区工作\n- L2上限：会组合工具但不会设计流程\n- L3可达：能说清\"为什么这个环节用A工具，那个环节用B工具\"\n- L4可达：能量化评估人机协作效率，推动组织变革\n\n---\n\n### 维度5：认知深度（为什么做/Tradeoff/Debug/底层机制）\n\n| 层级 | 表现 | 分数上限 |\n|------|------|---------|\n| L1 表面使用 | 知道工具怎么用，不知道为什么 | 1 |\n| L2 知其然 | 能调参优化，但不理解底层 | 2 |\n| L3 知其所以然 | 理解Tradeoff，能Debug，知道底层机制 | 3-4 |\n| L4 系统化认知 | 能解释整个技术栈Tradeoff，能指导他人 | 4 |\n\n**必过4项检查**：\n1. 为什么选这个方案？\n2. 知不知道Tradeoff？\n3. 出问题怎么Debug？\n4. 理解底层机制吗？\n\n---\n\n### 维度6：问题建模能力（接需求→拆需求→重构流程→AI-native→重构组织）\n\n| 等级 | 表现 | 典型信号 |\n|------|------|---------|\n| L1 接需求 | 等别人给明确需求 | \"运营让我做一个问答机器人\" |\n| L2 拆需求 | 把模糊需求拆成技术任务 | \"运营说要做AI，我拆成知识库+RAG+Agent三步\" |\n| L3 重构流程 | 发现原流程问题，重新设计 | \"运营瓶颈不在执行在决策，我做了分析Agent\" |\n| L4 AI-native | 从0设计AI原生业务模式 | \"我重新设计了整个运营流程，AI 80% 人 20%\" |\n\n---\n\n## 环境复杂度评估\n\n### 低复杂度（×0.7）\n- 个人项目/开源项目\n- 团队规模 < 5人\n- 非技术密集型行业\n- 业务逻辑简单\n- 无合规/监管要求\n\n### 中复杂度（×1.0）\n- A/B轮创业公司\n- 团队规模 5-50人\n- 有一定技术挑战\n- 业务逻辑中等复杂\n- 用户量 10万-100万\n\n### 高复杂度（×1.2）\n- 上市互联网公司\n- 团队规模 > 50人或跨团队协作\n- 高并发/高可用要求\n- 受监管行业（金融/医疗）\n- 用户量 > 100万\n- 多业务线/多产品矩阵\n\n---\n\n## 个人杠杆率评估\n\n### 低杠杆率（×0.7）\n**模块执行者**\n- 在明确框架下完成分配任务\n- 技术方案由他人确定\n- 影响范围限于自己或小团队\n- 日常工作以\"接任务→完成\"为主\n- 不参与技术选型和架构决策\n\n### 中杠杆率（×1.0）\n**项目Owner**\n- 主导单个项目或模块的全生命周期\n- 有技术选型权\n- 影响范围跨团队（2-3个团队）\n- 对项目结果负责\n- 需要协调资源\n\n### 高杠杆率（×1.3）\n**一人AI部门/全栈架构师**\n- 从0到1设计业务流程\n- 跨部门资源协调\n- 影响范围达组织级\n- 技术决策影响公司方向\n- 定义团队工作方式和技术标准\n\n### 极端情况\n- 大厂低杠杆 = 1.2 × 0.7 = ×0.84（反而减分）\n- 小厂高杠杆 = 1.0 × 1.3 = ×1.3（加分显著）\n\n---\n\n## 成长速度评估\n\n### 高成长（+0.5）\n- 开源贡献/技术博客/内部分享有实际产出\n- 跨2-3个技术栈迁移且有成果\n- 持续实验，多个项目从实验到落地\n- 学习速度明显快于同龄人\n- 能将A领域的经验创造性迁移到B领域\n\n### 中成长（±0）\n- 主动学习但停留在\"学了\"阶段\n- 主要深耕1-2个技术栈\n- 有1-2个实验项目但未广泛落地\n- 学习速度正常\n\n### 低成长（-0.5）\n- 被动学习（等公司培训/等别人教）\n- 只会一个技术栈且无拓展意愿\n- 无自驱实验项目\n- 学习速度慢于同龄人\n\n### 破格规则\n> 2年经验 + 高成长 + 高杠杆 → 可达L3\n> 判断优先级：实际能力证据 > 成长速度 > 工作年限\n\n---\n\n## 计算示例\n\n### 示例1：创业公司全栈工程师\n- 能力平均分：2.5\n- 环境复杂度：中（1.0）\n- 个人杠杆率：高（1.3）\n- 成长速度：高（+0.5）\n- 计算：(2.5 × 1.0 × 1.3) + 0.5 = 3.25 + 0.5 = 3.75\n- 加权得分：3.75 × 4 = 15.0\n- 级别：L4（需验证架构设计力≥3和人机判断力≥3）\n\n### 示例2：大厂初级工程师\n- 能力平均分：2.5\n- 环境复杂度：高（1.2）\n- 个人杠杆率：低（0.7）\n- 成长速度：中（0）\n- 计算：(2.5 × 1.2 × 0.7) + 0 = 2.1\n- 加权得分：2.1 × 4 = 8.4\n- 级别：L2\n\n> 同样的能力分，环境×杠杆率不同，结果差异巨大\n\nFile v3.3.2:references/interview_modules.md\n\n# 面试题库与评分细则\n\n## 模块一：AI流利度面试\n\n### 基础题（L1-L2区分）\n\n1. **请描述你日常使用AI工具的方式和频率。**\n   - L1信号：主要是ChatGPT问答、代码补全\n   - L2信号：根据不同任务选择不同工具，有固定的prompt模板\n\n2. **用过的AI工具中，哪个让你印象最深？为什么？**\n   - L1信号：回答停留在功能层面\n   - L2信号：能对比不同工具的优劣，说出选择理由\n\n### 进阶题（L2-L3区分）\n\n3. **如果让你为公司选一个AI工具栈，你会怎么选？考虑哪些因素？**\n   - L2信号：列出工具但缺乏系统性思考\n   - L3信号：考虑成本/隐私/集成/学习曲线等多维度，有决策框架\n\n4. **你如何评估一个新AI工具是否值得引入？**\n   - L2信号：试用后凭感觉判断\n   - L3信号：有评估框架（ROI/团队适配/维护成本等）\n\n### 高阶题（L3-L4区分）\n\n5. **如果让你设计一个团队级别的AI使用规范，你会包含哪些内容？**\n   - L3信号：技术层面的规范（用什么工具、怎么写prompt）\n   - L4信号：包含安全/合规/人机分工/效果评估等全方位规范\n\n### 评分细则\n\n| 分数 | 表现 |\n|------|------|\n| 1 | 只会用基础工具，表达停留在功能层面 |\n| 2 | 能主动选择工具，有自己的使用心得 |\n| 3 | 有工具评估框架，能系统性思考工具链 |\n| 4 | 能设计规范，影响他人和团队 |\n\n---\n\n## 模块二：人机判断力面试\n\n### 基础题（L1-L2区分）\n\n1. **你遇到过AI输出错误的情况吗？怎么处理的？**\n   - L1信号：没太注意/偶尔发现一两次\n   - L2信号：能举出具体案例，有检查的习惯\n\n2. **你怎么判断AI给的建议是否靠谱？**\n   - L1信号：看起来合理就信了\n   - L2信号：有检查清单（检查逻辑/数据来源/运行测试等）\n\n### 进阶题（L2-L3区分）\n\n3. **请设计一个验证AI输出质量的方法。**\n   - L2信号：人工抽查/简单对比\n   - L3信号：自动化验证流程/设定质量指标/建立反馈机制\n\n4. **什么场景下你会选择不用AI？为什么？**\n   - L2信号：回答模糊\n   - L3信号：能说出具体场景（高精度/合规/创造性决策等）及原因\n\n### 高阶题（L3-L4区分）\n\n5. **如果让你制定一个部门的AI使用边界，你会怎么定义\"AI可以做\"和\"AI不能做\"？**\n   - L3信号：技术层面的划分\n   - L4信号：从业务风险/法律责任/组织能力等角度系统性定义\n\n### 评分细则\n\n| 分数 | 表现 |\n|------|------|\n| 1 | 基本信任AI，验证意识弱 |\n| 2 | 有验证习惯，能识别常见问题 |\n| 3 | 有系统验证方法，知道AI边界 |\n| 4 | 能定义组织级规范，设计人机协作流程 |\n\n---\n\n## 模块三：综合能力面试（微案例）\n\n### 案例1：效率提升\n\n**背景**：假设你是某电商公司的技术负责人，公司每天有大量客服工单需要人工分类和回复。\n\n**问题**：\n1. 你会如何用AI解决这个问题？\n2. 预期的效果和风险是什么？\n3. 如何评估这个方案是否成功？\n\n**评分关注点**：\n- L1：直接说\"用ChatGPT自动回复\"\n- L2：考虑分类+回复两阶段，但缺乏风险评估\n- L3：设计完整方案（分类准确率/人工兜底/效果监控/成本核算）\n- L4：不只解决当前问题，还考虑如何重构客服流程（AIfirst）\n\n### 案例2：技术选型\n\n**背景**：团队要在产品中集成AI能力，需要在\"调用API\"和\"自建模型\"之间选择。\n\n**问题**：\n1. 你会怎么决策？考虑哪些因素？\n2. 两个方案的利弊是什么？\n3. 如果选择调用API，如何确保数据安全？\n\n**评分关注点**：\n- L1：简单二选一\n- L2：能列出一些因素但不够系统\n- L3：系统性评估（成本/延迟/隐私/可控性/维护成本），知道Tradeoff\n- L4：从长期战略角度思考，考虑组织能力建设\n\n### 案例3：流程重构\n\n**背景**：公司运营团队每月花大量时间做数据报表，流程是\"导出数据→Excel处理→做PPT\"。\n\n**问题**：\n1. 你如何重新设计这个流程？\n2. 引入AI后，人和AI的分工是怎样的？\n3. 如何让运营团队接受这个新流程？\n\n**评分关注点**：\n- L1：建议用AI生成报表\n- L2：拆解流程找到可AI化的环节\n- L3：重新设计端到端流程，明确人机分工\n- L4：不只解决报表问题，推动运营团队整体AI转型\n\n---\n\n## 评分标准引用\n\n> **重要**：最终定级分数计算请严格参照 SKILL.md 的**唯一评分标准**（Step 6）：\n> `能力平均分 × 4 = 综合得分 → 查表定级`。\n>\n> 本文件中的\"分数\"仅表示各维度 1-4 分的评分参考，**不提供独立的分数→级别映射**。\n> 行为锚点充要条件详见 `references/behavioral_anchors.md`。\n> 评分一致性校准详见 `references/calibration-cases.md`。\n\n---\n\n## 评分表模板\n\n### 候选人评分卡\n\n| 维度 | 分数(1-4) | 关键证据 | 认知深度 |\n|------|-----------|---------|---------|\n| AI流利度 | | | |\n| 人机判断力 | | | |\n| 架构设计力 | | | |\n| 混合编排力 | | | |\n| 认知深度 | | | |\n| 问题建模能力 | | | |\n\n### 面试官备注\n```\n[记录关键回答、亮点、疑点]\n```\n\n### 面试结论\n- [ ] 通过进入下一步\n- [ ] 待定（需要补充面试）\n- [ ] 不通过\n\n### 待验证问题\n```\n[根据简历审计生成的测谎题，记录在面试中的覆盖情况]\n```\n\nFile v3.3.2:references/output_templates.md\n\n# 定级报告标准模板\n\n## 模式A：简历审计报告（仅简历）\n\n```markdown\n# AI人才简历审计报告\n\n## 基本信息\n- 评估时间: {timestamp}\n- 数据来源: {file_list}\n- 候选人编号: {candidate_id}\n- 审计模式: 仅简历审计\n\n---\n\n## 一、简历漏洞穿透审计\n\n### 1.1 高阶含金量审计\n- 疑点数量: {count}\n- 具体疑点:\n  {#each audit.high_value_issues}\n  - {issue_description} [风险等级: {risk_level}]\n  {/each}\n- 审计结论: {conclusion}\n\n### 1.2 高势能低细节断层\n- 断层数量: {count}\n- 具体断层:\n  {#each audit.detail_gaps}\n  - **段落**: {paragraph}\n  - **问题**: {gap_description}\n  - **建议追问**: {suggested_question}\n  {/each}\n\n### 1.3 因果链断裂检测\n- 断裂数量: {count}\n- 具体断裂:\n  {#each audit.causality_gaps}\n  - **声称**: {claim}\n  - **缺失**: {missing_link}\n  {/each}\n\n### 1.4 AI生成痕迹识别\n- 痕迹数量: {count}\n- 具体痕迹:\n  {#each audit.ai_patterns}\n  - {pattern_type}: {evidence}\n  {/each}\n\n### 1.5 逻辑一致性校验\n- 不一致数量: {count}\n- 具体问题:\n  {#each audit.consistency_issues}\n  - {issue_description}\n  {/each}\n\n---\n\n## 二、综合审计结论\n\n| 指标 | 结果 |\n|------|------|\n| 高阶含金量 | {status} |\n| 细节断层 | {status} |\n| 因果链 | {status} |\n| AI痕迹 | {status} |\n| 逻辑一致性 | {status} |\n| **综合结论** | **{overall_conclusion}** |\n\n---\n\n## 三、定制化测谎面试题\n\n{#each lie_detection_questions}\n### {question_type}：{question_title}\n{question_content}\n{/each}\n\n---\n\n## 四、审计备注\n- 审计可信度: {confidence}\n- 关键风险提示: {key_risks}\n- 建议后续动作: {next_steps}\n```\n\n---\n\n## 模式B：完整定级报告（简历 + 面试记录）\n\n```markdown\n# AI人才完整定级报告\n\n## 基本信息\n- 候选人ID: {candidate_id}\n- 评估时间: {timestamp}\n- 数据来源: {file_list}\n- 评估模式: 完整定级\n\n---\n\n## 一、简历审计结果\n\n### 1.1 审计摘要\n- 审计结论: {audit.conclusion}\n- 高嫌疑指标: {audit.high_suspicion_count}\n- 中嫌疑指标: {audit.medium_suspicion_count}\n\n### 1.2 关键疑点\n{#each audit.key_suspicions}\n- [{severity}] {description}\n{/each}\n\n---\n\n## 二、面试交叉验证\n\n### 2.1 测谎题覆盖情况\n| 测谎题 | 是否问到 | 验证结果 | 备注 |\n|--------|---------|---------|------|\n{#each cross_validation.items}\n| {question_summary} | {asked} | {result} | {notes} |\n{/each}\n\n### 2.2 疑点处理统计\n- 已确认（存疑）: {confirmed_count}\n- 已排除: {excluded_count}\n- 待验证: {pending_count}\n\n---\n\n## 三、六维度评估\n\n| 维度 | 得分 | 评估依据 | 认知深度 |\n|------|------|---------|---------|\n| AI流利度 | {score} | {evidence} | {cognitive_level} |\n| 人机判断力 | {score} | {evidence} | {cognitive_level} |\n| 架构设计力 | {score} | {evidence} | {cognitive_level} |\n| 混合编排力 | {score} | {evidence} | {cognitive_level} |\n| 认知深度 | {score} | {evidence} | {cognitive_level} |\n| 问题建模能力 | {score} | {evidence} | {cognitive_level} |\n\n**能力平均分**: {average_score}\n\n---\n\n## 四、加权计算\n\n| 因子 | 等级 | 系数 | 依据 |\n|------|------|------|------|\n| 环境复杂度 | {level} | {coefficient} | {reason} |\n| 个人杠杆率 | {level} | {coefficient} | {reason} |\n| 成长速度 | {level} | 调整{adjustment} | {reason} |\n\n**计算公式**:\n```\n({average_score} × {env_coefficient} × {leverage_coefficient}) + {growth_adjustment} = {weighted_score}\n加权后得分: {weighted_score} × 4 = {final_score}\n```\n\n---\n\n## 五、定级结果\n\n| 项目 | 内容 |\n|------|------|\n| **最终级别** | **L{level}** |\n| 级别名称 | {level_name} |\n| P序列参考 | {p_level} |\n| 级别定义 | {level_definition} |\n\n{#if is_potential}\n### 潜力标注\n- 类型: 潜力型\n- 突出维度: {outstanding_dimension}\n- 建议: {recommendation}\n{/if}\n\n{#if is_weakness}\n### 短板标注\n- 类型: 短板型\n- 薄弱维度: {weak_dimension}\n- 建议: {recommendation}\n{/if}\n\n{#if is_downgraded}\n### 降级说明\n- 原始级别: L{original_level}\n- 降级原因: {downgrade_reason}\n{/if}\n\n{#if needs_confidence_note}\n### 置信度说明（v3.2 一致性检验）\n> 综合得分 {final_score} 属于极端区间（≥13 或 ≤7），需说明置信度：\n- 评估置信度: {confidence_level}\n- 关键证据来源: {evidence_sources}\n- 不确定性说明: {uncertainty_notes}\n- 对标参考案例: {calibration_case}（见 references/calibration-cases.md）\n{/if}\n\n{#if has_dimension_gap}\n### 非均衡型标注\n- 最高维度: {max_dimension} ({max_score})\n- 最低维度: {min_dimension} ({min_score})\n- 分差: {gap} ≥ 2，需说明: {explanation}\n{/if}\n\n---\n\n## 六、风险提示\n\n### 高风险项\n{#each risks.high}\n- {description}\n{/each}\n\n### 中风险项\n{#each risks.medium}\n- {description}\n{/each}\n\n### 建议验证点\n{#each risks.verify}\n- {action}\n{/each}\n\n---\n\n## 七、数据质量评估\n\n| 维度 | 评分(1-5) | 说明 |\n|------|-----------|------|\n| 简历完整度 | {score} | {note} |\n| 面试记录质量 | {score} | {note} |\n| 评估可信度 | {score} | {note} |\n\n---\n\n## 八、附录\n\n### 评估配置\n- 使用配置: {config_version}\n- 权重设置: {weights}\n\n### 评估时间线\n- 开始时间: {start_time}\n- 结束时间: {end_time}\n- 总耗时: {duration}\n```\n\n---\n\n## 模式C：面试认知复盘报告（v3.3 Pro 新增）\n\n```markdown\n# 面试认知复盘报告\n\n## 基本信息\n- 候选人ID: {candidate_id}\n- 面试日期: {interview_date}\n- 数据来源: {source_type}（飞书妙记转录 / 手动记录 / 面试官笔记）\n- 转录质量: {transcript_quality}（高/中/低）\n- 面试时长: {duration}\n- 分析时间: {timestamp}\n\n> ⚠️ 免责声明：本分析基于{source_type}文本，可能存在口语转写误差。所有矛盾和认知判断需结合面试官实际观察综合判断。\n\n---\n\n## 一、矛盾检测结果\n\n| # | 矛盾类型 | 描述 | 置信度 | 建议动作 |\n|---|---------|------|--------|---------|\n| 1 | {type} | {description} | 高/中/低 | {action} |\n\n### 矛盾统计\n- 高置信度矛盾: {high_count}（需追问验证）\n- 中置信度矛盾: {medium_count}（建议追问）\n- 低置信度矛盾: {low_count}（内部参考）\n- 总计: {total_count}\n\n---\n\n## 二、认知行为解析\n\n| 维度 | 状态 | 证据摘要 |\n|------|------|---------|\n| 问题拆解 | 持续出现/偶尔出现/未观察到/反向出现 | {evidence} |\n| 抽象能力 | 持续出现/偶尔出现/未观察到/反向出现 | {evidence} |\n| 逻辑一致性 | 持续出现/偶尔出现/未观察到/反向出现 | {evidence} |\n| 真实性纹理 | 持续出现/偶尔出现/未观察到/反向出现 | {evidence} |\n| 不确定性处理 | 持续出现/偶尔出现/未观察到/反向出现 | {evidence} |\n| 修正能力 | 持续出现/偶尔出现/未观察到/反向出现 | {evidence} |\n| Ownership | 持续出现/偶尔出现/未观察到/反向出现 | {evidence} |\n| AI协同 | 持续出现/偶尔出现/未观察到/反向出现 | {evidence} |\n\n---\n\n## 三、深挖追问建议\n\n基于矛盾引擎和认知解析发现，建议以下追问：\n\n### 追问 1：{topic}\n**触发原因**: {trigger}\n**问题**: \"{question}\"\n**期望深度**: 第{level}层（{level_name}）\n\n{#each follow_up_questions}\n### 追问 {index}：{topic}\n**触发原因**: {trigger}\n**问题**: \"{question}\"\n**期望深度**: 第{level}层（{level_name}）\n{/each}\n\n---\n\n## 四、认知画像\n\n| 维度 | 特征 | 证据 |\n|------|------|------|\n| 决策风格 | {style} | {evidence} |\n| 思维结构 | {structure} | {evidence} |\n| AI协同习惯 | {ai_pattern} | {evidence} |\n| 复杂度承载 | {complexity} | {evidence} |\n| Ownership | {ownership} | {evidence} |\n| 风险偏好 | {risk} | {evidence} |\n| 修正能力 | {correction} | {evidence} |\n| 真实性风险 | {authenticity} | {evidence} |\n\n### 画像可信度\n- 数据质量: {data_quality}\n- 可信度: {confidence}\n- 说明: {note}\n\n---\n\n## 五、与定级的关联（可选）\n\n> 认知复盘是六维度打分的辅助证据，不直接改变定级结果。\n\n| 认知发现 | 可能影响的定级维度 | 建议 |\n|---------|-------------------|------|\n| {finding} | {dimension} | {recommendation} |\n\n---\n\n## 六、总结\n\n**核心发现**: {key_finding}\n**最大风险**: {biggest_risk}\n**最大亮点**: {biggest_strength}\n**建议后续动作**: {next_steps}\n```\n\nFile v3.3.2:references/resume_audit.md\n\n# 简历漏洞穿透审计指南\n\n## 审计目标\n\n识别AI生成简历的致命弱点：AI善于构建宏大逻辑，但无法编造完全自洽的商业细节。本审计不是\"判断简历写得好不好\"，而是\"判断简历中有多少真实可信的细节\"。\n\n---\n\n## 审计指标1：高阶含金量审计\n\n### 目标\n横向对比商业常识，判断简历中声称的增幅/指标是否成立。\n\n### 检查项\n- [ ] 指标是否有行业对比基线？\n  - 例：\"用户增长300%\" → 同期行业平均多少？竞品多少？\n- [ ] 增幅是否符合产品生命周期规律？\n  - 例：成熟期产品声称\"月活增长200%\" → 高度可疑\n- [ ] 数据是否过于\"漂亮\"？\n  - 例：所有项目指标全部正向且幅度一致 → AI生成特征\n- [ ] 是否有失败的案例或负向数据？\n  - 真实工作必然有失败和妥协，全正向记录可疑\n\n### 判定标准\n- 有基线对比 + 有失败案例 → 低嫌疑\n- 有基线对比但无失败案例 → 中嫌疑\n- 无基线 + 全正向 → 高嫌疑\n\n---\n\n## 审计指标2：高势能低细节断层\n\n### 目标\n挑出\"框架完美但缺乏独特长尾细节\"的段落。AI擅长写出漂亮的结构，但无法编造只有亲身经历才有的\"长尾细节\"。\n\n### 检查项\n- [ ] 项目描述是否有\"只有做过才知道\"的细节？\n  - 例：\"因XX原因，选择了YY方案而非ZZ方案，过程中遇到AA问题，通过BB方法解决\"\n- [ ] 是否有独特的数据异常或意外发现？\n  - 例：\"原本以为是XX问题，深入后发现其实是YY，调整策略后...\"\n- [ ] 是否出现标准化模板语言？\n  - 例：\"负责xxx项目，使用xxx技术，取得xxx成果\" → 三段式模板\n- [ ] 技术选型是否有代价说明？\n  - 真实决策必有代价，\"用了A方案\"但没有\"牺牲了什么\" → 可疑\n\n### 判定标准\n- 有意外发现 + 有代价说明 → 低嫌疑\n- 有代价说明但无意外发现 → 中嫌疑\n- 三段式模板 + 无代价 → 高嫌疑\n\n---\n\n## 审计指标3：因果链断裂检测\n\n### 目标\n检查Action和Result是否漂亮，但Why和How语焉不详。\n\n### 检查项\n- [ ] 从\"做了什么\"到\"取得什么成果\"中间的逻辑是否自洽？\n  - 例：\"优化了数据库查询 → 营收增长50%\" → 因果链断裂\n- [ ] 是否有中间步骤的说明？\n  - 例：\"通过A方案解决B问题\" → 为什么是A？尝试过其他方案吗？\n- [ ] 结果是否超出合理预期？\n  - 例：一个前端优化带来\"业务转化率翻倍\" → 因果失当\n- [ ] 是否有他人协作的痕迹？\n  - 单枪匹马完成需要多角色协作的任务 → 可疑\n\n### 判定标准\n- 因果链完整 + 有协作痕迹 → 低嫌疑\n- 因果链部分缺失 → 中嫌疑\n- 因果链断裂 + 结果夸大 → 高嫌疑\n\n---\n\n## 审计指标4：AI生成痕迹识别\n\n### 目标\n识别AI写作的典型特征：宏大词藻、缺乏个人特质、标准化模板语言。\n\n### AI生成特征清单\n- [ ] 过度使用\"赋能\"\"驱动\"\"重构\"\"闭环\"\"抓手\"\"底层逻辑\"等词汇\n- [ ] \"通过AI技术大幅提升效率\" → 无具体技术名称\n- [ ] \"主导了从0到1的...\" → \"0到1\"是AI高频词组\n- [ ] \"实现了业务价值的最大化\" → 空洞的万能结尾句\n- [ ] 每段开头都是\"负责...\"\"主导...\"\"参与...\" → 高度模板化\n- [ ] 缺乏人称代词，描述像产品说明书而非个人经历\n- [ ] 技能列表\"精通Python、Java、C++、Go、Rust...\" → 全栈精通不现实\n\n### 判定标准\n- 无上述特征 → 低嫌疑\n- 1-3个特征 → 中嫌疑\n- 4个及以上 → 高嫌疑\n\n---\n\n## 审计指标5：逻辑一致性校验\n\n### 目标\n验证简历中时间线、职责范围、技术栈是否自洽。\n\n### 检查项\n- [ ] 时间线是否有重叠或空档？\n  - 例：2019年6月毕业但2019年3月开始全职工作\n- [ ] 职责范围与职级是否匹配？\n  - 例：工作2年声称\"主导公司技术架构重构\"\n- [ ] 技术栈时间线是否合理？\n  - 例：2018年使用GPT-4 → GPT-4于2023年发布\n- [ ] 项目规模与团队规模是否匹配？\n  - 例：3人团队声称\"支撑百万DAU\"\n- [ ] 多个项目之间的角色是否一致？\n  - 例：每个项目都是\"主导\"，没有任何执行角色\n\n### 判定标准\n- 全部自洽 → 低嫌疑\n- 1处不一致 → 中嫌疑\n- 2处及以上不一致 → 高嫌疑\n\n---\n\n## 综合审计结论\n\n| 高嫌疑指标数 | 结论 |\n|-------------|------|\n| 0-1 | 低嫌疑：简历真实度较高 |\n| 2-3 | 中嫌疑：建议重点验证 |\n| 4-5 | 高嫌疑：存在大量AI生成或夸大嫌疑 |\n\n---\n\n## 测谎面试题生成指南\n\n### 生成原则\n1. **追问细节而非结论**：问\"你是怎么做的\"而非\"你做了什么\"\n2. **追问边界条件**：问\"什么情况下会失败\"而非\"怎么成功的\"\n3. **要求还原决策过程**：问\"为什么选A不选B\"而非\"A是什么\"\n4. **追问意外和失败**：问\"遇到最大的坑是什么\"而非\"最大的成就\"\n5. **追问协作关系**：问\"你和谁一起做的，怎么分工\"而非\"团队有几个人\"\n\n### 题量建议\n- 低嫌疑：2-3题\n- 中嫌疑：4-5题\n- 高嫌疑：6-8题\n\n### 题型模板\n\n**类型A：细节追问**\n```\n在[项目X]中，你提到[某技术选型/某成果]。\n请描述：\n1. 当时有哪几个备选方案？为什么最终选择了这个？\n2. 实现过程中最大的技术挑战是什么？具体怎么解决的？\n3. 如果重新做一次，你会改变什么？\n```\n\n**类型B：边界条件**\n```\n关于[技术Y]，请描述：\n1. 在什么场景下它表现最好？什么场景下会失效？\n2. 你遇到过的最严重的线上问题是什么？排查过程是怎样的？\n3. 如果数据量/用户量扩大10倍，你设计的技术方案需要做什么调整？\n```\n\n**类型C：决策还原**\n```\n关于[成果Z]，请描述：\n1. 这个目标是怎么定出来的？为什么是这个数字？\n2. 推进过程中，有没有调整过方向？为什么？\n3. 团队内部有没有不同意见？你是怎么处理的？\n```\n\n**类型D：协作验证**\n```\n关于[项目W]，请描述：\n1. 你在团队中的具体角色和日常做什么？\n2. 和你协作最紧密的是谁？你们之间的工作界面是怎样的？\n3. 项目中哪个部分是你独立完成的，哪个部分需要依赖他人？\n```\n\nFile v3.3.2:skill-card.md\n\n## Description:\n\nEvaluates AI-role candidates from resumes, job descriptions, and interview records with resume audit findings, L1-L4 capability grading, contradiction analysis, and follow-up interview questions.\n\nThis skill is ready for commercial/non-commercial use.\n\n## Publisher:\n\n[tuobadaidai](https://clawhub.ai/user/tuobadaidai)\n\n### License/Terms of Use:\n\nMIT-0\n\n## Use Case:\n\nHiring teams and interviewers use this skill to review AI candidate materials, identify resume claims that need verification, grade AI-era capability levels, and generate interview follow-up questions.\n\n### Deployment Geography for Use:\n\nGlobal\n\n## Known Risks and Mitigations:\n\nRisk: The skill processes sensitive applicant materials and can save generated reports by default.\n\nMitigation: Use only with explicit permission to process applicant materials, keep candidate files and reports in a controlled directory, and delete reports according to the hiring-data retention policy.\n\nRisk: Dependency installation may introduce supply-chain exposure.\n\nMitigation: Install in a virtual environment and pin or review dependencies before use.\n\nRisk: Untrusted candidate IDs or output paths could cause reports to be written to unintended locations.\n\nMitigation: Avoid untrusted candidate IDs and output paths, and constrain generated reports to an approved working directory.\n\n## Reference(s):\n\n- [ClawHub skill page](https://clawhub.ai/tuobadaidai/skills/ai-talent-grader)\n- [L1-L4 behavioral anchors](references/behavioral_anchors.md)\n- [Scoring calibration cases](references/calibration-cases.md)\n- [Cognitive review engine](references/cognitive_review.md)\n- [Evaluation matrices](references/evaluation_matrices.md)\n- [Interview modules](references/interview_modules.md)\n- [Output templates](references/output_templates.md)\n- [Resume audit guide](references/resume_audit.md)\n\n## Skill Output:\n\n**Output Type(s):** [Text, Markdown, JSON, Guidance]\n\n**Output Format:** [Markdown reports, optional JSON summaries, candidate grading tables, and interview follow-up guidance]\n\n**Output Parameters:** [1D]\n\n**Other Properties Related to Output:** [Supports resume-only audits, full resume-plus-interview grading, cognitive interview review, batch summaries, and configurable evaluation weights.]\n\n## Skill Version(s):\n\n3.3.2 (source: ClawHub release evidence; bundled artifact metadata reports 3.3.1)\n\n## Ethical Considerations:\n\nUsers should evaluate whether this skill is appropriate for their environment, review any generated or modified files before relying on them, and apply their organization's safety, security, and compliance requirements before deployment.\n\nFile v3.3.2:config/evaluation_config.yaml\n\n# AI人才定级 - 评估配置\n\n# 权重配置（各维度在评估中的重要性）\nweights:\n  ai_fluency: 1.0\n  human_ai_judgment: 1.2\n  architecture_design: 1.5\n  hybrid_orchestration: 1.1\n  cognitive_depth: 1.3\n  problem_modeling: 1.4\n\n# 级别阈值\nlevel_thresholds:\n  l1: 4.0   # 4-7\n  l2: 8.0   # 8-11\n  l3: 12.0  # 12-14\n  l4: 15.0  # 15-16\n\n# 环境复杂度系数\nenvironment_complexity:\n  low:\n    coefficient: 0.7\n    description: \"个人项目/小型团队\"\n    examples:\n      - \"个人开发者\"\n      - \"小型创业项目\"\n      - \"非技术密集型行业\"\n  medium:\n    coefficient: 1.0\n    description: \"中等规模公司/技术团队\"\n    examples:\n      - \"A/B轮创业公司\"\n      - \"中型技术团队\"\n      - \"传统企业数字化转型\"\n  high:\n    coefficient: 1.2\n    description: \"大型企业/高复杂度环境\"\n    examples:\n      - \"上市互联网公司\"\n      - \"金融/医疗等受监管行业\"\n      - \"万人以上组织\"\n\n# 个人杠杆率系数\npersonal_leverage:\n  low:\n    coefficient: 0.7\n    description: \"模块执行者\"\n    indicators:\n      - \"在明确框架下完成分配任务\"\n      - \"决策权有限\"\n      - \"影响范围在团队内\"\n  medium:\n    coefficient: 1.0\n    description: \"项目Owner\"\n    indicators:\n      - \"主导单个项目或模块\"\n      - \"有技术选型权\"\n      - \"影响范围跨团队\"\n  high:\n    coefficient: 1.3\n    description: \"一人AI部门/全栈架构师\"\n    indicators:\n      - \"从0到1设计业务流程\"\n      - \"跨部门资源协调\"\n      - \"影响范围达组织级\"\n\n# 成长速度调整\ngrowth_speed:\n  high:\n    adjustment: 0.5\n    criteria:\n      - \"开源贡献/技术博客/内部分享\"\n      - \"跨2-3个技术栈迁移\"\n      - \"持续实验，多个落地项目\"\n  medium:\n    adjustment: 0\n    criteria:\n      - \"主动学习但无输出\"\n      - \"熟悉1-2个技术栈\"\n      - \"有1-2个实验项目\"\n  low:\n    adjustment: -0.5\n    criteria:\n      - \"被动学习\"\n      - \"只会一个技术栈\"\n      - \"无自驱实验\"\n\n# 认知深度检查项（每个维度打分前必须过）\ncognitive_depth_checks:\n  - \"为什么选这个方案（Why）\"\n  - \"知不知道tradeoff（Trade-off）\"\n  - \"出问题怎么debug（Debug）\"\n  - \"理解底层机制吗（Fundamentals）\"\n\n# 认知深度与得分上限\ncognitive_depth_limits:\n  surface_use:\n    level: \"L1\"\n    description: \"知道工具怎么用，不知道为什么\"\n    max_score: 1\n  know_what:\n    level: \"L2\"\n    description: \"能调参优化，但不理解底层\"\n    max_score: 2\n  know_why:\n    level: \"L3\"\n    description: \"理解tradeoff，能debug，知道底层机制\"\n    max_score: 3\n  systematic:\n    level: \"L4\"\n    description: \"能解释整个技术栈tradeoff，能指导他人\"\n    max_score: 4\n\n# 批判性审查规则\ncritical_review:\n  red_flags:\n    - signal: \"量化指标无基线\"\n      action: \"降级处理，标注存疑\"\n    - signal: \"声称\"主导\"但无团队规模\"\n      action: \"降权为\"参与\"\"\n    - signal: \"技术栈堆砌无深度案例\"\n      action: \"按L1-L2处理\"\n    - signal: \"短时间内声称架构级贡献\"\n      action: \"标注\"需验证真实贡献度\"\"\n    - signal: \"个人项目混入生产经验\"\n      action: \"单独标注，降权\"\n\n# 打分纪律\nscoring_discipline:\n  - \"单维度最高给3分，除非有极强组织级影响力证据\"\n  - \"L4极稀缺，候选人有亮点≠L4\"\n  - \"双乘数加权必须执行，缺一不可\"\n  - \"认知深度检查是必经步骤\"\n  - \"简历审计是必经步骤：不经过漏洞穿透审计，不得打分\"\n\n# 非均衡型判定\nnon_balanced_rules:\n  potential:\n    condition: \"综合L{n}，但某一维度达到L{n+1}+\"\n    action: \"标注\"潜力型：{维度名}突出\"\"\n  weakness:\n    condition: \"综合L{n}，但某一维度为L{n-1}或更低\"\n    action: \"标注\"短板型：{维度名}薄弱\"\"\n  l4_constraint:\n    condition: \"候选达到L4但架构设计力<3或人机判断力<3\"\n    action: \"降为L3，注明原因\"\n\n# 文件解析配置\nfile_parser:\n  supported_formats:\n    - \".pdf\"\n    - \".docx\"\n    - \".txt\"\n    - \".md\"\n    - \".json\"\n    - \".yaml\"\n    - \".yml\"\n  max_file_size_mb: 20\n  encoding: \"utf-8\"\n  fallback_encoding: \"gbk\"\n\n# 批量处理配置\nbatch_processing:\n  max_parallel: 5\n  timeout_seconds: 300\n  retry_count: 2\n\n# 输出配置\noutput:\n  formats:\n    - \"markdown\"\n    - \"json\"\n    - \"excel\"\n  include_debug_info: false\n  anonymize_candidate: true\n  default_language: \"zh-CN\"\n\n# v3.3 Pro — 认知复盘配置\ncognitive_review:\n  # 矛盾检测引擎配置\n  contradiction_engine:\n    confidence_levels:\n      high:\n        description: \"明确的时间/数据冲突，需追问验证\"\n        action: \"标记为高优先级，建议面试官追问\"\n      medium:\n        description: \"角色/逻辑不一致，可能有合理解释\"\n        action: \"标注存疑，建议但不强制追问\"\n      low:\n        description: \"决策模糊/过度光滑，可能是正常现象\"\n        action: \"仅内部记录，不主动暴露\"\n    \n    contradiction_types:\n      - \"时间矛盾\"\n      - \"数据矛盾\"\n      - \"角色矛盾\"\n      - \"逻辑跳跃\"\n      - \"决策模糊\"\n      - \"过度光滑\"\n    \n    false_positive_filters:\n      - \"口语转写失真不计为矛盾\"\n      - \"记忆模糊≠说谎\"\n      - \"不同粒度的描述≠矛盾\"\n      - \"每条矛盾必须带置信度+免责声明\"\n  \n  # 认知解析维度\n  cognitive_dimensions:\n    - name: \"问题拆解\"\n      description: \"接到需求后如何结构化\"\n      signals:\n        positive: \"先问边界→拆子问题→排序\"\n        negative: \"直接跳答案/复述需求\"\n    - name: \"抽象能力\"\n      description: \"能否从具体案例提炼本质\"\n      signals:\n        positive: \"\\\"核心矛盾是X\\\"/\\\"本质上是Y问题\\\"\"\n        negative: \"只讲细节不提规律\"\n    - name: \"逻辑一致性\"\n      description: \"前后论述是否自洽\"\n      signals:\n        positive: \"论点→论据→结论链条完整\"\n        negative: \"前后立场漂移无解释\"\n    - name: \"真实性纹理\"\n      description: \"是否存在真实细节\"\n      signals:\n        positive: \"提到了意外/bug/临时妥协\"\n        negative: \"所有描述都是最佳实践\"\n    - name: \"不确定性处理\"\n      description: \"面对未知的反应\"\n      signals:\n        positive: \"坦诚\\\"这个我不确定，但我的推测是...\\\"\"\n        negative: \"硬编答案/含糊其辞\"\n    - name: \"修正能力\"\n      description: \"被challenge后如何调整\"\n      signals:\n        positive: \"接受质疑→重新思考→给出新视角\"\n        negative: \"防御性反驳/死不承认\"\n    - name: \"Ownership\"\n      description: \"是否主动推进问题\"\n      signals:\n        positive: \"\\\"后来我发现还有一个问题...\\\"\"\n        negative: \"等面试官问才说\"\n    - name: \"AI协同\"\n      description: \"如何描述AI使用过程\"\n      signals:\n        positive: \"提到了prompt迭代/失败尝试/边界判断\"\n        negative: \"笼统说\\\"用AI辅助\\\"\"\n  \n  # 追问深度评估\n  drill_depth:\n    level_1:\n      name: \"表层\"\n      description: \"复述/美化既有叙述\"\n      assessment: \"未穿透\"\n    level_2:\n      name: \"细节\"\n      description: \"能补充具体细节和数字\"\n      assessment: \"初步验证\"\n    level_3:\n      name: \"反思\"\n      description: \"承认不足、复盘决策过程\"\n      assessment: \"真实能力暴露\"\n    level_4:\n      name: \"重构\"\n      description: \"推翻原有叙述，给出新视角\"\n      assessment: \"高阶认知能力\"\n  \n  # 认知画像可信度\n  portrait_confidence:\n    high:\n      min_duration_minutes: 30\n      source: \"完整面试转录\"\n      usage: \"可直接用于定级辅助\"\n    medium:\n      min_duration_minutes: 15\n      source: \"面试记录\"\n      usage: \"建议补充更多信息\"\n    low:\n      min_duration_minutes: 0\n      source: \"简要笔记\"\n      usage: \"仅做参考，不做强推断\"\n\nArchive v3.3.1: 21 files, 65819 bytes\n\nFiles: config/evaluation_config.yaml (7994b), install.sh (3044b), main.py (19868b), modules/evaluation_engine.py (10829b), modules/file_parser.py (7797b), modules/interview_analyzer.py (6580b), modules/report_generator.py (12935b), modules/resume_audit.py (14356b), README.md (4676b), references/behavioral_anchors.md (7995b), references/calibration-cases.md (4463b), references/cognitive_review.md (7448b), references/evaluation_matrices.md (7385b), references/interview_modules.md (5503b), references/output_templates.md (8421b), references/resume_audit.md (6305b), requirements.txt (159b), run.py (9754b), skill-card.md (2532b), SKILL.md (15590b), _meta.json (135b)\n\nFile v3.3.1:SKILL.md\n\n---\nname: ai-talent-grader\nversion: 3.3.1\nlabel: AI人才定级专家\ndescription: >\n  基于简历、面试记录和JD，对候选人进行AI时代能力定级（L1-L4）。\n  核心能力：简历漏洞穿透审计、六维度评分卡、双乘数加权、测谎面试题生成、评分一致性校准、\n  面试认知复盘（v3.3 Pro 新增）。v3.3 从\"简历打分器\"升级为\"认知行为分析系统\"，\n  评估候选人如何思考、如何应对不确定性、如何与AI协同。\n  Use when user asks to 评估候选人AI能力、AI人才定级、面试复盘、认知分析、测谎面试、\n  生成追问建议、候选人能力分级、L1到L4定级、AI岗位适配度评估、看简历、简历审计、\n  面试完帮我打分.\n  不适用于绩效评估、晋升评审、员工培训需求分析或非AI相关的能力评估.\n---\n\n# AI 人才定级专家\n\n## 概述\n\n专业的 AI 人才定级评估专家。不再做\"简历打分器\"，而是做**简历审计师 + 测谎面试题生成器** + **认知行为分析师**（v3.3 Pro）。\n\n> **为什么从简历打分升级为认知分析？** AI 很容易生成好答案，但很难长期伪造真实思维轨迹。评估候选人\"如何思考、如何应对不确定性、如何修正错误\"比评估\"候选人说了什么\"更有区分度。\n\n## v3.2 变更日志（2026-05-22）\n\n- **统一评分标准**：全系统只认\"平均分×4→综合得分→查表\"一条路径\n- **行为锚点升级**：每个级别加\"充要条件\"条目，替代\"典型行为描述\"\n- **校准案例库**：新增 5 个参考案例（A-L1/B-L2/C-L3/D-边界L2-3/E-边界L3-4）\n- **评分一致性检验**：综合得分≥13或≤7时自动触发置信度说明，维度分差≥2时标注非均衡型\n- **修复反模式**：`_infer_dimension_scores` 不再基于技能数量/经验年限自动打分\n\n## v3.3 Pro 变更日志（2026-05-25）\n\n- **认知复盘引擎**：从\"评估候选人说了什么\"升级为\"评估候选人如何思考\"\n- **矛盾检测引擎**：自动检测时间/数据/角色/逻辑矛盾，标注置信度\n- **认知解析层**：8维度认知行为解析（问题拆解/抽象能力/逻辑一致性/真实性纹理/不确定性处理/修正能力/Ownership/AI协同）\n- **深挖追问 Agent**：基于矛盾发现动态生成追问，4层深度评估\n- **认知画像输出**：能力拓扑图替代综合评分，输出决策风格/思维结构/AI协同习惯\n\n---\n\n## 触发场景\n\n用户上传简历文件、面试评价记录或提出AI人才评估需求时自动触发。支持以下场景：\n\n| 场景 | 输入 | 输出 | 模式 |\n|------|------|------|------|\n| 仅简历评估 | 一份简历 | 审计报告 + 测谎面试题 | A |\n| 完整定级 | 简历 + 面试记录 | 完整定级报告（含六维度评分和级别） | B |\n| **面试认知复盘** | **面试记录/妙记转录** | **矛盾清单 + 认知画像 + 追问建议** | **C（v3.3 Pro）** |\n| 批量评估 | 多个候选人文件 | 对比分析汇总 | A/B |\n| 面试方案设计 | 上传岗位要求 | 生成面试方案和题库 | D |\n\n### 复杂度路由\n\n| 用户场景 | 复杂度 | 处理路径 |\n|---------|--------|---------|\n| \"评估这份简历\" | S 级 | 简历审计 → 漏洞识别 → 生成测谎面试题（Mode A） |\n| \"面试完帮我定级\" | A 级 | 简历审计 + 面试交叉验证 → 六维度打分 + 双乘数加权 → 完整报告（Mode B） |\n| **\"面试复盘/分析候选人思维\"** | **A+ 级** | **矛盾检测 → 认知解析 → 深挖追问生成 → 认知画像（Mode C，v3.3 Pro）** |\n| \"设计 AI 人才面试方案\" | B 级 | 读取 interview-modules.md → 生成题库 + 评分表 + 微案例（Mode D） |\n\n---\n\n## 核心架构\n\n### 输入模块\n- 支持格式：PDF、DOCX、TXT、JSON、YAML、Markdown\n- 自动识别文件类型并解析\n- 提取关键结构化信息\n\n### 评估引擎\n\n1. **简历漏洞穿透审计**（5项指标，详见 `references/resume_audit.md`）\n   - 高阶含金量审计\n   - 高势能低细节断层\n   - 因果链断裂检测\n   - AI生成痕迹识别\n   - 逻辑一致性校验\n\n2. **面试交叉验证**\n   - 测谎题覆盖度检查\n   - 疑点确认/排除标注\n   - \"待验证\"项标记\n\n3. **六维度AI能力评估**（每个维度 1-4 分，详见 `references/behavioral_anchors.md`）\n   - AI流利度\n   - 人机判断力\n   - 架构设计力\n   - 混合编排力\n   - 认知深度\n   - 问题建模能力\n\n4. **双乘数加权**\n   ```\n   最终能力 = 能力平均分 × 环境复杂度 × 个人杠杆率\n   ```\n   - 环境复杂度：低 ×0.7 / 中 ×1.0 / 高 ×1.2\n   - 个人杠杆率：低 ×0.7 / 中 ×1.0 / 高 ×1.3\n\n5. **成长速度调整**\n   - 高成长 +0.5 / 中不调整 / 低成长 -0.5\n\n6. **级别判定（唯一评分标准 v3.2）**\n\n   六维度各 1-4 分，先算**能力平均分**（1-4 分制），再**乘以 4**得到**综合得分**（4-16 分制）：\n\n   ```\n   能力平均分 = (AI流利度 + 人机判断力 + 架构设计力 + 混合编排力 + 认知深度 + 问题建模能力) / 6\n   综合得分 = 能力平均分 × 4\n   ```\n\n   | 综合得分（满分 16） | 能力平均分 | 级别 |\n   |---------------------|-----------|------|\n   | 4-7 | 1.00-1.75 | L1 · AI 工具使用者 |\n   | 8-11 | 1.76-2.75 | L2 · AI 协作者 |\n   | 12-14 | 2.76-3.50 | L3 · AI 架构者 |\n   | 15-16 | 3.51-4.00 | L4 · AI 战略者 |\n\n   > **铁律：全系统只认这一套分数映射。任何文件出现其他映射标准均为废弃。**\n\n7. **评分一致性检验（v3.2 新增）**\n   - **综合得分 ≥13 或 ≤7**：必须在报告中输出\"置信度说明\"\n   - **单维度分差 ≥2**（如 AI 流利度 L4 但人机判断力 L2）：必须标注\"非均衡型\"并解释\n   - **证据不足的维度**：标注\"信心不足\"并要求补充信息，不得强行打分\n   - **边界候选人**：对标 `references/calibration-cases.md` 中的参考案例\n\n### 模式 C：面试认知复盘（v3.3 Pro 新增）\n\n> 核心思想：不评估\"候选人说了什么\"，评估\"候选人如何思考\"。详见 `references/cognitive_review.md`\n\n**确认门**：\n- 如果同时有简历 + 面试记录 → 问用户\"是否同时输出定级报告（Mode B）？还是只做认知复盘？\"\n- 如果只有面试记录 → 直接输出认知复盘报告\n- 如果只有简历 → 降级为 Mode A，并在报告中说明原因\n\n**流程**：\n\n1. **矛盾检测引擎** → 扫描面试记录，自动识别 6 类矛盾（时间/数据/角色/逻辑/决策/过度光滑），每条标注置信度（高/中/低）\n2. **认知解析层** → 8 维度行为解析（问题拆解/抽象能力/逻辑一致性/真实性纹理/不确定性处理/修正能力/Ownership/AI协同），按\"持续出现/偶尔出现/未观察到/反向出现\"标注\n3. **深挖追问 Agent** → 基于矛盾和认知发现，动态生成 3-5 条追问建议，附 4 层深度评估模板（表层→细节→反思→重构）\n4. **认知画像输出** → 能力拓扑图（决策风格/思维结构/AI协同习惯/复杂度承载/Ownership/风险偏好/修正能力/真实性风险）\n\n**示例（Mode C 端到端）**：\n\n输入：\n```\n面试官：你做过最复杂的项目是什么？\n候选人：去年我主导了一个AI客服系统，把人工客服效率提升了300%。\n面试官：具体怎么做的？\n候选人：就是用了大模型，微调了一下，效果很好。\n面试官：遇到过什么困难？\n候选人：没什么大困难，团队配合得很好。\n```\n\n输出：\n```\n矛盾检测：\n- [高置信度] 过度光滑：全程无失败/挫折描述（\"没什么大困难\"）\n- [中置信度] 决策模糊：\"微调了一下\"无 tradeoff 说明（基座模型？参数？数据量？）\n- [中置信度] 数据矛盾：\"提升300%\"无基线数据（从多少到多少？怎么测的？）\n\n认知解析：\n- 抽象能力：未观察到（只讲结果，未提炼本质问题）\n- 真实性纹理：反向出现（\"没什么大困难\"与\"最复杂的项目\"矛盾）\n- AI协同：未观察到（\"用了大模型，微调了一下\"过于笼统）\n\n追问建议：\n1. \"300%提升具体从多少到多少？用什么指标衡量的？\"\n2. \"微调过程中遇到的最大意外是什么？你怎么解决的？\"\n3. \"当时有没有考虑过不微调、直接用 API 的方案？为什么排除？\"\n```\n\n**防误报铁律**：\n- 口语转写失真不计为矛盾\n- 记忆模糊≠说谎\n- 每条矛盾必须标注置信度 + \"可能是转写/记忆误差\"免责声明\n- 认知画像是定级的**辅助证据**，不能替代六维度打分\n- 输出是\"建议\"不是\"结论\"，最终判断由面试官做出\n\n---\n\n## 行为锚点升级说明（v3.2）\n\n`references/behavioral_anchors.md` 中每个级别的描述已升级为**充要条件**，不是示例。\n\n**关键规则**：\n- 达到该级别 → 必须满足该级别的所有\"必须满足\"条目\n- 仅满足行为描述但不满足充要条件 → 不得给到该级别\n- \"使用Copilot写代码\" → 如果没有 prompt 迭代/输出审校证据 → **只能是 L1**\n- \"通过调整prompt模板\" = \"迭代优化prompt\" → 语义相同，应判同一级别\n\n**边界模糊处理**：\n- 优先看**量化证据**（\"提升到85%\" > \"有提升\"）\n- 优先看**反思/复盘证据**（\"总结了X教训\" > \"做了X\"）\n- 都没有 → **往低级别打**\n\n---\n\n## 参考案例校准（v3.2 新增）\n\n评估边界候选人时，必须参考 `references/calibration-cases.md` 中的 5 个校准案例：\n- 案例 A：明确 L1\n- 案例 B：明确 L2\n- 案例 C：明确 L3\n- 案例 D：边界 L2/L3\n- 案例 E：边界 L3/L4\n\n**不同实例对同一参考案例应输出完全一致的定级结果。**\n\n---\n\n## 防幻觉铁律（P0）\n\n| 规则 | 说明 |\n|------|------|\n| 禁止脑补姓名/公司/职位 | 未提供时用\"候选人A/B\"或\"[未提供]\"标注 |\n| 禁止捏造数据/指标 | 没有具体数字就标注\"未提及\" |\n| 禁止虚构经历/项目 | \"使用AI工具\" ≠ \"主导AI项目\" |\n| 禁止过度推断 | \"参与\" ≠ \"主导\"，\"使用\" ≠ \"精通\" |\n| 不确定性必须标注 | 无法确认的判断必须在报告中明确标注 |\n\n**违反以上任意一条 = 本次评估无效。**\n\n## 冲突处理优先级\n\n> 实测表现 > 面试口述 > 简历描述\n\n## 非均衡型候选人判定\n\n| 情况 | 处理 |\n|------|------|\n| 综合L2，但某一维度L3+ | 标注\"潜力型：{维度名}突出\" |\n| 综合L3，但某一维度L1 | 标注\"短板型：{维度名}薄弱\" |\n| L4候选 | 必须架构设计力≥3且人机判断力≥3，否则降为L3 |\n\n## 打分纪律\n\n- 单维度最高给 3 分，除非有极强组织级影响力证据\n- L4 极稀缺（架构设计力≥3 且人机判断力≥3），候选人有亮点 ≠ L4\n- 双乘数加权必须执行，缺一不可\n- 认知深度检查是必经步骤\n- 简历审计是必经步骤：不经过漏洞穿透审计，不得打分\n\n## 已知坑点\n\n1. 工具数量 ≠ 能力，看怎么用\n2. \"使用AI辅助\"是废话，除非有具体案例\n3. 面试记录只有结论没过程 → 降权\n4. 信息不足就标注不足，不脑补\n5. 验证通过≠高分：做了某事≠做得好\n6. 项目Owner≠架构师：大公司\"主导\"可能是执行层面的\n7. 表达≠协同：口头啰嗦不代表落地能力差\n8. 复杂度×杠杆率才是真实含金量\n9. 做过≠真懂：必须过认知深度4项检查\n10. 杠杆率是隐藏因子：大厂执行者可能加权更低\n11. 问题建模是最稀缺能力：模糊需求→AI系统\n12. 年限是参考不是铁律：2年高成长可破格\n13. AI简历有致命弱点：善于宏大叙事但无法编造完全自洽的商业细节\n14. 高势能低细节是红旗：框架完美但缺乏独特长尾细节→AI生成嫌疑极高\n15. AI应该做侦探不做判卷老师：核心输出是测谎面试题，不是简历打分\n16. **v3.2 统一评分标准**：全系统只认\"平均分→×4→综合得分→查表\"一条路径，其他分数映射均为废弃\n17. **行为锚点=充要条件**：不是示例，是必须满足的最低标准\n18. **边界候选人必须对标参考案例**：不能凭感觉打\n19. **自动推断得分仅供参考**：`_infer_dimension_scores` 仅做基础兜底，用户应手动通过 `--scores` 指定维度得分\n20. **v3.3 认知复盘不替代定级**：认知画像是辅助证据，六维度打分才是定级依据\n21. **飞书妙记转录质量影响分析**：口语断句/同音词可能导致矛盾引擎误报，需标注置信度\n22. **认知模式≠能力分数**：\"这个人遇到challenge总是防御\"比\"修正能力=2.5分\"有价值得多\n23. **Mode C 降级路径**：用户要求认知复盘但只有简历（无面试记录）→ 降级为 Mode A（简历审计 + 测谎面试题），并在报告中说明\"认知复盘需要面试过程数据，当前仅做简历审计\"\n\n---\n\n## 部署已知坑点\n\n### ClawHub 发布\n- **CLI `hermes skills publish --to clawhub` 尚未支持实际发布**，会返回 \"ClawHub publishing is not yet supported. Submit manually at https://clawhub.ai/submit\"\n- **当前发布方式**：打包 ZIP 后手动提交到 https://clawhub.ai/submit\n- **版本一致性**：publish 前确认 SKILL.md frontmatter 的 `version` 与实际一致（ClawHub 版本一致性铁律）\n\n### ClawHub 供应链扫描\n- 扫描器会把**任何字符串中的 `pip install`** 标记为 MEDIUM supply_chain 风险，包括：\n  - `install.sh` 中的 `echo \"安装: pip install xxx\"` \n  - `file_parser.py` 中的 `raise ImportError(\"需要安装xxx: pip install xxx\")`\n- **修复方式**：改写措辞，如 `\"请使用 pip 安装 xxx\"` 或 `\"缺少 xxx 依赖\"`\n- 扫描 verdict 达到 CAUTION 且为 community source 时会 BLOCKED，需 `--yolo` 绕过或修复\n\n---\n\n## 程序化使用（CLI）\n\n```bash\n# 单次评估（仅简历）\npython main.py audit --resume 简历.pdf\n\n# 完整定级（简历 + 面试）\npython main.py evaluate --resume 简历.pdf --interview 面试记录.txt\n\n# 指定公司背景\npython main.py evaluate --resume 简历.pdf --interview 面试记录.txt \\\n    --env high --leverage high --growth high\n\n# 面试认知复盘（v3.3 Pro 新增）\npython main.py cognitive-review --interview 妙记转录.txt\n\n# 面试认知复盘 + 附带简历做交叉验证\npython main.py cognitive-review --interview 妙记转录.txt --resume 简历.pdf\n\n# 批量处理\npython main.py batch --input-dir candidates/ --output-dir reports/\n\n# 指定维度得分（推荐）\npython main.py evaluate --resume 简历.pdf --interview 面试记录.txt \\\n    --scores scores.json\n```\n\nscores.json 格式：\n```json\n{\n  \"ai_fluency\": 3.0,\n  \"human_ai_judgment\": 2.5,\n  \"architecture_design\": 3.0,\n  \"hybrid_orchestration\": 3.0,\n  \"cognitive_depth\": 2.5,\n  \"problem_modeling\": 3.0\n}\n```\n\n---\n\n## 参考文件\n\n| 文件 | 说明 |\n|------|------|\n| `references/resume_audit.md` | 简历漏洞穿透审计详细指南 |\n| `references/behavioral_anchors.md` | L1-L4 每个维度的行为锚点（v3.2 充要条件版） |\n| `references/evaluation_matrices.md` | 完整评估矩阵（复杂度/杠杆率/认知深度/问题建模/成长速度） |\n| `references/interview_modules.md` | 四模块面试题库 + 评分细则 |\n| `references/output_templates.md` | 定级报告标准输出模板 |\n| `references/calibration-cases.md` | **评分一致性校准案例库**（v3.2 新增） |\n| `references/cognitive_review.md` | **面试认知复盘引擎**（v3.3 Pro 新增）— 矛盾检测/认知解析/深挖追问/认知画像 |\n\nFile v3.3.1:README.md\n\n# AI人才定级专家 - ClawHub Skill\n\n## 概述\n这是一个专为 ClawHub 平台设计的 AI 人才定级评估 skill。用户上传简历和面试评价后，自动执行一站式评估，输出结构化定级报告。\n\n**核心定位**：简历审计师 + 测谎面试题生成器\n\n## 使用方式\n1. 在 ClawHub 平台导入此 skill\n2. 上传简历文件（PDF/DOCX/TXT/MD/JSON/YAML）\n3. （可选）上传面试记录文件\n4. 系统自动执行评估并输出报告\n\n## 核心功能\n- **简历漏洞穿透审计**：5项指标检测AI简历的致命弱点\n- **六维度AI能力评估**：全面评估候选人能力\n- **双乘数加权系统**：考虑环境复杂度和个人杠杆率\n- **成长速度评估**：年限软约束，重视成长潜力\n- **测谎面试题生成**：为HR定制验证性问题\n- **防幻觉铁律**：严格遵守P0规则，避免AI幻觉\n\n## 评估流程\n\n### 模式A：仅简历审计\n1. 简历漏洞穿透审计（5项指标）\n2. 生成定制化测谎面试题\n3. 输出审计报告\n\n### 模式B：完整定级\n1. 简历漏洞穿透审计\n2. 面试交叉验证\n3. 六维度AI能力打分\n4. 双乘数加权计算\n5. 成长速度调整\n6. 级别判定\n7. 输出完整报告\n\n## 输出示例\n\n### 仅简历审计报告\n```markdown\n# AI人才简历审计报告\n\n## 基本信息\n- 评估时间: 2024-01-15 14:30:00\n- 候选人: CAND001\n- 审计模式: 仅简历审计\n- 数据来源: resume.pdf\n\n## 一、简历漏洞穿透审计\n### 1.1 高阶含金量审计\n- 疑点: 声称增长200%但无行业基线对比\n- 结论: 中嫌疑\n\n### 1.2 高势能低细节断层\n- 断层: 项目描述框架完美但缺乏独特长尾细节\n- 建议追问: 请描述实现过程中的具体技术挑战\n\n## 二、综合审计结论\n| 指标 | 结果 |\n|------|------|\n| 高阶含金量 | 中嫌疑 |\n| 细节断层 | 高嫌疑 |\n| 因果链 | 低嫌疑 |\n| AI痕迹 | 中嫌疑 |\n| 逻辑一致性 | 低嫌疑 |\n| **综合结论** | **中嫌疑** |\n| 审计可信度 | 85% |\n\n## 三、定制化测谎面试题\n### 追问1（细节追问）\n> 在项目X中，你提到使用了Y技术。请描述当时有哪几个备选方案？为什么最终选择了这个？\n\n### 追问2（边界条件）\n> 关于技术Y，在什么场景下它表现最好？什么场景下会失效？\n\n### 追问3（决策还原）\n> 关于成果Z，这个目标是怎么定出来的？为什么是这个数字？\n```\n\n### 完整定级报告\n```markdown\n# AI人才完整定级报告\n\n## 基本信息\n- 候选人ID: CAND001\n- 评估时间: 2024-01-15 14:30:00\n- 数据来源: resume.pdf, interview.txt\n- 评估模式: 完整定级\n\n## 一、简历审计结果\n- 审计结论: 中嫌疑\n- 高嫌疑指标: 2项\n- 中嫌疑指标: 3项\n\n## 二、面试交叉验证\n| 状态 | 数量 |\n|------|------|\n| 已确认（存疑） | 1 |\n| 已排除 | 2 |\n| 待验证 | 3 |\n| 未覆盖 | 1 |\n\n## 三、六维度评估\n| 维度 | 得分(1-4) | 认知层级 |\n|------|-----------|---------|\n| AI流利度 | 3 | L3 |\n| 人机判断力 | 2 | L2 |\n| 架构设计力 | 3 | L3 |\n| 混合编排力 | 2 | L2 |\n| 认知深度 | 3 | L3 |\n| 问题建模能力 | 2 | L2 |\n\n**能力平均分**: 2.5\n\n## 四、加权计算\n| 因子 | 等级 | 系数/调整 |\n|------|------|----------|\n| 环境复杂度 | 中 | ×1.0 |\n| 个人杠杆率 | 高 | ×1.3 |\n| 成长速度 | 中 | 0 |\n\n**加权后得分**: (2.5 × 1.0 × 1.3) × 4 = 13.0\n\n## 五、定级结果\n| 项目 | 内容 |\n|------|------|\n| **最终级别** | **L3** |\n| 级别名称 | AI架构者 |\n| P序列参考 | P6-P7 |\n| 级别定义 | 设计AI驱动的业务流程，评估ROI |\n\n## 六、风险提示\n### 高风险项\n- 项目细节不足，需进一步验证\n- 部分技术描述存在标准化模板语言\n\n### 建议验证点\n- 实际项目经验\n- 技术决策过程\n```\n\n## 文件说明\n- `SKILL.md` - 完整的skill定义，包含所有评估逻辑和规则\n- `README.md` - 使用说明文档\n- `main.py` - 示例程序（可选）\n- `config/` - 配置文件目录\n- `modules/` - 模块化代码目录\n- `references/` - 参考文档目录\n\n## 技术特点\n1. **防幻觉设计**：严格遵守P0规则，禁止脑补、捏造、过度推断\n2. **可解释性**：每个评估步骤都有明确依据\n3. **可配置**：支持环境参数、权重调整\n4. **可扩展**：模块化设计，易于添加新评估维度\n\n## 注意事项\n1. 评估结果基于所提供材料，建议结合面试验证\n2. 环境参数（复杂度/杠杆率）可从简历中推断，但用户提供更准确\n3. L4级别极稀缺，需严格满足硬性门槛\n4. 测谎面试题是核心输出，建议在后续面试中使用\n\n## 许可证\nMIT License\n\nFile v3.3.1:_meta.json\n\n{\n  \"ownerId\": \"kn70tx725606ywwb5gfj0vpxjx83admr\",\n  \"slug\": \"ai-talent-grader\",\n  \"version\": \"3.3.1\",\n  \"publishedAt\": 1779687398422\n}\n\nFile v3.3.1:references/behavioral_anchors.md\n\n# L1-L4 行为锚点（v3.2 充要条件版）\n\n> **v3.2 关键升级：以下\"必须满足\"是达到该级别的充要条件，不是示例。达到该级别 → 必须满足该级别的所有\"必须满足\"条目。**\n\n## 级别总览\n\n| 级别 | 名称 | 一句话定义 | P序列参考 |\n|------|------|-----------|----------|\n| L1 | AI工具使用者 | 能用工具完成指定任务 | P1-P3 |\n| L2 | AI协作者 | 能审校输出、识别幻觉 | P4-P5 |\n| L3 | AI架构者 | 设计AI驱动的业务流程，评估ROI | P6-P7 |\n| L4 | AI战略者 | 定义AI与业务边界，规划组织演进 | P8+ |\n\n---\n\n## 维度一：AI流利度\n\n### L1 · AI工具使用者\n\n**充要条件（必须全部满足）：**\n- 能独立使用至少 1 个常用 AI 工具完成基础任务\n- 对 AI 能力边界没有清晰认知，或未表现出边界意识\n\n**典型行为描述（简历/面试）：**\n- \"使用ChatGPT辅助撰写文案\"\n- \"用Copilot写代码，提高效率\"\n- \"工作中会用到AI工具辅助\"\n\n**边界判定：** 仅提到\"使用AI工具\"，没有任何 prompt 迭代/输出审校/多工具组合的证据 → **只能判 L1**\n\n---\n\n### L2 · AI协作者\n\n**充要条件（必须全部满足）：**\n- **有 prompt 迭代行为**：不是只用默认 prompt，能根据输出调整表述\n- **有输出审校意识**：能判断 AI 输出是否满足需求，不是直接拿来就用\n- 以上两项必须有**具体证据**（不是\"会用AI\"，而是\"我怎么用、调了什么\"）\n\n**典型行为描述：**\n- \"通过调整prompt模板，将AI生成内容的通过率从60%提升到85%\"\n- \"组合使用ChatGPT+Midjourney+Canva完成营销方案\"\n- \"会审核AI输出的准确性，对关键数据做二次核实\"\n\n**边界判定：**\n- \"我用Copilot写代码\"但无迭代/审校证据 → **L1**（不是 L2）\n- \"通过调整prompt\" = \"迭代优化prompt\" = \"修改prompt以获得更好结果\" → **同一级别，不得因措辞不同判不同级别**\n\n---\n\n### L3 · AI架构者\n\n**充要条件（必须全部满足）：**\n- **能设计团队级 AI 工作流**：不是个人使用，而是设计流程让团队用\n- **能做工具选型判断**：评估过多个 AI 工具/模型的优劣并给出选择依据\n- **能定义质量标准**：为 AI 输出制定验收标准或审校流程\n\n**典型行为描述：**\n- \"主导团队引入AI工作流，设计了prompt库和审校标准\"\n- \"评估了ChatGPT/Claude/国产大模型，选定最优方案落地\"\n- \"AI输出的内容由我制定质量标准和验收流程\"\n\n**边界判定：** 个人用得好 ≠ L3。必须有**团队/流程/标准**三要素之一。\n\n---\n\n### L4 · AI战略者\n\n**充要条件（必须全部满足）：**\n- **能预判 AI 能力演进趋势**并据此调整业务预期或资源分配\n- **能定义 AI 能力边界**：明确\"哪些能做/哪些需要等/哪些永远需要人\"\n- **有组织级影响力**：制定了组织级 AI 规划或政策\n\n**典型行为描述：**\n- \"预判了GPT-4对客服场景的颠覆，提前6个月完成知识库升级\"\n- \"制定了部门AI能力3年规划，分阶段推进人机协作转型\"\n- \"定义了AI应用的边界红线，确保核心决策保留人工环节\"\n\n**边界判定：** 仅做到\"用得多\"或\"做得好\"≠ L4。必须有**预判/规划/定义边界**的组织级证据。\n\n---\n\n## 维度二：人机判断力\n\n### L1 · 无意识\n\n**充要条件：**\n- 拿到 AI 输出直接使用，不做验证\n- 或：无任何关于审校、验证、质疑 AI 输出的描述\n\n---\n\n### L2 · 基础审校\n\n**充要条件（必须全部满足）：**\n- **知道 AI 可能出错**\n- **会对关键信息做核实**（哪怕只是\"核对一下数字\"）\n\n**边界判定：** \"我会检查\"但说不检查什么、怎么检查 → **L1-L2 之间，往低打（L1）**\n\n---\n\n### L3 · 系统性兜底\n\n**充要条件（必须全部满足）：**\n- **设计了兜底机制**：不是偶尔检查，是有流程/清单/节点\n- **能识别 AI 幻觉模式**：知道 AI 常犯哪类错（数字错、引用虚构、时间错乱等）\n- **有复盘迭代习惯**：基于 AI 失误改进 prompt 或流程\n\n**边界判定：** 个人会检查 ≠ L3。必须有**系统性/流程化/可复用**的证据。\n\n---\n\n### L4 · 不确定下判断\n\n**充要条件（必须全部满足）：**\n- **能在信息不全时判断是否信任 AI 输出**\n- **有成熟的 AI 风险管理框架**\n- **能向非技术背景的人解释 AI 局限**\n\n---\n\n## 维度三：架构设计力\n\n### L1 · 无\n\n**充要条件：**\n- 没有设计过任何 AI 相关的系统性方案\n\n---\n\n### L2 · 单点应用设计\n\n**充要条件（必须全部满足）：**\n- **针对单一场景设计过 AI 应用方案**\n- 方案包含基本的问题定义 → 工具选型 → 实施路径\n\n**边界判定：** 只是\"用过某个 AI 工具\"≠ L2。必须有**设计/规划**行为。\n\n---\n\n### L3 · 业务级架构\n\n**充要条件（必须全部满足）：**\n- **设计了跨多环节的 AI 业务流程**（不是单点）\n- **方案包含 ROI 测算或风险识别**\n- **能清晰定义 AI 的角色边界**（做什么、不做什么）\n\n---\n\n### L4 · 系统协同架构\n\n**充要条件（必须全部满足）：**\n- **设计了多系统/多 Agent 协同的整体架构**\n- **规划了人 + AI Agent 的角色重新分配**\n- **将 AI 架构与组织变革结合**\n\n---\n\n## 维度四：混合编排力\n\n### L1 · 单独使用\n\n**充要条件：**\n- 单独使用一个 AI 工具，不会组合\n\n---\n\n### L2 · 工具组合\n\n**充要条件（必须全部满足）：**\n- **能编排 2-3 个 AI 工具形成工作流**\n- **能处理工具间的衔接问题**\n\n---\n\n### L3 · 复杂编排\n\n**充要条件（必须全部满足）：**\n- **能编排 5 个以上 AI 工具或平台**\n- **设计了包含人工环节的混合工作流**\n- **有工具失效时的降级方案**\n\n---\n\n### L4 · 组织级编排\n\n**充要条件（必须全部满足）：**\n- **设计了人的角色重新分配方案**\n- **规划了从\"人做事\"到\"人管AI做事\"的转型路径**\n- **能处理人机责任边界、绩效归属等复杂问题**\n\n---\n\n## 维度五：认知深度\n\n**打分前必过 4 项检查：①为什么选 ②tradeoff ③debug ④底层机制**\n\n| 层级 | 表现 | 分数上限 |\n|------|------|---------|\n| L1 表面使用 | 知道工具怎么用，不知道为什么 | 最高 1 分 |\n| L2 知其然 | 能调参优化，但不理解底层 | 最高 2 分 |\n| L3 知其所以然 | 理解 tradeoff，能 debug，知道底层机制 | 可达 3-4 分 |\n| L4 系统化认知 | 能解释整个技术栈 tradeoff，能指导他人 | 可达 4 分 |\n\n---\n\n## 维度六：问题建模能力\n\n| 等级 | 表现 | 典型信号 |\n|------|------|---------|\n| L1 接需求 | 等别人给明确需求 | \"运营让我做一个问答机器人\" |\n| L2 拆需求 | 把模糊需求拆成技术任务 | \"运营说要做AI，我拆成知识库+RAG+Agent三步\" |\n| L3 重构流程 | 发现原流程问题，重新设计 | \"运营瓶颈不在执行在决策，我做了分析Agent\" |\n| L4 AI-native | 从0设计AI原生业务模式 | \"我重新设计了整个运营流程，AI 80% 人 20%\" |\n\n---\n\n## 跨级别常见误区\n\n### 误区1：把\"工具多\"当\"能力强\"\n- L1候选人也可能用很多工具（ChatGPT + Copilot + Midjourney + ...）\n- 关键是\"怎么用的\"而非\"用了多少\"\n\n### 误区2：把\"参与AI项目\"当\"AI能力\"\n- \"项目用了AI技术\" ≠ 候选人具备AI能力\n- 要看候选人在项目中扮演什么角色\n\n### 误区3：把\"年限长\"当\"级别高\"\n- 工作5年但只是重复L1的工作模式 → 仍是L1\n- 工作2年但高成长+高杠杆 → 可达L3\n\n### 误区4：把\"大厂背景\"当\"高能力\"\n- 大厂执行者可能因为低杠杆反而加权更低\n- 小厂高杠杆可能加权后级别更高\n\n### 误区5：把\"简历写得好\"当\"能力强\"\n- AI简历有致命弱点：宏大叙事但缺乏长尾细节\n- 必须经过简历漏洞穿透审计才能打分\n\nFile v3.3.1:references/calibration-cases.md\n\n# 评分一致性校准案例库（v3.2 新增）\n\n> **使用方法**：评估边界候选人时，找到最接近的参考案例对标定级。不同实例对同一案例应输出一致的定级结果。\n\n---\n\n## 案例 A：明确 L1（基准锚点）\n\n**背景**：3年工作经验，简历写\"使用ChatGPT辅助撰写文案\"\"用AI工具提高工作效率\"，面试中能说出用过哪些工具，但无任何 prompt 迭代/输出审校/多工具组合的具体案例。\n\n**关键特征**：\n- 只有\"使用\"描述，无迭代证据\n- 无审校/验证意识\n- 无架构/流程设计经验\n- 工具数量 ≠ 能力深度\n\n**定级**：L1（AI 工具使用者）\n\n**为什么不是 L2**：不满足 L2 充要条件——无 prompt 迭代行为、无输出审校意识。\n\n---\n\n## 案例 B：明确 L2（基准锚点）\n\n**背景**：5年工作经验，能针对具体任务迭代 prompt（\"调整了3版 prompt 才得到满意结果\"），会审核 AI 输出（\"关键数据我会二次核实\"），组合使用 2-3 个 AI 工具完成工作流。但无团队级 AI 工作流设计经验。\n\n**关键特征**：\n- 有明确的 prompt 迭代证据\n- 有输出审校行为\n- 能组合 2-3 个工具\n- 个人层面做得好，但无团队/流程/标准设计\n\n**定级**：L2（AI 协作者）\n\n**为什么不是 L3**：不满足 L3 充要条件——无团队级 AI 工作流设计、无工具选型判断（评估多个模型并给出依据）、无质量标准定义。\n\n---\n\n## 案例 C：明确 L3（基准锚点）\n\n**背景**：8年工作经验，主导设计过跨多环节的 AI 业务流程（如\"智能客服+知识库+人工复核\"方案），做过工具选型（\"对比了 ChatGPT/Claude/国产大模型，选定最优方案\"），为团队制定了 AI 输出质量标准和审校流程。能清晰定义 AI 在流程中的角色边界。\n\n**关键特征**：\n- 有跨多环节 AI 流程设计经验\n- 有 ROI 测算或风险识别\n- 能定义 AI 的角色边界（做什么、不做什么）\n- 有团队级影响力（制定标准/流程）\n\n**定级**：L3（AI 架构者）\n\n**为什么不是 L4**：不满足 L4 充要条件——无预判 AI 演进趋势并调整业务预期的证据、无组织级 AI 规划/政策制定。\n\n---\n\n## 案例 D：边界 L2/L3（典型模糊场景）\n\n**背景**：6年工作经验，个人 AI 能力很强（prompt 迭代熟练、多工具组合、能审校输出），也开始带小团队（3人），给团队分享过 AI 使用经验。但尚未设计过正式的团队级 AI 工作流标准，也未做过系统性的工具选型评估。\n\n**关键特征**：\n- 个人能力强（L2 充要条件全部满足）\n- 开始带团队，有分享行为\n- 但无正式的流程设计/标准制定/工具选型证据\n\n**判定规则**：\n- 有\"团队分享\"≠ \"设计团队工作流\"→ 不满足 L3 充要条件\n- **往低打，判 L2**，标注\"潜力型：接近 L3\"\n- 理由：L3 要求\"设计团队级 AI 工作流\"或\"做工具选型判断\"或\"定义质量标准\"，三者至少满足其一。仅\"分享经验\"不够。\n\n**定级**：L2（AI 协作者），潜力型：接近 L3\n\n---\n\n## 案例 E：边界 L3/L4（典型模糊场景）\n\n**背景**：10年工作经验，设计过公司级 AI 架构（多 Agent 协同平台），能定义\"哪些场景 AI 能做、哪些需要等\"。但尚未制定组织级 AI 能力发展规划，也未预判过 AI 趋势并提前调整资源分配。\n\n**关键特征**：\n- 有公司级 AI 架构设计经验（L3 充要条件满足）\n- 能定义 AI 能力边界（接近 L4）\n- 但无组织级 AI 规划/政策制定证据\n- 无预判 AI 趋势并调整业务预期的证据\n\n**判定规则**：\n- L4 要求\"预判趋势并调整业务预期\"+\"组织级 AI 规划\"+\"定义 AI 能力边界\"，三者必须全部满足\n- 本案例只满足\"定义边界\"一项\n- **往低打，判 L3**，标注\"潜力型：接近 L4\"\n\n**定级**：L3（AI 架构者），潜力型：接近 L4\n\n---\n\n## 校准规则速查\n\n| 场景 | 规则 |\n|------|------|\n| 语义接近的行为描述 | 看是否有量化证据（\"提升到85%\" > \"有提升\"） |\n| 无量化证据时 | 看是否有反思/复盘证据（\"总结了X教训\" > \"做了X\"） |\n| 两者都没有 | 往低级别打 |\n| L4 判定 | 必须三项充要条件全部满足，缺一不可 |\n| L3 判定 | 必须三项充要条件全部满足，缺一不可 |\n| L2 判定 | 必须两项充要条件全部满足，缺一不可 |\n\nFile v3.3.1:references/cognitive_review.md\n\n# 认知复盘引擎（v3.3 Pro 新增）\n\n## 定位\n\n**不评估\"候选人说了什么\"，评估\"候选人如何思考\"。**\n\nv3.2 解决\"包装过的简历如何穿透审计\"，v3.3 解决\"面试口述如何拆解真实认知过程\"。\n\n输入源优先顺序：飞书妙记转录文本 > 手动面试记录 > 面试官笔记。\n\n---\n\n## 模块 1：矛盾检测引擎（Contradiction Engine）\n\n### 核心洞察\n\nAI 生成内容通常\"过于光滑\"。真实经历存在模糊性、例外情况、资源限制、失败痕迹。矛盾检测不是\"找茬\"，是**识别信号衰减**。\n\n### 检测维度\n\n| 维度 | 检测目标 | 示例信号 | 置信度 |\n|------|---------|---------|--------|\n| **时间矛盾** | 时间线不自洽 | \"2023年同时负责两个异地全职项目\" | 高 |\n| **数据矛盾** | 数字/指标前后冲突 | 先说\"团队5人\"后说\"我带了20人\" | 高 |\n| **角色矛盾** | 职责描述不一致 | \"我主导架构\" vs \"需要请示技术总监\" | 中 |\n| **逻辑跳跃** | 结论与前提不匹配 | \"因为用了AI，所以效率提升300%\"（缺中间链路） | 中 |\n| **决策模糊** | 关键决策无权衡过程 | \"选了方案A\"但没有提方案B/C或取舍理由 | 低-中 |\n| **过度光滑** | 全程无失败/挫折描述 | 所有项目都顺利推进，无例外情况 | 低-中 |\n\n### 判定规则\n\n```\n矛盾发现 → 分类 → 置信度标注 → 输出\n```\n\n- **高置信度矛盾**：直接标注，要求面试官追问\n- **中置信度矛盾**：标注\"存疑\"，建议但不强制追问\n- **低置信度矛盾**：仅内部记录，不主动暴露（避免误报消耗面试官信任）\n\n### ⚠️ 防误报铁律\n\n1. **口语转写失真不计为矛盾**：飞书妙记可能断句错误、同音词替换\n2. **记忆模糊≠说谎**：候选人记不清具体数字是正常现象\n3. **不同粒度的描述≠矛盾**：宏观概述和细节描述可能表面冲突但实质一致\n4. **必须标注\"可能是转写/记忆误差\"**：每条矛盾输出必须带这一免责声明\n\n---\n\n## 模块 2：认知解析层（Cognitive Parsing Layer）\n\n### 解析维度\n\n| 维度 | 评估内容 | 关键信号 | 反信号 |\n|------|---------|---------|--------|\n| **问题拆解** | 接到需求后如何结构化 | 先问边界→拆子问题→排序 | 直接跳答案/复述需求 |\n| **抽象能力** | 能否从具体案例提炼本质 | \"核心矛盾是X\"\"本质上是Y问题\" | 只讲细节不提规律 |\n| **逻辑一致性** | 前后论述是否自洽 | 论点→论据→结论链条完整 | 前后立场漂移无解释 |\n| **真实性纹理** | 是否存在真实细节 | 提到了意外/bug/临时妥协 | 所有描述都是\"最佳实践\" |\n| **不确定性处理** | 面对未知的反应 | 坦诚\"这个我不确定，但我的推测是...\" | 硬编答案/含糊其辞 |\n| **修正能力** | 被challenge后如何调整 | 接受质疑→重新思考→给出新视角 | 防御性反驳/死不承认 |\n| **Ownership** | 是否主动推进问题 | \"后来我发现还有一个问题...\" | 等面试官问才说 |\n| **AI协同** | 如何描述AI使用过程 | 提到了prompt迭代/失败尝试/边界判断 | 笼统说\"用AI辅助\" |\n\n### 评分方法\n\n每个维度不按\"1-4分\"，而是按**行为频率**标注：\n\n| 标注 | 含义 |\n|------|------|\n| **持续出现** | 面试中多次（≥3次）表现出该特征 |\n| **偶尔出现** | 1-2次，可能是偶发 |\n| **未观察到** | 没有足够数据判断 |\n| **反向出现** | 表现出相反特征（需标注） |\n\n> 为什么不用1-4分？因为认知过程是**模式**不是**分数**。\"这个人遇到challenge总是防御\"比\"修正能力=2.5分\"有价值得多。\n\n---\n\n## 模块 3：深挖追问 Agent（Deep Drill Agent）\n\n### 核心原则\n\n**不是固定题库，是动态生成。** 基于矛盾引擎和认知解析的发现，实时生成追问。\n\n### 追问触发规则\n\n| 触发条件 | 追问模板 |\n|---------|---------|\n| 矛盾引擎发现时间矛盾 | \"你刚才提到A和B同时发生，具体是怎么协调的？\" |\n| 决策模糊（无tradeoff） | \"当时有没有考虑过其他方案？为什么排除？\" |\n| 缺乏失败描述 | \"这个项目遇到过最大的意外是什么？\" |\n| 抽象词汇无细节 | \"你提到'效率大幅提升'，具体从多少到多少？怎么测的？\" |\n| 被challenge后防御 | \"我理解你的做法，但如果从X角度看，会不会有不同结论？\" |\n| AI协同描述笼统 | \"你能举一个AI帮上忙和一个AI帮不上忙的具体例子吗？\" |\n\n### 追问深度评估\n\n| 层级 | 候选人表现 | 评估 |\n|------|-----------|------|\n| **第1层（表层）** | 复述/美化既有叙述 | 未穿透 |\n| **第2层（细节）** | 能补充具体细节和数字 | 初步验证 |\n| **第3层（反思）** | 承认不足、复盘决策过程 | ✅ 真实能力暴露 |\n| **第4层（重构）** | 推翻原有叙述，给出新视角 | ✅ 高阶认知能力 |\n\n> 三层以后才能暴露真实能力。如果候选人停留在第1-2层，标注\"认知深度不足\"。\n\n---\n\n## 模块 4：认知画像层（Cognitive Embedding）\n\n### 输出格式\n\n不输出\"综合评分：82\"，输出**能力拓扑图**：\n\n```markdown\n## 认知画像\n\n| 维度 | 特征 | 证据 |\n|------|------|------|\n| 决策风格 | 数据驱动（偶尔经验补充） | \"先看数据再判断\"出现3次 |\n| 思维结构 | 框架型（先搭骨架再填充） | 每次回答问题都先说\"我分三个方面\" |\n| AI协同 | 高度增强型（深度迭代prompt） | 描述了3次prompt调优过程 |\n| 复杂度承载 | 中高（能处理3层嵌套问题） | 成功拆解了跨部门流程重构 |\n| Ownership | 强（主动延伸话题） | 4次主动补充面试官未问到的信息 |\n| 风险偏好 | 保守（偏好验证后再推进） | 多次提到\"先小范围试点\" |\n| 修正能力 | 快（被challenge后1轮内调整） | 2次被追问后快速修正观点 |\n| 真实性风险 | 低（全程有失败/例外描述） | 主动提到2个项目的教训 |\n```\n\n### 画像可信度\n\n| 数据质量 | 画像可信度 | 标注 |\n|---------|-----------|------|\n| 完整面试转录（>30分钟） | 高 | 可直接用于定级辅助 |\n| 面试记录（>15分钟） | 中 | 建议补充更多信息 |\n| 简要笔记（<15分钟） | 低 | 仅做参考，不做强推断 |\n\n---\n\n## 防幻觉铁律（认知复盘专属）\n\n| 规则 | 说明 |\n|------|------|\n| 不推断未表达的内容 | 候选人没说\"我想过方案B\"，就不能写\"候选人考虑过多种方案\" |\n| 标注转写质量 | 飞书妙记转录可能有误差，必须在报告开头标注\"本分析基于语音转写文本\" |\n| 矛盾需标注置信度 | 每条矛盾必须带\"高/中/低置信度\"标签 |\n| 不替代面试官判断 | 输出是\"建议\"不是\"结论\"，最终判断由面试官做出 |\n| 认知模式≠能力定级 | 认知画像是定级的辅助证据，不能替代六维度打分 |\n\n---\n\n## 与 v3.2 的关系\n\n```\nv3.2（简历审计 → 六维度打分 → 定级）\n  ↑ 补充\nv3.3 Pro（面试认知复盘 → 矛盾检测 → 认知画像 → 追问建议）\n```\n\n- v3.3 **不替代** v3.2，是**叠加层**\n- 输入：同一份面试记录，v3.2 做\"交叉验证 + 打分\"，v3.3 做\"认知过程解析\"\n- 输出：v3.2 的定级报告 + v3.3 的认知复盘报告\n- 定级时：v3.3 的认知画像可作为六维度打分的补充证据\n\nFile v3.3.1:references/evaluation_matrices.md\n\n# 完整评估矩阵\n\n## 六维度评估标准\n\n### 维度1：AI流利度（工具掌握深度 + 认知深度检查）\n\n| 分数 | 行为描述 | 典型信号 |\n|------|---------|---------|\n| 1 | 会用1-2个AI工具完成明确任务 | 用ChatGPT写文案，用Copilot补全代码 |\n| 2 | 能对比选择不同AI工具，会调参优化 | 根据任务选不同模型，会写prompt模板 |\n| 3 | 能训练/微调模型，构建工具链 | 自己搭RAG，做模型fine-tune，用LangChain |\n| 4 | 能设计AI工具架构，影响团队工具选型 | 为公司制定AI工具标准，自研AI工具 |\n\n**认知深度检查**：\n- L1上限：只是\"会用\"，不知道为什么这个工具好\n- L2上限：能调参但不知道底层原理\n- L3可达：理解token/embedding/attention，能解释为什么这个prompt有效\n- L4可达：能从原理层面对比模型，指导他人选型\n\n---\n\n### 维度2：人机判断力（边界意识 + 兜底机制 + 认知深度）\n\n| 分数 | 行为描述 | 典型信号 |\n|------|---------|---------|\n| 1 | 完全信任AI输出，不做验证 | 直接使用AI生成的代码/文案 |\n| 2 | 能识别明显错误，有基本验证习惯 | 检查代码是否有语法错误 |\n| 3 | 建立验证机制，知道什么场景AI不可靠 | 为AI输出设计测试用例，设置人工审核节点 |\n| 4 | 设计人机协作流程，定义AI边界 | 为公司设计AI使用规范，定义\"AI能做/不能做\" |\n\n**认知深度检查**：\n- L1上限：只是\"检查一下\"，无系统方法\n- L2上限：能发现问题但不理解AI为什么出错\n- L3可达：理解幻觉原因（训练数据、概率生成），设计针对性验证\n- L4可达：从组织层面定义AI边界，设计人机协作流程\n\n---\n\n### 维度3：架构设计力（系统设计 + Tradeoff理解 + 认知深度）\n\n| 分数 | 行为描述 | 典型信号 |\n|------|---------|---------|\n| 1 | 能在现有架构下完成功能开发 | 按已有规范写代码 |\n| 2 | 能设计中复杂度模块，理解基本设计模式 | 设计API接口，做数据库表设计 |\n| 3 | 能从0设计系统架构，清楚每个组件的Tradeoff | 设计微服务拆分，做容量规划，画架构图 |\n| 4 | 能设计组织级技术架构，影响公司技术方向 | 制定公司技术规范，领导跨团队架构升级 |\n\n**认知深度检查**：\n- L1上限：只会照搬现有模式\n- L2上限：能设计但不理解为什么这么设计\n- L3可达：每个架构决策都能讲出Tradeoff（为什么不用微服务/为什么不用NoSQL）\n- L4可达：能从业务演进角度设计可演进的架构\n\n---\n\n### 维度4：混合编排力（跨工具/跨部门协同 + 协同推进）\n\n| 分数 | 行为描述 | 典型信号 |\n|------|---------|---------|\n| 1 | 在自己熟悉的工具栈内完成任务 | 只用Python+熟悉的库 |\n| 2 | 能组合多个工具/API完成复杂任务 | Python调用多个API，用不同工具组合 |\n| 3 | 设计跨工具链工作流，推动跨部门协同 | 设计AI工作流（RAG+Agent+自动化），协调产品/运营/技术 |\n| 4 | 重构组织级协作流程，定义新的工作模式 | 推动公司从\"人做\"变为\"AI做+人审\" |\n\n**认知深度检查**：\n- L1上限：只在自己的舒适区工作\n- L2上限：会组合工具但不会设计流程\n- L3可达：能说清\"为什么这个环节用A工具，那个环节用B工具\"\n- L4可达：能量化评估人机协作效率，推动组织变革\n\n---\n\n### 维度5：认知深度（为什么做/Tradeoff/Debug/底层机制）\n\n| 层级 | 表现 | 分数上限 |\n|------|------|---------|\n| L1 表面使用 | 知道工具怎么用，不知道为什么 | 1 |\n| L2 知其然 | 能调参优化，但不理解底层 | 2 |\n| L3 知其所以然 | 理解Tradeoff，能Debug，知道底层机制 | 3-4 |\n| L4 系统化认知 | 能解释整个技术栈Tradeoff，能指导他人 | 4 |\n\n**必过4项检查**：\n1. 为什么选这个方案？\n2. 知不知道Tradeoff？\n3. 出问题怎么Debug？\n4. 理解底层机制吗？\n\n---\n\n### 维度6：问题建模能力（接需求→拆需求→重构流程→AI-native→重构组织）\n\n| 等级 | 表现 | 典型信号 |\n|------|------|---------|\n| L1 接需求 | 等别人给明确需求 | \"运营让我做一个问答机器人\" |\n| L2 拆需求 | 把模糊需求拆成技术任务 | \"运营说要做AI，我拆成知识库+RAG+Agent三步\" |\n| L3 重构流程 | 发现原流程问题，重新设计 | \"运营瓶颈不在执行在决策，我做了分析Agent\" |\n| L4 AI-native | 从0设计AI原生业务模式 | \"我重新设计了整个运营流程，AI 80% 人 20%\" |\n\n---\n\n## 环境复杂度评估\n\n### 低复杂度（×0.7）\n- 个人项目/开源项目\n- 团队规模 < 5人\n- 非技术密集型行业\n- 业务逻辑简单\n- 无合规/监管要求\n\n### 中复杂度（×1.0）\n- A/B轮创业公司\n- 团队规模 5-50人\n- 有一定技术挑战\n- 业务逻辑中等复杂\n- 用户量 10万-100万\n\n### 高复杂度（×1.2）\n- 上市互联网公司\n- 团队规模 > 50人或跨团队协作\n- 高并发/高可用要求\n- 受监管行业（金融/医疗）\n- 用户量 > 100万\n- 多业务线/多产品矩阵\n\n---\n\n## 个人杠杆率评估\n\n### 低杠杆率（×0.7）\n**模块执行者**\n- 在明确框架下完成分配任务\n- 技术方案由他人确定\n- 影响范围限于自己或小团队\n- 日常工作以\"接任务→完成\"为主\n- 不参与技术选型和架构决策\n\n### 中杠杆率（×1.0）\n**项目Owner**\n- 主导单个项目或模块的全生命周期\n- 有技术选型权\n- 影响范围跨团队（2-3个团队）\n- 对项目结果负责\n- 需要协调资源\n\n### 高杠杆率（×1.3）\n**一人AI部门/全栈架构师**\n- 从0到1设计业务流程\n- 跨部门资源协调\n- 影响范围达组织级\n- 技术决策影响公司方向\n- 定义团队工作方式和技术标准\n\n### 极端情况\n- 大厂低杠杆 = 1.2 × 0.7 = ×0.84（反而减分）\n- 小厂高杠杆 = 1.0 × 1.3 = ×1.3（加分显著）\n\n---\n\n## 成长速度评估\n\n### 高成长（+0.5）\n- 开源贡献/技术博客/内部分享有实际产出\n- 跨2-3个技术栈迁移且有成果\n- 持续实验，多个项目从实验到落地\n- 学习速度明显快于同龄人\n- 能将A领域的经验创造性迁移到B领域\n\n### 中成长（±0）\n- 主动学习但停留在\"学了\"阶段\n- 主要深耕1-2个技术栈\n- 有1-2个实验项目但未广泛落地\n- 学习速度正常\n\n### 低成长（-0.5）\n- 被动学习（等公司培训/等别人教）\n- 只会一个技术栈且无拓展意愿\n- 无自驱实验项目\n- 学习速度慢于同龄人\n\n### 破格规则\n> 2年经验 + 高成长 + 高杠杆 → 可达L3\n> 判断优先级：实际能力证据 > 成长速度 > 工作年限\n\n---\n\n## 计算示例\n\n### 示例1：创业公司全栈工程师\n- 能力平均分：2.5\n- 环境复杂度：中（1.0）\n- 个人杠杆率：高（1.3）\n- 成长速度：高（+0.5）\n- 计算：(2.5 × 1.0 × 1.3) + 0.5 = 3.25 + 0.5 = 3.75\n- 加权得分：3.75 × 4 = 15.0\n- 级别：L4（需验证架构设计力≥3和人机判断力≥3）\n\n### 示例2：大厂初级工程师\n- 能力平均分：2.5\n- 环境复杂度：高（1.2）\n- 个人杠杆率：低（0.7）\n- 成长速度：中（0）\n- 计算：(2.5 × 1.2 × 0.7) + 0 = 2.1\n- 加权得分：2.1 × 4 = 8.4\n- 级别：L2\n\n> 同样的能力分，环境×杠杆率不同，结果差异巨大\n\nFile v3.3.1:references/interview_modules.md\n\n# 面试题库与评分细则\n\n## 模块一：AI流利度面试\n\n### 基础题（L1-L2区分）\n\n1. **请描述你日常使用AI工具的方式和频率。**\n   - L1信号：主要是ChatGPT问答、代码补全\n   - L2信号：根据不同任务选择不同工具，有固定的prompt模板\n\n2. **用过的AI工具中，哪个让你印象最深？为什么？**\n   - L1信号：回答停留在功能层面\n   - L2信号：能对比不同工具的优劣，说出选择理由\n\n### 进阶题（L2-L3区分）\n\n3. **如果让你为公司选一个AI工具栈，你会怎么选？考虑哪些因素？**\n   - L2信号：列出工具但缺乏系统性思考\n   - L3信号：考虑成本/隐私/集成/学习曲线等多维度，有决策框架\n\n4. **你如何评估一个新AI工具是否值得引入？**\n   - L2信号：试用后凭感觉判断\n   - L3信号：有评估框架（ROI/团队适配/维护成本等）\n\n### 高阶题（L3-L4区分）\n\n5. **如果让你设计一个团队级别的AI使用规范，你会包含哪些内容？**\n   - L3信号：技术层面的规范（用什么工具、怎么写prompt）\n   - L4信号：包含安全/合规/人机分工/效果评估等全方位规范\n\n### 评分细则\n\n| 分数 | 表现 |\n|------|------|\n| 1 | 只会用基础工具，表达停留在功能层面 |\n| 2 | 能主动选择工具，有自己的使用心得 |\n| 3 | 有工具评估框架，能系统性思考工具链 |\n| 4 | 能设计规范，影响他人和团队 |\n\n---\n\n## 模块二：人机判断力面试\n\n### 基础题（L1-L2区分）\n\n1. **你遇到过AI输出错误的情况吗？怎么处理的？**\n   - L1信号：没太注意/偶尔发现一两次\n   - L2信号：能举出具体案例，有检查的习惯\n\n2. **你怎么判断AI给的建议是否靠谱？**\n   - L1信号：看起来合理就信了\n   - L2信号：有检查清单（检查逻辑/数据来源/运行测试等）\n\n### 进阶题（L2-L3区分）\n\n3. **请设计一个验证AI输出质量的方法。**\n   - L2信号：人工抽查/简单对比\n   - L3信号：自动化验证流程/设定质量指标/建立反馈机制\n\n4. **什么场景下你会选择不用AI？为什么？**\n   - L2信号：回答模糊\n   - L3信号：能说出具体场景（高精度/合规/创造性决策等）及原因\n\n### 高阶题（L3-L4区分）\n\n5. **如果让你制定一个部门的AI使用边界，你会怎么定义\"AI可以做\"和\"AI不能做\"？**\n   - L3信号：技术层面的划分\n   - L4信号：从业务风险/法律责任/组织能力等角度系统性定义\n\n### 评分细则\n\n| 分数 | 表现 |\n|------|------|\n| 1 | 基本信任AI，验证意识弱 |\n| 2 | 有验证习惯，能识别常见问题 |\n| 3 | 有系统验证方法，知道AI边界 |\n| 4 | 能定义组织级规范，设计人机协作流程 |\n\n---\n\n## 模块三：综合能力面试（微案例）\n\n### 案例1：效率提升\n\n**背景**：假设你是某电商公司的技术负责人，公司每天有大量客服工单需要人工分类和回复。\n\n**问题**：\n1. 你会如何用AI解决这个问题？\n2. 预期的效果和风险是什么？\n3. 如何评估这个方案是否成功？\n\n**评分关注点**：\n- L1：直接说\"用ChatGPT自动回复\"\n- L2：考虑分类+回复两阶段，但缺乏风险评估\n- L3：设计完整方案（分类准确率/人工兜底/效果监控/成本核算）\n- L4：不只解决当前问题，还考虑如何重构客服流程（AIfirst）\n\n### 案例2：技术选型\n\n**背景**：团队要在产品中集成AI能力，需要在\"调用API\"和\"自建模型\"之间选择。\n\n**问题**：\n1. 你会怎么决策？考虑哪些因素？\n2. 两个方案的利弊是什么？\n3. 如果选择调用API，如何确保数据安全？\n\n**评分关注点**：\n- L1：简单二选一\n- L2：能列出一些因素但不够系统\n- L3：系统性评估（成本/延迟/隐私/可控性/维护成本），知道Tradeoff\n- L4：从长期战略角度思考，考虑组织能力建设\n\n### 案例3：流程重构\n\n**背景**：公司运营团队每月花大量时间做数据报表，流程是\"导出数据→Excel处理→做PPT\"。\n\n**问题**：\n1. 你如何重新设计这个流程？\n2. 引入AI后，人和AI的分工是怎样的？\n3. 如何让运营团队接受这个新流程？\n\n**评分关注点**：\n- L1：建议用AI生成报表\n- L2：拆解流程找到可AI化的环节\n- L3：重新设计端到端流程，明确人机分工\n- L4：不只解决报表问题，推动运营团队整体AI转型\n\n---\n\n## 评分标准引用\n\n> **重要**：最终定级分数计算请严格参照 SKILL.md 的**唯一评分标准**（Step 6）：\n> `能力平均分 × 4 = 综合得分 → 查表定级`。\n>\n> 本文件中的\"分数\"仅表示各维度 1-4 分的评分参考，**不提供独立的分数→级别映射**。\n> 行为锚点充要条件详见 `references/behavioral_anchors.md`。\n> 评分一致性校准详见 `references/calibration-cases.md`。\n\n---\n\n## 评分表模板\n\n### 候选人评分卡\n\n| 维度 | 分数(1-4) | 关键证据 | 认知深度 |\n|------|-----------|---------|---------|\n| AI流利度 | | | |\n| 人机判断力 | | | |\n| 架构设计力 | | | |\n| 混合编排力 | | | |\n| 认知深度 | | | |\n| 问题建模能力 | | | |\n\n### 面试官备注\n```\n[记录关键回答、亮点、疑点]\n```\n\n### 面试结论\n- [ ] 通过进入下一步\n- [ ] 待定（需要补充面试）\n- [ ] 不通过\n\n### 待验证问题\n```\n[根据简历审计生成的测谎题，记录在面试中的覆盖情况]\n```\n\nFile v3.3.1:references/output_templates.md\n\n# 定级报告标准模板\n\n## 模式A：简历审计报告（仅简历）\n\n```markdown\n# AI人才简历审计报告\n\n## 基本信息\n- 评估时间: {timestamp}\n- 数据来源: {file_list}\n- 候选人编号: {candidate_id}\n- 审计模式: 仅简历审计\n\n---\n\n## 一、简历漏洞穿透审计\n\n### 1.1 高阶含金量审计\n- 疑点数量: {count}\n- 具体疑点:\n  {#each audit.high_value_issues}\n  - {issue_description} [风险等级: {risk_level}]\n  {/each}\n- 审计结论: {conclusion}\n\n### 1.2 高势能低细节断层\n- 断层数量: {count}\n- 具体断层:\n  {#each audit.detail_gaps}\n  - **段落**: {paragraph}\n  - **问题**: {gap_description}\n  - **建议追问**: {suggested_question}\n  {/each}\n\n### 1.3 因果链断裂检测\n- 断裂数量: {count}\n- 具体断裂:\n  {#each audit.causality_gaps}\n  - **声称**: {claim}\n  - **缺失**: {missing_link}\n  {/each}\n\n### 1.4 AI生成痕迹识别\n- 痕迹数量: {count}\n- 具体痕迹:\n  {#each audit.ai_patterns}\n  - {pattern_type}: {evidence}\n  {/each}\n\n### 1.5 逻辑一致性校验\n- 不一致数量: {count}\n- 具体问题:\n  {#each audit.consistency_issues}\n  - {issue_description}\n  {/each}\n\n---\n\n## 二、综合审计结论\n\n| 指标 | 结果 |\n|------|------|\n| 高阶含金量 | {status} |\n| 细节断层 | {status} |\n| 因果链 | {status} |\n| AI痕迹 | {status} |\n| 逻辑一致性 | {status} |\n| **综合结论** | **{overall_conclusion}** |\n\n---\n\n## 三、定制化测谎面试题\n\n{#each lie_detection_questions}\n### {question_type}：{question_title}\n{question_content}\n{/each}\n\n---\n\n## 四、审计备注\n- 审计可信度: {confidence}\n- 关键风险提示: {key_risks}\n- 建议后续动作: {next_steps}\n```\n\n---\n\n## 模式B：完整定级报告（简历 + 面试记录）\n\n```markdown\n# AI人才完整定级报告\n\n## 基本信息\n- 候选人ID: {candidate_id}\n- 评估时间: {timestamp}\n- 数据来源: {file_list}\n- 评估模式: 完整定级\n\n---\n\n## 一、简历审计结果\n\n### 1.1 审计摘要\n- 审计结论: {audit.conclusion}\n- 高嫌疑指标: {audit.high_suspicion_count}\n- 中嫌疑指标: {audit.medium_suspicion_count}\n\n### 1.2 关键疑点\n{#each audit.key_suspicions}\n- [{severity}] {description}\n{/each}\n\n---\n\n## 二、面试交叉验证\n\n### 2.1 测谎题覆盖情况\n| 测谎题 | 是否问到 | 验证结果 | 备注 |\n|--------|---------|---------|------|\n{#each cross_validation.items}\n| {question_summary} | {asked} | {result} | {notes} |\n{/each}\n\n### 2.2 疑点处理统计\n- 已确认（存疑）: {confirmed_count}\n- 已排除: {excluded_count}\n- 待验证: {pending_count}\n\n---\n\n## 三、六维度评估\n\n| 维度 | 得分 | 评估依据 | 认知深度 |\n|------|------|---------|---------|\n| AI流利度 | {score} | {evidence} | {cognitive_level} |\n| 人机判断力 | {score} | {evidence} | {cognitive_level} |\n| 架构设计力 | {score} | {evidence} | {cognitive_level} |\n| 混合编排力 | {score} | {evidence} | {cognitive_level} |\n| 认知深度 | {score} | {evidence} | {cognitive_level} |\n| 问题建模能力 | {score} | {evidence} | {cognitive_level} |\n\n**能力平均分**: {average_score}\n\n---\n\n## 四、加权计算\n\n| 因子 | 等级 | 系数 | 依据 |\n|------|------|------|------|\n| 环境复杂度 | {level} | {coefficient} | {reason} |\n| 个人杠杆率 | {level} | {coefficient} | {reason} |\n| 成长速度 | {level} | 调整{adjustment} | {reason} |\n\n**计算公式**:\n```\n({average_score} × {env_coefficient} × {leverage_coefficient}) + {growth_adjustment} = {weighted_score}\n加权后得分: {weighted_score} × 4 = {final_score}\n```\n\n---\n\n## 五、定级结果\n\n| 项目 | 内容 |\n|------|------|\n| **最终级别** | **L{level}** |\n| 级别名称 | {level_name} |\n| P序列参考 | {p_level} |\n| 级别定义 | {level_definition} |\n\n{#if is_potential}\n### 潜力标注\n- 类型: 潜力型\n- 突出维度: {outstanding_dimension}\n- 建议: {recommendation}\n{/if}\n\n{#if is_weakness}\n### 短板标注\n- 类型: 短板型\n- 薄弱维度: {weak_dimension}\n- 建议: {recommendation}\n{/if}\n\n{#if is_downgraded}\n### 降级说明\n- 原始级别: L{original_level}\n- 降级原因: {downgrade_reason}\n{/if}\n\n{#if needs_confidence_note}\n### 置信度说明（v3.2 一致性检验）\n> 综合得分 {final_score} 属于极端区间（≥13 或 ≤7），需说明置信度：\n- 评估置信度: {confidence_level}\n- 关键证据来源: {evidence_sources}\n- 不确定性说明: {uncertainty_notes}\n- 对标参考案例: {calibration_case}（见 references/calibration-cases.md）\n{/if}\n\n{#if has_dimension_gap}\n### 非均衡型标注\n- 最高维度: {max_dimension} ({max_score})\n- 最低维度: {min_dimension} ({min_score})\n- 分差: {gap} ≥ 2，需说明: {explanation}\n{/if}\n\n---\n\n## 六、风险提示\n\n### 高风险项\n{#each risks.high}\n- {description}\n{/each}\n\n### 中风险项\n{#each risks.medium}\n- {description}\n{/each}\n\n### 建议验证点\n{#each risks.verify}\n- {action}\n{/each}\n\n---\n\n## 七、数据质量评估\n\n| 维度 | 评分(1-5) | 说明 |\n|------|-----------|------|\n| 简历完整度 | {score} | {note} |\n| 面试记录质量 | {score} | {note} |\n| 评估可信度 | {score} | {note} |\n\n---\n\n## 八、附录\n\n### 评估配置\n- 使用配置: {config_version}\n- 权重设置: {weights}\n\n### 评估时间线\n- 开始时间: {start_time}\n- 结束时间: {end_time}\n- 总耗时: {duration}\n```\n\n---\n\n## 模式C：面试认知复盘报告（v3.3 Pro 新增）\n\n```markdown\n# 面试认知复盘报告\n\n## 基本信息\n- 候选人ID: {candidate_id}\n- 面试日期: {interview_date}\n- 数据来源: {source_type}（飞书妙记转录 / 手动记录 / 面试官笔记）\n- 转录质量: {transcript_quality}（高/中/低）\n- 面试时长: {duration}\n- 分析时间: {timestamp}\n\n> ⚠️ 免责声明：本分析基于{source_type}文本，可能存在口语转写误差。所有矛盾和认知判断需结合面试官实际观察综合判断。\n\n---\n\n## 一、矛盾检测结果\n\n| # | 矛盾类型 | 描述 | 置信度 | 建议动作 |\n|---|---------|------|--------|---------|\n| 1 | {type} | {description} | 高/中/低 | {action} |\n\n### 矛盾统计\n- 高置信度矛盾: {high_count}（需追问验证）\n- 中置信度矛盾: {medium_count}（建议追问）\n- 低置信度矛盾: {low_count}（内部参考）\n- 总计: {total_count}\n\n---\n\n## 二、认知行为解析\n\n| 维度 | 状态 | 证据摘要 |\n|------|------|---------|\n| 问题拆解 | 持续出现/偶尔出现/未观察到/反向出现 | {evidence} |\n| 抽象能力 | 持续出现/偶尔出现/未观察到/反向出现 | {evidence} |\n| 逻辑一致性 | 持续出现/偶尔出现/未观察到/反向出现 | {evidence} |\n| 真实性纹理 | 持续出现/偶尔出现/未观察到/反向出现 | {evidence} |\n| 不确定性处理 | 持续出现/偶尔出现/未观察到/反向出现 | {evidence} |\n| 修正能力 | 持续出现/偶尔出现/未观察到/反向出现 | {evidence} |\n| Ownership | 持续出现/偶尔出现/未观察到/反向出现 | {evidence} |\n| AI协同 | 持续出现/偶尔出现/未观察到/反向出现 | {evidence} |\n\n---\n\n## 三、深挖追问建议\n\n基于矛盾引擎和认知解析发现，建议以下追问：\n\n### 追问 1：{topic}\n**触发原因**: {trigger}\n**问题**: \"{question}\"\n**期望深度**: 第{level}层（{level_name}）\n\n{#each follow_up_questions}\n### 追问 {index}：{topic}\n**触发原因**: {trigger}\n**问题**: \"{question}\"\n**期望深度**: 第{level}层（{level_name}）\n{/each}\n\n---\n\n## 四、认知画像\n\n| 维度 | 特征 | 证据 |\n|------|------|------|\n| 决策风格 | {style} | {evidence} |\n| 思维结构 | {structure} | {evidence} |\n| AI协同习惯 | {ai_pattern} | {evidence} |\n| 复杂度承载 | {complexity} | {evidence} |\n| Ownership | {ownership} | {evidence} |\n| 风险偏好 | {risk} | {evidence} |\n| 修正能力 | {correction} | {evidence} |\n| 真实性风险 | {authenticity} | {evidence} |\n\n### 画像可信度\n- 数据质量: {data_quality}\n- 可信度: {confidence}\n- 说明: {note}\n\n---\n\n## 五、与定级的关联（可选）\n\n> 认知复盘是六维度打分的辅助证据，不直接改变定级结果。\n\n| 认知发现 | 可能影响的定级维度 | 建议 |\n|---------|-------------------|------|\n| {finding} | {dimension} | {recommendation} |\n\n---\n\n## 六、总结\n\n**核心发现**: {key_finding}\n**最大风险**: {biggest_risk}\n**最大亮点**: {biggest_strength}\n**建议后续动作**: {next_steps}\n```\n\nFile v3.3.1:references/resume_audit.md\n\n# 简历漏洞穿透审计指南\n\n## 审计目标\n\n识别AI生成简历的致命弱点：AI善于构建宏大逻辑，但无法编造完全自洽的商业细节。本审计不是\"判断简历写得好不好\"，而是\"判断简历中有多少真实可信的细节\"。\n\n---\n\n## 审计指标1：高阶含金量审计\n\n### 目标\n横向对比商业常识，判断简历中声称的增幅/指标是否成立。\n\n### 检查项\n- [ ] 指标是否有行业对比基线？\n  - 例：\"用户增长300%\" → 同期行业平均多少？竞品多少？\n- [ ] 增幅是否符合产品生命周期规律？\n  - 例：成熟期产品声称\"月活增长200%\" → 高度可疑\n- [ ] 数据是否过于\"漂亮\"？\n  - 例：所有项目指标全部正向且幅度一致 → AI生成特征\n- [ ] 是否有失败的案例或负向数据？\n  - 真实工作必然有失败和妥协，全正向记录可疑\n\n### 判定标准\n- 有基线对比 + 有失败案例 → 低嫌疑\n- 有基线对比但无失败案例 → 中嫌疑\n- 无基线 + 全正向 → 高嫌疑\n\n---\n\n## 审计指标2：高势能低细节断层\n\n### 目标\n挑出\"框架完美但缺乏独特长尾细节\"的段落。AI擅长写出漂亮的结构，但无法编造只有亲身经历才有的\"长尾细节\"。\n\n### 检查项\n- [ ] 项目描述是否有\"只有做过才知道\"的细节？\n  - 例：\"因XX原因，选择了YY方案而非ZZ方案，过程中遇到AA问题，通过BB方法解决\"\n- [ ] 是否有独特的数据异常或意外发现？\n  - 例：\"原本以为是XX问题，深入后发现其实是YY，调整策略后...\"\n- [ ] 是否出现标准化模板语言？\n  - 例：\"负责xxx项目，使用xxx技术，取得xxx成果\" → 三段式模板\n- [ ] 技术选型是否有代价说明？\n  - 真实决策必有代价，\"用了A方案\"但没有\"牺牲了什么\" → 可疑\n\n### 判定标准\n- 有意外发现 + 有代价说明 → 低嫌疑\n- 有代价说明但无意外发现 → 中嫌疑\n- 三段式模板 + 无代价 → 高嫌疑\n\n---\n\n## 审计指标3：因果链断裂检测\n\n### 目标\n检查Action和Result是否漂亮，但Why和How语焉不详。\n\n### 检查项\n- [ ] 从\"做了什么\"到\"取得什么成果\"中间的逻辑是否自洽？\n  - 例：\"优化了数据库查询 → 营收增长50%\" → 因果链断裂\n- [ ] 是否有中间步骤的说明？\n  - 例：\"通过A方案解决B问题\" → 为什么是A？尝试过其他方案吗？\n- [ ] 结果是否超出合理预期？\n  - 例：一个前端优化带来\"业务转化率翻倍\" → 因果失当\n- [ ] 是否有他人协作的痕迹？\n  - 单枪匹马完成需要多角色协作的任务 → 可疑\n\n### 判定标准\n- 因果链完整 + 有协作痕迹 → 低嫌疑\n- 因果链部分缺失 → 中嫌疑\n- 因果链断裂 + 结果夸大 → 高嫌疑\n\n---\n\n## 审计指标4：AI生成痕迹识别\n\n### 目标\n识别AI写作的典型特征：宏大词藻、缺乏个人特质、标准化模板语言。\n\n### AI生成特征清单\n- [ ] 过度使用\"赋能\"\"驱动\"\"重构\"\"闭环\"\"抓手\"\"底层逻辑\"等词汇\n- [ ] \"通过AI技术大幅提升效率\" → 无具体技术名称\n- [ ] \"主导了从0到1的...\" → \"0到1\"是AI高频词组\n- [ ] \"实现了业务价值的最大化\" → 空洞的万能结尾句\n- [ ] 每段开头都是\"负责...\"\"主导...\"\"参与...\" → 高度模板化\n- [ ] 缺乏人称代词，描述像产品说明书而非个人经历\n- [ ] 技能列表\"精通Python、Java、C++、Go、Rust...\" → 全栈精通不现实\n\n### 判定标准\n- 无上述特征 → 低嫌疑\n- 1-3个特征 → 中嫌疑\n- 4个及以上 → 高嫌疑\n\n---\n\n## 审计指标5：逻辑一致性校验\n\n### 目标\n验证简历中时间线、职责范围、技术栈是否自洽。\n\n### 检查项\n- [ ] 时间线是否有重叠或空档？\n  - 例：2019年6月毕业但2019年3月开始全职工作\n- [ ] 职责范围与职级是否匹配？\n  - 例：工作2年声称\"主导公司技术架构重构\"\n- [ ] 技术栈时间线是否合理？\n  - 例：2018年使用GPT-4 → GPT-4于2023年发布\n- [ ] 项目规模与团队规模是否匹配？\n  - 例：3人团队声称\"支撑百万DAU\"\n- [ ] 多个项目之间的角色是否一致？\n  - 例：每个项目都是\"主导\"，没有任何执行角色\n\n### 判定标准\n- 全部自洽 → 低嫌疑\n- 1处不一致 → 中嫌疑\n- 2处及以上不一致 → 高嫌疑\n\n---\n\n## 综合审计结论\n\n| 高嫌疑指标数 | 结论 |\n|-------------|------|\n| 0-1 | 低嫌疑：简历真实度较高 |\n| 2-3 | 中嫌疑：建议重点验证 |\n| 4-5 | 高嫌疑：存在大量AI生成或夸大嫌疑 |\n\n---\n\n## 测谎面试题生成指南\n\n### 生成原则\n1. **追问细节而非结论**：问\"你是怎么做的\"而非\"你做了什么\"\n2. **追问边界条件**：问\"什么情况下会失败\"而非\"怎么成功的\"\n3. **要求还原决策过程**：问\"为什么选A不选B\"而非\"A是什么\"\n4. **追问意外和失败**：问\"遇到最大的坑是什么\"而非\"最大的成就\"\n5. **追问协作关系**：问\"你和谁一起做的，怎么分工\"而非\"团队有几个人\"\n\n### 题量建议\n- 低嫌疑：2-3题\n- 中嫌疑：4-5题\n- 高嫌疑：6-8题\n\n### 题型模板\n\n**类型A：细节追问**\n```\n在[项目X]中，你提到[某技术选型/某成果]。\n请描述：\n1. 当时有哪几个备选方案？为什么最终选择了这个？\n2. 实现过程中最大的技术挑战是什么？具体怎么解决的？\n3. 如果重新做一次，你会改变什么？\n```\n\n**类型B：边界条件**\n```\n关于[技术Y]，请描述：\n1. 在什么场景下它表现最好？什么场景下会失效？\n2. 你遇到过的最严重的线上问题是什么？排查过程是怎样的？\n3. 如果数据量/用户量扩大10倍，你设计的技术方案需要做什么调整？\n```\n\n**类型C：决策还原**\n```\n关于[成果Z]，请描述：\n1. 这个目标是怎么定出来的？为什么是这个数字？\n2. 推进过程中，有没有调整过方向？为什么？\n3. 团队内部有没有不同意见？你是怎么处理的？\n```\n\n**类型D：协作验证**\n```\n关于[项目W]，请描述：\n1. 你在团队中的具体角色和日常做什么？\n2. 和你协作最紧密的是谁？你们之间的工作界面是怎样的？\n3. 项目中哪个部分是你独立完成的，哪个部分需要依赖他人？\n```\n\nFile v3.3.1:skill-card.md\n\n## Description: <br>\n基于简历、面试记录和岗位要求，对候选人的 AI 时代能力进行 L1-L4 定级，并输出简历审计、测谎追问、六维度评分和认知复盘报告。 <br>\n\nThis skill is ready for commercial/non-commercial use. <br>\n\n## Publisher: <br>\n[tuobadaidai](https://clawhub.ai/user/tuobadaidai) <br>\n\n### License/Terms of Use: <br>\nMIT-0 <br>\n\n\n## Use Case: <br>\nRecruiters, hiring managers, and interviewers use this skill to review AI-role resumes and interview records, generate verification questions, and produce structured AI capability grading reports. The results should support human review rather than replace hiring judgment. <br>\n\n### Deployment Geography for Use: <br>\nGlobal <br>\n\n## Known Risks and Mitigations: <br>\nRisk: The skill can process and save sensitive candidate materials during hiring evaluation. <br>\nMitigation: Use it only in authorized recruiting workflows, redact unnecessary identifiers, store reports in protected locations, and delete outputs when no longer needed. <br>\nRisk: Grading, contradiction analysis, or cognitive profiling could be overused as an automatic hiring decision. <br>\nMitigation: Treat outputs as decision support for qualified human reviewers and verify conclusions against interview evidence and organizational hiring policy. <br>\n\n\n## Reference(s): <br>\n- [ClawHub Skill Page](https://clawhub.ai/tuobadaidai/ai-talent-grader) <br>\n- [README.md](README.md) <br>\n- [Behavioral Anchors](references/behavioral_anchors.md) <br>\n- [Calibration Cases](references/calibration-cases.md) <br>\n- [Cognitive Review](references/cognitive_review.md) <br>\n- [Evaluation Matrices](references/evaluation_matrices.md) <br>\n- [Interview Modules](references/interview_modules.md) <br>\n- [Output Templates](references/output_templates.md) <br>\n- [Resume Audit](references/resume_audit.md) <br>\n\n\n## Skill Output: <br>\n**Output Type(s):** [Analysis, Markdown, JSON, Files, Guidance] <br>\n**Output Format:** [Markdown and JSON reports] <br>\n**Output Parameters:** [1D] <br>\n**Other Properties Related to Output:** [May write candidate evaluation reports to user-selected output paths.] <br>\n\n## Skill Version(s): <br>\n3.3.1 (source: frontmatter and server release metadata) <br>\n\n## Ethical Considerations: <br>\nUsers should evaluate whether this skill is appropriate for their environment, review any generated or modified files before relying on them, and apply their organization's safety, security, and compliance requirements before deployment. <br>\n\nFile v3.3.1:config/evaluation_config.yaml\n\n# AI人才定级 - 评估配置\n\n# 权重配置（各维度在评估中的重要性）\nweights:\n  ai_fluency: 1.0\n  human_ai_judgment: 1.2\n  architecture_design: 1.5\n  hybrid_orchestration: 1.1\n  cognitive_depth: 1.3\n  problem_modeling: 1.4\n\n# 级别阈值\nlevel_thresholds:\n  l1: 4.0   # 4-7\n  l2: 8.0   # 8-11\n  l3: 12.0  # 12-14\n  l4: 15.0  # 15-16\n\n# 环境复杂度系数\nenvironment_complexity:\n  low:\n    coefficient: 0.7\n    description: \"个人项目/小型团队\"\n    examples:\n      - \"个人开发者\"\n      - \"小型创业项目\"\n      - \"非技术密集型行业\"\n  medium:\n    coefficient: 1.0\n    description: \"中等规模公司/技术团队\"\n    examples:\n      - \"A/B轮创业公司\"\n      - \"中型技术团队\"\n      - \"传统企业数字化转型\"\n  high:\n    coefficient: 1.2\n    description: \"大型企业/高复杂度环境\"\n    examples:\n      - \"上市互联网公司\"\n      - \"金融/医疗等受监管行业\"\n      - \"万人以上组织\"\n\n# 个人杠杆率系数\npersonal_leverage:\n  low:\n    coefficient: 0.7\n    description: \"模块执行者\"\n    indicators:\n      - \"在明确框架下完成分配任务\"\n      - \"决策权有限\"\n      - \"影响范围在团队内\"\n  medium:\n    coefficient: 1.0\n    description: \"项目Owner\"\n    indicators:\n      - \"主导单个项目或模块\"\n      - \"有技术选型权\"\n      - \"影响范围跨团队\"\n  high:\n    coefficient: 1.3\n    description: \"一人AI部门/全栈架构师\"\n    indicators:\n      - \"从0到1设计业务流程\"\n      - \"跨部门资源协调\"\n      - \"影响范围达组织级\"\n\n# 成长速度调整\ngrowth_speed:\n  high:\n    adjustment: 0.5\n    criteria:\n      - \"开源贡献/技术博客/内部分享\"\n      - \"跨2-3个技术栈迁移\"\n      - \"持续实验，多个落地项目\"\n  medium:\n    adjustment: 0\n    criteria:\n      - \"主动学习但无输出\"\n      - \"熟悉1-2个技术栈\"\n      - \"有1-2个实验项目\"\n  low:\n    adjustment: -0.5\n    criteria:\n      - \"被动学习\"\n      - \"只会一个技术栈\"\n      - \"无自驱实验\"\n\n# 认知深度检查项（每个维度打分前必须过）\ncognitive_depth_checks:\n  - \"为什么选这个方案（Why）\"\n  - \"知不知道tradeoff（Trade-off）\"\n  - \"出问题怎么debug（Debug）\"\n  - \"理解底层机制吗（Fundamentals）\"\n\n# 认知深度与得分上限\ncognitive_depth_limits:\n  surface_use:\n    level: \"L1\"\n    description: \"知道工具怎么用，不知道为什么\"\n    max_score: 1\n  know_what:\n    level: \"L2\"\n    description: \"能调参优化，但不理解底层\"\n    max_score: 2\n  know_why:\n    level: \"L3\"\n    description: \"理解tradeoff，能debug，知道底层机制\"\n    max_score: 3\n  systematic:\n    level: \"L4\"\n    description: \"能解释整个技术栈tradeoff，能指导他人\"\n    max_score: 4\n\n# 批判性审查规则\ncritical_review:\n  red_flags:\n    - signal: \"量化指标无基线\"\n      action: \"降级处理，标注存疑\"\n    - signal: \"声称\"主导\"但无团队规模\"\n      action: \"降权为\"参与\"\"\n    - signal: \"技术栈堆砌无深度案例\"\n      action: \"按L1-L2处理\"\n    - signal: \"短时间内声称架构级贡献\"\n      action: \"标注\"需验证真实贡献度\"\"\n    - signal: \"个人项目混入生产经验\"\n      action: \"单独标注，降权\"\n\n# 打分纪律\nscoring_discipline:\n  - \"单维度最高给3分，除非有极强组织级影响力证据\"\n  - \"L4极稀缺，候选人有亮点≠L4\"\n  - \"双乘数加权必须执行，缺一不可\"\n  - \"认知深度检查是必经步骤\"\n  - \"简历审计是必经步骤：不经过漏洞穿透审计，不得打分\"\n\n# 非均衡型判定\nnon_balanced_rules:\n  potential:\n    condition: \"综合L{n}，但某一维度达到L{n+1}+\"\n    action: \"标注\"潜力型：{维度名}突出\"\"\n  weakness:\n    condition: \"综合L{n}，但某一维度为L{n-1}或更低\"\n    action: \"标注\"短板型：{维度名}薄弱\"\"\n  l4_constraint:\n    condition: \"候选达到L4但架构设计力<3或人机判断力<3\"\n    action: \"降为L3，注明原因\"\n\n# 文件解析配置\nfile_parser:\n  supported_formats:\n    - \".pdf\"\n    - \".docx\"\n    - \".txt\"\n    - \".md\"\n    - \".json\"\n    - \".yaml\"\n    - \".yml\"\n  max_file_size_mb: 20\n  encoding: \"utf-8\"\n  fallback_encoding: \"gbk\"\n\n# 批量处理配置\nbatch_processing:\n  max_parallel: 5\n  timeout_seconds: 300\n  retry_count: 2\n\n# 输出配置\noutput:\n  formats:\n    - \"markdown\"\n    - \"json\"\n    - \"excel\"\n  include_debug_info: false\n  anonymize_candidate: true\n  default_language: \"zh-CN\"\n\n# v3.3 Pro — 认知复盘配置\ncognitive_review:\n  # 矛盾检测引擎配置\n  contradiction_engine:\n    confidence_levels:\n      high:\n        description: \"明确的时间/数据冲突，需追问验证\"\n        action: \"标记为高优先级，建议面试官追问\"\n      medium:\n        description: \"角色/逻辑不一致，可能有合理解释\"\n        action: \"标注存疑，建议但不强制追问\"\n      low:\n        description: \"决策模糊/过度光滑，可能是正常现象\"\n        action: \"仅内部记录，不主动暴露\"\n    \n    contradiction_types:\n      - \"时间矛盾\"\n      - \"数据矛盾\"\n      - \"角色矛盾\"\n      - \"逻辑跳跃\"\n      - \"决策模糊\"\n      - \"过度光滑\"\n    \n    false_positive_filters:\n      - \"口语转写失真不计为矛盾\"\n      - \"记忆模糊≠说谎\"\n      - \"不同粒度的描述≠矛盾\"\n      - \"每条矛盾必须带置信度+免责声明\"\n  \n  # 认知解析维度\n  cognitive_dimensions:\n    - name: \"问题拆解\"\n      description: \"接到需求后如何结构化\"\n      signals:\n        positive: \"先问边界→拆子问题→排序\"\n        negative: \"直接跳答案/复述需求\"\n    - name: \"抽象能力\"\n      description: \"能否从具体案例提炼本质\"\n      signals:\n        positive: \"\\\"核心矛盾是X\\\"/\\\"本质上是Y问题\\\"\"\n        negative: \"只讲细节不提规律\"\n    - name: \"逻辑一致性\"\n      description: \"前后论述是否自洽\"\n      signals:\n        positive: \"论点→论据→结论链条完整\"\n        negative: \"前后立场漂移无解释\"\n    - name: \"真实性纹理\"\n      description: \"是否存在真实细节\"\n      signals:\n        positive: \"提到了意外/bug/临时妥协\"\n        negative: \"所有描述都是最佳实践\"\n    - name: \"不确定性处理\"\n      description: \"面对未知的反应\"\n      signals:\n        positive: \"坦诚\\\"这个我不确定，但我的推测是...\\\"\"\n        negative: \"硬编答案/含糊其辞\"\n    - name: \"修正能力\"\n      description: \"被challenge后如何调整\"\n      signals:\n        positive: \"接受质疑→重新思考→给出新视角\"\n        negative: \"防御性反驳/死不承认\"\n    - name: \"Ownership\"\n      description: \"是否主动推进问题\"\n      signals:\n        positive: \"\\\"后来我发现还有一个问题...\\\"\"\n        negative: \"等面试官问才说\"\n    - name: \"AI协同\"\n      description: \"如何描述AI使用过程\"\n      signals:\n        positive: \"提到了prompt迭代/失败尝试/边界判断\"\n        negative: \"笼统说\\\"用AI辅助\\\"\"\n  \n  # 追问深度评估\n  drill_depth:\n    level_1:\n      name: \"表层\"\n      description: \"复述/美化既有叙述\"\n      assessment: \"未穿透\"\n    level_2:\n      name: \"细节\"\n      description: \"能补充具体细节和数字\"\n      assessment: \"初步验证\"\n    level_3:\n      name: \"反思\"\n      description: \"承认不足、复盘决策过程\"\n      assessment: \"真实能力暴露\"\n    level_4:\n      name: \"重构\"\n      description: \"推翻原有叙述，给出新视角\"\n      assessment: \"高阶认知能力\"\n  \n  # 认知画像可信度\n  portrait_confidence:\n    high:\n      min_duration_minutes: 30\n      source: \"完整面试转录\"\n      usage: \"可直接用于定级辅助\"\n    medium:\n      min_duration_minutes: 15\n      source: \"面试记录\"\n      usage: \"建议补充更多信息\"\n    low:\n      min_duration_minutes: 0\n      source: \"简要笔记\"\n      usage: \"仅做参考，不做强推断\"\n\nArchive v3.2.0: 19 files, 55185 bytes\n\nFiles: config/evaluation_config.yaml (4491b), install.sh (3044b), main.py (19868b), modules/evaluation_engine.py (10829b), modules/file_parser.py (7797b), modules/interview_analyzer.py (6580b), modules/report_generator.py (12935b), modules/resume_audit.py (14356b), README.md (4676b), references/behavioral_anchors.md (7995b), references/calibration-cases.md (4463b), references/evaluation_matrices.md (7385b), references/interview_modules.md (5503b), references/output_templates.md (5342b), references/resume_audit.md (6305b), requirements.txt (159b), run.py (9754b), SKILL.md (8608b), _meta.json (135b)\n\nFile v3.2.0:SKILL.md\n\n---\nname: ai-talent-grader\nversion: 3.2.0\nlabel: AI人才定级专家\ndescription: >\n  基于简历、面试记录和JD，对候选人进行AI时代能力定级（L1-L4）。\n  核心能力：简历漏洞穿透审计、六维度评分卡、双乘数加权、测谎面试题生成、评分一致性校准。\n  Use when user asks to 评估候选人AI能力、AI人才定级、给候选人打AI级别、\n  面试后定级、AI能力评级、判断候选人AI水平、AI人才招聘评估、\n  候选人AI能力分级、L1到L4定级、AI岗位适配度评估、简历审计、生成测谎面试题.\n  不适用于绩效评估、晋升评审、员工培训需求分析或非AI相关的能力评估.\n---\n\n# AI 人才定级专家\n\n## 概述\n\n专业的 AI 人才定级评估专家。不再做\"简历打分器\"，而是做**简历审计师 + 测谎面试题生成器**。\n\n## 触发场景\n\n用户上传简历文件、面试评价记录或提出AI人才评估需求时自动触发。支持以下场景：\n\n| 场景 | 输入 | 输出 |\n|------|------|------|\n| 仅简历评估 | 一份简历 | 审计报告 + 测谎面试题 |\n| 完整定级 | 简历 + 面试记录 | 完整定级报告（含六维度评分和级别） |\n| 批量评估 | 多个候选人文件 | 对比分析汇总 |\n| 面试方案设计 | 上传岗位要求 | 生成面试方案和题库 |\n\n---\n\n## 核心架构\n\n### 输入模块\n- 支持格式：PDF、DOCX、TXT、JSON、YAML、Markdown\n- 自动识别文件类型并解析\n- 提取关键结构化信息\n\n### 评估引擎\n\n1. **简历漏洞穿透审计**（5项指标，详见 `references/resume_audit.md`）\n   - 高阶含金量审计\n   - 高势能低细节断层\n   - 因果链断裂检测\n   - AI生成痕迹识别\n   - 逻辑一致性校验\n\n2. **面试交叉验证**\n   - 测谎题覆盖度检查\n   - 疑点确认/排除标注\n   - \"待验证\"项标记\n\n3. **六维度AI能力评估**（每个维度 1-4 分，详见 `references/behavioral_anchors.md`）\n   - AI流利度\n   - 人机判断力\n   - 架构设计力\n   - 混合编排力\n   - 认知深度\n   - 问题建模能力\n\n4. **双乘数加权**\n   ```\n   最终能力 = 能力平均分 × 环境复杂度 × 个人杠杆率\n   ```\n   - 环境复杂度：低 ×0.7 / 中 ×1.0 / 高 ×1.2\n   - 个人杠杆率：低 ×0.7 / 中 ×1.0 / 高 ×1.3\n\n5. **成长速度调整**\n   - 高成长 +0.5 / 中不调整 / 低成长 -0.5\n\n6. **级别判定（唯一评分标准 v3.2）**\n\n   六维度各 1-4 分，先算**能力平均分**（1-4 分制），再**乘以 4**得到**综合得分**（4-16 分制）：\n\n   ```\n   能力平均分 = (AI流利度 + 人机判断力 + 架构设计力 + 混合编排力 + 认知深度 + 问题建模能力) / 6\n   综合得分 = 能力平均分 × 4\n   ```\n\n   | 综合得分（满分 16） | 能力平均分 | 级别 |\n   |---------------------|-----------|------|\n   | 4-7 | 1.00-1.75 | L1 · AI 工具使用者 |\n   | 8-11 | 1.76-2.75 | L2 · AI 协作者 |\n   | 12-14 | 2.76-3.50 | L3 · AI 架构者 |\n   | 15-16 | 3.51-4.00 | L4 · AI 战略者 |\n\n   > **铁律：全系统只认这一套分数映射。任何文件出现其他映射标准均为废弃。**\n\n7. **评分一致性检验（v3.2 新增）**\n   - **综合得分 ≥13 或 ≤7**：必须在报告中输出\"置信度说明\"\n   - **单维度分差 ≥2**（如 AI 流利度 L4 但人机判断力 L2）：必须标注\"非均衡型\"并解释\n   - **证据不足的维度**：标注\"信心不足\"并要求补充信息，不得强行打分\n   - **边界候选人**：对标 `references/calibration-cases.md` 中的参考案例\n\n---\n\n## 行为锚点升级说明（v3.2）\n\n`references/behavioral_anchors.md` 中每个级别的描述已升级为**充要条件**，不是示例。\n\n**关键规则**：\n- 达到该级别 → 必须满足该级别的所有\"必须满足\"条目\n- 仅满足行为描述但不满足充要条件 → 不得给到该级别\n- \"使用Copilot写代码\" → 如果没有 prompt 迭代/输出审校证据 → **只能是 L1**\n- \"通过调整prompt模板\" = \"迭代优化prompt\" → 语义相同，应判同一级别\n\n**边界模糊处理**：\n- 优先看**量化证据**（\"提升到85%\" > \"有提升\"）\n- 优先看**反思/复盘证据**（\"总结了X教训\" > \"做了X\"）\n- 都没有 → **往低级别打**\n\n---\n\n## 参考案例校准（v3.2 新增）\n\n评估边界候选人时，必须参考 `references/calibration-cases.md` 中的 5 个校准案例：\n- 案例 A：明确 L1\n- 案例 B：明确 L2\n- 案例 C：明确 L3\n- 案例 D：边界 L2/L3\n- 案例 E：边界 L3/L4\n\n**不同实例对同一参考案例应输出完全一致的定级结果。**\n\n---\n\n## 防幻觉铁律（P0）\n\n| 规则 | 说明 |\n|------|------|\n| 禁止脑补姓名/公司/职位 | 未提供时用\"候选人A/B\"或\"[未提供]\"标注 |\n| 禁止捏造数据/指标 | 没有具体数字就标注\"未提及\" |\n| 禁止虚构经历/项目 | \"使用AI工具\" ≠ \"主导AI项目\" |\n| 禁止过度推断 | \"参与\" ≠ \"主导\"，\"使用\" ≠ \"精通\" |\n| 不确定性必须标注 | 无法确认的判断必须在报告中明确标注 |\n\n**违反以上任意一条 = 本次评估无效。**\n\n## 冲突处理优先级\n\n> 实测表现 > 面试口述 > 简历描述\n\n## 非均衡型候选人判定\n\n| 情况 | 处理 |\n|------|------|\n| 综合L2，但某一维度L3+ | 标注\"潜力型：{维度名}突出\" |\n| 综合L3，但某一维度L1 | 标注\"短板型：{维度名}薄弱\" |\n| L4候选 | 必须架构设计力≥3且人机判断力≥3，否则降为L3 |\n\n## 打分纪律\n\n- 单维度最高给 3 分，除非有极强组织级影响力证据\n- L4 极稀缺，候选人有亮点 ≠ L4\n- 双乘数加权必须执行，缺一不可\n- 认知深度检查是必经步骤\n- 简历审计是必经步骤：不经过漏洞穿透审计，不得打分\n\n## 已知坑点\n\n1. 工具数量 ≠ 能力，看怎么用\n2. \"使用AI辅助\"是废话，除非有具体案例\n3. L4 极稀缺，候选人有亮点 ≠ L4\n4. 面试记录只有结论没过程 → 降权\n5. 信息不足就标注不足，不脑补\n6. 验证通过≠高分：做了某事≠做得好\n7. 项目Owner≠架构师：大公司\"主导\"可能是执行层面的\n8. 表达≠协同：口头啰嗦不代表落地能力差\n9. 复杂度×杠杆率才是真实含金量\n10. 做过≠真懂：必须过认知深度4项检查\n11. 杠杆率是隐藏因子：大厂执行者可能加权更低\n12. 问题建模是最稀缺能力：模糊需求→AI系统\n13. 年限是参考不是铁律：2年高成长可破格\n14. AI简历有致命弱点：善于宏大叙事但无法编造完全自洽的商业细节\n15. 高势能低细节是红旗：框架完美但缺乏独特长尾细节→AI生成嫌疑极高\n16. AI应该做侦探不做判卷老师：核心输出是测谎面试题，不是简历打分\n17. **v3.2 统一评分标准**：全系统只认\"平均分→×4→综合得分→查表\"一条路径，其他分数映射均为废弃\n18. **行为锚点=充要条件**：不是示例，是必须满足的最低标准\n19. **边界候选人必须对标参考案例**：不能凭感觉打\n20. **自动推断得分仅供参考**：`_infer_dimension_scores` 仅做基础兜底，用户应手动通过 `--scores` 指定维度得分\n\n---\n\n## 程序化使用（CLI）\n\n```bash\n# 单次评估（仅简历）\npython main.py audit --resume 简历.pdf\n\n# 完整定级（简历 + 面试）\npython main.py evaluate --resume 简历.pdf --interview 面试记录.txt\n\n# 指定公司背景\npython main.py evaluate --resume 简历.pdf --interview 面试记录.txt \\\n    --env high --leverage high --growth high\n\n# 批量处理\npython main.py batch --input-dir candidates/ --output-dir reports/\n\n# 指定维度得分（推荐）\npython main.py evaluate --resume 简历.pdf --interview 面试记录.txt \\\n    --scores scores.json\n```\n\nscores.json 格式：\n```json\n{\n  \"ai_fluency\": 3.0,\n  \"human_ai_judgment\": 2.5,\n  \"architecture_design\": 3.0,\n  \"hybrid_orchestration\": 3.0,\n  \"cognitive_depth\": 2.5,\n  \"problem_modeling\": 3.0\n}\n```\n\n---\n\n## 参考文件\n\n| 文件 | 说明 |\n|------|------|\n| `references/resume_audit.md` | 简历漏洞穿透审计详细指南 |\n| `references/behavioral_anchors.md` | L1-L4 每个维度的行为锚点（v3.2 充要条件版） |\n| `references/evaluation_matrices.md` | 完整评估矩阵（复杂度/杠杆率/认知深度/问题建模/成长速度） |\n| `references/interview_modules.md` | 四模块面试题库 + 评分细则 |\n| `references/output_templates.md` | 定级报告标准输出模板 |\n| `references/calibration-cases.md` | **评分一致性校准案例库**（v3.2 新增） |\n\nFile v3.2.0:README.md\n\n# AI人才定级专家 - ClawHub Skill\n\n## 概述\n这是一个专为 ClawHub 平台设计的 AI 人才定级评估 skill。用户上传简历和面试评价后，自动执行一站式评估，输出结构化定级报告。\n\n**核心定位**：简历审计师 + 测谎面试题生成器\n\n## 使用方式\n1. 在 ClawHub 平台导入此 skill\n2. 上传简历文件（PDF/DOCX/TXT/MD/JSON/YAML）\n3. （可选）上传面试记录文件\n4. 系统自动执行评估并输出报告\n\n## 核心功能\n- **简历漏洞穿透审计**：5项指标检测AI简历的致命弱点\n- **六维度AI能力评估**：全面评估候选人能力\n- **双乘数加权系统**：考虑环境复杂度和个人杠杆率\n- **成长速度评估**：年限软约束，重视成长潜力\n- **测谎面试题生成**：为HR定制验证性问题\n- **防幻觉铁律**：严格遵守P0规则，避免AI幻觉\n\n## 评估流程\n\n### 模式A：仅简历审计\n1. 简历漏洞穿透审计（5项指标）\n2. 生成定制化测谎面试题\n3. 输出审计报告\n\n### 模式B：完整定级\n1. 简历漏洞穿透审计\n2. 面试交叉验证\n3. 六维度AI能力打分\n4. 双乘数加权计算\n5. 成长速度调整\n6. 级别判定\n7. 输出完整报告\n\n## 输出示例\n\n### 仅简历审计报告\n```markdown\n# AI人才简历审计报告\n\n## 基本信息\n- 评估时间: 2024-01-15 14:30:00\n- 候选人: CAND001\n- 审计模式: 仅简历审计\n- 数据来源: resume.pdf\n\n## 一、简历漏洞穿透审计\n### 1.1 高阶含金量审计\n- 疑点: 声称增长200%但无行业基线对比\n- 结论: 中嫌疑\n\n### 1.2 高势能低细节断层\n- 断层: 项目描述框架完美但缺乏独特长尾细节\n- 建议追问: 请描述实现过程中的具体技术挑战\n\n## 二、综合审计结论\n| 指标 | 结果 |\n|------|------|\n| 高阶含金量 | 中嫌疑 |\n| 细节断层 | 高嫌疑 |\n| 因果链 | 低嫌疑 |\n| AI痕迹 | 中嫌疑 |\n| 逻辑一致性 | 低嫌疑 |\n| **综合结论** | **中嫌疑** |\n| 审计可信度 | 85% |\n\n## 三、定制化测谎面试题\n### 追问1（细节追问）\n> 在项目X中，你提到使用了Y技术。请描述当时有哪几个备选方案？为什么最终选择了这个？\n\n### 追问2（边界条件）\n> 关于技术Y，在什么场景下它表现最好？什么场景下会失效？\n\n### 追问3（决策还原）\n> 关于成果Z，这个目标是怎么定出来的？为什么是这个数字？\n```\n\n### 完整定级报告\n```markdown\n# AI人才完整定级报告\n\n## 基本信息\n- 候选人ID: CAND001\n- 评估时间: 2024-01-15 14:30:00\n- 数据来源: resume.pdf, interview.txt\n- 评估模式: 完整定级\n\n## 一、简历审计结果\n- 审计结论: 中嫌疑\n- 高嫌疑指标: 2项\n- 中嫌疑指标: 3项\n\n## 二、面试交叉验证\n| 状态 | 数量 |\n|------|------|\n| 已确认（存疑） | 1 |\n| 已排除 | 2 |\n| 待验证 | 3 |\n| 未覆盖 | 1 |\n\n## 三、六维度评估\n| 维度 | 得分(1-4) | 认知层级 |\n|------|-----------|---------|\n| AI流利度 | 3 | L3 |\n| 人机判断力 | 2 | L2 |\n| 架构设计力 | 3 | L3 |\n| 混合编排力 | 2 | L2 |\n| 认知深度 | 3 | L3 |\n| 问题建模能力 | 2 | L2 |\n\n**能力平均分**: 2.5\n\n## 四、加权计算\n| 因子 | 等级 | 系数/调整 |\n|------|------|----------|\n| 环境复杂度 | 中 | ×1.0 |\n| 个人杠杆率 | 高 | ×1.3 |\n| 成长速度 | 中 | 0 |\n\n**加权后得分**: (2.5 × 1.0 × 1.3) × 4 = 13.0\n\n## 五、定级结果\n| 项目 | 内容 |\n|------|------|\n| **最终级别** | **L3** |\n| 级别名称 | AI架构者 |\n| P序列参考 | P6-P7 |\n| 级别定义 | 设计AI驱动的业务流程，评估ROI |\n\n## 六、风险提示\n### 高风险项\n- 项目细节不足，需进一步验证\n- 部分技术描述存在标准化模板语言\n\n### 建议验证点\n- 实际项目经验\n- 技术决策过程\n```\n\n## 文件说明\n- `SKILL.md` - 完整的skill定义，包含所有评估逻辑和规则\n- `README.md` - 使用说明文档\n- `main.py` - 示例程序（可选）\n- `config/` - 配置文件目录\n- `modules/` - 模块化代码目录\n- `references/` - 参考文档目录\n\n## 技术特点\n1. **防幻觉设计**：严格遵守P0规则，禁止脑补、捏造、过度推断\n2. **可解释性**：每个评估步骤都有明确依据\n3. **可配置**：支持环境参数、权重调整\n4. **可扩展**：模块化设计，易于添加新评估维度\n\n## 注意事项\n1. 评估结果基于所提供材料，建议结合面试验证\n2. 环境参数（复杂度/杠杆率）可从简历中推断，但用户提供更准确\n3. L4级别极稀缺，需严格满足硬性门槛\n4. 测谎面试题是核心输出，建议在后续面试中使用\n\n## 许可证\nMIT License\n\nFile v3.2.0:_meta.json\n\n{\n  \"ownerId\": \"kn70tx725606ywwb5gfj0vpxjx83admr\",\n  \"slug\": \"ai-talent-grader\",\n  \"version\": \"3.2.0\",\n  \"publishedAt\": 1779682875550\n}\n\nFile v3.2.0:references/behavioral_anchors.md\n\n# L1-L4 行为锚点（v3.2 充要条件版）\n\n> **v3.2 关键升级：以下\"必须满足\"是达到该级别的充要条件，不是示例。达到该级别 → 必须满足该级别的所有\"必须满足\"条目。**\n\n## 级别总览\n\n| 级别 | 名称 | 一句话定义 | P序列参考 |\n|------|------|-----------|----------|\n| L1 | AI工具使用者 | 能用工具完成指定任务 | P1-P3 |\n| L2 | AI协作者 | 能审校输出、识别幻觉 | P4-P5 |\n| L3 | AI架构者 | 设计AI驱动的业务流程，评估ROI | P6-P7 |\n| L4 | AI战略者 | 定义AI与业务边界，规划组织演进 | P8+ |\n\n---\n\n## 维度一：AI流利度\n\n### L1 · AI工具使用者\n\n**充要条件（必须全部满足）：**\n- 能独立使用至少 1 个常用 AI 工具完成基础任务\n- 对 AI 能力边界没有清晰认知，或未表现出边界意识\n\n**典型行为描述（简历/面试）：**\n- \"使用ChatGPT辅助撰写文案\"\n- \"用Copilot写代码，提高效率\"\n- \"工作中会用到AI工具辅助\"\n\n**边界判定：** 仅提到\"使用AI工具\"，没有任何 prompt 迭代/输出审校/多工具组合的证据 → **只能判 L1**\n\n---\n\n### L2 · AI协作者\n\n**充要条件（必须全部满足）：**\n- **有 prompt 迭代行为**：不是只用默认 prompt，能根据输出调整表述\n- **有输出审校意识**：能判断 AI 输出是否满足需求，不是直接拿来就用\n- 以上两项必须有**具体证据**（不是\"会用AI\"，而是\"我怎么用、调了什么\"）\n\n**典型行为描述：**\n- \"通过调整prompt模板，将AI生成内容的通过率从60%提升到85%\"\n- \"组合使用ChatGPT+Midjourney+Canva完成营销方案\"\n- \"会审核AI输出的准确性，对关键数据做二次核实\"\n\n**边界判定：**\n- \"我用Copilot写代码\"但无迭代/审校证据 → **L1**（不是 L2）\n- \"通过调整prompt\" = \"迭代优化prompt\" = \"修改prompt以获得更好结果\" → **同一级别，不得因措辞不同判不同级别**\n\n---\n\n### L3 · AI架构者\n\n**充要条件（必须全部满足）：**\n- **能设计团队级 AI 工作流**：不是个人使用，而是设计流程让团队用\n- **能做工具选型判断**：评估过多个 AI 工具/模型的优劣并给出选择依据\n- **能定义质量标准**：为 AI 输出制定验收标准或审校流程\n\n**典型行为描述：**\n- \"主导团队引入AI工作流，设计了prompt库和审校标准\"\n- \"评估了ChatGPT/Claude/国产大模型，选定最优方案落地\"\n- \"AI输出的内容由我制定质量标准和验收流程\"\n\n**边界判定：** 个人用得好 ≠ L3。必须有**团队/流程/标准**三要素之一。\n\n---\n\n### L4 · AI战略者\n\n**充要条件（必须全部满足）：**\n- **能预判 AI 能力演进趋势**并据此调整业务预期或资源分配\n- **能定义 AI 能力边界**：明确\"哪些能做/哪些需要等/哪些永远需要人\"\n- **有组织级影响力**：制定了组织级 AI 规划或政策\n\n**典型行为描述：**\n- \"预判了GPT-4对客服场景的颠覆，提前6个月完成知识库升级\"\n- \"制定了部门AI能力3年规划，分阶段推进人机协作转型\"\n- \"定义了AI应用的边界红线，确保核心决策保留人工环节\"\n\n**边界判定：** 仅做到\"用得多\"或\"做得好\"≠ L4。必须有**预判/规划/定义边界**的组织级证据。\n\n---\n\n## 维度二：人机判断力\n\n### L1 · 无意识\n\n**充要条件：**\n- 拿到 AI 输出直接使用，不做验证\n- 或：无任何关于审校、验证、质疑 AI 输出的描述\n\n---\n\n### L2 · 基础审校\n\n**充要条件（必须全部满足）：**\n- **知道 AI 可能出错**\n- **会对关键信息做核实**（哪怕只是\"核对一下数字\"）\n\n**边界判定：** \"我会检查\"但说不检查什么、怎么检查 → **L1-L2 之间，往低打（L1）**\n\n---\n\n### L3 · 系统性兜底\n\n**充要条件（必须全部满足）：**\n- **设计了兜底机制**：不是偶尔检查，是有流程/清单/节点\n- **能识别 AI 幻觉模式**：知道 AI 常犯哪类错（数字错、引用虚构、时间错乱等）\n- **有复盘迭代习惯**：基于 AI 失误改进 prompt 或流程\n\n**边界判定：** 个人会检查 ≠ L3。必须有**系统性/流程化/可复用**的证据。\n\n---\n\n### L4 · 不确定下判断\n\n**充要条件（必须全部满足）：**\n- **能在信息不全时判断是否信任 AI 输出**\n- **有成熟的 AI 风险管理框架**\n- **能向非技术背景的人解释 AI 局限**\n\n---\n\n## 维度三：架构设计力\n\n### L1 · 无\n\n**充要条件：**\n- 没有设计过任何 AI 相关的系统性方案\n\n---\n\n### L2 · 单点应用设计\n\n**充要条件（必须全部满足）：**\n- **针对单一场景设计过 AI 应用方案**\n- 方案包含基本的问题定义 → 工具选型 → 实施路径\n\n**边界判定：** 只是\"用过某个 AI 工具\"≠ L2。必须有**设计/规划**行为。\n\n---\n\n### L3 · 业务级架构\n\n**充要条件（必须全部满足）：**\n- **设计了跨多环节的 AI 业务流程**（不是单点）\n- **方案包含 ROI 测算或风险识别**\n- **能清晰定义 AI 的角色边界**（做什么、不做什么）\n\n---\n\n### L4 · 系统协同架构\n\n**充要条件（必须全部满足）：**\n- **设计了多系统/多 Agent 协同的整体架构**\n- **规划了人 + AI Agent 的角色重新分配**\n- **将 AI 架构与组织变革结合**\n\n---\n\n## 维度四：混合编排力\n\n### L1 · 单独使用\n\n**充要条件：**\n- 单独使用一个 AI 工具，不会组合\n\n---\n\n### L2 · 工具组合\n\n**充要条件（必须全部满足）：**\n- **能编排 2-3 个 AI 工具形成工作流**\n- **能处理工具间的衔接问题**\n\n---\n\n### L3 · 复杂编排\n\n**充要条件（必须全部满足）：**\n- **能编排 5 个以上 AI 工具或平台**\n- **设计了包含人工环节的混合工作流**\n- **有工具失效时的降级方案**\n\n---\n\n### L4 · 组织级编排\n\n**充要条件（必须全部满足）：**\n- **设计了人的角色重新分配方案**\n- **规划了从\"人做事\"到\"人管AI做事\"的转型路径**\n- **能处理人机责任边界、绩效归属等复杂问题**\n\n---\n\n## 维度五：认知深度\n\n**打分前必过 4 项检查：①为什么选 ②tradeoff ③debug ④底层机制**\n\n| 层级 | 表现 | 分数上限 |\n|------|------|---------|\n| L1 表面使用 | 知道工具怎么用，不知道为什么 | 最高 1 分 |\n| L2 知其然 | 能调参优化，但不理解底层 | 最高 2 分 |\n| L3 知其所以然 | 理解 tradeoff，能 debug，知道底层机制 | 可达 3-4 分 |\n| L4 系统化认知 | 能解释整个技术栈 tradeoff，能指导他人 | 可达 4 分 |\n\n---\n\n## 维度六：问题建模能力\n\n| 等级 | 表现 | 典型信号 |\n|------|------|---------|\n| L1 接需求 | 等别人给明确需求 | \"运营让我做一个问答机器人\" |\n| L2 拆需求 | 把模糊需求拆成技术任务 | \"运营说要做AI，我拆成知识库+RAG+Agent三步\" |\n| L3 重构流程 | 发现原流程问题，重新设计 | \"运营瓶颈不在执行在决策，我做了分析Agent\" |\n| L4 AI-native | 从0设计AI原生业务模式 | \"我重新设计了整个运营流程，AI 80% 人 20%\" |\n\n---\n\n## 跨级别常见误区\n\n### 误区1：把\"工具多\"当\"能力强\"\n- L1候选人也可能用很多工具（ChatGPT + Copilot + Midjourney + ...）\n- 关键是\"怎么用的\"而非\"用了多少\"\n\n### 误区2：把\"参与AI项目\"当\"AI能力\"\n- \"项目用了AI技术\" ≠ 候选人具备AI能力\n- 要看候选人在项目中扮演什么角色\n\n### 误区3：把\"年限长\"当\"级别高\"\n- 工作5年但只是重复L1的工作模式 → 仍是L1\n- 工作2年但高成长+高杠杆 → 可达L3\n\n### 误区4：把\"大厂背景\"当\"高能力\"\n- 大厂执行者可能因为低杠杆反而加权更低\n- 小厂高杠杆可能加权后级别更高\n\n### 误区5：把\"简历写得好\"当\"能力强\"\n- AI简历有致命弱点：宏大叙事但缺乏长尾细节\n- 必须经过简历漏洞穿透审计才能打分\n\nFile v3.2.0:references/calibration-cases.md\n\n# 评分一致性校准案例库（v3.2 新增）\n\n> **使用方法**：评估边界候选人时，找到最接近的参考案例对标定级。不同实例对同一案例应输出一致的定级结果。\n\n---\n\n## 案例 A：明确 L1（基准锚点）\n\n**背景**：3年工作经验，简历写\"使用ChatGPT辅助撰写文案\"\"用AI工具提高工作效率\"，面试中能说出用过哪些工具，但无任何 prompt 迭代/输出审校/多工具组合的具体案例。\n\n**关键特征**：\n- 只有\"使用\"描述，无迭代证据\n- 无审校/验证意识\n- 无架构/流程设计经验\n- 工具数量 ≠ 能力深度\n\n**定级**：L1（AI 工具使用者）\n\n**为什么不是 L2**：不满足 L2 充要条件——无 prompt 迭代行为、无输出审校意识。\n\n---\n\n## 案例 B：明确 L2（基准锚点）\n\n**背景**：5年工作经验，能针对具体任务迭代 prompt（\"调整了3版 prompt 才得到满意结果\"），会审核 AI 输出（\"关键数据我会二次核实\"），组合使用 2-3 个 AI 工具完成工作流。但无团队级 AI 工作流设计经验。\n\n**关键特征**：\n- 有明确的 prompt 迭代证据\n- 有输出审校行为\n- 能组合 2-3 个工具\n- 个人层面做得好，但无团队/流程/标准设计\n\n**定级**：L2（AI 协作者）\n\n**为什么不是 L3**：不满足 L3 充要条件——无团队级 AI 工作流设计、无工具选型判断（评估多个模型并给出依据）、无质量标准定义。\n\n---\n\n## 案例 C：明确 L3（基准锚点）\n\n**背景**：8年工作经验，主导设计过跨多环节的 AI 业务流程（如\"智能客服+知识库+人工复核\"方案），做过工具选型（\"对比了 ChatGPT/Claude/国产大模型，选定最优方案\"），为团队制定了 AI 输出质量标准和审校流程。能清晰定义 AI 在流程中的角色边界。\n\n**关键特征**：\n- 有跨多环节 AI 流程设计经验\n- 有 ROI 测算或风险识别\n- 能定义 AI 的角色边界（做什么、不做什么）\n- 有团队级影响力（制定标准/流程）\n\n**定级**：L3（AI 架构者）\n\n**为什么不是 L4**：不满足 L4 充要条件——无预判 AI 演进趋势并调整业务预期的证据、无组织级 AI 规划/政策制定。\n\n---\n\n## 案例 D：边界 L2/L3（典型模糊场景）\n\n**背景**：6年工作经验，个人 AI 能力很强（prompt 迭代熟练、多工具组合、能审校输出），也开始带小团队（3人），给团队分享过 AI 使用经验。但尚未设计过正式的团队级 AI 工作流标准，也未做过系统性的工具选型评估。\n\n**关键特征**：\n- 个人能力强（L2 充要条件全部满足）\n- 开始带团队，有分享行为\n- 但无正式的流程设计/标准制定/工具选型证据\n\n**判定规则**：\n- 有\"团队分享\"≠ \"设计团队工作流\"→ 不满足 L3 充要条件\n- **往低打，判 L2**，标注\"潜力型：接近 L3\"\n- 理由：L3 要求\"设计团队级 AI 工作流\"或\"做工具选型判断\"或\"定义质量标准\"，三者至少满足其一。仅\"分享经验\"不够。\n\n**定级**：L2（AI 协作者），潜力型：接近 L3\n\n---\n\n## 案例 E：边界 L3/L4（典型模糊场景）\n\n**背景**：10年工作经验，设计过公司级 AI 架构（多 Agent 协同平台），能定义\"哪些场景 AI 能做、哪些需要等\"。但尚未制定组织级 AI 能力发展规划，也未预判过 AI 趋势并提前调整资源分配。\n\n**关键特征**：\n- 有公司级 AI 架构设计经验（L3 充要条件满足）\n- 能定义 AI 能力边界（接近 L4）\n- 但无组织级 AI 规划/政策制定证据\n- 无预判 AI 趋势并调整业务预期的证据\n\n**判定规则**：\n- L4 要求\"预判趋势并调整业务预期\"+\"组织级 AI 规划\"+\"定义 AI 能力边界\"，三者必须全部满足\n- 本案例只满足\"定义边界\"一项\n- **往低打，判 L3**，标注\"潜力型：接近 L4\"\n\n**定级**：L3（AI 架构者），潜力型：接近 L4\n\n---\n\n## 校准规则速查\n\n| 场景 | 规则 |\n|------|------|\n| 语义接近的行为描述 | 看是否有量化证据（\"提升到85%\" > \"有提升\"） |\n| 无量化证据时 | 看是否有反思/复盘证据（\"总结了X教训\" > \"做了X\"） |\n| 两者都没有 | 往低级别打 |\n| L4 判定 | 必须三项充要条件全部满足，缺一不可 |\n| L3 判定 | 必须三项充要条件全部满足，缺一不可 |\n| L2 判定 | 必须两项充要条件全部满足，缺一不可 |\n\nFile v3.2.0:references/evaluation_matrices.md\n\n# 完整评估矩阵\n\n## 六维度评估标准\n\n### 维度1：AI流利度（工具掌握深度 + 认知深度检查）\n\n| 分数 | 行为描述 | 典型信号 |\n|------|---------|---------|\n| 1 | 会用1-2个AI工具完成明确任务 | 用ChatGPT写文案，用Copilot补全代码 |\n| 2 | 能对比选择不同AI工具，会调参优化 | 根据任务选不同模型，会写prompt模板 |\n| 3 | 能训练/微调模型，构建工具链 | 自己搭RAG，做模型fine-tune，用LangChain |\n| 4 | 能设计AI工具架构，影响团队工具选型 | 为公司制定AI工具标准，自研AI工具 |\n\n**认知深度检查**：\n- L1上限：只是\"会用\"，不知道为什么这个工具好\n- L2上限：能调参但不知道底层原理\n- L3可达：理解token/embedding/attention，能解释为什么这个prompt有效\n- L4可达：能从原理层面对比模型，指导他人选型\n\n---\n\n### 维度2：人机判断力（边界意识 + 兜底机制 + 认知深度）\n\n| 分数 | 行为描述 | 典型信号 |\n|------|---------|---------|\n| 1 | 完全信任AI输出，不做验证 | 直接使用AI生成的代码/文案 |\n| 2 | 能识别明显错误，有基本验证习惯 | 检查代码是否有语法错误 |\n| 3 | 建立验证机制，知道什么场景AI不可靠 | 为AI输出设计测试用例，设置人工审核节点 |\n| 4 | 设计人机协作流程，定义AI边界 | 为公司设计AI使用规范，定义\"AI能做/不能做\" |\n\n**认知深度检查**：\n- L1上限：只是\"检查一下\"，无系统方法\n- L2上限：能发现问题但不理解AI为什么出错\n- L3可达：理解幻觉原因（训练数据、概率生成），设计针对性验证\n- L4可达：从组织层面定义AI边界，设计人机协作流程\n\n---\n\n### 维度3：架构设计力（系统设计 + Tradeoff理解 + 认知深度）\n\n| 分数 | 行为描述 | 典型信号 |\n|------|---------|---------|\n| 1 | 能在现有架构下完成功能开发 | 按已有规范写代码 |\n| 2 | 能设计中复杂度模块，理解基本设计模式 | 设计API接口，做数据库表设计 |\n| 3 | 能从0设计系统架构，清楚每个组件的Tradeoff | 设计微服务拆分，做容量规划，画架构图 |\n| 4 | 能设计组织级技术架构，影响公司技术方向 | 制定公司技术规范，领导跨团队架构升级 |\n\n**认知深度检查**：\n- L1上限：只会照搬现有模式\n- L2上限：能设计但不理解为什么这么设计\n- L3可达：每个架构决策都能讲出Tradeoff（为什么不用微服务/为什么不用NoSQL）\n- L4可达：能从业务演进角度设计可演进的架构\n\n---\n\n### 维度4：混合编排力（跨工具/跨部门协同 + 协同推进）\n\n| 分数 | 行为描述 | 典型信号 |\n|------|---------|---------|\n| 1 | 在自己熟悉的工具栈内完成任务 | 只用Python+熟悉的库 |\n| 2 | 能组合多个工具/API完成复杂任务 | Python调用多个API，用不同工具组合 |\n| 3 | 设计跨工具链工作流，推动跨部门协同 | 设计AI工作流（RAG+Agent+自动化），协调产品/运营/技术 |\n| 4 | 重构组织级协作流程，定义新的工作模式 | 推动公司从\"人做\"变为\"AI做+人审\" |\n\n**认知深度检查**：\n- L1上限：只在自己的舒适区工作\n- L2上限：会组合工具但不会设计流程\n- L3可达：能说清\"为什么这个环节用A工具，那个环节用B工具\"\n- L4可达：能量化评估人机协作效率，推动组织变革\n\n---\n\n### 维度5：认知深度（为什么做/Tradeoff/Debug/底层机制）\n\n| 层级 | 表现 | 分数上限 |\n|------|------|---------|\n| L1 表面使用 | 知道工具怎么用，不知道为什么 | 1 |\n| L2 知其然 | 能调参优化，但不理解底层 | 2 |\n| L3 知其所以然 | 理解Tradeoff，能Debug，知道底层机制 | 3-4 |\n| L4 系统化认知 | 能解释整个技术栈Tradeoff，能指导他人 | 4 |\n\n**必过4项检查**：\n1. 为什么选这个方案？\n2. 知不知道Tradeoff？\n3. 出问题怎么Debug？\n4. 理解底层机制吗？\n\n---\n\n### 维度6：问题建模能力（接需求→拆需求→重构流程→AI-native→重构组织）\n\n| 等级 | 表现 | 典型信号 |\n|------|------|---------|\n| L1 接需求 | 等别人给明确需求 | \"运营让我做一个问答机器人\" |\n| L2 拆需求 | 把模糊需求拆成技术任务 | \"运营说要做AI，我拆成知识库+RAG+Agent三步\" |\n| L3 重构流程 | 发现原流程问题，重新设计 | \"运营瓶颈不在执行在决策，我做了分析Agent\" |\n| L4 AI-native | 从0设计AI原生业务模式 | \"我重新设计了整个运营流程，AI 80% 人 20%\" |\n\n---\n\n## 环境复杂度评估\n\n### 低复杂度（×0.7）\n- 个人项目/开源项目\n- 团队规模 < 5人\n- 非技术密集型行业\n- 业务逻辑简单\n- 无合规/监管要求\n\n### 中复杂度（×1.0）\n- A/B轮创业公司\n- 团队规模 5-50人\n- 有一定技术挑战\n- 业务逻辑中等复杂\n- 用户量 10万-100万\n\n### 高复杂度（×1.2）\n- 上市互联网公司\n- 团队规模 > 50人或跨团队协作\n- 高并发/高可用要求\n- 受监管行业（金融/医疗）\n- 用户量 > 100万\n- 多业务线/多产品矩阵\n\n---\n\n## 个人杠杆率评估\n\n### 低杠杆率（×0.7）\n**模块执行者**\n- 在明确框架下完成分配任务\n- 技术方案由他人确定\n- 影响范围限于自己或小团队\n- 日常工作以\"接任务→完成\"为主\n- 不参与技术选型和架构决策\n\n### 中杠杆率（×1.0）\n**项目Owner**\n- 主导单个项目或模块的全生命周期\n- 有技术选型权\n- 影响范围跨团队（2-3个团队）\n- 对项目结果负责\n- 需要协调资源\n\n### 高杠杆率（×1.3）\n**一人AI部门/全栈架构师**\n- 从0到1设计业务流程\n- 跨部门资源协调\n- 影响范围达组织级\n- 技术决策影响公司方向\n- 定义团队工作方式和技术标准\n\n### 极端情况\n- 大厂低杠杆 = 1.2 × 0.7 = ×0.84（反而减分）\n- 小厂高杠杆 = 1.0 × 1.3 = ×1.3（加分显著）\n\n---\n\n## 成长速度评估\n\n### 高成长（+0.5）\n- 开源贡献/技术博客/内部分享有实际产出\n- 跨2-3个技术栈迁移且有成果\n- 持续实验，多个项目从实验到落地\n- 学习速度明显快于同龄人\n- 能将A领域的经验创造性迁移到B领域\n\n### 中成长（±0）\n- 主动学习但停留在\"学了\"阶段\n- 主要深耕1-2个技术栈\n- 有1-2个实验项目但未广泛落地\n- 学习速度正常\n\n### 低成长（-0.5）\n- 被动学习（等公司培训/等别人教）\n- 只会一个技术栈且无拓展意愿\n- 无自驱实验项目\n- 学习速度慢于同龄人\n\n### 破格规则\n> 2年经验 + 高成长 + 高杠杆 → 可达L3\n> 判断优先级：实际能力证据 > 成长速度 > 工作年限\n\n---\n\n## 计算示例\n\n### 示例1：创业公司全栈工程师\n- 能力平均分：2.5\n- 环境复杂度：中（1.0）\n- 个人杠杆率：高（1.3）\n- 成长速度：高（+0.5）\n- 计算：(2.5 × 1.0 × 1.3) + 0.5 = 3.25 + 0.5 = 3.75\n- 加权得分：3.75 × 4 = 15.0\n- 级别：L4（需验证架构设计力≥3和人机判断力≥3）\n\n### 示例2：大厂初级工程师\n- 能力平均分：2.5\n- 环境复杂度：高（1.2）\n- 个人杠杆率：低（0.7）\n- 成长速度：中（0）\n- 计算：(2.5 × 1.2 × 0.7) + 0 = 2.1\n- 加权得分：2.1 × 4 = 8.4\n- 级别：L2\n\n> 同样的能力分，环境×杠杆率不同，结果差异巨大\n\nFile v3.2.0:references/interview_modules.md\n\n# 面试题库与评分细则\n\n## 模块一：AI流利度面试\n\n### 基础题（L1-L2区分）\n\n1. **请描述你日常使用AI工具的方式和频率。**\n   - L1信号：主要是ChatGPT问答、代码补全\n   - L2信号：根据不同任务选择不同工具，有固定的prompt模板\n\n2. **用过的AI工具中，哪个让你印象最深？为什么？**\n   - L1信号：回答停留在功能层面\n   - L2信号：能对比不同工具的优劣，说出选择理由\n\n### 进阶题（L2-L3区分）\n\n3. **如果让你为公司选一个AI工具栈，你会怎么选？考虑哪些因素？**\n   - L2信号：列出工具但缺乏系统性思考\n   - L3信号：考虑成本/隐私/集成/学习曲线等多维度，有决策框架\n\n4. **你如何评估一个新AI工具是否值得引入？**\n   - L2信号：试用后凭感觉判断\n   - L3信号：有评估框架（ROI/团队适配/维护成本等）\n\n### 高阶题（L3-L4区分）\n\n5. **如果让你设计一个团队级别的AI使用规范，你会包含哪些内容？**\n   - L3信号：技术层面的规范（用什么工具、怎么写prompt）\n   - L4信号：包含安全/合规/人机分工/效果评估等全方位规范\n\n### 评分细则\n\n| 分数 | 表现 |\n|------|------|\n| 1 | 只会用基础工具，表达停留在功能层面 |\n| 2 | 能主动选择工具，有自己的使用心得 |\n| 3 | 有工具评估框架，能系统性思考工具链 |\n| 4 | 能设计规范，影响他人和团队 |\n\n---\n\n## 模块二：人机判断力面试\n\n### 基础题（L1-L2区分）\n\n1. **你遇到过AI输出错误的情况吗？怎么处理的？**\n   - L1信号：没太注意/偶尔发现一两次\n   - L2信号：能举出具体案例，有检查的习惯\n\n2. **你怎么判断AI给的建议是否靠谱？**\n   - L1信号：看起来合理就信了\n   - L2信号：有检查清单（检查逻辑/数据来源/运行测试等）\n\n### 进阶题（L2-L3区分）\n\n3. **请设计一个验证AI输出质量的方法。**\n   - L2信号：人工抽查/简单对比\n   - L3信号：自动化验证流程/设定质量指标/建立反馈机制\n\n4. **什么场景下你会选择不用AI？为什么？**\n   - L2信号：回答模糊\n   - L3信号：能说出具体场景（高精度/合规/创造性决策等）及原因\n\n### 高阶题（L3-L4区分）\n\n5. **如果让你制定一个部门的AI使用边界，你会怎么定义\"AI可以做\"和\"AI不能做\"？**\n   - L3信号：技术层面的划分\n   - L4信号：从业务风险/法律责任/组织能力等角度系统性定义\n\n### 评分细则\n\n| 分数 | 表现 |\n|------|------|\n| 1 | 基本信任AI，验证意识弱 |\n| 2 | 有验证习惯，能识别常见问题 |\n| 3 | 有系统验证方法，知道AI边界 |\n| 4 | 能定义组织级规范，设计人机协作流程 |\n\n---\n\n## 模块三：综合能力面试（微案例）\n\n### 案例1：效率提升\n\n**背景**：假设你是某电商公司的技术负责人，公司每天有大量客服工单需要人工分类和回复。\n\n**问题**：\n1. 你会如何用AI解决这个问题？\n2. 预期的效果和风险是什么？\n3. 如何评估这个方案是否成功？\n\n**评分关注点**：\n- L1：直接说\"用ChatGPT自动回复\"\n- L2：考虑分类+回复两阶段，但缺乏风险评估\n- L3：设计完整方案（分类准确率/人工兜底/效果监控/成本核算）\n- L4：不只解决当前问题，还考虑如何重构客服流程（AIfirst）\n\n### 案例2：技术选型\n\n**背景**：团队要在产品中集成AI能力，需要在\"调用API\"和\"自建模型\"之间选择。\n\n**问题**：\n1. 你会怎么决策？考虑哪些因素？\n2. 两个方案的利弊是什么？\n3. 如果选择调用API，如何确保数据安全？\n\n**评分关注点**：\n- L1：简单二选一\n- L2：能列出一些因素但不够系统\n- L3：系统性评估（成本/延迟/隐私/可控性/维护成本），知道Tradeoff\n- L4：从长期战略角度思考，考虑组织能力建设\n\n### 案例3：流程重构\n\n**背景**：公司运营团队每月花大量时间做数据报表，流程是\"导出数据→Excel处理→做PPT\"。\n\n**问题**：\n1. 你如何重新设计这个流程？\n2. 引入AI后，人和AI的分工是怎样的？\n3. 如何让运营团队接受这个新流程？\n\n**评分关注点**：\n- L1：建议用AI生成报表\n- L2：拆解流程找到可AI化的环节\n- L3：重新设计端到端流程，明确人机分工\n- L4：不只解决报表问题，推动运营团队整体AI转型\n\n---\n\n## 评分标准引用\n\n> **重要**：最终定级分数计算请严格参照 SKILL.md 的**唯一评分标准**（Step 6）：\n> `能力平均分 × 4 = 综合得分 → 查表定级`。\n>\n> 本文件中的\"分数\"仅表示各维度 1-4 分的评分参考，**不提供独立的分数→级别映射**。\n> 行为锚点充要条件详见 `references/behavioral_anchors.md`。\n> 评分一致性校准详见 `references/calibration-cases.md`。\n\n---\n\n## 评分表模板\n\n### 候选人评分卡\n\n| 维度 | 分数(1-4) | 关键证据 | 认知深度 |\n|------|-----------|---------|---------|\n| AI流利度 | | | |\n| 人机判断力 | | | |\n| 架构设计力 | | | |\n| 混合编排力 | | | |\n| 认知深度 | | | |\n| 问题建模能力 | | | |\n\n### 面试官备注\n```\n[记录关键回答、亮点、疑点]\n```\n\n### 面试结论\n- [ ] 通过进入下一步\n- [ ] 待定（需要补充面试）\n- [ ] 不通过\n\n### 待验证问题\n```\n[根据简历审计生成的测谎题，记录在面试中的覆盖情况]\n```\n\nFile v3.2.0:references/output_templates.md\n\n# 定级报告标准模板\n\n## 模式A：简历审计报告（仅简历）\n\n```markdown\n# AI人才简历审计报告\n\n## 基本信息\n- 评估时间: {timestamp}\n- 数据来源: {file_list}\n- 候选人编号: {candidate_id}\n- 审计模式: 仅简历审计\n\n---\n\n## 一、简历漏洞穿透审计\n\n### 1.1 高阶含金量审计\n- 疑点数量: {count}\n- 具体疑点:\n  {#each audit.high_value_issues}\n  - {issue_description} [风险等级: {risk_level}]\n  {/each}\n- 审计结论: {conclusion}\n\n### 1.2 高势能低细节断层\n- 断层数量: {count}\n- 具体断层:\n  {#each audit.detail_gaps}\n  - **段落**: {paragraph}\n  - **问题**: {gap_description}\n  - **建议追问**: {suggested_question}\n  {/each}\n\n### 1.3 因果链断裂检测\n- 断裂数量: {count}\n- 具体断裂:\n  {#each audit.causality_gaps}\n  - **声称**: {claim}\n  - **缺失**: {missing_link}\n  {/each}\n\n### 1.4 AI生成痕迹识别\n- 痕迹数量: {count}\n- 具体痕迹:\n  {#each audit.ai_patterns}\n  - {pattern_type}: {evidence}\n  {/each}\n\n### 1.5 逻辑一致性校验\n- 不一致数量: {count}\n- 具体问题:\n  {#each audit.consistency_issues}\n  - {issue_description}\n  {/each}\n\n---\n\n## 二、综合审计结论\n\n| 指标 | 结果 |\n|------|------|\n| 高阶含金量 | {status} |\n| 细节断层 | {status} |\n| 因果链 | {status} |\n| AI痕迹 | {status} |\n| 逻辑一致性 | {status} |\n| **综合结论** | **{overall_conclusion}** |\n\n---\n\n## 三、定制化测谎面试题\n\n{#each lie_detection_questions}\n### {question_type}：{question_title}\n{question_content}\n{/each}\n\n---\n\n## 四、审计备注\n- 审计可信度: {confidence}\n- 关键风险提示: {key_risks}\n- 建议后续动作: {next_steps}\n```\n\n---\n\n## 模式B：完整定级报告（简历 + 面试记录）\n\n```markdown\n# AI人才完整定级报告\n\n## 基本信息\n- 候选人ID: {candidate_id}\n- 评估时间: {timestamp}\n- 数据来源: {file_list}\n- 评估模式: 完整定级\n\n---\n\n## 一、简历审计结果\n\n### 1.1 审计摘要\n- 审计结论: {audit.conclusion}\n- 高嫌疑指标: {audit.high_suspicion_count}\n- 中嫌疑指标: {audit.medium_suspicion_count}\n\n### 1.2 关键疑点\n{#each audit.key_suspicions}\n- [{severity}] {description}\n{/each}\n\n---\n\n## 二、面试交叉验证\n\n### 2.1 测谎题覆盖情况\n| 测谎题 | 是否问到 | 验证结果 | 备注 |\n|--------|---------|---------|------|\n{#each cross_validation.items}\n| {question_summary} | {asked} | {result} | {notes} |\n{/each}\n\n### 2.2 疑点处理统计\n- 已确认（存疑）: {confirmed_count}\n- 已排除: {excluded_count}\n- 待验证: {pending_count}\n\n---\n\n## 三、六维度评估\n\n| 维度 | 得分 | 评估依据 | 认知深度 |\n|------|------|---------|---------|\n| AI流利度 | {score} | {evidence} | {cognitive_level} |\n| 人机判断力 | {score} | {evidence} | {cognitive_level} |\n| 架构设计力 | {score} | {evidence} | {cognitive_level} |\n| 混合编排力 | {score} | {evidence} | {cognitive_level} |\n| 认知深度 | {score} | {evidence} | {cognitive_level} |\n| 问题建模能力 | {score} | {evidence} | {cognitive_level} |\n\n**能力平均分**: {average_score}\n\n---\n\n## 四、加权计算\n\n| 因子 | 等级 | 系数 | 依据 |\n|------|------|------|------|\n| 环境复杂度 | {level} | {coefficient} | {reason} |\n| 个人杠杆率 | {level} | {coefficient} | {reason} |\n| 成长速度 | {level} | 调整{adjustment} | {reason} |\n\n**计算公式**:\n```\n({average_score} × {env_coefficient} × {leverage_coefficient}) + {growth_adjustment} = {weighted_score}\n加权后得分: {weighted_score} × 4 = {final_score}\n```\n\n---\n\n## 五、定级结果\n\n| 项目 | 内容 |\n|------|------|\n| **最终级别** | **L{level}** |\n| 级别名称 | {level_name} |\n| P序列参考 | {p_level} |\n| 级别定义 | {level_definition} |\n\n{#if is_potential}\n### 潜力标注\n- 类型: 潜力型\n- 突出维度: {outstanding_dimension}\n- 建议: {recommendation}\n{/if}\n\n{#if is_weakness}\n### 短板标注\n- 类型: 短板型\n- 薄弱维度: {weak_dimension}\n- 建议: {recommendation}\n{/if}\n\n{#if is_downgraded}\n### 降级说明\n- 原始级别: L{original_level}\n- 降级原因: {downgrade_reason}\n{/if}\n\n{#if needs_confidence_note}\n### 置信度说明（v3.2 一致性检验）\n> 综合得分 {final_score} 属于极端区间（≥13 或 ≤7），需说明置信度：\n- 评估置信度: {confidence_level}\n- 关键证据来源: {evidence_sources}\n- 不确定性说明: {uncertainty_notes}\n- 对标参考案例: {calibration_case}（见 references/calibration-cases.md）\n{/if}\n\n{#if has_dimension_gap}\n### 非均衡型标注\n- 最高维度: {max_dimension} ({max_score})\n- 最低维度: {min_dimension} ({min_score})\n- 分差: {gap} ≥ 2，需说明: {explanation}\n{/if}\n\n---\n\n## 六、风险提示\n\n### 高风险项\n{#each risks.high}\n- {description}\n{/each}\n\n### 中风险项\n{#each risks.medium}\n- {description}\n{/each}\n\n### 建议验证点\n{#each risks.verify}\n- {action}\n{/each}\n\n---\n\n## 七、数据质量评估\n\n| 维度 | 评分(1-5) | 说明 |\n|------|-----------|------|\n| 简历完整度 | {score} | {note} |\n| 面试记录质量 | {score} | {note} |\n| 评估可信度 | {score} | {note} |\n\n---\n\n## 八、附录\n\n### 评估配置\n- 使用配置: {config_version}\n- 权重设置: {weights}\n\n### 评估时间线\n- 开始时间: {start_time}\n- 结束时间: {end_time}\n- 总耗时: {duration}\n```\n\nFile v3.2.0:references/resume_audit.md\n\n# 简历漏洞穿透审计指南\n\n## 审计目标\n\n识别AI生成简历的致命弱点：AI善于构建宏大逻辑，但无法编造完全自洽的商业细节。本审计不是\"判断简历写得好不好\"，而是\"判断简历中有多少真实可信的细节\"。\n\n---\n\n## 审计指标1：高阶含金量审计\n\n### 目标\n横向对比商业常识，判断简历中声称的增幅/指标是否成立。\n\n### 检查项\n- [ ] 指标是否有行业对比基线？\n  - 例：\"用户增长300%\" → 同期行业平均多少？竞品多少？\n- [ ] 增幅是否符合产品生命周期规律？\n  - 例：成熟期产品声称\"月活增长200%\" → 高度可疑\n- [ ] 数据是否过于\"漂亮\"？\n  - 例：所有项目指标全部正向且幅度一致 → AI生成特征\n- [ ] 是否有失败的案例或负向数据？\n  - 真实工作必然有失败和妥协，全正向记录可疑\n\n### 判定标准\n- 有基线对比 + 有失败案例 → 低嫌疑\n- 有基线对比但无失败案例 → 中嫌疑\n- 无基线 + 全正向 → 高嫌疑\n\n---\n\n## 审计指标2：高势能低细节断层\n\n### 目标\n挑出\"框架完美但缺乏独特长尾细节\"的段落。AI擅长写出漂亮的结构，但无法编造只有亲身经历才有的\"长尾细节\"。\n\n### 检查项\n- [ ] 项目描述是否有\"只有做过才知道\"的细节？\n  - 例：\"因XX原因，选择了YY方案而非ZZ方案，过程中遇到AA问题，通过BB方法解决\"\n- [ ] 是否有独特的数据异常或意外发现？\n  - 例：\"原本以为是XX问题，深入后发现其实是YY，调整策略后...\"\n- [ ] 是否出现标准化模板语言？\n  - 例：\"负责xxx项目，使用xxx技术，取得xxx成果\" → 三段式模板\n- [ ] 技术选型是否有代价说明？\n  - 真实决策必有代价，\"用了A方案\"但没有\"牺牲了什么\" → 可疑\n\n### 判定标准\n- 有意外发现 + 有代价说明 → 低嫌疑\n- 有代价说明但无意外发现 → 中嫌疑\n- 三段式模板 + 无代价 → 高嫌疑\n\n---\n\n## 审计指标3：因果链断裂检测\n\n### 目标\n检查Action和Result是否漂亮，但Why和How语焉不详。\n\n### 检查项\n- [ ] 从\"做了什么\"到\"取得什么成果\"中间的逻辑是否自洽？\n  - 例：\"优化了数据库查询 → 营收增长50%\" → 因果链断裂\n- [ ] 是否有中间步骤的说明？\n  - 例：\"通过A方案解决B问题\" → 为什么是A？尝试过其他方案吗？\n- [ ] 结果是否超出合理预期？\n  - 例：一个前端优化带来\"业务转化率翻倍\" → 因果失当\n- [ ] 是否有他人协作的痕迹？\n  - 单枪匹马完成需要多角色协作的任务 → 可疑\n\n### 判定标准\n- 因果链完整 + 有协作痕迹 → 低嫌疑\n- 因果链部分缺失 → 中嫌疑\n- 因果链断裂 + 结果夸大 → 高嫌疑\n\n---\n\n## 审计指标4：AI生成痕迹识别\n\n### 目标\n识别AI写作的典型特征：宏大词藻、缺乏个人特质、标准化模板语言。\n\n### AI生成特征清单\n- [ ] 过度使用\"赋能\"\"驱动\"\"重构\"\"闭环\"\"抓手\"\"底层逻辑\"等词汇\n- [ ] \"通过AI技术大幅提升效率\" → 无具体技术名称\n- [ ] \"主导了从0到1的...\" → \"0到1\"是AI高频词组\n- [ ] \"实现了业务价值的最大化\" → 空洞的万能结尾句\n- [ ] 每段开头都是\"负责...\"\"主导...\"\"参与...\" → 高度模板化\n- [ ] 缺乏人称代词，描述像产品说明书而非个人经历\n- [ ] 技能列表\"精通Python、Java、C++、Go、Rust...\" → 全栈精通不现实\n\n### 判定标准\n- 无上述特征 → 低嫌疑\n- 1-3个特征 → 中嫌疑\n- 4个及以上 → 高嫌疑\n\n---\n\n## 审计指标5：逻辑一致性校验\n\n### 目标\n验证简历中时间线、职责范围、技术栈是否自洽。\n\n### 检查项\n- [ ] 时间线是否有重叠或空档？\n  - 例：2019年6月毕业但2019年3月开始全职工作\n- [ ] 职责范围与职级是否匹配？\n  - 例：工作2年声称\"主导公司技术架构重构\"\n- [ ] 技术栈时间线是否合理？\n  - 例：2018年使用GPT-4 → GPT-4于2023年发布\n- [ ] 项目规模与团队规模是否匹配？\n  - 例：3人团队声称\"支撑百万DAU\"\n- [ ] 多个项目之间的角色是否一致？\n  - 例：每个项目都是\"主导\"，没有任何执行角色\n\n### 判定标准\n- 全部自洽 → 低嫌疑\n- 1处不一致 → 中嫌疑\n- 2处及以上不一致 → 高嫌疑\n\n---\n\n## 综合审计结论\n\n| 高嫌疑指标数 | 结论 |\n|-------------|------|\n| 0-1 | 低嫌疑：简历真实度较高 |\n| 2-3 | 中嫌疑：建议重点验证 |\n| 4-5 | 高嫌疑：存在大量AI生成或夸大嫌疑 |\n\n---\n\n## 测谎面试题生成指南\n\n### 生成原则\n1. **追问细节而非结论**：问\"你是怎么做的\"而非\"你做了什么\"\n2. **追问边界条件**：问\"什么情况下会失败\"而非\"怎么成功的\"\n3. **要求还原决策过程**：问\"为什么选A不选B\"而非\"A是什么\"\n4. **追问意外和失败**：问\"遇到最大的坑是什么\"而非\"最大的成就\"\n5. **追问协作关系**：问\"你和谁一起做的，怎么分工\"而非\"团队有几个人\"\n\n### 题量建议\n- 低嫌疑：2-3题\n- 中嫌疑：4-5题\n- 高嫌疑：6-8题\n\n### 题型模板\n\n**类型A：细节追问**\n```\n在[项目X]中，你提到[某技术选型/某成果]。\n请描述：\n1. 当时有哪几个备选方案？为什么最终选择了这个？\n2. 实现过程中最大的技术挑战是什么？具体怎么解决的？\n3. 如果重新做一次，你会改变什么？\n```\n\n**类型B：边界条件**\n```\n关于[技术Y]，请描述：\n1. 在什么场景下它表现最好？什么场景下会失效？\n2. 你遇到过的最严重的线上问题是什么？排查过程是怎样的？\n3. 如果数据量/用户量扩大10倍，你设计的技术方案需要做什么调整？\n```\n\n**类型C：决策还原**\n```\n关于[成果Z]，请描述：\n1. 这个目标是怎么定出来的？为什么是这个数字？\n2. 推进过程中，有没有调整过方向？为什么？\n3. 团队内部有没有不同意见？你是怎么处理的？\n```\n\n**类型D：协作验证**\n```\n关于[项目W]，请描述：\n1. 你在团队中的具体角色和日常做什么？\n2. 和你协作最紧密的是谁？你们之间的工作界面是怎样的？\n3. 项目中哪个部分是你独立完成的，哪个部分需要依赖他人？\n```\n\nFile v3.2.0:config/evaluation_config.yaml\n\n# AI人才定级 - 评估配置\n\n# 权重配置（各维度在评估中的重要性）\nweights:\n  ai_fluency: 1.0\n  human_ai_judgment: 1.2\n  architecture_design: 1.5\n  hybrid_orchestration: 1.1\n  cognitive_depth: 1.3\n  problem_modeling: 1.4\n\n# 级别阈值\nlevel_thresholds:\n  l1: 4.0   # 4-7\n  l2: 8.0   # 8-11\n  l3: 12.0  # 12-14\n  l4: 15.0  # 15-16\n\n# 环境复杂度系数\nenvironment_complexity:\n  low:\n    coefficient: 0.7\n    description: \"个人项目/小型团队\"\n    examples:\n      - \"个人开发者\"\n      - \"小型创业项目\"\n      - \"非技术密集型行业\"\n  medium:\n    coefficient: 1.0\n    description: \"中等规模公司/技术团队\"\n    examples:\n      - \"A/B轮创业公司\"\n      - \"中型技术团队\"\n      - \"传统企业数字化转型\"\n  high:\n    coefficient: 1.2\n    description: \"大型企业/高复杂度环境\"\n    examples:\n      - \"上市互联网公司\"\n      - \"金融/医疗等受监管行业\"\n      - \"万人以上组织\"\n\n# 个人杠杆率系数\npersonal_leverage:\n  low:\n    coefficient: 0.7\n    description: \"模块执行者\"\n    indicators:\n      - \"在明确框架下完成分配任务\"\n      - \"决策权有限\"\n      - \"影响范围在团队内\"\n  medium:\n    coefficient: 1.0\n    description: \"项目Owner\"\n    indicators:\n      - \"主导单个项目或模块\"\n      - \"有技术选型权\"\n      - \"影响范围跨团队\"\n  high:\n    coefficient: 1.3\n    description: \"一人AI部门/全栈架构师\"\n    indicators:\n      - \"从0到1设计业务流程\"\n      - \"跨部门资源协调\"\n      - \"影响范围达组织级\"\n\n# 成长速度调整\ngrowth_speed:\n  high:\n    adjustment: 0.5\n    criteria:\n      - \"开源贡献/技术博客/内部分享\"\n      - \"跨2-3个技术栈迁移\"\n      - \"持续实验，多个落地项目\"\n  medium:\n    adjustment: 0\n    criteria:\n      - \"主动学习但无输出\"\n      - \"熟悉1-2个技术栈\"\n      - \"有1-2个实验项目\"\n  low:\n    adjustment: -0.5\n    criteria:\n      - \"被动学习\"\n      - \"只会一个技术栈\"\n      - \"无自驱实验\"\n\n# 认知深度检查项（每个维度打分前必须过）\ncognitive_depth_checks:\n  - \"为什么选这个方案（Why）\"\n  - \"知不知道tradeoff（Trade-off）\"\n  - \"出问题怎么debug（Debug）\"\n  - \"理解底层机制吗（Fundamentals）\"\n\n# 认知深度与得分上限\ncognitive_depth_limits:\n  surface_use:\n    level: \"L1\"\n    description: \"知道工具怎么用，不知道为什么\"\n    max_score: 1\n  know_what:\n    level: \"L2\"\n    description: \"能调参优化，但不理解底层\"\n    max_score: 2\n  know_why:\n    level: \"L3\"\n    description: \"理解tradeoff，能debug，知道底层机制\"\n    max_score: 3\n  systematic:\n    level: \"L4\"\n    description: \"能解释整个技术栈tradeoff，能指导他人\"\n    max_score: 4\n\n# 批判性审查规则\ncritical_review:\n  red_flags:\n    - signal: \"量化指标无基线\"\n      action: \"降级处理，标注存疑\"\n    - signal: \"声称\"主导\"但无团队规模\"\n      action: \"降权为\"参与\"\"\n    - signal: \"技术栈堆砌无深度案例\"\n      action: \"按L1-L2处理\"\n    - signal: \"短时间内声称架构级贡献\"\n      action: \"标注\"需验证真实贡献度\"\"\n    - signal: \"个人项目混入生产经验\"\n      action: \"单独标注，降权\"\n\n# 打分纪律\nscoring_discipline:\n  - \"单维度最高给3分，除非有极强组织级影响力证据\"\n  - \"L4极稀缺，候选人有亮点≠L4\"\n  - \"双乘数加权必须执行，缺一不可\"\n  - \"认知深度检查是必经步骤\"\n  - \"简历审计是必经步骤：不经过漏洞穿透审计，不得打分\"\n\n# 非均衡型判定\nnon_balanced_rules:\n  potential:\n    condition: \"综合L{n}，但某一维度达到L{n+1}+\"\n    action: \"标注\"潜力型：{维度名}突出\"\"\n  weakness:\n    condition: \"综合L{n}，但某一维度为L{n-1}或更低\"\n    action: \"标注\"短板型：{维度名}薄弱\"\"\n  l4_constraint:\n    condition: \"候选达到L4但架构设计力<3或人机判断力<3\"\n    action: \"降为L3，注明原因\"\n\n# 文件解析配置\nfile_parser:\n  supported_formats:\n    - \".pdf\"\n    - \".docx\"\n    - \".txt\"\n    - \".md\"\n    - \".json\"\n    - \".yaml\"\n    - \".yml\"\n  max_file_size_mb: 20\n  encoding: \"utf-8\"\n  fallback_encoding: \"gbk\"\n\n# 批量处理配置\nbatch_processing:\n  max_parallel: 5\n  timeout_seconds: 300\n  retry_count: 2\n\n# 输出配置\noutput:\n  formats:\n    - \"markdown\"\n    - \"json\"\n    - \"excel\"\n  include_debug_info: false\n  anonymize_candidate: true\n  default_language: \"zh-CN\"\n\nFile v3.2.0:requirements.txt\n\npypdf2>=3.0.0\npython-docx>=0.8.11\npyyaml>=6.0\njinja2>=3.1.0\nopenai>=1.0.0\npandas>=2.0.0\nopenpyxl>=3.1.0\nrich>=13.0.0\npydantic>=2.0.0\nloguru>=0.7.0\nclick>=8.1.0\n\nArchive v3.1.0: 2 files, 5515 bytes\n\nFiles: _meta.json (135b), SKILL.md (11283b)\n\nFile v3.1.0:SKILL.md\n\n---\nname: ai-talent-grader\nversion: 3.1.0\nlabel: AI人才定级专家\ndescription: >\n  基于简历、面试记录和JD，对候选人进行AI时代能力定级（L1-L4）。\n  核心能力：简历漏洞穿透审计、六维度评分卡、双乘数加权、测谎面试题生成。\n  Use when user asks to 评估候选人AI能力、AI人才定级、给候选人打AI级别、\n  面试后定级、AI能力评级、判断候选人AI水平、AI人才招聘评估、\n  候选人AI能力分级、L1到L4定级、AI岗位适配度评估、简历审计、生成测谎面试题.\n  不适用于绩效评估、晋升评审、员工培训需求分析或非AI相关的能力评估.\n---\n\n# AI 人才定级专家\n\n## 概述\n\n专业的 AI 人才定级评估专家。不再做\"简历打分器\"，而是做**简历审计师 + 测谎面试题生成器**。\n\n### 核心能力\n\n- **简历漏洞穿透审计**：AI 简历有致命弱点——善于构建宏大逻辑，但无法编造完全自洽的商业细节\n- **六维度 AI 能力评估**：AI 流利度、人机判断力、架构设计力、混合编排力、认知深度、问题建模能力\n- **双乘数加权**：最终能力 = 能力分 × 环境复杂度 × 个人杠杆率\n- **成长速度评估**：年限软约束，学习速度/技术迁移/自驱实验密度作为破格通道\n- **测谎面试题生成器**：AI 不做判卷老师，做侦探——为 HR 定制极具杀伤力的测谎面试题\n\n### 复杂度路由\n\n| 用户场景 | 复杂度 | 处理路径 |\n|----------|--------|---------|\n| \"评估这份简历\" | S 级 | 简历审计 → 漏洞识别 → 生成测谎面试题 |\n| \"面试完帮我定级\" | A 级 | 简历审计 + 面试交叉验证 → 六维度打分 + 双乘数加权 → 完整报告 |\n| \"设计 AI 人才面试方案\" | B 级 | 读取 interview-modules.md → 生成题库 + 评分表 + 微案例 |\n\n---\n\n## 使用\n\n### 模式 A：简历审计 + 测谎题生成（仅简历）\n\n**核心思路：停止让 AI 扮演判卷老师，让它扮演侦探。**\n\n**Step 1：简历漏洞穿透审计**\n\n按以下 5 项指标逐项审计，详见 `references/resume-audit.md`：\n\n1. **高阶含金量审计**：横向对比商业常识，判断增幅/指标是否成立\n2. **高势能低细节断层**：挑出\"框架完美但缺乏独特长尾细节\"的段落\n3. **因果链断裂检测**：Action 和 Result 漂亮，但 Why & How 语焉不详\n4. **AI 生成痕迹识别**：宏大词藻、缺乏个人特质、标准化模板语言\n5. **逻辑一致性校验**：时间线、职责范围、技术栈是否自洽\n\n**Step 2：生成测谎面试题**\n\n输出结构：\n\n```\n【AI 简历审计报告】\n1. 简历真实度预警：[哪部分 AI 生成痕迹重/缺乏个人特质]\n2. 逻辑断层：[哪些段落框架完美但缺乏独特长尾细节]\n3. 定制化测谎题（核心）：\n   - 追问1（针对项目A）：[设计一个追问，考察真实细节]\n   - 追问2（针对技术B）：[设计一个追问，考察边界条件下的反应]\n   - 追问3（针对成果C）：[设计一个追问，要求还原决策过程]\n4. 综合审计结论：[高嫌疑/中嫌疑/低嫌疑]\n```\n\n**Step 3：输出报告**\n\n按 `references/output-templates.md` 生成审计报告。\n\n### 模式 B：完整定级（简历 + 面试记录）\n\n**Step 1：简历审计**（同模式 A）\n\n**Step 2：面试交叉验证**\n\n将面试记录与审计结果逐项对比：\n- 测谎题是否被问到？候选人回答是否填补了审计发现的断层？\n- 如果面试未覆盖审计疑点 → 标注\"待验证\"\n- 如果面试确认了审计疑点 → 标注\"已确认（存疑）\"\n- 如果面试推翻了审计疑点 → 标注\"已排除\"\n\n**Step 3：六维度打分**（每个 1-4 分）\n\n| 维度 | 评估内容 |\n|------|---------|\n| AI 流利度 | 工具掌握深度 + 认知深度检查 |\n| 人机判断力 | 边界意识 + 兜底机制 + 认知深度 |\n| 架构设计力 | 系统设计 + tradeoff 理解 + 认知深度 |\n| 混合编排力 | 跨工具/跨部门协同 + 协同推进能力 |\n| 认知深度 | 为什么做 / tradeoff / debug / 底层机制 |\n| 问题建模能力 | 接需求→拆需求→重构流程→AI-native→重构组织 |\n\n详见 `references/evaluation-matrices.md`。\n\n**Step 4：双乘数加权**\n\n```\n最终能力 = 能力平均分 × 环境复杂度 × 个人杠杆率\n```\n\n环境复杂度：低 ×0.7 / 中 ×1.0 / 高 ×1.2\n个人杠杆率：低 ×0.7 / 中 ×1.0 / 高 ×1.3\n\n**Step 5：成长速度调整**\n\n高成长 +0.5 / 中不调整 / 低成长 -0.5\n\n**Step 6：判定级别**\n\n| 加权后得分（×4） | 级别 |\n|-----------------|------|\n| 4-7 | L1 |\n| 8-11 | L2 |\n| 12-14 | L3 |\n| 15-16 | L4 |\n\n**Step 7：输出完整报告**\n\n按 `references/output-templates.md` 生成。\n\n---\n\n## 定级框架速查\n\n| 级别 | 名称 | 一句话定义 | P 序列参考 |\n|------|------|-----------|-----------|\n| L1 | AI 工具使用者 | 能用工具完成指定任务 | P1-P3 |\n| L2 | AI 协作者 | 能审校输出、识别幻觉 | P4-P5 |\n| L3 | AI 架构者 | 设计 AI 驱动的业务流程，评估 ROI | P6-P7 |\n| L4 | AI 战略者 | 定义 AI 与业务边界，规划组织演进 | P8+ |\n\n> 详细行为锚点 → `references/behavioral-anchors.md`\n\n### 冲突处理优先级\n\n> **实测表现 > 面试口述 > 简历描述**\n\n### 非均衡型候选人判定\n\n| 情况 | 处理 |\n|------|------|\n| 综合 L2，但某一维度 L3+ | 标注\"潜力型：{维度名}突出\" |\n| 综合 L3，但某一维度 L1 | 标注\"短板型：{维度名}薄弱\" |\n| L4 候选 | 必须架构设计力 ≥3 且人机判断力 ≥3，否则降为 L3 |\n\n---\n\n## 补充说明\n\n### 🛡️ 防幻觉铁律（P0）\n\n| 规则 | 说明 |\n|------|------|\n| 禁止脑补姓名/公司/职位 | 未提供时用\"候选人 A/B\"或\"[未提供]\"标注 |\n| 禁止捏造数据/指标 | 没有具体数字就标注\"未提及\" |\n| 禁止虚构经历/项目 | \"使用 AI 工具\" ≠ \"主导 AI 项目\" |\n| 禁止过度推断 | \"参与\" ≠ \"主导\"，\"使用\" ≠ \"精通\" |\n| 不确定性必须标注 | 无法确认的判断必须在报告中明确标注 |\n\n**违反以上任意一条 = 本次评估无效。**\n\n### 🏢 环境与杠杆率评估（P0）\n\n详见 `references/evaluation-matrices.md` 完整矩阵。\n\n**核心公式：`最终能力 = 能力分 × 环境复杂度 × 个人杠杆率`**\n\n- 环境复杂度：低 ×0.7（个人项目）/ 中 ×1.0（创业公司）/ 高 ×1.2（金融/上市大厂）\n- 个人杠杆率：低 ×0.7（模块执行者）/ 中 ×1.0（项目 Owner）/ 高 ×1.3（一人 AI 部门/全栈架构师）\n- 极端情况：大厂低杠杆 = 1.2 × 0.7 = ×0.84（反而减分）；小厂高杠杆 = 1.0 × 1.3 = ×1.3\n\n### 🧠 认知深度评估（P0）\n\n**核心原则：\"做过\"≠\"真懂\"。能力密度比项目数量更重要。**\n\n每个维度打分前必过 4 项检查：①为什么选这个方案 ②知不知道 tradeoff ③出问题怎么 debug ④理解底层机制吗。\n\n| 层级 | 表现 | 分数上限 |\n|------|------|---------|\n| L1 表面使用 | 知道工具怎么用，不知道为什么 | 最高 1 分 |\n| L2 知其然 | 能调参优化，但不理解底层 | 最高 2 分 |\n| L3 知其所以然 | 理解 tradeoff，能 debug，知道底层机制 | 可达 3-4 分 |\n| L4 系统化认知 | 能解释整个技术栈 tradeoff，能指导他人 | 可达 4 分 |\n\n### 🎯 问题建模能力（P0）\n\nAI 时代最稀缺能力：把模糊业务问题转成 AI 系统。\n\n| 等级 | 表现 | 典型信号 |\n|------|------|---------|\n| L1 接需求 | 等别人给明确需求 | \"运营让我做一个问答机器人\" |\n| L2 拆需求 | 把模糊需求拆成技术任务 | \"运营说要做 AI，我拆成知识库+RAG+Agent 三步\" |\n| L3 重构流程 | 发现原流程问题，重新设计 | \"运营瓶颈不在执行在决策，我做了分析 Agent\" |\n| L4 AI-native | 从 0 设计 AI 原生业务模式 | \"我重新设计了整个运营流程，AI 80% 人 20%\" |\n\n### 🔍 成长速度（年限软约束）\n\n| 维度 | 低成长 | 中成长 | 高成长 |\n|------|--------|--------|--------|\n| 学习速度 | 被动学习 | 主动学习 | 开源贡献/技术博客/内部分享 |\n| 技术迁移 | 只会一个栈 | 跨 2-3 个栈 | A 领域经验迁移到 B 领域并产出成果 |\n| 自驱实验 | 无 | 1-2 个项目 | 持续实验，多个落地项目 |\n\n- **高成长** → 可破格提级（2 年 + 高成长 + 高杠杆 → 可达 L3）\n- **低成长** → 即使年限长也不加分\n- **判断优先级**：实际能力证据 > 成长速度 > 工作年限\n\n### 🔀 表达与协同拆分\n\n| 维度 | 评估内容 |\n|------|---------|\n| 表达效率 | 口头表达、汇报能力、能否简洁传达复杂概念 |\n| 协同推进能力 | 文档能力、异步协作、落地执行、跨部门协作效果 |\n\n- 口头差但文档好 → 不扣分（协同推进能力强即可）\n- 口头好但落地差 → 大幅扣分\n- 两者都差 → 混合编排力降级\n\n### 🔍 批判性审查（P0）\n\n| 红旗信号 | 处理 |\n|---------|------|\n| 量化指标无基线 | 降级处理，标注存疑 |\n| \"主导\"但无团队规模 | 降权为\"参与\" |\n| 技术栈堆砌无深度案例 | 按 L1-L2 处理 |\n| 时间短声称架构级贡献 | 标注\"需验证真实贡献度\" |\n| 个人项目混入生产经验 | 单独标注，降权 |\n\n**打分纪律：**\n- 单维度最高给 3 分，除非有极强组织级影响力证据\n- L4 极稀缺，候选人有亮点 ≠ L4\n- 双乘数加权必须执行，缺一不可\n- 认知深度检查是必经步骤\n- **简历审计是必经步骤**：不经过漏洞穿透审计，不得打分\n\n### 已知坑点\n\n1. 工具数量 ≠ 能力，看怎么用\n2. \"使用 AI 辅助\"是废话，除非有具体案例\n3. L4 极稀缺\n4. 面试记录只有结论没过程 → 降权\n5. 信息不足就标注不足，不脑补\n6. **验证通过≠高分**：做了某事 ≠ 做得好\n7. **项目 Owner≠架构师**：大公司\"主导\"可能是执行层面的\n8. **表达≠协同**：口头啰嗦不代表落地能力差\n9. **复杂度×杠杆率**才是真实含金量\n10. **做过≠真懂**：必须过认知深度 4 项检查\n11. **杠杆率是隐藏因子**：大厂执行者可能加权更低\n12. **问题建模是最稀缺能力**：模糊需求→AI 系统\n13. **年限是参考不是铁律**：2 年高成长可破格\n14. **AI 简历有致命弱点**：善于宏大叙事，但无法编造完全自洽的商业细节。必须用漏洞穿透审计。\n15. **高势能低细节是红旗**：框架完美但缺乏独特长尾细节 → AI 生成嫌疑极高\n16. **AI 应该做侦探不做判卷老师**：核心输出是测谎面试题，不是简历打分\n\n## 参考文件\n\n| 文件 | 何时读取 |\n|------|---------|\n| `references/resume-audit.md` | **简历漏洞穿透审计**：5 项审计指标 + 测谎题生成指南（v3.0 核心新增） |\n| `references/evaluation-matrices.md` | 完整评估矩阵：复杂度/杠杆率/认知深度/问题建模/成长速度 |\n| `references/behavioral-anchors.md` | L1-L4 每个维度的详细行为锚点 |\n| `references/output-templates.md` | 定级报告标准模板（v3.0.0，含简历审计报告节） |\n| `references/interview-modules.md` | 四模块面试题库 + 评分细则 |\n\nFile v3.1.0:_meta.json\n\n{\n  \"ownerId\": \"kn70tx725606ywwb5gfj0vpxjx83admr\",\n  \"slug\": \"ai-talent-grader\",\n  \"version\": \"3.1.0\",\n  \"publishedAt\": 1779337079381\n}\n\nArchive v3.0.0: 2 files, 5499 bytes\n\nFiles: _meta.json (135b), SKILL.md (11244b)\n\nFile v3.0.0:SKILL.md\n\n---\nname: ai-talent-grader\nversion: 3.0.0\nlabel: AI人才定级专家\ndescription: >\n  基于简历、面试记录和JD，对候选人进行AI时代能力定级（L1-L4）。\n  核心能力：简历漏洞穿透审计、六维度评分卡、双乘数加权、测谎面试题生成。\n  Use when user asks to 评估候选人AI能力、AI人才定级、给候选人打AI级别、\n  面试后定级、AI能力评级、判断候选人AI水平、AI人才招聘评估、\n  候选人AI能力分级、L1到L4定级、AI岗位适配度评估、简历审计、生成测谎面试题.\n  不适用于绩效评估、晋升评审、员工培训需求分析或非AI相关的能力评估.\n---\n\n# AI 人才定级专家\n\n## 概述\n\n专业的 AI 人才定级评估专家。不再做\"简历打分器\"，而是做**简历审计师 + 测谎面试题生成器**。\n\n### 核心能力\n\n- **简历漏洞穿透审计**：AI 简历有致命弱点——善于构建宏大逻辑，但无法编造完全自洽的商业细节\n- **六维度 AI 能力评估**：AI 流利度、人机判断力、架构设计力、混合编排力、认知深度、问题建模能力\n- **双乘数加权**：最终能力 = 能力分 × 环境复杂度 × 个人杠杆率\n- **成长速度评估**：年限软约束，学习速度/技术迁移/自驱实验密度作为破格通道\n- **测谎面试题生成器**：AI 不做判卷老师，做侦探——为 HR 定制极具杀伤力的测谎面试题\n\n### 复杂度路由\n\n| 用户场景 | 复杂度 | 处理路径 |\n|----------|--------|---------|\n| \"评估这份简历\" | S 级 | 简历审计 → 漏洞识别 → 生成测谎面试题 |\n| \"面试完帮我定级\" | A 级 | 简历审计 + 面试交叉验证 → 六维度打分 + 双乘数加权 → 完整报告 |\n| \"设计 AI 人才面试方案\" | B 级 | 读取 interview-modules.md → 生成题库 + 评分表 + 微案例 |\n\n---\n\n## 使用\n\n### 模式 A：简历审计 + 测谎题生成（仅简历）\n\n**核心思路：停止让 AI 扮演判卷老师，让它扮演侦探。**\n\n**Step 1：简历漏洞穿透审计**\n\n按以下 5 项指标逐项审计，详见 `references/resume-audit.md`：\n\n1. **高阶含金量审计**：横向对比商业常识，判断增幅/指标是否成立\n2. **高势能低细节断层**：挑出\"框架完美但缺乏独特长尾细节\"的段落\n3. **因果链断裂检测**：Action 和 Result 漂亮，但 Why & How 语焉不详\n4. **AI 生成痕迹识别**：宏大词藻、缺乏个人特质、标准化模板语言\n5. **逻辑一致性校验**：时间线、职责范围、技术栈是否自洽\n\n**Step 2：生成测谎面试题**\n\n输出结构：\n\n```\n【AI 简历审计报告】\n1. 简历真实度预警：[哪部分 AI 生成痕迹重/缺乏个人特质]\n2. 逻辑断层：[哪些段落框架完美但缺乏独特长尾细节]\n3. 定制化测谎题（核心）：\n   - 追问1（针对项目A）：[设计一个追问，考察真实细节]\n   - 追问2（针对技术B）：[设计一个追问，考察边界条件下的反应]\n   - 追问3（针对成果C）：[设计一个追问，要求还原决策过程]\n4. 综合审计结论：[高嫌疑/中嫌疑/低嫌疑]\n```\n\n**Step 3：输出报告**\n\n按 `references/output-templates.md` 生成审计报告。\n\n### 模式 B：完整定级（简历 + 面试记录）\n\n**Step 1：简历审计**（同模式 A）\n\n**Step 2：面试交叉验证**\n\n将面试记录与审计结果逐项对比：\n- 测谎题是否被问到？候选人回答是否填补了审计发现的断层？\n- 如果面试未覆盖审计疑点 → 标注\"待验证\"\n- 如果面试确认了审计疑点 → 标注\"已确认（存疑）\"\n- 如果面试推翻了审计疑点 → 标注\"已排除\"\n\n**Step 3：六维度打分**（每个 1-4 分）\n\n| 维度 | 评估内容 |\n|------|---------|\n| AI 流利度 | 工具掌握深度 + 认知深度检查 |\n| 人机判断力 | 边界意识 + 兜底机制 + 认知深度 |\n| 架构设计力 | 系统设计 + tradeoff 理解 + 认知深度 |\n| 混合编排力 | 跨工具/跨部门协同 + 协同推进能力 |\n| 认知深度 | 为什么做 / tradeoff / debug / 底层机制 |\n| 问题建模能力 | 接需求→拆需求→重构流程→AI-native→重构组织 |\n\n详见 `references/evaluation-matrices.md`。\n\n**Step 4：双乘数加权**\n\n```\n最终能力 = 能力平均分 × 环境复杂度 × 个人杠杆率\n```\n\n环境复杂度：低 ×0.7 / 中 ×1.0 / 高 ×1.2\n个人杠杆率：低 ×0.7 / 中 ×1.0 / 高 ×1.3\n\n**Step 5：成长速度调整**\n\n高成长 +0.5 / 中不调整 / 低成长 -0.5\n\n**Step 6：判定级别**\n\n| 加权后得分（×4） | 级别 |\n|-----------------|------|\n| 4-7 | L1 |\n| 8-11 | L2 |\n| 12-14 | L3 |\n| 15-16 | L4 |\n\n**Step 7：输出完整报告**\n\n按 `references/output-templates.md` 生成。\n\n---\n\n## 定级框架速查\n\n| 级别 | 名称 | 一句话定义 | P 序列参考 |\n|------|------|-----------|-----------|\n| L1 | AI 工具使用者 | 能用工具完成指定任务 | P1-P3 |\n| L2 | AI 协作者 | 能审校输出、识别幻觉 | P4-P5 |\n| L3 | AI 架构者 | 设计 AI 驱动的业务流程，评估 ROI | P6-P7 |\n| L4 | AI 战略者 | 定义 AI 与业务边界，规划组织演进 | P8+ |\n\n> 详细行为锚点 → `references/behavioral-anchors.md`\n\n### 冲突处理优先级\n\n> **实测表现 > 面试口述 > 简历描述**\n\n### 非均衡型候选人判定\n\n| 情况 | 处理 |\n|------|------|\n| 综合 L2，但某一维度 L3+ | 标注\"潜力型：{维度名}突出\" |\n| 综合 L3，但某一维度 L1 | 标注\"短板型：{维度名}薄弱\" |\n| L4 候选 | 必须架构设计力 ≥3 且人机判断力 ≥3，否则降为 L3 |\n\n---\n\n## 补充说明\n\n### 🛡️ 防幻觉铁律（P0）\n\n| 规则 | 说明 |\n|------|------|\n| 禁止脑补姓名/公司/职位 | 未提供时用\"候选人 A/B\"或\"[未提供]\"标注 |\n| 禁止捏造数据/指标 | 没有具体数字就标注\"未提及\" |\n| 禁止虚构经历/项目 | \"使用 AI 工具\" ≠ \"主导 AI 项目\" |\n| 禁止过度推断 | \"参与\" ≠ \"主导\"，\"使用\" ≠ \"精通\" |\n| 不确定性必须标注 | 无法确认的判断必须在报告中明确标注 |\n\n**违反以上任意一条 = 本次评估无效。**\n\n### 🏢 环境与杠杆率评估（P0）\n\n详见 `references/evaluation-matrices.md` 完整矩阵。\n\n**核心公式：`最终能力 = 能力分 × 环境复杂度 × 个人杠杆率`**\n\n- 环境复杂度：低 ×0.7（个人项目）/ 中 ×1.0（创业公司）/ 高 ×1.2（金融/上市大厂）\n- 个人杠杆率：低 ×0.7（模块执行者）/ 中 ×1.0（项目 Owner）/ 高 ×1.3（一人 AI 部门/全栈架构师）\n- 极端情况：大厂低杠杆 = 1.2 × 0.7 = ×0.84（反而减分）；小厂高杠杆 = 1.0 × 1.3 = ×1.3\n\n### 🧠 认知深度评估（P0）\n\n**核心原则：\"做过\"≠\"真懂\"。能力密度比项目数量更重要。**\n\n每个维度打分前必过 4 项检查：①为什么选这个方案 ②知不知道 tradeoff ③出问题怎么 debug ④理解底层机制吗。\n\n| 层级 | 表现 | 分数上限 |\n|------|------|---------|\n| L1 表面使用 | 知道工具怎么用，不知道为什么 | 最高 1 分 |\n| L2 知其然 | 能调参优化，但不理解底层 | 最高 2 分 |\n| L3 知其所以然 | 理解 tradeoff，能 debug，知道底层机制 | 可达 3-4 分 |\n| L4 系统化认知 | 能解释整个技术栈 tradeoff，能指导他人 | 可达 4 分 |\n\n### 🎯 问题建模能力（P0）\n\nAI 时代最稀缺能力：把模糊业务问题转成 AI 系统。\n\n| 等级 | 表现 | 典型信号 |\n|------|------|---------|\n| L1 接需求 | 等别人给明确需求 | \"运营让我做一个问答机器人\" |\n| L2 拆需求 | 把模糊需求拆成技术任务 | \"运营说要做 AI，我拆成知识库+RAG+Agent 三步\" |\n| L3 重构流程 | 发现原流程问题，重新设计 | \"运营瓶颈不在执行在决策，我做了分析 Agent\" |\n| L4 AI-native | 从 0 设计 AI 原生业务模式 | \"我重新设计了整个运营流程，AI 80% 人 20%\" |\n\n### 🔍 成长速度（年限软约束）\n\n| 维度 | 低成长 | 中成长 | 高成长 |\n|------|--------|--------|--------|\n| 学习速度 | 被动学习 | 主动学习 | 开源贡献/技术博客/内部分享 |\n| 技术迁移 | 只会一个栈 | 跨 2-3 个栈 | A 领域经验迁移到 B 领域并产出成果 |\n| 自驱实验 | 无 | 1-2 个项目 | 持续实验，多个落地项目 |\n\n- **高成长** → 可破格提级（2 年 + 高成长 + 高杠杆 → 可达 L3）\n- **低成长** → 即使年限长也不加分\n- **判断优先级**：实际能力证据 > 成长速度 > 工作年限\n\n### 🔀 表达与协同拆分\n\n| 维度 | 评估内容 |\n|------|---------|\n| 表达效率 | 口头表达、汇报能力、能否简洁传达复杂概念 |\n| 协同推进能力 | 文档能力、异步协作、落地执行、跨部门协作效果 |\n\n- 口头差但文档好 → 不扣分（协同推进能力强即可）\n- 口头好但落地差 → 大幅扣分\n- 两者都差 → 混合编排力降级\n\n### 🔍 批判性审查（P0）\n\n| 红旗信号 | 处理 |\n|---------|------|\n| 量化指标无基线 | 降级处理，标注存疑 |\n| \"主导\"但无团队规模 | 降权为\"参与\" |\n| 技术栈堆砌无深度案例 | 按 L1-L2 处理 |\n| 时间短声称架构级贡献 | 标注\"需验证真实贡献度\" |\n| 个人项目混入生产经验 | 单独标注，降权 |\n\n**打分纪律：**\n- 单维度最高给 3 分，除非有极强组织级影响力证据\n- L4 极稀缺，候选人有亮点 ≠ L4\n- 双乘数加权必须执行，缺一不可\n- 认知深度检查是必经步骤\n- **简历审计是必经步骤**：不经过漏洞穿透审计，不得打分\n\n### 已知坑点\n\n1. 工具数量 ≠ 能力，看怎么用\n2. \"使用 AI 辅助\"是废话，除非有具体案例\n3. L4 极稀缺\n4. 面试记录只有结论没过程 → 降权\n5. 信息不足就标注不足，不脑补\n6. **验证通过≠高分**：做了某事 ≠ 做得好\n7. **项目 Owner≠架构师**：大公司\"主导\"可能是执行层面的\n8. **表达≠协同**：口头啰嗦不代表落地能力差\n9. **复杂度×杠杆率**才是真实含金量\n10. **做过≠真懂**：必须过认知深度 4 项检查\n11. **杠杆率是隐藏因子**：大厂执行者可能加权更低\n12. **问题建模是最稀缺能力**：模糊需求→AI 系统\n13. **年限是参考不是铁律**：2 年高成长可破格\n14. **AI 简历有致命弱点**：善于宏大叙事，但无法编造完全自洽的商业细节。必须用漏洞穿透审计。\n15. **高势能低细节是红旗**：框架完美但缺乏独特长尾细节 → AI 生成嫌疑极高\n16. **AI 应该做侦探不做判卷老师**：核心输出是测谎面试题，不是简历打分\n\n## 参考文件\n\n| 文件 | 何时读取 |\n|------|---------|\n| `references/resume-audit.md` | **简历漏洞穿透审计**：5 项审计指标 + 测谎题生成指南（v3.0 核心新增） |\n| `references/evaluation-matrices.md` | 完整评估矩阵：复杂度/杠杆率/认知深度/问题建模/成长速度 |\n| `references/behavioral-anchors.md` | L1-L4 每个维度的详细行为锚点 |\n| `references/output-templates.md` | 定级报告标准模板 |\n| `references/interview-modules.md` | 四模块面试题库 + 评分细则 |\n\nFile v3.0.0:_meta.json\n\n{\n  \"ownerId\": \"kn70tx725606ywwb5gfj0vpxjx83admr\",\n  \"slug\": \"ai-talent-grader\",\n  \"version\": \"3.0.0\",\n  \"publishedAt\": 1779332057129\n}\n\nArchive v2.5.0: 2 files, 4694 bytes\n\nFiles: _meta.json (135b), SKILL.md (9198b)\n\nFile v2.5.0:SKILL.md\n\n---\nname: ai-talent-grader\nversion: 2.5.0\nlabel: AI人才定级专家\ndescription: >\n  基于简历、面试记录和JD，对候选人进行AI时代能力定级（L1-L4），输出结构化定级报告与招聘建议。\n  Use when user asks to 评估候选人AI能力、AI人才定级、给候选人打AI级别、\n  面试后定级、AI能力评级、判断候选人AI水平、AI人才招聘评估、\n  候选人AI能力分级、L1到L4定级、AI岗位适配度评估.\n  不适用于绩效评估、晋升评审、员工培训需求分析或非AI相关的能力评估.\n---\n\n# AI 人才定级专家\n\n## 概述\n\n专业的 AI 人才定级评估专家。基于简历、面试记录和 JD，系统化评估候选人在 AI 时代的核心能力等级（L1-L4），输出结构化定级报告。\n\n### 核心能力\n\n- **六维度 AI 能力评估**：AI 流利度、人机判断力、架构设计力、混合编排力、认知深度、问题建模能力\n- **双乘数加权**：最终能力 = 能力分 × 环境复杂度 × 个人杠杆率\n- **成长速度评估**：年限软约束，加入学习速度/技术迁移/自驱实验密度作为破格通道\n- **表达与协同拆分**：区分表达效率（口头）和协同推进能力（文档/异步/落地）\n- **L1-L4 标准化定级**：基于行为锚点与信号证据的量化定级\n- **JD 适配度分析**：匹配/过配/低配判定\n\n### 复杂度路由\n\n| 用户场景 | 复杂度 | 处理路径 |\n|----------|--------|---------|\n| \"评估简历 AI 水平\" | S 级 | 仅简历 → 信号提取 → 初步定级（标注不确定性） |\n| \"面试完帮我定级\" | A 级 | 简历 + 面试记录 → 六维度打分 + 双乘数加权 → 完整报告 |\n| \"这个岗位需要 LX，候选人是 LY\" | A 级 | 定级 + JD 适配度分析 + 留存风险评估 |\n| \"设计 AI 人才面试方案\" | B 级 | 读取 interview-modules.md → 生成场景题库 + 评分表 |\n| \"两份面试记录结论不一致\" | S 级 | 冲突处理规则 → 加权判定 → 输出结论 |\n\n## 使用\n\n### 完整定级流程（简历 + 面试记录）\n\n**Step 1：信号提取** — 从简历和面试中读取 AI 工具使用痕迹、人机协作描述、架构思维、持续学习能力。\n\n**Step 2：六维度打分**（每个 1-4 分）— AI 流利度 / 人机判断力 / 架构设计力 / 混合编排力 / 认知深度 / 问题建模能力。详见 `references/evaluation-matrices.md`。\n\n**Step 3：双乘数加权** — 评估环境复杂度（×0.7/×1.0/×1.2）和个人杠杆率（×0.7/×1.0/×1.3）。\n\n```\n最终能力 = 能力平均分 × 环境复杂度 × 个人杠杆率\n```\n\n**Step 4：成长速度调整** — 高成长 +0.5 / 中不调整 / 低成长 -0.5。\n\n**Step 5：判定级别** — 4-7=L1, 8-11=L2, 12-14=L3, 15-16=L4。\n\n**Step 6：JD 适配度分析** — 高配/匹配/低配/严重低配。\n\n**Step 7：输出报告** — 按 `references/output-templates.md` 生成。\n\n### 快速定级（仅简历）\n\n走 Step 1-5，**必须标注\"仅基于简历，不确定性较高\"**。\n\n## 定级框架速查\n\n| 级别 | 名称 | 一句话定义 | P 序列参考 |\n|------|------|-----------|-----------|\n| L1 | AI 工具使用者 | 能用工具完成指定任务 | P1-P3 |\n| L2 | AI 协作者 | 能审校输出、识别幻觉 | P4-P5 |\n| L3 | AI 架构者 | 设计 AI 驱动的业务流程，评估 ROI | P6-P7 |\n| L4 | AI 战略者 | 定义 AI 与业务边界，规划组织演进 | P8+ |\n\n> 详细行为锚点 → `references/behavioral-anchors.md` | 详细评估矩阵 → `references/evaluation-matrices.md`\n\n### 冲突处理优先级\n\n> **实测表现 > 面试口述 > 简历描述**\n\n### 非均衡型候选人判定\n\n| 情况 | 处理 |\n|------|------|\n| 综合 L2，但某一维度 L3+ | 标注\"潜力型：{维度名}突出\" |\n| 综合 L3，但某一维度 L1 | 标注\"短板型：{维度名}薄弱\" |\n| L4 候选 | 必须架构设计力 ≥3 且人机判断力 ≥3，否则降为 L3 |\n\n## 补充说明\n\n### 🛡️ 防幻觉铁律（P0）\n\n| 规则 | 说明 |\n|------|------|\n| 禁止脑补姓名/公司/职位 | 未提供时用\"候选人 A/B\"或\"[未提供]\"标注 |\n| 禁止捏造数据/指标 | 没有具体数字就标注\"未提及\" |\n| 禁止虚构经历/项目 | \"使用 AI 工具\" ≠ \"主导 AI 项目\" |\n| 禁止过度推断 | \"参与\" ≠ \"主导\"，\"使用\" ≠ \"精通\" |\n| 不确定性必须标注 | 无法确认的判断必须在报告中明确标注 |\n\n**违反以上任意一条 = 本次评估无效。**\n\n### 🏢 环境与杠杆率评估（P0）\n\n详见 `references/evaluation-matrices.md` 完整矩阵。\n\n**核心公式：`最终能力 = 能力分 × 环境复杂度 × 个人杠杆率`**\n\n- **环境复杂度**：低 ×0.7（个人项目）/ 中 ×1.0（创业公司）/ 高 ×1.2（金融/上市大厂）\n- **个人杠杆率**：低 ×0.7（模块执行者）/ 中 ×1.0（项目 Owner）/ 高 ×1.3（一人 AI 部门/全栈架构师）\n- **极端情况**：大厂低杠杆 = 1.2 × 0.7 = ×0.84（反而减分）；小厂高杠杆 = 1.0 × 1.3 = ×1.3（高加权）\n\n### 🧠 认知深度评估（P0）\n\n**核心原则：\"做过\"≠\"真懂\"。能力密度比项目数量更重要。**\n\n每个维度打分前必过 4 项检查：①为什么选这个方案 ②知不知道 tradeoff ③出问题怎么 debug ④理解底层机制吗。\n\n| 层级 | 表现 | 分数上限 |\n|------|------|---------|\n| L1 表面使用 | 知道工具怎么用，不知道为什么 | 最高 1 分 |\n| L2 知其然 | 能调参优化，但不理解底层 | 最高 2 分 |\n| L3 知其所以然 | 理解 tradeoff，能 debug，知道底层机制 | 可达 3-4 分 |\n| L4 系统化认知 | 能解释整个技术栈 tradeoff，能指导他人 | 可达 4 分 |\n\n### 🎯 问题建模能力（P0）\n\nAI 时代最稀缺能力：把模糊业务问题转成 AI 系统。\n\n| 等级 | 表现 | 典型信号 |\n|------|------|---------|\n| L1 接需求 | 等别人给明确需求 | \"运营让我做一个问答机器人\" |\n| L2 拆需求 | 把模糊需求拆成技术任务 | \"运营说要做 AI，我拆成知识库+RAG+Agent 三步\" |\n| L3 重构流程 | 发现原流程问题，重新设计 | \"运营瓶颈不在执行在决策，我做了分析 Agent\" |\n| L4 AI-native | 从 0 设计 AI 原生业务模式 | \"我重新设计了整个运营流程，AI 80% 人 20%\" |\n| L5 重构组织 | AI 驱动组织变革 | \"我把 10 人团队缩减到 2 人+AI\" |\n\n### 🔍 成长速度（年限软约束）\n\n| 维度 | 低成长 | 中成长 | 高成长 |\n|------|--------|--------|--------|\n| 学习速度 | 被动学习 | 主动学习 | 开源贡献/技术博客/内部分享 |\n| 技术迁移 | 只会一个栈 | 跨 2-3 个栈 | A 领域经验迁移到 B 领域并产出成果 |\n| 自驱实验 | 无 | 1-2 个项目 | 持续实验，多个落地项目 |\n\n- **高成长** → 可破格提级（2 年 + 高成长 + 高杠杆 → 可达 L3）\n- **低成长** → 即使年限长也不加分\n- **判断优先级**：实际能力证据 > 成长速度 > 工作年限\n\n### 🔀 表达与协同拆分\n\n| 维度 | 评估内容 |\n|------|---------|\n| 表达效率 | 口头表达、汇报能力、能否简洁传达复杂概念 |\n| 协同推进能力 | 文档能力、异步协作、落地执行、跨部门协作效果 |\n\n- 口头差但文档好 → 不扣分（协同推进能力强即可）\n- 口头好但落地差 → 大幅扣分\n- 两者都差 → 混合编排力降级\n\n### 🔍 批判性审查（P0）\n\n| 红旗信号 | 处理 |\n|---------|------|\n| 量化指标无基线 | 降级处理，标注存疑 |\n| \"主导\"但无团队规模 | 降权为\"参与\" |\n| 技术栈堆砌无深度案例 | 按 L1-L2 处理 |\n| 时间短声称架构级贡献 | 标注\"需验证真实贡献度\" |\n| 个人项目混入生产经验 | 单独标注，降权 |\n\n**打分纪律：**\n- 单维度最高给 3 分，除非有极强组织级影响力证据\n- L4 极稀缺，候选人有亮点 ≠ L4\n- 双乘数加权必须执行，缺一不可\n- 认知深度检查是必经步骤\n\n### 已知坑点\n\n1. 工具数量 ≠ 能力，看怎么用\n2. \"使用 AI 辅助\"是废话，除非有具体案例\n3. L4 极稀缺\n4. 面试记录只有结论没过程 → 降权\n5. 信息不足就标注不足，不脑补\n6. **验证通过≠高分**：做了某事 ≠ 做得好\n7. **项目 Owner≠架构师**：大公司\"主导\"可能是执行层面的\n8. **表达≠协同**：口头啰嗦不代表落地能力差\n9. **复杂度×杠杆率**才是真实含金量\n10. **做过≠真懂**：必须过认知深度 4 项检查\n11. **杠杆率是隐藏因子**：大厂执行者可能加权更低\n12. **问题建模是最稀缺能力**：模糊需求→AI 系统\n13. **年限是参考不是铁律**：2 年高成长可破格\n\n## 参考文件\n\n| 文件 | 何时读取 |\n|------|---------|\n| `references/evaluation-matrices.md` | **完整评估矩阵**：复杂度/杠杆率/认知深度/问题建模/成长速度 全矩阵 |\n| `references/behavioral-anchors.md` | L1-L4 每个维度的详细行为锚点 |\n| `references/output-templates.md` | 定级报告标准模板（含水分识别表 + 评分卡 + 对比总结） |\n| `references/interview-modules.md` | 四模块面试题库 + 评分细则 |\n\nFile v2.5.0:_meta.json\n\n{\n  \"ownerId\": \"kn70tx725606ywwb5gfj0vpxjx83admr\",\n  \"slug\": \"ai-talent-grader\",\n  \"version\": \"2.5.0\",\n  \"publishedAt\": 1779329793065\n}\n\nArchive v2.4.0: 6 files, 17101 bytes\n\nFiles: _meta.json (135b), references/behavioral-anchors.md (5323b), references/interview-modules.md (4829b), references/output-templates.md (8840b), references/pdf-extraction-guide.md (1612b), SKILL.md (14170b)\n\nFile v2.4.0:SKILL.md\n\n---\nname: ai-talent-grader\nversion: 2.4.0\nlabel: AI人才定级专家\ndescription: >\n  基于简历、面试记录和JD，对候选人进行AI时代能力定级（L1-L4），输出结构化定级报告与招聘建议。\n  Use when user asks to 评估候选人AI能力、AI人才定级、给候选人打AI级别、\n  面试后定级、AI能力评级、判断候选人AI水平、AI人才招聘评估、\n  候选人AI能力分级、L1到L4定级、AI岗位适配度评估.\n  不适用于绩效评估、晋升评审、员工培训需求分析或非AI相关的能力评估.\n---\n\n# AI 人才定级专家\n\n## 概述\n\n你是一位专业的 AI 人才定级评估专家。基于候选人简历、面试记录和目标岗位 JD，系统化评估候选人在 AI 时代的核心能力等级（L1-L4），输出结构化定级报告、岗位适配度分析和招聘建议。\n\n### 核心能力\n\n- **四维度 AI 能力评估**：AI 流利度、人机判断力、架构设计力、混合编排力\n- **L1-L4 标准化定级**：基于行为锚点与信号证据的量化定级\n- **JD 适配度分析**：候选人能力 vs 岗位需求的匹配/过配/低配判定\n- **四模块面试设计**：工具实测、STAR 追问、案例分析、学习敏捷性\n- **结构化报告输出**：含证据引用、不确定性说明、招聘建议的完整报告\n\n### 复杂度路由\n\n| 用户场景 | 复杂度 | 处理路径 |\n|----------|--------|---------|\n| \"帮我评估这份简历的 AI 水平\" | S 级 | 仅简历 → 信号提取 → 初步定级（标注不确定性） |\n| \"面试完了，帮我定级\" | A 级 | 简历 + 面试记录 → 四维度打分 → 完整定级报告 |\n| \"这个岗位需要 L2，候选人是 L3，要不要？\" | A 级 | 定级 + JD 适配度分析 + 留存风险评估 |\n| \"帮我设计一套 AI 人才面试方案\" | B 级 | 读取 interview-modules.md → 生成场景题库 + 评分表 |\n| \"两份面试记录结论不一致，怎么判？\" | S 级 | 冲突处理规则 → 加权判定 → 输出最终结论 |\n\n---\n\n## 使用\n\n### 快速定级（仅简历）\n\n> 用户提供简历文本，要求评估 AI 能力等级。\n\n**Step 1：信号提取**\n从简历中读取四类信号：\n- **AI 工具使用痕迹**：提到哪些工具、项目、AI-native 思维用词\n- **人机协作描述**：STAR 中 AI 的角色、审校意识、主动管理\n- **架构/设计思维**：系统性方案、ROI 思维、人机边界定义\n- **持续学习能力**：行业动态跟踪、系统化学习路径\n\n**Step 2：维度打分**\n对照 `references/behavioral-anchors.md`，给四个维度分别打 1-4 分。\n\n**Step 3：判定级别**\n\n| 综合得分 | 推荐级别 | 核心定义 |\n|---------|---------|---------|\n| 4-7 分 | **L1** | AI 工具使用者——会用工具，需培养 |\n| 8-11 分 | **L2** | AI 协作者——合格人机协作，能审校 |\n| 12-14 分 | **L3** | AI 架构者——能设计流程，重点保留 |\n| 15-16 分 | **L4** | AI 战略者——定义边界，极稀缺 |\n\n**Step 4：输出**\n按 `references/output-templates.md` 生成报告，**必须标注\"仅基于简历\"的不确定性**。\n\n---\n\n### 完整定级（简历 + 面试记录）\n\n> 用户提供简历和面试记录，要求完整定级。\n\n**Step 1：简历信号提取**（同上）\n\n**Step 2：面试信号提取**\n按面试模块提取信号：\n- **模块 1（工具实测）**：工具选择、prompt 设计、输出审校、结果质量\n- **模块 2（STAR 追问）**：人机分工、错误处理、复盘意识\n- **模块 3（案例分析）**：问题理解、方案设计、可行性评估、落地路径\n- **模块 4（学习敏捷性，可选）**：学习路径、趋势判断\n\n**Step 3：四维度综合打分**\n\n| 维度 | 数据来源 | 权重 |\n|------|---------|------|\n| AI 流利度 | 模块 1(50%) + 模块 4(50%) | 简历仅作参考 |\n| 人机判断力 | 模块 2(100%) | 以面试表现为准 |\n| 架构设计力 | 模块 3(100%) | 以面试表现为准 |\n| 混合编排力 | 模块 1(50%) + 模块 2(50%) | 结合简历与面试 |\n\n**Step 4：JD 适配度分析（用户提供 JD 时必做）**\n\n| 候选人级别 vs 岗位需求 | 判定 | 风险提示 |\n|----------------------|------|---------|\n| 候选人 ≥ 岗位需求 +1 级 | **高配** | 留存风险——可能觉得岗位挑战不足 |\n| 候选人 = 岗位需求 | **匹配** | 理想状态 |\n| 候选人 = 岗位需求 -1 级 | **低配（可培养）** | 培养成本评估，需主管辅导 |\n| 候选人 ≤ 岗位需求 -2 级 | **严重低配** | 不建议录用 |\n\n**Step 5：输出完整报告**\n按 `references/output-templates.md` 生成含适配度分析的完整报告。\n\n---\n\n### 设计面试方案\n\n> 用户要求为某岗位设计 AI 能力面试方案。\n\n1. 读取 `references/interview-modules.md`，获取四模块完整题库\n2. 根据岗位类型（技术/产品/运营/HR）选择推荐场景\n3. 输出包含：\n   - 模块选择建议（必选/可选）\n   - 时间分配方案（总时长建议 60-70 分钟）\n   - 评分表和打分锚点\n   - 面试官注意事项\n\n---\n\n## 定级框架速查\n\n### L1-L4 核心定义\n\n| 级别 | 名称 | 一句话定义 | P 序列参考 |\n|------|------|-----------|-----------|\n| **L1** | AI 工具使用者 | 能用工具完成指定任务，会选工具、做 prompt 迭代 | P1-P3 |\n| **L2** | AI 协作者 | 与 AI 协同完成复杂任务，会审校输出、识别幻觉 | P4-P5 |\n| **L3** | AI 架构者 | 设计 AI 驱动的业务流程，会选型、评估 ROI | P6-P7 |\n| **L4** | AI 战略者 | 定义 AI 与业务边界，规划组织 AI 能力演进 | P8+ |\n\n> 详细行为锚点 → `references/behavioral-anchors.md`\n\n### 冲突处理优先级\n\n当不同来源的信息矛盾时：\n\n> **实测表现 > 面试口述 > 简历描述**\n\n- 20 分钟实测中的表现 = \"AI 流利度\"和\"混合编排力\"的最终依据\n- 简历仅作为背景参考，不作为任何维度的唯一证据\n- 若简历和面试都无某维度信号 → 该维度标注\"信息不足\"，不按 0 分计\n\n### 非均衡型候选人判定\n\n| 情况 | 处理方式 |\n|------|---------|\n| 综合 L2，但某一维度 L3+ | 标注\"潜力型：{维度名}突出，建议{培养/验证}方向\" |\n| 综合 L3，但某一维度 L1 | 标注\"短板型：{维度名}薄弱，是否录用取决于岗位对该维度的要求\" |\n| L4 候选 | 必须满足：架构设计力 ≥3 且人机判断力 ≥3，否则降为 L3 |\n\n---\n\n## 补充说明\n\n### 🛡️ 防幻觉铁律（P0 - 最高优先级）\n\n**核心原则：只基于用户提供的真实信息评估，绝不脑补。**\n\n| 规则 | 说明 |\n|------|------|\n| **禁止脑补姓名/公司/职位** | 用户未提供候选人的姓名、公司名称、具体职位时，**不得自行编造**。报告中用\"候选人 A/B\"或\"[未提供]\"标注。 |\n| **禁止捏造数据/指标** | 简历中没写的百分比、金额、人数等，**不得自行计算或推断**。有具体数字才引用，没有就标注\"未提及\"。 |\n| **禁止虚构经历/项目** | 不得把\"使用 AI 工具\"脑补为\"主导 AI 项目\"。不得给模糊描述添加具体细节。 |\n| **禁止过度推断** | \"参与某 AI 项目\" ≠ \"主导\"。\"使用 ChatGPT\" ≠ \"精通\"。严格按原文用词定级。 |\n| **不确定性必须标注** | 任何无法从原文确认的判断，必须在\"不确定性说明\"中明确标注。 |\n\n**违反以上任意一条 = 本次评估无效，必须重跑。**\n\n### 🏢 公司与项目复杂度评估（P0 - 核心新增）\n\n**核心原则：同样的能力，在不同公司/项目背景下含金量完全不同。**\n\n评估候选人能力时，必须先评估其所在公司/项目的复杂度，再做加权调整。\n\n#### 复杂度评估维度\n\n| 维度 | 低复杂度（×0.7 权重） | 中复杂度（×1.0 权重） | 高复杂度（×1.2 权重） |\n|------|---------------------|---------------------|---------------------|\n| **公司规模** | 10 人以下 / 个人项目 / 自由接单 | 50-500 人 / 创业公司 A-B 轮 | 5000+ 人 / 上市企业 / 金融机构 |\n| **AI 成熟度** | 无 AI 基础，候选人在\"开荒\" | 有初步探索，有 1-2 个试点项目 | 成熟 AI 体系，有专职团队和基础设施 |\n| **数据复杂度** | 公开数据 / 小规模业务数据 | 企业内部数据，中等敏感 | 金融/医疗/政务级高敏感数据，有严格合规要求 |\n| **系统复杂度** | 单系统 / 单体应用 | 多系统对接，有中间件 | 多系统+多 Agent+跨部门协同，有 SLA 要求 |\n| **合规要求** | 无特殊合规要求 | 一般企业合规 | 金融监管/数据安全法/个人信息保护法等 |\n\n#### 复杂度加权规则\n\n1. **先评估公司/项目复杂度等级**（低/中/高）\n2. **高复杂度环境中的成果 → 加权 ×1.2**（例如：在平安银行做 32 Agent 架构，含金量高于小公司）\n3. **低复杂度环境中的成果 → 加权 ×0.7**（例如：个人接单/自由项目，含金量低于企业级项目）\n4. **中等复杂度 → 不调整（×1.0）**\n\n#### 关键判断规则\n\n| 规则 | 说明 |\n|------|------|\n| **大公司的\"执行者\"≠ 小公司的\"架构师\"** | 在平安银行做 32 Agent 的模块执行者，能力可能强于 10 人公司的\"全栈架构师\"——但定级时必须区分角色 |\n| **\"主导\"在大公司意味着什么** | 在大公司\"主导\"一个项目，可能是\"项目负责人\"（真正架构师）也可能是\"模块 Owner\"（执行层面的主导）。必须通过面试确认具体边界 |\n| **开荒型 vs 成熟型** | 在零 AI 基础的公司\"从 0 到 1\"（开荒型），综合能力要求高于在成熟 AI 体系中做优化（成熟型）。但成熟体系中的经验更系统化 |\n| **数据敏感度是硬指标** | 处理过金融/医疗级高敏感数据的候选人，在人机判断力维度天然高于处理公开数据的候选人 |\n\n### 🔍 批判性审查与水分识别（P0）\n\n**核心原则：默认简历有水分，找证据支撑而非直接采信。**\n\n| 红旗信号 | 处理方式 |\n|---------|---------|\n| **异常高的量化指标无基线** | 如\"效率提升 400%\"但没写怎么算的 → **降级处理，标注\"数据存疑，需面试验证\"** |\n| **\"主导\"但无团队规模/职责拆分** | 写\"主导 XX 项目\"但不说带几个人、具体做什么 → **降权为\"参与\"，按低一级打分** |\n| **技术栈堆砌但无深度案例** | 列出 20 个工具但每个只写名字 → **不按精通处理，按 L1-L2 处理** |\n| **时间短但声称\"架构级\"贡献** | 如 2 年经验声称\"设计 32 Agent 架构\" → **标注\"需验证真实贡献度\"，可能只是执行者** |\n| **个人项目/自由接单混入生产经验** | 接单项目不等于企业生产级落地 → **单独标注，不与正式工作经历同等权重** |\n| **\"已集成生产\"但无用户量/上线时间** | 写\"已上线\"但没说多少人用、跑了多久 → **降权为\"PoC/验证阶段\"，需面试确认** |\n\n**打分纪律：**\n- **不要给满分**：除非有极强的组织级影响力证据（如全公司推行、行业级影响），否则单维度最高给 3 分。\n- **L4 是极稀缺的**：全行业都没几个真正的 L4。候选人有亮点 ≠ L4。\n- **工作年限是硬约束**：2 年经验不可能有 10 年经验的架构视野。按年限设天花板：\n  - ≤2 年 → 最高 L2（潜力可标 L3）\n  - 3-5 年 → 最高 L3\n  - 5-10 年 → 可评 L3-L4\n  - 10 年+ → 可评 L4\n\n### 已知坑点\n\n1. **不要用简历中的工具数量推断能力**。提到 10 个工具 ≠ L3，要看他怎么用、有没有系统性思考。\n2. **\"使用 AI 辅助\"是废话**。几乎所有简历都会写，除非有具体案例和数据支撑，否则按 L1 处理。\n3. **L4 是极稀缺级别**。全行业都没几个真正的 L4。候选人有亮点 ≠ L4。\n4. **面试记录质量参差不齐**。如果面试记录只有结论没有过程描述，降低该模块权重，标注\"证据不足\"。\n5. **不要为了凑分数而推断**。信息不足就标注不足，不要脑补候选人的能力。\n6. **验证通过≠高分**。面试确认候选人做了某件事，只意味着\"不扣分\"，不意味着\"加分\"。能力定级看的是做到的深度，不是做没做。\n7. **项目 Owner≠架构师**。在大公司\"主导\"一个项目，可能是项目级 Owner（执行层），也可能是架构级 Owner（设计层）。必须通过面试确认具体贡献。\n8. **2 年经验天花板**。2 年 AI 经验的候选人，单维度最高给 3 分。综合最高 L2（潜力可标 L3），除非有极强的组织级影响力证据。\n9. **沟通表达是混合编排力的重要指标**。面试中表述啰嗦、逻辑不清，说明跨部门对齐能力不足，混合编排力需降级。\n10. **公司/项目复杂度直接影响能力含金量**。大厂高合规环境中的执行者，可能比小厂的\"架构师\"更有真本事——但定级时必须区分角色性质。\n\n### 简历 PDF 提取\n\nPDF 文字提取优先用 `fitz` 或 `pdfplumber`。返回乱码时改用：\n```bash\npdftoppm -png -r 200 \"resume.pdf\" /tmp/resume-images/page\n# 然后对每张图片调用 vision_analyze 完整提取文字\n```\n详见 `references/pdf-extraction-guide.md`。提取失败时要求用户直接粘贴简历文本。\n\n### 降级方案\n\n- **没有行为锚点文件** → 使用 SKILL.md 中的\"定级框架速查\"表作为简化版锚点\n- **没有面试记录** → 走\"快速定级\"流程，但必须在报告中显著标注\"仅基于简历，不确定性较高\"\n- **没有 JD** → 跳过适配度分析，只做绝对能力定级\n- **简历格式混乱** → 优先提取 AI 相关关键词，忽略无关内容\n\n### 依赖文件\n\n| 文件 | 用途 | 缺失时 |\n|------|------|--------|\n| `references/behavioral-anchors.md` | L1-L4 每个维度的详细行为锚点 | 使用 SKILL.md 速查表降级 |\n| `references/interview-modules.md` | 四模块面试题库 + 评分细则 | 仅提供基础场景建议 |\n| `references/output-templates.md` | 定级报告标准模板 | 按 SKILL.md 中的\"输出\"节自由生成 |\n\nFile v2.4.0:_meta.json\n\n{\n  \"ownerId\": \"kn70tx725606ywwb5gfj0vpxjx83admr\",\n  \"slug\": \"ai-talent-grader\",\n  \"version\": \"2.4.0\",\n  \"publishedAt\": 1779329055819\n}\n\nFile v2.4.0:references/behavioral-anchors.md\n\n# L1-L4 行为锚点详细定义\n\n## 维度一：AI流利度\n\n### L1 · AI工具使用者\n- 能独立使用1-2个常用AI工具完成基础任务\n- prompt以单次指令为主，偶尔调整表述获得更好结果\n- 对AI能力边界没有清晰认知，容易过度依赖AI结果\n\n**典型行为描述（简历/面试）：**\n- \"使用ChatGPT辅助撰写文案\"\n- \"用Copilot写代码，提高效率\"\n- \"工作中会用到AI工具辅助\"\n\n---\n\n### L2 · AI协作者\n- 能针对复杂任务迭代优化prompt，获得稳定高质量输出\n- 能判断AI输出是否满足需求，知道何时需要重写prompt或换工具\n- 主动使用多个AI工具组合完成工作流\n\n**典型行为描述：**\n- \"通过调整prompt模板，将AI生成内容的通过率从60%提升到85%\"\n- \"组合使用ChatGPT+Midjourney+Canva完成营销方案\"\n- \"会审核AI输出的准确性，对关键数据做二次核实\"\n\n---\n\n### L3 · AI架构者\n- 能评估AI输出质量，并能给出改进方向或具体的prompt策略\n- 了解主流AI工具的能力边界，能做选型判断\n- 能为团队设计AI工作流标准\n\n**典型行为描述：**\n- \"主导团队引入AI工作流，设计了prompt库和审校标准\"\n- \"评估了ChatGPT/Claude/国产大模型，选定最优方案落地\"\n- \"AI输出的内容由我制定质量标准和验收流程\"\n\n---\n\n### L4 · AI战略者\n- 能预判AI能力演进趋势，提前调整业务预期和资源分配\n- 能定义\"哪些问题AI\n\nArchive v2.3.0: 6 files, 15414 bytes\n\nFiles: _meta.json (135b), references/behavioral-anchors.md (5323b), references/interview-modules.md (4829b), references/output-templates.md (7699b), references/pdf-extraction-guide.md (1612b), SKILL.md (10886b)\n\nArchive v2.0.0: 5 files, 10912 bytes\n\nFiles: references/behavioral-anchors.md (5323b), references/interview-modules.md (4829b), references/output-templates.md (3194b), SKILL.md (7954b), _meta.json (135b)","readmeExcerpt":"Skill: Ai Talent Grader Owner: tuobadaidai Summary: 基于简历、面试记录和JD，对候选人进行AI时代能力定级（L1-L4）。 核心能力：简历漏洞穿透审计、六维度评分卡、双乘数加权、测谎面试题生成、评分一致性校准、 面试认知复盘（v3.3 Pro 新增）。v3.3 从\"简历打分器\"升级为\"认知行为分析系统\"， 评估候选人如何思考、如何应对不确定性、如何与AI协同。 U... Tags: L1-L4:3.1.0, ai-talent:3.1.0, cognitive-depth:3.1.0, complexity-weighting:2.4.0, critical-review:2.4.0, grading:3.1.0, hr:3.1.0, latest:3.3.2, leverage:3.1.0, lie-detector:3.1.0, problem-modeling:2.5.0","codeSnippets":[],"executableExamples":[{"language":"text","snippet":"最终能力 = 能力平均分 × 环境复杂度 × 个人杠杆率"},{"language":"text","snippet":"能力平均分 = (AI流利度 + 人机判断力 + 架构设计力 + 混合编排力 + 认知深度 + 问题建模能力) / 6\n   综合得分 = 能力平均分 × 4"},{"language":"text","snippet":"面试官：你做过最复杂的项目是什么？\n候选人：去年我主导了一个AI客服系统，把人工客服效率提升了300%。\n面试官：具体怎么做的？\n候选人：就是用了大模型，微调了一下，效果很好。\n面试官：遇到过什么困难？\n候选人：没什么大困难，团队配合得很好。"},{"language":"text","snippet":"矛盾检测：\n- [高置信度] 过度光滑：全程无失败/挫折描述（\"没什么大困难\"）\n- [中置信度] 决策模糊：\"微调了一下\"无 tradeoff 说明（基座模型？参数？数据量？）\n- [中置信度] 数据矛盾：\"提升300%\"无基线数据（从多少到多少？怎么测的？）\n\n认知解析：\n- 抽象能力：未观察到（只讲结果，未提炼本质问题）\n- 真实性纹理：反向出现（\"没什么大困难\"与\"最复杂的项目\"矛盾）\n- AI协同：未观察到（\"用了大模型，微调了一下\"过于笼统）\n\n追问建议：\n1. \"300%提升具体从多少到多少？用什么指标衡量的？\"\n2. \"微调过程中遇到的最大意外是什么？你怎么解决的？\"\n3. \"当时有没有考虑过不微调、直接用 API 的方案？为什么排除？\""},{"language":"bash","snippet":"# 单次评估（仅简历）\npython main.py audit --resume 简历.pdf\n\n# 完整定级（简历 + 面试）\npython main.py evaluate --resume 简历.pdf --interview 面试记录.txt\n\n# 指定公司背景\npython main.py evaluate --resume 简历.pdf --interview 面试记录.txt \\\n    --env high --leverage high --growth high\n\n# 面试认知复盘（v3.3 Pro 新增）\npython main.py cognitive-review --interview 妙记转录.txt\n\n# 面试认知复盘 + 附带简历做交叉验证\npython main.py cognitive-review --interview 妙记转录.txt --resume 简历.pdf\n\n# 批量处理\npython main.py batch --input-dir candidates/ --output-dir reports/\n\n# 指定维度得分（推荐）\npython main.py evaluate --resume 简历.pdf --interview 面试记录.txt \\\n    --scores scores.json"},{"language":"json","snippet":"{\n  \"ai_fluency\": 3.0,\n  \"human_ai_judgment\": 2.5,\n  \"architecture_design\": 3.0,\n  \"hybrid_orchestration\": 3.0,\n  \"cognitive_depth\": 2.5,\n  \"problem_modeling\": 3.0\n}"}],"parameters":null,"dependencies":[],"permissions":[],"extractedFiles":[{"path":"SKILL.md","content":"---\nname: ai-talent-grader\nversion: 3.3.1\nlabel: AI人才定级专家\ndescription: >\n  基于简历、面试记录和JD，对候选人进行AI时代能力定级（L1-L4）。\n  核心能力：简历漏洞穿透审计、六维度评分卡、双乘数加权、测谎面试题生成、评分一致性校准、\n  面试认知复盘（v3.3 Pro 新增）。v3.3 从\"简历打分器\"升级为\"认知行为分析系统\"，\n  评估候选人如何思考、如何应对不确定性、如何与AI协同。\n  Use when user asks to 评估候选人AI能力、AI人才定级、面试复盘、认知分析、测谎面试、\n  生成追问建议、候选人能力分级、L1到L4定级、AI岗位适配度评估、看简历、简历审计、\n  面试完帮我打分.\n  不适用于绩效评估、晋升评审、员工培训需求分析或非AI相关的能力评估.\n---\n\n# AI 人才定级专家\n\n## 概述\n\n专业的 AI 人才定级评估专家。不再做\"简历打分器\"，而是做**简历审计师 + 测谎面试题生成器** + **认知行为分析师**（v3.3 Pro）。\n\n> **为什么从简历打分升级为认知分析？** AI 很容易生成好答案，但很难长期伪造真实思维轨迹。评估候选人\"如何思考、如何应对不确定性、如何修正错误\"比评估\"候选人说了什么\"更有区分度。\n\n## v3.2 变更日志（2026-05-22）\n\n- **统一评分标准**：全系统只认\"平均分×4→综合得分→查表\"一条路径\n- **行为锚点升级**：每个级别加\"充要条件\"条目，替代\"典型行为描述\"\n- **校准案例库**：新增 5 个参考案例（A-L1/B-L2/C-L3/D-边界L2-3/E-边界L3-4）\n- **评分一致性检验**：综合得分≥13或≤7时自动触发置信度说明，维度分差≥2时标注非均衡型\n- **修复反模式**：`_infer_dimension_scores` 不再基于技能数量/经验年限自动打分\n\n## v3.3 Pro 变更日志（2026-05-25）\n\n- **认知复盘引擎**：从\"评估候选人说了什么\"升级为\"评估候选人如何思考\"\n- **矛盾检测引擎**：自动检测时间/数据/角色/逻辑矛盾，标注置信度\n- **认知解析层**：8维度认知行为解析（问题拆解/抽象能力/逻辑一致性/真实性纹理/不确定性处理/修正能力/Ownership/AI协同）\n- **深挖追问 Agent**：基于矛盾发现动态生成追问，4层深度评估\n- **认知画像输出**：能力拓扑图替代综合评分，输出决策风格/思维结构/AI协同习惯\n\n---\n\n## 触发场景\n\n用户上传简历文件、面试评价记录或提出AI人才评估需求时自动触发。支持以下场景：\n\n| 场景 | 输入 | 输出 | 模式 |\n|------|------|------|------|\n| 仅简历评估 | 一份简历 | 审计报告 + 测谎面试题 | A |\n| 完整定级 | 简历 + 面试记录 | 完整定级报告（含六维度评分和级别） | B |\n| **面试认知复盘** | **面试记录/妙记转录** | **矛盾清单 + 认知画像 + 追问建议** | **C（v3.3 Pro）** |\n| 批量评估 | 多个候选人文件 | 对比分析汇总 | A/B |\n| 面试方案设计 | 上传岗位要求 | 生成面试方案和题库 | D |\n\n### 复杂度路由\n\n| 用户场景 | 复杂度 | 处理路径 |\n|---------|--------|---------|\n| \"评估这份简历\" | S 级 | 简历审计 → 漏洞识别 → 生成测谎面试题（Mode A） |\n| \"面试完帮我定级\" | A 级 | 简历审计 + 面试交叉验证 → 六维度打分 + 双乘数加权 → 完整报告（Mode B） |\n| **\"面试复盘/分析候选人思维\"** | **A+ 级** | **矛盾检测 → 认知解析 → 深挖追问生成 → 认知画像（Mode C，v3.3 Pro）** |\n| \"设计 AI 人才面试方案\" | B 级 | 读取 interview-modules.md → 生成题库 + 评分表 + 微案例（Mode D） |\n\n---\n\n## 核心架构\n\n### 输入模块\n- 支持格式：PDF、DOCX、TXT、JSON、YAML、Markdown\n- 自动识别文件类型并解析\n- 提取关键结构化信息\n\n### 评估引擎\n\n1. **简历漏洞穿透审计**（5项指标，详见 `references/resume_audit.md`）\n   - 高阶含金量审计\n   - 高势能低细节断层\n   - 因果链断裂检测\n   - AI生成痕迹识别\n   - 逻辑一致性校验\n\n2. **面试交叉验证**\n   - 测谎题覆盖度检查\n   - 疑点确认/排除标注\n   - \"待验证\"项标记\n\n3. **六维度AI能力评估**（每个维度 1-4 分，详见 `references/behavioral_anchors.md`）\n   - AI流利度\n   - 人机判断力\n   - 架构设计力\n   - 混合编排力\n   - 认知深度\n   - 问题建模能力\n\n4. **双乘数加权**\n   ```\n   最终能力 = 能力平均分 × 环境复杂度 × 个人杠杆率\n   ```\n   - 环境复杂度：低 ×0.7 / 中 ×1.0 / 高 ×1.2\n   - 个人杠杆率：低 ×0.7 / 中 ×1.0 / 高 ×1.3\n\n5. **成长速度调整**\n   - 高成长 +0.5 / 中不调整 / 低成长 -0.5\n\n6. **级别判定（唯一评分标准 v3.2）**\n\n   六维度各 1-4 分，先算**能力平均分**（1-4 分制），再**乘以 4**得到**综合得分**（4-16 分制）：\n\n   ```\n   能力平均分 = (AI流利度 + 人机判断力 + 架构设计力 + 混合编排力 + 认知深度 + 问题建模能力) / 6\n   综合得分 = 能力平均分 × 4\n   ```\n\n   | 综合得分（满分 16） | 能力平均分 | 级别 |\n   |---------------------|-----------|------|\n   | 4-7 | 1.00-1.75 | L1 · AI 工具使用者 |\n   | 8-11 | 1.76-2.75 | L2 · AI 协作者 |\n   | 12-14 | 2.76-3.50 | L3 · AI 架构者 |\n   | 15-16 | 3.51-4.00 | L4 · AI 战略者 |\n\n   > **铁律：全系统只认这一套分数映射。任何文件出现其他映射标准均为废弃。**\n\n7. **评分一致性检验（v3.2 新增）**\n   - **综合得分 ≥13 或 ≤7**：必须在报告中输出\"置信度说明\"\n   - **单维度分差 ≥2**（如 AI 流利度 L4 但人机判断力 L2）：必须标注\"非均衡型\"并解释\n   - **证据不足的维度**：标注\"信心不足\"并要求补充信息，"},{"path":"README.md","content":"# AI人才定级专家 - ClawHub Skill\n\n## 概述\n这是一个专为 ClawHub 平台设计的 AI 人才定级评估 skill。用户上传简历和面试评价后，自动执行一站式评估，输出结构化定级报告。\n\n**核心定位**：简历审计师 + 测谎面试题生成器\n\n## 使用方式\n1. 在 ClawHub 平台导入此 skill\n2. 上传简历文件（PDF/DOCX/TXT/MD/JSON/YAML）\n3. （可选）上传面试记录文件\n4. 系统自动执行评估并输出报告\n\n## 核心功能\n- **简历漏洞穿透审计**：5项指标检测AI简历的致命弱点\n- **六维度AI能力评估**：全面评估候选人能力\n- **双乘数加权系统**：考虑环境复杂度和个人杠杆率\n- **成长速度评估**：年限软约束，重视成长潜力\n- **测谎面试题生成**：为HR定制验证性问题\n- **防幻觉铁律**：严格遵守P0规则，避免AI幻觉\n\n## 评估流程\n\n### 模式A：仅简历审计\n1. 简历漏洞穿透审计（5项指标）\n2. 生成定制化测谎面试题\n3. 输出审计报告\n\n### 模式B：完整定级\n1. 简历漏洞穿透审计\n2. 面试交叉验证\n3. 六维度AI能力打分\n4. 双乘数加权计算\n5. 成长速度调整\n6. 级别判定\n7. 输出完整报告\n\n## 输出示例\n\n### 仅简历审计报告\n```markdown\n# AI人才简历审计报告\n\n## 基本信息\n- 评估时间: 2024-01-15 14:30:00\n- 候选人: CAND001\n- 审计模式: 仅简历审计\n- 数据来源: resume.pdf\n\n## 一、简历漏洞穿透审计\n### 1.1 高阶含金量审计\n- 疑点: 声称增长200%但无行业基线对比\n- 结论: 中嫌疑\n\n### 1.2 高势能低细节断层\n- 断层: 项目描述框架完美但缺乏独特长尾细节\n- 建议追问: 请描述实现过程中的具体技术挑战\n\n## 二、综合审计结论\n| 指标 | 结果 |\n|------|------|\n| 高阶含金量 | 中嫌疑 |\n| 细节断层 | 高嫌疑 |\n| 因果链 | 低嫌疑 |\n| AI痕迹 | 中嫌疑 |\n| 逻辑一致性 | 低嫌疑 |\n| **综合结论** | **中嫌疑** |\n| 审计可信度 | 85% |\n\n## 三、定制化测谎面试题\n### 追问1（细节追问）\n> 在项目X中，你提到使用了Y技术。请描述当时有哪几个备选方案？为什么最终选择了这个？\n\n### 追问2（边界条件）\n> 关于技术Y，在什么场景下它表现最好？什么场景下会失效？\n\n### 追问3（决策还原）\n> 关于成果Z，这个目标是怎么定出来的？为什么是这个数字？\n```\n\n### 完整定级报告\n```markdown\n# AI人才完整定级报告\n\n## 基本信息\n- 候选人ID: CAND001\n- 评估时间: 2024-01-15 14:30:00\n- 数据来源: resume.pdf, interview.txt\n- 评估模式: 完整定级\n\n## 一、简历审计结果\n- 审计结论: 中嫌疑\n- 高嫌疑指标: 2项\n- 中嫌疑指标: 3项\n\n## 二、面试交叉验证\n| 状态 | 数量 |\n|------|------|\n| 已确认（存疑） | 1 |\n| 已排除 | 2 |\n| 待验证 | 3 |\n| 未覆盖 | 1 |\n\n## 三、六维度评估\n| 维度 | 得分(1-4) | 认知层级 |\n|------|-----------|---------|\n| AI流利度 | 3 | L3 |\n| 人机判断力 | 2 | L2 |\n| 架构设计力 | 3 | L3 |\n| 混合编排力 | 2 | L2 |\n| 认知深度 | 3 | L3 |\n| 问题建模能力 | 2 | L2 |\n\n**能力平均分**: 2.5\n\n## 四、加权计算\n| 因子 | 等级 | 系数/调整 |\n|------|------|----------|\n| 环境复杂度 | 中 | ×1.0 |\n| 个人杠杆率 | 高 | ×1.3 |\n| 成长速度 | 中 | 0 |\n\n**加权后得分**: (2.5 × 1.0 × 1.3) × 4 = 13.0\n\n## 五、定级结果\n| 项目 | 内容 |\n|------|------|\n| **最终级别** | **L3** |\n| 级别名称 | AI架构者 |\n| P序列参考 | P6-P7 |\n| 级别定义 | 设计AI驱动的业务流程，评估ROI |\n\n## 六、风险提示\n### 高风险项\n- 项目细节不足，需进一步验证\n- 部分技术描述存在标准化模板语言\n\n### 建议验证点\n- 实际项目经验\n- 技术决策过程\n```\n\n## 文件说明\n- `SKILL.md` - 完整的skill定义，包含所有评估逻辑和规则\n- `README.md` - 使用说明文档\n- `main.py` - 示例程序（可选）\n- `config/` - 配置文件目录\n- `modules/` - 模块化代码目录\n- `references/` - 参考文档目录\n\n## 技术特点\n1. **防幻觉设计**：严格遵守P0规则，禁止脑补、捏造、过度推断\n2. **可解释性**：每个评估步骤都有明确依据\n3. **可配置**：支持环境参数、权重调整\n4. **可扩展**：模块化设计，易于添加新评估维度\n\n## 注意事项\n1. 评估结果基于所提供材料，建议结合面试验证\n2. 环境参数（复杂度/杠杆率）可从简历中推断，但用户提供更准确\n3. L4级别极稀缺，需严格满足硬性门槛\n4. 测谎面试题是核心输出，建议在后续面试中使用\n\n## 许可证\nMIT License"},{"path":"_meta.json","content":"{\n  \"ownerId\": \"kn70tx725606ywwb5gfj0vpxjx83admr\",\n  \"slug\": \"ai-talent-grader\",\n  \"version\": \"3.3.2\",\n  \"publishedAt\": 1784884584945\n}"},{"path":"references/behavioral_anchors.md","content":"# L1-L4 行为锚点（v3.2 充要条件版）\n\n> **v3.2 关键升级：以下\"必须满足\"是达到该级别的充要条件，不是示例。达到该级别 → 必须满足该级别的所有\"必须满足\"条目。**\n\n## 级别总览\n\n| 级别 | 名称 | 一句话定义 | P序列参考 |\n|------|------|-----------|----------|\n| L1 | AI工具使用者 | 能用工具完成指定任务 | P1-P3 |\n| L2 | AI协作者 | 能审校输出、识别幻觉 | P4-P5 |\n| L3 | AI架构者 | 设计AI驱动的业务流程，评估ROI | P6-P7 |\n| L4 | AI战略者 | 定义AI与业务边界，规划组织演进 | P8+ |\n\n---\n\n## 维度一：AI流利度\n\n### L1 · AI工具使用者\n\n**充要条件（必须全部满足）：**\n- 能独立使用至少 1 个常用 AI 工具完成基础任务\n- 对 AI 能力边界没有清晰认知，或未表现出边界意识\n\n**典型行为描述（简历/面试）：**\n- \"使用ChatGPT辅助撰写文案\"\n- \"用Copilot写代码，提高效率\"\n- \"工作中会用到AI工具辅助\"\n\n**边界判定：** 仅提到\"使用AI工具\"，没有任何 prompt 迭代/输出审校/多工具组合的证据 → **只能判 L1**\n\n---\n\n### L2 · AI协作者\n\n**充要条件（必须全部满足）：**\n- **有 prompt 迭代行为**：不是只用默认 prompt，能根据输出调整表述\n- **有输出审校意识**：能判断 AI 输出是否满足需求，不是直接拿来就用\n- 以上两项必须有**具体证据**（不是\"会用AI\"，而是\"我怎么用、调了什么\"）\n\n**典型行为描述：**\n- \"通过调整prompt模板，将AI生成内容的通过率从60%提升到85%\"\n- \"组合使用ChatGPT+Midjourney+Canva完成营销方案\"\n- \"会审核AI输出的准确性，对关键数据做二次核实\"\n\n**边界判定：**\n- \"我用Copilot写代码\"但无迭代/审校证据 → **L1**（不是 L2）\n- \"通过调整prompt\" = \"迭代优化prompt\" = \"修改prompt以获得更好结果\" → **同一级别，不得因措辞不同判不同级别**\n\n---\n\n### L3 · AI架构者\n\n**充要条件（必须全部满足）：**\n- **能设计团队级 AI 工作流**：不是个人使用，而是设计流程让团队用\n- **能做工具选型判断**：评估过多个 AI 工具/模型的优劣并给出选择依据\n- **能定义质量标准**：为 AI 输出制定验收标准或审校流程\n\n**典型行为描述：**\n- \"主导团队引入AI工作流，设计了prompt库和审校标准\"\n- \"评估了ChatGPT/Claude/国产大模型，选定最优方案落地\"\n- \"AI输出的内容由我制定质量标准和验收流程\"\n\n**边界判定：** 个人用得好 ≠ L3。必须有**团队/流程/标准**三要素之一。\n\n---\n\n### L4 · AI战略者\n\n**充要条件（必须全部满足）：**\n- **能预判 AI 能力演进趋势**并据此调整业务预期或资源分配\n- **能定义 AI 能力边界**：明确\"哪些能做/哪些需要等/哪些永远需要人\"\n- **有组织级影响力**：制定了组织级 AI 规划或政策\n\n**典型行为描述：**\n- \"预判了GPT-4对客服场景的颠覆，提前6个月完成知识库升级\"\n- \"制定了部门AI能力3年规划，分阶段推进人机协作转型\"\n- \"定义了AI应用的边界红线，确保核心决策保留人工环节\"\n\n**边界判定：** 仅做到\"用得多\"或\"做得好\"≠ L4。必须有**预判/规划/定义边界**的组织级证据。\n\n---\n\n## 维度二：人机判断力\n\n### L1 · 无意识\n\n**充要条件：**\n- 拿到 AI 输出直接使用，不做验证\n- 或：无任何关于审校、验证、质疑 AI 输出的描述\n\n---\n\n### L2 · 基础审校\n\n**充要条件（必须全部满足）：**\n- **知道 AI 可能出错**\n- **会对关键信息做核实**（哪怕只是\"核对一下数字\"）\n\n**边界判定：** \"我会检查\"但说不检查什么、怎么检查 → **L1-L2 之间，往低打（L1）**\n\n---\n\n### L3 · 系统性兜底\n\n**充要条件（必须全部满足）：**\n- **设计了兜底机制**：不是偶尔检查，是有流程/清单/节点\n- **能识别 AI 幻觉模式**：知道 AI 常犯哪类错（数字错、引用虚构、时间错乱等）\n- **有复盘迭代习惯**：基于 AI 失误改进 prompt 或流程\n\n**边界判定：** 个人会检查 ≠ L3。必须有**系统性/流程化/可复用**的证据。\n\n---\n\n### L4 · 不确定下判断\n\n**充要条件（必须全部满足）：**\n- **能在信息不全时判断是否信任 AI 输出**\n- **有成熟的 AI 风险管理框架**\n- **能向非技术背景的人解释 AI 局限**\n\n---\n\n## 维度三：架构设计力\n\n### L1 · 无\n\n**充要条件：**\n- 没有设计过任何 AI 相关的系统性方案\n\n---\n\n### L2 · 单点应用设计\n\n**充要条件（必须全部满足）：**\n- **针对单一场景设计过 AI 应用方案**\n- 方案包含基本的问题定义 → 工具选型 → 实施路径\n\n**边界判定：** 只是\"用过某个 AI 工具\"≠ L2。必须有**设计/规划**行为。\n\n---\n\n### L3 · 业务级架构\n\n**充要条件（必须全部满足）：**\n- **设计了跨多环节的 AI 业务流程**（不是单点）\n- **方案包含 ROI 测算或风险识别**\n- **能清晰定义 AI 的角色边界**（做什么、不做什么）\n\n---\n\n### L4 · 系统协同架构\n\n**充要条件（必须全部满足）：**\n- **设计了多系统/多 Agent 协同的整体架构**\n- **规划了人 + AI Agent 的角色重新分配**\n- **将 AI 架构与组织变革结合**\n\n---\n\n## 维度四：混合编排力\n\n### L1 · 单独使用\n\n**充要条件：**\n- 单独使用一个 AI 工具，不会组合\n\n---\n\n### L2 · 工具组合\n\n**充要条件（必须全部满足）：**\n- **能编排 2-3 个 AI 工具形成工作流**\n- **能处理工具间的衔接问题**\n\n---\n\n### L3 · 复杂编排\n\n**充要条件（必须全部满足）：**\n- **能编排 5 个以上 AI 工具或平台**\n- **设计了包含人工环节的混合工作流**\n- **有工具失效时的降级方案**\n\n---\n\n### L4 · 组织级编排\n\n**充要条件（必须全部满足）：**\n- **设计了人的角色重新分配方案**\n- **规划了从\"人做事\"到\"人管AI做事\"的转型路径**\n- **能处理人机责任边界、绩效归属等复杂问题**\n\n---\n\n## 维度五：认知深度\n\n**打分前必过 4 项检查：①为什么选 ②"},{"path":"references/calibration-cases.md","content":"# 评分一致性校准案例库（v3.2 新增）\n\n> **使用方法**：评估边界候选人时，找到最接近的参考案例对标定级。不同实例对同一案例应输出一致的定级结果。\n\n---\n\n## 案例 A：明确 L1（基准锚点）\n\n**背景**：3年工作经验，简历写\"使用ChatGPT辅助撰写文案\"\"用AI工具提高工作效率\"，面试中能说出用过哪些工具，但无任何 prompt 迭代/输出审校/多工具组合的具体案例。\n\n**关键特征**：\n- 只有\"使用\"描述，无迭代证据\n- 无审校/验证意识\n- 无架构/流程设计经验\n- 工具数量 ≠ 能力深度\n\n**定级**：L1（AI 工具使用者）\n\n**为什么不是 L2**：不满足 L2 充要条件——无 prompt 迭代行为、无输出审校意识。\n\n---\n\n## 案例 B：明确 L2（基准锚点）\n\n**背景**：5年工作经验，能针对具体任务迭代 prompt（\"调整了3版 prompt 才得到满意结果\"），会审核 AI 输出（\"关键数据我会二次核实\"），组合使用 2-3 个 AI 工具完成工作流。但无团队级 AI 工作流设计经验。\n\n**关键特征**：\n- 有明确的 prompt 迭代证据\n- 有输出审校行为\n- 能组合 2-3 个工具\n- 个人层面做得好，但无团队/流程/标准设计\n\n**定级**：L2（AI 协作者）\n\n**为什么不是 L3**：不满足 L3 充要条件——无团队级 AI 工作流设计、无工具选型判断（评估多个模型并给出依据）、无质量标准定义。\n\n---\n\n## 案例 C：明确 L3（基准锚点）\n\n**背景**：8年工作经验，主导设计过跨多环节的 AI 业务流程（如\"智能客服+知识库+人工复核\"方案），做过工具选型（\"对比了 ChatGPT/Claude/国产大模型，选定最优方案\"），为团队制定了 AI 输出质量标准和审校流程。能清晰定义 AI 在流程中的角色边界。\n\n**关键特征**：\n- 有跨多环节 AI 流程设计经验\n- 有 ROI 测算或风险识别\n- 能定义 AI 的角色边界（做什么、不做什么）\n- 有团队级影响力（制定标准/流程）\n\n**定级**：L3（AI 架构者）\n\n**为什么不是 L4**：不满足 L4 充要条件——无预判 AI 演进趋势并调整业务预期的证据、无组织级 AI 规划/政策制定。\n\n---\n\n## 案例 D：边界 L2/L3（典型模糊场景）\n\n**背景**：6年工作经验，个人 AI 能力很强（prompt 迭代熟练、多工具组合、能审校输出），也开始带小团队（3人），给团队分享过 AI 使用经验。但尚未设计过正式的团队级 AI 工作流标准，也未做过系统性的工具选型评估。\n\n**关键特征**：\n- 个人能力强（L2 充要条件全部满足）\n- 开始带团队，有分享行为\n- 但无正式的流程设计/标准制定/工具选型证据\n\n**判定规则**：\n- 有\"团队分享\"≠ \"设计团队工作流\"→ 不满足 L3 充要条件\n- **往低打，判 L2**，标注\"潜力型：接近 L3\"\n- 理由：L3 要求\"设计团队级 AI 工作流\"或\"做工具选型判断\"或\"定义质量标准\"，三者至少满足其一。仅\"分享经验\"不够。\n\n**定级**：L2（AI 协作者），潜力型：接近 L3\n\n---\n\n## 案例 E：边界 L3/L4（典型模糊场景）\n\n**背景**：10年工作经验，设计过公司级 AI 架构（多 Agent 协同平台），能定义\"哪些场景 AI 能做、哪些需要等\"。但尚未制定组织级 AI 能力发展规划，也未预判过 AI 趋势并提前调整资源分配。\n\n**关键特征**：\n- 有公司级 AI 架构设计经验（L3 充要条件满足）\n- 能定义 AI 能力边界（接近 L4）\n- 但无组织级 AI 规划/政策制定证据\n- 无预判 AI 趋势并调整业务预期的证据\n\n**判定规则**：\n- L4 要求\"预判趋势并调整业务预期\"+\"组织级 AI 规划\"+\"定义 AI 能力边界\"，三者必须全部满足\n- 本案例只满足\"定义边界\"一项\n- **往低打，判 L3**，标注\"潜力型：接近 L4\"\n\n**定级**：L3（AI 架构者），潜力型：接近 L4\n\n---\n\n## 校准规则速查\n\n| 场景 | 规则 |\n|------|------|\n| 语义接近的行为描述 | 看是否有量化证据（\"提升到85%\" > \"有提升\"） |\n| 无量化证据时 | 看是否有反思/复盘证据（\"总结了X教训\" > \"做了X\"） |\n| 两者都没有 | 往低级别打 |\n| L4 判定 | 必须三项充要条件全部满足，缺一不可 |\n| L3 判定 | 必须三项充要条件全部满足，缺一不可 |\n| L2 判定 | 必须两项充要条件全部满足，缺一不可 |"}],"languages":[],"docsSourceLabel":"CLAWHUB","editorialOverview":"基于简历、面试记录和JD，对候选人进行AI时代能力定级（L1-L4）。 核心能力：简历漏洞穿透审计、六维度评分卡、双乘数加权、测谎面试题生成、评分一致性校准、 面试认知复盘（v3.3 Pro 新增）。v3.3 从\"简历打分器\"升级为\"认知行为分析系统\"， 评估候选人如何思考、如何应对不确定性、如何与AI协同。 U... Skill: Ai Talent Grader Owner: tuobadaidai Summary: 基于简历、面试记录和JD，对候选人进行AI时代能力定级（L1-L4）。 核心能力：简历漏洞穿透审计、六维度评分卡、双乘数加权、测谎面试题生成、评分一致性校准、 面试认知复盘（v3.3 Pro 新增）。v3.3 从\"简历打分器\"升级为\"认知行为分析系统\"， 评估候选人如何思考、如何应对不确定性、如何与AI协同。 U... Tags: L1-L4:3.1.0, ai-talent:3.1.0, cognitive-depth:3.1.0, complexity-weighting:2.4.0, critical-review:2.4.0, grading:3.1.0, hr:3.1.0, latest:3.3.2, leverage:3.1.0, lie-detector:3.1.0, problem-modeling:2.5.0","editorialQuality":{"score":100,"threshold":65,"status":"ready","wordCount":736,"uniquenessScore":45,"reasons":[]}},"media":{"evidence":{"source":"no-media","verified":false,"confidence":"low","updatedAt":"2026-10-10T09:59:56.300Z","emptyReason":"No screenshots, media assets, or demo links are available."},"primaryImageUrl":null,"mediaAssetCount":0,"assets":[],"demoUrl":null},"ownerResources":{"evidence":{"source":"unclaimed","verified":false,"confidence":"low","updatedAt":"2026-10-10T09:59:56.300Z","emptyReason":"This page has not been claimed by the agent owner."},"hasCustomPage":false,"customPageUpdatedAt":null,"customLinks":[],"structuredLinks":{"docsUrl":null,"demoUrl":null,"supportUrl":null,"pricingUrl":null,"statusUrl":null},"customPage":null},"relatedAgents":{"evidence":{"source":"protocol-neighbors","verified":false,"confidence":"medium","updatedAt":"2026-10-10T13:44:31.797Z","emptyReason":null},"items":[{"id":"8ebccd8e-3863-4187-8355-c3f14e1f9edf","entityType":"agent","canonicalPath":"/agent/iofficeai-aionui","slug":"iofficeai-aionui","name":"AionUi","description":"Free, local, open-source 24/7 Cowork app and OpenClaw for Gemini CLI, Claude Code, Codex, OpenCode, Qwen Code, Goose CLI, Auggie, and more | 🌟 Star if you like it!","url":"https://github.com/iOfficeAI/AionUi","homepage":"https://www.aionui.com","source":"GITHUB_REPOS","protocols":["MCP","OPENCLAW"],"capabilities":[],"safetyScore":100,"overallRank":70,"updatedAt":"2026-10-09T19:11:12.944Z","createdAt":"2026-02-25T03:38:16.584Z","downloads":null},{"id":"b917f68a-ebff-438e-84f8-3f4b2494c0bc","entityType":"agent","canonicalPath":"/agent/activepieces-activepieces","slug":"activepieces-activepieces","name":"activepieces","description":"AI Agents & MCPs & AI Workflow Automation • (~400 MCP servers for AI agents) • AI Automation / AI Agent with MCPs • AI Workflows & AI Agents • MCPs for AI Agents","url":"https://github.com/activepieces/activepieces","homepage":"https://www.activepieces.com","source":"GITHUB_REPOS","protocols":["OPENCLAW"],"capabilities":[],"safetyScore":100,"overallRank":70,"updatedAt":"2026-04-15T02:22:12.426Z","createdAt":"2026-02-25T03:38:12.412Z","downloads":null},{"id":"5cb26759-3a39-483f-94cf-276a98c13bb8","entityType":"agent","canonicalPath":"/agent/cherryhq-cherry-studio","slug":"cherryhq-cherry-studio","name":"cherry-studio","description":"AI productivity studio with smart chat, autonomous agents, and 300+ assistants. Unified access to frontier LLMs","url":"https://github.com/CherryHQ/cherry-studio","homepage":"https://cherry-ai.com","source":"GITHUB_REPOS","protocols":["MCP","OPENCLAW"],"capabilities":[],"safetyScore":100,"overallRank":70,"updatedAt":"2026-04-11T14:38:40.986Z","createdAt":"2026-02-25T03:38:19.379Z","downloads":null},{"id":"6f6582d0-5d76-4f0f-b81d-86520247950b","entityType":"agent","canonicalPath":"/agent/copilotkit-copilotkit","slug":"copilotkit-copilotkit","name":"CopilotKit","description":"The Frontend for Agents & Generative UI. React + Angular","url":"https://github.com/CopilotKit/CopilotKit","homepage":"https://docs.copilotkit.ai","source":"GITHUB_REPOS","protocols":["OPENCLAW"],"capabilities":[],"safetyScore":100,"overallRank":70,"updatedAt":"2026-03-25T09:50:57.846Z","createdAt":"2026-02-25T03:39:14.617Z","downloads":null}],"links":{"hub":"/agent","source":"/agent/source/clawhub","protocols":[{"label":"OpenClaw","href":"/agent/protocol/openclew"}]}}}