{"id":"0ab03c9b-09d2-4825-af87-29c16496b619","entityType":"agent","slug":"clawhub-ford828-pdf-master","name":"PDF万能大师","canonicalUrl":"https://www.xpersona.co/agent/clawhub-ford828-pdf-master","canonicalPath":"/agent/clawhub-ford828-pdf-master","generatedAt":"2026-10-11T01:45:56.805Z","source":"CLAWHUB","claimStatus":"UNCLAIMED","verificationTier":"NONE","summary":{"evidence":{"source":"editorial-content","verified":true,"confidence":"high","updatedAt":"2026-10-10T22:52:42.065Z","emptyReason":null},"description":"全能 PDF 智能处理技能，覆盖 25 项能力五大核心（Office 高保真互转、扫描件 OCR、PDF 直接编辑、加密水印权限、批量合并拆分重命名）、九大增值（表格提取、图文解析、摘要、脱敏、元数据清洗、自动命名、版本对比、文档问答、规格对比矩阵）、四大扩展（智能压缩、排版保留翻译、合同风险审查、发票验真归档）、七大壁垒（电子签名审批流、批量内容替换、表单创建、图纸测量、翻页电子书、印刷级导出、密文级永久删除）。当用户上传 PDF 并提出转换、识别、编辑、加密、压缩、翻译、审查、归档、签名、替换、表单、测量、电子书、印刷、删除等需求，或提到\"转Word\"\"OCR\"\"加水印\"\"压缩到xxMB\" Skill: PDF万能大师 Owner: ford828 Summary: 全能 PDF 智能处理技能，覆盖 25 项能力五大核心（Office 高保真互转、扫描件 OCR、PDF 直接编辑、加密水印权限、批量合并拆分重命名）、九大增值（表格提取、图文解析、摘要、脱敏、元数据清洗、自动命名、版本对比、文档问答、规格对比矩阵）、四大扩展（智能压缩、排版保留翻译、合同风险审查、发票验真归档）、七大壁垒（电子签名审批流、批量内容替换、表单创建、图纸测量、翻页电子书、印刷级导出、密文级永久删除）。当用户上传 PDF 并提出转换、识别、编辑、加密、压缩、翻译、审查、归档、签名、替换、表单、测量、电子书、印刷、删除等需求，或提到\"转Word\"\"OCR\"\"加水印\"\"压缩到xxMB\" Tags: latest:2.1.0 Version history: v2.1.0 | 2026-07-26T13:42:21.357Z | user - 引","descriptionLabel":"Technical summary","evidenceSummary":"Capability contract not published. No trust telemetry is available yet. 1.2K downloads reported by the source. Last updated 10/10/2026.","installCommand":"clawhub skill install s17frrzcg4chdh4z6rnsntmhgd86c8vv:pdf-master","sourceUrl":"https://clawhub.ai/ford828/pdf-master","homepage":"https://clawhub.ai/ford828/skills/pdf-master","primaryLinks":[{"label":"View on ClawHub","url":"https://clawhub.ai/ford828/pdf-master","kind":"source"},{"label":"Homepage","url":"https://clawhub.ai/ford828/skills/pdf-master","kind":"homepage"}],"safetyScore":84,"overallRank":62,"popularityScore":62,"trustScore":null,"claimedByName":null,"isOwner":false,"seoDescription":"全能 PDF 智能处理技能，覆盖 25 项能力五大核心（Office 高保真互转、扫描件 OCR、PDF 直接编辑、加密水印权限、批量合并拆分重命名）、九大增值（表格提取、图文解析、摘要、脱敏、元数据清洗、自动命名、版本对比、文档问答、规格对比矩阵）、四大扩展（智能压缩、排版保留翻译、合同风险审查、发票验真归档）、七大"},"coverage":{"evidence":{"source":"public-profile","verified":false,"confidence":"medium","updatedAt":"2026-10-10T22:52:42.065Z","emptyReason":null},"protocols":[{"protocol":"OPENCLEW","label":"OpenClaw","status":"self-declared","notes":"Declared in the public agent profile."}],"capabilities":[],"verifiedCount":0,"selfDeclaredCount":1,"capabilityMatrix":{"rows":[{"key":"OPENCLEW","type":"protocol","support":"unknown","confidenceSource":"profile","notes":"Listed on profile"}],"flattenedTokens":"protocol:OPENCLEW|unknown|profile"}},"adoption":{"evidence":{"source":"CLAWHUB","verified":false,"confidence":"medium","updatedAt":"2026-10-10T22:52:42.065Z","emptyReason":null},"stars":null,"forks":null,"downloads":1237,"packageName":null,"latestVersion":"2.1.0","tractionLabel":"1.2K downloads"},"release":{"evidence":{"source":"CLAWHUB","verified":false,"confidence":"medium","updatedAt":"2026-10-10T22:52:42.047Z","emptyReason":null},"lastUpdatedAt":"2026-10-10T22:52:42.065Z","lastCrawledAt":"2026-10-10T22:52:42.047Z","lastIndexedAt":null,"nextCrawlAt":"2026-10-11T22:52:42.047Z","lastVerifiedAt":null,"highlights":[{"version":"2.1.0","createdAt":"2026-07-26T13:42:21.357Z","changelog":"- 引入环境自检逻辑，新增 Step 0：首次使用或缺依赖时报错时自动检测环境，缺失核心依赖时引导用户用 setup.sh 一键安装 - 添加 LICENSE（MIT-0）、README.md 和环境脚本，完善开源合规与部署说明 - 支持能力就绪矩阵检查，缺增强依赖时自动降级并告知质量影响 - 完善元数据声明和依赖要求，新增 requirements.txt、requirements-optional.txt - 统一入口，引导读者使用 bash setup.sh 完成部署，去除 skill-card.md","fileCount":32,"zipByteSize":65951},{"version":"2.0.2","createdAt":"2026-07-26T09:57:44.209Z","changelog":"**Summary:** Introduced modular, workflow-based architecture; added detailed capability references and automation scripts. - Reorganized skill into a multi-layer modular structure with 25 capabilities, divided by core, value-add, extension, and enterprise barrier features. - Added a comprehensive workflow: PDF inspection, intent routing, confirmation, execution, and delivery with self-check and user value feedback. - Introduced 22 new reference and script files, covering detailed capability protocols, error handling, security, quality standards, and automation (e.g., batch replace, compress, convert, OCR, merge, redact, split, watermark). - Replaced “skill-card.md” with technical and instructional documentation in the `references/` directory for structured access and maintainability. - Enforced strict limits and compliance rules for security, confirmation, and error handling to ensure reliability and data protection. - Standardized routing for user requests; all triggers and accepted commands are now centrally documented and dynamically matched.","fileCount":25,"zipByteSize":57331},{"version":"1.0.2","createdAt":"2026-07-26T09:47:28.716Z","changelog":"**Major update: Modular and workflow-driven redesign with expanded documentation and automation scripts.** - Completely restructured skill core: logic is now organized via a workflow of 5 explicit, auditable steps for every PDF request. - Added 21 new reference files detailing all capabilities, value messaging, error handling, technical specs, and compliance. - Introduced 10+ new automation scripts for granular PDF tasks (batch replace, compress, convert, extract tables, watermark, redact, etc). - Capability routing and process standards moved to a central index—each function now references external quality and procedural docs. - Old Markdown skill summary files removed, and replaced by a concise, maintainable skill.md file; all deep guidance offloaded to references/. - Tightened task constraints and safety policies (file size/page limits, redline handling for sensitive/irreversible operations, explicit preview requirements). - Designed for automation, batch processing, and Feishu (Lark) integration out of the box.","fileCount":25,"zipByteSize":57324},{"version":"1.0.1","createdAt":"2026-05-23T14:20:28.346Z","changelog":"**pdf-master v1.0.1 → v2.1** — Major feature expansion and enterprise capability upgrades: - Added 3 new enterprise-grade features: multi-document PDF splitting, high-fidelity PDF→CAD conversion, and a cross-software collaboration/compatibility layer. - Introduced specialized OCR template library for precise business document extraction (e.g., IDs, licenses, bank statements, medical records). - Enhanced intelligent editing with advanced font/style matching and new handwriting-to-vector annotation. - Automated, exportable compliance/audit reports for DRM/security logging (human-readable, for compliance teams). - Added team password vault and batch contract comparison abilities. - Upgraded multimodal Q&A: now supports images, formulas, signatures, stamps, and visual answer positioning. - Improved existing automation, accuracy, and collaboration capabilities in batch processing, security, and document understanding.","fileCount":3,"zipByteSize":22511},{"version":"1.0.0","createdAt":"2026-05-23T13:28:47.901Z","changelog":"pdf-master 1.0.0 - Major launch of pdf-master 2.0: a universal PDF processing system with 30 precision-targeted capabilities across 5 AI-driven cores, 4 professional extensions, 7 deep scenario-specific features, 9 value-adds, and 5 critical gap-fillers. - Built on Docling/Marker/OpenParse enterprise stack, enabling high-fidelity conversion, advanced OCR with scan restoration, layout-preserving editing, enterprise DRM security with blockchain audit, and batch automation. - Introduces AI scan enhancement (e.g., shadow/finger/curvature correction), auto bookmark generation, PDF/A archival, handwriting recognition, accessibility tagging (WCAG), and collaborative workflow. - Every output clearly states time/cost savings vs manual work; precision, speed, security, and compliance surpass standard tools. - Optimized for real workplace pain points with granular, pipeline-driven document intelligence beyond basic feature sets.","fileCount":2,"zipByteSize":17179}]},"execution":{"evidence":{"source":"CLAWHUB","verified":false,"confidence":"low","updatedAt":null,"emptyReason":"No published capability contract is available yet."},"installCommand":"clawhub skill install s17frrzcg4chdh4z6rnsntmhgd86c8vv:pdf-master","setupComplexity":"low","setupSteps":["Setup complexity is LOW. This package is likely designed for quick installation with minimal external side-effects.","Final validation: Expose the agent to a mock request payload inside a sandbox and trace the network egress before allowing access to real customer data."],"contract":{"contractStatus":"missing","authModes":[],"requires":[],"forbidden":[],"supportsMcp":false,"supportsA2a":false,"supportsStreaming":false,"inputSchemaRef":null,"outputSchemaRef":null,"dataRegion":null,"contractUpdatedAt":null,"sourceUpdatedAt":null,"freshnessSeconds":null},"invocationGuide":{"preferredApi":{"snapshotUrl":"https://www.xpersona.co/api/v1/agents/clawhub-ford828-pdf-master/snapshot","contractUrl":"https://www.xpersona.co/api/v1/agents/clawhub-ford828-pdf-master/contract","trustUrl":"https://www.xpersona.co/api/v1/agents/clawhub-ford828-pdf-master/trust"},"curlExamples":["curl -s \"https://www.xpersona.co/api/v1/agents/clawhub-ford828-pdf-master/snapshot\"","curl -s \"https://www.xpersona.co/api/v1/agents/clawhub-ford828-pdf-master/contract\"","curl -s \"https://www.xpersona.co/api/v1/agents/clawhub-ford828-pdf-master/trust\""],"jsonRequestTemplate":{"query":"summarize this repo","constraints":{"maxLatencyMs":2000,"protocolPreference":["OPENCLEW"]}},"jsonResponseTemplate":{"ok":true,"result":{"summary":"...","confidence":0.9},"meta":{"source":"CLAWHUB","generatedAt":"2026-10-11T01:45:56.799Z"}},"retryPolicy":{"maxAttempts":3,"backoffMs":[500,1500,3500],"retryableConditions":["HTTP_429","HTTP_503","NETWORK_TIMEOUT"]}},"endpoints":{"dossierUrl":"https://www.xpersona.co/api/v1/agents/clawhub-ford828-pdf-master/dossier","snapshotUrl":"https://www.xpersona.co/api/v1/agents/clawhub-ford828-pdf-master/snapshot","contractUrl":"https://www.xpersona.co/api/v1/agents/clawhub-ford828-pdf-master/contract","trustUrl":"https://www.xpersona.co/api/v1/agents/clawhub-ford828-pdf-master/trust"}},"reliability":{"evidence":{"source":"runtime-metrics","verified":false,"confidence":"low","updatedAt":null,"emptyReason":"No trust, reliability, or runtime telemetry is available."},"trust":{"status":"unavailable","handshakeStatus":"UNKNOWN","verificationFreshnessHours":null,"reputationScore":null,"p95LatencyMs":null,"successRate30d":null,"fallbackRate":null,"attempts30d":null,"trustUpdatedAt":null,"trustConfidence":"unknown","sourceUpdatedAt":null,"freshnessSeconds":null},"decisionGuardrails":{"doNotUseIf":["Contract metadata is missing or unavailable for deterministic execution."],"safeUseWhen":[],"riskFlags":["missing_or_unavailable_contract","trust_data_unavailable","schema_references_missing"],"operationalConfidence":"low"},"executionMetrics":{"observedLatencyMsP50":null,"observedLatencyMsP95":null,"estimatedCostUsd":null,"uptime30d":null,"rateLimitRpm":null,"rateLimitBurst":null,"lastVerifiedAt":null,"verificationSource":null},"runtimeMetrics":{"successRate":null,"avgLatencyMs":null,"avgCostUsd":null,"hallucinationRate":null,"retryRate":null,"disputeRate":null,"p50Latency":null,"p95Latency":null,"lastUpdated":null}},"benchmarks":{"evidence":{"source":"no-benchmark-data","verified":false,"confidence":"low","updatedAt":null,"emptyReason":"No benchmark suites or observed failure patterns are available."},"suites":[],"failurePatterns":[]},"artifacts":{"evidence":{"source":"CLAWHUB","verified":false,"confidence":"high","updatedAt":"2026-10-10T22:52:42.065Z","emptyReason":null},"readme":"Skill: PDF万能大师\n\nOwner: ford828\n\nSummary: 全能 PDF 智能处理技能，覆盖 25 项能力五大核心（Office 高保真互转、扫描件 OCR、PDF 直接编辑、加密水印权限、批量合并拆分重命名）、九大增值（表格提取、图文解析、摘要、脱敏、元数据清洗、自动命名、版本对比、文档问答、规格对比矩阵）、四大扩展（智能压缩、排版保留翻译、合同风险审查、发票验真归档）、七大壁垒（电子签名审批流、批量内容替换、表单创建、图纸测量、翻页电子书、印刷级导出、密文级永久删除）。当用户上传 PDF 并提出转换、识别、编辑、加密、压缩、翻译、审查、归档、签名、替换、表单、测量、电子书、印刷、删除等需求，或提到\"转Word\"\"OCR\"\"加水印\"\"压缩到xxMB\"\n\nTags: latest:2.1.0\n\nVersion history:\n\nv2.1.0 | 2026-07-26T13:42:21.357Z | user\n\n- 引入环境自检逻辑，新增 Step 0：首次使用或缺依赖时报错时自动检测环境，缺失核心依赖时引导用户用 setup.sh 一键安装\n- 添加 LICENSE（MIT-0）、README.md 和环境脚本，完善开源合规与部署说明\n- 支持能力就绪矩阵检查，缺增强依赖时自动降级并告知质量影响\n- 完善元数据声明和依赖要求，新增 requirements.txt、requirements-optional.txt\n- 统一入口，引导读者使用 bash setup.sh 完成部署，去除 skill-card.md\n\nv2.0.2 | 2026-07-26T09:57:44.209Z | user\n\n**Summary:**  \nIntroduced modular, workflow-based architecture; added detailed capability references and automation scripts.\n\n- Reorganized skill into a multi-layer modular structure with 25 capabilities, divided by core, value-add, extension, and enterprise barrier features.\n- Added a comprehensive workflow: PDF inspection, intent routing, confirmation, execution, and delivery with self-check and user value feedback.\n- Introduced 22 new reference and script files, covering detailed capability protocols, error handling, security, quality standards, and automation (e.g., batch replace, compress, convert, OCR, merge, redact, split, watermark).\n- Replaced “skill-card.md” with technical and instructional documentation in the `references/` directory for structured access and maintainability.\n- Enforced strict limits and compliance rules for security, confirmation, and error handling to ensure reliability and data protection.\n- Standardized routing for user requests; all triggers and accepted commands are now centrally documented and dynamically matched.\n\nv1.0.2 | 2026-07-26T09:47:28.716Z | user\n\n**Major update: Modular and workflow-driven redesign with expanded documentation and automation scripts.**\n\n- Completely restructured skill core: logic is now organized via a workflow of 5 explicit, auditable steps for every PDF request.\n- Added 21 new reference files detailing all capabilities, value messaging, error handling, technical specs, and compliance.\n- Introduced 10+ new automation scripts for granular PDF tasks (batch replace, compress, convert, extract tables, watermark, redact, etc).\n- Capability routing and process standards moved to a central index—each function now references external quality and procedural docs.\n- Old Markdown skill summary files removed, and replaced by a concise, maintainable skill.md file; all deep guidance offloaded to references/.\n- Tightened task constraints and safety policies (file size/page limits, redline handling for sensitive/irreversible operations, explicit preview requirements).\n- Designed for automation, batch processing, and Feishu (Lark) integration out of the box.\n\nv1.0.1 | 2026-05-23T14:20:28.346Z | user\n\n**pdf-master v1.0.1 → v2.1** — Major feature expansion and enterprise capability upgrades:\n\n- Added 3 new enterprise-grade features: multi-document PDF splitting, high-fidelity PDF→CAD conversion, and a cross-software collaboration/compatibility layer.\n- Introduced specialized OCR template library for precise business document extraction (e.g., IDs, licenses, bank statements, medical records).\n- Enhanced intelligent editing with advanced font/style matching and new handwriting-to-vector annotation.\n- Automated, exportable compliance/audit reports for DRM/security logging (human-readable, for compliance teams).\n- Added team password vault and batch contract comparison abilities.\n- Upgraded multimodal Q&A: now supports images, formulas, signatures, stamps, and visual answer positioning.\n- Improved existing automation, accuracy, and collaboration capabilities in batch processing, security, and document understanding.\n\nv1.0.0 | 2026-05-23T13:28:47.901Z | user\n\npdf-master 1.0.0\n\n- Major launch of pdf-master 2.0: a universal PDF processing system with 30 precision-targeted capabilities across 5 AI-driven cores, 4 professional extensions, 7 deep scenario-specific features, 9 value-adds, and 5 critical gap-fillers.\n- Built on Docling/Marker/OpenParse enterprise stack, enabling high-fidelity conversion, advanced OCR with scan restoration, layout-preserving editing, enterprise DRM security with blockchain audit, and batch automation.\n- Introduces AI scan enhancement (e.g., shadow/finger/curvature correction), auto bookmark generation, PDF/A archival, handwriting recognition, accessibility tagging (WCAG), and collaborative workflow.\n- Every output clearly states time/cost savings vs manual work; precision, speed, security, and compliance surpass standard tools.\n- Optimized for real workplace pain points with granular, pipeline-driven document intelligence beyond basic feature sets.\n\nArchive index:\n\nArchive v2.1.0: 32 files, 65951 bytes\n\nFiles: clawhub.json (1680b), LICENSE (926b), README.md (3701b), references/capabilities-core.md (6857b), references/capabilities-pro.md (11021b), references/capabilities-value.md (6349b), references/command-guide.md (7965b), references/error-handling.md (3468b), references/feishu-setup.md (4260b), references/few-shot-examples.md (4516b), references/ocr-config.md (3015b), references/quality-standards.md (3237b), references/security-compliance.md (3502b), references/tech-spec.md (4794b), references/value-messaging.md (2796b), requirements-optional.txt (492b), requirements.txt (405b), scripts/check_env.py (2879b), scripts/pdf_batch_replace.py (4392b), scripts/pdf_compress.py (3446b), scripts/pdf_convert.py (1898b), scripts/pdf_extract_tables.py (2367b), scripts/pdf_info.py (3446b), scripts/pdf_merge.py (1936b), scripts/pdf_ocr.py (3775b), scripts/pdf_redact.py (5348b), scripts/pdf_split.py (2749b), scripts/pdf_watermark.py (3583b), setup.sh (3294b), skill-card.md (3196b), SKILL.md (9343b), _meta.json (129b)\n\nFile v2.1.0:SKILL.md\n\n---\nname: pdf-master\ndescription: 全能 PDF 智能处理技能，覆盖 25 项能力五大核心（Office 高保真互转、扫描件 OCR、PDF 直接编辑、加密水印权限、批量合并拆分重命名）、九大增值（表格提取、图文解析、摘要、脱敏、元数据清洗、自动命名、版本对比、文档问答、规格对比矩阵）、四大扩展（智能压缩、排版保留翻译、合同风险审查、发票验真归档）、七大壁垒（电子签名审批流、批量内容替换、表单创建、图纸测量、翻页电子书、印刷级导出、密文级永久删除）。当用户上传 PDF 并提出转换、识别、编辑、加密、压缩、翻译、审查、归档、签名、替换、表单、测量、电子书、印刷、删除等需求，或提到\"转Word\"\"OCR\"\"加水印\"\"压缩到xxMB\"\"审查合同\"\"批量盖章\"\"彻底删除\"等指令时触发。飞书机器人场景原生支持。\nlicense: MIT-0\nmetadata:\n  version: 2.1.0\n  openclaw:\n    requires:\n      bins: [python3]\n      optional_bins: [tesseract, libreoffice]\n---\n\n# 万能 PDF 大师\n\n一站式 PDF 处理系统，25 项能力按四层组织。本文件是**路由与流程主控**：所有能力的详细执行规程、质量标准、错误降级、价值话术均在 `references/` 中按需加载。\n\n---\n\n## 核心工作流\n\n每个请求严格按 5 步执行：\n\n### Step 0: 环境闸门（首次使用或脚本报 ImportError 时）\n\n运行 `python3 scripts/check_env.py` 查看能力就绪矩阵：\n\n- 核心缺失 → 引导用户执行 `bash setup.sh`（或 `pip install -r requirements.txt`），装好再继续\n- 增强项缺失 → 不阻断，按 `references/error-handling.md` 降级链执行并告知质量差异\n- 环境齐备时跳过本步，不要每次请求都跑\n\n### Step 1: 接收与检测\n\n收到 PDF 后先运行 `scripts/pdf_info.py` 获取：页数、大小、加密状态、文本层有无、扫描件占比、元数据。**未检测不得开始处理。**\n\n| 检测结果 | 路由 |\n|---------|------|\n| 有文本层 | 文本型管道（PyMuPDF / pdfplumber） |\n| 无文本层、纯图像 | OCR 管道（先读 `references/ocr-config.md`） |\n| 部分文本+部分图像 | 混合管道（文本页直取，图像页 OCR） |\n| 加密文件 | 索要密码；无法提供则终止并说明 |\n\n### Step 2: 意图路由\n\n用「能力路由总表」匹配用户指令到能力编号。匹配规则：\n\n1. **单意图命中** → 直接进入对应能力规程\n2. **复合指令**（如\"按日期重命名后合并成带目录的手册\"）→ 拆成能力链，按依赖顺序执行（重命名 #11 → 合并 #5），每步完成后汇报\n3. **意图模糊**（如\"处理一下这个文件\"）→ 列出最可能的 2-3 个能力让用户选择，**不得自行猜测执行**\n4. **无法匹配** → 说明能力边界，推荐最接近的能力\n\n20 个带标准路由的 Few-Shot 示例见 `references/few-shot-examples.md`，路由拿不准时先查它。\n\n### Step 3: 执行前确认\n\n以下情况必须先确认再动手：\n\n- **批量任务**（>10 文件）：报出文件数、预计耗时、将执行的操作清单\n- **不可逆操作**（密文删除 #25、批量替换 #20、直接编辑 #3）：展示预览/差异，等用户说\"确认\"\n- **目标参数缺失**（压缩没说目标大小、改名没给规则）：给出默认值并询问是否采用\n\n### Step 4: 执行与进度反馈\n\n- 确定性操作优先调用 `scripts/` 下脚本，不重复造轮子\n- 长任务（>30 秒）每 20-30 秒发一次进度：\"正在解析第 3/20 页…\"\n- 任一环节失败 → 按 `references/error-handling.md` 的降级链处理，**不得静默失败**\n\n### Step 5: 交付与价值确认\n\n交付时四件事缺一不可：\n\n1. **结果文件**：上传文件 / 发文本 / 给多维表格链接\n2. **质检结论**：按 `references/quality-standards.md` 对应能力的验收项自检并报告（如\"表格 12 个全部原生可编辑，图片偏移 <5px\"）\n3. **异常清单**：跳过的页、失败的文件、降级的环节，逐一明示\n4. **价值反馈**：一句话省时/省钱/避险对比，话术从 `references/value-messaging.md` 取，不得编造数字\n\n---\n\n## 能力路由总表\n\n**第一层 · 五大核心**（详细规程 `references/capabilities-core.md`）\n\n| # | 能力 | 触发关键词 | 脚本 |\n|---|------|-----------|------|\n| 1 | PDF↔Office 高保真互转 | 转Word / 转Excel / 转PPT | `pdf_convert.py` |\n| 2 | 扫描件 OCR 精准识别 | OCR / 识别 / 扫描件转文字 | `pdf_ocr.py` |\n| 3 | PDF 内直接编辑 | 改文字 / 改参数 / 替换图片 | —（规程执行） |\n| 4 | 安全保护（加密/权限/水印） | 加密 / 加水印 / 禁止打印 | `pdf_watermark.py` |\n| 5 | 批量自动化处理 | 批量合并 / 拆分 / 重命名 | `pdf_merge.py` `pdf_split.py` |\n\n**第二层 · 九大增值**（详细规程 `references/capabilities-value.md`）\n\n| # | 能力 | 触发关键词 | 脚本 |\n|---|------|-----------|------|\n| 6 | 表格精准提取 | 提取表格 / 表格转Excel | `pdf_extract_tables.py` |\n| 7 | 图文混排解析 | 提取图文 / 解析内容 | —（规程执行） |\n| 8 | 智能摘要 | 摘要 / 总结 / 提炼重点 | —（LLM 执行） |\n| 9 | 自动脱敏 | 脱敏 / 打码 / 隐藏敏感信息 | —（规程执行） |\n| 10 | 元数据清洗 | 清洗元数据 / 擦除痕迹 | `pdf_info.py --scrub` |\n| 11 | 名称/编号自动化 | 自动命名 / 重命名 | —（规程执行） |\n| 12 | 两版差异对比 | 对比 / diff / 版本差异 | —（规程执行） |\n| 13 | 文档即问即答 | 问答 / 这份文件说了什么 | —（RAG 规程） |\n| 14 | 规格参数对比矩阵 | 规格对比 / 参数对比 | —（规程执行） |\n\n**第三层 · 四大扩展**（详细规程 `references/capabilities-pro.md`）\n\n| # | 能力 | 触发关键词 | 脚本 |\n|---|------|-----------|------|\n| 15 | PDF 智能压缩 | 压缩 / 压到xxMB / 缩小 | `pdf_compress.py` |\n| 16 | PDF 翻译（保留排版） | 翻译 / 翻成中文 / 双语对照 | —（规程执行） |\n| 17 | 合同智能审查 | 审查合同 / 合同体检 / 标风险 | —（规程执行） |\n| 18 | 发票/票据自动归档 | 归档发票 / 报销汇总 / 验真 | —（规程执行） |\n\n**第四层 · 七大壁垒**（详细规程 `references/capabilities-pro.md`）\n\n| # | 能力 | 触发关键词 | 脚本 |\n|---|------|-----------|------|\n| 19 | 电子签名与审批流 | 签名 / 电子签 / 批量盖章 / 审批流 | —（规程执行） |\n| 20 | 批量内容替换 | 批量替换 / 统一改价格 / 换Logo | `pdf_batch_replace.py` |\n| 21 | PDF 表单创建 | 生成表单 / 可填写PDF / 问卷转表单 | —（规程执行） |\n| 22 | 图纸精准测量 | 测量图纸 / 量尺寸 / 算面积 | —（规程执行） |\n| 23 | 翻页电子书制作 | 翻页书 / 电子书 / 手册转网页 | —（规程执行） |\n| 24 | 印刷级导出 | 印刷导出 / CMYK / 出血区 / 转曲 | —（规程执行） |\n| 25 | 密文级敏感信息删除 | 彻底删除 / 永久抹除 / 不是涂黑 | `pdf_redact.py` |\n\n---\n\n## 硬性约束\n\n| 约束项 | 限制 | 超限处理 |\n|--------|------|---------|\n| 单文件大小 | ≤100MB | 建议先压缩（#15）或拆分（#5） |\n| 单任务页数 | ≤200 页 | 引导用户指定页范围 |\n| OCR 单批 | ≤50 页 | 自动分批，批间报进度 |\n| 并发任务 | ≤3 | 排队并告知预计等待 |\n| 单任务超时 | 5 分钟 | 熔断，保留中间结果，报告已完成部分 |\n| 批量替换 | ≤500 文件/批 | 分批执行 |\n| 密文删除 | ≤200 文件/批 | 分批执行 |\n| 批量确认阈值 | >10 文件 | 必须先确认清单 |\n\n## 安全红线\n\n- **涉密文档**（用户声明或检测到密级标记）→ 全程本地模型，禁上云，详见 `references/security-compliance.md`\n- **密文删除（#25）与脱敏（#9）是不同操作**：#9 是遮盖可恢复，#25 是删除底层对象不可恢复，用户说\"涂黑/打码\"走 #9，说\"彻底/永久/真删\"走 #25，不得混用\n- **脱敏/删除前必须预览确认**，执行后必须验证扫描并出报告\n- 发票验真（#18）、电子签名（#19）依赖外部接口；接口不可用时明确告知\"未验真/无法律效力签名\"，不得伪造结果\n\n## 资源索引\n\n| 文件 | 何时读取 |\n|------|---------|\n| `setup.sh` + `requirements*.txt` | 首次部署/装依赖（`bash setup.sh` 一键；`--check` 仅自检） |\n| `scripts/check_env.py` | 能力就绪矩阵自检 |\n| `references/capabilities-core.md` | 执行能力 1-5 前 |\n| `references/capabilities-value.md` | 执行能力 6-14 前 |\n| `references/capabilities-pro.md` | 执行能力 15-25 前 |\n| `references/few-shot-examples.md` | 意图路由拿不准时 |\n| `references/quality-standards.md` | 交付前自检 |\n| `references/error-handling.md` | 任何环节失败时 |\n| `references/security-compliance.md` | 涉密/脱敏/删除/签名任务前 |\n| `references/command-guide.md` | 用户问\"你能做什么\"时 |\n| `references/value-messaging.md` | 交付时取价值话术 |\n| `references/tech-spec.md` | 需要理解技术栈/管线细节时 |\n| `references/ocr-config.md` | OCR 任务调参或识别效果差时 |\n| `references/feishu-setup.md` | 飞书部署/联调/排障时 |\n\nFile v2.1.0:README.md\n\n# 万能 PDF 大师（pdf-master）\n\n一站式 PDF 智能处理技能：**25 项能力 · 4 层架构 · 10 个实测脚本 · 全套质量/安全护栏**。\n不是功能堆砌，而是针对职场真实痛点的工程化解决方案——每项能力都有明确的执行规程、验收标准和降级策略。\n\n## 为什么选它\n\n- **路由精准**：SKILL.md 内置「能力路由总表」+ 20 个 Few-Shot 示例，指令解析不猜测、不跑偏\n- **执行稳定**：10 个高频能力脚本化（合并/拆分/OCR/压缩/水印/表格提取/密文删除/转换/批量替换/信息检测），输出可复现\n- **质量可验**：25 项能力逐项合格线（如\"表格原生可编辑、图片偏移 ≤5px、中文识别率 >95%\"），交付必过质检\n- **失败有兜底**：完整降级链（首选→降级→部分交付→明确终止），不静默失败、不伪造结果\n- **安全有红线**：脱敏 vs 密文删除严格区分、CA 签名效力边界清晰、涉密文档本地模型路由、7 条红线清单\n\n## 能力总览（25 项）\n\n| 层 | 能力 |\n|----|------|\n| 五大核心 | ① Office 高保真互转 ② 扫描件 OCR ③ PDF 直接编辑 ④ 加密/权限/动态水印 ⑤ 批量合并拆分重命名 |\n| 九大增值 | ⑥ 表格提取 ⑦ 图文解析 ⑧ 智能摘要 ⑨ 自动脱敏 ⑩ 元数据清洗 ⑪ 自动命名 ⑫ 版本对比 ⑬ 文档问答 ⑭ 规格对比矩阵 |\n| 四大扩展 | ⑮ 智能压缩（目标大小迭代）⑯ 翻译保留排版 ⑰ 合同风险审查 ⑱ 发票验真归档 |\n| 七大壁垒 | ⑲ 电子签名审批流 ⑳ 批量内容替换（可回滚）㉑ 表单创建 ㉒ 图纸测量 ㉓ 翻页电子书 ㉔ 印刷级导出（CMYK/出血/转曲）㉕ 密文级永久删除（双引擎验证+删除证书） |\n\n## 快速开始\n\n```bash\n# 1. 安装技能\nclawhub install pdf-master\n\n# 2. 一键装依赖（幂等；装完自动自检，输出能力就绪矩阵）\nbash setup.sh            # 核心依赖；--all 装全部增强项\n# 也可手动：pip install -r requirements.txt\n\n# 3. 之后直接用自然语言：\n\"把这份 PDF 转成 Word，表格要保持可编辑\"\n\"这 100 张发票帮我验真去重，生成报销单\"\n\"把 200 份报价单的 1999 改成 2199，先预览差异\"\n\"这份招标公告里的报价和联系方式彻底删除，不是涂黑\"\n```\n\n## 脚本速查（scripts/）\n\n| 脚本 | 用途 |\n|------|------|\n| `pdf_info.py` | 类型检测（文本/扫描/混合/加密）、元数据清洗 |\n| `pdf_merge.py` / `pdf_split.py` | 合并（带目录书签）/ 拆分（页范围/书签） |\n| `pdf_ocr.py` | 扫描件 → 可搜索 PDF（隐形文本层），PaddleOCR/Tesseract 双引擎 |\n| `pdf_compress.py` | 分层压缩到目标大小，质量地板保护文字清晰度 |\n| `pdf_watermark.py` | 动态水印（含中文）+ AES-256 加密 + 权限控制 |\n| `pdf_extract_tables.py` | 表格 → CSV/Excel |\n| `pdf_convert.py` | PDF → Word（pdf2docx）/ Excel |\n| `pdf_redact.py` | 密文级删除 + 双引擎验证 + 删除证书 |\n| `pdf_batch_replace.py` | 批量替换：预览 → 备份 → 执行 → 一键回滚 |\n\n## 环境依赖\n\n- 必需：`python3` + `pymupdf` `pdfplumber` `pikepdf` `pypdf` `pandas` `openpyxl`\n- 可选：`tesseract`（OCR 兜底）、`libreoffice`（复杂版面转换）、`pdf2docx` `paddleocr`（增强）\n\n## 文档地图（references/）\n\n能力规程（core/value/pro）· Few-Shot 路由示例 · 质量验收标准 · 错误降级策略 · 安全合规护栏 · 命令速查 · 价值话术库 · 技术规范 · OCR 调参 · 飞书集成\n\n## 许可证\n\nMIT-0：任何人可自由使用、修改、再分发（含商业用途），无需署名。\n\nFile v2.1.0:_meta.json\n\n{\n  \"ownerId\": \"kn7f0d8egkxsnntb67gq7hrxzd86cwz5\",\n  \"slug\": \"pdf-master\",\n  \"version\": \"2.1.0\",\n  \"publishedAt\": 1785073341357\n}\n\nFile v2.1.0:references/capabilities-core.md\n\n# 核心能力规程（#1-#5）\n\n> 执行对应能力前完整阅读本节。每项能力按「执行步骤 → 验收标准 → 常见坑」组织。\n> 交付话术见 `value-messaging.md`，通用质检项见 `quality-standards.md`。\n\n## 目录\n- [#1 PDF↔Office 高保真互转](#1-pdfoffice-高保真互转)\n- [#2 扫描件 OCR 精准识别](#2-扫描件-ocr-精准识别)\n- [#3 PDF 内直接编辑](#3-pdf-内直接编辑)\n- [#4 安全保护（加密/权限/水印）](#4-安全保护加密权限水印)\n- [#5 批量自动化处理](#5-批量自动化处理)\n\n---\n\n## #1 PDF↔Office 高保真互转\n\n**目标**：转换后排版还原度可编辑、可用，不是\"能打开就行\"。\n\n### 执行步骤\n\n1. `pdf_info.py` 检测文本层。扫描件 → 先走 #2 OCR 再转换，并告知用户多一步\n2. 按目标格式选管道：\n   - **PDF→Word**：首选 `scripts/pdf_convert.py`（pdf2docx）；复杂版面（多栏/嵌套表格/文本框密集）→ 走 LibreOffice 重建管道：`PDF → 提取元素 → 版面分析 → 生成原生 docx`\n   - **PDF→Excel**：只关心表格时直接用 #6 表格提取输出 xlsx；整页还原才走 pdf2docx 类管道\n   - **PDF→PPT**：一页一幻灯片，文本转文本框、图片原位嵌入；提醒用户 PPT 还原度天然低于 Word\n3. 转换后自检（见下），不合格项降级重试一次，仍不合格如实列入异常清单\n\n### 验收标准\n\n| 项 | 合格线 |\n|----|--------|\n| 字体匹配 | ≥90% 文本保持原字体或视觉近似字体 |\n| 表格 | 原生可编辑表格，非图片/文本框堆叠 |\n| 图片位置 | 偏移 ≤5px |\n| 页眉页脚 | 正确识别归位，不混入正文 |\n\n### 常见坑\n\n- 矢量图/SVG 元素转 Word 后变位图 → 提前告知\n- 特殊字体（企业定制字体）本机缺失 → 用视觉近似字体并在交付时说明\n- 竖排中文/日文 → pdf2docx 支持差，走 LibreOffice 管道\n\n---\n\n## #2 扫描件 OCR 精准识别\n\n**目标**：可搜索、可复制、表格可重建。参数调优必读 `ocr-config.md`。\n\n### 执行步骤\n\n1. 预处理：纠偏 → 去噪 → 二值化（手机拍照件加对比度增强）\n2. 引擎选择：中文/中英混排 → PaddleOCR；纯英文 → Tesseract 亦可；手写体 → PaddleOCR 手写模型\n3. 按用户要的输出形态执行：\n   - **可搜索 PDF**：`scripts/pdf_ocr.py`，原图上叠隐形文本层，版式零改动\n   - **纯文本**：按阅读顺序拼接，保留段落结构\n   - **表格→Excel**：表格区域单独走结构化识别，重建行列（合并单元格语义判断）\n4. 批量 >50 页自动分批，批间报进度\n\n### 验收标准\n\n| 项 | 合格线 |\n|----|--------|\n| 中文印刷体识别率 | >95%（抽 3 页人工比对关键字段） |\n| 金额/日期/编号 | 100% 复核（正则校验格式 + 抽样目检） |\n| 可搜索 PDF | 全文可搜索、可复制、选中位置准确 |\n\n### 常见坑\n\n- 公章覆盖文字 → 该区域识别率骤降，标注\"低置信区\"提醒用户核对\n- 低分辨率（<150dpi）→ 先超分辨率或明确告知识别率上限\n- 表格无框线 → 用坐标聚类重建，交付时附原页截图供比对\n\n---\n\n## #3 PDF 内直接编辑\n\n**目标**：改字、换图、增删页，不动整体排版。**不可逆操作，执行前必须预览确认。**\n\n### 执行步骤\n\n1. 备份原文件（`.bak`），任何编辑都在副本上进行\n2. 文本编辑：定位目标文本对象 → 以原字体/字号/颜色改写内容流；新文本比原文长 → 预警\"可能溢出/换行\"，给两种方案（缩字号容纳 / 接受换行）让用户选\n3. 图片替换：读取原图 bbox → 新图等比缩放到 bbox 内居中 → 保持原透明度/旋转\n4. 页面操作：插入/删除/旋转/调序，操作后重排页码引用（目录、书签、交叉引用）\n5. 生成修改前后对比预览图 → **用户确认后才交付正式文件**\n\n### 验收标准\n\n- 修改区域外零改动（diff 两版页面渲染图，仅目标区域有差异）\n- 新文本无溢出、无遮挡、无乱码（字体子集缺失时用嵌入字体并说明）\n\n### 常见坑\n\n- 扫描件\"改字\"：本质是修图不是改文本 → 告知用户走图像修复方案，效果上限先说清\n- 加密/签名过的 PDF：编辑会破坏签名 → 明确告知并让用户确认是否继续\n\n---\n\n## #4 安全保护（加密/权限/水印）\n\n### 执行步骤\n\n1. 明确需求组合：密码 / 权限 / 水印 / 过期失效，缺参数给默认值并确认\n2. 执行 `scripts/pdf_watermark.py`：\n   - 加密：AES-256，用户密码+所有者密码分离\n   - 权限粒度：禁止打印 / 禁止复制 / 禁止注释 / 禁止编辑，可组合\n   - 动态水印：支持变量 `{user_id}` `{date}` `{time}` `{custom}`，半透明（默认 15% 不透明度）、对角平铺整页、每页随机微偏移防批量裁剪\n3. 输出受保护文件 + 一页《保护配置说明》（列明启用项与密码传递方式——密码绝不与文件同渠道发送）\n\n### 验收标准\n\n- 用无密码方式打开 → 拒绝；用错误密码 → 拒绝\n- 权限项在主流阅读器（Adobe/WPS/浏览器）中生效验证\n- 水印在 100%-400% 缩放下可读、不遮挡正文关键信息\n\n### 常见坑\n\n- 权限控制是\"君子协定\"，流氓阅读器可绕过 → 必须如实告知用户，配合水印追溯才是完整方案\n- 水印遮挡公章/签名区 → 默认避开页面四角 15% 区域，或由用户指定避让区\n\n---\n\n## #5 批量自动化处理\n\n### 执行步骤\n\n1. 清点文件清单（数量、总页数、总大小），>10 个文件先确认再执行\n2. 按子能力选脚本：\n   - **合并**：`scripts/pdf_merge.py` —— 按文件名自然序或用户指定序；自动生成目录书签（每文件一章，取文件名/首页标题）\n   - **拆分**：`scripts/pdf_split.py` —— 支持按页范围 / 按书签 / 每 N 页一份；按内容拆分（如按章节标题）→ 先提取书签或标题模式再切\n   - **重命名**：从文档提取变量（标题/日期/编号）→ 模板如 `{date}_{title}_{no}` → **先输出新旧文件名对照表，确认后执行**\n   - **格式统一**：统一页面尺寸（A4/Letter）、页边距、页眉页脚\n3. 失败文件单独列出，不混入成功批次；保留原文件不动\n\n### 验收标准\n\n- 合并后：页数 = 各文件页数之和；目录书签可跳转且层级正确\n- 拆分后：各份页数正确、首页内容符合拆分规则\n- 重命名：对照表 100% 覆盖，无重名冲突（冲突自动加序号）\n\n### 常见坑\n\n- 文件名编码（GBK/UTF-8 混杂）→ 排序前统一规范化\n- 合并混有加密文件 → 单独列出，提示逐个提供密码\n- 扫描件无书签可拆 → 走 OCR 标题检测，置信度低的拆分点列出请用户确认\n\nFile v2.1.0:references/capabilities-pro.md\n\n# 扩展与壁垒能力规程（#15-#25）\n\n> 执行对应能力前完整阅读本节。交付话术见 `value-messaging.md`，通用质检项见 `quality-standards.md`。\n\n## 目录\n- [#15 PDF 智能压缩](#15-pdf-智能压缩)\n- [#16 PDF 翻译（保留排版）](#16-pdf-翻译保留排版)\n- [#17 合同智能审查](#17-合同智能审查)\n- [#18 发票/票据自动归档](#18-发票票据自动归档)\n- [#19 电子签名与审批流](#19-电子签名与审批流)\n- [#20 批量内容替换](#20-批量内容替换)\n- [#21 PDF 表单创建](#21-pdf-表单创建)\n- [#22 图纸精准测量](#22-图纸精准测量)\n- [#23 翻页电子书制作](#23-翻页电子书制作)\n- [#24 印刷级导出](#24-印刷级导出)\n- [#25 密文级敏感信息删除](#25-密文级敏感信息删除)\n\n---\n\n## #15 PDF 智能压缩\n\n### 执行步骤\n\n1. 确认目标：指定大小（\"压到10MB\"）/ 场景预设（微信≤100MB、邮件≤25MB）/ 质量预设（清晰度优先）\n2. 分层压缩策略（`scripts/pdf_compress.py` 内置）：文字/矢量 → 无损保留；彩色图片 → JPEG 降采样（默认 150dpi/q70）；扫描页 → 可选转 JBIG2 思路的位图优化；嵌入字体子集化；清理冗余对象\n3. 目标大小模式：迭代降质直到 ≤ 目标值，每轮报参数；**设质量地板**（dpi 不低于 96、q 不低于 40），触底仍超 → 报告\"极限压缩到 X MB\"，由用户决定是否接受更低画质\n4. 输出压缩前后对比：大小、 dpi、关键页局部放大图（公章/签名/小字号区）\n\n### 验收标准\n\n- 文字区域：放大 200% 无模糊（文字未参与有损压缩）\n- 公章/签名/二维码可辨认、可扫描\n- 线条图无肉眼可见锯齿；页数与内容零丢失\n\n---\n\n## #16 PDF 翻译（保留排版）\n\n### 执行步骤\n\n1. 确认：目标语言 / 输出形态（纯译文 / 双语对照：左右、上下、段内三选一）/ 术语表（内置行业库或用户自定义）\n2. 段落级提取（保留每段坐标、字号、字体粗细）→ 术语库预替换 → 调用翻译 → 译段回写原坐标\n3. 排版回写规则：译文超长 → 先缩字号（最小到原 80%）→ 再允许换行扩框；CJK 与拉丁混排注意字距；图表内文字走图像文本替换\n4. 生成《术语对照表》附交付\n\n### 验收标准\n\n- 排版保留：版面结构、表格、图片位置与原文件一致（渲染图 diff 仅文字区域有差异）\n- 术语准确率 ≥95%（对照术语表全量核验）；无漏译段落\n- 双语版原文/译文逐段可对应\n\n### 常见坑\n\n- 德/俄语译文平均膨胀 30% → 提前告知可能换行\n- 扫描件 → 先 OCR 出文本层再翻译，告知多一步\n- 公式/代码块不翻译，原位保留\n\n---\n\n## #17 合同智能审查\n\n### 执行步骤\n\n1. 确认审查立场（甲方/乙方/中立）与合同类型（采购/销售/劳动/合作/租赁），立场不同风险取向不同\n2. 风险条款识别（六大类）：自动续约 / 天价违约金 / 权利义务不对等 / 模糊表述 / 知识产权归属 / 数据隐私与保密\n3. 输出《审查报告》固定结构：\n   - `风险总览`（🔴高危/🟡中危/🟢低危 计数 + 一句话结论）\n   - `逐条明细`：条款原文 → 页码定位 → 风险等级 → 风险解释 → 法律依据 → 修改建议（给出可直接替换的条款文本）\n   - `缺失条款提醒`（该类合同应有而未有的条款）\n4. 高亮标注版 PDF 一并交付\n5. **免责边界**：报告结尾固定声明\"本审查为 AI 辅助初筛，不替代执业律师意见；高危条款建议法务复核\"\n\n### 验收标准\n\n- 六大类风险逐类扫描覆盖，无整类遗漏\n- 每条风险有原文引用+页码，可点击核验；修改建议具体可执行，不说空话\n\n---\n\n## #18 发票/票据自动归档\n\n### 执行步骤\n\n1. 批量 OCR（发票专用模型）：提取发票代码、号码、开票日期、金额、税额、价税合计、购买方/销售方名称与税号、发票类型\n2. 验真：对接税务验真接口 → 逐张标记 真票/假票/作废/查无此票；**接口不可用时如实标记\"未验真\"，严禁伪造验真结果**\n3. 去重：发票代码+号码哈希；重复张列出对照\n4. 输出：Excel 汇总表（按员工/部门/项目分类）+ 报销单 + 归档包（按 年/月 目录结构化重命名发票文件）\n5. 异常清单：识别失败、验真异常、疑似连号/大额，单独列出\n\n### 验收标准\n\n- 关键字段（号码/日期/价税合计）识别率 ≥98%，金额字段全量正则校验\n- 验真状态逐张有结果（含\"未验真\"状态）；去重 0 误杀（号码不同不判重）\n\n---\n\n## #19 电子签名与审批流\n\n### 执行步骤\n\n1. 确认场景：单份签 / 批量盖章 / 多级审批流；确认签署方与顺序\n2. 法律有效性路径：CA 数字证书签名（符合《电子签名法》第十三条）；**无 CA 环境时只能做\"图片章+留痕\"**，必须明确告知法律效力差异\n3. 批量盖章：AI 定位签署区（\"签字/盖章/甲方（盖章）\"关键词+版式特征）→ 预览定位结果（逐份缩略图标出落章位置）→ 用户确认 → 批量执行，位置精度 ±2mm\n4. 审批流引擎：顺序/并行/会签/条件分支；前级未签自动锁后级；每步记录 时间/IP/设备/证书编号 → 不可篡改审计日志\n5. 签署完成后：文件哈希存证；任何后续修改会破坏签名并触发报警\n6. 进度查询与签名验证作为子命令支持\n\n### 验收标准\n\n- 落章位置预览确认率 100%（未确认不执行）\n- 审计日志逐步完整；签名验证报告可独立出具\n- 法律效力表述准确：CA 证书签 vs 图片章，绝不混称\n\n---\n\n## #20 批量内容替换\n\n> 不可逆操作。备份 → 预览 → 确认 → 执行 → 报告，五步缺一不可。\n\n### 执行步骤\n\n1. 规则确认：精确匹配 / 正则 / 图片哈希（换 Logo）；多规则可同时下发\n2. `scripts/pdf_batch_replace.py --dry-run` 生成《差异预览》：每文件命中位置、原文→新文、标记\"可疑替换\"（命中在表格/页眉/图片内等非常规区）\n3. **用户确认后执行**：自动备份原件 → 批量替换（≤500/批）→ 失败文件单独列出\n4. 《替换报告》：成功/失败/跳过计数、每文件命中数、备份位置、回滚指令\n5. 回滚：`--rollback` 从备份恢复\n\n### 验收标准\n\n- 预览命中率与执行结果一致；无误替换（可疑替换已逐一确认）\n- 替换区域外零改动；失败文件原件完好\n\n---\n\n## #21 PDF 表单创建\n\n### 执行步骤\n\n1. 字段检测：从 Word/PDF/图片识别填写区（下划线、\"姓名：____\"、空白框）→ 智能判型（文本/日期/数字/单选/复选/下拉/签名）\n2. 生成《字段清单表》（名称/类型/校验规则/必填）→ 用户确认或修改\n3. 高级功能按需：自动计算（数量×单价=小计）/ 字段联动（选\"已婚\"显示配偶信息）/ 数据验证（手机号/身份证正则）/ 下拉选项从 Excel 导入\n4. 数据收集：在线收集需求 → 生成填写链接/二维码 + 多维表格实时汇总（飞书流程见 `feishu-setup.md`）；纯 PDF 表单 → 交付可填写 PDF 并说明数据回收方式\n5. 交付前自测：逐字段试填、计算验算、联动触发、校验拦截各跑一遍\n\n### 验收标准\n\n- 字段类型判断准确率 ≥90%（用户确认环节兜底）\n- 计算公式验算正确；联动与校验逻辑全部实测通过\n\n---\n\n## #22 图纸精准测量\n\n### 执行步骤\n\n1. 比例尺校准：识别图上\"1:100\"类标注 → 无标注时要求用户提供一个已知尺寸反推；多比例尺分区图分别校准\n2. 测量：距离（两点）/ 面积（闭合区域）/ 角度 / 坐标；结果 = 图上距离 × 比例尺\n3. 标注：测量值带引线标注在图纸副本上（原件不动）\n4. 批量测量：框选多个区域 → 输出 Excel 测量数据表（区域名/测量类型/数值/单位）\n5. **精度声明**：PDF 矢量图可达毫米级；扫描件受分辨率限制，交付时注明误差范围\n\n### 验收标准\n\n- 比例尺校准用图上已知尺寸复核（误差 <2%）\n- 测量值单位、比例标注齐全；标注不遮挡图元\n\n---\n\n## #23 翻页电子书制作\n\n### 执行步骤\n\n1. 输出形态确认：在线链接 / 离线 HTML 包 / 嵌入官网 iframe 代码\n2. 制作：HTML5 Canvas 拟真翻页（30fps，拖拽/点击/键盘/滚轮）；移动端单页自适应、平板双页、桌面全屏\n3. 增强按需：目录导航（取 PDF 书签）/ 全文搜索高亮 / 热点链接 / 分享控制（允许下载 vs 仅在线读）\n4. 交付前真机自测：手机/平板/桌面各翻一遍，检查加载速度与变形\n5. 图片质量：页面渲染 ≥150dpi，移动端懒加载\n\n### 验收标准\n\n- 三端展示无变形、无模糊；翻页流畅\n- 目录可跳转、搜索可命中（如启用）；离线包断网可用\n\n---\n\n## #24 印刷级导出\n\n### 执行步骤\n\n1. 确认印刷要求：色彩标准（FOGRA39/Japan Color/厂方 ICC）/ 出血（默认 3mm）/ 交付标准（PDF/X-1a 或 PDF/X-4）\n2. 印刷预检（先出《预检报告》）：RGB 对象清单 / 低于 300dpi 图片清单 / 未嵌入字体清单 / 叠印与细线（<0.25pt）风险\n3. 转换执行：RGB→CMYK（指定 ICC）/ 出血区自动外扩（内容延展非简单拉边）/ 文字转曲 / 输出 PDF/X\n4. 手机阅读优化（子能力）：流式单栏重排 / 图片自适应点击看原图 / 暗色模式 / EPUB 或 HTML5 导出\n5. 交付：印刷级文件 + 预检报告（遗留风险逐项列出）\n\n### 验收标准\n\n- 输出通过 PDF/X 验证器校验；全文无 RGB 残留（转曲/图片除外已声明）\n- 出血区连续无白边；图片全部 ≥300dpi 或已列入风险清单\n- 手机版重排后无横向滚动条、文字可搜索（EPUB 流式）\n\n---\n\n## #25 密文级敏感信息删除\n\n> 最高风险操作。执行前必读 `security-compliance.md`。与 #9 脱敏的本质区别：#25 删除底层对象不可恢复。\n\n### 执行步骤\n\n1. 规则确认：预设类型（身份证/银行卡/手机/邮箱）/ 自定义正则 / 指定区域 / 图片内敏感区\n2. `scripts/pdf_redact.py --scan` 生成《删除预览》：每处命中类型/页码/内容遮蔽对照 → **用户明确确认**\n3. 真删执行：定位文本对象 → 内容流移除绘制指令 → 同步清理字体引用/编码映射；图片内敏感区 → 图像修复（inpainting）抹除非打码\n4. 彻底性验证（自动）：pdfplumber+PyMuPDF 双引擎全文提取扫描 → 0 命中；正则二次扫描 → 0 命中\n5. 出具《删除证书》（PDF/A）：删除时间/操作人/规则/命中数/验证结果/文件哈希，嵌入 PDF 元数据\n6. 批量 ≤200 文件/批；逐份出证\n\n### 验收标准\n\n- 双引擎提取扫描 + 正则扫描 0 命中（附扫描日志）\n- 证书要素齐全、可第三方审计；非目标内容零损伤\n\nFile v2.1.0:references/capabilities-value.md\n\n# 增值能力规程（#6-#14）\n\n> 执行对应能力前完整阅读本节。交付话术见 `value-messaging.md`，通用质检项见 `quality-standards.md`。\n\n## 目录\n- [#6 表格精准提取](#6-表格精准提取)\n- [#7 图文混排解析](#7-图文混排解析)\n- [#8 智能摘要](#8-智能摘要)\n- [#9 自动脱敏](#9-自动脱敏)\n- [#10 元数据清洗](#10-元数据清洗)\n- [#11 名称/编号自动化](#11-名称编号自动化)\n- [#12 两版差异对比](#12-两版差异对比)\n- [#13 文档即问即答](#13-文档即问即答)\n- [#14 规格参数对比矩阵](#14-规格参数对比矩阵)\n\n---\n\n## #6 表格精准提取\n\n### 执行步骤\n\n1. `pdf_info.py` 判文本层：文本型 → pdfplumber 坐标提取；扫描型 → 先 #2 OCR 表格模式\n2. 运行 `scripts/pdf_extract_tables.py`，逐页检测表格区域\n3. 难点对策（按 `tech-spec.md` 表格识别章）：合并单元格 → 形态学+语义判断；无框线 → 坐标聚类；跨页表 → 表头重复模式自动拼接；嵌套表 → 递归子区域\n4. 输出：CSV（单表）/ xlsx（多表多 sheet）/ 飞书多维表格（用户指定时，流程见 `feishu-setup.md`）\n5. **数值列校验**：金额/数量列做正则与合计勾稽，异常值标黄并报告\n\n### 验收标准\n\n- 表格检出：逐页目检无遗漏（漏检是最大事故）\n- 行列结构与原表一致，合并单元格还原正确\n- 数值与原文件逐列抽核 ≥10% 行数，零误差\n\n---\n\n## #7 图文混排解析\n\n### 执行步骤\n\n1. 版面分析：识别标题/正文/列表/表格/图片/图注/页眉页脚区域与阅读顺序（多栏文档按栏序）\n2. 输出 Markdown：标题层级、列表、加粗等语义保留；图片提取为文件并在文中原位引用；表格转 Markdown 或 CSV 引用\n3. 图表（chart）类图片：附一句内容描述（\"图3：2021-2025 出货量柱状图，峰值在 2024\"）\n\n### 验收标准\n\n- 阅读顺序正确（多栏不错序、跨页段落正确衔接）\n- 图片零丢失，引用位置与原版面一致\n- 页眉页脚/页码已剥离，不混入正文\n\n---\n\n## #8 智能摘要\n\n### 执行步骤\n\n1. 确认摘要形态：要点式（默认）/ 段落式 / 一页纸；确认长度（默认 ≤500 字或全文 5%）\n2. 长文（>100 页）分章摘要再归并，避免截断 bias\n3. 输出结构：`核心结论（3 条以内）→ 分章要点 → 关键数据/日期/人名清单`\n4. 每个要点标注来源页码\n\n### 验收标准\n\n- 关键数据（金额、日期、比例）与原文逐一核对零误差\n- 无原文之外的推断；推断性内容必须标注\"（推断）\"\n- 页码引用可跳转核验\n\n---\n\n## #9 自动脱敏\n\n> ⚠️ 脱敏 = 遮盖，底层可恢复。用户要\"彻底/永久删除\"→ 路由 #25。两者的区别必须在交付时说清。涉密任务前读 `security-compliance.md`。\n\n### 执行步骤\n\n1. 识别敏感项：身份证 / 手机 / 银行卡 / 邮箱 / 姓名 / 地址 / 自定义关键词（用户可提供清单）\n2. 生成《脱敏预览报告》：每处敏感项的类型、页码、遮蔽前后对照 → **用户确认后执行**\n3. 执行遮盖（黑色矩形覆盖+同步移除可见文本，但底层对象保留）\n4. 交付脱敏文件 + 预览报告存档\n\n### 验收标准\n\n- 规则覆盖项 0 漏网（二次正则全文扫描验证）\n- 遮盖不越界（不伤及相邻非敏感文字）\n\n---\n\n## #10 元数据清洗\n\n### 执行步骤\n\n1. `scripts/pdf_info.py --meta` 导出全部元数据与 XML 扩展信息，列给用户看有什么\n2. 清洗项：作者 / 最后修改者 / 创建工具 / 修改历史 / 缩略图 / 嵌入文件 / JavaScript / 审阅批注\n3. 执行 `scripts/pdf_info.py --scrub`，清洗后再次导出元数据对比验证\n\n### 验收标准\n\n- 清洗后元数据字段为空或默认值；XMP 包、嵌入附件、隐藏图层同步清除\n- 正文内容零改动\n\n---\n\n## #11 名称/编号自动化\n\n### 执行步骤\n\n1. 与用户确认命名模板：`{date}_{title}_{no}` 之类；可用变量：文档标题/首页日期/检测到的编号/原文件名/序号\n2. 逐文件提取变量 → 生成《新旧文件名对照表》→ **确认后批量重命名**\n3. 非法字符（`\\/:*?\"<>|`）自动替换为 `-`；重名自动加 `(2)` `(3)`\n\n### 验收标准\n\n- 对照表 100% 覆盖所有文件，变量提取失败的文件单独列出人工命名\n- 无重名、无非法字符\n\n---\n\n## #12 两版差异对比\n\n### 执行步骤\n\n1. 双通道对比：文本 diff（逐段对齐）+ 视觉 diff（页面渲染图像素级比对）\n2. 差异分类：新增 / 删除 / 修改 / 格式变化 / 图片变化 / 页面增删\n3. 输出《差异报告》：差异清单（页码+原文→新文+分类）+ 高亮标注版 PDF（新增绿、删除红、修改黄）\n4. 合同场景联动：差异落在关键条款（价格/期限/违约/知识产权）时，额外风险提示（对接 #17 规则）\n\n### 验收标准\n\n- 文本差异 0 漏报（随机抽 3 处未标记区域复核无差异）\n- 差异分类准确；纯格式变化与实质内容变化分开统计\n\n---\n\n## #13 文档即问即答\n\n### 执行步骤\n\n1. 建索引：解析 → 按语义切片（300-500 字/片，保留页码元数据）→ Embedding → 向量库（Chroma/FAISS）\n2. 回答：检索 Top-K 片段 → 生成答案 → **每条结论附页码引用**\n3. 检索无结果 → 明确说\"文档中未找到相关信息\"，不得编造\n4. 多轮追问保持会话内索引复用；涉密文档走本地模型（见 `security-compliance.md`）\n\n### 验收标准\n\n- 答案每个事实点都有页码；页码真实可核\n- 数值类答案与原文一致（金额、参数、日期）\n\n---\n\n## #14 规格参数对比矩阵\n\n### 执行步骤\n\n1. 逐文档提取规格区块（参数表、特性列表、技术指标），扫描件先 OCR\n2. 参数归一化：同义参数合并（\"亮度/Brightness/ cd/m² 亮度\"）、单位统一（ms=毫秒、inch=英寸换算标注）、缺失标 `—`\n3. 输出对比矩阵：行=参数项，列=各文档；差异显著项（数值差 >20% 或有无差异）高亮\n4. 附《参数来源表》：每个单元格值标注来源文档+页码\n\n### 验收标准\n\n- 参数归一化无张冠李戴（抽查每列 5 个参数回原文核对）\n- 矩阵覆盖所有文档的全部规格项，无静默丢弃\n\nFile v2.1.0:references/command-guide.md\n\n# 命令速查手册\n\n> 用户问\"你能做什么\"时，按本文件展示。能力编号与 SKILL.md 路由总表一致（1-25 连续编号）。\n\n## 触发方式\n\n- 飞书 @机器人 + 上传 PDF + 文字指令\n- 群聊中 @机器人并附文件；单聊直接发文件+指令\n\n---\n\n## 第一层 · 五大核心（#1-#5）\n\n### #1 PDF↔Office 高保真互转\n\n| 你想做什么 | 指令示例 | 输出 |\n|-----------|---------|------|\n| PDF 转 Word（保持格式） | \"转Word\" / \"转成可编辑文档\" | .docx |\n| PDF 转 Excel（表格可编辑） | \"转Excel\" / \"表格转成Excel\" | .xlsx |\n| PDF 转 PPT | \"转PPT\" / \"转成幻灯片\" | .pptx |\n\n### #2 扫描件 OCR 精准识别\n\n| 你想做什么 | 指令示例 | 输出 |\n|-----------|---------|------|\n| 扫描件转可搜索PDF | \"OCR识别\" / \"扫描件转文字\" | 可搜索PDF |\n| 发票/单据识别汇总 | \"识别这叠发票\" / \"发票汇总到表格\" | Excel汇总表 |\n| 手写体识别 | \"识别手写单据\" | 文本 |\n\n### #3 PDF 内直接编辑\n\n| 你想做什么 | 指令示例 | 输出 |\n|-----------|---------|------|\n| 修改PDF内文字 | \"改第3页的价格\" / \"把'乙方'改成'甲方'\" | 编辑后PDF |\n| 替换PDF内图片 | \"替换第5页的产品图\" | 编辑后PDF |\n| 插入/删除页面 | \"在第10页后插入新页\" | 编辑后PDF |\n\n### #4 安全保护（加密/水印/权限）\n\n| 你想做什么 | 指令示例 | 输出 |\n|-----------|---------|------|\n| 加密+密码 | \"加密\" / \"设密码\" | 加密PDF |\n| 动态水印 | \"加水印\" / \"带工号水印\" | 带水印PDF |\n| 禁止打印/复制 | \"禁止打印\" / \"只读不能复制\" | 受保护PDF |\n\n### #5 批量自动化处理\n\n| 你想做什么 | 指令示例 | 输出 |\n|-----------|---------|------|\n| 批量合并 | \"合并这20个PDF\" / \"合并成手册\" | 合并PDF（带目录书签） |\n| 按规则拆分 | \"按章节拆分\" / \"每50页拆一份\" | 多个PDF |\n| 批量重命名 | \"按日期重命名\" | 重命名后的文件 |\n\n---\n\n## 第二层 · 九大增值（#6-#14）\n\n| # | 你想做什么 | 指令示例 | 输出 |\n|---|-----------|---------|------|\n| 6 | 提取表格 | \"提取表格\" / \"表格转Excel\" | CSV / Excel / 飞书多维表格 |\n| 7 | 图文解析 | \"提取图文\" / \"解析成Markdown\" | Markdown + 图片包 |\n| 8 | 智能摘要 | \"摘要\" / \"提炼重点\" | 要点摘要（附页码） |\n| 9 | 自动脱敏 | \"脱敏处理\" / \"隐藏敏感信息\" | 脱敏后PDF |\n| 10 | 元数据清洗 | \"擦除痕迹\" / \"去掉作者信息\" | 干净PDF |\n| 11 | 自动命名 | \"按日期重命名\" / \"自动命名\" | 新旧名对照表+重命名文件 |\n| 12 | 版本对比 | \"对比两版差异\" / \"diff\" | 差异报告+高亮PDF |\n| 13 | 文档问答 | \"这份文档说了什么\" / \"参数是多少\" | 答案（附页码引用） |\n| 14 | 规格对比 | \"对比两份规格书的参数\" | 对比矩阵表格 |\n\n---\n\n## 第三层 · 四大扩展（#15-#18）\n\n### #15 PDF 智能压缩\n\n| 你想做什么 | 指令示例 | 输出 |\n|-----------|---------|------|\n| 压缩到指定大小 | \"压缩到10MB以下\" / \"压到20MB\" | 压缩后PDF |\n| 微信/邮件适配 | \"微信传不了帮我压一下\" | 压缩后PDF |\n\n### #16 PDF 翻译（保留排版）\n\n| 你想做什么 | 指令示例 | 输出 |\n|-----------|---------|------|\n| 翻译成中文 | \"翻译成中文\" / \"翻成中文保留格式\" | 翻译后PDF |\n| 双语对照 | \"双语对照翻译\" | 双语PDF |\n| 术语表翻译 | \"用我司术语表翻译\" | 翻译后PDF+术语对照表 |\n\n### #17 合同智能审查\n\n| 你想做什么 | 指令示例 | 输出 |\n|-----------|---------|------|\n| 全面审查 | \"审查这份合同的风险\" / \"合同体检\" | 审查报告+高亮PDF |\n| 立场审查 | \"站在乙方角度标出不利条款\" | 审查报告 |\n\n### #18 发票/票据自动归档\n\n| 你想做什么 | 指令示例 | 输出 |\n|-----------|---------|------|\n| 归档+验真 | \"归档这叠发票\" / \"发票验真归档\" | Excel+归档包 |\n| 报销汇总 | \"生成报销单\" | Excel报销单 |\n| 验真去重 | \"查重复发票\" | 验真结果表 |\n\n---\n\n## 第四层 · 七大壁垒（#19-#25）\n\n### #19 电子签名与审批流\n\n| 你想做什么 | 指令示例 | 输出 |\n|-----------|---------|------|\n| 单份电子签名 | \"给这份合同加电子签名\" | 签名后PDF |\n| 批量盖章 | \"批量盖章这200份报价单\" | 盖章后PDF集合 |\n| 审批流 | \"设置审批流：法务→财务→CEO\" | 流程配置+签名邀请 |\n| 查进度/验签 | \"查签署进度\" / \"验证签名\" | 进度/验证报告 |\n\n### #20 批量内容替换\n\n| 你想做什么 | 指令示例 | 输出 |\n|-----------|---------|------|\n| 批量改价格 | \"200份报价单1999改成2199\" | 替换后PDF+报告 |\n| 统一改地址电话 | \"统一改成新地址和电话\" | 替换后PDF集合 |\n| 批量换Logo | \"旧Logo换成新的\" | 替换后PDF集合 |\n| 预览差异 | \"先预览差异再执行\" | 差异预览报告 |\n\n### #21 PDF 表单创建\n\n| 你想做什么 | 指令示例 | 输出 |\n|-----------|---------|------|\n| 问卷转表单 | \"把这个问卷做成可填写的PDF\" | 可填写PDF |\n| 自动计算 | \"加自动计算：数量×单价=总价\" | 含计算PDF |\n| 字段联动 | \"选了已婚才显示配偶信息\" | 含联动PDF |\n| 数据收集 | \"收集表单数据到表格\" | 链接/二维码+多维表格 |\n\n### #22 图纸精准测量\n\n| 你想做什么 | 指令示例 | 输出 |\n|-----------|---------|------|\n| 量距离 | \"量一下这两堵墙的距离\" | 标注后PDF |\n| 算面积 | \"算这个会议室的面积\" | 标注PDF+数据表 |\n| 批量测量 | \"批量测量所有房间面积\" | Excel测量数据表 |\n\n### #23 翻页电子书制作\n\n| 你想做什么 | 指令示例 | 输出 |\n|-----------|---------|------|\n| 做翻页书 | \"做成翻页电子书\" / \"手册转网页版\" | 在线链接+离线包 |\n| 嵌入官网 | \"生成嵌入代码\" | iframe代码+链接 |\n| 加搜索 | \"要能搜索关键词\" | 增强版电子书 |\n\n### #24 印刷级导出\n\n| 你想做什么 | 指令示例 | 输出 |\n|-----------|---------|------|\n| 印刷预检导出 | \"导出印刷版\" / \"印刷厂要CMYK\" | 印刷级PDF+预检报告 |\n| 加出血区 | \"加3mm出血\" | 带出血区PDF |\n| 文字转曲 | \"文字转曲防缺字\" | 转曲后PDF |\n| 手机优化 | \"转手机阅读版\" | 优化版PDF/EPUB |\n\n### #25 密文级敏感信息删除\n\n| 你想做什么 | 指令示例 | 输出 |\n|-----------|---------|------|\n| 彻底删除隐私 | \"彻底删除身份证号\" / \"永久抹除\" | 安全删除PDF+删除证书 |\n| 批量删除 | \"批量删除敏感信息\" / \"不是涂黑是真删\" | 删除后PDF集合+证书 |\n| 删除验证 | \"检查还有残留吗\" | 验证报告 |\n\n---\n\n## 复合指令示例（能力链）\n\n```\n@万能PDF大师 帮我处理这100份测试报告：按日期重命名，然后合并成一本带目录的手册。\n→ #11 重命名 → #5 合并\n```\n\n```\n@万能PDF大师 这份扫描件合同80MB微信发不了，压到20MB以下，文字必须清楚。\n→ #2 OCR检测（如需）→ #15 目标压缩\n```\n\n```\n@万能PDF大师 这份50页英文Datasheet翻译成中文，保留排版，术语要准。\n→ #16（内置术语库，交付附术语对照表）\n```\n\n```\n@万能PDF大师 这份招标文件要公开，投标方报价和联系方式彻底删除，不是涂黑。\n→ #25（预览→确认→真删→双引擎验证→删除证书）\n```\n\n```\n@万能PDF大师 新旧两版合同对比一下，重点看价格和违约条款变了没。\n→ #12 差异对比 → 关键条款联动 #17 风险提示\n```\n\n---\n\n## 系统反馈提示词库\n\n- ⏳ \"正在解析第 3/20 页…\"\n- 🔍 \"OCR识别中，预计还需30秒…\"\n- ✅ \"表格提取完成，正在生成多维表格…\"\n- ⚠️ \"检测到扫描件，已自动调用OCR引擎…\"\n- 🛡️ \"敏感内容预览已生成，请确认后执行\"\n- 🔴 \"以下文件处理失败：…原件未受影响，详见失败清单\"\n\nFile v2.1.0:references/error-handling.md\n\n# 错误处理与降级策略\n\n> 任何环节失败时阅读。**三条铁律：不静默失败、不伪造结果、原件不受损。**\n\n## 目录\n- [总原则](#总原则)\n- [通用降级链](#通用降级链)\n- [分场景处理](#分场景处理)\n- [熔断与超时](#熔断与超时)\n- [失败报告模板](#失败报告模板)\n\n---\n\n## 总原则\n\n1. **不静默失败**：失败必须显式告知，含原因、影响范围、建议动作\n2. **不伪造结果**：外部接口（验真/CA/翻译）不可用 → 标注\"未完成该步\"，绝不编造\n3. **原件不受损**：所有写操作在副本进行；批量任务失败文件单独隔离，不混入成功批次\n4. **降级优于终止**：有降级路径先降级并告知质量差异，无降级才终止\n\n## 通用降级链\n\n```\n首选方案失败\n  ↓ 记录失败原因\n降级方案执行（质量差异必须告知）\n  ↓ 仍失败\n部分交付：已完成部分先给 + 失败清单 + 重试建议\n  ↓ 完全无法执行\n明确终止：原因 + 用户可采取的替代动作\n```\n\n## 分场景处理\n\n### 输入类\n| 场景 | 处理 |\n|------|------|\n| 文件损坏/打不开 | 尝试修复（pikepdf/qpdf 修复模式）→ 失败则告知重发 |\n| 加密无密码 | 索要密码（\"回复 密码:xxx\"）；明确密码不留存 |\n| 超限（100MB/200页） | 给出具体瘦身路径（先压缩/指定页范围），不只说\"太大\" |\n| 非 PDF 文件 | 说明支持范围；Word/图片可引导先转 PDF |\n| 扫描件质量过差（<100dpi） | 告知识别率上限，请用户提供更清晰版本 |\n\n### 处理类\n| 场景 | 处理 |\n|------|------|\n| PaddleOCR 环境异常 | 降级 Tesseract，告知中文识别率下降（ocr-config.md 决策树） |\n| pdf2docx 转换排版崩 | 降级 LibreOffice 重建管道 → 再降级渲染图+文本层流式 docx |\n| 压缩触底仍超标 | 报告极限值（\"已压到 23MB，继续将损伤文字\"），用户裁决 |\n| 表格检出疑似遗漏 | 二次检测（换检测算法）；仍有疑区列入人工核对清单 |\n| 翻译后排版溢出 | 缩字号(→80%)→换行扩框→双语对照改上下式，逐级处理 |\n| 批量替换部分失败 | 成功批次先交付+失败清单；备份完整可回滚 |\n\n### 外部依赖类\n| 场景 | 处理 |\n|------|------|\n| 发票验真接口不可用 | 逐张标\"未验真\"+接口状态说明+稍后重验指引 |\n| CA 签名服务不可用 | 改图片章方案必须声明无法律效力，用户确认才执行 |\n| 翻译接口超时 | 分段重试 → 仍失败交付已译部分+未译页清单 |\n| 飞书上传失败 | 本地保留结果，重试 3 次；失败给备用取件方式 |\n| 本地模型不可用（涉密任务） | **终止并说明**，不得为完成任务转云端 |\n\n## 熔断与超时\n\n- 单任务 5 分钟硬熔断：保存中间结果 → 报告\"已完成 X/Y\"+续作方式（\"回复'继续'从断点续作\"）\n- OCR 单批 50 页限：批间检查点持久化，熔断后从最近检查点恢复\n- 并发 3 满：新任务排队，告知位次与预计等待\n\n## 失败报告模板\n\n```\n🔴 部分完成 / ⚠️ 已降级 / ❌ 失败\n\n任务：{能力# + 指令摘要}\n结果：成功 {n} / 失败 {m} / 跳过 {k}\n\n失败清单：\n| 文件/页 | 原因 | 建议 |\n| xx.pdf | 加密未提供密码 | 回复\"密码:xxx\"后重试 |\n\n降级说明：{用了什么降级方案，质量差异是什么}\n原件状态：未受影响 / 已备份于 {路径}\n```\n\nFile v2.1.0:references/feishu-setup.md\n\n# 飞书集成配置\n\n> 部署、联调、飞书侧排障时阅读。\n\n## 目录\n- [前置要求](#前置要求)\n- [事件订阅](#事件订阅配置)\n- [文件处理流程](#文件处理流程)\n- [消息卡片模板](#进度反馈消息格式)\n- [多维表格输出](#多维表格输出)\n- [单聊 vs 群聊](#单聊-vs-群聊)\n- [幂等与临时文件](#幂等与临时文件)\n- [错误处理](#错误处理)\n\n---\n\n## 前置要求\n\n1. 飞书机器人已创建并获取 `app_id` / `app_secret`\n2. 机器人已加入目标群聊 / 已开通单聊权限\n3. 开通以下权限：\n\n| 权限 | 用途 |\n|------|------|\n| `im:message:send` | 发送结果消息 |\n| `im:message` | 读取用户指令 |\n| `im:file:read` | 下载用户上传的 PDF |\n| `im:file:write` | 回传结果文件 |\n| `drive:file:read` | 读取云文档附件 |\n| `bitable:app:create` | 创建多维表格 |\n| `bitable:app:read` / `bitable:app:write` | 写入提取数据 |\n\n## 事件订阅配置\n\n- `im.message.receive_v1` — 收到消息（含文件），唯一必需事件\n- 可选：`im.message.message_read_v1`（进度卡片已读回执）\n\n## 文件处理流程\n\n```\n用户上传PDF → 飞书消息事件（含 file_key + message_id）\n    ↓\nBot 下载文件（file_key → 临时路径）\n    ↓\npdf_info.py 检测（类型/页数/加密）\n    ↓\n解析用户指令 → 路由能力（SKILL.md 路由表）\n    ↓\n执行处理（进度实时推送）→ 生成结果\n    ↓\n上传飞书（消息/文件/多维表格）\n    ↓\n清理临时文件（成功/失败都清理）\n```\n\n## 进度反馈消息格式\n\n进度卡片（interactive）：\n\n```json\n{\n  \"msg_type\": \"interactive\",\n  \"card\": {\n    \"config\": { \"wide_screen_mode\": true },\n    \"header\": { \"title\": { \"tag\": \"plain_text\", \"content\": \"⏳ 正在处理 PDF\" }, \"template\": \"blue\" },\n    \"elements\": [\n      { \"tag\": \"markdown\", \"content\": \"已解析：8/20 页\\n预计剩余：30 秒\" }\n    ]\n  }\n}\n```\n\n交付卡片模板（header.template 按结果变色：成功 green / 部分失败 orange / 失败 red）：\n\n```json\n{\n  \"msg_type\": \"interactive\",\n  \"card\": {\n    \"header\": { \"title\": { \"tag\": \"plain_text\", \"content\": \"✅ 转换完成\" }, \"template\": \"green\" },\n    \"elements\": [\n      { \"tag\": \"markdown\", \"content\": \"**质检**：表格 12 个全部原生可编辑，图片偏移 <5px\\n**异常**：无\\n💡 手动重排约需 2-3 小时，本次耗时 48 秒\" }\n    ]\n  }\n}\n```\n\n## 多维表格输出\n\n表格提取/发票归档结果写入多维表格：\n\n1. `feishu_bitable_app` 创建 App（命名：`PDF提取_{文件名}_{日期}`）\n2. `feishu_bitable_app_table` 创建数据表（字段类型映射：金额→数字、日期→日期、其余→文本）\n3. `feishu_bitable_app_table_record` 批量写入（单批 ≤500 条，分批提交）\n4. 返回表格链接 + 字段说明给用户\n\n## 单聊 vs 群聊\n\n- **单聊**：直接处理并返回结果\n- **群聊**：@机器人时处理，普通消息忽略；结果默认群里回复，涉密内容提示\"已私聊发送\"\n\n## 幂等与临时文件\n\n- 以 `message_id + file_key` 为幂等键：同一文件同一指令重复触发 → 直接返回缓存结果，不重复执行\n- 临时文件生命周期：任务结束（成功/失败/超时）即清理；看门狗每 30 分钟清扫孤儿文件\n- 用户密码：仅存内存，任务结束即焚，不落盘不日志\n\n## 错误处理\n\n| 错误场景 | 回复 |\n|---------|------|\n| 文件超过 100MB | \"文件太大，请压缩或拆分后重试（可先发我压缩：指令'压缩到80MB'）\" |\n| 超过 200 页 | \"页数超限，请指定页范围（如 1-50页）\" |\n| 加密 PDF 无密码 | \"请提供PDF密码：回复 '密码:xxx'（密码仅用于本次处理，不留存）\" |\n| OCR 超时 | \"识别超时，建议：①降精度重试 ②指定页范围，回复序号选择\" |\n| 无文本层且 OCR 失败 | \"无法识别内容，请检查文件清晰度，或发原图重试\" |\n| 批量部分失败 | 成功结果先交付 + 失败清单（文件名+原因+建议），原件不受影响 |\n| 外部接口不可用（验真/翻译） | \"xx接口暂不可用，结果已标注'未验真/未翻译'，可稍后重试\" |\n\n> 通用降级链与熔断策略见 `error-handling.md`。\n\nFile v2.1.0:references/few-shot-examples.md\n\n# Few-Shot 路由示例（20 例）\n\n> 意图路由拿不准时对照本表。格式：用户输入 → 路由 → 关键动作要点。\n\n---\n\n**例 1**\n用户：\"客户发来一份50页PDF标书，转Word我要改条款，之前用免费工具表格全乱了\"\n→ **#1** PDF→Word。先 `pdf_info.py` 检测文本层；表格多用 pdf2docx 首选管道；交付按字体/表格/图片/页眉四项质检。\n\n**例 2**\n用户：\"这20张发票扫描件帮我识别汇总到Excel，免费OCR总是把金额识别错\"\n→ **#2 + #18** 组合。OCR 表格模式提取 → 金额字段全量正则校验 → 低置信区清单 → Excel 汇总。\n\n**例 3**\n用户：\"产品手册第5页的价格改成1999，手头没有源文件\"\n→ **#3** 直接编辑。备份 → 定位文本对象改写 → 新文本长度检查 → 预览确认 → 交付。\n\n**例 4**\n用户：\"这份报价单发给客户前，加水印防截图泄露，再加密码禁止转发，7天后失效\"\n→ **#4**。动态水印（用户ID+时间戳）+ AES-256 加密 + 权限禁用；密码与文件分渠道发送提醒。\n\n**例 5**\n用户：\"帮我处理这100份测试报告：按日期重命名，然后合并成一本带目录的手册\"\n→ **#11 → #5** 能力链。先批量提取日期生成对照表确认 → 重命名 → 按名排序合并+目录书签。\n\n**例 6**\n用户：\"这份扫描件合同80MB，微信发不了，帮我压到20MB以下，但文字必须清楚\"\n→ **#15**。分层压缩目标 20MB；文字层无损；迭代降图片 dpi/q 至达标；触底则报告极限值。\n\n**例 7**\n用户：\"这份50页英文芯片Datasheet翻译成中文，保留排版，术语要准\"\n→ **#16**。加载芯片行业术语库 → 段落级翻译回写坐标 → 交付双语版+术语对照表。\n\n**例 8**\n用户：\"这份50页的合作协议帮我审查一下，标出所有风险条款，我们是乙方\"\n→ **#17**。立场=乙方 → 六大类风险扫描 → 分级报告+高亮PDF+免责声明。\n\n**例 9**\n用户：\"这叠100张发票帮我归档，要验真、去重、生成报销单\"\n→ **#18**。批量 OCR → 验真（接口不可用标\"未验真\"）→ 哈希去重 → 报销单+归档包。\n\n**例 10**\n用户：\"这份劳动合同要发给深圳的员工签，他在家没法打印，要合法电子签名\"\n→ **#19**。需 CA 证书路径；无 CA → 明确告知图片章无法律效力，给替代建议。\n\n**例 11**\n用户：\"这200份历史报价单上的价格要从1999改成2199，公司统一调价\"\n→ **#20**。规则精确匹配 → dry-run 差异预览 → 确认 → 备份执行 → 替换报告。\n\n**例 12**\n用户：\"把这个Word入职登记表做成可填写的PDF表单，要能自动计算工龄工资\"\n→ **#21**。字段检测+判型 → 字段清单确认 → 加计算公式 → 自测后交付。\n\n**例 13**\n用户：\"这份PDF施工图上量一下客厅到阳台的距离，还有主卧面积\"\n→ **#22**。比例尺识别/校准 → 两点距离+闭合面积 → 引线标注副本+数值表。\n\n**例 14**\n用户：\"这份产品手册发给客户太死板了，做成能翻页的电子书，能放官网\"\n→ **#23**。HTML5 翻页书 → 三端自测 → 在线链接 + iframe 嵌入代码。\n\n**例 15**\n用户：\"这份宣传册要发印刷厂，他们说文件不合格，帮我导出印刷版\"\n→ **#24**。预检报告 → RGB→CMYK + 3mm 出血 + 转曲 → PDF/X 输出+遗留风险清单。\n\n**例 16**\n用户：\"这份招标公告要公开发布，里面投标方的报价和联系方式要彻底删除，不是涂黑，是真删\"\n→ **#25**。删除预览 → 用户确认 → 底层删除 → 双引擎+正则 0 命中验证 → 删除证书。\n\n**例 17**\n用户：\"把这两版合同 diff 一下，重点看违约条款改了没\"\n→ **#12**（联动 **#17**）。双通道对比 → 差异分类报告 → 关键条款差异做风险提示。\n\n**例 18**\n用户：\"这份文档里关于质保期是怎么约定的？\"\n→ **#13** 问答。检索 → 答案+页码引用；检索为空答\"文档中未找到\"。\n\n**例 19**\n用户：\"帮我把这份 PDF 里的表格提出来，顺便对比下另一家规格书的参数\"\n→ **#6 + #14**。先表格提取 → 再两文档参数归一化 → 对比矩阵+来源表。\n\n**例 20**\n用户：\"这个文件你看着处理一下\"\n→ **意图模糊，禁止猜**。回应：\"可以这样做：①转Word编辑 ②提取表格 ③生成摘要——回复序号或说下你的目的，我来执行。\"\n\nFile v2.1.0:references/ocr-config.md\n\n# OCR 配置指南\n\n> OCR 任务调参、识别效果不达标排障时阅读。脚本入口：`scripts/pdf_ocr.py`。\n\n## 目录\n- [默认配置](#默认配置开箱即用)\n- [场景调参](#场景调参)\n- [速度与精度](#速度-vs-精度)\n- [识别率排障决策树](#识别率排障决策树)\n- [低置信区处理](#低置信区处理)\n\n---\n\n## 默认配置（开箱即用）\n\n| 参数 | 默认值 | 说明 |\n|------|--------|------|\n| `OCR_ENGINE` | `paddleocr` | 中文场景首选 |\n| `DETECTION` | `ch_PP-OCRv4_det` | 文字区域检测模型 |\n| `RECOGNITION` | `ch_PP-OCRv4_rec` | 文字识别模型 |\n| `LANGUAGE` | `ch+en` | 中英混合 |\n| `DESKEW` | `true` | 自动纠偏 |\n| `DENOISE` | `true` | 去噪 |\n| `BINARIZATION` | `adaptive` | 自适应二值化 |\n| `DPI` | `300` | 页面渲染分辨率（<150dpi 原图先超分） |\n\n## 场景调参\n\n### 高质量扫描件（清晰、无倾斜）\n```json\n{ \"deskew\": false, \"denoise\": false, \"binarization\": \"otsu\" }\n```\n\n### 手机拍照 / 有倾斜 / 阴影\n```json\n{ \"deskew\": true, \"denoise\": true, \"binarization\": \"adaptive\", \"contrast_enhance\": true, \"perspective_correct\": true }\n```\n\n### 手写体 / 低质量\n```json\n{ \"engine\": \"paddleocr\", \"model\": \"ch_PP-OCRv4_rec_mobile\", \"handwriting\": true, \"denoise\": true, \"super_resolution\": true }\n```\n\n### 纯英文文档\n```json\n{ \"engine\": \"tesseract\", \"language\": \"eng\", \"oem\": 3, \"psm\": 6 }\n```\n\n### 表格密集文档\n```json\n{ \"table_mode\": true, \"structure_model\": \"SLANet\", \"line_detect\": \"morphology\" }\n```\n\n## 速度 vs 精度\n\n| 模式 | 适用场景 | 速度 |\n|------|---------|------|\n| `fast` | 预览/草稿 | 3-5 秒/页 |\n| `balanced` | 日常使用（默认） | 8-12 秒/页 |\n| `accurate` | 关键文档/出版 | 15-25 秒/页 |\n\n> 单批 ≤50 页，超出自动分批并批间报进度。\n\n## 识别率排障决策树\n\n识别结果不达标时按序排查，每步验证后再进下一步：\n\n1. **原图质量**：渲染 dpi 是否 ≥300？→ 提高渲染 dpi 重跑\n2. **预处理是否误伤**：清晰件开了 denoise/binarization 反而掉字 → 换\"高质量扫描件\"配置\n3. **语言配置**：纯英文用了中文模型 → 切 Tesseract eng；日文/韩文 → 切对应语言包\n4. **引擎切换**：PaddleOCR 异常 → 降级 Tesseract（告知中文识别率下降）；反之亦然\n5. **手写体**：印刷体模型识别手写 → 切手写模型，并告知手写识别率上限（~85%）\n6. **特殊区域**：公章覆盖、底纹、水印区 → 标记低置信区（见下）\n7. **仍不达标**：如实报告\"该页识别置信度低\"，附原图请用户人工核对，**不得硬凑结果**\n\n## 低置信区处理\n\n- 以下区域自动标记「低置信区」：公章覆盖区、手写批注区、底纹/水印重叠区、分辨率 <150dpi 区\n- 交付时附《低置信区清单》：页码 + 区域截图 + 识别结果 + \"请人工核对\"提示\n- 金额/日期/编号类字段落在低置信区 → 升级为必核项，置顶提醒\n\nFile v2.1.0:references/quality-standards.md\n\n# 质量验收标准\n\n> 每次交付前对照执行。**通用项必查，专项项按涉及能力查。** 未过项要么修复，要么写入异常清单如实交付——禁止隐瞒。\n\n## 通用验收项（所有交付）\n\n- [ ] 输出文件可正常打开（用与生成不同的工具二次打开验证）\n- [ ] 页数符合预期（无丢页/多页）\n- [ ] 交付含四要素：结果文件 + 质检结论 + 异常清单 + 价值反馈\n- [ ] 临时文件已清理；原件未被修改（除非任务就是编辑原件，且已有备份）\n\n## 能力专项验收\n\n| # | 必查项（合格线） |\n|---|-----------------|\n| 1 | 字体匹配≥90%；表格原生可编辑；图片偏移≤5px；页眉页脚归位 |\n| 2 | 中文印刷体>95%（抽3页比对）；金额/日期/编号100%复核；可搜索PDF可选中可复制 |\n| 3 | 修改区外零改动（渲染diff）；新文本无溢出无乱码；预览已确认 |\n| 4 | 无密码/错误密码均拒绝打开；权限在主流阅读器生效；水印不遮公章签名 |\n| 5 | 合并页数=Σ各文件；书签可跳转；拆分份数与首页正确；重命名对照表100%覆盖 |\n| 6 | 表格0漏检；合并单元格还原正确；数值抽核≥10%行零误差 |\n| 7 | 阅读顺序正确（多栏不错序）；图片0丢失；页眉页脚已剥离 |\n| 8 | 关键数据与原文零误差；无原文外推断（或已标注）；要点附页码 |\n| 9 | 规则覆盖0漏网（二次扫描验证）；遮盖不越界；已说明\"可恢复\"属性 |\n| 10 | 元数据/XMP/附件/隐藏图层全清；正文零改动 |\n| 11 | 变量提取失败文件已单列；无重名无非法字符 |\n| 12 | 差异0漏报（抽3处未标区复核）；格式变化与实质变化分开统计 |\n| 13 | 事实点全附页码且可核；检索为空明确说\"未找到\" |\n| 14 | 参数归一化抽查每列5项回核；全参数覆盖无静默丢弃 |\n| 15 | 文字区放大200%无模糊；公章/二维码可辨认；页数内容0丢失 |\n| 16 | 排版diff仅文字区有差异；术语≥95%（全量对照术语表）；无漏译段 |\n| 17 | 六大类风险逐类扫描；每条有原文+页码+可执行建议；附免责声明 |\n| 18 | 关键字段≥98%；金额全量正则校验；验真状态逐张有值（含\"未验真\"）；去重0误杀 |\n| 19 | 落章预览确认率100%；审计日志完整；CA签与图片章表述不混淆 |\n| 20 | 预览命中与执行一致；替换区外零改动；失败文件原件完好；备份可回滚 |\n| 21 | 字段判型≥90%（确认兜底）；计算/联动/校验全部实测通过 |\n| 22 | 比例尺已知尺寸复核误差<2%；单位比例标注齐全 |\n| 23 | 三端无变形无模糊；翻页流畅；目录/搜索/离线如启用则实测 |\n| 24 | 通过PDF/X校验；无未声明RGB残留；出血连续；图片≥300dpi或已列风险 |\n| 25 | 双引擎+正则扫描0命中；证书要素齐全；非目标内容0损伤 |\n\n## 质检结论写法\n\n交付时用 2-3 句话说清：**查了什么 + 结果如何 + 遗留风险**。\n\n✅ 好：\"抽检 3 页识别准确率 97%，金额字段全部通过校验；第 7 页公章覆盖区已标低置信，请人工核对该页两个金额。\"\n\n❌ 差：\"已完成，质量很好。\"\n\nArchive v2.0.2: 25 files, 57331 bytes\n\nFiles: references/capabilities-core.md (6857b), references/capabilities-pro.md (11021b), references/capabilities-value.md (6349b), references/command-guide.md (7965b), references/error-handling.md (3468b), references/feishu-setup.md (4260b), references/few-shot-examples.md (4516b), references/ocr-config.md (3015b), references/quality-standards.md (3237b), references/security-compliance.md (3502b), references/tech-spec.md (4794b), references/value-messaging.md (2796b), scripts/pdf_batch_replace.py (4392b), scripts/pdf_compress.py (3446b), scripts/pdf_convert.py (1898b), scripts/pdf_extract_tables.py (2367b), scripts/pdf_info.py (3446b), scripts/pdf_merge.py (1936b), scripts/pdf_ocr.py (3775b), scripts/pdf_redact.py (5348b), scripts/pdf_split.py (2749b), scripts/pdf_watermark.py (3583b), skill-card.md (3816b), SKILL.md (8623b), _meta.json (129b)\n\nFile v2.0.2:SKILL.md\n\n---\nname: pdf-master\ndescription: 全能 PDF 智能处理技能，覆盖 25 项能力五大核心（Office 高保真互转、扫描件 OCR、PDF 直接编辑、加密水印权限、批量合并拆分重命名）、九大增值（表格提取、图文解析、摘要、脱敏、元数据清洗、自动命名、版本对比、文档问答、规格对比矩阵）、四大扩展（智能压缩、排版保留翻译、合同风险审查、发票验真归档）、七大壁垒（电子签名审批流、批量内容替换、表单创建、图纸测量、翻页电子书、印刷级导出、密文级永久删除）。当用户上传 PDF 并提出转换、识别、编辑、加密、压缩、翻译、审查、归档、签名、替换、表单、测量、电子书、印刷、删除等需求，或提到\"转Word\"\"OCR\"\"加水印\"\"压缩到xxMB\"\"审查合同\"\"批量盖章\"\"彻底删除\"等指令时触发。飞书机器人场景原生支持。\n---\n\n# 万能 PDF 大师\n\n一站式 PDF 处理系统，25 项能力按四层组织。本文件是**路由与流程主控**：所有能力的详细执行规程、质量标准、错误降级、价值话术均在 `references/` 中按需加载。\n\n---\n\n## 核心工作流\n\n每个请求严格按 5 步执行：\n\n### Step 1: 接收与检测\n\n收到 PDF 后先运行 `scripts/pdf_info.py` 获取：页数、大小、加密状态、文本层有无、扫描件占比、元数据。**未检测不得开始处理。**\n\n| 检测结果 | 路由 |\n|---------|------|\n| 有文本层 | 文本型管道（PyMuPDF / pdfplumber） |\n| 无文本层、纯图像 | OCR 管道（先读 `references/ocr-config.md`） |\n| 部分文本+部分图像 | 混合管道（文本页直取，图像页 OCR） |\n| 加密文件 | 索要密码；无法提供则终止并说明 |\n\n### Step 2: 意图路由\n\n用「能力路由总表」匹配用户指令到能力编号。匹配规则：\n\n1. **单意图命中** → 直接进入对应能力规程\n2. **复合指令**（如\"按日期重命名后合并成带目录的手册\"）→ 拆成能力链，按依赖顺序执行（重命名 #11 → 合并 #5），每步完成后汇报\n3. **意图模糊**（如\"处理一下这个文件\"）→ 列出最可能的 2-3 个能力让用户选择，**不得自行猜测执行**\n4. **无法匹配** → 说明能力边界，推荐最接近的能力\n\n20 个带标准路由的 Few-Shot 示例见 `references/few-shot-examples.md`，路由拿不准时先查它。\n\n### Step 3: 执行前确认\n\n以下情况必须先确认再动手：\n\n- **批量任务**（>10 文件）：报出文件数、预计耗时、将执行的操作清单\n- **不可逆操作**（密文删除 #25、批量替换 #20、直接编辑 #3）：展示预览/差异，等用户说\"确认\"\n- **目标参数缺失**（压缩没说目标大小、改名没给规则）：给出默认值并询问是否采用\n\n### Step 4: 执行与进度反馈\n\n- 确定性操作优先调用 `scripts/` 下脚本，不重复造轮子\n- 长任务（>30 秒）每 20-30 秒发一次进度：\"正在解析第 3/20 页…\"\n- 任一环节失败 → 按 `references/error-handling.md` 的降级链处理，**不得静默失败**\n\n### Step 5: 交付与价值确认\n\n交付时四件事缺一不可：\n\n1. **结果文件**：上传文件 / 发文本 / 给多维表格链接\n2. **质检结论**：按 `references/quality-standards.md` 对应能力的验收项自检并报告（如\"表格 12 个全部原生可编辑，图片偏移 <5px\"）\n3. **异常清单**：跳过的页、失败的文件、降级的环节，逐一明示\n4. **价值反馈**：一句话省时/省钱/避险对比，话术从 `references/value-messaging.md` 取，不得编造数字\n\n---\n\n## 能力路由总表\n\n**第一层 · 五大核心**（详细规程 `references/capabilities-core.md`）\n\n| # | 能力 | 触发关键词 | 脚本 |\n|---|------|-----------|------|\n| 1 | PDF↔Office 高保真互转 | 转Word / 转Excel / 转PPT | `pdf_convert.py` |\n| 2 | 扫描件 OCR 精准识别 | OCR / 识别 / 扫描件转文字 | `pdf_ocr.py` |\n| 3 | PDF 内直接编辑 | 改文字 / 改参数 / 替换图片 | —（规程执行） |\n| 4 | 安全保护（加密/权限/水印） | 加密 / 加水印 / 禁止打印 | `pdf_watermark.py` |\n| 5 | 批量自动化处理 | 批量合并 / 拆分 / 重命名 | `pdf_merge.py` `pdf_split.py` |\n\n**第二层 · 九大增值**（详细规程 `references/capabilities-value.md`）\n\n| # | 能力 | 触发关键词 | 脚本 |\n|---|------|-----------|------|\n| 6 | 表格精准提取 | 提取表格 / 表格转Excel | `pdf_extract_tables.py` |\n| 7 | 图文混排解析 | 提取图文 / 解析内容 | —（规程执行） |\n| 8 | 智能摘要 | 摘要 / 总结 / 提炼重点 | —（LLM 执行） |\n| 9 | 自动脱敏 | 脱敏 / 打码 / 隐藏敏感信息 | —（规程执行） |\n| 10 | 元数据清洗 | 清洗元数据 / 擦除痕迹 | `pdf_info.py --scrub` |\n| 11 | 名称/编号自动化 | 自动命名 / 重命名 | —（规程执行） |\n| 12 | 两版差异对比 | 对比 / diff / 版本差异 | —（规程执行） |\n| 13 | 文档即问即答 | 问答 / 这份文件说了什么 | —（RAG 规程） |\n| 14 | 规格参数对比矩阵 | 规格对比 / 参数对比 | —（规程执行） |\n\n**第三层 · 四大扩展**（详细规程 `references/capabilities-pro.md`）\n\n| # | 能力 | 触发关键词 | 脚本 |\n|---|------|-----------|------|\n| 15 | PDF 智能压缩 | 压缩 / 压到xxMB / 缩小 | `pdf_compress.py` |\n| 16 | PDF 翻译（保留排版） | 翻译 / 翻成中文 / 双语对照 | —（规程执行） |\n| 17 | 合同智能审查 | 审查合同 / 合同体检 / 标风险 | —（规程执行） |\n| 18 | 发票/票据自动归档 | 归档发票 / 报销汇总 / 验真 | —（规程执行） |\n\n**第四层 · 七大壁垒**（详细规程 `references/capabilities-pro.md`）\n\n| # | 能力 | 触发关键词 | 脚本 |\n|---|------|-----------|------|\n| 19 | 电子签名与审批流 | 签名 / 电子签 / 批量盖章 / 审批流 | —（规程执行） |\n| 20 | 批量内容替换 | 批量替换 / 统一改价格 / 换Logo | `pdf_batch_replace.py` |\n| 21 | PDF 表单创建 | 生成表单 / 可填写PDF / 问卷转表单 | —（规程执行） |\n| 22 | 图纸精准测量 | 测量图纸 / 量尺寸 / 算面积 | —（规程执行） |\n| 23 | 翻页电子书制作 | 翻页书 / 电子书 / 手册转网页 | —（规程执行） |\n| 24 | 印刷级导出 | 印刷导出 / CMYK / 出血区 / 转曲 | —（规程执行） |\n| 25 | 密文级敏感信息删除 | 彻底删除 / 永久抹除 / 不是涂黑 | `pdf_redact.py` |\n\n---\n\n## 硬性约束\n\n| 约束项 | 限制 | 超限处理 |\n|--------|------|---------|\n| 单文件大小 | ≤100MB | 建议先压缩（#15）或拆分（#5） |\n| 单任务页数 | ≤200 页 | 引导用户指定页范围 |\n| OCR 单批 | ≤50 页 | 自动分批，批间报进度 |\n| 并发任务 | ≤3 | 排队并告知预计等待 |\n| 单任务超时 | 5 分钟 | 熔断，保留中间结果，报告已完成部分 |\n| 批量替换 | ≤500 文件/批 | 分批执行 |\n| 密文删除 | ≤200 文件/批 | 分批执行 |\n| 批量确认阈值 | >10 文件 | 必须先确认清单 |\n\n## 安全红线\n\n- **涉密文档**（用户声明或检测到密级标记）→ 全程本地模型，禁上云，详见 `references/security-compliance.md`\n- **密文删除（#25）与脱敏（#9）是不同操作**：#9 是遮盖可恢复，#25 是删除底层对象不可恢复，用户说\"涂黑/打码\"走 #9，说\"彻底/永久/真删\"走 #25，不得混用\n- **脱敏/删除前必须预览确认**，执行后必须验证扫描并出报告\n- 发票验真（#18）、电子签名（#19）依赖外部接口；接口不可用时明确告知\"未验真/无法律效力签名\"，不得伪造结果\n\n## 资源索引\n\n| 文件 | 何时读取 |\n|------|---------|\n| `references/capabilities-core.md` | 执行能力 1-5 前 |\n| `references/capabilities-value.md` | 执行能力 6-14 前 |\n| `references/capabilities-pro.md` | 执行能力 15-25 前 |\n| `references/few-shot-examples.md` | 意图路由拿不准时 |\n| `references/quality-standards.md` | 交付前自检 |\n| `references/error-handling.md` | 任何环节失败时 |\n| `references/security-compliance.md` | 涉密/脱敏/删除/签名任务前 |\n| `references/command-guide.md` | 用户问\"你能做什么\"时 |\n| `references/value-messaging.md` | 交付时取价值话术 |\n| `references/tech-spec.md` | 需要理解技术栈/管线细节时 |\n| `references/ocr-config.md` | OCR 任务调参或识别效果差时 |\n| `references/feishu-setup.md` | 飞书部署/联调/排障时 |\n\nFile v2.0.2:_meta.json\n\n{\n  \"ownerId\": \"kn7f0d8egkxsnntb67gq7hrxzd86cwz5\",\n  \"slug\": \"pdf-master\",\n  \"version\": \"2.0.2\",\n  \"publishedAt\": 1785059864209\n}\n\nFile v2.0.2:references/capabilities-core.md\n\n# 核心能力规程（#1-#5）\n\n> 执行对应能力前完整阅读本节。每项能力按「执行步骤 → 验收标准 → 常见坑」组织。\n> 交付话术见 `value-messaging.md`，通用质检项见 `quality-standards.md`。\n\n## 目录\n- [#1 PDF↔Office 高保真互转](#1-pdfoffice-高保真互转)\n- [#2 扫描件 OCR 精准识别](#2-扫描件-ocr-精准识别)\n- [#3 PDF 内直接编辑](#3-pdf-内直接编辑)\n- [#4 安全保护（加密/权限/水印）](#4-安全保护加密权限水印)\n- [#5 批量自动化处理](#5-批量自动化处理)\n\n---\n\n## #1 PDF↔Office 高保真互转\n\n**目标**：转换后排版还原度可编辑、可用，不是\"能打开就行\"。\n\n### 执行步骤\n\n1. `pdf_info.py` 检测文本层。扫描件 → 先走 #2 OCR 再转换，并告知用户多一步\n2. 按目标格式选管道：\n   - **PDF→Word**：首选 `scripts/pdf_convert.py`（pdf2docx）；复杂版面（多栏/嵌套表格/文本框密集）→ 走 LibreOffice 重建管道：`PDF → 提取元素 → 版面分析 → 生成原生 docx`\n   - **PDF→Excel**：只关心表格时直接用 #6 表格提取输出 xlsx；整页还原才走 pdf2docx 类管道\n   - **PDF→PPT**：一页一幻灯片，文本转文本框、图片原位嵌入；提醒用户 PPT 还原度天然低于 Word\n3. 转换后自检（见下），不合格项降级重试一次，仍不合格如实列入异常清单\n\n### 验收标准\n\n| 项 | 合格线 |\n|----|--------|\n| 字体匹配 | ≥90% 文本保持原字体或视觉近似字体 |\n| 表格 | 原生可编辑表格，非图片/文本框堆叠 |\n| 图片位置 | 偏移 ≤5px |\n| 页眉页脚 | 正确识别归位，不混入正文 |\n\n### 常见坑\n\n- 矢量图/SVG 元素转 Word 后变位图 → 提前告知\n- 特殊字体（企业定制字体）本机缺失 → 用视觉近似字体并在交付时说明\n- 竖排中文/日文 → pdf2docx 支持差，走 LibreOffice 管道\n\n---\n\n## #2 扫描件 OCR 精准识别\n\n**目标**：可搜索、可复制、表格可重建。参数调优必读 `ocr-config.md`。\n\n### 执行步骤\n\n1. 预处理：纠偏 → 去噪 → 二值化（手机拍照件加对比度增强）\n2. 引擎选择：中文/中英混排 → PaddleOCR；纯英文 → Tesseract 亦可；手写体 → PaddleOCR 手写模型\n3. 按用户要的输出形态执行：\n   - **可搜索 PDF**：`scripts/pdf_ocr.py`，原图上叠隐形文本层，版式零改动\n   - **纯文本**：按阅读顺序拼接，保留段落结构\n   - **表格→Excel**：表格区域单独走结构化识别，重建行列（合并单元格语义判断）\n4. 批量 >50 页自动分批，批间报进度\n\n### 验收标准\n\n| 项 | 合格线 |\n|----|--------|\n| 中文印刷体识别率 | >95%（抽 3 页人工比对关键字段） |\n| 金额/日期/编号 | 100% 复核（正则校验格式 + 抽样目检） |\n| 可搜索 PDF | 全文可搜索、可复制、选中位置准确 |\n\n### 常见坑\n\n- 公章覆盖文字 → 该区域识别率骤降，标注\"低置信区\"提醒用户核对\n- 低分辨率（<150dpi）→ 先超分辨率或明确告知识别率上限\n- 表格无框线 → 用坐标聚类重建，交付时附原页截图供比对\n\n---\n\n## #3 PDF 内直接编辑\n\n**目标**：改字、换图、增删页，不动整体排版。**不可逆操作，执行前必须预览确认。**\n\n### 执行步骤\n\n1. 备份原文件（`.bak`），任何编辑都在副本上进行\n2. 文本编辑：定位目标文本对象 → 以原字体/字号/颜色改写内容流；新文本比原文长 → 预警\"可能溢出/换行\"，给两种方案（缩字号容纳 / 接受换行）让用户选\n3. 图片替换：读取原图 bbox → 新图等比缩放到 bbox 内居中 → 保持原透明度/旋转\n4. 页面操作：插入/删除/旋转/调序，操作后重排页码引用（目录、书签、交叉引用）\n5. 生成修改前后对比预览图 → **用户确认后才交付正式文件**\n\n### 验收标准\n\n- 修改区域外零改动（diff 两版页面渲染图，仅目标区域有差异）\n- 新文本无溢出、无遮挡、无乱码（字体子集缺失时用嵌入字体并说明）\n\n### 常见坑\n\n- 扫描件\"改字\"：本质是修图不是改文本 → 告知用户走图像修复方案，效果上限先说清\n- 加密/签名过的 PDF：编辑会破坏签名 → 明确告知并让用户确认是否继续\n\n---\n\n## #4 安全保护（加密/权限/水印）\n\n### 执行步骤\n\n1. 明确需求组合：密码 / 权限 / 水印 / 过期失效，缺参数给默认值并确认\n2. 执行 `scripts/pdf_watermark.py`：\n   - 加密：AES-256，用户密码+所有者密码分离\n   - 权限粒度：禁止打印 / 禁止复制 / 禁止注释 / 禁止编辑，可组合\n   - 动态水印：支持变量 `{user_id}` `{date}` `{time}` `{custom}`，半透明（默认 15% 不透明度）、对角平铺整页、每页随机微偏移防批量裁剪\n3. 输出受保护文件 + 一页《保护配置说明》（列明启用项与密码传递方式——密码绝不与文件同渠道发送）\n\n### 验收标准\n\n- 用无密码方式打开 → 拒绝；用错误密码 → 拒绝\n- 权限项在主流阅读器（Adobe/WPS/浏览器）中生效验证\n- 水印在 100%-400% 缩放下可读、不遮挡正文关键信息\n\n### 常见坑\n\n- 权限控制是\"君子协定\"，流氓阅读器可绕过 → 必须如实告知用户，配合水印追溯才是完整方案\n- 水印遮挡公章/签名区 → 默认避开页面四角 15% 区域，或由用户指定避让区\n\n---\n\n## #5 批量自动化处理\n\n### 执行步骤\n\n1. 清点文件清单（数量、总页数、总大小），>10 个文件先确认再执行\n2. 按子能力选脚本：\n   - **合并**：`scripts/pdf_merge.py` —— 按文件名自然序或用户指定序；自动生成目录书签（每文件一章，取文件名/首页标题）\n   - **拆分**：`scripts/pdf_split.py` —— 支持按页范围 / 按书签 / 每 N 页一份；按内容拆分（如按章节标题）→ 先提取书签或标题模式再切\n   - **重命名**：从文档提取变量（标题/日期/编号）→ 模板如 `{date}_{title}_{no}` → **先输出新旧文件名对照表，确认后执行**\n   - **格式统一**：统一页面尺寸（A4/Letter）、页边距、页眉页脚\n3. 失败文件单独列出，不混入成功批次；保留原文件不动\n\n### 验收标准\n\n- 合并后：页数 = 各文件页数之和；目录书签可跳转且层级正确\n- 拆分后：各份页数正确、首页内容符合拆分规则\n- 重命名：对照表 100% 覆盖，无重名冲突（冲突自动加序号）\n\n### 常见坑\n\n- 文件名编码（GBK/UTF-8 混杂）→ 排序前统一规范化\n- 合并混有加密文件 → 单独列出，提示逐个提供密码\n- 扫描件无书签可拆 → 走 OCR 标题检测，置信度低的拆分点列出请用户确认\n\nFile v2.0.2:references/capabilities-pro.md\n\n# 扩展与壁垒能力规程（#15-#25）\n\n> 执行对应能力前完整阅读本节。交付话术见 `value-messaging.md`，通用质检项见 `quality-standards.md`。\n\n## 目录\n- [#15 PDF 智能压缩](#15-pdf-智能压缩)\n- [#16 PDF 翻译（保留排版）](#16-pdf-翻译保留排版)\n- [#17 合同智能审查](#17-合同智能审查)\n- [#18 发票/票据自动归档](#18-发票票据自动归档)\n- [#19 电子签名与审批流](#19-电子签名与审批流)\n- [#20 批量内容替换](#20-批量内容替换)\n- [#21 PDF 表单创建](#21-pdf-表单创建)\n- [#22 图纸精准测量](#22-图纸精准测量)\n- [#23 翻页电子书制作](#23-翻页电子书制作)\n- [#24 印刷级导出](#24-印刷级导出)\n- [#25 密文级敏感信息删除](#25-密文级敏感信息删除)\n\n---\n\n## #15 PDF 智能压缩\n\n### 执行步骤\n\n1. 确认目标：指定大小（\"压到10MB\"）/ 场景预设（微信≤100MB、邮件≤25MB）/ 质量预设（清晰度优先）\n2. 分层压缩策略（`scripts/pdf_compress.py` 内置）：文字/矢量 → 无损保留；彩色图片 → JPEG 降采样（默认 150dpi/q70）；扫描页 → 可选转 JBIG2 思路的位图优化；嵌入字体子集化；清理冗余对象\n3. 目标大小模式：迭代降质直到 ≤ 目标值，每轮报参数；**设质量地板**（dpi 不低于 96、q 不低于 40），触底仍超 → 报告\"极限压缩到 X MB\"，由用户决定是否接受更低画质\n4. 输出压缩前后对比：大小、 dpi、关键页局部放大图（公章/签名/小字号区）\n\n### 验收标准\n\n- 文字区域：放大 200% 无模糊（文字未参与有损压缩）\n- 公章/签名/二维码可辨认、可扫描\n- 线条图无肉眼可见锯齿；页数与内容零丢失\n\n---\n\n## #16 PDF 翻译（保留排版）\n\n### 执行步骤\n\n1. 确认：目标语言 / 输出形态（纯译文 / 双语对照：左右、上下、段内三选一）/ 术语表（内置行业库或用户自定义）\n2. 段落级提取（保留每段坐标、字号、字体粗细）→ 术语库预替换 → 调用翻译 → 译段回写原坐标\n3. 排版回写规则：译文超长 → 先缩字号（最小到原 80%）→ 再允许换行扩框；CJK 与拉丁混排注意字距；图表内文字走图像文本替换\n4. 生成《术语对照表》附交付\n\n### 验收标准\n\n- 排版保留：版面结构、表格、图片位置与原文件一致（渲染图 diff 仅文字区域有差异）\n- 术语准确率 ≥95%（对照术语表全量核验）；无漏译段落\n- 双语版原文/译文逐段可对应\n\n### 常见坑\n\n- 德/俄语译文平均膨胀 30% → 提前告知可能换行\n- 扫描件 → 先 OCR 出文本层再翻译，告知多一步\n- 公式/代码块不翻译，原位保留\n\n---\n\n## #17 合同智能审查\n\n### 执行步骤\n\n1. 确认审查立场（甲方/乙方/中立）与合同类型（采购/销售/劳动/合作/租赁），立场不同风险取向不同\n2. 风险条款识别（六大类）：自动续约 / 天价违约金 / 权利义务不对等 / 模糊表述 / 知识产权归属 / 数据隐私与保密\n3. 输出《审查报告》固定结构：\n   - `风险总览`（🔴高危/🟡中危/🟢低危 计数 + 一句话结论）\n   - `逐条明细`：条款原文 → 页码定位 → 风险等级 → 风险解释 → 法律依据 → 修改建议（给出可直接替换的条款文本）\n   - `缺失条款提醒`（该类合同应有而未有的条款）\n4. 高亮标注版 PDF 一并交付\n5. **免责边界**：报告结尾固定声明\"本审查为 AI 辅助初筛，不替代执业律师意见；高危条款建议法务复核\"\n\n### 验收标准\n\n- 六大类风险逐类扫描覆盖，无整类遗漏\n- 每条风险有原文引用+页码，可点击核验；修改建议具体可执行，不说空话\n\n---\n\n## #18 发票/票据自动归档\n\n### 执行步骤\n\n1. 批量 OCR（发票专用模型）：提取发票代码、号码、开票日期、金额、税额、价税合计、购买方/销售方名称与税号、发票类型\n2. 验真：对接税务验真接口 → 逐张标记 真票/假票/作废/查无此票；**接口不可用时如实标记\"未验真\"，严禁伪造验真结果**\n3. 去重：发票代码+号码哈希；重复张列出对照\n4. 输出：Excel 汇总表（按员工/部门/项目分类）+ 报销单 + 归档包（按 年/月 目录结构化重命名发票文件）\n5. 异常清单：识别失败、验真异常、疑似连号/大额，单独列出\n\n### 验收标准\n\n- 关键字段（号码/日期/价税合计）识别率 ≥98%，金额字段全量正则校验\n- 验真状态逐张有结果（含\"未验真\"状态）；去重 0 误杀（号码不同不判重）\n\n---\n\n## #19 电子签名与审批流\n\n### 执行步骤\n\n1. 确认场景：单份签 / 批量盖章 / 多级审批流；确认签署方与顺序\n2. 法律有效性路径：CA 数字证书签名（符合《电子签名法》第十三条）；**无 CA 环境时只能做\"图片章+留痕\"**，必须明确告知法律效力差异\n3. 批量盖章：AI 定位签署区（\"签字/盖章/甲方（盖章）\"关键词+版式特征）→ 预览定位结果（逐份缩略图标出落章位置）→ 用户确认 → 批量执行，位置精度 ±2mm\n4. 审批流引擎：顺序/并行/会签/条件分支；前级未签自动锁后级；每步记录 时间/IP/设备/证书编号 → 不可篡改审计日志\n5. 签署完成后：文件哈希存证；任何后续修改会破坏签名并触发报警\n6. 进度查询与签名验证作为子命令支持\n\n### 验收标准\n\n- 落章位置预览确认率 100%（未确认不执行）\n- 审计日志逐步完整；签名验证报告可独立出具\n- 法律效力表述准确：CA 证书签 vs 图片章，绝不混称\n\n---\n\n## #20 批量内容替换\n\n> 不可逆操作。备份 → 预览 → 确认 → 执行 → 报告，五步缺一不可。\n\n### 执行步骤\n\n1. 规则确认：精确匹配 / 正则 / 图片哈希（换 Logo）；多规则可同时下发\n2. `scripts/pdf_batch_replace.py --dry-run` 生成《差异预览》：每文件命中位置、原文→新文、标记\"可疑替换\"（命中在表格/页眉/图片内等非常规区）\n3. **用户确认后执行**：自动备份原件 → 批量替换（≤500/批）→ 失败文件单独列出\n4. 《替换报告》：成功/失败/跳过计数、每文件命中数、备份位置、回滚指令\n5. 回滚：`--rollback` 从备份恢复\n\n### 验收标准\n\n- 预览命中率与执行结果一致；无误替换（可疑替换已逐一确认）\n- 替换区域外零改动；失败文件原件完好\n\n---\n\n## #21 PDF 表单创建\n\n### 执行步骤\n\n1. 字段检测：从 Word/PDF/图片识别填写区（下划线、\"姓名：____\"、空白框）→ 智能判型（文本/日期/数字/单选/复选/下拉/签名）\n2. 生成《字段清单表》（名称/类型/校验规则/必填）→ 用户确认或修改\n3. 高级功能按需：自动计算（数量×单价=小计）/ 字段联动（选\"已婚\"显示配偶信息）/ 数据验证（手机号/身份证正则）/ 下拉选项从 Excel 导入\n4. 数据收集：在线收集需求 → 生成填写链接/二维码 + 多维表格实时汇总（飞书流程见 `feishu-setup.md`）；纯 PDF 表单 → 交付可填写 PDF 并说明数据回收方式\n5. 交付前自测：逐字段试填、计算验算、联动触发、校验拦截各跑一遍\n\n### 验收标准\n\n- 字段类型判断准确率 ≥90%（用户确认环节兜底）\n- 计算公式验算正确；联动与校验逻辑全部实测通过\n\n---\n\n## #22 图纸精准测量\n\n### 执行步骤\n\n1. 比例尺校准：识别图上\"1:100\"类标注 → 无标注时要求用户提供一个已知尺寸反推；多比例尺分区图分别校准\n2. 测量：距离（两点）/ 面积（闭合区域）/ 角度 / 坐标；结果 = 图上距离 × 比例尺\n3. 标注：测量值带引线标注在图纸副本上（原件不动）\n4. 批量测量：框选多个区域 → 输出 Excel 测量数据表（区域名/测量类型/数值/单位）\n5. **精度声明**：PDF 矢量图可达毫米级；扫描件受分辨率限制，交付时注明误差范围\n\n### 验收标准\n\n- 比例尺校准用图上已知尺寸复核（误差 <2%）\n- 测量值单位、比例标注齐全；标注不遮挡图元\n\n---\n\n## #23 翻页电子书制作\n\n### 执行步骤\n\n1. 输出形态确认：在线链接 / 离线 HTML 包 / 嵌入官网 iframe 代码\n2. 制作：HTML5 Canvas 拟真翻页（30fps，拖拽/点击/键盘/滚轮）；移动端单页自适应、平板双页、桌面全屏\n3. 增强按需：目录导航（取 PDF 书签）/ 全文搜索高亮 / 热点链接 / 分享控制（允许下载 vs 仅在线读）\n4. 交付前真机自测：手机/平板/桌面各翻一遍，检查加载速度与变形\n5. 图片质量：页面渲染 ≥150dpi，移动端懒加载\n\n### 验收标准\n\n- 三端展示无变形、无模糊；翻页流畅\n- 目录可跳转、搜索可命中（如启用）；离线包断网可用\n\n---\n\n## #24 印刷级导出\n\n### 执行步骤\n\n1. 确认印刷要求：色彩标准（FOGRA39/Japan Color/厂方 ICC）/ 出血（默认 3mm）/ 交付标准（PDF/X-1a 或 PDF/X-4）\n2. 印刷预检（先出《预检报告》）：RGB 对象清单 / 低于 300dpi 图片清单 / 未嵌入字体清单 / 叠印与细线（<0.25pt）风险\n3. 转换执行：RGB→CMYK（指定 ICC）/ 出血区自动外扩（内容延展非简单拉边）/ 文字转曲 / 输出 PDF/X\n4. 手机阅读优化（子能力）：流式单栏重排 / 图片自适应点击看原图 / 暗色模式 / EPUB 或 HTML5 导出\n5. 交付：印刷级文件 + 预检报告（遗留风险逐项列出）\n\n### 验收标准\n\n- 输出通过 PDF/X 验证器校验；全文无 RGB 残留（转曲/图片除外已声明）\n- 出血区连续无白边；图片全部 ≥300dpi 或已列入风险清单\n- 手机版重排后无横向滚动条、文字可搜索（EPUB 流式）\n\n---\n\n## #25 密文级敏感信息删除\n\n> 最高风险操作。执行前必读 `security-compliance.md`。与 #9 脱敏的本质区别：#25 删除底层对象不可恢复。\n\n### 执行步骤\n\n1. 规则确认：预设类型（身份证/银行卡/手机/邮箱）/ 自定义正则 / 指定区域 / 图片内敏感区\n2. `scripts/pdf_redact.py --scan` 生成《删除预览》：每处命中类型/页码/内容遮蔽对照 → **用户明确确认**\n3. 真删执行：定位文本对象 → 内容流移除绘制指令 → 同步清理字体引用/编码映射；图片内敏感区 → 图像修复（inpainting）抹除非打码\n4. 彻底性验证（自动）：pdfplumber+PyMuPDF 双引擎全文提取扫描 → 0 命中；正则二次扫描 → 0 命中\n5. 出具《删除证书》（PDF/A）：删除时间/操作人/规则/命中数/验证结果/文件哈希，嵌入 PDF 元数据\n6. 批量 ≤200 文件/批；逐份出证\n\n### 验收标准\n\n- 双引擎提取扫描 + 正则扫描 0 命中（附扫描日志）\n- 证书要素齐全、可第三方审计；非目标内容零损伤\n\nFile v2.0.2:references/capabilities-value.md\n\n# 增值能力规程（#6-#14）\n\n> 执行对应能力前完整阅读本节。交付话术见 `value-messaging.md`，通用质检项见 `quality-standards.md`。\n\n## 目录\n- [#6 表格精准提取](#6-表格精准提取)\n- [#7 图文混排解析](#7-图文混排解析)\n- [#8 智能摘要](#8-智能摘要)\n- [#9 自动脱敏](#9-自动脱敏)\n- [#10 元数据清洗](#10-元数据清洗)\n- [#11 名称/编号自动化](#11-名称编号自动化)\n- [#12 两版差异对比](#12-两版差异对比)\n- [#13 文档即问即答](#13-文档即问即答)\n- [#14 规格参数对比矩阵](#14-规格参数对比矩阵)\n\n---\n\n## #6 表格精准提取\n\n### 执行步骤\n\n1. `pdf_info.py` 判文本层：文本型 → pdfplumber 坐标提取；扫描型 → 先 #2 OCR 表格模式\n2. 运行 `scripts/pdf_extract_tables.py`，逐页检测表格区域\n3. 难点对策（按 `tech-spec.md` 表格识别章）：合并单元格 → 形态学+语义判断；无框线 → 坐标聚类；跨页表 → 表头重复模式自动拼接；嵌套表 → 递归子区域\n4. 输出：CSV（单表）/ xlsx（多表多 sheet）/ 飞书多维表格（用户指定时，流程见 `feishu-setup.md`）\n5. **数值列校验**：金额/数量列做正则与合计勾稽，异常值标黄并报告\n\n### 验收标准\n\n- 表格检出：逐页目检无遗漏（漏检是最大事故）\n- 行列结构与原表一致，合并单元格还原正确\n- 数值与原文件逐列抽核 ≥10% 行数，零误差\n\n---\n\n## #7 图文混排解析\n\n### 执行步骤\n\n1. 版面分析：识别标题/正文/列表/表格/图片/图注/页眉页脚区域与阅读顺序（多栏文档按栏序）\n2. 输出 Markdown：标题层级、列表、加粗等语义保留；图片提取为文件并在文中原位引用；表格转 Markdown 或 CSV 引用\n3. 图表（chart）类图片：附一句内容描述（\"图3：2021-2025 出货量柱状图，峰值在 2024\"）\n\n### 验收标准\n\n- 阅读顺序正确（多栏不错序、跨页段落正确衔接）\n- 图片零丢失，引用位置与原版面一致\n- 页眉页脚/页码已剥离，不混入正文\n\n---\n\n## #8 智能摘要\n\n### 执行步骤\n\n1. 确认摘要形态：要点式（默认）/ 段落式 / 一页纸；确认长度（默认 ≤500 字或全文 5%）\n2. 长文（>100 页）分章摘要再归并，避免截断 bias\n3. 输出结构：`核心结论（3 条以内）→ 分章要点 → 关键数据/日期/人名清单`\n4. 每个要点标注来源页码\n\n### 验收标准\n\n- 关键数据（金额、日期、比例）与原文逐一核对零误差\n- 无原文之外的推断；推断性内容必须标注\"（推断）\"\n- 页码引用可跳转核验\n\n---\n\n## #9 自动脱敏\n\n> ⚠️ 脱敏 = 遮盖，底层可恢复。用户要\"彻底/永久删除\"→ 路由 #25。两者的区别必须在交付时说清。涉密任务前读 `security-compliance.md`。\n\n### 执行步骤\n\n1. 识别敏感项：身份证 / 手机 / 银行卡 / 邮箱 / 姓名 / 地址 / 自定义关键词（用户可提供清单）\n2. 生成《脱敏预览报告》：每处敏感项的类型、页码、遮蔽前后对照 → **用户确认后执行**\n3. 执行遮盖（黑色矩形覆盖+同步移除可见文本，但底层对象保留）\n4. 交付脱敏文件 + 预览报告存档\n\n### 验收标准\n\n- 规则覆盖项 0 漏网（二次正则全文扫描验证）\n- 遮盖不越界（不伤及相邻非敏感文字）\n\n---\n\n## #10 元数据清洗\n\n### 执行步骤\n\n1. `scripts/pdf_info.py --meta` 导出全部元数据与 XML 扩展信息，列给用户看有什么\n2. 清洗项：作者 / 最后修改者 / 创建工具 / 修改历史 / 缩略图 / 嵌入文件 / JavaScript / 审阅批注\n3. 执行 `scripts/pdf_info.py --scrub`，清洗后再次导出元数据对比验证\n\n### 验收标准\n\n- 清洗后元数据字段为空或默认值；XMP 包、嵌入附件、隐藏图层同步清除\n- 正文内容零改动\n\n---\n\n## #11 名称/编号自动化\n\n### 执行步骤\n\n1. 与用户确认命名模板：`{date}_{title}_{no}` 之类；可用变量：文档标题/首页日期/检测到的编号/原文件名/序号\n2. 逐文件提取变量 → 生成《新旧文件名对照表》→ **确认后批量重命名**\n3. 非法字符（`\\/:*?\"<>|`）自动替换为 `-`；重名自动加 `(2)` `(3)`\n\n### 验收标准\n\n- 对照表 100% 覆盖所有文件，变量提取失败的文件单独列出人工命名\n- 无重名、无非法字符\n\n---\n\n## #12 两版差异对比\n\n### 执行步骤\n\n1. 双通道对比：文本 diff（逐段对齐）+ 视觉 diff（页面渲染图像素级比对）\n2. 差异分类：新增 / 删除 / 修改 / 格式变化 / 图片变化 / 页面增删\n3. 输出《差异报告》：差异清单（页码+原文→新文+分类）+ 高亮标注版 PDF（新增绿、删除红、修改黄）\n4. 合同场景联动：差异落在关键条款（价格/期限/违约/知识产权）时，额外风险提示（对接 #17 规则）\n\n### 验收标准\n\n- 文本差异 0 漏报（随机抽 3 处未标记区域复核无差异）\n- 差异分类准确；纯格式变化与实质内容变化分开统计\n\n---\n\n## #13 文档即问即答\n\n### 执行步骤\n\n1. 建索引：解析 → 按语义切片（300-500 字/片，保留页码元数据）→ Embedding → 向量库（Chroma/FAISS）\n2. 回答：检索 Top-K 片段 → 生成答案 → **每条结论附页码引用**\n3. 检索无结果 → 明确说\"文档中未找到相关信息\"，不得编造\n4. 多轮追问保持会话内索引复用；涉密文档走本地模型（见 `security-compliance.md`）\n\n### 验收标准\n\n- 答案每个事实点都有页码；页码真实可核\n- 数值类答案与原文一致（金额、参数、日期）\n\n---\n\n## #14 规格参数对比矩阵\n\n### 执行步骤\n\n1. 逐文档提取规格区块（参数表、特性列表、技术指标），扫描件先 OCR\n2. 参数归一化：同义参数合并（\"亮度/Brightness/ cd/m² 亮度\"）、单位统一（ms=毫秒、inch=英寸换算标注）、缺失标 `—`\n3. 输出对比矩阵：行=参数项，列=各文档；差异显著项（数值差 >20% 或有无差异）高亮\n4. 附《参数来源表》：每个单元格值标注来源文档+页码\n\n### 验收标准\n\n- 参数归一化无张冠李戴（抽查每列 5 个参数回原文核对）\n- 矩阵覆盖所有文档的全部规格项，无静默丢弃\n\nFile v2.0.2:references/command-guide.md\n\n# 命令速查手册\n\n> 用户问\"你能做什么\"时，按本文件展示。能力编号与 SKILL.md 路由总表一致（1-25 连续编号）。\n\n## 触发方式\n\n- 飞书 @机器人 + 上传 PDF + 文字指令\n- 群聊中 @机器人并附文件；单聊直接发文件+指令\n\n---\n\n## 第一层 · 五大核心（#1-#5）\n\n### #1 PDF↔Office 高保真互转\n\n| 你想做什么 | 指令示例 | 输出 |\n|-----------|---------|------|\n| PDF 转 Word（保持格式） | \"转Word\" / \"转成可编辑文档\" | .docx |\n| PDF 转 Excel（表格可编辑） | \"转Excel\" / \"表格转成Excel\" | .xlsx |\n| PDF 转 PPT | \"转PPT\" / \"转成幻灯片\" | .pptx |\n\n### #2 扫描件 OCR 精准识别\n\n| 你想做什么 | 指令示例 | 输出 |\n|-----------|---------|------|\n| 扫描件转可搜索PDF | \"OCR识别\" / \"扫描件转文字\" | 可搜索PDF |\n| 发票/单据识别汇总 | \"识别这叠发票\" / \"发票汇总到表格\" | Excel汇总表 |\n| 手写体识别 | \"识别手写单据\" | 文本 |\n\n### #3 PDF 内直接编辑\n\n| 你想做什么 | 指令示例 | 输出 |\n|-----------|---------|------|\n| 修改PDF内文字 | \"改第3页的价格\" / \"把'乙方'改成'甲方'\" | 编辑后PDF |\n| 替换PDF内图片 | \"替换第5页的产品图\" | 编辑后PDF |\n| 插入/删除页面 | \"在第10页后插入新页\" | 编辑后PDF |\n\n### #4 安全保护（加密/水印/权限）\n\n| 你想做什么 | 指令示例 | 输出 |\n|-----------|---------|------|\n| 加密+密码 | \"加密\" / \"设密码\" | 加密PDF |\n| 动态水印 | \"加水印\" / \"带工号水印\" | 带水印PDF |\n| 禁止打印/复制 | \"禁止打印\" / \"只读不能复制\" | 受保护PDF |\n\n### #5 批量自动化处理\n\n| 你想做什么 | 指令示例 | 输出 |\n|-----------|---------|------|\n| 批量合并 | \"合并这20个PDF\" / \"合并成手册\" | 合并PDF（带目录书签） |\n| 按规则拆分 | \"按章节拆分\" / \"每50页拆一份\" | 多个PDF |\n| 批量重命名 | \"按日期重命名\" | 重命名后的文件 |\n\n---\n\n## 第二层 · 九大增值（#6-#14）\n\n| # | 你想做什么 | 指令示例 | 输出 |\n|---|-----------|---------|------|\n| 6 | 提取表格 | \"提取表格\" / \"表格转Excel\" | CSV / Excel / 飞书多维表格 |\n| 7 | 图文解析 | \"提取图文\" / \"解析成Markdown\" | Markdown + 图片包 |\n| 8 | 智能摘要 | \"摘要\" / \"提炼重点\" | 要点摘要（附页码） |\n| 9 | 自动脱敏 | \"脱敏处理\" / \"隐藏敏感信息\" | 脱敏后PDF |\n| 10 | 元数据清洗 | \"擦除痕迹\" / \"去掉作者信息\" | 干净PDF |\n| 11 | 自动命名 | \"按日期重命名\" / \"自动命名\" | 新旧名对照表+重命名文件 |\n| 12 | 版本对比 | \"对比两版差异\" / \"diff\" | 差异报告+高亮PDF |\n| 13 | 文档问答 | \"这份文档说了什么\" / \"参数是多少\" | 答案（附页码引用） |\n| 14 | 规格对比 | \"对比两份规格书的参数\" | 对比矩阵表格 |\n\n---\n\n## 第三层 · 四大扩展（#15-#18）\n\n### #15 PDF 智能压缩\n\n| 你想做什么 | 指令示例 | 输出 |\n|-----------|---------|------|\n| 压缩到指定大小 | \"压缩到10MB以下\" / \"压到20MB\" | 压缩后PDF |\n| 微信/邮件适配 | \"微信传不了帮我压一下\" | 压缩后PDF |\n\n### #16 PDF 翻译（保留排版）\n\n| 你想做什么 | 指令示例 | 输出 |\n|-----------|---------|------|\n| 翻译成中文 | \"翻译成中文\" / \"翻成中文保留格式\" | 翻译后PDF |\n| 双语对照 | \"双语对照翻译\" | 双语PDF |\n| 术语表翻译 | \"用我司术语表翻译\" | 翻译后PDF+术语对照表 |\n\n### #17 合同智能审查\n\n| 你想做什么 | 指令示例 | 输出 |\n|-----------|---------|------|\n| 全面审查 | \"审查这份合同的风险\" / \"合同体检\" | 审查报告+高亮PDF |\n| 立场审查 | \"站在乙方角度标出不利条款\" | 审查报告 |\n\n### #18 发票/票据自动归档\n\n| 你想做什么 | 指令示例 | 输出 |\n|-----------|---------|------|\n| 归档+验真 | \"归档这叠发票\" / \"发票验真归档\" | Excel+归档包 |\n| 报销汇总 | \"生成报销单\" | Excel报销单 |\n| 验真去重 | \"查重复发票\" | 验真结果表 |\n\n---\n\n## 第四层 · 七大壁垒（#19-#25）\n\n### #19 电子签名与审批流\n\n| 你想做什么 | 指令示例 | 输出 |\n|-----------|---------|------|\n| 单份电子签名 | \"给这份合同加电子签名\" | 签名后PDF |\n| 批量盖章 | \"批量盖章这200份报价单\" | 盖章后PDF集合 |\n| 审批流 | \"设置审批流：法务→财务→CEO\" | 流程配置+签名邀请 |\n| 查进度/验签 | \"查签署进度\" / \"验证签名\" | 进度/验证报告 |\n\n### #20 批量内容替换\n\n| 你想做什么 | 指令示例 | 输出 |\n|-----------|---------|------|\n| 批量改价格 | \"200份报价单1999改成2199\" | 替换后PDF+报告 |\n| 统一改地址电话 | \"统一改成新地址和电话\" | 替换后PDF集合 |\n| 批量换Logo | \"旧Logo换成新的\" | 替换后PDF集合 |\n| 预览差异 | \"先预览差异再执行\" | 差异预览报告 |\n\n### #21 PDF 表单创建\n\n| 你想做什么 | 指令示例 | 输出 |\n|-----------|---------|------|\n| 问卷转表单 | \"把这个问卷做成可填写的PDF\" | 可填写PDF |\n| 自动计算 | \"加自动计算：数量×单价=总价\" | 含计算PDF |\n| 字段联动 | \"选了已婚才显示配偶信息\" | 含联动PDF |\n| 数据收集 | \"收集表单数据到表格\" | 链接/二维码+多维表格 |\n\n### #22 图纸精准测量\n\n| 你想做什么 | 指令示例 | 输出 |\n|-----------|---------|------|\n| 量距离 | \"量一下这两堵墙的距离\" | 标注后PDF |\n| 算面积 | \"算这个会议室的面积\" | 标注PDF+数据表 |\n| 批量测量 | \"批量测量所有房间面积\" | Excel测量数据表 |\n\n### #23 翻页电子书制作\n\n| 你想做什么 | 指令示例 | 输出 |\n|-----------|---------|------|\n| 做翻页书 | \"做成翻页电子书\" / \"手册转网页版\" | 在线链接+离线包 |\n| 嵌入官网 | \"生成嵌入代码\" | iframe代码+链接 |\n| 加搜索 | \"要能搜索关键词\" | 增强版电子书 |\n\n### #24 印刷级导出\n\n| 你想做什么 | 指令示例 | 输出 |\n|-----------|---------|------|\n| 印刷预检导出 | \"导出印刷版\" / \"印刷厂要CMYK\" | 印刷级PDF+预检报告 |\n| 加出血区 | \"加3mm出血\" | 带出血区PDF |\n| 文字转曲 | \"文字转曲防缺字\" | 转曲后PDF |\n| 手机优化 | \"转手机阅读版\" | 优化版PDF/EPUB |\n\n### #25 密文级敏感信息删除\n\n| 你想做什么 | 指令示例 | 输出 |\n|-----------|---------|------|\n| 彻底删除隐私 | \"彻底删除身份证号\" / \"永久抹除\" | 安全删除PDF+删除证书 |\n| 批量删除 | \"批量删除敏感信息\" / \"不是涂黑是真删\" | 删除后PDF集合+证书 |\n| 删除验证 | \"检查还有残留吗\" | 验证报告 |\n\n---\n\n## 复合指令示例（能力链）\n\n```\n@万能PDF大师 帮我处理这100份测试报告：按日期重命名，然后合并成一本带目录的手册。\n→ #11 重命名 → #5 合并\n```\n\n```\n@万能PDF大师 这份扫描件合同80MB微信发不了，压到20MB以下，文字必须清楚。\n→ #2 OCR检测（如需）→ #15 目标压缩\n```\n\n```\n@万能PDF大师 这份50页英文Datasheet翻译成中文，保留排版，术语要准。\n→ #16（内置术语库，交付附术语对照表）\n```\n\n```\n@万能PDF大师 这份招标文件要公开，投标方报价和联系方式彻底删除，不是涂黑。\n→ #25（预览→确认→真删→双引擎验证→删除证书）\n```\n\n```\n@万能PDF大师 新旧两版合同对比一下，重点看价格和违约条款变了没。\n→ #12 差异对比 → 关键条款联动 #17 风险提示\n```\n\n---\n\n## 系统反馈提示词库\n\n- ⏳ \"正在解析第 3/20 页…\"\n- 🔍 \"OCR识别中，预计还需30秒…\"\n- ✅ \"表格提取完成，正在生成多维表格…\"\n- ⚠️ \"检测到扫描件，已自动调用OCR引擎…\"\n- 🛡️ \"敏感内容预览已生成，请确认后执行\"\n- 🔴 \"以下文件处理失败：…原件未受影响，详见失败清单\"\n\nFile v2.0.2:references/error-handling.md\n\n# 错误处理与降级策略\n\n> 任何环节失败时阅读。**三条铁律：不静默失败、不伪造结果、原件不受损。**\n\n## 目录\n- [总原则](#总原则)\n- [通用降级链](#通用降级链)\n- [分场景处理](#分场景处理)\n- [熔断与超时](#熔断与超时)\n- [失败报告模板](#失败报告模板)\n\n---\n\n## 总原则\n\n1. **不静默失败**：失败必须显式告知，含原因、影响范围、建议动作\n2. **不伪造结果**：外部接口（验真/CA/翻译）不可用 → 标注\"未完成该步\"，绝不编造\n3. **原件不受损**：所有写操作在副本进行；批量任务失败文件单独隔离，不混入成功批次\n4. **降级优于终止**：有降级路径先降级并告知质量差异，无降级才终止\n\n## 通用降级链\n\n```\n首选方案失败\n  ↓ 记录失败原因\n降级方案执行（质量差异必须告知）\n  ↓ 仍失败\n部分交付：已完成部分先给 + 失败清单 + 重试建议\n  ↓ 完全无法执行\n明确终止：原因 + 用户可采取的替代动作\n```\n\n## 分场景处理\n\n### 输入类\n| 场景 | 处理 |\n|------|------|\n| 文件损坏/打不开 | 尝试修复（pikepdf/qpdf 修复模式）→ 失败则告知重发 |\n| 加密无密码 | 索要密码（\"回复 密码:xxx\"）；明确密码不留存 |\n| 超限（100MB/200页） | 给出具体瘦身路径（先压缩/指定页范围），不只说\"太大\" |\n| 非 PDF 文件 | 说明支持范围；Word/图片可引导先转 PDF |\n| 扫描件质量过差（<100dpi） | 告知识别率上限，请用户提供更清晰版本 |\n\n### 处理类\n| 场景 | 处理 |\n|------|------|\n| PaddleOCR 环境异常 | 降级 Tesseract，告知中文识别率下降（ocr-config.md 决策树） |\n| pdf2docx 转换排版崩 | 降级 LibreOffice 重建管道 → 再降级渲染图+文本层流式 docx |\n| 压缩触底仍超标 | 报告极限值（\"已压到 23MB，继续将损伤文字\"），用户裁决 |\n| 表格检出疑似遗漏 | 二次检测（换检测算法）；仍有疑区列入人工核对清单 |\n| 翻译后排版溢出 | 缩字号(→80%)→换行扩框→双语对照改上下式，逐级处理 |\n| 批量替换部分失败 | 成功批次先交付+失败清单；备份完整可回滚 |\n\n### 外部依赖类\n| 场景 | 处理 |\n|------|------|\n| 发票验真接口不可用 | 逐张标\"未验真\"+接口状态说明+稍后重验指引 |\n| CA 签名服务不可用 | 改图片章方案必须声明无法律效力，用户确认才执行 |\n| 翻译接口超时 | 分段重试 → 仍失败交付已译部分+未译页清单 |\n| 飞书上传失败 | 本地保留结果，重试 3 次；失败给备用取件方式 |\n| 本地模型不可用（涉密任务） | **终止并说明**，不得为完成任务转云端 |\n\n## 熔断与超时\n\n- 单任务 5 分钟硬熔断：保存中间结果 → 报告\"已完成 X/Y\"+续作方式（\"回复'继续'从断点续作\"）\n- OCR 单批 50 页限：批间检查点持久化，熔断后从最近检查点恢复\n- 并发 3 满：新任务排队，告知位次与预计等待\n\n## 失败报告模板\n\n```\n🔴 部分完成 / ⚠️ 已降级 / ❌ 失败\n\n任务：{能力# + 指令摘要}\n结果：成功 {n} / 失败 {m} / 跳过 {k}\n\n失败清单：\n| 文件/页 | 原因 | 建议 |\n| xx.pdf | 加密未提供密码 | 回复\"密码:xxx\"后重试 |\n\n降级说明：{用了什么降级方案，质量差异是什么}\n原件状态：未受影响 / 已备份于 {路径}\n```\n\nFile v2.0.2:references/feishu-setup.md\n\n# 飞书集成配置\n\n> 部署、联调、飞书侧排障时阅读。\n\n## 目录\n- [前置要求](#前置要求)\n- [事件订阅](#事件订阅配置)\n- [文件处理流程](#文件处理流程)\n- [消息卡片模板](#进度反馈消息格式)\n- [多维表格输出](#多维表格输出)\n- [单聊 vs 群聊](#单聊-vs-群聊)\n- [幂等与临时文件](#幂等与临时文件)\n- [错误处理](#错误处理)\n\n---\n\n## 前置要求\n\n1. 飞书机器人已创建并获取 `app_id` / `app_secret`\n2. 机器人已加入目标群聊 / 已开通单聊权限\n3. 开通以下权限：\n\n| 权限 | 用途 |\n|------|------|\n| `im:message:send` | 发送结果消息 |\n| `im:message` | 读取用户指令 |\n| `im:file:read` | 下载用户上传的 PDF |\n| `im:file:write` | 回传结果文件 |\n| `drive:file:read` | 读取云文档附件 |\n| `bitable:app:create` | 创建多维表格 |\n| `bitable:app:read` / `bitable:app:write` | 写入提取数据 |\n\n## 事件订阅配置\n\n- `im.message.receive_v1` — 收到消息（含文件），唯一必需事件\n- 可选：`im.message.message_read_v1`（进度卡片已读回执）\n\n## 文件处理流程\n\n```\n用户上传PDF → 飞书消息事件（含 file_key + message_id）\n    ↓\nBot 下载文件（file_key → 临时路径）\n    ↓\npdf_info.py 检测（类型/页数/加密）\n    ↓\n解析用户指令 → 路由能力（SKILL.md 路由表）\n    ↓\n执行处理（进度实时推送）→ 生成结果\n    ↓\n上传飞书（消息/文件/多维表格）\n    ↓\n清理临时文件（成功/失败都清理）\n```\n\n## 进度反馈消息格式\n\n进度卡片（interactive）：\n\n```json\n{\n  \"msg_type\": \"interactive\",\n  \"card\": {\n    \"config\": { \"wide_screen_mode\": true },\n    \"header\": { \"title\": { \"tag\": \"plain_text\", \"content\": \"⏳ 正在处理 PDF\" }, \"template\": \"blue\" },\n    \"elements\": [\n      { \"tag\": \"markdown\", \"content\": \"已解析：8/20 页\\n预计剩余：30 秒\" }\n    ]\n  }\n}\n```\n\n交付卡片模板（header.template 按结果变色：成功 green / 部分失败 orange / 失败 red）：\n\n```json\n{\n  \"msg_type\": \"interactive\",\n  \"card\": {\n    \"header\": { \"title\": { \"tag\": \"plain_text\", \"content\": \"✅ 转换完成\" }, \"template\": \"green\" },\n    \"elements\": [\n      { \"tag\": \"markdown\", \"content\": \"**质检**：表格 12 个全部原生可编辑，图片偏移 <5px\\n**异常**：无\\n💡 手动重排约需 2-3 小时，本次耗时 48 秒\" }\n    ]\n  }\n}\n```\n\n## 多维表格输出\n\n表格提取/发票归档结果写入多维表格：\n\n1. `feishu_bitable_app` 创建 App（命名：`PDF提取_{文件名}_{日期}`）\n2. `feishu_bitable_app_table` 创建数据表（字段类型映射：金额→数字、日期→日期、其余→文本）\n3. `feishu_bitable_app_table_record` 批量写入（单批 ≤500 条，分批提交）\n4. 返回表格链接 + 字段说明给用户\n\n## 单聊 vs 群聊\n\n- **单聊**：直接处理并返回结果\n- **群聊**：@机器人时处理，普通消息忽略；结果默认群里回复，涉密内容提示\"已私聊发送\"\n\n## 幂等与临时文件\n\n- 以 `message_id + file_key` 为幂等键：同一文件同一指令重复触发 → 直接返回缓存结果，不重复执行\n- 临时文件生命周期：任务结束（成功/失败/超时）即清理；看门狗每 30 分钟清扫孤儿文件\n- 用户密码：仅存内存，任务结束即焚，不落盘不日志\n\n## 错误处理\n\n| 错误场景 | 回复 |\n|---------|------|\n| 文件超过 100MB | \"文件太大，请压缩或拆分后重试（可先发我压缩：指令'压缩到80MB'）\" |\n| 超过 200 页 | \"页数超限，请指定页范围（如 1-50页）\" |\n| 加密 PDF 无密码 | \"请提供PDF密码：回复 '密码:xxx'（密码仅用于本次处理，不留存）\" |\n| OCR 超时 | \"识别超时，建议：①降精度重试 ②指定页范围，回复序号选择\" |\n| 无文本层且 OCR 失败 | \"无法识别内容，请检查文件清晰度，或发原图重试\" |\n| 批量部分失败 | 成功结果先交付 + 失败清单（文件名+原因+建议），原件不受影响 |\n| 外部接口不可用（验真/翻译） | \"xx接口暂不可用，结果已标注'未验真/未翻译'，可稍后重试\" |\n\n> 通用降级链与熔断策略见 `error-handling.md`。\n\nFile v2.0.2:references/few-shot-examples.md\n\n# Few-Shot 路由示例（20 例）\n\n> 意图路由拿不准时对照本表。格式：用户输入 → 路由 → 关键动作要点。\n\n---\n\n**例 1**\n用户：\"客户发来一份50页PDF标书，转Word我要改条款，之前用免费工具表格全乱了\"\n→ **#1** PDF→Word。先 `pdf_info.py` 检测文本层；表格多用 pdf2docx 首选管道；交付按字体/表格/图片/页眉四项质检。\n\n**例 2**\n用户：\"这20张发票扫描件帮我识别汇总到Excel，免费OCR总是把金额识别错\"\n→ **#2 + #18** 组合。OCR 表格模式提取 → 金额字段全量正则校验 → 低置信区清单 → Excel 汇总。\n\n**例 3**\n用户：\"产品手册第5页的价格改成1999，手头没有源文件\"\n→ **#3** 直接编辑。备份 → 定位文本对象改写 → 新文本长度检查 → 预览确认 → 交付。\n\n**例 4**\n用户：\"这份报价单发给客户前，加水印防截图泄露，再加密码禁止转发，7天后失效\"\n→ **#4**。动态水印（用户ID+时间戳）+ AES-256 加密 + 权限禁用；密码与文件分渠道发送提醒。\n\n**例 5**\n用户：\"帮我处理这100份测试报告：按日期重命名，然后合并成一本带目录的手册\"\n→ **#11 → #5** 能力链。先批量提取日期生成对照表确认 → 重命名 → 按名排序合并+目录书签。\n\n**例 6**\n用户：\"这份扫描件合同80MB，微信发不了，帮我压到20MB以下，但文字必须清楚\"\n→ **#15**。分层压缩目标 20MB；文字层无损；迭代降图片 dpi/q 至达标；触底则报告极限值。\n\n**例 7**\n用户：\"这份50页英文芯片Datasheet翻译成中文，保留排版，术语要准\"\n→ **#16**。加载芯片行业术语库 → 段落级翻译回写坐标 → 交付双语版+术语对照表。\n\n**例 8**\n用户：\"这份50页的合作协议帮我审查一下，标出所有风险条款，我们是乙方\"\n→ **#17**。立场=乙方 → 六大类风险扫描 → 分级报告+高亮PDF+免责声明。\n\n**例 9**\n用户：\"这叠100张发票帮我归档，要验真、去重、生成报销单\"\n→ **#18**。批量 OCR → 验真（接口不可用标\"未验真\"）→ 哈希去重 → 报销单+归档包。\n\n**例 10**\n用户：\"这份劳动合同要发给深圳的员工签，他在家没法打印，要合法电子签名\"\n→ **#19**。需 CA 证书路径；无 CA → 明确告知图片章无法律效力，给替代建议。\n\n**例 11**\n用户：\"这200份历史报价单上的价格要从1999改成2199，公司统一调价\"\n→ **#20**。规则精确匹配 → dry-run 差异预览 → 确认 → 备份执行 → 替换报告。\n\n**例 12**\n用户：\"把这个Word入职登记表做成可填写的PDF表单，要能自动计算工龄工资\"\n→ **#21**。字段检测+判型 → 字段清单确认 → 加计算公式 → 自测后交付。\n\n**例 13**\n用户：\"这份PDF施工图上量一下客厅到阳台的距离，还有主卧面积\"\n→ **#22**。比例尺识别/校准 → 两点距离+闭合面积 → 引线标注副本+数值表。\n\n**例 14**\n用户：\"这份产品手册发给客户太死板了，做成能翻页的电子书，能放官网\"\n→ **#23**。HTML5 翻页书 → 三端自测 → 在线链接 + iframe 嵌入代码。\n\n**例 15**\n用户：\"这份宣传册要发印刷厂，他们说文件不合格，帮我导出印刷版\"\n→ **#24**。预检报告 → RGB→CMYK + 3mm 出血 + 转曲 → PDF/X 输出+遗留风险清单。\n\n**例 16**\n用户：\"这份招标公告要公开发布，里面投标方的报价和联系方式要彻底删除，不是涂黑，是真删\"\n→ **#25**。删除预览 → 用户确认 → 底层删除 → 双引擎+正则 0 命中验证 → 删除证书。\n\n**例 17**\n用户：\"把这两版合同 diff 一下，重点看违约条款改了没\"\n→ **#12**（联动 **#17**）。双通道对比 → 差异分类报告 → 关键条款差异做风险提示。\n\n**例 18**\n用户：\"这份文档里关于质保期是怎么约定的？\"\n→ **#13** 问答。检索 → 答案+页码引用；检索为空答\"文档中未找到\"。\n\n**例 19**\n用户：\"帮我把这份 PDF 里的表格提出来，顺便对比下另一家规格书的参数\"\n→ **#6 + #14**。先表格提取 → 再两文档参数归一化 → 对比矩阵+来源表。\n\n**例 20**\n用户：\"这个文件你看着处理一下\"\n→ **意图模糊，禁止猜**。回应：\"可以这样做：①转Word编辑 ②提取表格 ③生成摘要——回复序号或说下你的目的，我来执行。\"\n\nFile v2.0.2:references/ocr-config.md\n\n# OCR 配置指南\n\n> OCR 任务调参、识别效果不达标排障时阅读。脚本入口：`scripts/pdf_ocr.py`。\n\n## 目录\n- [默认配置](#默认配置开箱即用)\n- [场景调参](#场景调参)\n- [速度与精度](#速度-vs-精度)\n- [识别率排障决策树](#识别率排障决策树)\n- [低置信区处理](#低置信区处理)\n\n---\n\n## 默认配置（开箱即用）\n\n| 参数 | 默认值 | 说明 |\n|------|--------|------|\n| `OCR_ENGINE` | `paddleocr` | 中文场景首选 |\n| `DETECTION` | `ch_PP-OCRv4_det` | 文字区域检测模型 |\n| `RECOGNITION` | `ch_PP-OCRv4_rec` | 文字识别模型 |\n| `LANGUAGE` | `ch+en` | 中英混合 |\n| `DESKEW` | `true` | 自动纠偏 |\n| `DENOISE` | `true` | 去噪 |\n| `BINARIZATION` | `adaptive` | 自适应二值化 |\n| `DPI` | `300` | 页面渲染分辨率（<150dpi 原图先超分） |\n\n## 场景调参\n\n### 高质量扫描件（清晰、无倾斜）\n```json\n{ \"deskew\": false, \"denoise\": false, \"binarization\": \"otsu\" }\n```\n\n### 手机拍照 / 有倾斜 / 阴影\n```json\n{ \"deskew\": true, \"denoise\": true, \"binarization\": \"adaptive\", \"contrast_enhance\": true, \"perspective_correct\": true }\n```\n\n### 手写体 / 低质量\n```json\n{ \"engine\": \"paddleocr\", \"model\": \"ch_PP-OCRv4_rec_mobile\", \"handwriting\": true, \"denoise\": true, \"super_resolution\": true }\n```\n\n### 纯英文文档\n```json\n{ \"engine\": \"tesseract\", \"language\": \"eng\", \"oem\": 3, \"psm\": 6 }\n```\n\n### 表格密集文档\n```json\n{ \"table_mode\": true, \"structure_model\": \"SLANet\", \"line_detect\": \"morphology\" }\n```\n\n## 速度 vs 精度\n\n| 模式 | 适用场景 | 速度 |\n|------|---------|------|\n| `fast` | 预览/草稿 | 3-5 秒/页 |\n| `balanced` | 日常使用（默认） | 8-12 秒/页 |\n| `accurate` | 关键文档/出版 | 15-25 秒/页 |\n\n> 单批 ≤50 页，超出自动分批并批间报进度。\n\n## 识别率排障决策树\n\n识别结果不达标时按序排查，每步验证后再进下一步：\n\n1. **原图质量**：渲染 dpi 是否 ≥300？→ 提高渲染 dpi 重跑\n2. **预处理是否误伤**：清晰件开了 denoise/binarization 反而掉字 → 换\"高质量扫描件\"配置\n3. **语言配置**：纯英文用了中文模型 → 切 Tesseract eng；日文/韩文 → 切对应语言包\n4. **引擎切换**：PaddleOCR 异常 → 降级 Tesseract（告知中文识别率下降）；反之亦然\n5. **手写体**：印刷体模型识别手写 → 切手写模型，并告知手写识别率上限（~85%）\n6. **特殊区域**：公章覆盖、底纹、水印区 → 标记低置信区（见下）\n7. **仍不达标**：如实报告\"该页识别置信度低\"，附原图请用户人工核对，**不得硬凑结果**\n\n## 低置信区处理\n\n- 以下区域自动标记「低置信区」：公章覆盖区、手写批注区、底纹/水印重叠区、分辨率 <150dpi 区\n- 交付时附《低置信区清单》：页码 + 区域截图 + 识别结果 + \"请人工核对\"提示\n- 金额/日期/编号类字段落在低置信区 → 升级为必核项，置顶提醒\n\nFile v2.0.2:references/quality-standards.md\n\n# 质量验收标准\n\n> 每次交付前对照执行。**通用项必查，专项项按涉及能力查。** 未过项要么修复，要么写入异常清单如实交付——禁止隐瞒。\n\n## 通用验收项（所有交付）\n\n- [ ] 输出文件可正常打开（用与生成不同的工具二次打开验证）\n- [ ] 页数符合预期（无丢页/多页）\n- [ ] 交付含四要素：结果文件 + 质检结论 + 异常清单 + 价值反馈\n- [ ] 临时文件已清理；原件未被修改（除非任务就是编辑原件，且已有备份）\n\n## 能力专项验收\n\n| # | 必查项（合格线） |\n|---|-----------------|\n| 1 | 字体匹配≥90%；表格原生可编辑；图片偏移≤5px；页眉页脚归位 |\n| 2 | 中文印刷体>95%（抽3页比对）；金额/日期/编号100%复核；可搜索PDF可选中可复制 |\n| 3 | 修改区外零改动（渲染diff）；新文本无溢出无乱码；预览已确认 |\n| 4 | 无密码/错误密码均拒绝打开；权限在主流阅读器生效；水印不遮公章签名 |\n| 5 | 合并页数=Σ各文件；书签可跳转；拆分份数与首页正确；重命名对照表100%覆盖 |\n| 6 | 表格0漏检；合并单元格还原正确；数值抽核≥10%行零误差 |\n| 7 | 阅读顺序正确（多栏不错序）；图片0丢失；页眉页脚已剥离 |\n| 8 | 关键数据与原文零误差；无原文外推断（或已标注）；要点附页码 |\n| 9 | 规则覆盖0漏网（二次扫描验证）；遮盖不越界；已说明\"可恢复\"属性 |\n| 10 | 元数据/XMP/附件/隐藏图层全清；正文零改动 |\n| 11 | 变量提取失败文件已单列；无重名无非法字符 |\n| 12 | 差异0漏报（抽3处未标区复核）；格式变化与实质变化分开统计 |\n| 13 | 事实点全附页码且可核；检索为空明确说\"未找到\" |\n| 14 | 参数归一化抽查每列5项回核；全参数覆盖无静默丢弃 |\n| 15 | 文字区放大200%无模糊；公章/二维码可辨认；页数内容0丢失 |\n| 16 | 排版diff仅文字区有差异；术语≥95%（全量对照术语表）；无漏译段 |\n| 17 | 六大类风险逐类扫描；每条有原文+页码+可执行建议；附免责声明 |\n| 18 | 关键字段≥98%；金额全量正则校验；验真状态逐张有值（含\"未验真\"）；去重0误杀 |\n| 19 | 落章预览确认率100%；审计日志完整；CA签与图片章表述不混淆 |\n| 20 | 预览命中与执行一致；替换区外零改动；失败文件原件完好；备份可回滚 |\n| 21 | 字段判型≥90%（确认兜底）；计算/联动/校验全部实测通过 |\n| 22 | 比例尺已知尺寸复核误差<2%；单位比例标注齐全 |\n| 23 | 三端无变形无模糊；翻页流畅；目录/搜索/离线如启用则实测 |\n| 24 | 通过PDF/X校验；无未声明RGB残留；出血连续；图片≥300dpi或已列风险 |\n| 25 | 双引擎+正则扫描0命中；证书要素齐全；非目标内容0损伤 |\n\n## 质检结论写法\n\n交付时用 2-3 句话说清：**查了什么 + 结果如何 + 遗留风险**。\n\n✅ 好：\"抽检 3 页识别准确率 97%，金额字段全部通过校验；第 7 页公章覆盖区已标低置信，请人工核对该页两个金额。\"\n\n❌ 差：\"已完成，质量很好。\"\n\nFile v2.0.2:references/security-compliance.md\n\n# 安全与合规护栏\n\n> 涉密文档、脱敏/删除、电子签名、合同审查任务**执行前必读**。\n\n## 目录\n- [文档密级与模型路由](#文档密级与模型路由)\n- [脱敏 #9 vs 密文删除 #25](#脱敏-9-vs-密文删除-25)\n- [电子签名法律效力边界](#电子签名法律效力边界)\n- [合同审查免责边界](#合同审查免责边界)\n- [数据生命周期](#数据生命周期)\n- [红线清单](#红线清单)\n\n---\n\n## 文档密级与模型路由\n\n| 密级 | 判定 | 模型路由 |\n|------|------|---------|\n| 公开/内部一般 | 默认 | 云端模型 |\n| 内部敏感 | 用户声明\"敏感/涉密\" | 本地 27B，禁上云 |\n| 密级文档 | 检测到\"机密/秘密/绝密\"字样或密级水印 | 本地 27B，禁上云；任务结束即焚临时文件 |\n\n- 检测在 `pdf_info.py` 阶段完成，命中即提示用户确认路由\n- 本地模型不可用时：**终止任务并说明**，不得转云端完成\n\n## 脱敏 #9 vs 密文删除 #25\n\n| 维度 | #9 脱敏 | #25 密文删除 |\n|------|---------|-------------|\n| 本质 | 遮盖（黑框覆盖） | 删除底层文本对象/图像修复 |\n| 可恢复性 | 专业工具可恢复 | 不可恢复（双引擎验证） |\n| 适用 | 内部流转、低风险 | 对外公开、法律合规、隐私抹除 |\n| 交付物 | 脱敏文件 | 删除文件+验证报告+删除证书 |\n\n- 用户说\"涂黑/打码/隐藏\"→ #9；说\"彻底/永久/真删/抹除\"→ #25\n- 意图不明时必须澄清，并说明两者可恢复性差异\n- #9 交付时必须提示\"底层数据仍可恢复，对外公开请用彻底删除\"\n\n## 电子签名法律效力边界\n\n| 方案 | 法律效力 | 表述要求 |\n|------|---------|---------|\n| CA 数字证书签名 | 符合《电子签名法》第十三条，司法实践认可 | 可表述\"具有法律效力\" |\n| 图片章+留痕 | 无法律效力，仅示意 | **必须明确告知无法律效力** |\n\n- 劳动/合同场景用户要求\"合法电子签\"→ 无 CA 环境时不得用图片章冒充\n- 批量盖章执行前落章位置预览确认率 100%\n- 审计日志要素：时间/IP/设备/证书编号/文件哈希，逐步完整\n\n## 合同审查免责边界\n\n- 每份审查报告结尾固定附：\n  > \"本报告为 AI 辅助初筛结果，不构成法律意见，不替代执业律师审查。🔴 高危条款建议提交法务/律师复核后决策。\"\n- 不输出\"这份合同可以签/不能签\"的结论性判断，只输出风险与建议\n- 法律依据引用须注明法条名称与条款号；不确定的法条不引用\n\n## 数据生命周期\n\n| 数据 | 规则 |\n|------|------|\n| 用户上传文件 | 处理期存临时目录，任务结束（成功/失败/超时）即清理 |\n| 用户密码 | 仅内存使用，不落盘、不日志、任务结束即焚 |\n| 备份文件（#3/#20） | 保留至用户确认结果无误或 7 天，先到期先清理 |\n| 删除证书/审计日志 | 按用户指定位置交付，服务端不留副本（用户要求托管除外） |\n| 对话中的敏感内容 | 不主动复述完整敏感号码（身份证/银行卡），引用时遮蔽中间位 |\n\n## 红线清单\n\n1. 涉密文档上云 —— 禁止\n2. 伪造验真/签名/审查结果 —— 禁止\n3. 涂黑冒充彻底删除 —— 禁止\n4. 图片章冒充法律有效签名 —— 禁止\n5. 未预览确认执行不可逆操作（#3/#20/#25） —— 禁止\n6. 密码落盘/进日志 —— 禁止\n7. 本地模型不可用时转云端处理涉密任务 —— 禁止\n\nArchive v1.0.2: 25 files, 57324 bytes\n\nFiles: references/capabilities-core.md (6857b), references/capabilities-pro.md (11021b), references/capabilities-value.md (6349b), references/command-guide.md (7965b), references/error-handling.md (3468b), references/feishu-setup.md (4260b), references/few-shot-examples.md (4516b), references/ocr-config.md (3015b), references/quality-standards.md (3237b), references/security-compliance.md (3502b), references/tech-spec.md (4794b), references/value-messaging.md (2796b), scripts/pdf_batch_replace.py (4392b), scripts/pdf_compress.py (3446b), scripts/pdf_convert.py (1898b), scripts/pdf_extract_tables.py (2367b), scripts/pdf_info.py (3446b), scripts/pdf_merge.py (1936b), scripts/pdf_ocr.py (3775b), scripts/pdf_redact.py (5348b), scripts/pdf_split.py (2749b), scripts/pdf_watermark.py (3583b), skill-card.md (3722b), skill.md (8623b), _meta.json (129b)\n\nFile v1.0.2:skill.md\n\n---\nname: pdf-master\ndescription: 全能 PDF 智能处理技能，覆盖 25 项能力五大核心（Office 高保真互转、扫描件 OCR、PDF 直接编辑、加密水印权限、批量合并拆分重命名）、九大增值（表格提取、图文解析、摘要、脱敏、元数据清洗、自动命名、版本对比、文档问答、规格对比矩阵）、四大扩展（智能压缩、排版保留翻译、合同风险审查、发票验真归档）、七大壁垒（电子签名审批流、批量内容替换、表单创建、图纸测量、翻页电子书、印刷级导出、密文级永久删除）。当用户上传 PDF 并提出转换、识别、编辑、加密、压缩、翻译、审查、归档、签名、替换、表单、测量、电子书、印刷、删除等需求，或提到\"转Word\"\"OCR\"\"加水印\"\"压缩到xxMB\"\"审查合同\"\"批量盖章\"\"彻底删除\"等指令时触发。飞书机器人场景原生支持。\n---\n\n# 万能 PDF 大师\n\n一站式 PDF 处理系统，25 项能力按四层组织。本文件是**路由与流程主控**：所有能力的详细执行规程、质量标准、错误降级、价值话术均在 `references/` 中按需加载。\n\n---\n\n## 核心工作流\n\n每个请求严格按 5 步执行：\n\n### Step 1: 接收与检测\n\n收到 PDF 后先运行 `scripts/pdf_info.py` 获取：页数、大小、加密状态、文本层有无、扫描件占比、元数据。**未检测不得开始处理。**\n\n| 检测结果 | 路由 |\n|---------|------|\n| 有文本层 | 文本型管道（PyMuPDF / pdfplumber） |\n| 无文本层、纯图像 | OCR 管道（先读 `references/ocr-config.md`） |\n| 部分文本+部分图像 | 混合管道（文本页直取，图像页 OCR） |\n| 加密文件 | 索要密码；无法提供则终止并说明 |\n\n### Step 2: 意图路由\n\n用「能力路由总表」匹配用户指令到能力编号。匹配规则：\n\n1. **单意图命中** → 直接进入对应能力规程\n2. **复合指令**（如\"按日期重命名后合并成带目录的手册\"）→ 拆成能力链，按依赖顺序执行（重命名 #11 → 合并 #5），每步完成后汇报\n3. **意图模糊**（如\"处理一下这个文件\"）→ 列出最可能的 2-3 个能力让用户选择，**不得自行猜测执行**\n4. **无法匹配** → 说明能力边界，推荐最接近的能力\n\n20 个带标准路由的 Few-Shot 示例见 `references/few-shot-examples.md`，路由拿不准时先查它。\n\n### Step 3: 执行前确认\n\n以下情况必须先确认再动手：\n\n- **批量任务**（>10 文件）：报出文件数、预计耗时、将执行的操作清单\n- **不可逆操作**（密文删除 #25、批量替换 #20、直接编辑 #3）：展示预览/差异，等用户说\"确认\"\n- **目标参数缺失**（压缩没说目标大小、改名没给规则）：给出默认值并询问是否采用\n\n### Step 4: 执行与进度反馈\n\n- 确定性操作优先调用 `scripts/` 下脚本，不重复造轮子\n- 长任务（>30 秒）每 20-30 秒发一次进度：\"正在解析第 3/20 页…\"\n- 任一环节失败 → 按 `references/error-handling.md` 的降级链处理，**不得静默失败**\n\n### Step 5: 交付与价值确认\n\n交付时四件事缺一不可：\n\n1. **结果文件**：上传文件 / 发文本 / 给多维表格链接\n2. **质检结论**：按 `references/quality-standards.md` 对应能力的验收项自检并报告（如\"表格 12 个全部原生可编辑，图片偏移 <5px\"）\n3. **异常清单**：跳过的页、失败的文件、降级的环节，逐一明示\n4. **价值反馈**：一句话省时/省钱/避险对比，话术从 `references/value-messaging.md` 取，不得编造数字\n\n---\n\n## 能力路由总表\n\n**第一层 · 五大核心**（详细规程 `references/capabilities-core.md`）\n\n| # | 能力 | 触发关键词 | 脚本 |\n|---|------|-----------|------|\n| 1 | PDF↔Office 高保真互转 | 转Word / 转Excel / 转PPT | `pdf_convert.py` |\n| 2 | 扫描件 OCR 精准识别 | OCR / 识别 / 扫描件转文字 | `pdf_ocr.py` |\n| 3 | PDF 内直接编辑 | 改文字 / 改参数 / 替换图片 | —（规程执行） |\n| 4 | 安全保护（加密/权限/水印） | 加密 / 加水印 / 禁止打印 | `pdf_watermark.py` |\n| 5 | 批量自动化处理 | 批量合并 / 拆分 / 重命名 | `pdf_merge.py` `pdf_split.py` |\n\n**第二层 · 九大增值**（详细规程 `references/capabilities-value.md`）\n\n| # | 能力 | 触发关键词 | 脚本 |\n|---|------|-----------|------|\n| 6 | 表格精准提取 | 提取表格 / 表格转Excel | `pdf_extract_tables.py` |\n| 7 | 图文混排解析 | 提取图文 / 解析内容 | —（规程执行） |\n| 8 | 智能摘要 | 摘要 / 总结 / 提炼重点 | —（LLM 执行） |\n| 9 | 自动脱敏 | 脱敏 / 打码 / 隐藏敏感信息 | —（规程执行） |\n| 10 | 元数据清洗 | 清洗元数据 / 擦除痕迹 | `pdf_info.py --scrub` |\n| 11 | 名称/编号自动化 | 自动命名 / 重命名 | —（规程执行） |\n| 12 | 两版差异对比 | 对比 / diff / 版本差异 | —（规程执行） |\n| 13 | 文档即问即答 | 问答 / 这份文件说了什么 | —（RAG 规程） |\n| 14 | 规格参数对比矩阵 | 规格对比 / 参数对比 | —（规程执行） |\n\n**第三层 · 四大扩展**（详细规程 `references/capabilities-pro.md`）\n\n| # | 能力 | 触发关键词 | 脚本 |\n|---|------|-----------|------|\n| 15 | PDF 智能压缩 | 压缩 / 压到xxMB / 缩小 | `pdf_compress.py` |\n| 16 | PDF 翻译（保留排版） | 翻译 / 翻成中文 / 双语对照 | —（规程执行） |\n| 17 | 合同智能审查 | 审查合同 / 合同体检 / 标风险 | —（规程执行） |\n| 18 | 发票/票据自动归档 | 归档发票 / 报销汇总 / 验真 | —（规程执行） |\n\n**第四层 · 七大壁垒**（详细规程 `references/capabilities-pro.md`）\n\n| # | 能力 | 触发关键词 | 脚本 |\n|---|------|-----------|------|\n| 19 | 电子签名与审批流 | 签名 / 电子签 / 批量盖章 / 审批流 | —（规程执行） |\n| 20 | 批量内容替换 | 批量替换 / 统一改价格 / 换Logo | `pdf_batch_replace.py` |\n| 21 | PDF 表单创建 | 生成表单 / 可填写PDF / 问卷转表单 | —（规程执行） |\n| 22 | 图纸精准测量 | 测量图纸 / 量尺寸 / 算面积 | —（规程执行） |\n| 23 | 翻页电子书制作 | 翻页书 / 电子书 / 手册转网页 | —（规程执行） |\n| 24 | 印刷级导出 | 印刷导出 / CMYK / 出血区 / 转曲 | —（规程执行） |\n| 25 | 密文级敏感信息删除 | 彻底删除 / 永久抹除 / 不是涂黑 | `pdf_redact.py` |\n\n---\n\n## 硬性约束\n\n| 约束项 | 限制 | 超限处理 |\n|--------|------|---------|\n| 单文件大小 | ≤100MB | 建议先压缩（#15）或拆分（#5） |\n| 单任务页数 | ≤200 页 | 引导用户指定页范围 |\n| OCR 单批 | ≤50 页 | 自动分批，批间报进度 |\n| 并发任务 | ≤3 | 排队并告知预计等待 |\n| 单任务超时 | 5 分钟 | 熔断，保留中间结果，报告已完成部分 |\n| 批量替换 | ≤500 文件/批 | 分批执行 |\n| 密文删除 | ≤200 文件/批 | 分批执行 |\n| 批量确认阈值 | >10 文件 | 必须先确认清单 |\n\n## 安全红线\n\n- **涉密文档**（用户声明或检测到密级标记）→ 全程本地模型，禁上云，详见 `references/security-compliance.md`\n- **密文删除（#25）与脱敏（#9）是不同操作**：#9 是遮盖可恢复，#25 是删除底层对象不可恢复，用户说\"涂黑/打码\"走 #9，说\"彻底/永久/真删\"走 #25，不得混用\n- **脱敏/删除前必须预览确认**，执行后必须验证扫描并出报告\n- 发票验真（#18）、电子签名（#19）依赖外部接口；接口不可用时明确告知\"未验真/无法律效力签名\"，不得伪造结果\n\n## 资源索引\n\n| 文件 | 何时读取 |\n|------|---------|\n| `references/capabilities-core.md` | 执行能力 1-5 前 |\n| `references/capabilities-value.md` | 执行能力 6-14 前 |\n| `references/capabilities-pro.md` | 执行能力 15-25 前 |\n| `references/few-shot-examples.md` | 意图路由拿不准时 |\n| `references/quality-standards.md` | 交付前自检 |\n| `references/error-handling.md` | 任何环节失败时 |\n| `references/security-compliance.md` | 涉密/脱敏/删除/签名任务前 |\n| `references/command-guide.md` | 用户问\"你能做什么\"时 |\n| `references/value-messaging.md` | 交付时取价值话术 |\n| `references/tech-spec.md` | 需要理解技术栈/管线细节时 |\n| `references/ocr-config.md` | OCR 任务调参或识别效果差时 |\n| `references/feishu-setup.md` | 飞书部署/联调/排障时 |\n\nFile v1.0.2:_meta.json\n\n{\n  \"ownerId\": \"kn7f0d8egkxsnntb67gq7hrxzd86cwz5\",\n  \"slug\": \"pdf-master\",\n  \"version\": \"1.0.2\",\n  \"publishedAt\": 1785059248716\n}\n\nFile v1.0.2:references/capabilities-core.md\n\n# 核心能力规程（#1-#5）\n\n> 执行对应能力前完整阅读本节。每项能力按「执行步骤 → 验收标准 → 常见坑」组织。\n> 交付话术见 `value-messaging.md`，通用质检项见 `quality-standards.md`。\n\n## 目录\n- [#1 PDF↔Office 高保真互转](#1-pdfoffice-高保真互转)\n- [#2 扫描件 OCR 精准识别](#2-扫描件-ocr-精准识别)\n- [#3 PDF 内直接编辑](#3-pdf-内直接编辑)\n- [#4 安全保护（加密/权限/水印）](#4-安全保护加密权限水印)\n- [#5 批量自动化处理](#5-批量自动化处理)\n\n---\n\n## #1 PDF↔Office 高保真互转\n\n**目标**：转换后排版还原度可编辑、可用，不是\"能打开就行\"。\n\n### 执行步骤\n\n1. `pdf_info.py` 检测文本层。扫描件 → 先走 #2 OCR 再转换，并告知用户多一步\n2. 按目标格式选管道：\n   - **PDF→Word**：首选 `scripts/pdf_convert.py`（pdf2docx）；复杂版面（多栏/嵌套表格/文本框密集）→ 走 LibreOffice 重建管道：`PDF → 提取元素 → 版面分析 → 生成原生 docx`\n   - **PDF→Excel**：只关心表格时直接用 #6 表格提取输出 xlsx；整页还原才走 pdf2docx 类管道\n   - **PDF→PPT**：一页一幻灯片，文本转文本框、图片原位嵌入；提醒用户 PPT 还原度天然低于 Word\n3. 转换后自检（见下），不合格项降级重试一次，仍不合格如实列入异常清单\n\n### 验收标准\n\n| 项 | 合格线 |\n|----|--------|\n| 字体匹配 | ≥90% 文本保持原字体或视觉近似字体 |\n| 表格 | 原生可编辑表格，非图片/文本框堆叠 |\n| 图片位置 | 偏移 ≤5px |\n| 页眉页脚 | 正确识别归位，不混入正文 |\n\n### 常见坑\n\n- 矢量图/SVG 元素转 Word 后变位图 → 提前告知\n- 特殊字体（企业定制字体）本机缺失 → 用视觉近似字体并在交付时说明\n- 竖排中文/日文 → pdf2docx 支持差，走 LibreOffice 管道\n\n---\n\n## #2 扫描件 OCR 精准识别\n\n**目标**：可搜索、可复制、表格可重建。参数调优必读 `ocr-config.md`。\n\n### 执行步骤\n\n1. 预处理：纠偏 → 去噪 → 二值化（手机拍照件加对比度增强）\n2. 引擎选择：中文/中英混排 → PaddleOCR；纯英文 → Tesseract 亦可；手写体 → PaddleOCR 手写模型\n3. 按用户要的输出形态执行：\n   - **可搜索 PDF**：`scripts/pdf_ocr.py`，原图上叠隐形文本层，版式零改动\n   - **纯文本**：按阅读顺序拼接，保留段落结构\n   - **表格→Excel**：表格区域单独走结构化识别，重建行列（合并单元格语义判断）\n4. 批量 >50 页自动分批，批间报进度\n\n### 验收标准\n\n| 项 | 合格线 |\n|----|--------|\n| 中文印刷体识别率 | >95%（抽 3 页人工比对关键字段） |\n| 金额/日期/编号 | 100% 复核（正则校验格式 + 抽样目检） |\n| 可搜索 PDF | 全文可搜索、可复制、选中位置准确 |\n\n### 常见坑\n\n- 公章覆盖文字 → 该区域识别率骤降，标注\"低置信区\"提醒用户核对\n- 低分辨率（<150dpi）→ 先超分辨率或明确告知识别率上限\n- 表格无框线 → 用坐标聚类重建，交付时附原页截图供比对\n\n---\n\n## #3 PDF 内直接编辑\n\n**目标**：改字、换图、增删页，不动整体排版。**不可逆操作，执行前必须预览确认。**\n\n### 执行步骤\n\n1. 备份原文件（`.bak`），任何编辑都在副本上进行\n2. 文本编辑：定位目标文本对象 → 以原字体/字号/颜色改写内容流；新文本比原文长 → 预警\"可能溢出/换行\"，给两种方案（缩字号容纳 / 接受换行）让用户选\n3. 图片替换：读取原图 bbox → 新图等比缩放到 bbox 内居中 → 保持原透明度/旋转\n4. 页面操作：插入/删除/旋转/调序，操作后重排页码引用（目录、书签、交叉引用）\n5. 生成修改前后对比预览图 → **用户确认后才交付正式文件**\n\n### 验收标准\n\n- 修改区域外零改动（diff 两版页面渲染图，仅目标区域有差异）\n- 新文本无溢出、无遮挡、无乱码（字体子集缺失时用嵌入字体并说明）\n\n### 常见坑\n\n- 扫描件\"改字\"：本质是修图不是改文本 → 告知用户走图像修复方案，效果上限先说清\n- 加密/签名过的 PDF：编辑会破坏签名 → 明确告知并让用户确认是否继续\n\n---\n\n## #4 安全保护（加密/权限/水印）\n\n### 执行步骤\n\n1. 明确需求组合：密码 / 权限 / 水印 / 过期失效，缺参数给默认值并确认\n2. 执行 `scripts/pdf_watermark.py`：\n   - 加密：AES-256，用户密码+所有者密码分离\n   - 权限粒度：禁止打印 / 禁止复制 / 禁止注释 / 禁止编辑，可组合\n   - 动态水印：支持变量 `{user_id}` `{date}` `{time}` `{custom}`，半透明（默认 15% 不透明度）、对角平铺整页、每页随机微偏移防批量裁剪\n3. 输出受保护文件 + 一页《保护配置说明》（列明启用项与密码传递方式——密码绝不与文件同渠道发送）\n\n### 验收标准\n\n- 用无密码方式打开 → 拒绝；用错误密码 → 拒绝\n- 权限项在主流阅读器（Adobe/WPS/浏览器）中生效验证\n- 水印在 100%-400% 缩放下可读、不遮挡正文关键信息\n\n### 常见坑\n\n- 权限控制是\"君子协定\"，流氓阅读器可绕过 → 必须如实告知用户，配合水印追溯才是完整方案\n- 水印遮挡公章/签名区 → 默认避开页面四角 15% 区域，或由用户指定避让区\n\n---\n\n## #5 批量自动化处理\n\n### 执行步骤\n\n1. 清点文件清单（数量、总页数、总大小），>10 个文件先确认再执行\n2. 按子能力选脚本：\n   - **合并**：`scripts/pdf_merge.py` —— 按文件名自然序或用户指定序；自动生成目录书签（每文件一章，取文件名/首页标题）\n   - **拆分**：`scripts/pdf_split.py` —— 支持按页范围 / 按书签 / 每 N 页一份；按内容拆分（如按章节标题）→ 先提取书签或标题模式再切\n   - **重命名**：从文档提取变量（标题/日期/编号）→ 模板如 `{date}_{title}_{no}` → **先输出新旧文件名对照表，确认后执行**\n   - **格式统一**：统一页面尺寸（A4/Letter）、页边距、页眉页脚\n3. 失败文件单独列出，不混入成功批次；保留原文件不动\n\n### 验收标准\n\n- 合并后：页数 = 各文件页数之和；目录书签可跳转且层级正确\n- 拆分后：各份页数正确、首页内容符合拆分规则\n- 重命名：对照表 100% 覆盖，无重名冲突（冲突自动加序号）\n\n### 常见坑\n\n- 文件名编码（GBK/UTF-8 混杂）→ 排序前统一规范化\n- 合并混有加密文件 → 单独列出，提示逐个提供密码\n- 扫描件无书签可拆 → 走 OCR 标题检测，置信度低的拆分点列出请用户确认\n\nFile v1.0.2:references/capabilities-pro.md\n\n# 扩展与壁垒能力规程（#15-#25）\n\n> 执行对应能力前完整阅读本节。交付话术见 `value-messaging.md`，通用质检项见 `quality-standards.md`。\n\n## 目录\n- [#15 PDF 智能压缩](#15-pdf-智能压缩)\n- [#16 PDF 翻译（保留排版）](#16-pdf-翻译保留排版)\n- [#17 合同智能审查](#17-合同智能审查)\n- [#18 发票/票据自动归档](#18-发票票据自动归档)\n- [#19 电子签名与审批流](#19-电子签名与审批流)\n- [#20 批量内容替换](#20-批量内容替换)\n- [#21 PDF 表单创建](#21-pdf-表单创建)\n- [#22 图纸精准测量](#22-图纸精准测量)\n- [#23 翻页电子书制作](#23-翻页电子书制作)\n- [#24 印刷级导出](#24-印刷级导出)\n- [#25 密文级敏感信息删除](#25-密文级敏感信息删除)\n\n---\n\n## #15 PDF 智能压缩\n\n### 执行步骤\n\n1. 确认目标：指定大小（\"压到10MB\"）/ 场景预设（微信≤100MB、邮件≤25MB）/ 质量预设（清晰度优先）\n2. 分层压缩策略（`scripts/pdf_compress.py` 内置）：文字/矢量 → 无损保留；彩色图片 → JPEG 降采样（默认 150dpi/q70）；扫描页 → 可选转 JBIG2 思路的位图优化；嵌入字体子集化；清理冗余对象\n3. 目标大小模式：迭代降质直到 ≤ 目标值，每轮报参数；**设质量地板**（dpi 不低于 96、q 不低于 40），触底仍超 → 报告\"极限压缩到 X MB\"，由用户决定是否接受更低画质\n4. 输出压缩前后对比：大小、 dpi、关键页局部放大图（公章/签名/小字号区）\n\n### 验收标准\n\n- 文字区域：放大 200% 无模糊（文字未参与有损压缩）\n- 公章/签名/二维码可辨认、可扫描\n- 线条图无肉眼可见锯齿；页数与内容零丢失\n\n---\n\n## #16 PDF 翻译（保留排版）\n\n### 执行步骤\n\n1. 确认：目标语言 / 输出形态（纯译文 / 双语对照：左右、上下、段内三选一）/ 术语表（内置行业库或用户自定义）\n2. 段落级提取（保留每段坐标、字号、字体粗细）→ 术语库预替换 → 调用翻译 → 译段回写原坐标\n3. 排版回写规则：译文超长 → 先缩字号（最小到原 80%）→ 再允许换行扩框；CJK 与拉丁混排注意字距；图表内文字走图像文本替换\n4. 生成《术语对照表》附交付\n\n### 验收标准\n\n- 排版保留：版面结构、表格、图片位置与原文件一致（渲染图 diff 仅文字区域有差异）\n- 术语准确率 ≥95%（对照术语表全量核验）；无漏译段落\n- 双语版原文/译文逐段可对应\n\n### 常见坑\n\n- 德/俄语译文平均膨胀 30% → 提前告知可能换行\n- 扫描件 → 先 OCR 出文本层再翻译，告知多一步\n- 公式/代码块不翻译，原位保留\n\n---\n\n## #17 合同智能审查\n\n### 执行步骤\n\n1. 确认审查立场（甲方/乙方/中立）与合同类型（采购/销售/劳动/合作/租赁），立场不同风险取向不同\n2. 风险条款识别（六大类）：自动续约 / 天价违约金 / 权利义务不对等 / 模糊表述 / 知识产权归属 / 数据隐私与保密\n3. 输出《审查报告》固定结构：\n   - `风险总览`（🔴高危/🟡中危/🟢低危 计数 + 一句话结论）\n   - `逐条明细`：条款原文 → 页码定位 → 风险等级 → 风险解释 → 法律依据 → 修改建议（给出可直接替换的条款文本）\n   - `缺失条款提醒`（该类合同应有而未有的条款）\n4. 高亮标注版 PDF 一并交付\n5. **免责边界**：报告结尾固定声明\"本审查为 AI 辅助初筛，不替代执业律师意见；高危条款建议法务复核\"\n\n### 验收标准\n\n- 六大类风险逐类扫描覆盖，无整类遗漏\n- 每条风险有原文引用+页码，可点击核验；修改建议具体可执行，不说空话\n\n---\n\n## #18 发票/票据自动归档\n\n### 执行步骤\n\n1. 批量 OCR（发票专用模型）：提取发票代码、号码、开票日期、金额、税额、价税合计、购买方/销售方名称与税号、发票类型\n2. 验真：对接税务验真接口 → 逐张标记 真票/假票/作废/查无此票；**接口不可用时如实标记\"未验真\"，严禁伪造验真结果**\n3. 去重：发票代码+号码哈希；重复张列出对照\n4. 输出：Excel 汇总表（按员工/部门/项目分类）+ 报销单 + 归档包（按 年/月 目录结构化重命名发票文件）\n5. 异常清单：识别失败、验真异常、疑似连号/大额，单独列出\n\n### 验收标准\n\n- 关键字段（号码/日期/价税合计）识别率 ≥98%，金额字段全量正则校验\n- 验真状态逐张有结果（含\"未验真\"状态）；去重 0 误杀（号码不同不判重）\n\n---\n\n## #19 电子签名与审批流\n\n### 执行步骤\n\n1. 确认场景：单份签 / 批量盖章 / 多级审批流；确认签署方与顺序\n2. 法律有效性路径：CA 数字证书签名（符合《电子签名法》第十三条）；**无 CA 环境时只能做\"图片章+留痕\"**，必须明确告知法律效力差异\n3. 批量盖章：AI 定位签署区（\"签字/盖章/甲方（盖章）\"关键词+版式特征）→ 预览定位结果（逐份缩略图标出落章位置）→ 用户确认 → 批量执行，位置精度 ±2mm\n4. 审批流引擎：顺序/并行/会签/条件分支；前级未签自动锁后级；每步记录 时间/IP/设备/证书编号 → 不可篡改审计日志\n5. 签署完成后：文件哈希存证；任何后续修改会破坏签名并触发报警\n6. 进度查询与签名验证作为子命令支持\n\n### 验收标准\n\n- 落章位置预览确认率 100%（未确认不执行）\n- 审计日志逐步完整；签名验证报告可独立出具\n- 法律效力表述准确：CA 证书签 vs 图片章，绝不混称\n\n---\n\n## #20 批量内容替换\n\n> 不可逆操作。备份 → 预览 → 确认 → 执行 → 报告，五步缺一不可。\n\n### 执行步骤\n\n1. 规则确认：精确匹配 / 正则 / 图片哈希（换 Logo）；多规则可同时下发\n2. `scripts/pdf_batch_replace.py --dry-run` 生成《差异预览》：每文件命中位置、原文→新文、标记\"可疑替换\"（命中在表格/页眉/图片内等非常规区）\n3. **用户确认后执行**：自动备份原件 → 批量替换（≤500/批）→ 失败文件单独列出\n4. 《替换报告》：成功/失败/跳过计数、每文件命中数、备份位置、回滚指令\n5. 回滚：`--rollback` 从备份恢复\n\n### 验收标准\n\n- 预览命中率与执行结果一致；无误替换（可疑替换已逐一确认）\n- 替换区域外零改动；失败文件原件完好\n\n---\n\n## #21 PDF 表单创建\n\n### 执行步骤\n\n1. 字段检测：从 Word/PDF/图片识别填写区（下划线、\"姓名：____\"、空白框）→ 智能判型（文本/日期/数字/单选/复选/下拉/签名）\n2. 生成《字段清单表》（名称/类型/校验规则/必填）→ 用户确认或修改\n3. 高级功能按需：自动计算（数量×单价=小计）/ 字段联动（选\"已婚\"显示配偶信息）/ 数据验证（手机号/身份证正则）/ 下拉选项从 Excel 导入\n4. 数据收集：在线收集需求 → 生成填写链接/二维码 + 多维表格实时汇总（飞书流程见 `feishu-setup.md`）；纯 PDF 表单 → 交付可填写 PDF 并说明数据回收方式\n5. 交付前自测：逐字段试填、计算验算、联动触发、校验拦截各跑一遍\n\n### 验收标准\n\n- 字段类型判断准确率 ≥90%（用户确认环节兜底）\n- 计算公式验算正确；联动与校验逻辑全部实测通过\n\n---\n\n## #22 图纸精准测量\n\n### 执行步骤\n\n1. 比例尺校准：识别图上\"1:100\"类标注 → 无标注时要求用户提供一个已知尺寸反推；多比例尺分区图分别校准\n2. 测量：距离（两点）/ 面积（闭合区域）/ 角度 / 坐标；结果 = 图上距离 × 比例尺\n3. 标注：测量值带引线标注在图纸副本上（原件不动）\n4. 批量测量：框选多个区域 → 输出 Excel 测量数据表（区域名/测量类型/数值/单位）\n5. **精度声明**：PDF 矢量图可达毫米级；扫描件受分辨率限制，交付时注明误差范围\n\n### 验收标准\n\n- 比例尺校准用图上已知尺寸复核（误差 <2%）\n- 测量值单位、比例标注齐全；标注不遮挡图元\n\n---\n\n## #23 翻页电子书制作\n\n### 执行步骤\n\n1. 输出形态确认：在线链接 / 离线 HTML 包 / 嵌入官网 iframe 代码\n2. 制作：HTML5 Canvas 拟真翻页（30fps，拖拽/点击/键盘/滚轮）；移动端单页自适应、平板双页、桌面全屏\n3. 增强按需：目录导航（取 PDF 书签）/ 全文搜索高亮 / 热点链接 / 分享控制（允许下载 vs 仅在线读）\n4. 交付前真机自测：手机/平板/桌面各翻一遍，检查加载速度与变形\n5. 图片质量：页面渲染 ≥150dpi，移动端懒加载\n\n### 验收标准\n\n- 三端展示无变形、无模糊；翻页流畅\n- 目录可跳转、搜索可命中（如启用）；离线包断网可用\n\n---\n\n## #24 印刷级导出\n\n### 执行步骤\n\n1. 确认印刷要求：色彩标准（FOGRA39/Japan Color/厂方 ICC）/ 出血（默认 3mm）/ 交付标准（PDF/X-1a 或 PDF/X-4）\n2. 印刷预检（先出《预检报告》）：RGB 对象清单 / 低于 300dpi 图片清单 / 未嵌入字体清单 / 叠印与细线（<0.25pt）风险\n3. 转换执行：RGB→CMYK（指定 ICC）/ 出血区自动外扩（内容延展非简单拉边）/ 文字转曲 / 输出 PDF/X\n4. 手机阅读优化（子能力）：流式单栏重排 / 图片自适应点击看原图 / 暗色模式 / EPUB 或 HTML5 导出\n5. 交付：印刷级文件 + 预检报告（遗留风险逐项列出）\n\n### 验收标准\n\n- 输出通过 PDF/X 验证器校验；全文无 RGB 残留（转曲/图片除外已声明）\n- 出血区连续无白边；图片全部 ≥300dpi 或已列入风险清单\n- 手机版重排后无横向滚动条、文字可搜索（EPUB 流式）\n\n---\n\n## #25 密文级敏感信息删除\n\n> 最高风险操作。执行前必读 `security-compliance.md`。与 #9 脱敏的本质区别：#25 删除底层对象不可恢复。\n\n### 执行步骤\n\n1. 规则确认：预设类型（身份证/银行卡/手机/邮箱）/ 自定义正则 / 指定区域 / 图片内敏感区\n2. `scripts/pdf_redact.py --scan` 生成《删除预览》：每处命中类型/页码/内容遮蔽对照 → **用户明确确认**\n3. 真删执行：定位文本对象 → 内容流移除绘制指令 → 同步清理字体引用/编码映射；图片内敏感区 → 图像修复（inpainting）抹除非打码\n4. 彻底性验证（自动）：pdfplumber+PyMuPDF 双引擎全文提取扫描 → 0 命中；正则二次扫描 → 0 命中\n5. 出具《删除证书》（PDF/A）：删除时间/操作人/规则/命中数/验证结果/文件哈希，嵌入 PDF 元数据\n6. 批量 ≤200 文件/批；逐份出证\n\n### 验收标准\n\n- 双引擎提取扫描 + 正则扫描 0 命中（附扫描日志）\n- 证书要素齐全、可第三方审计；非目标内容零损伤\n\nFile v1.0.2:references/capabilities-value.md\n\n# 增值能力规程（#6-#14）\n\n> 执行对应能力前完整阅读本节。交付话术见 `value-messaging.md`，通用质检项见 `quality-standards.md`。\n\n## 目录\n- [#6 表格精准提取](#6-表格精准提取)\n- [#7 图文混排解析](#7-图文混排解析)\n- [#8 智能摘要](#8-智能摘要)\n- [#9 自动脱敏](#9-自动脱敏)\n- [#10 元数据清洗](#10-元数据清洗)\n- [#11 名称/编号自动化](#11-名称编号自动化)\n- [#12 两版差异对比](#12-两版差异对比)\n- [#13 文档即问即答](#13-文档即问即答)\n- [#14 规格参数对比矩阵](#14-规格参数对比矩阵)\n\n---\n\n## #6 表格精准提取\n\n### 执行步骤\n\n1. `pdf_info.py` 判文本层：文本型 → pdfplumber 坐标提取；扫描型 → 先 #2 OCR 表格模式\n2. 运行 `scripts/pdf_extract_tables.py`，逐页检测表格区域\n3. 难点对策（按 `tech-spec.md` 表格识别章）：合并单元格 → 形态学+语义判断；无框线 → 坐标聚类；跨页表 → 表头重复模式自动拼接；嵌套表 → 递归子区域\n4. 输出：CSV（单表）/ xlsx（多表多 sheet）/ 飞书多维表格（用户指定时，流程见 `feishu-setup.md`）\n5. **数值列校验**：金额/数量列做正则与合计勾稽，异常值标黄并报告\n\n### 验收标准\n\n- 表格检出：逐页目检无遗漏（漏检是最大事故）\n- 行列结构与原表一致，合并单元格还原正确\n- 数值与原文件逐列抽核 ≥10% 行数，零误差\n\n---\n\n## #7 图文混排解析\n\n### 执行步骤\n\n1. 版面分析：识别标题/正文/列表/表格/图片/图注/页眉页脚区域与阅读顺序（多栏文档按栏序）\n2. 输出 Markdown：标题层级、列表、加粗等语义保留；图片提取为文件并在文中原位引用；表格转 Markdown 或 CSV 引用\n3. 图表（chart）类图片：附一句内容描述（\"图3：2021-2025 出货量柱状图，峰值在 2024\"）\n\n### 验收标准\n\n- 阅读顺序正确（多栏不错序、跨页段落正确衔接）\n- 图片零丢失，引用位置与原版面一致\n- 页眉页脚/页码已剥离，不混入正文\n\n---\n\n## #8 智能摘要\n\n### 执行步骤\n\n1. 确认摘要形态：要点式（默认）/ 段落式 / 一页纸；确认长度（默认 ≤500 字或全文 5%）\n2. 长文（>100 页）分章摘要再归并，避免截断 bias\n3. 输出结构：`核心结论（3 条以内）→ 分章要点 → 关键数据/日期/人名清单`\n4. 每个要点标注来源页码\n\n### 验收标准\n\n- 关键数据（金额、日期、比例）与原文逐一核对零误差\n- 无原文之外的推断；推断性内容必须标注\"（推断）\"\n- 页码引用可跳转核验\n\n---\n\n## #9 自动脱敏\n\n> ⚠️ 脱敏 = 遮盖，底层可恢复。用户要\"彻底/永久删除\"→ 路由 #25。两者的区别必须在交付时说清。涉密任务前读 `security-compliance.md`。\n\n### 执行步骤\n\n1. 识别敏感项：身份证 / 手机 / 银行卡 / 邮箱 / 姓名 / 地址 / 自定义关键词（用户可提供清单）\n2. 生成《脱敏预览报告》：每处敏感项的类型、页码、遮蔽前后对照 → **用户确认后执行**\n3. 执行遮盖（黑色矩形覆盖+同步移除可见文本，但底层对象保留）\n4. 交付脱敏文件 + 预览报告存档\n\n### 验收标准\n\n- 规则覆盖项 0 漏网（二次正则全文扫描验证）\n- 遮盖不越界（不伤及相邻非敏感文字）\n\n---\n\n## #10 元数据清洗\n\n### 执行步骤\n\n1. `scripts/pdf_info.py --meta` 导出全部元数据与 XML 扩展信息，列给用户看有什么\n2. 清洗项：作者 / 最后修改者 / 创建工具 / 修改历史 / 缩略图 / 嵌入文件 / JavaScript / 审阅批注\n3. 执行 `scripts/pdf_info.py --scrub`，清洗后再次导出元数据对比验证\n\n### 验收标准\n\n- 清洗后元数据字段为空或默认值；XMP 包、嵌入附件、隐藏图层同步清除\n- 正文内容零改动\n\n---\n\n## #11 名称/编号自动化\n\n### 执行步骤\n\n1. 与用户确认命名模板：`{date}_{title}_{no}` 之类；可用变量：文档标题/首页日期/检测到的编号/原文件名/序号\n2. 逐文件提取变量 → 生成《新旧文件名对照表》→ **确认后批量重命名**\n3. 非法字符（`\\/:*?\"<>|`）自动替换为 `-`；重名自动加 `(2)` `(3)`\n\n### 验收标准\n\n- 对照表 100% 覆盖所有文件，变量提取失败的文件单独列出人工命名\n- 无重名、无非法字符\n\n---\n\n## #12 两版差异对比\n\n### 执行步骤\n\n1. 双通道对比：文本 diff（逐段对齐）+ 视觉 diff（页面渲染图像素级比对）\n2. 差异分类：新增 / 删除 / 修改 / 格式变化 / 图片变化 / 页面增删\n3. 输出《差异报告》：差异清单（页码+原文→新文+分类）+ 高亮标注版 PDF（新增绿、删除红、修改黄）\n4. 合同场景联动：差异落在关键条款（价格/期限/违约/知识产权）时，额外风险提示（对接 #17 规则）\n\n### 验收标准\n\n- 文本差异 0 漏报（随机抽 3 处未标记区域复核无差异）\n- 差异分类准确；纯格式变化与实质内容变化分开统计\n\n---\n\n## #13 文档即问即答\n\n### 执行步骤\n\n1. 建索引：解析 → 按语义切片（300-500 字/片，保留页码元数据）→ Embedding → 向量库（Chroma/FAISS）\n2. 回答：检索 Top-K 片段 → 生成答案 → **每条结论附页码引用**\n3. 检索无结果 → 明确说\"文档中未找到相关信息\"，不得编造\n4. 多轮追问保持会话内索引复用；涉密文档走本地模型（见 `security-compliance.md`）\n\n### 验收标准\n\n- 答案每个事实点都有页码；页码真实可核\n- 数值类答案与原文一致（金额、参数、日期）\n\n---\n\n## #14 规格参数对比矩阵\n\n### 执行步骤\n\n1. 逐文档提取规格区块（参数表、特性列表、技术指标），扫描件先 OCR\n2. 参数归一化：同义参数合并（\"亮度/Brightness/ cd/m² 亮度\"）、单位统一（ms=毫秒、inch=英寸换算标注）、缺失标 `—`\n3. 输出对比矩阵：行=参数项，列=各文档；差异显著项（数值差 >20% 或有无差异）高亮\n4. 附《参数来源表》：每个单元格值标注来源文档+页码\n\n### 验收标准\n\n- 参数归一化无张冠李戴（抽查每列 5 个参数回原文核对）\n- 矩阵覆盖所有文档的全部规格项，无静默丢弃\n\nFile v1.0.2:references/command-guide.md\n\n# 命令速查手册\n\n> 用户问\"你能做什么\"时，按本文件展示。能力编号与 SKILL.md 路由总表一致（1-25 连续编号）。\n\n## 触发方式\n\n- 飞书 @机器人 + 上传 PDF + 文字指令\n- 群聊中 @机器人并附文件；单聊直接发文件+指令\n\n---\n\n## 第一层 · 五大核心（#1-#5）\n\n### #1 PDF↔Office 高保真互转\n\n| 你想做什么 | 指令示例 | 输出 |\n|-----------|---------|------|\n| PDF 转 Word（保持格式） | \"转Word\" / \"转成可编辑文档\" | .docx |\n| PDF 转 Excel（表格可编辑） | \"转Excel\" / \"表格转成Excel\" | .xlsx |\n| PDF 转 PPT | \"转PPT\" / \"转成幻灯片\" | .pptx |\n\n### #2 扫描件 OCR 精准识别\n\n| 你想做什么 | 指令示例 | 输出 |\n|-----------|---------|------|\n| 扫描件转可搜索PDF | \"OCR识别\" / \"扫描件转文字\" | 可搜索PDF |\n| 发票/单据识别汇总 | \"识别这叠发票\" / \"发票汇总到表格\" | Excel汇总表 |\n| 手写体识别 | \"识别手写单据\" | 文本 |\n\n### #3 PDF 内直接编辑\n\n| 你想做什么 | 指令示例 | 输出 |\n|-----------|---------|------|\n| 修改PDF内文字 | \"改第3页的价格\" / \"把'乙方'改成'甲方'\" | 编辑后PDF |\n| 替换PDF内图片 | \"替换第5页的产品图\" | 编辑后PDF |\n| 插入/删除页面 | \"在第10页后插入新页\" | 编辑后PDF |\n\n### #4 安全保护（加密/水印/权限）\n\n| 你想做什么 | 指令示例 | 输出 |\n|-----------|---------|------|\n| 加密+密码 | \"加密\" / \"设密码\" | 加密PDF |\n| 动态水印 | \"加水印\" / \"带工号水印\" | 带水印PDF |\n| 禁止打印/复制 | \"禁止打印\" / \"只读不能复制\" | 受保护PDF |\n\n### #5 批量自动化处理\n\n| 你想做什么 | 指令示例 | 输出 |\n|-----------|---------|------|\n| 批量合并 | \"合并这20个PDF\" / \"合并成手册\" | 合并PDF（带目录书签） |\n| 按规则拆分 | \"按章节拆分\" / \"每50页拆一份\" | 多个PDF |\n| 批量重命名 | \"按日期重命名\" | 重命名后的文件 |\n\n---\n\n## 第二层 · 九大增值（#6-#14）\n\n| # | 你想做什么 | 指令示例 | 输出 |\n|---|-----------|---------|------|\n| 6 | 提取表格 | \"提取表格\" / \"表格转Excel\" | CSV / Excel / 飞书多维表格 |\n| 7 | 图文解析 | \"提取图文\" / \"解析成Markdown\" | Markdown + 图片包 |\n| 8 | 智能摘要 | \"摘要\" / \"提炼重点\" | 要点摘要（附页码） |\n| 9 | 自动脱敏 | \"脱敏处理\" / \"隐藏敏感信息\" | 脱敏后PDF |\n| 10 | 元数据清洗 | \"擦除痕迹\" / \"去掉作者信息\" | 干净PDF |\n| 11 | 自动命名 | \"按日期重命名\" / \"自动命名\" | 新旧名对照表+重命名文件 |\n| 12 | 版本对比 | \"对比两版差异\" / \"diff\" | 差异报告+高亮PDF |\n| 13 | 文档问答 | \"这份文档说了什么\" / \"参数是多少\" | 答案（附页码引用） |\n| 14 | 规格对比 | \"对比两份规格书的参数\" | 对比矩阵表格 |\n\n---\n\n## 第三层 · 四大扩展（#15-#18）\n\n### #15 PDF 智能压缩\n\n| 你想做什么 | 指令示例 | 输出 |\n|-----------|---------|------|\n| 压缩到指定大小 | \"压缩到10MB以下\" / \"压到20MB\" | 压缩后PDF |\n| 微信/邮件适配 | \"微信传不了帮我压一下\" | 压缩后PDF |\n\n### #16 PDF 翻译（保留排版）\n\n| 你想做什么 | 指令示例 | 输出 |\n|-----------|---------|------|\n| 翻译成中文 | \"翻译成中文\" / \"翻成中文保留格式\" | 翻译后PDF |\n| 双语对照 | \"双语对照翻译\" | 双语PDF |\n| 术语表翻译 | \"用我司术语表翻译\" | 翻译后PDF+术语对照表 |\n\n### #17 合同智能审查\n\n| 你想做什么 | 指令示例 | 输出 |\n|-----------|---------|------|\n| 全面审查 | \"审查这份合同的风险\" / \"合同体检\" | 审查报告+高亮PDF |\n| 立场审查 | \"站在乙方角度标出不利条款\" | 审查报告 |\n\n### #18 发票/票据自动归档\n\n| 你想做什么 | 指令示例 | 输出 |\n|-----------|---------|------|\n| 归档+验真 | \"归档这叠发票\" / \"发票验真归档\" | Excel+归档包 |\n| 报销汇总 | \"生成报销单\" | Excel报销单 |\n| 验真去重 | \"查重复发票\" | 验真结果表 |\n\n---\n\n## 第四层 · 七大壁垒（#19-#25）\n\n### #19 电子签名与审批流\n\n| 你想做什么 | 指令示例 | 输出 |\n|-----------|---------|------|\n| 单份电子签名 | \"给这份合同加电子签名\" | 签名后PDF |\n| 批量盖章 | \"批量盖章这200份报价单\" | 盖章后PDF集合 |\n| 审批流 | \"设置审批流：法务→财务→CEO\" | 流程配置+签名邀请 |\n| 查进度/验签 | \"查签署进度\" / \"验证签名\" | 进度/验证报告 |\n\n### #20 批量内容替换\n\n| 你想做什么 | 指令示例 | 输出 |\n|-----------|---------|------|\n| 批量改价格 | \"200份报价单1999改成2199\" | 替换后PDF+报告 |\n| 统一改地址电话 | \"统一改成新地址和电话\" | 替换后PDF集合 |\n| 批量换Logo | \"旧Logo换成新的\" | 替换后PDF集合 |\n| 预览差异 | \"先预览差异再执行\" | 差异预览报告 |\n\n### #21 PDF 表单创建\n\n| 你想做什么 | 指令示例 | 输出 |\n|-----------|---------|------|\n| 问卷转表单 | \"把这个问卷做成可填写的PDF\" | 可填写PDF |\n| 自动计算 | \"加自动计算：数量×单价=总价\" | 含计算PDF |\n| 字段联动 | \"选了已婚才显示配偶信息\" | 含联动PDF |\n| 数据收集 | \"收集表单数据到表格\" | 链接/二维码+多维表格 |\n\n### #22 图纸精准测量\n\n| 你想做什么 | 指令示例 | 输出 |\n|-----------|---------|------|\n| 量距离 | \"量一下这两堵墙的距离\" | 标注后PDF |\n| 算面积 | \"算这个会议室的面积\" | 标注PDF+数据表 |\n| 批量测量 | \"批量测量所有房间面积\" | Excel测量数据表 |\n\n### #23 翻页电子书制作\n\n| 你想做什么 | 指令示例 | 输出 |\n|-----------|---------|------|\n| 做翻页书 | \"做成翻页电子书\" / \"手册转网页版\" | 在线链接+离线包 |\n| 嵌入官网 | \"生成嵌入代码\" | iframe代码+链接 |\n| 加搜索 | \"要能搜索关键词\" | 增强版电子书 |\n\n### #24 印刷级导出\n\n| 你想做什么 | 指令示例 | 输出 |\n|-----------|---------|------|\n| 印刷预检导出 | \"导出印刷版\" / \"印刷厂要CMYK\" | 印刷级PDF+预检报告 |\n| 加出血区 | \"加3mm出血\" | 带出血区PDF |\n| 文字转曲 | \"文字转曲防缺字\" | 转曲后PDF |\n| 手机优化 | \"转手机阅读版\" | 优化版PDF/EPUB |\n\n### #25 密文级敏感信息删除\n\n| 你想做什么 | 指令示例 | 输出 |\n|-----------|---------|------|\n| 彻底删除隐私 | \"彻底删除身份证号\" / \"永久抹除\" | 安全删除PDF+删除证书 |\n| 批量删除 | \"批量删除敏感信息\" / \"不是涂黑是真删\" | 删除后PDF集合+证书 |\n| 删除验证 | \"检查还有残留吗\" | 验证报告 |\n\n---\n\n## 复合指令示例（能力链）\n\n```\n@万能PDF大师 帮我处理这100份测试报告：按日期重命名，然后合并成一本带目录的手册。\n→ #11 重命名 → #5 合并\n```\n\n```\n@万能PDF大师 这份扫描件合同80MB微信发不了，压到20MB以下，文字必须清楚。\n→ #2 OCR检测（如需）→ #15 目标压缩\n```\n\n```\n@万能PDF大师 这份50页英文Datasheet翻译成中文，保留排版，术语要准。\n→ #16（内置术语库，交付附术语对照表）\n```\n\n```\n@万能PDF大师 这份招标文件要公开，投标方报价和联系方式彻底删除，不是涂黑。\n→ #25（预览→确认→真删→双引擎验证→删除证书）\n```\n\n```\n@万能PDF大师 新旧两版合同对比一下，重点看价格和违约条款变了没。\n→ #12 差异对比 → 关键条款联动 #17 风险提示\n```\n\n---\n\n## 系统反馈提示词库\n\n- ⏳ \"正在解析第 3/20 页…\"\n- 🔍 \"OCR识别中，预计还需30秒…\"\n- ✅ \"表格提取完成，正在生成多维表格…\"\n- ⚠️ \"检测到扫描件，已自动调用OCR引擎…\"\n- 🛡️ \"敏感内容预览已生成，请确认后执行\"\n- 🔴 \"以下文件处理失败：…原件未受影响，详见失败清单\"\n\nFile v1.0.2:references/error-handling.md\n\n# 错误处理与降级策略\n\n> 任何环节失败时阅读。**三条铁律：不静默失败、不伪造结果、原件不受损。**\n\n## 目录\n- [总原则](#总原则)\n- [通用降级链](#通用降级链)\n- [分场景处理](#分场景处理)\n- [熔断与超时](#熔断与超时)\n- [失败报告模板](#失败报告模板)\n\n---\n\n## 总原则\n\n1. **不静默失败**：失败必须显式告知，含原因、影响范围、建议动作\n2. **不伪造结果**：外部接口（验真/CA/翻译）不可用 → 标注\"未完成该步\"，绝不编造\n3. **原件不受损**：所有写操作在副本进行；批量任务失败文件单独隔离，不混入成功批次\n4. **降级优于终止**：有降级路径先降级并告知质量差异，无降级才终止\n\n## 通用降级链\n\n```\n首选方案失败\n  ↓ 记录失败原因\n降级方案执行（质量差异必须告知）\n  ↓ 仍失败\n部分交付：已完成部分先给 + 失败清单 + 重试建议\n  ↓ 完全无法执行\n明确终止：原因 + 用户可采取的替代动作\n```\n\n## 分场景处理\n\n### 输入类\n| 场景 | 处理 |\n|------|------|\n| 文件损坏/打不开 | 尝试修复（pikepdf/qpdf 修复模式）→ 失败则告知重发 |\n| 加密无密码 | 索要密码（\"回复 密码:xxx\"）；明确密码不留存 |\n| 超限（100MB/200页） | 给出具体瘦身路径（先压缩/指定页范围），不只说\"太大\" |\n| 非 PDF 文件 | 说明支持范围；Word/图片可引导先转 PDF |\n| 扫描件质量过差（<100dpi） | 告知识别率上限，请用户提供更清晰版本 |\n\n### 处理类\n| 场景 | 处理 |\n|------|------|\n| PaddleOCR 环境异常 | 降级 Tesseract，告知中文识别率下降（ocr-config.md 决策树） |\n| pdf2docx 转换排版崩 | 降级 LibreOffice 重建管道 → 再降级渲染图+文本层流式 docx |\n| 压缩触底仍超标 | 报告极限值（\"已压到 23MB，继续将损伤文字\"），用户裁决 |\n| 表格检出疑似遗漏 | 二次检测（换检测算法）；仍有疑区列入人工核对清单 |\n| 翻译后排版溢出 | 缩字号(→80%)→换行扩框→双语对照改上下式，逐级处理 |\n| 批量替换部分失败 | 成功批次先交付+失败清单；备份完整可回滚 |\n\n### 外部依赖类\n| 场景 | 处理 |\n|------|------|\n| 发票验真接口不可用 | 逐张标\"未验真\"+接口状态说明+稍后重验指引 |\n| CA 签名服务不可用 | 改图片章方案必须声明无法律效力，用户确认才执行 |\n| 翻译接口超时 | 分段重试 → 仍失败交付已译部分+未译页清单 |\n| 飞书上传失败 | 本地保留结果，重试 3 次；失败给备用取件方式 |\n| 本地模型不可用（涉密任务） | **终止并说明**，不得为完成任务转云端 |\n\n## 熔断与超时\n\n- 单任务 5 分钟硬熔断：保存中间结果 → 报告\"已完成 X/Y\"+续作方式（\"回复'继续'从断点续作\"）\n- OCR 单批 50 页限：批间检查点持久化，熔断后从最近检查点恢复\n- 并发 3 满：新任务排队，告知位次与预计等待\n\n## 失败报告模板\n\n```\n🔴 部分完成 / ⚠️ 已降级 / ❌ 失败\n\n任务：{能力# + 指令摘要}\n结果：成功 {n} / 失败 {m} / 跳过 {k}\n\n失败清单：\n| 文件/页 | 原因 | 建议 |\n| xx.pdf | 加密未提供密码 | 回复\"密码:xxx\"后重试 |\n\n降级说明：{用了什么降级方案，质量差异是什么}\n原件状态：未受影响 / 已备份于 {路径}\n```\n\nFile v1.0.2:references/feishu-setup.md\n\n# 飞书集成配置\n\n> 部署、联调、飞书侧排障时阅读。\n\n## 目录\n- [前置要求](#前置要求)\n- [事件订阅](#事件订阅配置)\n- [文件处理流程](#文件处理流程)\n- [消息卡片模板](#进度反馈消息格式)\n- [多维表格输出](#多维表格输出)\n- [单聊 vs 群聊](#单聊-vs-群聊)\n- [幂等与临时文件](#幂等与临时文件)\n- [错误处理](#错误处理)\n\n---\n\n## 前置要求\n\n1. 飞书机器人已创建并获取 `app_id` / `app_secret`\n2. 机器人已加入目标群聊 / 已开通单聊权限\n3. 开通以下权限：\n\n| 权限 | 用途 |\n|------|------|\n| `im:message:send` | 发送结果消息 |\n| `im:message` | 读取用户指令 |\n| `im:file:read` | 下载用户上传的 PDF |\n| `im:file:write` | 回传结果文件 |\n| `drive:file:read` | 读取云文档附件 |\n| `bitable:app:create` | 创建多维表格 |\n| `bitable:app:read` / `bitable:app:write` | 写入提取数据 |\n\n## 事件订阅配置\n\n- `im.message.receive_v1` — 收到消息（含文件），唯一必需事件\n- 可选：`im.message.message_read_v1`（进度卡片已读回执）\n\n## 文件处理流程\n\n```\n用户上传PDF → 飞书消息事件（含 file_key + message_id）\n    ↓\nBot 下载文件（file_key → 临时路径）\n    ↓\npdf_info.py 检测（类型/页数/加密）\n    ↓\n解析用户指令 → 路由能力（SKILL.md 路由表）\n    ↓\n执行处理（进度实时推送）→ 生成结果\n    ↓\n上传飞书（消息/文件/多维表格）\n    ↓\n清理临时文件（成功/失败都清理）\n```\n\n## 进度反馈消息格式\n\n进度卡片（interactive）：\n\n```json\n{\n  \"msg_type\": \"interactive\",\n  \"card\": {\n    \"config\": { \"wide_screen_mode\": true },\n    \"header\": { \"title\": { \"tag\": \"plain_text\", \"content\": \"⏳ 正在处理 PDF\" }, \"template\": \"blue\" },\n    \"elements\": [\n      { \"tag\": \"markdown\", \"content\": \"已解析：8/20 页\\n预计剩余：30 秒\" }\n    ]\n  }\n}\n```\n\n交付卡片模板（header.template 按结果变色：成功 green / 部分失败 orange / 失败 red）：\n\n```json\n{\n  \"msg_type\": \"interactive\",\n  \"card\": {\n    \"header\": { \"title\": { \"tag\": \"plain_text\", \"content\": \"✅ 转换完成\" }, \"template\": \"green\" },\n    \"elements\": [\n      { \"tag\": \"markdown\", \"content\": \"**质检**：表格 12 个全部原生可编辑，图片偏移 <5px\\n**异常**：无\\n💡 手动重排约需 2-3 小时，本次耗时 48 秒\" }\n    ]\n  }\n}\n```\n\n## 多维表格输出\n\n表格提取/发票归档结果写入多维表格：\n\n1. `feishu_bitable_app` 创建 App（命名：`PDF提取_{文件名}_{日期}`）\n2. `feishu_bitable_app_table` 创建数据表（字段类型映射：金额→数字、日期→日期、其余→文本）\n3. `feishu_bitable_app_table_record` 批量写入（单批 ≤500 条，分批提交）\n4. 返回表格链接 + 字段说明给用户\n\n## 单聊 vs 群聊\n\n- **单聊**：直接处理并返回结果\n- **群聊**：@机器人时处理，普通消息忽略；结果默认群里回复，涉密内容提示\"已私聊发送\"\n\n## 幂等与临时文件\n\n- 以 `message_id + file_key` 为幂等键：同一文件同一指令重复触发 → 直接返回缓存结果，不重复执行\n- 临时文件生命周期：任务结束（成功/失败/超时）即清理；看门狗每 30 分钟清扫孤儿文件\n- 用户密码：仅存内存，任务结束即焚，不落盘不日志\n\n## 错误处理\n\n| 错误场景 | 回复 |\n|---------|------|\n| 文件超过 100MB | \"文件太大，请压缩或拆分后重试（可先发我压缩：指令'压缩到80MB'）\" |\n| 超过 200 页 | \"页数超限，请指定页范围（如 1-50页）\" |\n| 加密 PDF 无密码 | \"请提供PDF密码：回复 '密码:xxx'（密码仅用于本次处理，不留存）\" |\n| OCR 超时 | \"识别超时，建议：①降精度重试 ②指定页范围，回复序号选择\" |\n| 无文本层且 OCR 失败 | \"无法识别内容，请检查文件清晰度，或发原图重试\" |\n| 批量部分失败 | 成功结果先交付 + 失败清单（文件名+原因+建议），原件不受影响 |\n| 外部接口不可用（验真/翻译） | \"xx接口暂不可用，结果已标注'未验真/未翻译'，可稍后重试\" |\n\n> 通用降级链与熔断策略见 `error-handling.md`。\n\nFile v1.0.2:references/few-shot-examples.md\n\n# Few-Shot 路由示例（20 例）\n\n> 意图路由拿不准时对照本表。格式：用户输入 → 路由 → 关键动作要点。\n\n---\n\n**例 1**\n用户：\"客户发来一份50页PDF标书，转Word我要改条款，之前用免费工具表格全乱了\"\n→ **#1** PDF→Word。先 `pdf_info.py` 检测文本层；表格多用 pdf2docx 首选管道；交付按字体/表格/图片/页眉四项质检。\n\n**例 2**\n用户：\"这20张发票扫描件帮我识别汇总到Excel，免费OCR总是把金额识别错\"\n→ **#2 + #18** 组合。OCR 表格模式提取 → 金额字段全量正则校验 → 低置信区清单 → Excel 汇总。\n\n**例 3**\n用户：\"产品手册第5页的价格改成1999，手头没有源文件\"\n→ **#3** 直接编辑。备份 → 定位文本对象改写 → 新文本长度检查 → 预览确认 → 交付。\n\n**例 4**\n用户：\"这份报价单发给客户前，加水印防截图泄露，再加密码禁止转发，7天后失效\"\n→ **#4**。动态水印（用户ID+时间戳）+ AES-256 加密 + 权限禁用；密码与文件分渠道发送提醒。\n\n**例 5**\n用户：\"帮我处理这100份测试报告：按日期重命名，然后合并成一本带目录的手册\"\n→ **#11 → #5** 能力链。先批量提取日期生成对照表确认 → 重命名 → 按名排序合并+目录书签。\n\n**例 6**\n用户：\"这份扫描件合同80MB，微信发不了，帮我压到20MB以下，但文字必须清楚\"\n→ **#15**。分层压缩目标 20MB；文字层无损；迭代降图片 dpi/q 至达标；触底则报告极限值。\n\n**例 7**\n用户：\"这份50页英文芯片Datasheet翻译成中文，保留排版，术语要准\"\n→ **#16**。加载芯片行业术语库 → 段落级翻译回写坐标 → 交付双语版+术语对照表。\n\n**例 8**\n用户：\"这份50页的合作协议帮我审查一下，标出所有风险条款，我们是乙方\"\n→ **#17**。立场=乙方 → 六大类风险扫描 → 分级报告+高亮PDF+免责声明。\n\n**例 9**\n用户：\"这叠100张发票帮我归档，要验真、去重、生成报销单\"\n→ **#18**。批量 OCR → 验真（接口不可用标\"未验真\"）→ 哈希去重 → 报销单+归档包。\n\n**例 10**\n用户：\"这份劳动合同要发给深圳的员工签，他在家没法打印，要合法电子签名\"\n→ **#19**。需 CA 证书路径；无 CA → 明确告知图片章无法律效力，给替代建议。\n\n**例 11**\n用户：\"这200份历史报价单上的价格要从1999改成2199，公司统一调价\"\n→ **#20**。规则精确匹配 → dry-run 差异预览 → 确认 → 备份执行 → 替换报告。\n\n**例 12**\n用户：\"把这个Word入职登记表做成可填写的PDF表单，要能自动计算工龄工资\"\n→ **#21**。字段检测+判型 → 字段清单确认 → 加计算公式 → 自测后交付。\n\n**例 13**\n用户：\"这份PDF施工图上量一下客厅到阳台的距离，还有主卧面积\"\n→ **#22**。比例尺识别/校准 → 两点距离+闭合面积 → 引线标注副本+数值表。\n\n**例 14**\n用户：\"这份产品手册发给客户太死板了，做成能翻页的电子书，能放官网\"\n→ **#23**。HTML5 翻页书 → 三端自测 → 在线链接 + iframe 嵌入代码。\n\n**例 15**\n用户：\"这份宣传册要发印刷厂，他们说文件不合格，帮我导出印刷版\"\n→ **#24**。预检报告 → RGB→CMYK + 3mm 出血 + 转曲 → PDF/X 输出+遗留风险清单。\n\n**例 16**\n用户：\"这份招标公告要公开发布，里面投标方的报价和联系方式要彻底删除，不是涂黑，是真删\"\n→ **#25**。删除预览 → 用户确认 → 底层删除 → 双引擎+正则 0 命中验证 → 删除证书。\n\n**例 17**\n用户：\"把这两版合同 diff 一下，重点看违约条款改了没\"\n→ **#12**（联动 **#17**）。双通道对比 → 差异分类报告 → 关键条款差异做风险提示。\n\n**例 18**\n用户：\"这份文档里关于质保期是怎么约定的？\"\n→ **#13** 问答。检索 → 答案+页码引用；检索为空答\"文档中未找到\"。\n\n**例 19**\n用户：\"帮我把这份 PDF 里的表格提出来，顺便对比下另一家规格书的参数\"\n→ **#6 + #14**。先表格提取 → 再两文档参数归一化 → 对比矩阵+来源表。\n\n**例 20**\n用户：\"这个文件你看着处理一下\"\n→ **意图模糊，禁止猜**。回应：\"可以这样做：①转Word编辑 ②提取表格 ③生成摘要——回复序号或说下你的目的，我来执行。\"\n\nFile v1.0.2:references/ocr-config.md\n\n# OCR 配置指南\n\n> OCR 任务调参、识别效果不达标排障时阅读。脚本入口：`scripts/pdf_ocr.py`。\n\n## 目录\n- [默认配置](#默认配置开箱即用)\n- [场景调参](#场景调参)\n- [速度与精度](#速度-vs-精度)\n- [识别率排障决策树](#识别率排障决策树)\n- [低置信区处理](#低置信区处理)\n\n---\n\n## 默认配置（开箱即用）\n\n| 参数 | 默认值 | 说明 |\n|------|--------|------|\n| `OCR_ENGINE` | `paddleocr` | 中文场景首选 |\n| `DETECTION` | `ch_PP-OCRv4_det` | 文字区域检测模型 |\n| `RECOGNITION` | `ch_PP-OCRv4_rec` | 文字识别模型 |\n| `LANGUAGE` | `ch+en` | 中英混合 |\n| `DESKEW` | `true` | 自动纠偏 |\n| `DENOISE` | `true` | 去噪 |\n| `BINARIZATION` | `adaptive` | 自适应二值化 |\n| `DPI` | `300` | 页面渲染分辨率（<150dpi 原图先超分） |\n\n## 场景调参\n\n### 高质量扫描件（清晰、无倾斜）\n```json\n{ \"deskew\": false, \"denoise\": false, \"binarization\": \"otsu\" }\n```\n\n### 手机拍照 / 有倾斜 / 阴影\n```json\n{ \"deskew\": true, \"denoise\": true, \"binarization\": \"adaptive\", \"contrast_enhance\": true, \"perspective_correct\": true }\n```\n\n### 手写体 / 低质量\n```json\n{ \"engine\": \"paddleocr\", \"model\": \"ch_PP-OCRv4_rec_mobile\", \"handwriting\": true, \"denoise\": true, \"super_resolution\": true }\n```\n\n### 纯英文文档\n```json\n{ \"engine\": \"tesseract\", \"language\": \"eng\", \"oem\": 3, \"psm\": 6 }\n```\n\n### 表格密集文档\n```json\n{ \"table_mode\": true, \"structure_model\": \"SLANet\", \"line_detect\": \"morphology\" }\n```\n\n## 速度 vs 精度\n\n| 模式 | 适用场景 | 速度 |\n|------|---------|------|\n| `fast` | 预览/草稿 | 3-5 秒/页 |\n| `balanced` | 日常使用（默认） | 8-12 秒/页 |\n| `accurate` | 关键文档/出版 | 15-25 秒/页 |\n\n> 单批 ≤50 页，超出自动分批并批间报进度。\n\n## 识别率排障决策树\n\n识别结果不达标时按序排查，每步验证后再进下一步：\n\n1. **原图质量**：渲染 dpi 是否 ≥300？→ 提高渲染 dpi 重跑\n2. **预处理是否误伤**：清晰件开了 denoise/binarization 反而掉字 → 换\"高质量扫描件\"配置\n3. **语言配置**：纯英文用了中文模型 → 切 Tesseract eng；日文/韩文 → 切对应语言包\n4. **引擎切换**：PaddleOCR 异常 → 降级 Tesseract（告知中文识别率下降）；反之亦然\n5. **手写体**：印刷体模型识别手写 → 切手写模型，并告知手写识别率上限（~85%）\n6. **特殊区域**：公章覆盖、底纹、水印区 → 标记低置信区（见下）\n7. **仍不达标**：如实报告\"该页识别置信度低\"，附原图请用户人工核对，**不得硬凑结果**\n\n## 低置信区处理\n\n- 以下区域自动标记「低置信区」：公章覆盖区、手写批注区、底纹/水印重叠区、分辨率 <150dpi 区\n- 交付时附《低置信区清单》：页码 + 区域截图 + 识别结果 + \"请人工核对\"提示\n- 金额/日期/编号类字段落在低置信区 → 升级为必核项，置顶提醒\n\nFile v1.0.2:references/quality-standards.md\n\n# 质量验收标准\n\n> 每次交付前对照执行。**通用项必查，专项项按涉及能力查。** 未过项要么修复，要么写入异常清单如实交付——禁止隐瞒。\n\n## 通用验收项（所有交付）\n\n- [ ] 输出文件可正常打开（用与生成不同的工具二次打开验证）\n- [ ] 页数符合预期（无丢页/多页）\n- [ ] 交付含四要素：结果文件 + 质检结论 + 异常清单 + 价值反馈\n- [ ] 临时文件已清理；原件未被修改（除非任务就是编辑原件，且已有备份）\n\n## 能力专项验收\n\n| # | 必查项（合格线） |\n|---|-----------------|\n| 1 | 字体匹配≥90%；表格原生可编辑；图片偏移≤5px；页眉页脚归位 |\n| 2 | 中文印刷体>95%（抽3页比对）；金额/日期/编号100%复核；可搜索PDF可选中可复制 |\n| 3 | 修改区外零改动（渲染diff）；新文本无溢出无乱码；预览已确认 |\n| 4 | 无密码/错误密码均拒绝打开；权限在主流阅读器生效；水印不遮公章签名 |\n| 5 | 合并页数=Σ各文件；书签可跳转；拆分份数与首页正确；重命名对照表100%覆盖 |\n| 6 | 表格0漏检；合并单元格还原正确；数值抽核≥10%行零误差 |\n| 7 | 阅读顺序正确（多栏不错序）；图片0丢失；页眉页脚已剥离 |\n| 8 | 关键数据与原文零误差；无原文外推断（或已标注）；要点附页码 |\n| 9 | 规则覆盖0漏网（二次扫描验证）；遮盖不越界；已说明\"可恢复\"属性 |\n| 10 | 元数据/XMP/附件/隐藏图层全清；正文零改动 |\n| 11 | 变量提取失败文件已单列；无重名无非法字符 |\n| 12 | 差异0漏报（抽3处未标区复核）；格式变化与实质变化分开统计 |\n| 13 | 事实点全附页码且可核；检索为空明确说\"未找到\" |\n| 14 | 参数归一化抽查每列5项回核；全参数覆盖无静默丢弃 |\n| 15 | 文字区放大200%无模糊；公章/二维码可辨认；页数内容0丢失 |\n| 16 | 排版diff仅文字区有差异；术语≥95%（全量对照术语表）；无漏译段 |\n| 17 | 六大类风险逐类扫描；每条有原文+页码+可执行建议；附免责声明 |\n| 18 | 关键字段≥98%；金额全量正则校验；验真状态逐张有值（含\"未验真\"）；去重0误杀 |\n| 19 | 落章预览确认率100%；审计日志完整；CA签与图片章表述不混淆 |\n| 20 | 预览命中与执行一致；替换区外零改动；失败文件原件完好；备份可回滚 |\n| 21 | 字段判型≥90%（确认兜底）；计算/联动/校验全部实测通过 |\n| 22 | 比例尺已知尺寸复核误差<2%；单位比例标注齐全 |\n| 23 | 三端无变形无模糊；翻页流畅；目录/搜索/离线如启用则实测 |\n| 24 | 通过PDF/X校验；无未声明RGB残留；出血连续；图片≥300dpi或已列风险 |\n| 25 | 双引擎+正则扫描0命中；证书要素齐全；非目标内容0损伤 |\n\n## 质检结论写法\n\n交付时用 2-3 句话说清：**查了什么 + 结果如何 + 遗留风险**。\n\n✅ 好：\"抽检 3 页识别准确率 97%，金额字段全部通过校验；第 7 页公章覆盖区已标低置信，请人工核对该页两个金额。\"\n\n❌ 差：\"已完成，质量很好。\"\n\nFile v1.0.2:references/security-compliance.md\n\n# 安全与合规护栏\n\n> 涉密文档、脱敏/删除、电子签名、合同审查任务**执行前必读**。\n\n## 目录\n- [文档密级与模型路由](#文档密级与模型路由)\n- [脱敏 #9 vs 密文删除 #25](#脱敏-9-vs-密文删除-25)\n- [电子签名法律效力边界](#电子签名法律效力边界)\n- [合同审查免责边界](#合同审查免责边界)\n- [数据生命周期](#数据生命周期)\n- [红线清单](#红线清单)\n\n---\n\n## 文档密级与模型路由\n\n| 密级 | 判定 | 模型路由 |\n|------|------|---------|\n| 公开/内部一般 | 默认 | 云端模型 |\n| 内部敏感 | 用户声明\"敏感/涉密\" | 本地 27B，禁上云 |\n| 密级文档 | 检测到\"机密/秘密/绝密\"字样或密级水印 | 本地 27B，禁上云；任务结束即焚临时文件 |\n\n- 检测在 `pdf_info.py` 阶段完成，命中即提示用户确认路由\n- 本地模型不可用时：**终止任务并说明**，不得转云端完成\n\n## 脱敏 #9 vs 密文删除 #25\n\n| 维度 | #9 脱敏 | #25 密文删除 |\n|------|---------|-------------|\n| 本质 | 遮盖（黑框覆盖） | 删除底层文本对象/图像修复 |\n| 可恢复性 | 专业工具可恢复 | 不可恢复（双引擎验证） |\n| 适用 | 内部流转、低风险 | 对外公开、法律合规、隐私抹除 |\n| 交付物 | 脱敏文件 | 删除文件+验证报告+删除证书 |\n\n- 用户说\"涂黑/打码/隐藏\"→ #9；说\"彻底/永久/真删/抹除\"→ #25\n- 意图不明时必须澄清，并说明两者可恢复性差异\n- #9 交付时必须提示\"底层数据仍可恢复，对外公开请用彻底删除\"\n\n## 电子签名法律效力边界\n\n| 方案 | 法律效力 | 表述要求 |\n|------|---------|---------|\n| CA 数字证书签名 | 符合《电子签名法》第十三条，司法实践认可 | 可表述\"具有法律效力\" |\n| 图片章+留痕 | 无法律效力，仅示意 | **必须明确告知无法律效力** |\n\n- 劳动/合同场景用户要求\"合法电子签\"→ 无 CA 环境时不得用图片章冒充\n- 批量盖章执行前落章位置预览确认率 100%\n- 审计日志要素：时间/IP/设备/证书编号/文件哈希，逐步完整\n\n## 合同审查免责边界\n\n- 每份审查报告结尾固定附：\n  > \"本报告为 AI 辅助初筛结果，不构成法律意见，不替代执业律师审查。🔴 高危条款建议提交法务/律师复核后决策。\"\n- 不输出\"这份合同可以签/不能签\"的结论性判断，只输出风险与建议\n- 法律依据引用须注明法条名称与条款号；不确定的法条不引用\n\n## 数据生命周期\n\n| 数据 | 规则 |\n|------|------|\n| 用户上传文件 | 处理期存临时目录，任务结束（成功/失败/超时）即清理 |\n| 用户密码 | 仅内存使用，不落盘、不日志、任务结束即焚 |\n| 备份文件（#3/#20） | 保留至用户确认结果无误或 7 天，先到期先清理 |\n| 删除证书/审计日志 | 按用户指定位置交付，服务端不留副本（用户要求托管除外） |\n| 对话中的敏感内容 | 不主动复述完整敏感号码（身份证/银行卡），引用时遮蔽中间位 |\n\n## 红线清单\n\n1. 涉密文档上云 —— 禁止\n2. 伪造验真/签名/审查结果 —— 禁止\n3. 涂黑冒充彻底删除 —— 禁止\n4. 图片章冒充法律有效签名 —— 禁止\n5. 未预览确认执行不可逆操作（#3/#20/#25） —— 禁止\n6. 密码落盘/进日志 —— 禁止\n7. 本地模型不可用时转云端处理涉密任务 —— 禁止\n\nArchive v1.0.1: 3 files, 22511 bytes\n\nFiles: skill-card.md (2408b), SKILL.md (50877b), _meta.json (129b)\n\nFile v1.0.1:SKILL.md\n\n---\nname: pdf-master\ndescription: Universal PDF intelligent processing system v2.1 with 33 capabilities across 5 AI-powered cores, 4 professional extensions, 7 scenario barriers, 9 value-adds, and 5 gap-fillers + 3 new enterprise capabilities. Built on Docling/Marker/OpenParse enterprise-grade document intelligence stack. Features AI-driven fidelity conversion, enhanced OCR with professional templates, multimodal RAG Q&A, intelligent layout-preserving editing with font matching, PDF multi-document smart splitting, PDF→CAD conversion, cross-software collaboration layer, enterprise DRM with automated audit reports, batch contract comparison, and team password vault. Feishu Lark native. Every output includes time-cost comparison against manual work.\n---\n\n# 万能PDF大师 2.1 —— 企业级 PDF 智能处理中枢\n\n## Overview\n\n一站式 PDF 处理系统，**33项精准能力**，不是\"功能堆砌\"而是\"手术刀级痛点歼灭\"。每个能力都回答三个问题：免费工具的坑在哪？我们怎么做到**更精细**？优越在哪？\n\n**2.1 核心升级**：\n- **3项新增能力**：PDF内多文档智能拆解（第31项）、PDF→CAD高保真转换（第32项）、跨软件协作兼容层（第33项）\n- **5项深度优化**：多模态RAG问答、专业OCR模板库、字体智能匹配+仿真编辑、视觉比对审核、自动化审计报告\n- **2项微能力**：团队共享密码托管、批量合同比对\n- **精细度深化**：从\"30项能力覆盖\"升级到\"33项+7处精细度深化\"\n\n**核心价值主张**：免费工具让你\"勉强能用\"，我们让你\"零妥协\"——精度、速度、安全、合规、协作，每一项都比行业标准高一个段位。\n\n---\n\n## 五大AI驱动核心能力\n\n### 1. PDF↔Office 高保真互转（AI双引擎驱动）\n**职场场景**：收到 PDF 合同/标书/论文需要修改，免费工具转 Word 后排版全乱、公式变图片、表格变成文本框堆叠、矢量图变成位图。\n**免费工具的坑**：字体丢失、表格变图片/文本框、页眉页脚错位、图片移位、LaTeX公式无法编辑、矢量图位图化、多栏混排变单栏。\n**我们的解法（精细四阶管道）**：\n- **智能路由**：Docling 引擎分析文档类型（学术论文→Marker 公式优化引擎 / 商务文档→Docling 版面保持引擎 / 扫描件→OCR预处理管道）\n- **元素级解析**：OpenParse 版面分析→识别标题层级/段落边界/多栏分割/页眉页脚/脚注尾注→精确提取而非暴力转换\n- **高保真重建**：字体匹配引擎（90%+匹配率，自动子集化嵌入）→ 原生表格重建（支持嵌套表/跨页表/合并单元格）→ LaTeX公式识别转Word可编辑OMML公式 → 矢量图保留为EMF/SVG\n- **质量验证**：转后对比扫描（排版偏移≤3px、表格单元格对齐率≥98%、字体保真度≥90%）\n**优越点**：字体匹配≥90%、表格原生可编辑（含嵌套和跨页）、图片偏移≤3px、LaTeX公式保持可编辑、矢量图不位图化、多栏混排精确还原。\n**触发指令**：\"转Word\" / \"转Excel\" / \"转PPT\" / \"转Markdown\" / \"公式保持可编辑\"\n**付费话术**：\"手动重排通常需要 2-3 小时，复杂论文公式重打要一整天。现在一键搞定，公式可编辑、表格可调、矢量图不糊\"\n\n### 2. AI增强OCR精准识别（含扫描件画质修复 + 专业OCR模板库 2.1新增）\n**职场场景**：纸质发票、手写签名单据、扫描版合同、手机拍照的会议纪要，需要变成可搜索/可编辑内容。原始扫描件有阴影、手指遮挡、页面弯曲、打印模糊。企业用户还需要针对特定证件类型的高精度结构化提取。\n**免费工具的坑**：中文识别率低、特殊符号乱码、表格识别错位、有水印/页数限制、不支持批量、阴影区域识别成黑块、手指挡住内容、弯曲页面文字变形。**通用OCR提取营业执照后还要手动拆代码和法人姓名**。\n**我们的解法（精细六阶管道 + 2.1专业模板库）**：\n- **AI画质修复**（新增精细预处理）：U2-Net文档分割→去阴影（背景光照估计）→去手指/异物遮挡修复（inpainting）→曲线展平（DocUNet几何校正）→智能黑白化/背景漂白→摩尔纹去除→分辨率超分重建\n- **智能分类路由**：自动判断文档类型（发票/合同/手写笔记/印刷文档/表格图纸/**营业执照/身份证/护照/银行流水/病历**）→ 匹配最优识别策略\n- **双引擎识别**：PaddleOCR 中文SOTA（印刷体识别率>97%）+ 多模态LLM辅助（手写体/潦草字/特殊符号增强识别率>92%）\n- **版面精准重建**：复杂版面分析（多栏/图文环绕/页眉页脚分离）→ 表格专用OCR（行列线检测+单元格合并识别）→ 阅读顺序智能恢复\n- **语义后校正**：上下文纠错引擎→专业术语库匹配（法律/医疗/芯片/金融领域）→ 数字/日期格式标准化\n- **2.1 新增 — 专业OCR模板库**：\n  - **营业执照专版**：高精度提取统一社会信用代码/法人/注册资本/成立日期，无需后期清洗\n  - **身份证/护照专版**：自动提取证件照区域+精准提取姓名/证件号/有效期\n  - **银行流水专版**：自动识别交易记录表格，精确对齐收支金额\n  - **病历专版**：保留诊断/处方/检查报告结构化字段，手写处方识别\n- **多格式输出**：可搜索PDF（保留原图+隐形精确文本层）/ 纯文本 / Word（保持版面）/ Excel（表格精准重建，含合并单元格）\n**优越点**：预处理后的识别率提升15-25个百分点、印刷体识别率>97%、手写体识别率>92%、表格行列对齐率>96%、支持批量100页。**专业模板提取后清洗时间减少80%**。\n**触发指令**：\"OCR\" / \"识别\" / \"扫描件转文字\" / \"修复扫描件\" / \"去阴影识别\" / \"识别营业执照\" / \"提取身份证信息\" / \"OCR银行流水\" / \"识别手写病历\"\n**付费话术**：\"手动录入通常需要 1-2 小时，现在 3 分钟搞定。有阴影、手指遮挡、页面弯曲的烂扫描件也能救回来，识别率直接拉满。**通用OCR提取营业执照后还要手动拆代码和法人姓名，现在选'营业执照专版'，营业执照号码、法人、注册资本直接以结构化字段输出，省去二次清洗。**\"\n\n### 3. 智能排版保持编辑（段落级精准修改 + 字体智能匹配+仿真手感编辑 2.1新增）\n**职场场景**：发现合同里一个错别字或产品手册要改一个参数，手头没有原始文档，传统PDF编辑一改整段排版就崩。替换字体时用户经常丢失设计感，尤其是中文字体缺乏时替换为黑体/宋体，破坏了原有设计语言。\n**免费工具的坑**：只能\"注释\"不能真正修改文字、改文字会破坏整段排版（行距字距全乱）、改图片需要外部PS、改后字体不匹配、链接失效。**替换字体时中文字体缺乏，替换为黑体/宋体破坏了原有设计语言**。\n**我们的解法（精细四阶管道 + 2.1字体仿真）**：\n- **段落级智能识别**：精确识别段落边界→分析字体族/字号/字重/颜色/行距/字距/缩进→构建排版DNA档案\n- **精准文本替换**：保持原字体属性（无法匹配时自动选最接近回退）→ 自动计算文本长度变化→智能调整行断点→保持段落整体对齐方式\n- **多媒体编辑**：图片替换（自动对齐+比例保持+分辨率适配）→ 矢量图替换（SVG/EMF保持矢量性）→ 链接/书签自动更新→ 注释/表单域智能保留\n- **跨页一致性检查**：修改后整页排版漂移检测→多页重复元素（页眉/页脚/水印）一致性校验→修改后文件大小优化\n- **2.1 新增 — 字体智能匹配+仿真手感编辑**：\n  - **字体智能匹配引擎增强**：检测缺失字体→在本地/云端字体库中自动匹配风格最接近的字体（如\"思源黑体替代苹方\"\"霞鹜文楷替代华文楷书\"）→预览效果后一键应用\n  - **编辑时提供\"所见即所得\"排版预览**，实时显示修改后的行距字距变化\n  - **新增\"手写批注仿真\"功能**：手绘痕迹AI转矢量，保持批注原生感\n**优越点**：像编辑 Word 一样直接改，文字修改后排版漂移≤1mm、字体保持率≥95%、修改后文件结构完整性100%。**中文字体风格匹配+仿真预览，排版一致性提升30%**。\n**触发指令**：\"编辑\" / \"修改文字\" / \"改参数\" / \"替换图片\" / \"改排版保持样式\" / \"匹配字体\" / \"智能字体\" / \"替换字体保持风格\" / \"手写批注转矢量\"\n**付费话术**：\"重做整份手册通常需要 2 小时，现在 30 秒搞定。改一个字不会崩掉整段排版。**替换字体时不再简单粗暴换黑体/宋体，智能匹配风格最接近的字体，预览后再应用，保持原有设计语言。**\"\n\n### 4. 企业级安全保护（DRM + 区块链存证 + 自动化审计报告 2.1新增）\n**职场场景**：对外发送机密报价单、技术规格书，怕被二次转发/截图泄露；内部文件需要精确到人的权限控制（只读/禁止打印/过期失效）。企业合规团队需要一键导出的人类可读审计报告，直接交给内部合规部门或外部审计机构。\n**免费工具的坑**：只能加简单密码、水印是静态文字无法追溯、权限控制形同虚设（截屏无法防范）、没有法律效力。**当前的区块链存证和审计日志是技术层级的，企业合规团队需要的是一键导出的人类可读审计报告**。\n**我们的解法（精细多层防护 + 2.1自动化审计）**：\n- **加密层**：AES-256 加密 + 证书签名 + 硬件令牌支持（符合国密SM2/SM4标准可选）\n- **动态量子水印**（升级）：可见水印（工号+时间戳+用户ID，半透明覆盖整页，防拍照设计）+ 不可见数字水印（频域嵌入，截屏后仍可提取溯源）\n- **DRM权限管理**（新增精细控制）：禁止打印/复制/注释/编辑 → 打开次数限制（如\"最多打开5次\"）→ 有效期控制（精确到分钟）→ 设备绑定（限定3台设备）→ 离线/在线模式切换\n- **区块链存证**：每份文件嵌入唯一指纹→哈希上链存证（司法链/蚂蚁链）→ 生成法律效力证书\n- **泄露追溯**：任何截屏/拍照可通过不可见水印定位到具体个人→完整审计日志（时间/IP/设备/证书编号）\n- **2.1 新增 — 自动化审计报告**：\n  - **生成格式化审计报告**：按时间/操作人/文件/操作类型汇总\n  - **支持导出为合规标准格式**（PDF/Excel/Word）\n  - **支持按项目/按客户/按时间段自定义审计摘要**\n  - **企业合规团队一键导出**，直接交给内部合规部门或外部审计机构\n**优越点**：动态水印双层防护可追溯、DRM权限精确到打开次数和设备、区块链存证具备法律效力、泄露可定位到个人。**自动化审计报告生成，合规团队效率提升70%**。\n**触发指令**：\"加密\" / \"加水印\" / \"禁止打印\" / \"DRM保护\" / \"区块链存证\" / \"防截图\" / \"导出审计报告\" / \"合规摘要\" / \"操作记录汇总\" / \"审计日报\"\n**付费话术**：\"机密泄露损失无法估量。现在一键防护，双层水印+DRM+区块链存证，泄露能追溯到人，法律纠纷时上链数据就是证据。**企业合规团队不用再手动整理审计日志，一键导出格式化审计报告，直接交给审计机构。**\"\n\n### 5. 批量自动化处理（规则引擎增强）\n**职场场景**：认证工程师归档 100 份测试报告，需要按章节拆开并重命名；市场部将 20 个 PDF 合并成方案画册并自动生成目录。\n**免费工具的坑**：限制单文件/少量页数、不能按规则批量重命名、合并后没有目录、格式不统一、拆分规则单一。\n**我们的解法（精细五阶管道）**：\n- **智能合并**：自动排序（文件名/页数/日期/正则提取）→ 自动生成目录书签（基于文档标题AI识别）→ 格式统一化（页面大小/方向/页边距）→ 页眉页脚自动重编\n- **智能拆分**（升级）：按页数/书签/内容检测（AI识别章节标题自动拆分）→ 按空白页分隔→ 按文件大小→ 按条形码/二维码标记\n- **规则重命名**：提取标题/日期/编号/客户名称（支持正则匹配）→ 自动去重命名冲突→ 支持变量模板（如\"{日期}_{客户}_{编号}\"）\n- **格式统一**：页面大小标准化→页边距统一→页眉页脚批量添加/替换→字体嵌入标准化\n- **批处理验证**：完成后自动生成处理报告（成功/失败/警告列表）→ 失败文件单独归档便于重试\n**优越点**：从天降到分钟，规则智能提取、拆分支持内容感知、合并自动生成可点击目录、处理报告一目了然。\n**触发指令**：\"批量合并\" / \"批量拆分\" / \"按规则重命名\" / \"智能拆章节\"\n**付费话术**：\"逐个操作通常需要大半天，现在 5 分钟搞定，还能按内容自动拆分章节\"\n\n---\n\n## 九大增值能力（部分升级）\n\n| # | 能力 | 触发指令 | 输出 | 2.0升级点 |\n|---|------|---------|------|-----------|\n| 6 | 表格精准提取 | \"提取表格\" / \"表格转Excel\" | CSV / Excel / 飞书多维表格 | **升级**：支持嵌套表格、跨页表格、表头重复识别、合并单元格保持 |\n| 7 | 图文混排解析 | \"提取图文\" / \"解析内容\" | Markdown / 结构化文本 | **升级**：Docling驱动，版面保持率97.5%，图片自动提取并标注位置 |\n| 8 | 智能摘要 | \"摘要\" / \"总结\" / \"提炼重点\" | 要点摘要 | 支持长文档（200页+）分块摘要+整体汇总 |\n| 9 | 自动脱敏（+团队共享密码托管 2.1新增） | \"脱敏\" / \"打码\" / \"隐藏敏感信息\" / \"团队加密共享\" / \"一键解密\" / \"密码托管\" | 脱敏后 PDF / 团队加密空间 | **升级**：规则引擎+AI识别双模式，身份证号/银行卡/手机号/人名/公司名自动检测。**2.1新增**：团队加密空间统一存密码，成员一键调用，管理员设定有效期和访问次数 |\n| 10 | 元数据清洗 | \"清洗元数据\" / \"擦除痕迹\" | 干净 PDF | 彻底清理作者/编辑时间/修订记录/批注者信息 |\n| 11 | 名称/编号自动化 | \"自动命名\" / \"重命名\" | 新文件名 | 正则+AI双模式提取关键信息 |\n| 12 | 两版 PDF 差异对比 | \"对比\" / \"diff\" / \"版本差异\" | 高亮差异报告 | **升级**：像素级对比+文本级对比双模式，定位到具体字符 |\n| 13 | 基于文档的多模态即问即答 | \"问答\" / \"这份文件说了什么\" / \"问图表\" / \"多模态问答\" / \"这张图说了什么\" / \"表格问题\" | 答案（附页码引用+视觉定位） | **2.1升级**：RAG架构+本地27B模型+多模态理解，支持200页+长文档。新增图表问答、公式问答、批注意见识别、印章与手写签名识别、视觉页码定位（图片截取定位答案位置）。知识问答精准度从70%→92% |\n| 14 | 规格参数自动对比矩阵 | \"规格对比\" / \"参数对比\" | 对比表格 | AI自动识别规格段落，生成多产品对比表 |\n\n---\n\n## 四大专业扩展能力\n\n### 15. PDF 智能压缩（AI分层压缩）\n**职场场景**：扫描件合同/图纸太大，微信传不了（100MB限制）、邮件发不出去（25MB限制）。\n**免费工具的坑**：全局压缩文字图片一起压、没有智能分层、无法精确控制目标大小、压缩后公章模糊。\n**我们的解法**：AI智能分层（文字无损矢量保持+图片自适应降采样+线框图特殊保护）→ 目标大小模式（指定\"压到10MB\"自动迭代优化）→ 压缩前后对比预览 → 公章/签名区域特殊保护\n**优越点**：文字放大300%无模糊，公章/签名可辨认，线条图无锯齿，支持精确到MB的目标大小。\n**触发指令**：\"压缩\" / \"缩小\" / \"压到10MB以下\" / \"分层压缩\"\n**付费话术**：\"手动用PS逐页调压缩通常需要 1 小时，现在 30 秒搞定。文字无损，图片自动适配，还能精确压到你要的大小\"\n\n### 16. PDF 翻译（保留排版，术语精准）\n**职场场景**：收到英文芯片 Datasheet、日文技术规格书、外文合同，需要翻译给团队看。\n**免费工具的坑**：翻译后排版全毁、专业术语翻错（如 flip-flop 翻成\"人字拖\"）、不支持中日韩混排、无法双语对照。\n**我们的解法**：段落级翻译保留原排版坐标（Marker驱动元素定位）→ 内置行业术语库（法律/芯片/医疗/机械）→ 支持自定义术语表上传 → 双语对照输出（左原文右译文/上下对照/段落内对照）→ 翻译后排版验证\n**优越点**：排版保留率98.5%，术语准确率≥96%，支持中日英韩德混排。\n**触发指令**：\"翻译\" / \"翻成中文\" / \"双语对照\" / \"术语库翻译\"\n**付费话术**：\"请翻译公司翻这份文档通常要 500-1000 元等 2-3 天，现在 3 分钟搞定，排版几乎不动，专业术语还准\"\n\n### 17. 合同智能审查（法律AI引擎 + 批量合同比对 2.1新增）\n**职场场景**：法务/采购收到50页合同，逐页找风险条款；中小企业没有专职法务。**法务同时审阅20份供应商合同，要找出哪几份偏离了公司的标准条款库；采购要对比3家竞品合同中的付款条款差异**。\n**免费工具的坑**：通用建议不针对具体合同、没有风险分级、无法标注具体位置。**法务审20份合同逐份对照标准条款，看完第5份已经头晕了**。\n**我们的解法**：\n- **单文件审查**：风险条款识别引擎（自动续约/天价违约金/不对等违约/模糊表述/知识产权陷阱/数据隐私/管辖地不利/保证金风险）→ 风险分级（🔴高危🟡中危🟢低危）→ 审查报告（原文高亮+法律依据+修改建议+页码定位）→ 历史合同比对→ 支持上传公司标准条款库自动比对偏差\n- **2.1 新增 — 批量合同比对**：\n  - **上传标准模板合同，批量比对N份供应商合同**→自动标记偏离条款+归类风险等级\n  - **支持指定条款（如付款条件/违约责任/保密条款/争议管辖）高亮差异，并横向对比**\n  - **5分钟出完20份合同的汇总报告**\n**优越点**：5分钟出报告，高危条款一个不漏，附法律依据和修改建议，支持自定义公司条款模板。**法务批量审核效率提升60%**。\n**触发指令**：\"审查合同\" / \"合同体检\" / \"标风险条款\" / \"比对标准条款\" / \"批量比对合同\" / \"合同横向对比\" / \"找偏差条款\"\n**付费话术**：\"请律师审这份合同通常要 2000-5000 元，现在 5 分钟出报告。还能跟你公司的标准条款自动比对偏差。**法务审20份合同逐份对照标准条款，看完第5份已经头晕了。现在上传标准模板，AI批量比对20份合同，偏差条款自动标红输出，5分钟出完汇总报告。**\"\n\n### 18. 发票/票据自动归档（财税自动化）\n**职场场景**：财务每月整理几百张发票，手动录入金额/税号/日期，还要逐张验真、去重。\n**免费工具的坑**：OCR识别率低、没有验真、不支持批量、不能去重、无法生成报销单。\n**我们的解法**：批量 OCR 识别（≥98.5%识别率）→ 自动验真（对接税务接口：真票/假票/作废/重复/异常状态）→ 智能去重（基于发票代码+号码哈希）→ 生成报销单（按员工/部门/项目分类汇总）→ 电子归档（按年月自动建文件夹+命名）→ 支持火车票/机票/出租车票/电子发票统一处理\n**优越点**：识别+验真+去重+报销单全自动，假票一个不漏，支持多种票据类型。\n**触发指令**：\"归档发票\" / \"报销汇总\" / \"验真去重\" / \"票据整理\"\n**付费话术**：\"财务手动整理100张发票通常需要 4-6 小时，现在 10 分钟搞定。假票、废票、重复票一个都跑不了\"\n\n---\n\n## 七大场景壁垒能力（深度痛点专家）\n\n### 19. 电子签名与审批流（法律级）\n**职场场景**：异地员工签劳动合同、销售批量签报价单、项目合同三级审批。\n**免费工具的坑**：手写图片没有法律效力、批量签章手动拖放200份要两天、多人签批没有流程控制。\n**我们的解法**：\n- CA数字证书签名：符合《电子签名法》第十三条，法院/仲裁认可，支持RSA/国密SM2\n- AI批量定位签章：自动定位签名区域（识别\"签字\"\"盖章\"\"签章\"关键词），200份5分钟盖完，位置精确±1mm\n- 审批流程引擎：顺序/并行/会签/条件分支，前一级没签完自动锁定下一级，支持催办/转办/加签\n- 全程留痕存证：每步记录时间/IP/设备/证书编号，生成不可篡改审计日志，支持区块链存证\n- 防篡改保护：签名后自动哈希上链，任何修改破坏签名并报警\n**触发指令**：\"签名\" / \"电子签\" / \"批量盖章\" / \"审批流\" / \"CA签名\"\n**付费话术**：\"快递合同往返3天+快递费20元/份，200份就是4000元。现在3分钟签完，法律效力同等，还能追溯每一步操作\"\n\n### 20. 批量内容替换（规则引擎+差异预览 + 视觉比对审核 2.1新增）\n**职场场景**：公司调价200份报价单统一改价格；公司搬家更新地址电话；品牌升级换Logo。**批量替换Logo/图片等视觉内容时，用户需要在替换前逐页预览实际效果，防止视觉错位或颜色偏差**。\n**免费工具的坑**：只能逐份打开修改、转Word批量替换再转回格式又乱、不支持正则、无法预览差异。**当前\"差异预览确认\"是文本级预览，批量替换视觉内容时无法预览实际效果**。\n**我们的解法**：\n- 规则引擎：精确匹配/正则匹配/图片哈希匹配（旧Logo→新Logo）/二维码替换，多规则同时执行\n- 差异预览确认：每份文件哪些位置将被修改，原文→新文并排对比，标记\"可疑替换\"需人工确认\n- **2.1 新增 — 视觉比对审核**：\n  - 替换Logo前自动将新旧Logo叠加预览在当前页面上方，支持半透明叠层对比\n  - 智能检测替换内容是否超出页面边界/破坏布局，红框预警\n  - 支持\"一键全部通过\"或\"仅通过选定规则\"的分批审核\n- 容错与回滚：自动备份原始文件→替换失败的文件单独列出不混入成功批次→支持一键回滚→生成完整处理报告\n- 单次最高500份\n**优越点**：规则强大+差异预览+视觉比对，自带回滚机制，批量处理零风险。**减少80%批量替换失误率**。\n**触发指令**：\"批量替换\" / \"统一改价格\" / \"批量改Logo\" / \"正则替换\" / \"预览替换\" / \"视觉差异预览\" / \"批量替换预览模式\"\n**付费话术**：\"手动改200份报价单要8小时重复劳动，人眼疲劳必然改漏。现在5分钟搞定，还能预览差异防止改错，自带回滚不怕失误。**批量替换Logo前可以预览实际效果，智能检测是否超出边界，避免视觉错位。**\"\n\n### 21. PDF表单创建（智能字段识别+数据收集）\n**职场场景**：HR做入职登记表、市场部做调研问卷、行政做办公用品申请单。\n**免费工具的坑**：只能买Adobe Acrobat Pro（3000+/年）、字段一个个手动拖放、没有自动计算、没有联动。\n**我们的解法**：\n- 一键生成可填写域：AI自动检测\"姓名：____\"等下划线区域和框线区域，智能判断字段类型（文本/数字/日期/单选/多选/下拉/签名域）\n- 高级功能：自动计算（数量×单价=小计，含税价计算）、字段联动（条件显示/隐藏/自动填充）、数据验证（手机号/身份证/邮箱格式校验）、下拉框批量导入（从Excel导入选项列表）\n- 数据收集：生成表单链接/二维码，飞书/微信直接填写，提交数据实时汇总到多维表格，支持数据导出Excel\n- 模板库：预置100+常用表单模板（入职/报销/请假/采购/客户调研）\n**触发指令**：\"生成表单\" / \"做可填写PDF\" / \"问卷转表单\" / \"表单模板\"\n**付费话术**：\"原来要买Adobe Acrobat Pro（3000+/年）拖2小时字段，现在一键生成，还能自动计算和实时汇总数据\"\n\n### 22. 图纸精准测量（AI比例尺识别）\n**职场场景**：建筑设计师量墙距、机械工程师算零件面积、项目经理核对平面图。\n**免费工具的坑**：PDF阅读器没有测量、CAD软件几万块且PDF导入比例尺错乱、手动换算易错。\n**我们的解法**：\n- 自动识别比例尺：扫描图纸上的\"1:100\"\"1:50\"标注自动识别校准，无标注图纸通过已知尺寸反推，支持多比例尺分区识别\n- 多维度测量：距离/面积/角度/坐标/周长，点击两点自动显示实际长度，支持连续测量\n- 标注与导出：测量结果直接标注在图纸上（带引线+数值+单位+颜色区分），导出Excel测量数据表，支持批量测量（一次框选多个区域批量输出面积表）\n- 单位转换：自动换算mm/cm/m/英寸/英尺\n**触发指令**：\"测量图纸\" / \"量尺寸\" / \"算面积\" / \"比例尺校准\"\n**付费话术**：\"打印A0图纸一次50元，用尺子量还容易错。现在PDF上直接精确测量，自动按比例尺换算，结果还能标注导出\"\n\n### 23. 翻页电子书制作（精装画册体验）\n**职场场景**：销售给客户发产品手册、市场部做品牌宣传册。\n**免费工具的坑**：PDF死板、转电子书后排错乱、手机打开变形。\n**我们的解法**：\n- 拟真翻页效果：HTML5 Canvas渲染，纸张卷曲动画+阴影，60fps流畅，支持拖拽/点击/键盘/滚轮/触屏翻页\n- 智能适配多端：手机单页自适应、平板双页展开、电脑全屏演示、电视横屏展示\n- 增强功能：自动生成目录导航、全文搜索高亮、热点链接跳转、音频/视频嵌入、分享控制（允许下载/仅在线/密码访问）\n- 一键部署：在线链接直接发给客户，可嵌入官网（iframe），可生成离线包展会无网络使用，支持自定义域名\n**触发指令**：\"做翻页书\" / \"电子书\" / \"手册转网页\" / \"画册\"\n**付费话术**：\"给客户发PDF像发作业，翻页电子书像发精装画册。客户在线翻阅的体验专业感差一个档次，停留时长能差3倍\"\n\n### 24. 印刷级导出（预检一键通过）\n**职场场景**：设计部做好宣传册发给印刷厂，反复沟通文件不合格。\n**免费工具的坑**：不懂印刷参数、加出血区不规范、文字没转曲、图片分辨率不够。\n**我们的解法**：\n- 印刷预检一键导出：RGB→CMYK（ICC配置文件可选Japan Color 2001/FOGRA39/GRACoL）、出血区自动添加（3mm/5mm内容智能外扩）、文字自动转曲（所有字体转矢量路径+子集化）、图片分辨率检测（低于300dpi自动预警+智能超分）、输出PDF/X-1a/PDF/X-4标准\n- 预检报告：生成完整预检报告（色彩空间/字体嵌入/图片分辨率/出血区/专色/叠印设置逐项检查），印刷厂直接接收零返工\n- 手机阅读优化：流式布局单栏自适应、图片自适应点击看原图、暗色模式、导出EPUB/HTML5\n**触发指令**：\"印刷导出\" / \"CMYK导出\" / \"出血区\" / \"转曲\" / \"预检报告\"\n**付费话术**：\"印刷厂说文件不合格要重做，沟通来回2-3天。现在一键导出CMYK+出血区+转曲，预检报告逐项过关，直接上印刷机，零返工\"\n\n### 25. 密文级敏感信息永久删除（军事级销毁）\n**职场场景**：招标公告隐藏报价、离职交接删除身份证号、法院卷宗抹除隐私。\n**免费工具的坑**：\"涂黑\"只是覆盖矩形底层文本还在、一些工具只是隐藏图层、没有删除验证、无法律证明。\n**我们的解法**：\n- 真正删除底层对象：定位敏感文本的PDF文本对象→从内容流彻底移除绘制指令（不是覆盖）→同步清理字体引用/编码映射/位置矩阵/XMP元数据→图片中的敏感信息用AI图像修复（inpainting）彻底抹除像素而非打码\n- 删除彻底性验证（三阶验证）：删除后用pdfplumber/PyMuPDF全文提取扫描确认0命中→正则二次扫描→二进制层面确认对象已移除→生成\"删除验证报告\"\n- 删除证书与审计：生成PDF/A标准删除证书（记录删除时间/操作人/内容类型/验证结果/三阶验证通过标识）→证书嵌入PDF元数据可供第三方审计→符合GDPR/个人信息保护法合规要求\n- 批量删除：上传规则（如\"删除所有11位连续数字\"\"删除所有邮箱格式\"\"删除所有人名\"），AI辅助识别敏感信息\n**触发指令**：\"彻底删除\" / \"密文删除\" / \"永久抹除\" / \"不是涂黑\" / \"合规删除\"\n**付费话术**：\"涂黑只是遮眼，底层数据还在，恢复工具10秒就能提取。我们彻底删除文本对象，连恢复工具都找不回来，三阶验证确认干净，还附带法律级删除证书，GDPR和个人信息保护法合规\"\n\n---\n\n## 五大补齐短板的新增能力（2.0版本新增）\n\n### 26. 扫描件AI画质增强（文档照片修复专家）\n**职场场景**：用手机拍照的文档有阴影、手指按在纸上、页面弯曲、灯光不均、打印模糊，传统OCR识别率低，肉眼看着也难受。\n**免费工具的坑**：没有专门的文档画质增强工具、用PS手动调一页要10分钟、阴影去不掉、弯曲页面无法展平、手指遮挡无法修复。\n**我们的解法（专业文档修复管道）**：\n- AI文档分割：U2-Net精确分离文档前景与背景\n- 去阴影：背景光照估计+阴影区域检测+均匀化重建，彻底消除拍照阴影\n- 去手指/异物修复：AI检测手指/异物遮挡区域→文档内容inpainting智能修复，被挡住的内容自动补全\n- 曲线展平：DocUNet几何校正→弯曲页面自动展平→透视校正→文档矩形化\n- 智能黑白化：自适应阈值二值化→背景漂白→前景文字增强→印章/红色标记保护性保留\n- 摩尔纹/噪点去除：扫描件特有摩尔纹检测去除→降噪锐化→分辨率智能超分重建\n**优越点**：修复后的文档达到扫描仪级品质，OCR识别率提升15-25%，打印效果媲美原扫。\n**触发指令**：\"修复扫描件\" / \"去阴影\" / \"展平\" / \"去手指\" / \"文档美白\" / \"扫描件增强\"\n**付费话术**：\"手机拍的文档有阴影、手指、弯曲，看着不专业OCR还认不全。现在一键修复，达到扫描仪级品质，直接能归档或打印\"\n\n### 27. 智能书签与目录自动生成（长文档导航）\n**职场场景**：收到几百页的技术手册、标书、论文集，没有书签，翻找某个章节要翻半天。\n**免费工具的坑**：只能手动一页页加书签、无法识别章节层级、标题识别不准、页码对不上。\n**我们的解法**：\n- AI章节识别：Marker/Docling内容分析→自动识别标题层级（H1/H2/H3）→区分正文标题与页眉/图表标题→构建层级目录树\n- 智能书签生成：自动生成可点击PDF书签→支持多级嵌套→支持自定义展开层级\n- 页码校正：自动检测实际页码与标注页码偏差→目录页码自动对齐→支持罗马数字/阿拉伯数字混排\n- 目录页生成：自动插入/更新目录页（带页码+可点击链接）→ 支持多种目录样式\n**优越点**：200页文档3秒生成完整书签，标题识别准确率≥95%，页码自动校正。\n**触发指令**：\"生成书签\" / \"自动生成目录\" / \"加导航\" / \"书签\"\n**付费话术**：\"100页的标书手动加书签要30分钟还容易漏。现在3秒自动生成多级书签，还能校正页码偏差\"\n\n### 28. PDF无障碍标签化（Accessibility / WCAG合规）\n**职场场景**：企业有视障员工需要阅读PDF；政府/学校/大型企业网站需要满足无障碍法规（中国《无障碍环境建设法》、美国ADA、欧盟EN 301 549）；被投诉PDF无法被屏幕阅读器朗读。\n**免费工具的坑**：99%的PDF工具不支持Accessibility、手动加标签需要Adobe Acrobat Pro且一页页操作极其繁琐、不知道什么是WCAG合规、标签结构容易出错。\n**我们的解法**：\n- 无障碍自动检测：一键扫描PDF的Accessibility问题清单（缺失标签树/无阅读顺序/图片无替代文本/表格无摘要/色彩对比度不足/无文档标题/无语言标记）\n- 智能标签生成：自动生成完整标签树（Tags Tree）→确定正确阅读顺序→标题层级化（H1-H6）→段落/列表/表格语义标记\n- 图片Alt文本：AI自动生成图片描述（alt text）→支持批量编辑修改→复杂图表生成详细描述\n- 表格无障碍化：自动生成表格摘要（Table Summary）→表头关联标记（TH/TD）→复杂表格阅读顺序优化\n- 合规输出：导出WCAG 2.1 AA/AAA级别合规PDF→生成无障碍合规报告→支持PDF/UA（ISO 14289）标准\n**优越点**：一键检测+一键修复，合规率达到WCAG 2.1 AA标准，支持屏幕阅读器（NVDA/JAWS/VoiceOver）完美朗读。\n**触发指令**：\"无障碍\" / \"Accessibility\" / \"WCAG\" / \"加标签\" / \"屏幕阅读器\" / \"合规检测\"\n**付费话术**：\"手动给一个50页PDF加无障碍标签需要4-6小时专业操作。现在一键检测+一键修复，满足国内外无障碍法规要求，避免法律风险\"\n\n### 29. 手写笔记智能识别与数字化（笔迹专家）\n**职场场景**：会议纪要手写草稿、课堂笔记、客户拜访手写记录，需要整理成电子文档；手写待办事项容易遗忘。\n**免费工具的坑**：普通OCR手写识别率极低（<60%）、连笔字/潦草字无法识别、不分段落和结构、表格/图示无法处理、待办事项需手动提取。\n**我们的解法**：\n- 手写体专用识别：PaddleOCR手写增强模型 + 多模态LLM笔迹理解→连笔字/潦草字/速记符号增强识别（准确率>90%）\n- 智能结构化分块：AI自动划分区域（标题/正文/重点标记/待办框/时间戳/签名）→保持原文档空间结构\n- 内容智能整理：手写笔记→结构化Markdown/飞书文档→重点内容自动加粗/高亮标记→待办事项（□/☑）自动提取为任务列表\n- 混排处理：手写文字+手绘图表+粘贴打印件混排智能分离→图表区域单独标注→打印件区域用印刷体OCR提高精度\n**优越点**：手写识别率>90%（行业领先），自动结构整理，待办自动提取，支持中英文混写。\n**触发指令**：\"手写识别\" / \"笔记整理\" / \"手写转文字\" / \"会议纪要整理\"\n**付费话术**：\"手写笔记整理通常需要1小时手动重打。现在5分钟完成识别+结构化整理，待办事项还能自动提取到任务清单\"\n\n### 30. PDF/A长期归档标准转换与修复（档案合规）\n**职场场景**：企业档案管理需要符合长期保存标准；政府/国企/金融机构要求PDF/A归档；担心10年后PDF打不开因为字体缺失/格式过时。\n**免费工具的坑**：普通工具不支持PDF/A标准、不知道选哪个级别（PDF/A-1a/2a/3a/b/u）、字体嵌入问题无法自动修复、转换后合规性无法验证、色彩空间不对。\n**我们的解法**：\n- 智能级别推荐：根据文档用途自动推荐PDF/A级别（A-1b基础归档/A-2a可搜索/A-3a含附件/A-4现代化）\n- 一键合规转换：PDF→PDF/A自动转换→字体缺失自动嵌入（自动下载开源替代字体）→色彩空间转换（RGB→sRGB/CMYK）→透明度展平→JavaScript移除\n- 合规性验证：转换后逐条验证ISO 19005标准合规性→生成详细合规报告（通过项/警告项/失败项）→失败项自动修复建议\n- 档案元数据：自动生成/补全档案级元数据（标题/作者/主题/关键词/创建者/生产者/创建日期/修改日期）→符合Dublin Core标准\n- 批量归档：批量转换整个文件夹→按日期自动分类→生成归档清单\n**优越点**：一键转换通过ISO 19005验证，自动修复字体/色彩/透明度问题，生成档案级合规报告。\n**触发指令**：\"PDF/A\" / \"归档\" / \"长期保存\" / \"档案转换\" / \"合规归档\"\n**付费话术**：\"档案不合规10年后可能打不开。现在一键转换为PDF/A国际标准，自动修复所有合规问题，附合规报告，档案馆直接接收\"\n\n---\n\n## 2.1版本新增的三大企业级能力\n\n### 31. PDF内多文档智能拆解（智能分类拆分）\n**职场场景**：HR收到一个包含50份简历的PDF大包；财务收到一个混合了发票、收据、合同的PDF；法务收到包含诉状、附件、宣誓书的案件卷宗包。\n**免费工具的坑**：最多只能按页范围或书签手动拆，50份简历手动拆要45分钟，还容易拆错页。只能按章节标题拆分，无法解决多文档混合包的问题——文档里可能由多个独立的、不同类型的子文档拼成一个PDF。\n**我们的解法（AI内容感知拆分）**：\n- **智能分类拆分**：用AI分析页面内容，用自然语言描述类别（如\"每个候选人简历独立为一个文档\"），自动识别边界并拆分\n- **混合包类型支持**：简历包/发票包/收据合同混合包/案件卷宗包/房产披露文件包\n- **路由输出**：拆分后按类别自动路由到不同文件夹/工作流，支持命名规则（如\"{姓名}_简历.pdf\"）\n- **关联LlamaExtract**：对每个拆分后的文档自动执行针对性提取（如从简历章节提取候选人姓名、电话、邮箱）\n**优越点**：AI自动识别每个简历的起始和结束位置，一次拆完并自动命名，3分钟搞定。**HR、财务、法务节省70%拆分时间**。\n**触发指令**：\"拆简历包\" / \"拆分文档混合包\" / \"按类别拆分\" / \"智能拆文档集\"\n**付费话术**：\"50份简历拼在一个PDF里，手动拆一页一页另存为要将近1小时，还容易漏页。现在AI自动识别每个简历的起始和结束位置，一次拆完并自动命名，3分钟搞定。\"\n\n### 32. PDF转CAD图纸格式转换与自动解析（图纸级精度）\n**职场场景**：建筑设计师收到PDF图纸要导入CAD软件修改；机械工程师需要将PDF工程图转回可编辑的DWG格式；施工方只有PDF图纸但需要在CAD中标注修改。\n**免费工具的坑**：普通PDF转CAD工具转换后线型丢失、图层全部合并到一个图层、尺寸标注变成文本对象而非可编辑标注、比例尺错乱。转后丢失字母\"O\"等问题频发。\n**我们的解法（高保真PDF→CAD转换）**：\n- **PDF→DWG/DXF高保真转换**：\n  - 线型识别：实线/虚线/点划线自动映射到CAD线型库\n  - 图层自动提取与保留：按颜色/线型/对象类型自动创建图层\n  - 尺寸标注语义识别：数值+标注线+箭头→CAD可编辑尺寸对象\n- **图纸自动解析（AI增强）**：\n  - 比例尺自动识别\n  - 图框识别与提取（提取图纸幅面A0-A4及图签信息）\n  - 元件识别：电气符号/机械符号/建筑门窗等自动转为CAD块\n  - 尺寸标注批量提取为表格\n- **批量图纸处理**：整包PDF图纸批量转DWG、批量提取材料统计表、批量自动生成图纸目录\n**优越点**：一键转DWG，线型图层全保留，还能自动识别图框和材料表，直接进CAD修改。**设计师节省90%描图时间**。\n**触发指令**：\"转CAD\" / \"转DWG\" / \"转DXF\" / \"提取矢量图\" / \"自动解析图纸\"\n**付费话术**：\"PDF图纸手动描一遍要一整天，描完了线型全部是实线，图层全部合并。现在一键转DWG，线型图层全保留，还能自动识别图框和材料表，直接进CAD修改。\"\n\n### 33. 跨软件协作兼容层（批注意见聚合与兼容检测）\n**职场场景**：客户发来PDF需要团队多人协同批注，但5个人用5种不同软件（Adobe Acrobat、福昕、WPS、浏览器、iPad标记），批注意见互相不兼容、水印重叠、导出丢失。\n**免费工具的坑**：Adobe Acrobat批注在福昕中可能显示为\"未知对象\"、批注文字样式错乱、高亮颜色丢失甚至完全看不到。没有工具能一键将多来源批注意见合并并统一格式。\n**我们的解法（跨软件协作兼容引擎）**：\n- **多软件批注意见聚合与统一**：\n  - 自动接收Adobe/Acrobat/福昕/WPS/浏览器/iPad标记等多源批注导入\n  - 智能合并冲突批注（去重、合并、高亮差异）\n  - 输出通用标准批注PDF（PDF/UA兼容）\n- **全兼容性审核**：\n  - 一键检测PDF在不同软件中的兼容性风险（XFA表单/专有字体/JavaScript/多媒体对象等）\n  - 生成兼容性报告\n  - 自动修复为通用PDF格式\n- **多格式批注导出**：批注导出为通用格式（Markdown/Word/Excel表格批注汇总），支持跨软件协作\n**优越点**：一键聚合所有人的批注意见，智能去重合并，导出统一格式，还能检测兼容性问题提前预警。**多部门协作效率提升50%**。\n**触发指令**：\"合并批注\" / \"跨软件兼容\" / \"导出为通用PDF\" / \"检测兼容性问题\"\n**付费话术**：\"5个人用5种PDF软件批注同一份文档，意见散落在各处，合并起来要手动复制粘贴半小时。现在一键聚合所有人的批注意见，智能去重合并，导出统一格式，还能检测兼容性问题提前预警。\"\n\n---\n\n## Core Workflow\n\n### Trigger\n- **飞书 @机器人 + 上传 PDF + 文字指令**\n- **群聊中 @并附文件**\n- **单聊直接发送文件+指令**\n\n### Step 1: 智能文档分类与路由\n\n2.0版本增加精细分类路由：\n| 类型 | 检测方式 | 路由管道 | 工具链 |\n|------|---------|---------|--------|\n| 文本PDF | 有完整文本层+标准字体 | 直接处理管道 | Docling / PyMuPDF |\n| 扫描PDF | 无文本层，纯图片 | OCR预处理→画质增强→识别 | AI画质修复→PaddleOCR→LLM校正 |\n| 混合PDF | 部分文本+部分图片/扫描 | 混合管道 | 页面级智能路由 |\n| 复杂排版 | 多栏/杂志/学术论文 | 版面分析优先管道 | Marker / OpenParse |\n| 大文件 | >50页或>50MB | 分块处理管道 | 异步队列+流式处理 |\n\n### Step 2: 精细化任务执行\n\n解析指令，匹配33项能力。每项能力执行\"四阶质量管道\"：\n1. **预处理**：文档类型分析→质量评估→必要的前置修复\n2. **智能分析**：AI理解文档结构→识别关键元素→制定最优处理策略\n3. **精细化执行**：使用最优引擎处理→参数自适应调整→中间结果验证\n4. **质量验证**：输出质量检查→与标准对比→必要时自动重试\n\n### Step 3: AI增强层（2.0升级）\n\n复杂文档的AI处理升级：\n- **版面理解**：Docling多栏/图表/公式/页眉页脚精确识别\n- **表格结构恢复**：嵌套表/跨页表/合并单元格/表头重复处理\n- **语义理解**：行业术语库匹配→上下文语义校正→多模态理解（文字+图表+公式）\n- **质量预测**：处理前预判难度→处理中监控质量→处理后验证精度\n\n### Step 4: 价值交付\n\n每项输出必须包含\"时间节省/成本节省/风险消除\"量化信息：\n- **文本/Markdown** → 直接消息\n- **文件（PDF/Excel/Word）** → 上传到聊天\n- **结构化数据** → 飞书多维表格链接\n- **在线链接** → 翻页电子书/表单链接\n- **报告** → 审查报告/预检报告/合规报告/差异报告\n- **处理日志** → 批量任务处理报告（成功/失败/详情）\n\n---\n\n## Tech Stack（2.0企业级升级）\n\n| 层级 | 1.3版本 | **2.0升级方案** |\n|------|---------|----------------|\n| **文档解析引擎** | PyMuPDF, pdfplumber, LayoutParser | **Docling** (IBM企业级) + **Marker** (公式/学术优化) + **OpenParse** (版面分析) + PyMuPDF辅助 |\n| **OCR与画质** | PaddleOCR, Tesseract + OpenCV基础预处理 | **PaddleOCR+手写增强** + **U2-Net文档分割** + **DocUNet曲线展平** + 图像修复inpainting + 超分重建 |\n| **转换引擎** | LibreOffice headless, pdf2image | **Docling/Marker双引擎** + LibreOffice辅助 + 矢量图保留管道 |\n| **AI/LLM层** | Cloud model + local 27B | **多模态LLM** (文档理解) + **local 27B** (敏感文档) + **行业术语库** |\n| **RAG/问答** | Chroma/FAISS基础 | **优化RAG架构** + 200页+长文档分块策略 + 精确引用定位 |\n| **差异对比** | pdf-diff基础 | **像素级对比** + **文本级对比**双模式 |\n| **安全与DRM** | PyPDF2, pikepdf基础 | **AES-256+国密SM2/SM4** + **双层数字水印** (可见+不可见) + **DRM权限引擎** + **区块链存证** |\n| **队列与异步** | 基础异步队列 | **增强任务队列** + 流式进度反馈 + 断点续传 |\n| **压缩** | PyMuPDF + OpenCV基础 | **AI分层压缩引擎** (文字/图片/线框分层处理) + 目标大小迭代优化 |\n| **翻译** | Cloud translation API基础 | **Cloud translation + 术语库 + 坐标映射保留** (Marker驱动) |\n| **合同审查** | Legal LLM + rule engine | **Legal LLM + 扩展风险规则库 + 公司条款模板比对** |\n| **发票OCR** | Specialized invoice OCR | **增强发票OCR + 税务API + 多票据类型** (火车票/机票/出租车) |\n| **电子签名** | CA certificate基础 | **CA证书+国密SM2** + AI定位 + 审批引擎 + 区块链存证 |\n| **批量替换** | Rule engine + regex | **增强规则引擎 + 图片哈希 + 差异预览 + 一键回滚** |\n| **表单构建** | Field auto-detection基础 | **AI字段识别增强 + 计算引擎 + 条件逻辑 + 飞书数据汇总** |\n| **图纸测量** | Scale auto-detection基础 | **AI比例尺识别 + 多维度测量 + 批量测量导出** |\n| **翻页电子书** | HTML5 Canvas基础 | **HTML5 Canvas 60fps + 富媒体嵌入 + 离线包 + 自定义域名** |\n| **印刷导出** | CMYK基础转换 | **ICC配置管理 + PDF/X验证 + 预检报告 + 手机EPUB导出** |\n| **永久删除** | Content stream removal | **三阶验证删除 + AI图像修复inpainting + 法律级删除证书** |\n| **★扫描增强** (新增) | — | **U2-Net + DocUNet + inpainting + 超分** |\n| **★书签生成** (新增) | — | **Marker/Docling章节识别 + 层级目录 + 页码校正** |\n| **★无障碍** (新增) | — | **标签树生成 + Alt文本 + WCAG 2.1 AA验证** |\n| **★手写识别** (新增) | — | **PaddleOCR手写增强 + 多模态LLM + 结构化整理** |\n| **★PDF/A归档** (新增) | — | **ISO 19005转换 + 字体嵌入修复 + 合规验证报告** |\n| **★多文档拆解** (2.1新增) | — | **AI内容感知拆分 + 命名规则 + 类别路由** |\n| **★PDF转CAD** (2.1新增) | — | **线型识别 + 图层提取 + 尺寸语义识别 + 图框解析** |\n| **★跨软件兼容** (2.1新增) | — | **多源批注聚合 + 兼容性检测 + 通用格式输出** |\n\n---\n\n## Progress Feedback（精细化进度）\n\n长操作发送实时精细化进度：\n- \"📄 正在解析文档结构（Docling引擎）第 12/45 页…\"\n- \"🔍 检测到扫描页面，启动AI画质增强→去阴影→展平…第 5/20 页\"\n- \"🧠 OCR识别中（印刷体97%精度），预计还需 30 秒…\"\n- \"📊 表格结构重建完成，共识别 8 个表格（含2个跨页嵌套表）…\"\n- \"🖨️ 印刷预检中→色彩空间✓ 字体嵌入✓ 图片分辨率⚠️3张低于300dpi已预警…\"\n- \"🔒 DRM保护生成中→加密✓ 双层水印✓ 区块链存证✓ 权限设置✓\"\n- \"✅ 处理完成！质量评分：排版保真98.2% | 表格对齐99.1% | 字体匹配94.5%\"\n- \"批量替换进度：185/200 完成 | 5个需确认 | 10个失败已单独列出\"\n- \"PDF/A归档转换：字体嵌入修复3处 | 色彩空间转换✓ | 合规验证通过\"\n\n---\n\n## Constraints（2.1升级限制）\n\n| 限制项 | 1.3版本 | **2.0版本** | **2.1版本** |\n|--------|---------|-------------|-------------|\n| 单文件大小 | 100MB | **200MB**（大文件自动分块） | **200MB**（保留） |\n| 单次页数 | 200页 | **500页**（长文档优化处理） | **500页**（保留） |\n| OCR批量页数 | ≤50页 | **≤100页** | **≤100页**（保留） |\n| 并发任务 | ≤3 | **≤5** | **≤5**（保留） |\n| 单次任务超时 | 5分钟 | **10分钟**（复杂任务如翻译/增强自动延长） | **10分钟**（保留） |\n| 敏感文档处理 | local 27B | **local 27B + 本地OCR**（不上云） | **local 27B + 本地OCR**（保留） |\n| 批量替换 | 500文件 | **500文件**（保留） | **500文件**（保留） |\n| 永久删除 | 200文件 | **200文件**（保留） | **200文件**（保留） |\n| 扫描增强 | — | **≤50页/批次** | **≤50页/批次**（保留） |\n| 手写识别 | — | **≤20页/批次**（手写计算量大） | **≤20页/批次**（保留） |\n| PDF/A归档 | — | **≤100文件/批次** | **≤100文件/批次**（保留） |\n| 无障碍标签 | — | **≤200页/任务** | **≤200页/任务**（保留） |\n| 新增-多文档拆解 | — | — | **≤200页混合包/任务** |\n| 新增-PDF转CAD | — | — | **≤50页图纸/任务** |\n| 新增-跨软件兼容 | — | — | **≤500页/任务** |\n\n---\n\n## Resources\n\n- **Command reference**: See `references/command-guide-v2.md`（2.0新增指令手册）\n- **Implementation details**: See `references/tech-spec-v2.md`（2.0技术架构详细说明）\n- **Feishu integration**: See `references/feishu-setup-v2.md`（2.0飞书集成增强配置）\n- **OCR configuration**: See `references/ocr-config-v2.md`（2.0包含扫描增强和手写识别配置）\n- **Accessibility guide**: See `references/accessibility-setup.md`（新增-无障碍配置指南）\n- **PDF/A archival guide**: See `references/pdfa-archival-guide.md`（新增-归档转换操作手册）\n- **Agent config**: See `config/pdf-master-agent-v2.md`（2.0完整Agent训练文件含30项能力Few-Shot示例）\n- **Quality benchmarks**: See `references/quality-benchmarks.md`（2.0新增-各项能力质量基准指标）\n\n---\n\n## 版本演进记录\n\n| 版本 | 能力数 | 关键升级 |\n|------|--------|---------|\n| 1.0 | 基础 | 核心功能上线 |\n| 1.3 | 25项 | 五大核心+四大扩展+七大壁垒+九大增值 |\n| **2.1** | **33项** | **3项新增能力(多文档智能拆解/PDF→CAD/跨软件协作兼容)+5项深度优化(多模态RAG/专业OCR模板/字体智能匹配/视觉比对审核/自动化审计)+2项微能力(团队密码托管/批量合同比对)** |\n| 2.0 | 30项 | 技术栈升级(Docling/Marker/OpenParse)+精细度革命+五大新增能力(扫描增强/书签生成/无障碍/手写识别/PDF/A归档) |\n\nFile v1.0.1:_meta.json\n\n{\n  \"ownerId\": \"kn7f0d8egkxsnntb67gq7hrxzd86cwz5\",\n  \"slug\": \"pdf-master\",\n  \"version\": \"1.0.1\",\n  \"publishedAt\": 1779546028346\n}\n\nFile v1.0.1:skill-card.md\n\n## Description: <br>\nPDF万能大师 is a PDF workflow assistant for conversion, OCR, editing, batch processing, document Q&A, security controls, comparison, form, archival, and export tasks. <br>\n\nThis skill is ready for commercial/non-commercial use. <br>\n\n## Publisher: <br>\n[ford828](https://clawhub.ai/user/ford828) <br>\n\n### License/Terms of Use: <br>\nMIT-0 <br>\n\n\n## Use Case: <br>\nEmployees and business teams use this skill to inspect, transform, protect, compare, summarize, and organize PDF documents and related Office, spreadsheet, report, and extraction outputs. <br>\n\n### Deployment Geography for Use: <br>\nGlobal <br>\n\n## Known Risks and Mitigations: <br>\nRisk: Broad document, credential, legal-signing, publishing, and deletion authority can affect sensitive business records if used without clear scope. <br>\nMitigation: Use only in approved workspaces with explicit commands, deliberate attachment selection, and per-action confirmations. <br>\nRisk: Password vault and one-click decryption workflows can expose credentials if they are not backed by appropriate controls. <br>\nMitigation: Do not use those workflows unless they are backed by a real enterprise secrets manager with RBAC and audit controls. <br>\nRisk: Identity, banking, medical, invoice, contract, signature, hosted-link, tax, and blockchain workflows can create privacy, consent, retention, and transmission risk. <br>\nMitigation: Require clear policies for consent, local-only handling, external transmission, retention, deletion, and access review before processing those documents. <br>\n\n\n## Reference(s): <br>\n- [ClawHub skill page](https://clawhub.ai/ford828/pdf-master) <br>\n\n\n## Skill Output: <br>\n**Output Type(s):** [Text, Markdown, Files, Guidance] <br>\n**Output Format:** [Markdown guidance with requested document-processing outputs or file specifications] <br>\n**Output Parameters:** [1D] <br>\n**Other Properties Related to Output:** [May propose PDF, Office, spreadsheet, report, audit, or extraction artifacts; no executable install payload is present.] <br>\n\n## Skill Version(s): <br>\n1.0.1 (source: server release evidence) <br>\n\n## Ethical Considerations: <br>\nUsers should evaluate whether this skill is appropriate for their environment, review any generated or modified files before relying on them, and apply their organization's safety, security, and compliance requirements before deployment. <br>\n\nArchive v1.0.0: 2 files, 17179 bytes\n\nFiles: SKILL.md (39513b), _meta.json (129b)\n\nFile v1.0.0:SKILL.md\n\n---\nname: pdf-master\ndescription: Universal PDF intelligent processing system v2.0 with 30 capabilities across 5 AI-powered cores, 4 professional extensions, 7 scenario barriers, 9 value-adds, and 5 new gap-fillers. Built on Docling/Marker/OpenParse enterprise-grade document intelligence stack. Solves real workplace pain points with surgical-grade precision -- not just feature existence. Features AI-driven fidelity conversion (Docling+Marker dual-engine), enhanced OCR with scan restoration pipeline, intelligent layout-preserving editing, enterprise DRM security with blockchain audit, batch automation, AI scan enhancement (shadow removal/finger removal/curvature flattening), auto bookmark generation, PDF/A long-term archival, handwriting recognition, PDF accessibility tagging (WCAG compliant), and collaborative review workflow. Feishu Lark native. Every output includes time-cost comparison against manual work.\n---\n\n# 万能PDF大师 2.0 —— 企业级 PDF 智能处理中枢\n\n## Overview\n\n一站式 PDF 处理系统，**30项精准能力**，不是\"功能堆砌\"而是\"手术刀级痛点歼灭\"。每个能力都回答三个问题：免费工具的坑在哪？我们怎么做到**更精细**？优越在哪？\n\n**2.0 核心升级**：\n- **技术栈升级**：引入 Docling / Marker / OpenParse 企业级文档智能引擎，替换旧版基础工具链\n- **精细度革命**：每个能力加入\"预处理→智能分析→精细化执行→质量验证\"四阶管道，告别粗粒度处理\n- **5大新增能力**：扫描件AI画质增强、智能书签生成、PDF无障碍合规、手写笔记识别、PDF/A归档标准——补齐用户反馈的全部短板\n\n**核心价值主张**：免费工具让你\"勉强能用\"，我们让你\"零妥协\"——精度、速度、安全、合规，每一项都比行业标准高一个段位。\n\n---\n\n## 五大AI驱动核心能力\n\n### 1. PDF↔Office 高保真互转（AI双引擎驱动）\n**职场场景**：收到 PDF 合同/标书/论文需要修改，免费工具转 Word 后排版全乱、公式变图片、表格变成文本框堆叠、矢量图变成位图。\n**免费工具的坑**：字体丢失、表格变图片/文本框、页眉页脚错位、图片移位、LaTeX公式无法编辑、矢量图位图化、多栏混排变单栏。\n**我们的解法（精细四阶管道）**：\n- **智能路由**：Docling 引擎分析文档类型（学术论文→Marker 公式优化引擎 / 商务文档→Docling 版面保持引擎 / 扫描件→OCR预处理管道）\n- **元素级解析**：OpenParse 版面分析→识别标题层级/段落边界/多栏分割/页眉页脚/脚注尾注→精确提取而非暴力转换\n- **高保真重建**：字体匹配引擎（90%+匹配率，自动子集化嵌入）→ 原生表格重建（支持嵌套表/跨页表/合并单元格）→ LaTeX公式识别转Word可编辑OMML公式 → 矢量图保留为EMF/SVG\n- **质量验证**：转后对比扫描（排版偏移≤3px、表格单元格对齐率≥98%、字体保真度≥90%）\n**优越点**：字体匹配≥90%、表格原生可编辑（含嵌套和跨页）、图片偏移≤3px、LaTeX公式保持可编辑、矢量图不位图化、多栏混排精确还原。\n**触发指令**：\"转Word\" / \"转Excel\" / \"转PPT\" / \"转Markdown\" / \"公式保持可编辑\"\n**付费话术**：\"手动重排通常需要 2-3 小时，复杂论文公式重打要一整天。现在一键搞定，公式可编辑、表格可调、矢量图不糊\"\n\n### 2. AI增强OCR精准识别（含扫描件画质修复）\n**职场场景**：纸质发票、手写签名单据、扫描版合同、手机拍照的会议纪要，需要变成可搜索/可编辑内容。原始扫描件有阴影、手指遮挡、页面弯曲、打印模糊。\n**免费工具的坑**：中文识别率低、特殊符号乱码、表格识别错位、有水印/页数限制、不支持批量、阴影区域识别成黑块、手指挡住内容、弯曲页面文字变形。\n**我们的解法（精细六阶管道）**：\n- **AI画质修复**（新增精细预处理）：U2-Net文档分割→去阴影（背景光照估计）→去手指/异物遮挡修复（inpainting）→曲线展平（DocUNet几何校正）→智能黑白化/背景漂白→摩尔纹去除→分辨率超分重建\n- **智能分类路由**：自动判断文档类型（发票/合同/手写笔记/印刷文档/表格图纸）→ 匹配最优识别策略\n- **双引擎识别**：PaddleOCR 中文SOTA（印刷体识别率>97%）+ 多模态LLM辅助（手写体/潦草字/特殊符号增强识别率>92%）\n- **版面精准重建**：复杂版面分析（多栏/图文环绕/页眉页脚分离）→ 表格专用OCR（行列线检测+单元格合并识别）→ 阅读顺序智能恢复\n- **语义后校正**：上下文纠错引擎→专业术语库匹配（法律/医疗/芯片/金融领域）→ 数字/日期格式标准化\n- **多格式输出**：可搜索PDF（保留原图+隐形精确文本层）/ 纯文本 / Word（保持版面）/ Excel（表格精准重建，含合并单元格）\n**优越点**：预处理后的识别率提升15-25个百分点、印刷体识别率>97%、手写体识别率>92%、表格行列对齐率>96%、支持批量50页。\n**触发指令**：\"OCR\" / \"识别\" / \"扫描件转文字\" / \"修复扫描件\" / \"去阴影识别\"\n**付费话术**：\"手动录入通常需要 1-2 小时，现在 3 分钟搞定。有阴影、手指遮挡、页面弯曲的烂扫描件也能救回来，识别率直接拉满\"\n\n### 3. 智能排版保持编辑（段落级精准修改）\n**职场场景**：发现合同里一个错别字或产品手册要改一个参数，手头没有原始文档，传统PDF编辑一改整段排版就崩。\n**免费工具的坑**：只能\"注释\"不能真正修改文字、改文字会破坏整段排版（行距字距全乱）、改图片需要外部PS、改后字体不匹配、链接失效。\n**我们的解法（精细四阶管道）**：\n- **段落级智能识别**：精确识别段落边界→分析字体族/字号/字重/颜色/行距/字距/缩进→构建排版DNA档案\n- **精准文本替换**：保持原字体属性（无法匹配时自动选最接近回退）→ 自动计算文本长度变化→智能调整行断点→保持段落整体对齐方式\n- **多媒体编辑**：图片替换（自动对齐+比例保持+分辨率适配）→ 矢量图替换（SVG/EMF保持矢量性）→ 链接/书签自动更新→ 注释/表单域智能保留\n- **跨页一致性检查**：修改后整页排版漂移检测→多页重复元素（页眉/页脚/水印）一致性校验→修改后文件大小优化\n**优越点**：像编辑 Word 一样直接改，文字修改后排版漂移≤1mm、字体保持率≥95%、修改后文件结构完整性100%。\n**触发指令**：\"编辑\" / \"修改文字\" / \"改参数\" / \"替换图片\" / \"改排版保持样式\"\n**付费话术**：\"重做整份手册通常需要 2 小时，现在 30 秒搞定。改一个字不会崩掉整段排版\"\n\n### 4. 企业级安全保护（DRM + 区块链存证）\n**职场场景**：对外发送机密报价单、技术规格书，怕被二次转发/截图泄露；内部文件需要精确到人的权限控制（只读/禁止打印/过期失效）。\n**免费工具的坑**：只能加简单密码、水印是静态文字无法追溯、权限控制形同虚设（截屏无法防范）、没有法律效力。\n**我们的解法（精细多层防护）**：\n- **加密层**：AES-256 加密 + 证书签名 + 硬件令牌支持（符合国密SM2/SM4标准可选）\n- **动态量子水印**（升级）：可见水印（工号+时间戳+用户ID，半透明覆盖整页，防拍照设计）+ 不可见数字水印（频域嵌入，截屏后仍可提取溯源）\n- **DRM权限管理**（新增精细控制）：禁止打印/复制/注释/编辑 → 打开次数限制（如\"最多打开5次\"）→ 有效期控制（精确到分钟）→ 设备绑定（限定3台设备）→ 离线/在线模式切换\n- **区块链存证**：每份文件嵌入唯一指纹→哈希上链存证（司法链/蚂蚁链）→ 生成法律效力证书\n- **泄露追溯**：任何截屏/拍照可通过不可见水印定位到具体个人→完整审计日志（时间/IP/设备/证书编号）\n**优越点**：动态水印双层防护可追溯、DRM权限精确到打开次数和设备、区块链存证具备法律效力、泄露可定位到个人。\n**触发指令**：\"加密\" / \"加水印\" / \"禁止打印\" / \"DRM保护\" / \"区块链存证\" / \"防截图\"\n**付费话术**：\"机密泄露损失无法估量。现在一键防护，双层水印+DRM+区块链存证，泄露能追溯到人，法律纠纷时上链数据就是证据\"\n\n### 5. 批量自动化处理（规则引擎增强）\n**职场场景**：认证工程师归档 100 份测试报告，需要按章节拆开并重命名；市场部将 20 个 PDF 合并成方案画册并自动生成目录。\n**免费工具的坑**：限制单文件/少量页数、不能按规则批量重命名、合并后没有目录、格式不统一、拆分规则单一。\n**我们的解法（精细五阶管道）**：\n- **智能合并**：自动排序（文件名/页数/日期/正则提取）→ 自动生成目录书签（基于文档标题AI识别）→ 格式统一化（页面大小/方向/页边距）→ 页眉页脚自动重编\n- **智能拆分**（升级）：按页数/书签/内容检测（AI识别章节标题自动拆分）→ 按空白页分隔→ 按文件大小→ 按条形码/二维码标记\n- **规则重命名**：提取标题/日期/编号/客户名称（支持正则匹配）→ 自动去重命名冲突→ 支持变量模板（如\"{日期}_{客户}_{编号}\"）\n- **格式统一**：页面大小标准化→页边距统一→页眉页脚批量添加/替换→字体嵌入标准化\n- **批处理验证**：完成后自动生成处理报告（成功/失败/警告列表）→ 失败文件单独归档便于重试\n**优越点**：从天降到分钟，规则智能提取、拆分支持内容感知、合并自动生成可点击目录、处理报告一目了然。\n**触发指令**：\"批量合并\" / \"批量拆分\" / \"按规则重命名\" / \"智能拆章节\"\n**付费话术**：\"逐个操作通常需要大半天，现在 5 分钟搞定，还能按内容自动拆分章节\"\n\n---\n\n## 九大增值能力（部分升级）\n\n| # | 能力 | 触发指令 | 输出 | 2.0升级点 |\n|---|------|---------|------|-----------|\n| 6 | 表格精准提取 | \"提取表格\" / \"表格转Excel\" | CSV / Excel / 飞书多维表格 | **升级**：支持嵌套表格、跨页表格、表头重复识别、合并单元格保持 |\n| 7 | 图文混排解析 | \"提取图文\" / \"解析内容\" | Markdown / 结构化文本 | **升级**：Docling驱动，版面保持率97.5%，图片自动提取并标注位置 |\n| 8 | 智能摘要 | \"摘要\" / \"总结\" / \"提炼重点\" | 要点摘要 | 支持长文档（200页+）分块摘要+整体汇总 |\n| 9 | 自动脱敏 | \"脱敏\" / \"打码\" / \"隐藏敏感信息\" | 脱敏后 PDF | **升级**：规则引擎+AI识别双模式，身份证号/银行卡/手机号/人名/公司名自动检测 |\n| 10 | 元数据清洗 | \"清洗元数据\" / \"擦除痕迹\" | 干净 PDF | 彻底清理作者/编辑时间/修订记录/批注者信息 |\n| 11 | 名称/编号自动化 | \"自动命名\" / \"重命名\" | 新文件名 | 正则+AI双模式提取关键信息 |\n| 12 | 两版 PDF 差异对比 | \"对比\" / \"diff\" / \"版本差异\" | 高亮差异报告 | **升级**：像素级对比+文本级对比双模式，定位到具体字符 |\n| 13 | 基于文档的即问即答 | \"问答\" / \"这份文件说了什么\" | 答案（附页码引用） | **升级**：RAG架构+本地27B模型，支持200页+长文档，答案带精确页码引用 |\n| 14 | 规格参数自动对比矩阵 | \"规格对比\" / \"参数对比\" | 对比表格 | AI自动识别规格段落，生成多产品对比表 |\n\n---\n\n## 四大专业扩展能力\n\n### 15. PDF 智能压缩（AI分层压缩）\n**职场场景**：扫描件合同/图纸太大，微信传不了（100MB限制）、邮件发不出去（25MB限制）。\n**免费工具的坑**：全局压缩文字图片一起压、没有智能分层、无法精确控制目标大小、压缩后公章模糊。\n**我们的解法**：AI智能分层（文字无损矢量保持+图片自适应降采样+线框图特殊保护）→ 目标大小模式（指定\"压到10MB\"自动迭代优化）→ 压缩前后对比预览 → 公章/签名区域特殊保护\n**优越点**：文字放大300%无模糊，公章/签名可辨认，线条图无锯齿，支持精确到MB的目标大小。\n**触发指令**：\"压缩\" / \"缩小\" / \"压到10MB以下\" / \"分层压缩\"\n**付费话术**：\"手动用PS逐页调压缩通常需要 1 小时，现在 30 秒搞定。文字无损，图片自动适配，还能精确压到你要的大小\"\n\n### 16. PDF 翻译（保留排版，术语精准）\n**职场场景**：收到英文芯片 Datasheet、日文技术规格书、外文合同，需要翻译给团队看。\n**免费工具的坑**：翻译后排版全毁、专业术语翻错（如 flip-flop 翻成\"人字拖\"）、不支持中日韩混排、无法双语对照。\n**我们的解法**：段落级翻译保留原排版坐标（Marker驱动元素定位）→ 内置行业术语库（法律/芯片/医疗/机械）→ 支持自定义术语表上传 → 双语对照输出（左原文右译文/上下对照/段落内对照）→ 翻译后排版验证\n**优越点**：排版保留率98.5%，术语准确率≥96%，支持中日英韩德混排。\n**触发指令**：\"翻译\" / \"翻成中文\" / \"双语对照\" / \"术语库翻译\"\n**付费话术**：\"请翻译公司翻这份文档通常要 500-1000 元等 2-3 天，现在 3 分钟搞定，排版几乎不动，专业术语还准\"\n\n### 17. 合同智能审查（法律AI引擎）\n**职场场景**：法务/采购收到50页合同，逐页找风险条款；中小企业没有专职法务。\n**免费工具的坑**：通用建议不针对具体合同、没有风险分级、无法标注具体位置。\n**我们的解法**：风险条款识别引擎（自动续约/天价违约金/不对等违约/模糊表述/知识产权陷阱/数据隐私/管辖地不利/保证金风险）→ 风险分级（🔴高危🟡中危🟢低危）→ 审查报告（原文高亮+法律依据+修改建议+页码定位）→ 历史合同比对→ 支持上传公司标准条款库自动比对偏差\n**优越点**：5分钟出报告，高危条款一个不漏，附法律依据和修改建议，支持自定义公司条款模板。\n**触发指令**：\"审查合同\" / \"合同体检\" / \"标风险条款\" / \"比对标准条款\"\n**付费话术**：\"请律师审这份合同通常要 2000-5000 元，现在 5 分钟出报告。还能跟你公司的标准条款自动比对偏差\"\n\n### 18. 发票/票据自动归档（财税自动化）\n**职场场景**：财务每月整理几百张发票，手动录入金额/税号/日期，还要逐张验真、去重。\n**免费工具的坑**：OCR识别率低、没有验真、不支持批量、不能去重、无法生成报销单。\n**我们的解法**：批量 OCR 识别（≥98.5%识别率）→ 自动验真（对接税务接口：真票/假票/作废/重复/异常状态）→ 智能去重（基于发票代码+号码哈希）→ 生成报销单（按员工/部门/项目分类汇总）→ 电子归档（按年月自动建文件夹+命名）→ 支持火车票/机票/出租车票/电子发票统一处理\n**优越点**：识别+验真+去重+报销单全自动，假票一个不漏，支持多种票据类型。\n**触发指令**：\"归档发票\" / \"报销汇总\" / \"验真去重\" / \"票据整理\"\n**付费话术**：\"财务手动整理100张发票通常需要 4-6 小时，现在 10 分钟搞定。假票、废票、重复票一个都跑不了\"\n\n---\n\n## 七大场景壁垒能力（深度痛点专家）\n\n### 19. 电子签名与审批流（法律级）\n**职场场景**：异地员工签劳动合同、销售批量签报价单、项目合同三级审批。\n**免费工具的坑**：手写图片没有法律效力、批量签章手动拖放200份要两天、多人签批没有流程控制。\n**我们的解法**：\n- CA数字证书签名：符合《电子签名法》第十三条，法院/仲裁认可，支持RSA/国密SM2\n- AI批量定位签章：自动定位签名区域（识别\"签字\"\"盖章\"\"签章\"关键词），200份5分钟盖完，位置精确±1mm\n- 审批流程引擎：顺序/并行/会签/条件分支，前一级没签完自动锁定下一级，支持催办/转办/加签\n- 全程留痕存证：每步记录时间/IP/设备/证书编号，生成不可篡改审计日志，支持区块链存证\n- 防篡改保护：签名后自动哈希上链，任何修改破坏签名并报警\n**触发指令**：\"签名\" / \"电子签\" / \"批量盖章\" / \"审批流\" / \"CA签名\"\n**付费话术**：\"快递合同往返3天+快递费20元/份，200份就是4000元。现在3分钟签完，法律效力同等，还能追溯每一步操作\"\n\n### 20. 批量内容替换（规则引擎+差异预览）\n**职场场景**：公司调价200份报价单统一改价格；公司搬家更新地址电话；品牌升级换Logo。\n**免费工具的坑**：只能逐份打开修改、转Word批量替换再转回格式又乱、不支持正则、无法预览差异。\n**我们的解法**：\n- 规则引擎：精确匹配/正则匹配/图片哈希匹配（旧Logo→新Logo）/二维码替换，多规则同时执行\n- 差异预览确认：每份文件哪些位置将被修改，原文→新文并排对比，标记\"可疑替换\"需人工确认\n- 容错与回滚：自动备份原始文件→替换失败的文件单独列出不混入成功批次→支持一键回滚→生成完整处理报告\n- 单次最高500份\n**触发指令**：\"批量替换\" / \"统一改价格\" / \"批量改Logo\" / \"正则替换\"\n**付费话术**：\"手动改200份报价单要8小时重复劳动，人眼疲劳必然改漏。现在5分钟搞定，还能预览差异防止改错，自带回滚不怕失误\"\n\n### 21. PDF表单创建（智能字段识别+数据收集）\n**职场场景**：HR做入职登记表、市场部做调研问卷、行政做办公用品申请单。\n**免费工具的坑**：只能买Adobe Acrobat Pro（3000+/年）、字段一个个手动拖放、没有自动计算、没有联动。\n**我们的解法**：\n- 一键生成可填写域：AI自动检测\"姓名：____\"等下划线区域和框线区域，智能判断字段类型（文本/数字/日期/单选/多选/下拉/签名域）\n- 高级功能：自动计算（数量×单价=小计，含税价计算）、字段联动（条件显示/隐藏/自动填充）、数据验证（手机号/身份证/邮箱格式校验）、下拉框批量导入（从Excel导入选项列表）\n- 数据收集：生成表单链接/二维码，飞书/微信直接填写，提交数据实时汇总到多维表格，支持数据导出Excel\n- 模板库：预置100+常用表单模板（入职/报销/请假/采购/客户调研）\n**触发指令**：\"生成表单\" / \"做可填写PDF\" / \"问卷转表单\" / \"表单模板\"\n**付费话术**：\"原来要买Adobe Acrobat Pro（3000+/年）拖2小时字段，现在一键生成，还能自动计算和实时汇总数据\"\n\n### 22. 图纸精准测量（AI比例尺识别）\n**职场场景**：建筑设计师量墙距、机械工程师算零件面积、项目经理核对平面图。\n**免费工具的坑**：PDF阅读器没有测量、CAD软件几万块且PDF导入比例尺错乱、手动换算易错。\n**我们的解法**：\n- 自动识别比例尺：扫描图纸上的\"1:100\"\"1:50\"标注自动识别校准，无标注图纸通过已知尺寸反推，支持多比例尺分区识别\n- 多维度测量：距离/面积/角度/坐标/周长，点击两点自动显示实际长度，支持连续测量\n- 标注与导出：测量结果直接标注在图纸上（带引线+数值+单位+颜色区分），导出Excel测量数据表，支持批量测量（一次框选多个区域批量输出面积表）\n- 单位转换：自动换算mm/cm/m/英寸/英尺\n**触发指令**：\"测量图纸\" / \"量尺寸\" / \"算面积\" / \"比例尺校准\"\n**付费话术**：\"打印A0图纸一次50元，用尺子量还容易错。现在PDF上直接精确测量，自动按比例尺换算，结果还能标注导出\"\n\n### 23. 翻页电子书制作（精装画册体验）\n**职场场景**：销售给客户发产品手册、市场部做品牌宣传册。\n**免费工具的坑**：PDF死板、转电子书后排错乱、手机打开变形。\n**我们的解法**：\n- 拟真翻页效果：HTML5 Canvas渲染，纸张卷曲动画+阴影，60fps流畅，支持拖拽/点击/键盘/滚轮/触屏翻页\n- 智能适配多端：手机单页自适应、平板双页展开、电脑全屏演示、电视横屏展示\n- 增强功能：自动生成目录导航、全文搜索高亮、热点链接跳转、音频/视频嵌入、分享控制（允许下载/仅在线/密码访问）\n- 一键部署：在线链接直接发给客户，可嵌入官网（iframe），可生成离线包展会无网络使用，支持自定义域名\n**触发指令**：\"做翻页书\" / \"电子书\" / \"手册转网页\" / \"画册\"\n**付费话术**：\"给客户发PDF像发作业，翻页电子书像发精装画册。客户在线翻阅的体验专业感差一个档次，停留时长能差3倍\"\n\n### 24. 印刷级导出（预检一键通过）\n**职场场景**：设计部做好宣传册发给印刷厂，反复沟通文件不合格。\n**免费工具的坑**：不懂印刷参数、加出血区不规范、文字没转曲、图片分辨率不够。\n**我们的解法**：\n- 印刷预检一键导出：RGB→CMYK（ICC配置文件可选Japan Color 2001/FOGRA39/GRACoL）、出血区自动添加（3mm/5mm内容智能外扩）、文字自动转曲（所有字体转矢量路径+子集化）、图片分辨率检测（低于300dpi自动预警+智能超分）、输出PDF/X-1a/PDF/X-4标准\n- 预检报告：生成完整预检报告（色彩空间/字体嵌入/图片分辨率/出血区/专色/叠印设置逐项检查），印刷厂直接接收零返工\n- 手机阅读优化：流式布局单栏自适应、图片自适应点击看原图、暗色模式、导出EPUB/HTML5\n**触发指令**：\"印刷导出\" / \"CMYK导出\" / \"出血区\" / \"转曲\" / \"预检报告\"\n**付费话术**：\"印刷厂说文件不合格要重做，沟通来回2-3天。现在一键导出CMYK+出血区+转曲，预检报告逐项过关，直接上印刷机，零返工\"\n\n### 25. 密文级敏感信息永久删除（军事级销毁）\n**职场场景**：招标公告隐藏报价、离职交接删除身份证号、法院卷宗抹除隐私。\n**免费工具的坑**：\"涂黑\"只是覆盖矩形底层文本还在、一些工具只是隐藏图层、没有删除验证、无法律证明。\n**我们的解法**：\n- 真正删除底层对象：定位敏感文本的PDF文本对象→从内容流彻底移除绘制指令（不是覆盖）→同步清理字体引用/编码映射/位置矩阵/XMP元数据→图片中的敏感信息用AI图像修复（inpainting）彻底抹除像素而非打码\n- 删除彻底性验证（三阶验证）：删除后用pdfplumber/PyMuPDF全文提取扫描确认0命中→正则二次扫描→二进制层面确认对象已移除→生成\"删除验证报告\"\n- 删除证书与审计：生成PDF/A标准删除证书（记录删除时间/操作人/内容类型/验证结果/三阶验证通过标识）→证书嵌入PDF元数据可供第三方审计→符合GDPR/个人信息保护法合规要求\n- 批量删除：上传规则（如\"删除所有11位连续数字\"\"删除所有邮箱格式\"\"删除所有人名\"），AI辅助识别敏感信息\n**触发指令**：\"彻底删除\" / \"密文删除\" / \"永久抹除\" / \"不是涂黑\" / \"合规删除\"\n**付费话术**：\"涂黑只是遮眼，底层数据还在，恢复工具10秒就能提取。我们彻底删除文本对象，连恢复工具都找不回来，三阶验证确认干净，还附带法律级删除证书，GDPR和个人信息保护法合规\"\n\n---\n\n## 五大补齐短板的新增能力（2.0版本新增）\n\n### 26. 扫描件AI画质增强（文档照片修复专家）\n**职场场景**：用手机拍照的文档有阴影、手指按在纸上、页面弯曲、灯光不均、打印模糊，传统OCR识别率低，肉眼看着也难受。\n**免费工具的坑**：没有专门的文档画质增强工具、用PS手动调一页要10分钟、阴影去不掉、弯曲页面无法展平、手指遮挡无法修复。\n**我们的解法（专业文档修复管道）**：\n- AI文档分割：U2-Net精确分离文档前景与背景\n- 去阴影：背景光照估计+阴影区域检测+均匀化重建，彻底消除拍照阴影\n- 去手指/异物修复：AI检测手指/异物遮挡区域→文档内容inpainting智能修复，被挡住的内容自动补全\n- 曲线展平：DocUNet几何校正→弯曲页面自动展平→透视校正→文档矩形化\n- 智能黑白化：自适应阈值二值化→背景漂白→前景文字增强→印章/红色标记保护性保留\n- 摩尔纹/噪点去除：扫描件特有摩尔纹检测去除→降噪锐化→分辨率智能超分重建\n**优越点**：修复后的文档达到扫描仪级品质，OCR识别率提升15-25%，打印效果媲美原扫。\n**触发指令**：\"修复扫描件\" / \"去阴影\" / \"展平\" / \"去手指\" / \"文档美白\" / \"扫描件增强\"\n**付费话术**：\"手机拍的文档有阴影、手指、弯曲，看着不专业OCR还认不全。现在一键修复，达到扫描仪级品质，直接能归档或打印\"\n\n### 27. 智能书签与目录自动生成（长文档导航）\n**职场场景**：收到几百页的技术手册、标书、论文集，没有书签，翻找某个章节要翻半天。\n**免费工具的坑**：只能手动一页页加书签、无法识别章节层级、标题识别不准、页码对不上。\n**我们的解法**：\n- AI章节识别：Marker/Docling内容分析→自动识别标题层级（H1/H2/H3）→区分正文标题与页眉/图表标题→构建层级目录树\n- 智能书签生成：自动生成可点击PDF书签→支持多级嵌套→支持自定义展开层级\n- 页码校正：自动检测实际页码与标注页码偏差→目录页码自动对齐→支持罗马数字/阿拉伯数字混排\n- 目录页生成：自动插入/更新目录页（带页码+可点击链接）→ 支持多种目录样式\n**优越点**：200页文档3秒生成完整书签，标题识别准确率≥95%，页码自动校正。\n**触发指令**：\"生成书签\" / \"自动生成目录\" / \"加导航\" / \"书签\"\n**付费话术**：\"100页的标书手动加书签要30分钟还容易漏。现在3秒自动生成多级书签，还能校正页码偏差\"\n\n### 28. PDF无障碍标签化（Accessibility / WCAG合规）\n**职场场景**：企业有视障员工需要阅读PDF；政府/学校/大型企业网站需要满足无障碍法规（中国《无障碍环境建设法》、美国ADA、欧盟EN 301 549）；被投诉PDF无法被屏幕阅读器朗读。\n**免费工具的坑**：99%的PDF工具不支持Accessibility、手动加标签需要Adobe Acrobat Pro且一页页操作极其繁琐、不知道什么是WCAG合规、标签结构容易出错。\n**我们的解法**：\n- 无障碍自动检测：一键扫描PDF的Accessibility问题清单（缺失标签树/无阅读顺序/图片无替代文本/表格无摘要/色彩对比度不足/无文档标题/无语言标记）\n- 智能标签生成：自动生成完整标签树（Tags Tree）→确定正确阅读顺序→标题层级化（H1-H6）→段落/列表/表格语义标记\n- 图片Alt文本：AI自动生成图片描述（alt text）→支持批量编辑修改→复杂图表生成详细描述\n- 表格无障碍化：自动生成表格摘要（Table Summary）→表头关联标记（TH/TD）→复杂表格阅读顺序优化\n- 合规输出：导出WCAG 2.1 AA/AAA级别合规PDF→生成无障碍合规报告→支持PDF/UA（ISO 14289）标准\n**优越点**：一键检测+一键修复，合规率达到WCAG 2.1 AA标准，支持屏幕阅读器（NVDA/JAWS/VoiceOver）完美朗读。\n**触发指令**：\"无障碍\" / \"Accessibility\" / \"WCAG\" / \"加标签\" / \"屏幕阅读器\" / \"合规检测\"\n**付费话术**：\"手动给一个50页PDF加无障碍标签需要4-6小时专业操作。现在一键检测+一键修复，满足国内外无障碍法规要求，避免法律风险\"\n\n### 29. 手写笔记智能识别与数字化（笔迹专家）\n**职场场景**：会议纪要手写草稿、课堂笔记、客户拜访手写记录，需要整理成电子文档；手写待办事项容易遗忘。\n**免费工具的坑**：普通OCR手写识别率极低（<60%）、连笔字/潦草字无法识别、不分段落和结构、表格/图示无法处理、待办事项需手动提取。\n**我们的解法**：\n- 手写体专用识别：PaddleOCR手写增强模型 + 多模态LLM笔迹理解→连笔字/潦草字/速记符号增强识别（准确率>90%）\n- 智能结构化分块：AI自动划分区域（标题/正文/重点标记/待办框/时间戳/签名）→保持原文档空间结构\n- 内容智能整理：手写笔记→结构化Markdown/飞书文档→重点内容自动加粗/高亮标记→待办事项（□/☑）自动提取为任务列表\n- 混排处理：手写文字+手绘图表+粘贴打印件混排智能分离→图表区域单独标注→打印件区域用印刷体OCR提高精度\n**优越点**：手写识别率>90%（行业领先），自动结构整理，待办自动提取，支持中英文混写。\n**触发指令**：\"手写识别\" / \"笔记整理\" / \"手写转文字\" / \"会议纪要整理\"\n**付费话术**：\"手写笔记整理通常需要1小时手动重打。现在5分钟完成识别+结构化整理，待办事项还能自动提取到任务清单\"\n\n### 30. PDF/A长期归档标准转换与修复（档案合规）\n**职场场景**：企业档案管理需要符合长期保存标准；政府/国企/金融机构要求PDF/A归档；担心10年后PDF打不开因为字体缺失/格式过时。\n**免费工具的坑**：普通工具不支持PDF/A标准、不知道选哪个级别（PDF/A-1a/2a/3a/b/u）、字体嵌入问题无法自动修复、转换后合规性无法验证、色彩空间不对。\n**我们的解法**：\n- 智能级别推荐：根据文档用途自动推荐PDF/A级别（A-1b基础归档/A-2a可搜索/A-3a含附件/A-4现代化）\n- 一键合规转换：PDF→PDF/A自动转换→字体缺失自动嵌入（自动下载开源替代字体）→色彩空间转换（RGB→sRGB/CMYK）→透明度展平→JavaScript移除\n- 合规性验证：转换后逐条验证ISO 19005标准合规性→生成详细合规报告（通过项/警告项/失败项）→失败项自动修复建议\n- 档案元数据：自动生成/补全档案级元数据（标题/作者/主题/关键词/创建者/生产者/创建日期/修改日期）→符合Dublin Core标准\n- 批量归档：批量转换整个文件夹→按日期自动分类→生成归档清单\n**优越点**：一键转换通过ISO 19005验证，自动修复字体/色彩/透明度问题，生成档案级合规报告。\n**触发指令**：\"PDF/A\" / \"归档\" / \"长期保存\" / \"档案转换\" / \"合规归档\"\n**付费话术**：\"档案不合规10年后可能打不开。现在一键转换为PDF/A国际标准，自动修复所有合规问题，附合规报告，档案馆直接接收\"\n\n---\n\n## Core Workflow\n\n### Trigger\n- **飞书 @机器人 + 上传 PDF + 文字指令**\n- **群聊中 @并附文件**\n- **单聊直接发送文件+指令**\n\n### Step 1: 智能文档分类与路由\n\n2.0版本增加精细分类路由：\n| 类型 | 检测方式 | 路由管道 | 工具链 |\n|------|---------|---------|--------|\n| 文本PDF | 有完整文本层+标准字体 | 直接处理管道 | Docling / PyMuPDF |\n| 扫描PDF | 无文本层，纯图片 | OCR预处理→画质增强→识别 | AI画质修复→PaddleOCR→LLM校正 |\n| 混合PDF | 部分文本+部分图片/扫描 | 混合管道 | 页面级智能路由 |\n| 复杂排版 | 多栏/杂志/学术论文 | 版面分析优先管道 | Marker / OpenParse |\n| 大文件 | >50页或>50MB | 分块处理管道 | 异步队列+流式处理 |\n\n### Step 2: 精细化任务执行\n\n解析指令，匹配30项能力。每项能力执行\"四阶质量管道\"：\n1. **预处理**：文档类型分析→质量评估→必要的前置修复\n2. **智能分析**：AI理解文档结构→识别关键元素→制定最优处理策略\n3. **精细化执行**：使用最优引擎处理→参数自适应调整→中间结果验证\n4. **质量验证**：输出质量检查→与标准对比→必要时自动重试\n\n### Step 3: AI增强层（2.0升级）\n\n复杂文档的AI处理升级：\n- **版面理解**：Docling多栏/图表/公式/页眉页脚精确识别\n- **表格结构恢复**：嵌套表/跨页表/合并单元格/表头重复处理\n- **语义理解**：行业术语库匹配→上下文语义校正→多模态理解（文字+图表+公式）\n- **质量预测**：处理前预判难度→处理中监控质量→处理后验证精度\n\n### Step 4: 价值交付\n\n每项输出必须包含\"时间节省/成本节省/风险消除\"量化信息：\n- **文本/Markdown** → 直接消息\n- **文件（PDF/Excel/Word）** → 上传到聊天\n- **结构化数据** → 飞书多维表格链接\n- **在线链接** → 翻页电子书/表单链接\n- **报告** → 审查报告/预检报告/合规报告/差异报告\n- **处理日志** → 批量任务处理报告（成功/失败/详情）\n\n---\n\n## Tech Stack（2.0企业级升级）\n\n| 层级 | 1.3版本 | **2.0升级方案** |\n|------|---------|----------------|\n| **文档解析引擎** | PyMuPDF, pdfplumber, LayoutParser | **Docling** (IBM企业级) + **Marker** (公式/学术优化) + **OpenParse** (版面分析) + PyMuPDF辅助 |\n| **OCR与画质** | PaddleOCR, Tesseract + OpenCV基础预处理 | **PaddleOCR+手写增强** + **U2-Net文档分割** + **DocUNet曲线展平** + 图像修复inpainting + 超分重建 |\n| **转换引擎** | LibreOffice headless, pdf2image | **Docling/Marker双引擎** + LibreOffice辅助 + 矢量图保留管道 |\n| **AI/LLM层** | Cloud model + local 27B | **多模态LLM** (文档理解) + **local 27B** (敏感文档) + **行业术语库** |\n| **RAG/问答** | Chroma/FAISS基础 | **优化RAG架构** + 200页+长文档分块策略 + 精确引用定位 |\n| **差异对比** | pdf-diff基础 | **像素级对比** + **文本级对比**双模式 |\n| **安全与DRM** | PyPDF2, pikepdf基础 | **AES-256+国密SM2/SM4** + **双层数字水印** (可见+不可见) + **DRM权限引擎** + **区块链存证** |\n| **队列与异步** | 基础异步队列 | **增强任务队列** + 流式进度反馈 + 断点续传 |\n| **压缩** | PyMuPDF + OpenCV基础 | **AI分层压缩引擎** (文字/图片/线框分层处理) + 目标大小迭代优化 |\n| **翻译** | Cloud translation API基础 | **Cloud translation + 术语库 + 坐标映射保留** (Marker驱动) |\n| **合同审查** | Legal LLM + rule engine | **Legal LLM + 扩展风险规则库 + 公司条款模板比对** |\n| **发票OCR** | Specialized invoice OCR | **增强发票OCR + 税务API + 多票据类型** (火车票/机票/出租车) |\n| **电子签名** | CA certificate基础 | **CA证书+国密SM2** + AI定位 + 审批引擎 + 区块链存证 |\n| **批量替换** | Rule engine + regex | **增强规则引擎 + 图片哈希 + 差异预览 + 一键回滚** |\n| **表单构建** | Field auto-detection基础 | **AI字段识别增强 + 计算引擎 + 条件逻辑 + 飞书数据汇总** |\n| **图纸测量** | Scale auto-detection基础 | **AI比例尺识别 + 多维度测量 + 批量测量导出** |\n| **翻页电子书** | HTML5 Canvas基础 | **HTML5 Canvas 60fps + 富媒体嵌入 + 离线包 + 自定义域名** |\n| **印刷导出** | CMYK基础转换 | **ICC配置管理 + PDF/X验证 + 预检报告 + 手机EPUB导出** |\n| **永久删除** | Content stream removal | **三阶验证删除 + AI图像修复inpainting + 法律级删除证书** |\n| **★扫描增强** (新增) | — | **U2-Net + DocUNet + inpainting + 超分** |\n| **★书签生成** (新增) | — | **Marker/Docling章节识别 + 层级目录 + 页码校正** |\n| **★无障碍** (新增) | — | **标签树生成 + Alt文本 + WCAG 2.1 AA验证** |\n| **★手写识别** (新增) | — | **PaddleOCR手写增强 + 多模态LLM + 结构化整理** |\n| **★PDF/A归档** (新增) | — | **ISO 19005转换 + 字体嵌入修复 + 合规验证报告** |\n\n---\n\n## Progress Feedback（精细化进度）\n\n长操作发送实时精细化进度：\n- \"📄 正在解析文档结构（Docling引擎）第 12/45 页…\"\n- \"🔍 检测到扫描页面，启动AI画质增强→去阴影→展平…第 5/20 页\"\n- \"🧠 OCR识别中（印刷体97%精度），预计还需 30 秒…\"\n- \"📊 表格结构重建完成，共识别 8 个表格（含2个跨页嵌套表）…\"\n- \"🖨️ 印刷预检中→色彩空间✓ 字体嵌入✓ 图片分辨率⚠️3张低于300dpi已预警…\"\n- \"🔒 DRM保护生成中→加密✓ 双层水印✓ 区块链存证✓ 权限设置✓\"\n- \"✅ 处理完成！质量评分：排版保真98.2% | 表格对齐99.1% | 字体匹配94.5%\"\n- \"批量替换进度：185/200 完成 | 5个需确认 | 10个失败已单独列出\"\n- \"PDF/A归档转换：字体嵌入修复3处 | 色彩空间转换✓ | 合规验证通过\"\n\n---\n\n## Constraints（2.0升级限制）\n\n| 限制项 | 1.3版本 | **2.0版本** |\n|--------|---------|-------------|\n| 单文件大小 | 100MB | **200MB**（大文件自动分块） |\n| 单次页数 | 200页 | **500页**（长文档优化处理） |\n| OCR批量页数 | ≤50页 | **≤100页** |\n| 并发任务 | ≤3 | **≤5** |\n| 单次任务超时 | 5分钟 | **10分钟**（复杂任务如翻译/增强自动延长） |\n| 敏感文档处理 | local 27B | **local 27B + 本地OCR**（不上云） |\n| 批量替换 | 500文件 | **500文件**（保留） |\n| 永久删除 | 200文件 | **200文件**（保留） |\n| 新增-扫描增强 | — | **≤50页/批次** |\n| 新增-手写识别 | — | **≤20页/批次**（手写计算量大） |\n| 新增-PDF/A归档 | — | **≤100文件/批次** |\n| 新增-无障碍标签 | — | **≤200页/任务** |\n\n---\n\n## Resources\n\n- **Command reference**: See `references/command-guide-v2.md`（2.0新增指令手册）\n- **Implementation details**: See `references/tech-spec-v2.md`（2.0技术架构详细说明）\n- **Feishu integration**: See `references/feishu-setup-v2.md`（2.0飞书集成增强配置）\n- **OCR configuration**: See `references/ocr-config-v2.md`（2.0包含扫描增强和手写识别配置）\n- **Accessibility guide**: See `references/accessibility-setup.md`（新增-无障碍配置指南）\n- **PDF/A archival guide**: See `references/pdfa-archival-guide.md`（新增-归档转换操作手册）\n- **Agent config**: See `config/pdf-master-agent-v2.md`（2.0完整Agent训练文件含30项能力Few-Shot示例）\n- **Quality benchmarks**: See `references/quality-benchmarks.md`（2.0新增-各项能力质量基准指标）\n\n---\n\n## 版本演进记录\n\n| 版本 | 能力数 | 关键升级 |\n|------|--------|---------|\n| 1.0 | 基础 | 核心功能上线 |\n| 1.3 | 25项 | 五大核心+四大扩展+七大壁垒+九大增值 |\n| **2.0** | **30项** | **技术栈升级(Docling/Marker/OpenParse)+精细度革命+五大新增能力(扫描增强/书签生成/无障碍/手写识别/PDF/A归档)** |\n\nFile v1.0.0:_meta.json\n\n{\n  \"ownerId\": \"kn7f0d8egkxsnntb67gq7hrxzd86cwz5\",\n  \"slug\": \"pdf-master\",\n  \"version\": \"1.0.0\",\n  \"publishedAt\": 1779542927901\n}","readmeExcerpt":"Skill: PDF万能大师 Owner: ford828 Summary: 全能 PDF 智能处理技能，覆盖 25 项能力五大核心（Office 高保真互转、扫描件 OCR、PDF 直接编辑、加密水印权限、批量合并拆分重命名）、九大增值（表格提取、图文解析、摘要、脱敏、元数据清洗、自动命名、版本对比、文档问答、规格对比矩阵）、四大扩展（智能压缩、排版保留翻译、合同风险审查、发票验真归档）、七大壁垒（电子签名审批流、批量内容替换、表单创建、图纸测量、翻页电子书、印刷级导出、密文级永久删除）。当用户上传 PDF 并提出转换、识别、编辑、加密、压缩、翻译、审查、归档、签名、替换、表单、测量、电子书、印刷、删除等需求，或提到\"转Word\"\"OCR\"\"加水印\"\"压缩到xxMB\" Tags: latest:2.1.0 Version history: v2.1.0 | 2026-07-26T13:42:21.357Z | user - 引","codeSnippets":[],"executableExamples":[{"language":"bash","snippet":"# 1. 安装技能\nclawhub install pdf-master\n\n# 2. 一键装依赖（幂等；装完自动自检，输出能力就绪矩阵）\nbash setup.sh            # 核心依赖；--all 装全部增强项\n# 也可手动：pip install -r requirements.txt\n\n# 3. 之后直接用自然语言：\n\"把这份 PDF 转成 Word，表格要保持可编辑\"\n\"这 100 张发票帮我验真去重，生成报销单\"\n\"把 200 份报价单的 1999 改成 2199，先预览差异\"\n\"这份招标公告里的报价和联系方式彻底删除，不是涂黑\""},{"language":"text","snippet":"@万能PDF大师 帮我处理这100份测试报告：按日期重命名，然后合并成一本带目录的手册。\n→ #11 重命名 → #5 合并"},{"language":"text","snippet":"@万能PDF大师 这份扫描件合同80MB微信发不了，压到20MB以下，文字必须清楚。\n→ #2 OCR检测（如需）→ #15 目标压缩"},{"language":"text","snippet":"@万能PDF大师 这份50页英文Datasheet翻译成中文，保留排版，术语要准。\n→ #16（内置术语库，交付附术语对照表）"},{"language":"text","snippet":"@万能PDF大师 这份招标文件要公开，投标方报价和联系方式彻底删除，不是涂黑。\n→ #25（预览→确认→真删→双引擎验证→删除证书）"},{"language":"text","snippet":"@万能PDF大师 新旧两版合同对比一下，重点看价格和违约条款变了没。\n→ #12 差异对比 → 关键条款联动 #17 风险提示"}],"parameters":null,"dependencies":[],"permissions":[],"extractedFiles":[{"path":"SKILL.md","content":"---\nname: pdf-master\ndescription: 全能 PDF 智能处理技能，覆盖 25 项能力五大核心（Office 高保真互转、扫描件 OCR、PDF 直接编辑、加密水印权限、批量合并拆分重命名）、九大增值（表格提取、图文解析、摘要、脱敏、元数据清洗、自动命名、版本对比、文档问答、规格对比矩阵）、四大扩展（智能压缩、排版保留翻译、合同风险审查、发票验真归档）、七大壁垒（电子签名审批流、批量内容替换、表单创建、图纸测量、翻页电子书、印刷级导出、密文级永久删除）。当用户上传 PDF 并提出转换、识别、编辑、加密、压缩、翻译、审查、归档、签名、替换、表单、测量、电子书、印刷、删除等需求，或提到\"转Word\"\"OCR\"\"加水印\"\"压缩到xxMB\"\"审查合同\"\"批量盖章\"\"彻底删除\"等指令时触发。飞书机器人场景原生支持。\nlicense: MIT-0\nmetadata:\n  version: 2.1.0\n  openclaw:\n    requires:\n      bins: [python3]\n      optional_bins: [tesseract, libreoffice]\n---\n\n# 万能 PDF 大师\n\n一站式 PDF 处理系统，25 项能力按四层组织。本文件是**路由与流程主控**：所有能力的详细执行规程、质量标准、错误降级、价值话术均在 `references/` 中按需加载。\n\n---\n\n## 核心工作流\n\n每个请求严格按 5 步执行：\n\n### Step 0: 环境闸门（首次使用或脚本报 ImportError 时）\n\n运行 `python3 scripts/check_env.py` 查看能力就绪矩阵：\n\n- 核心缺失 → 引导用户执行 `bash setup.sh`（或 `pip install -r requirements.txt`），装好再继续\n- 增强项缺失 → 不阻断，按 `references/error-handling.md` 降级链执行并告知质量差异\n- 环境齐备时跳过本步，不要每次请求都跑\n\n### Step 1: 接收与检测\n\n收到 PDF 后先运行 `scripts/pdf_info.py` 获取：页数、大小、加密状态、文本层有无、扫描件占比、元数据。**未检测不得开始处理。**\n\n| 检测结果 | 路由 |\n|---------|------|\n| 有文本层 | 文本型管道（PyMuPDF / pdfplumber） |\n| 无文本层、纯图像 | OCR 管道（先读 `references/ocr-config.md`） |\n| 部分文本+部分图像 | 混合管道（文本页直取，图像页 OCR） |\n| 加密文件 | 索要密码；无法提供则终止并说明 |\n\n### Step 2: 意图路由\n\n用「能力路由总表」匹配用户指令到能力编号。匹配规则：\n\n1. **单意图命中** → 直接进入对应能力规程\n2. **复合指令**（如\"按日期重命名后合并成带目录的手册\"）→ 拆成能力链，按依赖顺序执行（重命名 #11 → 合并 #5），每步完成后汇报\n3. **意图模糊**（如\"处理一下这个文件\"）→ 列出最可能的 2-3 个能力让用户选择，**不得自行猜测执行**\n4. **无法匹配** → 说明能力边界，推荐最接近的能力\n\n20 个带标准路由的 Few-Shot 示例见 `references/few-shot-examples.md`，路由拿不准时先查它。\n\n### Step 3: 执行前确认\n\n以下情况必须先确认再动手：\n\n- **批量任务**（>10 文件）：报出文件数、预计耗时、将执行的操作清单\n- **不可逆操作**（密文删除 #25、批量替换 #20、直接编辑 #3）：展示预览/差异，等用户说\"确认\"\n- **目标参数缺失**（压缩没说目标大小、改名没给规则）：给出默认值并询问是否采用\n\n### Step 4: 执行与进度反馈\n\n- 确定性操作优先调用 `scripts/` 下脚本，不重复造轮子\n- 长任务（>30 秒）每 20-30 秒发一次进度：\"正在解析第 3/20 页…\"\n- 任一环节失败 → 按 `references/error-handling.md` 的降级链处理，**不得静默失败**\n\n### Step 5: 交付与价值确认\n\n交付时四件事缺一不可：\n\n1. **结果文件**：上传文件 / 发文本 / 给多维表格链接\n2. **质检结论**：按 `references/quality-standards.md` 对应能力的验收项自检并报告（如\"表格 12 个全部原生可编辑，图片偏移 <5px\"）\n3. **异常清单**：跳过的页、失败的文件、降级的环节，逐一明示\n4. **价值反馈**：一句话省时/省钱/避险对比，话术从 `references/value-messaging.md` 取，不得编造数字\n\n---\n\n## 能力路由总表\n\n**第一层 · 五大核心**（详细规程 `references/capabilities-core.md`）\n\n| # | 能力 | 触发关键词 | 脚本 |\n|---|------|-----------|------|\n| 1 | PDF↔Office 高保真互转 | 转Word / 转Excel / 转PPT | `pdf_convert.py` |\n| 2 | 扫描件 OCR 精准识别 | OCR / 识别 / 扫描件转文字 | `pdf_ocr.py` |\n| 3 | PDF 内直接编辑 | 改文字 / 改参数 / 替换图片 | —（规程执行） |\n| 4 | 安全保护（加密/权限/水印） | 加密 / 加水印 / 禁止打印 | `pdf_watermark.py` |\n| 5 | 批量自动化处理 | 批量合并 / 拆分 / 重命名 | `pdf_merge.py` `pdf_split.py` |\n\n**第二层 · 九大增值**（详细规程 `references/capabilities-value.md`）\n\n| # | 能力 | 触发关键词 | 脚本 |\n|---|------|-----------|------|\n| 6 | 表格精准提取 | 提取表格 / 表格转Excel | `pdf_extract_tables.py` |\n| 7 | 图文混排解析 | 提取图文 / 解析内容 | —（规程执行） |\n| 8 | 智能摘要 | 摘要 / 总结 / 提炼重点 | —（LLM 执行） |\n| 9 | 自动脱敏 | 脱敏 / 打码 / 隐藏敏感信息 | —（规程执行） |\n| 10 | 元数据清洗 | 清洗元数据 / 擦除痕迹 | `pdf_info.py --scrub` |\n| 11 | 名称/编号自动化 | 自动命名 / 重命名 | —（规程执行） |\n| 12 | 两版差异对比 | 对比 / diff / 版本差异 | —（规程执行） |\n| 13 | 文档即问即答 | 问答 / 这份文件说了什么 | —（RAG 规程） |\n| 14 | 规格"},{"path":"README.md","content":"# 万能 PDF 大师（pdf-master）\n\n一站式 PDF 智能处理技能：**25 项能力 · 4 层架构 · 10 个实测脚本 · 全套质量/安全护栏**。\n不是功能堆砌，而是针对职场真实痛点的工程化解决方案——每项能力都有明确的执行规程、验收标准和降级策略。\n\n## 为什么选它\n\n- **路由精准**：SKILL.md 内置「能力路由总表」+ 20 个 Few-Shot 示例，指令解析不猜测、不跑偏\n- **执行稳定**：10 个高频能力脚本化（合并/拆分/OCR/压缩/水印/表格提取/密文删除/转换/批量替换/信息检测），输出可复现\n- **质量可验**：25 项能力逐项合格线（如\"表格原生可编辑、图片偏移 ≤5px、中文识别率 >95%\"），交付必过质检\n- **失败有兜底**：完整降级链（首选→降级→部分交付→明确终止），不静默失败、不伪造结果\n- **安全有红线**：脱敏 vs 密文删除严格区分、CA 签名效力边界清晰、涉密文档本地模型路由、7 条红线清单\n\n## 能力总览（25 项）\n\n| 层 | 能力 |\n|----|------|\n| 五大核心 | ① Office 高保真互转 ② 扫描件 OCR ③ PDF 直接编辑 ④ 加密/权限/动态水印 ⑤ 批量合并拆分重命名 |\n| 九大增值 | ⑥ 表格提取 ⑦ 图文解析 ⑧ 智能摘要 ⑨ 自动脱敏 ⑩ 元数据清洗 ⑪ 自动命名 ⑫ 版本对比 ⑬ 文档问答 ⑭ 规格对比矩阵 |\n| 四大扩展 | ⑮ 智能压缩（目标大小迭代）⑯ 翻译保留排版 ⑰ 合同风险审查 ⑱ 发票验真归档 |\n| 七大壁垒 | ⑲ 电子签名审批流 ⑳ 批量内容替换（可回滚）㉑ 表单创建 ㉒ 图纸测量 ㉓ 翻页电子书 ㉔ 印刷级导出（CMYK/出血/转曲）㉕ 密文级永久删除（双引擎验证+删除证书） |\n\n## 快速开始\n\n```bash\n# 1. 安装技能\nclawhub install pdf-master\n\n# 2. 一键装依赖（幂等；装完自动自检，输出能力就绪矩阵）\nbash setup.sh            # 核心依赖；--all 装全部增强项\n# 也可手动：pip install -r requirements.txt\n\n# 3. 之后直接用自然语言：\n\"把这份 PDF 转成 Word，表格要保持可编辑\"\n\"这 100 张发票帮我验真去重，生成报销单\"\n\"把 200 份报价单的 1999 改成 2199，先预览差异\"\n\"这份招标公告里的报价和联系方式彻底删除，不是涂黑\"\n```\n\n## 脚本速查（scripts/）\n\n| 脚本 | 用途 |\n|------|------|\n| `pdf_info.py` | 类型检测（文本/扫描/混合/加密）、元数据清洗 |\n| `pdf_merge.py` / `pdf_split.py` | 合并（带目录书签）/ 拆分（页范围/书签） |\n| `pdf_ocr.py` | 扫描件 → 可搜索 PDF（隐形文本层），PaddleOCR/Tesseract 双引擎 |\n| `pdf_compress.py` | 分层压缩到目标大小，质量地板保护文字清晰度 |\n| `pdf_watermark.py` | 动态水印（含中文）+ AES-256 加密 + 权限控制 |\n| `pdf_extract_tables.py` | 表格 → CSV/Excel |\n| `pdf_convert.py` | PDF → Word（pdf2docx）/ Excel |\n| `pdf_redact.py` | 密文级删除 + 双引擎验证 + 删除证书 |\n| `pdf_batch_replace.py` | 批量替换：预览 → 备份 → 执行 → 一键回滚 |\n\n## 环境依赖\n\n- 必需：`python3` + `pymupdf` `pdfplumber` `pikepdf` `pypdf` `pandas` `openpyxl`\n- 可选：`tesseract`（OCR 兜底）、`libreoffice`（复杂版面转换）、`pdf2docx` `paddleocr`（增强）\n\n## 文档地图（references/）\n\n能力规程（core/value/pro）· Few-Shot 路由示例 · 质量验收标准 · 错误降级策略 · 安全合规护栏 · 命令速查 · 价值话术库 · 技术规范 · OCR 调参 · 飞书集成\n\n## 许可证\n\nMIT-0：任何人可自由使用、修改、再分发（含商业用途），无需署名。"},{"path":"_meta.json","content":"{\n  \"ownerId\": \"kn7f0d8egkxsnntb67gq7hrxzd86cwz5\",\n  \"slug\": \"pdf-master\",\n  \"version\": \"2.1.0\",\n  \"publishedAt\": 1785073341357\n}"},{"path":"references/capabilities-core.md","content":"# 核心能力规程（#1-#5）\n\n> 执行对应能力前完整阅读本节。每项能力按「执行步骤 → 验收标准 → 常见坑」组织。\n> 交付话术见 `value-messaging.md`，通用质检项见 `quality-standards.md`。\n\n## 目录\n- [#1 PDF↔Office 高保真互转](#1-pdfoffice-高保真互转)\n- [#2 扫描件 OCR 精准识别](#2-扫描件-ocr-精准识别)\n- [#3 PDF 内直接编辑](#3-pdf-内直接编辑)\n- [#4 安全保护（加密/权限/水印）](#4-安全保护加密权限水印)\n- [#5 批量自动化处理](#5-批量自动化处理)\n\n---\n\n## #1 PDF↔Office 高保真互转\n\n**目标**：转换后排版还原度可编辑、可用，不是\"能打开就行\"。\n\n### 执行步骤\n\n1. `pdf_info.py` 检测文本层。扫描件 → 先走 #2 OCR 再转换，并告知用户多一步\n2. 按目标格式选管道：\n   - **PDF→Word**：首选 `scripts/pdf_convert.py`（pdf2docx）；复杂版面（多栏/嵌套表格/文本框密集）→ 走 LibreOffice 重建管道：`PDF → 提取元素 → 版面分析 → 生成原生 docx`\n   - **PDF→Excel**：只关心表格时直接用 #6 表格提取输出 xlsx；整页还原才走 pdf2docx 类管道\n   - **PDF→PPT**：一页一幻灯片，文本转文本框、图片原位嵌入；提醒用户 PPT 还原度天然低于 Word\n3. 转换后自检（见下），不合格项降级重试一次，仍不合格如实列入异常清单\n\n### 验收标准\n\n| 项 | 合格线 |\n|----|--------|\n| 字体匹配 | ≥90% 文本保持原字体或视觉近似字体 |\n| 表格 | 原生可编辑表格，非图片/文本框堆叠 |\n| 图片位置 | 偏移 ≤5px |\n| 页眉页脚 | 正确识别归位，不混入正文 |\n\n### 常见坑\n\n- 矢量图/SVG 元素转 Word 后变位图 → 提前告知\n- 特殊字体（企业定制字体）本机缺失 → 用视觉近似字体并在交付时说明\n- 竖排中文/日文 → pdf2docx 支持差，走 LibreOffice 管道\n\n---\n\n## #2 扫描件 OCR 精准识别\n\n**目标**：可搜索、可复制、表格可重建。参数调优必读 `ocr-config.md`。\n\n### 执行步骤\n\n1. 预处理：纠偏 → 去噪 → 二值化（手机拍照件加对比度增强）\n2. 引擎选择：中文/中英混排 → PaddleOCR；纯英文 → Tesseract 亦可；手写体 → PaddleOCR 手写模型\n3. 按用户要的输出形态执行：\n   - **可搜索 PDF**：`scripts/pdf_ocr.py`，原图上叠隐形文本层，版式零改动\n   - **纯文本**：按阅读顺序拼接，保留段落结构\n   - **表格→Excel**：表格区域单独走结构化识别，重建行列（合并单元格语义判断）\n4. 批量 >50 页自动分批，批间报进度\n\n### 验收标准\n\n| 项 | 合格线 |\n|----|--------|\n| 中文印刷体识别率 | >95%（抽 3 页人工比对关键字段） |\n| 金额/日期/编号 | 100% 复核（正则校验格式 + 抽样目检） |\n| 可搜索 PDF | 全文可搜索、可复制、选中位置准确 |\n\n### 常见坑\n\n- 公章覆盖文字 → 该区域识别率骤降，标注\"低置信区\"提醒用户核对\n- 低分辨率（<150dpi）→ 先超分辨率或明确告知识别率上限\n- 表格无框线 → 用坐标聚类重建，交付时附原页截图供比对\n\n---\n\n## #3 PDF 内直接编辑\n\n**目标**：改字、换图、增删页，不动整体排版。**不可逆操作，执行前必须预览确认。**\n\n### 执行步骤\n\n1. 备份原文件（`.bak`），任何编辑都在副本上进行\n2. 文本编辑：定位目标文本对象 → 以原字体/字号/颜色改写内容流；新文本比原文长 → 预警\"可能溢出/换行\"，给两种方案（缩字号容纳 / 接受换行）让用户选\n3. 图片替换：读取原图 bbox → 新图等比缩放到 bbox 内居中 → 保持原透明度/旋转\n4. 页面操作：插入/删除/旋转/调序，操作后重排页码引用（目录、书签、交叉引用）\n5. 生成修改前后对比预览图 → **用户确认后才交付正式文件**\n\n### 验收标准\n\n- 修改区域外零改动（diff 两版页面渲染图，仅目标区域有差异）\n- 新文本无溢出、无遮挡、无乱码（字体子集缺失时用嵌入字体并说明）\n\n### 常见坑\n\n- 扫描件\"改字\"：本质是修图不是改文本 → 告知用户走图像修复方案，效果上限先说清\n- 加密/签名过的 PDF：编辑会破坏签名 → 明确告知并让用户确认是否继续\n\n---\n\n## #4 安全保护（加密/权限/水印）\n\n### 执行步骤\n\n1. 明确需求组合：密码 / 权限 / 水印 / 过期失效，缺参数给默认值并确认\n2. 执行 `scripts/pdf_watermark.py`：\n   - 加密：AES-256，用户密码+所有者密码分离\n   - 权限粒度：禁止打印 / 禁止复制 / 禁止注释 / 禁止编辑，可组合\n   - 动态水印：支持变量 `{user_id}` `{date}` `{time}` `{custom}`，半透明（默认 15% 不透明度）、对角平铺整页、每页随机微偏移防批量裁剪\n3. 输出受保护文件 + 一页《保护配置说明》（列明启用项与密码传递方式——密码绝不与文件同渠道发送）\n\n### 验收标准\n\n- 用无密码方式打开 → 拒绝；用错误密码 → 拒绝\n- 权限项在主流阅读器（Adobe/WPS/浏览器）中生效验证\n- 水印在 100%-400% 缩放下可读、不遮挡正文关键信息\n\n### 常见坑\n\n- 权限控制是\"君子协定\"，流氓阅读器可绕过 → 必须如实告知用户，配合水印追溯才是完整方案\n- 水印遮挡公章/签名区 → 默认避开页面四角 15% 区域，或由用户指定避让区\n\n---\n\n## #5 批量自动化处理\n\n### 执行步骤\n\n1. 清点文件清单（数量、总页数、总大小），>10 个文件先确认再执行\n2. 按子能力选脚本：\n   - **合并**：`scripts/pdf_merge.py` —— 按文件名自然序或用户指定序；自动生成目录书签（每文件一章，取文件名/首页标题）\n   - **拆分**：`scripts/pdf_split.py` —— 支持按页范围 / 按书签 / 每 N 页一份；按内容拆分（如按章节标题）→ 先提取书签或标题模式再切\n   - **重命名**：从文档提取变量（标题/日期/编号）→ 模板如 `{date}_{title}_{no}` → **先输出新旧文件名对照表，确认后执行**\n   - **格式统一**：统一页面尺寸（A4/Letter）、页边距、页眉页脚\n3. 失败文件单独列出，不混入成功批次；保留原文件不"},{"path":"references/capabilities-pro.md","content":"# 扩展与壁垒能力规程（#15-#25）\n\n> 执行对应能力前完整阅读本节。交付话术见 `value-messaging.md`，通用质检项见 `quality-standards.md`。\n\n## 目录\n- [#15 PDF 智能压缩](#15-pdf-智能压缩)\n- [#16 PDF 翻译（保留排版）](#16-pdf-翻译保留排版)\n- [#17 合同智能审查](#17-合同智能审查)\n- [#18 发票/票据自动归档](#18-发票票据自动归档)\n- [#19 电子签名与审批流](#19-电子签名与审批流)\n- [#20 批量内容替换](#20-批量内容替换)\n- [#21 PDF 表单创建](#21-pdf-表单创建)\n- [#22 图纸精准测量](#22-图纸精准测量)\n- [#23 翻页电子书制作](#23-翻页电子书制作)\n- [#24 印刷级导出](#24-印刷级导出)\n- [#25 密文级敏感信息删除](#25-密文级敏感信息删除)\n\n---\n\n## #15 PDF 智能压缩\n\n### 执行步骤\n\n1. 确认目标：指定大小（\"压到10MB\"）/ 场景预设（微信≤100MB、邮件≤25MB）/ 质量预设（清晰度优先）\n2. 分层压缩策略（`scripts/pdf_compress.py` 内置）：文字/矢量 → 无损保留；彩色图片 → JPEG 降采样（默认 150dpi/q70）；扫描页 → 可选转 JBIG2 思路的位图优化；嵌入字体子集化；清理冗余对象\n3. 目标大小模式：迭代降质直到 ≤ 目标值，每轮报参数；**设质量地板**（dpi 不低于 96、q 不低于 40），触底仍超 → 报告\"极限压缩到 X MB\"，由用户决定是否接受更低画质\n4. 输出压缩前后对比：大小、 dpi、关键页局部放大图（公章/签名/小字号区）\n\n### 验收标准\n\n- 文字区域：放大 200% 无模糊（文字未参与有损压缩）\n- 公章/签名/二维码可辨认、可扫描\n- 线条图无肉眼可见锯齿；页数与内容零丢失\n\n---\n\n## #16 PDF 翻译（保留排版）\n\n### 执行步骤\n\n1. 确认：目标语言 / 输出形态（纯译文 / 双语对照：左右、上下、段内三选一）/ 术语表（内置行业库或用户自定义）\n2. 段落级提取（保留每段坐标、字号、字体粗细）→ 术语库预替换 → 调用翻译 → 译段回写原坐标\n3. 排版回写规则：译文超长 → 先缩字号（最小到原 80%）→ 再允许换行扩框；CJK 与拉丁混排注意字距；图表内文字走图像文本替换\n4. 生成《术语对照表》附交付\n\n### 验收标准\n\n- 排版保留：版面结构、表格、图片位置与原文件一致（渲染图 diff 仅文字区域有差异）\n- 术语准确率 ≥95%（对照术语表全量核验）；无漏译段落\n- 双语版原文/译文逐段可对应\n\n### 常见坑\n\n- 德/俄语译文平均膨胀 30% → 提前告知可能换行\n- 扫描件 → 先 OCR 出文本层再翻译，告知多一步\n- 公式/代码块不翻译，原位保留\n\n---\n\n## #17 合同智能审查\n\n### 执行步骤\n\n1. 确认审查立场（甲方/乙方/中立）与合同类型（采购/销售/劳动/合作/租赁），立场不同风险取向不同\n2. 风险条款识别（六大类）：自动续约 / 天价违约金 / 权利义务不对等 / 模糊表述 / 知识产权归属 / 数据隐私与保密\n3. 输出《审查报告》固定结构：\n   - `风险总览`（🔴高危/🟡中危/🟢低危 计数 + 一句话结论）\n   - `逐条明细`：条款原文 → 页码定位 → 风险等级 → 风险解释 → 法律依据 → 修改建议（给出可直接替换的条款文本）\n   - `缺失条款提醒`（该类合同应有而未有的条款）\n4. 高亮标注版 PDF 一并交付\n5. **免责边界**：报告结尾固定声明\"本审查为 AI 辅助初筛，不替代执业律师意见；高危条款建议法务复核\"\n\n### 验收标准\n\n- 六大类风险逐类扫描覆盖，无整类遗漏\n- 每条风险有原文引用+页码，可点击核验；修改建议具体可执行，不说空话\n\n---\n\n## #18 发票/票据自动归档\n\n### 执行步骤\n\n1. 批量 OCR（发票专用模型）：提取发票代码、号码、开票日期、金额、税额、价税合计、购买方/销售方名称与税号、发票类型\n2. 验真：对接税务验真接口 → 逐张标记 真票/假票/作废/查无此票；**接口不可用时如实标记\"未验真\"，严禁伪造验真结果**\n3. 去重：发票代码+号码哈希；重复张列出对照\n4. 输出：Excel 汇总表（按员工/部门/项目分类）+ 报销单 + 归档包（按 年/月 目录结构化重命名发票文件）\n5. 异常清单：识别失败、验真异常、疑似连号/大额，单独列出\n\n### 验收标准\n\n- 关键字段（号码/日期/价税合计）识别率 ≥98%，金额字段全量正则校验\n- 验真状态逐张有结果（含\"未验真\"状态）；去重 0 误杀（号码不同不判重）\n\n---\n\n## #19 电子签名与审批流\n\n### 执行步骤\n\n1. 确认场景：单份签 / 批量盖章 / 多级审批流；确认签署方与顺序\n2. 法律有效性路径：CA 数字证书签名（符合《电子签名法》第十三条）；**无 CA 环境时只能做\"图片章+留痕\"**，必须明确告知法律效力差异\n3. 批量盖章：AI 定位签署区（\"签字/盖章/甲方（盖章）\"关键词+版式特征）→ 预览定位结果（逐份缩略图标出落章位置）→ 用户确认 → 批量执行，位置精度 ±2mm\n4. 审批流引擎：顺序/并行/会签/条件分支；前级未签自动锁后级；每步记录 时间/IP/设备/证书编号 → 不可篡改审计日志\n5. 签署完成后：文件哈希存证；任何后续修改会破坏签名并触发报警\n6. 进度查询与签名验证作为子命令支持\n\n### 验收标准\n\n- 落章位置预览确认率 100%（未确认不执行）\n- 审计日志逐步完整；签名验证报告可独立出具\n- 法律效力表述准确：CA 证书签 vs 图片章，绝不混称\n\n---\n\n## #20 批量内容替换\n\n> 不可逆操作。备份 → 预览 → 确认 → 执行 → 报告，五步缺一不可。\n\n### 执行步骤\n\n1. 规则确认：精确匹配 / 正则 / 图片哈希（换 Logo）；多规则可同时下发\n2. `scripts/pdf_batch_replace.py --dry-run` 生成《差异预览》：每文件命中位置、原文→新文、标记\"可疑替换\"（命中在表格/页眉/图片内等非常规区）\n3. **用户确认后执行**：自动备份原件 → 批量替换（≤500/批）→ 失败文件单独列出\n4. 《替换报告》：成功/失败/跳过计数、每文件命中数、备份位置、回滚指令\n5. 回滚：`--rollback` 从备份恢复\n\n### 验收标准\n\n- 预览命中率与执行结果一致；无误替换（可疑替换已逐一确认）\n- 替换区域外零改动；失败文件原件完好\n\n---\n\n## #21 PDF 表单创建\n\n### 执行步骤\n\n1. 字段检测：从 Word/PDF/图片识别填写区（下划线、\"姓名：____\"、空白框）→ 智能判型（文本/日期/数字/单选/复选/下拉"}],"languages":[],"docsSourceLabel":"CLAWHUB","editorialOverview":"全能 PDF 智能处理技能，覆盖 25 项能力五大核心（Office 高保真互转、扫描件 OCR、PDF 直接编辑、加密水印权限、批量合并拆分重命名）、九大增值（表格提取、图文解析、摘要、脱敏、元数据清洗、自动命名、版本对比、文档问答、规格对比矩阵）、四大扩展（智能压缩、排版保留翻译、合同风险审查、发票验真归档）、七大壁垒（电子签名审批流、批量内容替换、表单创建、图纸测量、翻页电子书、印刷级导出、密文级永久删除）。当用户上传 PDF 并提出转换、识别、编辑、加密、压缩、翻译、审查、归档、签名、替换、表单、测量、电子书、印刷、删除等需求，或提到\"转Word\"\"OCR\"\"加水印\"\"压缩到xxMB\" Skill: PDF万能大师 Owner: ford828 Summary: 全能 PDF 智能处理技能，覆盖 25 项能力五大核心（Office 高保真互转、扫描件 OCR、PDF 直接编辑、加密水印权限、批量合并拆分重命名）、九大增值（表格提取、图文解析、摘要、脱敏、元数据清洗、自动命名、版本对比、文档问答、规格对比矩阵）、四大扩展（智能压缩、排版保留翻译、合同风险审查、发票验真归档）、七大壁垒（电子签名审批流、批量内容替换、表单创建、图纸测量、翻页电子书、印刷级导出、密文级永久删除）。当用户上传 PDF 并提出转换、识别、编辑、加密、压缩、翻译、审查、归档、签名、替换、表单、测量、电子书、印刷、删除等需求，或提到\"转Word\"\"OCR\"\"加水印\"\"压缩到xxMB\" Tags: latest:2.1.0 Version history: v2.1.0 | 2026-07-26T13:42:21.357Z | user - 引","editorialQuality":{"score":100,"threshold":65,"status":"ready","wordCount":1251,"uniquenessScore":53,"reasons":[]}},"media":{"evidence":{"source":"no-media","verified":false,"confidence":"low","updatedAt":"2026-10-10T22:52:42.065Z","emptyReason":"No screenshots, media assets, or demo links are available."},"primaryImageUrl":null,"mediaAssetCount":0,"assets":[],"demoUrl":null},"ownerResources":{"evidence":{"source":"unclaimed","verified":false,"confidence":"low","updatedAt":"2026-10-10T22:52:42.065Z","emptyReason":"This page has not been claimed by the agent owner."},"hasCustomPage":false,"customPageUpdatedAt":null,"customLinks":[],"structuredLinks":{"docsUrl":null,"demoUrl":null,"supportUrl":null,"pricingUrl":null,"statusUrl":null},"customPage":null},"relatedAgents":{"evidence":{"source":"protocol-neighbors","verified":false,"confidence":"medium","updatedAt":"2026-10-11T01:45:56.805Z","emptyReason":null},"items":[{"id":"8ebccd8e-3863-4187-8355-c3f14e1f9edf","entityType":"agent","canonicalPath":"/agent/iofficeai-aionui","slug":"iofficeai-aionui","name":"AionUi","description":"Free, local, open-source 24/7 Cowork app and OpenClaw for Gemini CLI, Claude Code, Codex, OpenCode, Qwen Code, Goose CLI, Auggie, and more | 🌟 Star if you like it!","url":"https://github.com/iOfficeAI/AionUi","homepage":"https://www.aionui.com","source":"GITHUB_REPOS","protocols":["MCP","OPENCLAW"],"capabilities":[],"safetyScore":100,"overallRank":70,"updatedAt":"2026-10-09T19:11:12.944Z","createdAt":"2026-02-25T03:38:16.584Z","downloads":null},{"id":"b917f68a-ebff-438e-84f8-3f4b2494c0bc","entityType":"agent","canonicalPath":"/agent/activepieces-activepieces","slug":"activepieces-activepieces","name":"activepieces","description":"AI Agents & MCPs & AI Workflow Automation • (~400 MCP servers for AI agents) • AI Automation / AI Agent with MCPs • AI Workflows & AI Agents • MCPs for AI Agents","url":"https://github.com/activepieces/activepieces","homepage":"https://www.activepieces.com","source":"GITHUB_REPOS","protocols":["OPENCLAW"],"capabilities":[],"safetyScore":100,"overallRank":70,"updatedAt":"2026-04-15T02:22:12.426Z","createdAt":"2026-02-25T03:38:12.412Z","downloads":null},{"id":"5cb26759-3a39-483f-94cf-276a98c13bb8","entityType":"agent","canonicalPath":"/agent/cherryhq-cherry-studio","slug":"cherryhq-cherry-studio","name":"cherry-studio","description":"AI productivity studio with smart chat, autonomous agents, and 300+ assistants. Unified access to frontier LLMs","url":"https://github.com/CherryHQ/cherry-studio","homepage":"https://cherry-ai.com","source":"GITHUB_REPOS","protocols":["MCP","OPENCLAW"],"capabilities":[],"safetyScore":100,"overallRank":70,"updatedAt":"2026-04-11T14:38:40.986Z","createdAt":"2026-02-25T03:38:19.379Z","downloads":null},{"id":"6f6582d0-5d76-4f0f-b81d-86520247950b","entityType":"agent","canonicalPath":"/agent/copilotkit-copilotkit","slug":"copilotkit-copilotkit","name":"CopilotKit","description":"The Frontend for Agents & Generative UI. React + Angular","url":"https://github.com/CopilotKit/CopilotKit","homepage":"https://docs.copilotkit.ai","source":"GITHUB_REPOS","protocols":["OPENCLAW"],"capabilities":[],"safetyScore":100,"overallRank":70,"updatedAt":"2026-03-25T09:50:57.846Z","createdAt":"2026-02-25T03:39:14.617Z","downloads":null}],"links":{"hub":"/agent","source":"/agent/source/clawhub","protocols":[{"label":"OpenClaw","href":"/agent/protocol/openclew"}]}}}