{"id":"2c6f0dad-f72d-46a2-94da-fd7fc3408302","entityType":"agent","slug":"clawhub-maglanyulan-baidu-doc-vlm-parser","name":"百度文档解析vlm-parser","canonicalUrl":"https://www.xpersona.co/agent/clawhub-maglanyulan-baidu-doc-vlm-parser","canonicalPath":"/agent/clawhub-maglanyulan-baidu-doc-vlm-parser","generatedAt":"2026-10-11T08:42:34.173Z","source":"CLAWHUB","claimStatus":"UNCLAIMED","verificationTier":"NONE","summary":{"evidence":{"source":"editorial-content","verified":true,"confidence":"high","updatedAt":"2026-10-11T06:19:36.184Z","emptyReason":null},"description":"调用百度PaddleOCR-VL大模型API解析文档。基于PaddleOCR-VL-1.6多模态大模型，支持PDF、Word、PPT、图片等格式，精准识别印刷文本、手写文本、表格、公式、图表、印章等复杂元素，支持100+种语言，可处理不规则布局和长文档跨页解析。触发词：文档解析、VLM解析、大模型OCR、PaddleOCR、多模态文档、手写识别、公式识别、复杂版面。 Skill: 百度文档解析vlm-parser Owner: maglanyulan Summary: 调用百度PaddleOCR-VL大模型API解析文档。基于PaddleOCR-VL-1.6多模态大模型，支持PDF、Word、PPT、图片等格式，精准识别印刷文本、手写文本、表格、公式、图表、印章等复杂元素，支持100+种语言，可处理不规则布局和长文档跨页解析。触发词：文档解析、VLM解析、大模型OCR、PaddleOCR、多模态文档、手写识别、公式识别、复杂版面。 Tags: latest:1.0.5 Version history: v1.0.5 | 2026-09-17T11:16:24.084Z | user - Removed the file: skill-card.md - No functional changes to code or documentation observed in this versio","descriptionLabel":"Technical summary","evidenceSummary":"Capability contract not published. No trust telemetry is available yet. 1.1K downloads reported by the source. Last updated 10/11/2026.","installCommand":"clawhub skill install s17cm4qmnj4y8xj888f3gjms0583hg9z:baidu-doc-vlm-parser","sourceUrl":"https://clawhub.ai/maglanyulan/baidu-doc-vlm-parser","homepage":"https://clawhub.ai/maglanyulan/skills/baidu-doc-vlm-parser","primaryLinks":[{"label":"View on ClawHub","url":"https://clawhub.ai/maglanyulan/baidu-doc-vlm-parser","kind":"source"},{"label":"Homepage","url":"https://clawhub.ai/maglanyulan/skills/baidu-doc-vlm-parser","kind":"homepage"}],"safetyScore":84,"overallRank":62,"popularityScore":61,"trustScore":null,"claimedByName":null,"isOwner":false,"seoDescription":"调用百度PaddleOCR-VL大模型API解析文档。基于PaddleOCR-VL-1.6多模态大模型，支持PDF、Word、PPT、图片等格式，精准识别印刷文本、手写文本、表格、公式、图表、印章等复杂元素，支持100+种语言，可处理不规则布局和长文档跨页解析。触发词：文档解析、VLM解析、大模型OCR、PaddleO"},"coverage":{"evidence":{"source":"public-profile","verified":false,"confidence":"medium","updatedAt":"2026-10-11T06:19:36.184Z","emptyReason":null},"protocols":[{"protocol":"OPENCLEW","label":"OpenClaw","status":"self-declared","notes":"Declared in the public agent profile."}],"capabilities":[],"verifiedCount":0,"selfDeclaredCount":1,"capabilityMatrix":{"rows":[{"key":"OPENCLEW","type":"protocol","support":"unknown","confidenceSource":"profile","notes":"Listed on profile"}],"flattenedTokens":"protocol:OPENCLEW|unknown|profile"}},"adoption":{"evidence":{"source":"CLAWHUB","verified":false,"confidence":"medium","updatedAt":"2026-10-11T06:19:36.184Z","emptyReason":null},"stars":null,"forks":null,"downloads":1135,"packageName":null,"latestVersion":"1.0.5","tractionLabel":"1.1K downloads"},"release":{"evidence":{"source":"CLAWHUB","verified":false,"confidence":"medium","updatedAt":"2026-10-11T06:19:36.171Z","emptyReason":null},"lastUpdatedAt":"2026-10-11T06:19:36.184Z","lastCrawledAt":"2026-10-11T06:19:36.171Z","lastIndexedAt":null,"nextCrawlAt":"2026-10-12T06:19:36.171Z","lastVerifiedAt":null,"highlights":[{"version":"1.0.5","createdAt":"2026-09-17T11:16:24.084Z","changelog":"- Removed the file: skill-card.md - No functional changes to code or documentation observed in this version.","fileCount":7,"zipByteSize":14675},{"version":"1.0.4","createdAt":"2026-07-08T08:41:38.337Z","changelog":"- 新增了免费额度和计费方式的详细说明，包括个人/企业实名认证用户的具体免费页数。 - 增加了百度智能文档分析平台注册免费资源和计费页面的直达链接。 - 明确标注了额度获取和购买方式，引导用户至官方说明文档。 - 其他功能和接口未变。","fileCount":7,"zipByteSize":14483},{"version":"1.0.3","createdAt":"2026-07-08T07:13:12.521Z","changelog":"baidu-doc-vlm-parser 1.0.3 - 升级底层模型至 PaddleOCR-VL-1.6，描述与文档相应更新（原为 1.5）。 - 支持的图片最长边提升至 8192px（原为 4096px），说明文档已更新。 - 支持语言调整为“100+种语言”（原为 111 种）。 - API 速率限制说明：获取结果接口 QPS 降至 5。 - 文档进一步增加了 Python 调用示例和详细的接口示例响应，完善了参数、错误码与返回结构注释。 - 移除 skill-card.md 文件。","fileCount":7,"zipByteSize":14515},{"version":"1.0.1","createdAt":"2026-05-09T08:48:47.275Z","changelog":"- Version bump to 1.0.1 with no changes to files or documentation. - No functional, code, or documentation updates in this release.","fileCount":7,"zipByteSize":13117},{"version":"1.0.0","createdAt":"2026-05-09T06:16:19.313Z","changelog":"- Initial release of the baidu-doc-vlm-parser skill, providing intelligent document parsing via Baidu’s PaddleOCR-VL-1.5 multimodal API. - Supports PDF, Word, PPT, image and other formats; accurately recognizes printed and handwritten text, tables, formulas, charts, seals, and more. - Handles 111 languages, irregular layouts, multi-page/long documents, and outputs results in Markdown or JSON. - No manual configuration needed for formula, chart, language, or image recognition—VLM model handles automatically. - Asynchronous API: submit a task, obtain a task_id, and poll for results with Markdown/JSON links. - Includes detailed documentation for usage, parameters, file constraints, error handling, and script entry point.","fileCount":6,"zipByteSize":11671}]},"execution":{"evidence":{"source":"CLAWHUB","verified":false,"confidence":"low","updatedAt":null,"emptyReason":"No published capability contract is available yet."},"installCommand":"clawhub skill install s17cm4qmnj4y8xj888f3gjms0583hg9z:baidu-doc-vlm-parser","setupComplexity":"low","setupSteps":["Setup complexity is LOW. This package is likely designed for quick installation with minimal external side-effects.","Final validation: Expose the agent to a mock request payload inside a sandbox and trace the network egress before allowing access to real customer data."],"contract":{"contractStatus":"missing","authModes":[],"requires":[],"forbidden":[],"supportsMcp":false,"supportsA2a":false,"supportsStreaming":false,"inputSchemaRef":null,"outputSchemaRef":null,"dataRegion":null,"contractUpdatedAt":null,"sourceUpdatedAt":null,"freshnessSeconds":null},"invocationGuide":{"preferredApi":{"snapshotUrl":"https://www.xpersona.co/api/v1/agents/clawhub-maglanyulan-baidu-doc-vlm-parser/snapshot","contractUrl":"https://www.xpersona.co/api/v1/agents/clawhub-maglanyulan-baidu-doc-vlm-parser/contract","trustUrl":"https://www.xpersona.co/api/v1/agents/clawhub-maglanyulan-baidu-doc-vlm-parser/trust"},"curlExamples":["curl -s \"https://www.xpersona.co/api/v1/agents/clawhub-maglanyulan-baidu-doc-vlm-parser/snapshot\"","curl -s \"https://www.xpersona.co/api/v1/agents/clawhub-maglanyulan-baidu-doc-vlm-parser/contract\"","curl -s \"https://www.xpersona.co/api/v1/agents/clawhub-maglanyulan-baidu-doc-vlm-parser/trust\""],"jsonRequestTemplate":{"query":"summarize this repo","constraints":{"maxLatencyMs":2000,"protocolPreference":["OPENCLEW"]}},"jsonResponseTemplate":{"ok":true,"result":{"summary":"...","confidence":0.9},"meta":{"source":"CLAWHUB","generatedAt":"2026-10-11T08:42:34.170Z"}},"retryPolicy":{"maxAttempts":3,"backoffMs":[500,1500,3500],"retryableConditions":["HTTP_429","HTTP_503","NETWORK_TIMEOUT"]}},"endpoints":{"dossierUrl":"https://www.xpersona.co/api/v1/agents/clawhub-maglanyulan-baidu-doc-vlm-parser/dossier","snapshotUrl":"https://www.xpersona.co/api/v1/agents/clawhub-maglanyulan-baidu-doc-vlm-parser/snapshot","contractUrl":"https://www.xpersona.co/api/v1/agents/clawhub-maglanyulan-baidu-doc-vlm-parser/contract","trustUrl":"https://www.xpersona.co/api/v1/agents/clawhub-maglanyulan-baidu-doc-vlm-parser/trust"}},"reliability":{"evidence":{"source":"runtime-metrics","verified":false,"confidence":"low","updatedAt":null,"emptyReason":"No trust, reliability, or runtime telemetry is available."},"trust":{"status":"unavailable","handshakeStatus":"UNKNOWN","verificationFreshnessHours":null,"reputationScore":null,"p95LatencyMs":null,"successRate30d":null,"fallbackRate":null,"attempts30d":null,"trustUpdatedAt":null,"trustConfidence":"unknown","sourceUpdatedAt":null,"freshnessSeconds":null},"decisionGuardrails":{"doNotUseIf":["Contract metadata is missing or unavailable for deterministic execution."],"safeUseWhen":[],"riskFlags":["missing_or_unavailable_contract","trust_data_unavailable","schema_references_missing"],"operationalConfidence":"low"},"executionMetrics":{"observedLatencyMsP50":null,"observedLatencyMsP95":null,"estimatedCostUsd":null,"uptime30d":null,"rateLimitRpm":null,"rateLimitBurst":null,"lastVerifiedAt":null,"verificationSource":null},"runtimeMetrics":{"successRate":null,"avgLatencyMs":null,"avgCostUsd":null,"hallucinationRate":null,"retryRate":null,"disputeRate":null,"p50Latency":null,"p95Latency":null,"lastUpdated":null}},"benchmarks":{"evidence":{"source":"no-benchmark-data","verified":false,"confidence":"low","updatedAt":null,"emptyReason":"No benchmark suites or observed failure patterns are available."},"suites":[],"failurePatterns":[]},"artifacts":{"evidence":{"source":"CLAWHUB","verified":false,"confidence":"high","updatedAt":"2026-10-11T06:19:36.184Z","emptyReason":null},"readme":"Skill: 百度文档解析vlm-parser\n\nOwner: maglanyulan\n\nSummary: 调用百度PaddleOCR-VL大模型API解析文档。基于PaddleOCR-VL-1.6多模态大模型，支持PDF、Word、PPT、图片等格式，精准识别印刷文本、手写文本、表格、公式、图表、印章等复杂元素，支持100+种语言，可处理不规则布局和长文档跨页解析。触发词：文档解析、VLM解析、大模型OCR、PaddleOCR、多模态文档、手写识别、公式识别、复杂版面。\n\nTags: latest:1.0.5\n\nVersion history:\n\nv1.0.5 | 2026-09-17T11:16:24.084Z | user\n\n- Removed the file: skill-card.md\n- No functional changes to code or documentation observed in this version.\n\nv1.0.4 | 2026-07-08T08:41:38.337Z | user\n\n- 新增了免费额度和计费方式的详细说明，包括个人/企业实名认证用户的具体免费页数。\n- 增加了百度智能文档分析平台注册免费资源和计费页面的直达链接。\n- 明确标注了额度获取和购买方式，引导用户至官方说明文档。\n- 其他功能和接口未变。\n\nv1.0.3 | 2026-07-08T07:13:12.521Z | user\n\nbaidu-doc-vlm-parser 1.0.3\n\n- 升级底层模型至 PaddleOCR-VL-1.6，描述与文档相应更新（原为 1.5）。\n- 支持的图片最长边提升至 8192px（原为 4096px），说明文档已更新。\n- 支持语言调整为“100+种语言”（原为 111 种）。\n- API 速率限制说明：获取结果接口 QPS 降至 5。\n- 文档进一步增加了 Python 调用示例和详细的接口示例响应，完善了参数、错误码与返回结构注释。\n- 移除 skill-card.md 文件。\n\nv1.0.1 | 2026-05-09T08:48:47.275Z | user\n\n- Version bump to 1.0.1 with no changes to files or documentation.\n- No functional, code, or documentation updates in this release.\n\nv1.0.0 | 2026-05-09T06:16:19.313Z | user\n\n- Initial release of the baidu-doc-vlm-parser skill, providing intelligent document parsing via Baidu’s PaddleOCR-VL-1.5 multimodal API.\n- Supports PDF, Word, PPT, image and other formats; accurately recognizes printed and handwritten text, tables, formulas, charts, seals, and more.\n- Handles 111 languages, irregular layouts, multi-page/long documents, and outputs results in Markdown or JSON.\n- No manual configuration needed for formula, chart, language, or image recognition—VLM model handles automatically.\n- Asynchronous API: submit a task, obtain a task_id, and poll for results with Markdown/JSON links.\n- Includes detailed documentation for usage, parameters, file constraints, error handling, and script entry point.\n\nArchive index:\n\nArchive v1.0.5: 7 files, 14675 bytes\n\nFiles: _meta.json (139b), references/apikey-fetch.md (1537b), references/error_codes.md (2855b), references/parameters.md (3499b), scripts/baidu_doc_vlm_parser.py (9541b), skill-card.md (2885b), SKILL.md (14321b)\n\nFile v1.0.5:SKILL.md\n\n---\nname: baidu-doc-vlm-parser 百度文档解析(PaddleOCR-VL)\ndescription: 调用百度PaddleOCR-VL大模型API解析文档。基于PaddleOCR-VL-1.6多模态大模型，支持PDF、Word、PPT、图片等格式，精准识别印刷文本、手写文本、表格、公式、图表、印章等复杂元素，支持100+种语言，可处理不规则布局和长文档跨页解析。触发词：文档解析、VLM解析、大模型OCR、PaddleOCR、多模态文档、手写识别、公式识别、复杂版面。\nlicense: MIT\n---\n\n# 百度文档解析（PaddleOCR-VL）Skill\n\n基于 PaddleOCR-VL-1.6 多模态大模型，提供开箱即用的文档智能解析能力。\n\n## 功能概述\n\n**PaddleOCR-VL-1.6-0.9B** 是多模态文档解析领域的 SOTA 方案，具备：\n\n- **全要素精准解析**：高效识别印刷文本、手写文本、表格、公式、图表、印章等复杂文档元素\n- **智能阅读顺序**：基于人类阅读习惯推断内容排列顺序，将零散页面信息转化为有序带标签的结构化元素序列\n- **行级别坐标**：支持精准的行级别坐标输出\n- **100+ 种语言**：覆盖中、英、日、韩、拉丁文等全球化多语种文档\n- **不规则布局定位**：攻克复杂版面解析难点\n- **长文档跨页解析**：支持跨页表格合并等企业级场景\n- **直接 Markdown/JSON 输出**：无需额外处理\n\n## 与文档解析（标准版）的区别\n\n| 特性 | PaddleOCR-VL（本 Skill） | 标准版（pipeline-parser） |\n|------|-------------------------|--------------------------|\n| 底层模型 | 多模态大模型 VLM | 传统 Pipeline |\n| 语言支持 | 100+ 种 | 20+ 种 |\n| 公式/图片识别 | 默认开启，无需配置 | 需手动开启参数 |\n| 语种识别 | 自动识别，无需指定 | 需指定 language_type |\n| 版面类型 | 24 种细粒度类型 | 8 种基础类型 |\n| 行坐标 | 支持 | 不支持 |\n| 多边形坐标 | 支持（polygon） | 仅矩形框 |\n| 文件大小 | 版式 ≤100M，PDF ≤500 页 | PDF ≤300M，≤2000 页 |\n\n## 适用场景\n\n当用户需要：\n- 解析复杂版面文档（多栏、不规则布局）\n- 精准识别手写文本、数学公式、图表\n- 处理多语种混合文档\n- 获取行级别坐标信息\n- 长文档跨页表格合并\n- 免配置自动识别文档内容\n\n## 免费资源领取和计费说明\n[百度智能文档分析平台 领取免费测试资源](https://cloud.baidu.com/doc/OCR/s/fk3h7xu7h)\n\n\n[百度智能文档分析平台计费与购买方式](https://cloud.baidu.com/doc/OCR/s/Fls06fa15#%E6%96%87%E6%A1%A3%E8%A7%A3%E6%9E%90%EF%BC%88paddleocr-vl%EF%BC%89)\n\n\n| 用户类型 | 免费额度 |\n|---------|---------|\n| 个人实名认证用户 | **200 页** |\n| 企业实名认证用户 | **1000 页** |\n\n## API 配置\n\n### 额度获取方式\n\n您可通过百度智能云平台获取[免费额度](https://cloud.baidu.com/doc/OCR/s/fk3h7xu7h)与[购买调用资源](https://cloud.baidu.com/doc/OCR/s/Fls06fa15#%E6%96%87%E6%A1%A3%E8%A7%A3%E6%9E%90%EF%BC%88paddleocr-vl%EF%BC%89)\n\n### 环境变量（必须）\n\n使用前请设置以下环境变量：\n\n```bash\nexport BAIDU_DOC_AI_API_KEY=\"your_api_key\"\nexport BAIDU_DOC_AI_SECRET_KEY=\"your_secret_key\"\n```\n\n### 认证方式\n\n通过 API Key 和 Secret Key 获取 access_token，有效期 30 天。所有接口请求需以 URL 参数 `access_token` 携带。\n\n## 支持格式\n\n**版式文档**：pdf, jpg, jpeg, png, bmp, tif, tiff, ofd（图片最长边不大于 8192px）\n\n**流式文档**：doc, docx, txt, wps, ppt, pptx\n\n## 支持语言\n\n100+ 种语言，包括中文、英文、日文、韩文、拉丁文等，**无需手动指定，大模型自动识别**。\n\n## 使用方式\n\n```bash\npython3 scripts/baidu_doc_vlm_parser.py --file_data <文件的base64编码> --file_name \"test.pdf\"\npython3 scripts/baidu_doc_vlm_parser.py --file_url <文件公网URL> --file_name \"test.pdf\"\n```\n\n## API 接口\n\n文档解析（PaddleOCR-VL）API 服务为异步接口，需要先调用**提交请求接口**获取 task_id，然后调用**获取结果接口**进行结果轮询。\n\n### 提交请求接口\n\n- **HTTP 方法**：POST\n- **请求 URL**：`https://aip.baidubce.com/rest/2.0/brain/online/v2/paddle-vl-parser/task?access_token={token}`\n- **Content-Type**：`application/x-www-form-urlencoded`\n\n#### Python 示例\n\n```python\nimport requests, os, base64\n\ndef create_task(url, file_path, file_url):\n    with open(file_path, \"rb\") as f:\n        file_data = base64.b64encode(f.read())\n    data = {\n        \"file_data\": file_data,\n        \"file_url\": file_url,\n        \"file_name\": os.path.basename(file_path)\n    }\n    headers = {'Content-Type': 'application/x-www-form-urlencoded'}\n    return requests.post(url, headers=headers, data=data)\n\nrequest_host = \"https://aip.baidubce.com/rest/2.0/brain/online/v2/paddle-vl-parser/task?access_token={token}\"\nresponse = create_task(request_host, \"./test.pdf\", \"\")\nprint(response.json())\n```\n\n**成功响应示例：**\n\n```json\n{\n  \"error_code\": 0,\n  \"error_msg\": \"\",\n  \"log_id\": \"10138598131137362685273505665433\",\n  \"result\": { \"task_id\": \"task-3zy9Bg8CHt1M4pPOcX2q5bg28j26801S\" }\n}\n```\n\n### 获取结果接口\n\n- **HTTP 方法**：POST\n- **请求 URL**：`https://aip.baidubce.com/rest/2.0/brain/online/v2/paddle-vl-parser/task/query?access_token={token}`\n- **Content-Type**：`application/x-www-form-urlencoded`\n- **请求参数**：`task_id`（必填，提交请求时返回的 task_id）\n\n#### Python 示例\n\n```python\nimport requests\n\ndef query_task(url, task_id):\n    data = {\"task_id\": task_id}\n    headers = {'Content-Type': 'application/x-www-form-urlencoded'}\n    return requests.post(url, headers=headers, data=data)\n\nrequest_host = \"https://aip.baidubce.com/rest/2.0/brain/online/v2/paddle-vl-parser/task/query?access_token={access_token}\"\nresp = query_task(request_host, \"task_id\")\nprint(resp.json())\n```\n\n## 请求参数\n\n### 文件参数（必选，二选一）\n\n| 参数 | 必选 | 类型 | 说明 |\n|------|------|------|------|\n| `file_data` | 和 file_url 二选一 | string | 文件 Base64 编码数据。版式文档：pdf, jpg, jpeg, png, bmp, tif, tiff, ofd（图片最长边不大于 8192px）；流式文档：doc, docx, txt, wps, ppt, pptx。图片不超过 10M，版式文档不超过 100M，流式文档不超过 50M，PDF 最大 500 页。超过 50M 须使用 file_url。优先级：file_data > file_url |\n| `file_url` | 和 file_data 二选一 | string | 文件数据 URL，长度不超过 1024 字节。PDF 文档不超过 100M，最大 500 页。**请注意关闭 URL 防盗链** |\n| `file_name` | 是 | string | 文件名，请保证文件名后缀正确，例如 \"1.pdf\" |\n\n### 功能参数\n\n| 参数 | 必选 | 类型 | 说明 |\n|------|------|------|------|\n| `recognize_formula` | - | bool | **无需开启**，大模型默认对版式类型文档进行公式识别 |\n| `analysis_chart` | 否 | bool | 是否对统计图表进行解析 |\n| `parse_image_layout` | - | bool | **无需开启**，大模型默认解析文档中的所有图片 |\n| `language_type` | - | string | **无需开启**，大模型默认识别语种类型 |\n| `merge_tables` | 否 | bool | 是否将跨页表格合并输出，开启后 tables 内返回跨页表格合并标识 |\n| `relevel_titles` | 否 | bool | 是否对段落标题（paragraph_title）进行分级，开启后在 sub_type 中输出标题级别 |\n| `recognize_seal` | 否 | bool | 是否识别印章内容 |\n| `return_span_boxes` | 否 | bool | 是否返回行坐标 |\n\n## 返回结构\n\n### 提交请求返回\n\n| 字段 | 类型 | 说明 |\n|------|------|------|\n| `log_id` | uint64 | 唯一的 log id，用于问题定位 |\n| `error_code` | int | 错误码 |\n| `error_msg` | string | 错误描述信息 |\n| `result.task_id` | string | 该请求生成的 task_id |\n\n### 获取结果返回\n\n| 字段 | 类型 | 说明 |\n|------|------|------|\n| `result.task_id` | string | 任务 ID |\n| `result.status` | string | 任务状态：pending（排队中）、processing（运行中）、success（成功）、failed（失败） |\n| `result.task_error` | string | 解析报错信息（任务失败、额度耗尽等） |\n| `result.markdown_url` | string | Markdown 格式结果链接，**有效期 30 天** |\n| `result.parse_result_url` | string | JSON 格式结果 BOS 链接，**有效期 30 天** |\n\n### 解析结果 JSON 结构（parse_result_url）\n\n顶层字段：`file_name`、`file_id`、`pages[]`。\n\n#### 页面对象（pages[]）\n\n| 字段 | 类型 | 说明 |\n|------|------|------|\n| `page_id` | string | 页码 ID |\n| `page_num` | int | 页码数 |\n| `text` | string | 当前页所有纯文字内容 |\n| `layouts` | list | 版式分析结果 |\n| `tables` | list | 表格解析结果 |\n| `images` | list | 图片解析结果 |\n| `meta` | dict | 页面元信息（page_width, page_height） |\n\n#### 版面元素（layouts[]）\n\n| 字段 | 类型 | 说明 |\n|------|------|------|\n| `layout_id` | string | 唯一标志，格式 \"xxxxx-layout-{global_layout_index}\" |\n| `text` | string | 文本内容（type 为 table/image 时为空） |\n| `position` | list | 位置 [x, y, w, h] |\n| `polygon` | list | 顶点坐标列表，可围合成多边形 |\n| `span_boxes` | list | 行信息（开启 return_span_boxes 后生效），含 text 和 location |\n| `type` | string | 版面元素类型（见下表） |\n| `sub_type` | string | 标题层级（开启 relevel_titles 后生效） |\n\n**版面类型（type）— 24 种细粒度类型**：\n\n| 类型 | 说明 | 类型 | 说明 |\n|------|------|------|------|\n| `text` | 文本 | `table` | 表格 |\n| `image` | 图片 | `chart` | 图表 |\n| `doc_title` | 文档标题 | `paragraph_title` | 段落标题 |\n| `figure_title` | 图片标题 | `display_formula` | 公式 |\n| `inline_formula` | 行内公式 | `formula_number` | 公式编号 |\n| `header` | 页眉 | `footer` | 页脚 |\n| `header_image` | 页眉图片 | `footer_image` | 页脚图片 |\n| `number` | 页码 | `abstract` | 摘要 |\n| `algorithm` | 算法 | `aside_text` | 旁注文本 |\n| `content` | 目录 | `footnote` | 脚注 |\n| `reference` | 参考文献 | `reference_content` | 参考文献内容 |\n| `seal` | 印章 | `vertical_text` | 竖排文本 |\n\n#### 表格对象（tables[]）\n\n| 字段 | 类型 | 说明 |\n|------|------|------|\n| `layout_id` | string | 对应 layouts 中 type 为 table 的 layout ID |\n| `markdown` | string | 表格 Markdown 形式 |\n| `position` | list | 边框数据 [x, y, w, h] |\n| `cells` | list | 单元格内版面信息（扁平列表） |\n| `matrix` | list | 2D 单元格索引矩阵，元素为 `cells` 数组下标；相同下标重复出现表示合并单元格 |\n| `merge_table` | string | 合并标识（开启 merge_tables 后）：begin（开始）、end（结束） |\n\n#### 图片对象（images[]）\n\n| 字段 | 类型 | 说明 |\n|------|------|------|\n| `layout_id` | string | 对应 layouts 中 type 为 image 的 layout ID |\n| `position` | list | 边框数据 [x, y, w, h] |\n| `data_url` | string | 图片存储链接 |\n| `image_description` | string | 统计图表内容解析（JSON 字符串，需 `json.loads` 解析） |\n\n## API 特性\n\n### 异步处理流程\n\n1. 调用提交请求接口 → 获取 `task_id`\n2. 通过 `task_id` 调用获取结果接口轮询\n\n### 轮询建议\n\n- 提交请求后 5~10 秒开始轮询\n- 轮询间隔：5 秒\n- 最大轮询时间：300 秒\n\n### QPS 限制\n\n- 提交请求接口：**2 QPS**\n- 获取结果接口：**5 QPS**\n\n## 文件限制\n\n| 限制项 | 说明 |\n|--------|------|\n| 图片大小 | ≤ 10M，最长边 ≤ 8192px |\n| 版式文档大小 | ≤ 100M |\n| 流式文档大小 | ≤ 50M |\n| PDF 页数 | ≤ 500 页 |\n| URL 长度 | ≤ 1024 字节 |\n| 优先级 | file_data > file_url |\n\n## 错误处理\n\n常见错误码示例：\n\n| 错误码 | 说明 |\n|--------|------|\n| `282003` | missing parameters（缺少必要参数） |\n| `282007` | task not exist, please check task id（任务不存在） |\n\n完整错误码参见 `references/error_codes.md` 及 [OCR 错误码文档](https://cloud.baidu.com/doc/OCR/s/dk3iqnq51)。\n\n**失败响应示例：**\n\n```json\n{\n  \"log_id\": \"13665091038742503867108513247608\",\n  \"error_code\": \"282007\",\n  \"error_msg\": \"task not exist, please check task id\",\n  \"result\": \"null\"\n}\n```\n\n## 产品计费与购买方式\n\n> 数据来源：[百度智能云 OCR 计费说明](https://cloud.baidu.com/doc/OCR/s/Fls06fa15#%E6%96%87%E6%A1%A3%E8%A7%A3%E6%9E%90%EF%BC%88paddleocr-vl%EF%BC%89)\n\n### 免费额度\n\n登录[文字识别控制台](https://console.bce.baidu.com/ai/)自动领取：\n\n| 用户类型 | 免费额度 |\n|---------|---------|\n| 个人实名认证用户 | **200 页** |\n| 企业实名认证用户 | **1000 页** |\n\n### 新人优惠\n\n限时活动价 **9 元/千页**，面向新用户。\n\n### 预付费资源包\n\n有效期 **1 年**，到期未抵扣额度作废。购买后 7 天内若未产生调用可自助退订。\n\n| 规格（页） | 原价（元） | 现价（元） |\n|---:|---:|---:|\n| 5,000 | 425 | 230 |\n| 10,000 | 800 | 440 |\n| 50,000 | 3,750 | 2,000 |\n| 100,000 | 7,700 | 3,800 |\n| 200,000 | 14,300 | 7,200 |\n| 500,000 | 33,000 | 17,000 |\n| 1,000,000 | 54,000 | 32,000 |\n| 2,000,000（新增） | — | 62,000 |\n| 5,000,000 | 210,000 | 150,000 |\n\n### 按量后付费\n\n- 不限月调用量\n- 原价 **0.09 元/页**，现价 **0.05 元/页**\n- 仅成功调用计费，**调用失败不计费**\n\n### 购买入口\n\n- **购买资源包 / 开通后付费**：均通过[百度智能云控制台](https://console.bce.baidu.com/ai/) 文字识别产品页面进行\n- **退订**：资源包购买后 7 天内未产生调用可前往\"退订管理页面\"自助退订\n\n## 脚本\n\n- `scripts/baidu_doc_vlm_parser.py`：文档解析主程序，支持命令行快速调用\n\n## 参考文档\n\n- `references/parameters.md`：完整 API 参数与返回结构详解\n- `references/error_codes.md`：完整错误码参考\n- `references/apikey-fetch.md`：API Key 配置指南\n\n## 相关链接\n\n- [官方技术文档](https://cloud.baidu.com/doc/OCR/s/3mi73at9o)\n- [产品计费与购买](https://cloud.baidu.com/doc/OCR/s/Fls06fa15#%E6%96%87%E6%A1%A3%E8%A7%A3%E6%9E%90%EF%BC%88paddleocr-vl%EF%BC%89)\n- [百度云控制台](https://console.bce.baidu.com/ai/)\n- [智能文档分析平台](https://ai.baidu.com/solution/intelligent-document-analysis)\n\nFile v1.0.5:_meta.json\n\n{\n  \"ownerId\": \"kn75p1w9cr0c8ycct5wzrb5ken83e9nc\",\n  \"slug\": \"baidu-doc-vlm-parser\",\n  \"version\": \"1.0.5\",\n  \"publishedAt\": 1789643784084\n}\n\nFile v1.0.5:references/apikey-fetch.md\n\n# 百度文档解析（PaddleOCR-VL）API Key 配置指南\n\n## BAIDU_DOC_AI_API_KEY 和 BAIDU_DOC_AI_SECRET_KEY 未配置\n\n当环境变量未设置时，按照以下步骤操作：\n\n### 1. 获取 API Key 和 Secret Key\n\n访问：**https://ai.baidu.com/ai-doc/REFERENCE/Ck3dwjhhu#1-获取aksk**\n\n- 登录百度云账号\n- 创建应用或查看已有的 API Key 和 Secret Key\n- 复制你的 **API Key** 和 **Secret Key**\n\n### 2. 领取免费测试资源\n\n访问：**https://ai.baidu.com/ai-doc/OCR/dk3iqnq51**\n\n### 3. 配置环境变量\n\n```bash\nexport BAIDU_DOC_AI_API_KEY=\"your_actual_api_key_here\"\nexport BAIDU_DOC_AI_SECRET_KEY=\"your_actual_secret_key_here\"\n```\n\n或通过配置文件 `~/.claude/settings.json`：\n\n```json\n{\n  \"skills\": {\n    \"entries\": {\n      \"baidu-doc-vlm-parser\": {\n        \"env\": {\n          \"BAIDU_DOC_AI_API_KEY\": \"your_actual_api_key_here\",\n          \"BAIDU_DOC_AI_SECRET_KEY\": \"your_actual_secret_key_here\"\n        }\n      }\n    }\n  }\n}\n```\n\n### 4. 验证配置\n\n```bash\ncurl -X POST 'https://aip.baidubce.com/oauth/2.0/token' \\\n  -d 'grant_type=client_credentials' \\\n  -d 'client_id={your_api_key}' \\\n  -d 'client_secret={your_secret_key}'\n```\n\n### 5. 测试\n\n```bash\npython3 scripts/baidu_doc_vlm_parser.py --file_url \"https://example.com/test.pdf\" --file_name \"test.pdf\"\n```\n\n## 相关链接\n\n- [获取 AK/SK 文档](https://ai.baidu.com/ai-doc/REFERENCE/Ck3dwjhhu#1-获取aksk)\n- [领取免费资源](https://ai.baidu.com/ai-doc/OCR/dk3iqnq51)\n- [百度云控制台](https://console.bce.baidu.com/ai/)\n\nFile v1.0.5:references/error_codes.md\n\n# 百度文档解析（PaddleOCR-VL）错误码参考\n\n## 通用错误\n\n### 认证相关错误\n\n| 错误码 | 错误信息 | 说明 | 解决方案 |\n|--------|---------|------|----------|\n| 1 | Unknown error | 未知错误 | 重试请求 |\n| 2 | Service temporarily unavailable | 服务暂不可用 | 重试请求 |\n| 3 | Unsupported openapi method | API 接口不存在 | 检查 URL |\n| 4 | Open api request limit reached | 集群超限额 | 重试请求 |\n| 6 | No permission to access data | 无 API 访问权限 | 在百度云控制台开通 |\n| 17 | Open api daily request limit reached | 日配额超限 | 购买额度或等待重置 |\n| 18 | Open api qps request limit reached | QPS 超限 | 降低请求频率 |\n| 19 | Open api total request limit reached | 总量配额超限 | 购买额外配额 |\n| 100 | Invalid parameter | access_token 无效 | 重新获取 |\n| 110 | Access token invalid or no longer valid | access_token 无效 | 重新获取（30天有效期） |\n| 111 | Access token expired | access_token 过期 | 重新获取 |\n\n### 文件相关错误\n\n| 错误码 | 错误信息 | 说明 | 解决方案 |\n|--------|---------|------|----------|\n| 216200 | empty file or fileurl | 文件或 URL 为空 | 提供 file_data 或 file_url |\n| 216201 | file format error | 文件格式不支持 | 使用支持的格式 |\n| 216202 | file size error | 文件大小超限 | 缩减文件大小 |\n\n### 任务处理错误\n\n| 错误码 | 错误信息 | 说明 | 解决方案 |\n|--------|---------|------|----------|\n| 282000 | internal error | 任务处理失败 | 重试或联系技术支持 |\n| 282003 | missing parameters | 缺少必要参数 | 检查必填参数 |\n| 282005 | quota exceed error | 额度不足 | 申请增加配额 |\n| 282007 | task not exist | 任务不存在 | 检查 task_id |\n| 282018 | Service busy | 服务繁忙 | 降低请求频率 |\n\n### URL 相关错误\n\n| 错误码 | 错误信息 | 说明 | 解决方案 |\n|--------|---------|------|----------|\n| 282111 | url format illegal | URL 格式不合法 | 检查 URL 格式 |\n| 282112 | url download timeout | URL 下载超时 | 检查 URL 可访问性 |\n| 282113 | url response invalid | URL 响应无效 | 检查 URL 返回内容 |\n| 282114 | url size error | URL 长度超 1024 字节 | 缩短 URL |\n\n## 错误处理策略\n\n| 错误类型 | 错误码 | 建议处理方式 |\n|---------|--------|-------------|\n| 瞬时错误 | 1, 2, 4, 282000, 282018 | 指数退避重试 |\n| 认证错误 | 100, 110, 111 | 重新获取 access_token |\n| 配额错误 | 17, 18, 19, 282005 | 等待或购买额外配额 |\n| 参数错误 | 216200, 216201, 282003 | 修正参数后重试 |\n\n## 获取帮助\n\n- [提交工单](https://ticket.bce.baidu.com/?_=1648086674827&fromai=1#/ticket/create~productId=96&questionId=1306&channel=2)\n- [百度云控制台](https://console.bce.baidu.com/ai/)\n\nFile v1.0.5:references/parameters.md\n\n# 百度文档解析（PaddleOCR-VL）API 参数详解\n\n## 接口概述\n\n基于 PaddleOCR-VL-1.6-0.9B 多模态大模型，具备全要素精准解析能力，支持 100+ 种语言，可处理不规则布局和长文档跨页解析。\n\n## API 接口地址\n\n### 提交请求接口\n\n```\nPOST https://aip.baidubce.com/rest/2.0/brain/online/v2/paddle-vl-parser/task?access_token={access_token}\nContent-Type: application/x-www-form-urlencoded\n```\n\n### 获取结果接口\n\n```\nPOST https://aip.baidubce.com/rest/2.0/brain/online/v2/paddle-vl-parser/task/query?access_token={access_token}\nContent-Type: application/x-www-form-urlencoded\n```\n\n## 提交请求参数\n\n### 文件参数（必选，二选一）\n\n| 参数 | 必选 | 类型 | 说明 |\n|------|------|------|------|\n| file_data | 和 file_url 二选一 | string | 文件 Base64 编码。版式文档：pdf, jpg, jpeg, png, bmp, tif, tiff, ofd（图片最长边不大于 8192px）；流式文档：doc, docx, txt, wps, ppt, pptx。图片≤10M，版式文档≤100M，流式文档≤50M，PDF≤500页。超过50M须用file_url。优先级：file_data > file_url |\n| file_url | 和 file_data 二选一 | string | 文件URL，≤1024字节。PDF≤100M，≤500页。请关闭URL防盗链 |\n| file_name | 是 | string | 文件名，后缀须正确，如 \"1.pdf\" |\n\n### 功能参数\n\n| 参数 | 必选 | 类型 | 说明 |\n|------|------|------|------|\n| recognize_formula | - | bool | **无需开启**，大模型默认识别公式 |\n| analysis_chart | 否 | bool | 是否对统计图表进行解析 |\n| parse_image_layout | - | bool | **无需开启**，大模型默认解析所有图片 |\n| language_type | - | string | **无需开启**，大模型默认识别语种 |\n| merge_tables | 否 | bool | 是否合并跨页表格 |\n| relevel_titles | 否 | bool | 是否对 paragraph_title 进行分级 |\n| recognize_seal | 否 | bool | 是否识别印章 |\n| return_span_boxes | 否 | bool | 是否返回行坐标 |\n\n### 文档分块参数\n\n| 参数 | 必选 | 类型 | 默认值 | 说明 |\n|------|------|------|--------|------|\n| return_doc_chunks.switch | 否 | bool | False | 是否切分 |\n| return_doc_chunks.chunk_size | 否 | int | -1 | 切分块大小，-1为语义自动切分 |\n\n## 返回结构\n\n### 获取结果返回\n\n| 字段 | 类型 | 说明 |\n|------|------|------|\n| result.task_id | string | 任务 ID |\n| result.status | string | pending/processing/success/failed |\n| result.task_error | string | 报错信息 |\n| result.markdown_url | string | Markdown 结果链接（30天有效） |\n| result.parse_result_url | string | JSON 结果 BOS 链接（30天有效） |\n\n### 版面类型（24种）\n\n| 类型 | 说明 | 类型 | 说明 |\n|------|------|------|------|\n| text | 文本 | table | 表格 |\n| image | 图片 | chart | 图表 |\n| doc_title | 文档标题 | paragraph_title | 段落标题 |\n| figure_title | 图片标题 | display_formula | 公式 |\n| inline_formula | 行内公式 | formula_number | 公式编号 |\n| header | 页眉 | footer | 页脚 |\n| header_image | 页眉图片 | footer_image | 页脚图片 |\n| number | 页码 | abstract | 摘要 |\n| algorithm | 算法 | aside_text | 旁注文本 |\n| content | 目录 | footnote | 脚注 |\n| reference | 参考文献 | reference_content | 参考文献内容 |\n| seal | 印章 | vertical_text | 竖排文本 |\n\n## 相关文档\n\n- [官方 API 文档](https://ai.baidu.com/ai-doc/OCR/3mi73at9o)\n- [错误码参考](error_codes.md)\n- [API Key 配置指南](apikey-fetch.md)\n\nFile v1.0.5:skill-card.md\n\n## Description:\n\n调用百度PaddleOCR-VL大模型API解析文档，支持PDF、Word、PPT、图片等格式，并可识别印刷文本、手写文本、表格、公式、图表、印章和复杂版面元素。\n\nThis skill is ready for commercial/non-commercial use.\n\n## Publisher:\n\n[maglanyulan](https://clawhub.ai/user/maglanyulan)\n\n### License/Terms of Use:\n\nMIT-0\n\n## Use Case:\n\nDevelopers and document-processing teams use this skill to submit documents or document URLs to Baidu PaddleOCR-VL and retrieve structured parsing results such as Markdown, JSON, layout elements, tables, images, coordinates, and task status.\n\n### Deployment Geography for Use:\n\nGlobal\n\n## Known Risks and Mitigations:\n\nRisk: The skill can send full documents, document URLs, and Baidu API credentials to external Baidu Cloud services.\n\nMitigation: Use it only with documents approved for Baidu Cloud processing, store credentials through controlled environment configuration, and avoid confidential, regulated, customer, legal, financial, or identity documents unless organizational policy permits that processing.\n\nRisk: Returned Baidu result links may expose parsed Markdown or JSON output while they remain valid.\n\nMitigation: Treat result links as sensitive, limit sharing, and disable automatic result downloading when local retention is not needed.\n\nRisk: The authoritative security summary reports one unsafe result-download pattern.\n\nMitigation: Review downloaded parse-result content before downstream use and run the skill in an environment with appropriate network, credential, and data-handling controls.\n\n## Reference(s):\n\n- [ClawHub skill page](https://clawhub.ai/maglanyulan/skills/baidu-doc-vlm-parser)\n- [Baidu PaddleOCR-VL API documentation](https://cloud.baidu.com/doc/OCR/s/3mi73at9o)\n- [Baidu OCR pricing and purchasing](https://cloud.baidu.com/doc/OCR/s/Fls06fa15#%E6%96%87%E6%A1%A3%E8%A7%A3%E6%9E%90%EF%BC%88paddleocr-vl%EF%BC%89)\n- [Baidu OCR error codes](https://cloud.baidu.com/doc/OCR/s/dk3iqnq51)\n- [API Key configuration guide](references/apikey-fetch.md)\n- [API parameters](references/parameters.md)\n- [Error codes](references/error_codes.md)\n\n## Skill Output:\n\n**Output Type(s):** [text, markdown, code, shell commands, configuration, guidance]\n\n**Output Format:** [Markdown guidance, shell command examples, and JSON API responses]\n\n**Output Parameters:** [1D]\n\n**Other Properties Related to Output:** [Can return Baidu-hosted Markdown and JSON result URLs, downloaded parse results, task IDs, status messages, and error details.]\n\n## Skill Version(s):\n\n1.0.5 (source: server-resolved release metadata)\n\n## Ethical Considerations:\n\nUsers should evaluate whether this skill is appropriate for their environment, review any generated or modified files before relying on them, and apply their organization's safety, security, and compliance requirements before deployment.\n\nArchive v1.0.4: 7 files, 14483 bytes\n\nFiles: _meta.json (139b), references/apikey-fetch.md (1537b), references/error_codes.md (2855b), references/parameters.md (3491b), scripts/baidu_doc_vlm_parser.py (9656b), skill-card.md (2734b), SKILL.md (14311b)\n\nFile v1.0.4:SKILL.md\n\n---\nname: baidu-doc-vlm-parser 百度文档解析(PaddleOCR-VL)\ndescription: 调用百度PaddleOCR-VL大模型API解析文档。基于PaddleOCR-VL-1.6多模态大模型，支持PDF、Word、PPT、图片等格式，精准识别印刷文本、手写文本、表格、公式、图表、印章等复杂元素，支持100+种语言，可处理不规则布局和长文档跨页解析。触发词：文档解析、VLM解析、大模型OCR、PaddleOCR、多模态文档、手写识别、公式识别、复杂版面。\nlicense: MIT\n---\n\n# 百度文档解析（PaddleOCR-VL）Skill\n\n基于 PaddleOCR-VL-1.6 多模态大模型，提供开箱即用的文档智能解析能力。\n\n## 功能概述\n\n**PaddleOCR-VL-1.6-0.9B** 是多模态文档解析领域的 SOTA 方案，具备：\n\n- **全要素精准解析**：高效识别印刷文本、手写文本、表格、公式、图表、印章等复杂文档元素\n- **智能阅读顺序**：基于人类阅读习惯推断内容排列顺序，将零散页面信息转化为有序带标签的结构化元素序列\n- **行级别坐标**：支持精准的行级别坐标输出\n- **100+ 种语言**：覆盖中、英、日、韩、拉丁文等全球化多语种文档\n- **不规则布局定位**：攻克复杂版面解析难点\n- **长文档跨页解析**：支持跨页表格合并等企业级场景\n- **直接 Markdown/JSON 输出**：无需额外处理\n\n## 与文档解析（标准版）的区别\n\n| 特性 | PaddleOCR-VL（本 Skill） | 标准版（pipeline-parser） |\n|------|-------------------------|--------------------------|\n| 底层模型 | 多模态大模型 VLM | 传统 Pipeline |\n| 语言支持 | 100+ 种 | 20+ 种 |\n| 公式/图片识别 | 默认开启，无需配置 | 需手动开启参数 |\n| 语种识别 | 自动识别，无需指定 | 需指定 language_type |\n| 版面类型 | 24 种细粒度类型 | 8 种基础类型 |\n| 行坐标 | 支持 | 不支持 |\n| 多边形坐标 | 支持（polygon） | 仅矩形框 |\n| 文件大小 | 版式 ≤100M，PDF ≤500 页 | PDF ≤300M，≤2000 页 |\n\n## 适用场景\n\n当用户需要：\n- 解析复杂版面文档（多栏、不规则布局）\n- 精准识别手写文本、数学公式、图表\n- 处理多语种混合文档\n- 获取行级别坐标信息\n- 长文档跨页表格合并\n- 免配置自动识别文档内容\n\n## 免费资源领取和计费说明\n[百度智能文档分析平台 领取免费测试资源](https://cloud.baidu.com/doc/OCR/s/fk3h7xu7h)\n\n\n[百度智能文档分析平台计费与购买方式](https://cloud.baidu.com/doc/OCR/s/Fls06fa15#%E6%96%87%E6%A1%A3%E8%A7%A3%E6%9E%90%EF%BC%88paddleocr-vl%EF%BC%89)\n\n\n| 用户类型 | 免费额度 |\n|---------|---------|\n| 个人实名认证用户 | **200 页** |\n| 企业实名认证用户 | **1000 页** |\n\n## API 配置\n\n### 额度获取方式\n\n您可通过百度智能云平台获取[免费额度](https://cloud.baidu.com/doc/OCR/s/fk3h7xu7h)与[购买调用资源](https://cloud.baidu.com/doc/OCR/s/Fls06fa15#%E6%96%87%E6%A1%A3%E8%A7%A3%E6%9E%90%EF%BC%88paddleocr-vl%EF%BC%89)\n\n### 环境变量（必须）\n\n使用前请设置以下环境变量：\n\n```bash\nexport BAIDU_DOC_AI_API_KEY=\"your_api_key\"\nexport BAIDU_DOC_AI_SECRET_KEY=\"your_secret_key\"\n```\n\n### 认证方式\n\n通过 API Key 和 Secret Key 获取 access_token，有效期 30 天。所有接口请求需以 URL 参数 `access_token` 携带。\n\n## 支持格式\n\n**版式文档**：pdf, jpg, jpeg, png, bmp, tif, tiff, ofd（图片最长边不大于 8192px）\n\n**流式文档**：doc, docx, txt, wps, ppt, pptx\n\n## 支持语言\n\n100+ 种语言，包括中文、英文、日文、韩文、拉丁文等，**无需手动指定，大模型自动识别**。\n\n## 使用方式\n\n```bash\npython3 scripts/baidu_doc_vlm_parser.py --file_data <文件的base64编码> --file_name \"test.pdf\"\npython3 scripts/baidu_doc_vlm_parser.py --file_url <文件公网URL> --file_name \"test.pdf\"\n```\n\n## API 接口\n\n文档解析（PaddleOCR-VL）API 服务为异步接口，需要先调用**提交请求接口**获取 task_id，然后调用**获取结果接口**进行结果轮询。\n\n### 提交请求接口\n\n- **HTTP 方法**：POST\n- **请求 URL**：`https://aip.baidubce.com/rest/2.0/brain/online/v2/paddle-vl-parser/task?access_token={token}`\n- **Content-Type**：`application/x-www-form-urlencoded`\n\n#### Python 示例\n\n```python\nimport requests, os, base64\n\ndef create_task(url, file_path, file_url):\n    with open(file_path, \"rb\") as f:\n        file_data = base64.b64encode(f.read())\n    data = {\n        \"file_data\": file_data,\n        \"file_url\": file_url,\n        \"file_name\": os.path.basename(file_path)\n    }\n    headers = {'Content-Type': 'application/x-www-form-urlencoded'}\n    return requests.post(url, headers=headers, data=data)\n\nrequest_host = \"https://aip.baidubce.com/rest/2.0/brain/online/v2/paddle-vl-parser/task?access_token={token}\"\nresponse = create_task(request_host, \"./test.pdf\", \"\")\nprint(response.json())\n```\n\n**成功响应示例：**\n\n```json\n{\n  \"error_code\": 0,\n  \"error_msg\": \"\",\n  \"log_id\": \"10138598131137362685273505665433\",\n  \"result\": { \"task_id\": \"task-3zy9Bg8CHt1M4pPOcX2q5bg28j26801S\" }\n}\n```\n\n### 获取结果接口\n\n- **HTTP 方法**：POST\n- **请求 URL**：`https://aip.baidubce.com/rest/2.0/brain/online/v2/paddle-vl-parser/task/query?access_token={token}`\n- **Content-Type**：`application/x-www-form-urlencoded`\n- **请求参数**：`task_id`（必填，提交请求时返回的 task_id）\n\n#### Python 示例\n\n```python\nimport requests\n\ndef query_task(url, task_id):\n    data = {\"task_id\": task_id}\n    headers = {'Content-Type': 'application/x-www-form-urlencoded'}\n    return requests.post(url, headers=headers, data=data)\n\nrequest_host = \"https://aip.baidubce.com/rest/2.0/brain/online/v2/paddle-vl-parser/task/query?access_token={access_token}\"\nresp = query_task(request_host, \"task_id\")\nprint(resp.json())\n```\n\n## 请求参数\n\n### 文件参数（必选，二选一）\n\n| 参数 | 必选 | 类型 | 说明 |\n|------|------|------|------|\n| `file_data` | 和 file_url 二选一 | string | 文件 Base64 编码数据。版式文档：pdf, jpg, jpeg, png, bmp, tif, tiff, ofd（图片最长边不大于 8192px）；流式文档：doc, docx, txt, wps, ppt, pptx。图片不超过 10M，版式文档不超过 100M，流式文档不超过 50M，PDF 最大 500 页。超过 50M 须使用 file_url。优先级：file_data > file_url |\n| `file_url` | 和 file_data 二选一 | string | 文件数据 URL，长度不超过 1024 字节。PDF 文档不超过 100M，最大 500 页。**请注意关闭 URL 防盗链** |\n| `file_name` | 是 | string | 文件名，请保证文件名后缀正确，例如 \"1.pdf\" |\n\n### 功能参数\n\n| 参数 | 必选 | 类型 | 说明 |\n|------|------|------|------|\n| `recognize_formula` | - | bool | **无需开启**，大模型默认对版式类型文档进行公式识别 |\n| `analysis_chart` | 否 | bool | 是否对统计图表进行解析 |\n| `parse_image_layout` | - | bool | **无需开启**，大模型默认解析文档中的所有图片 |\n| `language_type` | - | string | **无需开启**，大模型默认识别语种类型 |\n| `merge_tables` | 否 | bool | 是否将跨页表格合并输出，开启后 tables 内返回跨页表格合并标识 |\n| `relevel_titles` | 否 | bool | 是否对段落标题（paragraph_title）进行分级，开启后在 sub_type 中输出标题级别 |\n| `recognize_seal` | 否 | bool | 是否识别印章内容 |\n| `return_span_boxes` | 否 | bool | 是否返回行坐标 |\n\n## 返回结构\n\n### 提交请求返回\n\n| 字段 | 类型 | 说明 |\n|------|------|------|\n| `log_id` | uint64 | 唯一的 log id，用于问题定位 |\n| `error_code` | int | 错误码 |\n| `error_msg` | string | 错误描述信息 |\n| `result.task_id` | string | 该请求生成的 task_id |\n\n### 获取结果返回\n\n| 字段 | 类型 | 说明 |\n|------|------|------|\n| `result.task_id` | string | 任务 ID |\n| `result.status` | string | 任务状态：pending（排队中）、processing（运行中）、success（成功）、failed（失败） |\n| `result.task_error` | string | 解析报错信息（任务失败、额度耗尽等） |\n| `result.markdown_url` | string | Markdown 格式结果链接，**有效期 30 天** |\n| `result.parse_result_url` | string | JSON 格式结果 BOS 链接，**有效期 30 天** |\n\n### 解析结果 JSON 结构（parse_result_url）\n\n顶层字段：`file_name`、`file_id`、`pages[]`。\n\n#### 页面对象（pages[]）\n\n| 字段 | 类型 | 说明 |\n|------|------|------|\n| `page_id` | string | 页码 ID |\n| `page_num` | int | 页码数 |\n| `text` | string | 当前页所有纯文字内容 |\n| `layouts` | list | 版式分析结果 |\n| `tables` | list | 表格解析结果 |\n| `images` | list | 图片解析结果 |\n| `meta` | dict | 页面元信息（page_width, page_height） |\n\n#### 版面元素（layouts[]）\n\n| 字段 | 类型 | 说明 |\n|------|------|------|\n| `layout_id` | string | 唯一标志，格式 \"xxxxx-layout-{global_layout_index}\" |\n| `text` | string | 文本内容（type 为 table/image 时为空） |\n| `position` | list | 位置 [x, y, w, h] |\n| `polygon` | list | 顶点坐标列表，可围合成多边形 |\n| `span_boxes` | list | 行信息（开启 return_span_boxes 后生效），含 text 和 location |\n| `type` | string | 版面元素类型（见下表） |\n| `sub_type` | string | 标题层级（开启 relevel_titles 后生效） |\n\n**版面类型（type）— 24 种细粒度类型**：\n\n| 类型 | 说明 | 类型 | 说明 |\n|------|------|------|------|\n| `text` | 文本 | `table` | 表格 |\n| `image` | 图片 | `chart` | 图表 |\n| `doc_title` | 文档标题 | `paragraph_title` | 段落标题 |\n| `figure_title` | 图片标题 | `display_formula` | 公式 |\n| `inline_formula` | 行内公式 | `formula_number` | 公式编号 |\n| `header` | 页眉 | `footer` | 页脚 |\n| `header_image` | 页眉图片 | `footer_image` | 页脚图片 |\n| `number` | 页码 | `abstract` | 摘要 |\n| `algorithm` | 算法 | `aside_text` | 旁注文本 |\n| `content` | 目录 | `footnote` | 脚注 |\n| `reference` | 参考文献 | `reference_content` | 参考文献内容 |\n| `seal` | 印章 | `vertical_text` | 竖排文本 |\n\n#### 表格对象（tables[]）\n\n| 字段 | 类型 | 说明 |\n|------|------|------|\n| `layout_id` | string | 对应 layouts 中 type 为 table 的 layout ID |\n| `markdown` | string | 表格 Markdown 形式 |\n| `position` | list | 边框数据 [x, y, w, h] |\n| `cells` | list | 单元格内版面信息（扁平列表） |\n| `matrix` | list | 2D 单元格索引矩阵，元素为 `cells` 数组下标；相同下标重复出现表示合并单元格 |\n| `merge_table` | string | 合并标识（开启 merge_tables 后）：begin（开始）、end（结束） |\n\n#### 图片对象（images[]）\n\n| 字段 | 类型 | 说明 |\n|------|------|------|\n| `layout_id` | string | 对应 layouts 中 type 为 image 的 layout ID |\n| `position` | list | 边框数据 [x, y, w, h] |\n| `data_url` | string | 图片存储链接 |\n| `image_description` | string | 统计图表内容解析（JSON 字符串，需 `json.loads` 解析） |\n\n## API 特性\n\n### 异步处理流程\n\n1. 调用提交请求接口 → 获取 `task_id`\n2. 通过 `task_id` 调用获取结果接口轮询\n\n### 轮询建议\n\n- 提交请求后 5~10 秒开始轮询\n- 轮询间隔：5 秒\n- 最大轮询时间：300 秒\n\n### QPS 限制\n\n- 提交请求接口：**2 QPS**\n- 获取结果接口：**5 QPS**\n\n## 文件限制\n\n| 限制项 | 说明 |\n|--------|------|\n| 图片大小 | ≤ 10M，最长边 ≤ 8192px |\n| 版式文档大小 | ≤ 100M |\n| 流式文档大小 | ≤ 50M |\n| PDF 页数 | ≤ 500 页 |\n| URL 长度 | ≤ 1024 字节 |\n| 优先级 | file_data > file_url |\n\n## 错误处理\n\n常见错误码示例：\n\n| 错误码 | 说明 |\n|--------|------|\n| `282003` | missing parameters（缺少必要参数） |\n| `282007` | task not exist, please check task id（任务不存在） |\n\n完整错误码参见 `references/error_codes.md` 及 [OCR 错误码文档](https://cloud.baidu.com/doc/OCR/s/dk3iqnq51)。\n\n**失败响应示例：**\n\n```json\n{\n  \"log_id\": \"13665091038742503867108513247608\",\n  \"error_code\": \"282007\",\n  \"error_msg\": \"task not exist, please check task id\",\n  \"result\": \"null\"\n}\n```\n\n## 产品计费与购买方式\n\n> 数据来源：[百度智能云 OCR 计费说明](https://cloud.baidu.com/doc/OCR/s/Fls06fa15#%E6%96%87%E6%A1%A3%E8%A7%A3%E6%9E%90%EF%BC%88paddleocr-vl%EF%BC%89)\n\n### 免费额度\n\n登录[文字识别控制台](https://console.bce.baidu.com/ai/)自动领取：\n\n| 用户类型 | 免费额度 |\n|---------|---------|\n| 个人实名认证用户 | **200 页** |\n| 企业实名认证用户 | **1000 页** |\n\n### 新人优惠\n\n限时活动价 **9 元/千页**，面向新用户。\n\n### 预付费资源包\n\n有效期 **1 年**，到期未抵扣额度作废。购买后 7 天内若未产生调用可自助退订。\n\n| 规格（页） | 原价（元） | 优惠价（元） |\n|---:|---:|---:|\n| 1,000 | 180 | 90 |\n| 5,000 | 850 | 425 |\n| 10,000 | 1,600 | 800 |\n| 50,000 | 7,500 | 3,750 |\n| 100,000 | 14,000 | 7,700 |\n| 200,000 | 26,000 | 14,300 |\n| 500,000 | 55,000 | 33,000 |\n| 1,000,000 | 90,000 | 54,000 |\n| 5,000,000 | 350,000 | 210,000 |\n\n### 按量后付费\n\n- 不限月调用量\n- 原价 **0.18 元/页**，优惠价 **0.09 元/页**\n- 仅成功调用计费，**调用失败不计费**\n\n### 购买入口\n\n- **购买资源包 / 开通后付费**：均通过[百度智能云控制台](https://console.bce.baidu.com/ai/) 文字识别产品页面进行\n- **退订**：资源包购买后 7 天内未产生调用可前往\"退订管理页面\"自助退订\n\n## 脚本\n\n- `scripts/baidu_doc_vlm_parser.py`：文档解析主程序，支持命令行快速调用\n\n## 参考文档\n\n- `references/parameters.md`：完整 API 参数与返回结构详解\n- `references/error_codes.md`：完整错误码参考\n- `references/apikey-fetch.md`：API Key 配置指南\n\n## 相关链接\n\n- [官方技术文档](https://cloud.baidu.com/doc/OCR/s/3mi73at9o)\n- [产品计费与购买](https://cloud.baidu.com/doc/OCR/s/Fls06fa15#%E6%96%87%E6%A1%A3%E8%A7%A3%E6%9E%90%EF%BC%88paddleocr-vl%EF%BC%89)\n- [百度云控制台](https://console.bce.baidu.com/ai/)\n- [智能文档分析平台](https://ai.baidu.com/solution/intelligent-document-analysis)\n\nFile v1.0.4:_meta.json\n\n{\n  \"ownerId\": \"kn75p1w9cr0c8ycct5wzrb5ken83e9nc\",\n  \"slug\": \"baidu-doc-vlm-parser\",\n  \"version\": \"1.0.4\",\n  \"publishedAt\": 1783500098337\n}\n\nFile v1.0.4:references/apikey-fetch.md\n\n# 百度文档解析（PaddleOCR-VL）API Key 配置指南\n\n## BAIDU_DOC_AI_API_KEY 和 BAIDU_DOC_AI_SECRET_KEY 未配置\n\n当环境变量未设置时，按照以下步骤操作：\n\n### 1. 获取 API Key 和 Secret Key\n\n访问：**https://ai.baidu.com/ai-doc/REFERENCE/Ck3dwjhhu#1-获取aksk**\n\n- 登录百度云账号\n- 创建应用或查看已有的 API Key 和 Secret Key\n- 复制你的 **API Key** 和 **Secret Key**\n\n### 2. 领取免费测试资源\n\n访问：**https://ai.baidu.com/ai-doc/OCR/dk3iqnq51**\n\n### 3. 配置环境变量\n\n```bash\nexport BAIDU_DOC_AI_API_KEY=\"your_actual_api_key_here\"\nexport BAIDU_DOC_AI_SECRET_KEY=\"your_actual_secret_key_here\"\n```\n\n或通过配置文件 `~/.claude/settings.json`：\n\n```json\n{\n  \"skills\": {\n    \"entries\": {\n      \"baidu-doc-vlm-parser\": {\n        \"env\": {\n          \"BAIDU_DOC_AI_API_KEY\": \"your_actual_api_key_here\",\n          \"BAIDU_DOC_AI_SECRET_KEY\": \"your_actual_secret_key_here\"\n        }\n      }\n    }\n  }\n}\n```\n\n### 4. 验证配置\n\n```bash\ncurl -X POST 'https://aip.baidubce.com/oauth/2.0/token' \\\n  -d 'grant_type=client_credentials' \\\n  -d 'client_id={your_api_key}' \\\n  -d 'client_secret={your_secret_key}'\n```\n\n### 5. 测试\n\n```bash\npython3 scripts/baidu_doc_vlm_parser.py --file_url \"https://example.com/test.pdf\" --file_name \"test.pdf\"\n```\n\n## 相关链接\n\n- [获取 AK/SK 文档](https://ai.baidu.com/ai-doc/REFERENCE/Ck3dwjhhu#1-获取aksk)\n- [领取免费资源](https://ai.baidu.com/ai-doc/OCR/dk3iqnq51)\n- [百度云控制台](https://console.bce.baidu.com/ai/)\n\nFile v1.0.4:references/error_codes.md\n\n# 百度文档解析（PaddleOCR-VL）错误码参考\n\n## 通用错误\n\n### 认证相关错误\n\n| 错误码 | 错误信息 | 说明 | 解决方案 |\n|--------|---------|------|----------|\n| 1 | Unknown error | 未知错误 | 重试请求 |\n| 2 | Service temporarily unavailable | 服务暂不可用 | 重试请求 |\n| 3 | Unsupported openapi method | API 接口不存在 | 检查 URL |\n| 4 | Open api request limit reached | 集群超限额 | 重试请求 |\n| 6 | No permission to access data | 无 API 访问权限 | 在百度云控制台开通 |\n| 17 | Open api daily request limit reached | 日配额超限 | 购买额度或等待重置 |\n| 18 | Open api qps request limit reached | QPS 超限 | 降低请求频率 |\n| 19 | Open api total request limit reached | 总量配额超限 | 购买额外配额 |\n| 100 | Invalid parameter | access_token 无效 | 重新获取 |\n| 110 | Access token invalid or no longer valid | access_token 无效 | 重新获取（30天有效期） |\n| 111 | Access token expired | access_token 过期 | 重新获取 |\n\n### 文件相关错误\n\n| 错误码 | 错误信息 | 说明 | 解决方案 |\n|--------|---------|------|----------|\n| 216200 | empty file or fileurl | 文件或 URL 为空 | 提供 file_data 或 file_url |\n| 216201 | file format error | 文件格式不支持 | 使用支持的格式 |\n| 216202 | file size error | 文件大小超限 | 缩减文件大小 |\n\n### 任务处理错误\n\n| 错误码 | 错误信息 | 说明 | 解决方案 |\n|--------|---------|------|----------|\n| 282000 | internal error | 任务处理失败 | 重试或联系技术支持 |\n| 282003 | missing parameters | 缺少必要参数 | 检查必填参数 |\n| 282005 | quota exceed error | 额度不足 | 申请增加配额 |\n| 282007 | task not exist | 任务不存在 | 检查 task_id |\n| 282018 | Service busy | 服务繁忙 | 降低请求频率 |\n\n### URL 相关错误\n\n| 错误码 | 错误信息 | 说明 | 解决方案 |\n|--------|---------|------|----------|\n| 282111 | url format illegal | URL 格式不合法 | 检查 URL 格式 |\n| 282112 | url download timeout | URL 下载超时 | 检查 URL 可访问性 |\n| 282113 | url response invalid | URL 响应无效 | 检查 URL 返回内容 |\n| 282114 | url size error | URL 长度超 1024 字节 | 缩短 URL |\n\n## 错误处理策略\n\n| 错误类型 | 错误码 | 建议处理方式 |\n|---------|--------|-------------|\n| 瞬时错误 | 1, 2, 4, 282000, 282018 | 指数退避重试 |\n| 认证错误 | 100, 110, 111 | 重新获取 access_token |\n| 配额错误 | 17, 18, 19, 282005 | 等待或购买额外配额 |\n| 参数错误 | 216200, 216201, 282003 | 修正参数后重试 |\n\n## 获取帮助\n\n- [提交工单](https://ticket.bce.baidu.com/?_=1648086674827&fromai=1#/ticket/create~productId=96&questionId=1306&channel=2)\n- [百度云控制台](https://console.bce.baidu.com/ai/)\n\nFile v1.0.4:references/parameters.md\n\n# 百度文档解析（PaddleOCR-VL）API 参数详解\n\n## 接口概述\n\n基于 PaddleOCR-VL-1.5-0.9B 多模态大模型，具备全要素精准解析能力，支持 111 种语言，可处理不规则布局和长文档跨页解析。\n\n## API 接口地址\n\n### 提交请求接口\n\n```\nPOST https://aip.baidubce.com/rest/2.0/brain/online/v2/paddle-vl-parser/task?access_token={access_token}\nContent-Type: application/x-www-form-urlencoded\n```\n\n### 获取结果接口\n\n```\nPOST https://aip.baidubce.com/rest/2.0/brain/online/v2/paddle-vl-parser/task/query?access_token={access_token}\nContent-Type: application/x-www-form-urlencoded\n```\n\n## 提交请求参数\n\n### 文件参数（必选，二选一）\n\n| 参数 | 必选 | 类型 | 说明 |\n|------|------|------|------|\n| file_data | 和 file_url 二选一 | string | 文件 Base64 编码。版式文档：pdf, jpg, jpeg, png, bmp, tif, tiff, ofd（图片最长边≤4096px）；流式文档：doc, docx, txt, wps, ppt, pptx。图片≤10M，版式文档≤100M，流式文档≤50M，PDF≤500页。超过50M须用file_url。优先级：file_data > file_url |\n| file_url | 和 file_data 二选一 | string | 文件URL，≤1024字节。PDF≤100M，≤500页。请关闭URL防盗链 |\n| file_name | 是 | string | 文件名，后缀须正确，如 \"1.pdf\" |\n\n### 功能参数\n\n| 参数 | 必选 | 类型 | 说明 |\n|------|------|------|------|\n| recognize_formula | - | bool | **无需开启**，大模型默认识别公式 |\n| analysis_chart | 否 | bool | 是否对统计图表进行解析 |\n| parse_image_layout | - | bool | **无需开启**，大模型默认解析所有图片 |\n| language_type | - | string | **无需开启**，大模型默认识别语种 |\n| merge_tables | 否 | bool | 是否合并跨页表格 |\n| relevel_titles | 否 | bool | 是否对 paragraph_title 进行分级 |\n| recognize_seal | 否 | bool | 是否识别印章 |\n| return_span_boxes | 否 | bool | 是否返回行坐标 |\n\n### 文档分块参数\n\n| 参数 | 必选 | 类型 | 默认值 | 说明 |\n|------|------|------|--------|------|\n| return_doc_chunks.switch | 否 | bool | False | 是否切分 |\n| return_doc_chunks.chunk_size | 否 | int | -1 | 切分块大小，-1为语义自动切分 |\n\n## 返回结构\n\n### 获取结果返回\n\n| 字段 | 类型 | 说明 |\n|------|------|------|\n| result.task_id | string | 任务 ID |\n| result.status | string | pending/processing/success/failed |\n| result.task_error | string | 报错信息 |\n| result.markdown_url | string | Markdown 结果链接（30天有效） |\n| result.parse_result_url | string | JSON 结果 BOS 链接（30天有效） |\n\n### 版面类型（24种）\n\n| 类型 | 说明 | 类型 | 说明 |\n|------|------|------|------|\n| text | 文本 | table | 表格 |\n| image | 图片 | chart | 图表 |\n| doc_title | 文档标题 | paragraph_title | 段落标题 |\n| figure_title | 图片标题 | display_formula | 公式 |\n| inline_formula | 行内公式 | formula_number | 公式编号 |\n| header | 页眉 | footer | 页脚 |\n| header_image | 页眉图片 | footer_image | 页脚图片 |\n| number | 页码 | abstract | 摘要 |\n| algorithm | 算法 | aside_text | 旁注文本 |\n| content | 目录 | footnote | 脚注 |\n| reference | 参考文献 | reference_content | 参考文献内容 |\n| seal | 印章 | vertical_text | 竖排文本 |\n\n## 相关文档\n\n- [官方 API 文档](https://ai.baidu.com/ai-doc/OCR/3mi73at9o)\n- [错误码参考](error_codes.md)\n- [API Key 配置指南](apikey-fetch.md)\n\nFile v1.0.4:skill-card.md\n\n## Description:\n\nParses PDF, Word, PowerPoint, image, and text documents through Baidu PaddleOCR-VL, returning structured document content with support for text, handwriting, tables, formulas, charts, seals, layout regions, and multilingual pages.\n\nThis skill is ready for commercial/non-commercial use.\n\n## Publisher:\n\n[maglanyulan](https://clawhub.ai/user/maglanyulan)\n\n### License/Terms of Use:\n\nMIT-0\n\n## Use Case:\n\nDevelopers and document-processing teams use this skill to submit documents to Baidu PaddleOCR-VL and retrieve parsed Markdown or JSON results for complex layouts, tables, formulas, handwriting, and multilingual content.\n\n### Deployment Geography for Use:\n\nGlobal\n\n## Known Risks and Mitigations:\n\nRisk: The skill sends submitted documents to Baidu cloud APIs, and result links may remain valid for 30 days.\n\nMitigation: Use it only for documents approved for external processing, protect returned links, and avoid sensitive documents unless the transfer has been reviewed.\n\nRisk: The current CLI path is reported by security evidence as ignoring the supplied document and querying a fixed task ID.\n\nMitigation: Fix or disable the CLI before use, and verify that execution submits the user-provided file or URL before deployment.\n\nRisk: The skill depends on Baidu API key and secret key credentials.\n\nMitigation: Provide credentials through approved secret management or environment variables, avoid committing them, and rotate them if exposed.\n\n## Reference(s):\n\n- [Skill page](https://clawhub.ai/maglanyulan/skills/baidu-doc-vlm-parser)\n- [API parameters](references/parameters.md)\n- [API key configuration](references/apikey-fetch.md)\n- [Error codes](references/error_codes.md)\n- [Baidu PaddleOCR-VL API documentation](https://cloud.baidu.com/doc/OCR/s/3mi73at9o)\n- [Baidu OCR error code documentation](https://cloud.baidu.com/doc/OCR/s/dk3iqnq51)\n- [Baidu Intelligent Document Analysis platform](https://ai.baidu.com/solution/intelligent-document-analysis)\n\n## Skill Output:\n\n**Output Type(s):** [text, markdown, JSON, shell commands, configuration, guidance]\n\n**Output Format:** [Markdown guidance with shell commands and Baidu API responses that may include Markdown and JSON result URLs.]\n\n**Output Parameters:** [1D]\n\n**Other Properties Related to Output:** [Requires Baidu API credentials and asynchronous polling; returned result links are documented as valid for 30 days.]\n\n## Skill Version(s):\n\n1.0.4 (source: server release evidence)\n\n## Ethical Considerations:\n\nUsers should evaluate whether this skill is appropriate for their environment, review any generated or modified files before relying on them, and apply their organization's safety, security, and compliance requirements before deployment.\n\nArchive v1.0.3: 7 files, 14515 bytes\n\nFiles: _meta.json (139b), references/apikey-fetch.md (1537b), references/error_codes.md (2855b), references/parameters.md (3491b), scripts/baidu_doc_vlm_parser.py (9656b), skill-card.md (2601b), SKILL.md (13702b)\n\nFile v1.0.3:SKILL.md\n\n---\nname: baidu-doc-vlm-parser 百度文档解析(PaddleOCR-VL)\ndescription: 调用百度PaddleOCR-VL大模型API解析文档。基于PaddleOCR-VL-1.6多模态大模型，支持PDF、Word、PPT、图片等格式，精准识别印刷文本、手写文本、表格、公式、图表、印章等复杂元素，支持100+种语言，可处理不规则布局和长文档跨页解析。触发词：文档解析、VLM解析、大模型OCR、PaddleOCR、多模态文档、手写识别、公式识别、复杂版面。\nlicense: MIT\n---\n\n# 百度文档解析（PaddleOCR-VL）Skill\n\n基于 PaddleOCR-VL-1.6 多模态大模型，提供开箱即用的文档智能解析能力。\n\n## 功能概述\n\n**PaddleOCR-VL-1.6-0.9B** 是多模态文档解析领域的 SOTA 方案，具备：\n\n- **全要素精准解析**：高效识别印刷文本、手写文本、表格、公式、图表、印章等复杂文档元素\n- **智能阅读顺序**：基于人类阅读习惯推断内容排列顺序，将零散页面信息转化为有序带标签的结构化元素序列\n- **行级别坐标**：支持精准的行级别坐标输出\n- **100+ 种语言**：覆盖中、英、日、韩、拉丁文等全球化多语种文档\n- **不规则布局定位**：攻克复杂版面解析难点\n- **长文档跨页解析**：支持跨页表格合并等企业级场景\n- **直接 Markdown/JSON 输出**：无需额外处理\n\n## 与文档解析（标准版）的区别\n\n| 特性 | PaddleOCR-VL（本 Skill） | 标准版（pipeline-parser） |\n|------|-------------------------|--------------------------|\n| 底层模型 | 多模态大模型 VLM | 传统 Pipeline |\n| 语言支持 | 100+ 种 | 20+ 种 |\n| 公式/图片识别 | 默认开启，无需配置 | 需手动开启参数 |\n| 语种识别 | 自动识别，无需指定 | 需指定 language_type |\n| 版面类型 | 24 种细粒度类型 | 8 种基础类型 |\n| 行坐标 | 支持 | 不支持 |\n| 多边形坐标 | 支持（polygon） | 仅矩形框 |\n| 文件大小 | 版式 ≤100M，PDF ≤500 页 | PDF ≤300M，≤2000 页 |\n\n## 适用场景\n\n当用户需要：\n- 解析复杂版面文档（多栏、不规则布局）\n- 精准识别手写文本、数学公式、图表\n- 处理多语种混合文档\n- 获取行级别坐标信息\n- 长文档跨页表格合并\n- 免配置自动识别文档内容\n\n## API 配置\n\n### 环境变量（必须）\n\n[百度智能文档分析平台 领取免费测试资源](https://ai.baidu.com/ai-doc/OCR/dk3iqnq51)\n\n使用前请设置以下环境变量：\n\n```bash\nexport BAIDU_DOC_AI_API_KEY=\"your_api_key\"\nexport BAIDU_DOC_AI_SECRET_KEY=\"your_secret_key\"\n```\n\n### 认证方式\n\n通过 API Key 和 Secret Key 获取 access_token，有效期 30 天。所有接口请求需以 URL 参数 `access_token` 携带。\n\n## 支持格式\n\n**版式文档**：pdf, jpg, jpeg, png, bmp, tif, tiff, ofd（图片最长边不大于 8192px）\n\n**流式文档**：doc, docx, txt, wps, ppt, pptx\n\n## 支持语言\n\n100+ 种语言，包括中文、英文、日文、韩文、拉丁文等，**无需手动指定，大模型自动识别**。\n\n## 使用方式\n\n```bash\npython3 scripts/baidu_doc_vlm_parser.py --file_data <文件的base64编码> --file_name \"test.pdf\"\npython3 scripts/baidu_doc_vlm_parser.py --file_url <文件公网URL> --file_name \"test.pdf\"\n```\n\n## API 接口\n\n文档解析（PaddleOCR-VL）API 服务为异步接口，需要先调用**提交请求接口**获取 task_id，然后调用**获取结果接口**进行结果轮询。\n\n### 提交请求接口\n\n- **HTTP 方法**：POST\n- **请求 URL**：`https://aip.baidubce.com/rest/2.0/brain/online/v2/paddle-vl-parser/task?access_token={token}`\n- **Content-Type**：`application/x-www-form-urlencoded`\n\n#### Python 示例\n\n```python\nimport requests, os, base64\n\ndef create_task(url, file_path, file_url):\n    with open(file_path, \"rb\") as f:\n        file_data = base64.b64encode(f.read())\n    data = {\n        \"file_data\": file_data,\n        \"file_url\": file_url,\n        \"file_name\": os.path.basename(file_path)\n    }\n    headers = {'Content-Type': 'application/x-www-form-urlencoded'}\n    return requests.post(url, headers=headers, data=data)\n\nrequest_host = \"https://aip.baidubce.com/rest/2.0/brain/online/v2/paddle-vl-parser/task?access_token={token}\"\nresponse = create_task(request_host, \"./test.pdf\", \"\")\nprint(response.json())\n```\n\n**成功响应示例：**\n\n```json\n{\n  \"error_code\": 0,\n  \"error_msg\": \"\",\n  \"log_id\": \"10138598131137362685273505665433\",\n  \"result\": { \"task_id\": \"task-3zy9Bg8CHt1M4pPOcX2q5bg28j26801S\" }\n}\n```\n\n### 获取结果接口\n\n- **HTTP 方法**：POST\n- **请求 URL**：`https://aip.baidubce.com/rest/2.0/brain/online/v2/paddle-vl-parser/task/query?access_token={token}`\n- **Content-Type**：`application/x-www-form-urlencoded`\n- **请求参数**：`task_id`（必填，提交请求时返回的 task_id）\n\n#### Python 示例\n\n```python\nimport requests\n\ndef query_task(url, task_id):\n    data = {\"task_id\": task_id}\n    headers = {'Content-Type': 'application/x-www-form-urlencoded'}\n    return requests.post(url, headers=headers, data=data)\n\nrequest_host = \"https://aip.baidubce.com/rest/2.0/brain/online/v2/paddle-vl-parser/task/query?access_token={access_token}\"\nresp = query_task(request_host, \"task_id\")\nprint(resp.json())\n```\n\n## 请求参数\n\n### 文件参数（必选，二选一）\n\n| 参数 | 必选 | 类型 | 说明 |\n|------|------|------|------|\n| `file_data` | 和 file_url 二选一 | string | 文件 Base64 编码数据。版式文档：pdf, jpg, jpeg, png, bmp, tif, tiff, ofd（图片最长边不大于 8192px）；流式文档：doc, docx, txt, wps, ppt, pptx。图片不超过 10M，版式文档不超过 100M，流式文档不超过 50M，PDF 最大 500 页。超过 50M 须使用 file_url。优先级：file_data > file_url |\n| `file_url` | 和 file_data 二选一 | string | 文件数据 URL，长度不超过 1024 字节。PDF 文档不超过 100M，最大 500 页。**请注意关闭 URL 防盗链** |\n| `file_name` | 是 | string | 文件名，请保证文件名后缀正确，例如 \"1.pdf\" |\n\n### 功能参数\n\n| 参数 | 必选 | 类型 | 说明 |\n|------|------|------|------|\n| `recognize_formula` | - | bool | **无需开启**，大模型默认对版式类型文档进行公式识别 |\n| `analysis_chart` | 否 | bool | 是否对统计图表进行解析 |\n| `parse_image_layout` | - | bool | **无需开启**，大模型默认解析文档中的所有图片 |\n| `language_type` | - | string | **无需开启**，大模型默认识别语种类型 |\n| `merge_tables` | 否 | bool | 是否将跨页表格合并输出，开启后 tables 内返回跨页表格合并标识 |\n| `relevel_titles` | 否 | bool | 是否对段落标题（paragraph_title）进行分级，开启后在 sub_type 中输出标题级别 |\n| `recognize_seal` | 否 | bool | 是否识别印章内容 |\n| `return_span_boxes` | 否 | bool | 是否返回行坐标 |\n\n## 返回结构\n\n### 提交请求返回\n\n| 字段 | 类型 | 说明 |\n|------|------|------|\n| `log_id` | uint64 | 唯一的 log id，用于问题定位 |\n| `error_code` | int | 错误码 |\n| `error_msg` | string | 错误描述信息 |\n| `result.task_id` | string | 该请求生成的 task_id |\n\n### 获取结果返回\n\n| 字段 | 类型 | 说明 |\n|------|------|------|\n| `result.task_id` | string | 任务 ID |\n| `result.status` | string | 任务状态：pending（排队中）、processing（运行中）、success（成功）、failed（失败） |\n| `result.task_error` | string | 解析报错信息（任务失败、额度耗尽等） |\n| `result.markdown_url` | string | Markdown 格式结果链接，**有效期 30 天** |\n| `result.parse_result_url` | string | JSON 格式结果 BOS 链接，**有效期 30 天** |\n\n### 解析结果 JSON 结构（parse_result_url）\n\n顶层字段：`file_name`、`file_id`、`pages[]`。\n\n#### 页面对象（pages[]）\n\n| 字段 | 类型 | 说明 |\n|------|------|------|\n| `page_id` | string | 页码 ID |\n| `page_num` | int | 页码数 |\n| `text` | string | 当前页所有纯文字内容 |\n| `layouts` | list | 版式分析结果 |\n| `tables` | list | 表格解析结果 |\n| `images` | list | 图片解析结果 |\n| `meta` | dict | 页面元信息（page_width, page_height） |\n\n#### 版面元素（layouts[]）\n\n| 字段 | 类型 | 说明 |\n|------|------|------|\n| `layout_id` | string | 唯一标志，格式 \"xxxxx-layout-{global_layout_index}\" |\n| `text` | string | 文本内容（type 为 table/image 时为空） |\n| `position` | list | 位置 [x, y, w, h] |\n| `polygon` | list | 顶点坐标列表，可围合成多边形 |\n| `span_boxes` | list | 行信息（开启 return_span_boxes 后生效），含 text 和 location |\n| `type` | string | 版面元素类型（见下表） |\n| `sub_type` | string | 标题层级（开启 relevel_titles 后生效） |\n\n**版面类型（type）— 24 种细粒度类型**：\n\n| 类型 | 说明 | 类型 | 说明 |\n|------|------|------|------|\n| `text` | 文本 | `table` | 表格 |\n| `image` | 图片 | `chart` | 图表 |\n| `doc_title` | 文档标题 | `paragraph_title` | 段落标题 |\n| `figure_title` | 图片标题 | `display_formula` | 公式 |\n| `inline_formula` | 行内公式 | `formula_number` | 公式编号 |\n| `header` | 页眉 | `footer` | 页脚 |\n| `header_image` | 页眉图片 | `footer_image` | 页脚图片 |\n| `number` | 页码 | `abstract` | 摘要 |\n| `algorithm` | 算法 | `aside_text` | 旁注文本 |\n| `content` | 目录 | `footnote` | 脚注 |\n| `reference` | 参考文献 | `reference_content` | 参考文献内容 |\n| `seal` | 印章 | `vertical_text` | 竖排文本 |\n\n#### 表格对象（tables[]）\n\n| 字段 | 类型 | 说明 |\n|------|------|------|\n| `layout_id` | string | 对应 layouts 中 type 为 table 的 layout ID |\n| `markdown` | string | 表格 Markdown 形式 |\n| `position` | list | 边框数据 [x, y, w, h] |\n| `cells` | list | 单元格内版面信息（扁平列表） |\n| `matrix` | list | 2D 单元格索引矩阵，元素为 `cells` 数组下标；相同下标重复出现表示合并单元格 |\n| `merge_table` | string | 合并标识（开启 merge_tables 后）：begin（开始）、end（结束） |\n\n#### 图片对象（images[]）\n\n| 字段 | 类型 | 说明 |\n|------|------|------|\n| `layout_id` | string | 对应 layouts 中 type 为 image 的 layout ID |\n| `position` | list | 边框数据 [x, y, w, h] |\n| `data_url` | string | 图片存储链接 |\n| `image_description` | string | 统计图表内容解析（JSON 字符串，需 `json.loads` 解析） |\n\n## API 特性\n\n### 异步处理流程\n\n1. 调用提交请求接口 → 获取 `task_id`\n2. 通过 `task_id` 调用获取结果接口轮询\n\n### 轮询建议\n\n- 提交请求后 5~10 秒开始轮询\n- 轮询间隔：5 秒\n- 最大轮询时间：300 秒\n\n### QPS 限制\n\n- 提交请求接口：**2 QPS**\n- 获取结果接口：**5 QPS**\n\n## 文件限制\n\n| 限制项 | 说明 |\n|--------|------|\n| 图片大小 | ≤ 10M，最长边 ≤ 8192px |\n| 版式文档大小 | ≤ 100M |\n| 流式文档大小 | ≤ 50M |\n| PDF 页数 | ≤ 500 页 |\n| URL 长度 | ≤ 1024 字节 |\n| 优先级 | file_data > file_url |\n\n## 错误处理\n\n常见错误码示例：\n\n| 错误码 | 说明 |\n|--------|------|\n| `282003` | missing parameters（缺少必要参数） |\n| `282007` | task not exist, please check task id（任务不存在） |\n\n完整错误码参见 `references/error_codes.md` 及 [OCR 错误码文档](https://cloud.baidu.com/doc/OCR/s/dk3iqnq51)。\n\n**失败响应示例：**\n\n```json\n{\n  \"log_id\": \"13665091038742503867108513247608\",\n  \"error_code\": \"282007\",\n  \"error_msg\": \"task not exist, please check task id\",\n  \"result\": \"null\"\n}\n```\n\n## 产品计费与购买方式\n\n> 数据来源：[百度智能云 OCR 计费说明](https://cloud.baidu.com/doc/OCR/s/Fls06fa15#%E6%96%87%E6%A1%A3%E8%A7%A3%E6%9E%90%EF%BC%88paddleocr-vl%EF%BC%89)\n\n### 免费额度\n\n登录[文字识别控制台](https://console.bce.baidu.com/ai/)自动领取：\n\n| 用户类型 | 免费额度 |\n|---------|---------|\n| 个人实名认证用户 | **200 页** |\n| 企业实名认证用户 | **1000 页** |\n\n### 新人优惠\n\n限时活动价 **9 元/千页**，面向新用户。\n\n### 预付费资源包\n\n有效期 **1 年**，到期未抵扣额度作废。购买后 7 天内若未产生调用可自助退订。\n\n| 规格（页） | 原价（元） | 优惠价（元） |\n|---:|---:|---:|\n| 1,000 | 180 | 90 |\n| 5,000 | 850 | 425 |\n| 10,000 | 1,600 | 800 |\n| 50,000 | 7,500 | 3,750 |\n| 100,000 | 14,000 | 7,700 |\n| 200,000 | 26,000 | 14,300 |\n| 500,000 | 55,000 | 33,000 |\n| 1,000,000 | 90,000 | 54,000 |\n| 5,000,000 | 350,000 | 210,000 |\n\n### 按量后付费\n\n- 不限月调用量\n- 原价 **0.18 元/页**，优惠价 **0.09 元/页**\n- 仅成功调用计费，**调用失败不计费**\n\n### 购买入口\n\n- **购买资源包 / 开通后付费**：均通过[百度智能云控制台](https://console.bce.baidu.com/ai/) 文字识别产品页面进行\n- **退订**：资源包购买后 7 天内未产生调用可前往\"退订管理页面\"自助退订\n\n## 脚本\n\n- `scripts/baidu_doc_vlm_parser.py`：文档解析主程序，支持命令行快速调用\n\n## 参考文档\n\n- `references/parameters.md`：完整 API 参数与返回结构详解\n- `references/error_codes.md`：完整错误码参考\n- `references/apikey-fetch.md`：API Key 配置指南\n\n## 相关链接\n\n- [官方技术文档](https://cloud.baidu.com/doc/OCR/s/3mi73at9o)\n- [产品计费与购买](https://cloud.baidu.com/doc/OCR/s/Fls06fa15#%E6%96%87%E6%A1%A3%E8%A7%A3%E6%9E%90%EF%BC%88paddleocr-vl%EF%BC%89)\n- [百度云控制台](https://console.bce.baidu.com/ai/)\n- [智能文档分析平台](https://ai.baidu.com/solution/intelligent-document-analysis)\n\nFile v1.0.3:_meta.json\n\n{\n  \"ownerId\": \"kn75p1w9cr0c8ycct5wzrb5ken83e9nc\",\n  \"slug\": \"baidu-doc-vlm-parser\",\n  \"version\": \"1.0.3\",\n  \"publishedAt\": 1783494792521\n}\n\nFile v1.0.3:references/apikey-fetch.md\n\n# 百度文档解析（PaddleOCR-VL）API Key 配置指南\n\n## BAIDU_DOC_AI_API_KEY 和 BAIDU_DOC_AI_SECRET_KEY 未配置\n\n当环境变量未设置时，按照以下步骤操作：\n\n### 1. 获取 API Key 和 Secret Key\n\n访问：**https://ai.baidu.com/ai-doc/REFERENCE/Ck3dwjhhu#1-获取aksk**\n\n- 登录百度云账号\n- 创建应用或查看已有的 API Key 和 Secret Key\n- 复制你的 **API Key** 和 **Secret Key**\n\n### 2. 领取免费测试资源\n\n访问：**https://ai.baidu.com/ai-doc/OCR/dk3iqnq51**\n\n### 3. 配置环境变量\n\n```bash\nexport BAIDU_DOC_AI_API_KEY=\"your_actual_api_key_here\"\nexport BAIDU_DOC_AI_SECRET_KEY=\"your_actual_secret_key_here\"\n```\n\n或通过配置文件 `~/.claude/settings.json`：\n\n```json\n{\n  \"skills\": {\n    \"entries\": {\n      \"baidu-doc-vlm-parser\": {\n        \"env\": {\n          \"BAIDU_DOC_AI_API_KEY\": \"your_actual_api_key_here\",\n          \"BAIDU_DOC_AI_SECRET_KEY\": \"your_actual_secret_key_here\"\n        }\n      }\n    }\n  }\n}\n```\n\n### 4. 验证配置\n\n```bash\ncurl -X POST 'https://aip.baidubce.com/oauth/2.0/token' \\\n  -d 'grant_type=client_credentials' \\\n  -d 'client_id={your_api_key}' \\\n  -d 'client_secret={your_secret_key}'\n```\n\n### 5. 测试\n\n```bash\npython3 scripts/baidu_doc_vlm_parser.py --file_url \"https://example.com/test.pdf\" --file_name \"test.pdf\"\n```\n\n## 相关链接\n\n- [获取 AK/SK 文档](https://ai.baidu.com/ai-doc/REFERENCE/Ck3dwjhhu#1-获取aksk)\n- [领取免费资源](https://ai.baidu.com/ai-doc/OCR/dk3iqnq51)\n- [百度云控制台](https://console.bce.baidu.com/ai/)\n\nFile v1.0.3:references/error_codes.md\n\n# 百度文档解析（PaddleOCR-VL）错误码参考\n\n## 通用错误\n\n### 认证相关错误\n\n| 错误码 | 错误信息 | 说明 | 解决方案 |\n|--------|---------|------|----------|\n| 1 | Unknown error | 未知错误 | 重试请求 |\n| 2 | Service temporarily unavailable | 服务暂不可用 | 重试请求 |\n| 3 | Unsupported openapi method | API 接口不存在 | 检查 URL |\n| 4 | Open api request limit reached | 集群超限额 | 重试请求 |\n| 6 | No permission to access data | 无 API 访问权限 | 在百度云控制台开通 |\n| 17 | Open api daily request limit reached | 日配额超限 | 购买额度或等待重置 |\n| 18 | Open api qps request limit reached | QPS 超限 | 降低请求频率 |\n| 19 | Open api total request limit reached | 总量配额超限 | 购买额外配额 |\n| 100 | Invalid parameter | access_token 无效 | 重新获取 |\n| 110 | Access token invalid or no longer valid | access_token 无效 | 重新获取（30天有效期） |\n| 111 | Access token expired | access_token 过期 | 重新获取 |\n\n### 文件相关错误\n\n| 错误码 | 错误信息 | 说明 | 解决方案 |\n|--------|---------|------|----------|\n| 216200 | empty file or fileurl | 文件或 URL 为空 | 提供 file_data 或 file_url |\n| 216201 | file format error | 文件格式不支持 | 使用支持的格式 |\n| 216202 | file size error | 文件大小超限 | 缩减文件大小 |\n\n### 任务处理错误\n\n| 错误码 | 错误信息 | 说明 | 解决方案 |\n|--------|---------|------|----------|\n| 282000 | internal error | 任务处理失败 | 重试或联系技术支持 |\n| 282003 | missing parameters | 缺少必要参数 | 检查必填参数 |\n| 282005 | quota exceed error | 额度不足 | 申请增加配额 |\n| 282007 | task not exist | 任务不存在 | 检查 task_id |\n| 282018 | Service busy | 服务繁忙 | 降低请求频率 |\n\n### URL 相关错误\n\n| 错误码 | 错误信息 | 说明 | 解决方案 |\n|--------|---------|------|----------|\n| 282111 | url format illegal | URL 格式不合法 | 检查 URL 格式 |\n| 282112 | url download timeout | URL 下载超时 | 检查 URL 可访问性 |\n| 282113 | url response invalid | URL 响应无效 | 检查 URL 返回内容 |\n| 282114 | url size error | URL 长度超 1024 字节 | 缩短 URL |\n\n## 错误处理策略\n\n| 错误类型 | 错误码 | 建议处理方式 |\n|---------|--------|-------------|\n| 瞬时错误 | 1, 2, 4, 282000, 282018 | 指数退避重试 |\n| 认证错误 | 100, 110, 111 | 重新获取 access_token |\n| 配额错误 | 17, 18, 19, 282005 | 等待或购买额外配额 |\n| 参数错误 | 216200, 216201, 282003 | 修正参数后重试 |\n\n## 获取帮助\n\n- [提交工单](https://ticket.bce.baidu.com/?_=1648086674827&fromai=1#/ticket/create~productId=96&questionId=1306&channel=2)\n- [百度云控制台](https://console.bce.baidu.com/ai/)\n\nFile v1.0.3:references/parameters.md\n\n# 百度文档解析（PaddleOCR-VL）API 参数详解\n\n## 接口概述\n\n基于 PaddleOCR-VL-1.5-0.9B 多模态大模型，具备全要素精准解析能力，支持 111 种语言，可处理不规则布局和长文档跨页解析。\n\n## API 接口地址\n\n### 提交请求接口\n\n```\nPOST https://aip.baidubce.com/rest/2.0/brain/online/v2/paddle-vl-parser/task?access_token={access_token}\nContent-Type: application/x-www-form-urlencoded\n```\n\n### 获取结果接口\n\n```\nPOST https://aip.baidubce.com/rest/2.0/brain/online/v2/paddle-vl-parser/task/query?access_token={access_token}\nContent-Type: application/x-www-form-urlencoded\n```\n\n## 提交请求参数\n\n### 文件参数（必选，二选一）\n\n| 参数 | 必选 | 类型 | 说明 |\n|------|------|------|------|\n| file_data | 和 file_url 二选一 | string | 文件 Base64 编码。版式文档：pdf, jpg, jpeg, png, bmp, tif, tiff, ofd（图片最长边≤4096px）；流式文档：doc, docx, txt, wps, ppt, pptx。图片≤10M，版式文档≤100M，流式文档≤50M，PDF≤500页。超过50M须用file_url。优先级：file_data > file_url |\n| file_url | 和 file_data 二选一 | string | 文件URL，≤1024字节。PDF≤100M，≤500页。请关闭URL防盗链 |\n| file_name | 是 | string | 文件名，后缀须正确，如 \"1.pdf\" |\n\n### 功能参数\n\n| 参数 | 必选 | 类型 | 说明 |\n|------|------|------|------|\n| recognize_formula | - | bool | **无需开启**，大模型默认识别公式 |\n| analysis_chart | 否 | bool | 是否对统计图表进行解析 |\n| parse_image_layout | - | bool | **无需开启**，大模型默认解析所有图片 |\n| language_type | - | string | **无需开启**，大模型默认识别语种 |\n| merge_tables | 否 | bool | 是否合并跨页表格 |\n| relevel_titles | 否 | bool | 是否对 paragraph_title 进行分级 |\n| recognize_seal | 否 | bool | 是否识别印章 |\n| return_span_boxes | 否 | bool | 是否返回行坐标 |\n\n### 文档分块参数\n\n| 参数 | 必选 | 类型 | 默认值 | 说明 |\n|------|------|------|--------|------|\n| return_doc_chunks.switch | 否 | bool | False | 是否切分 |\n| return_doc_chunks.chunk_size | 否 | int | -1 | 切分块大小，-1为语义自动切分 |\n\n## 返回结构\n\n### 获取结果返回\n\n| 字段 | 类型 | 说明 |\n|------|------|------|\n| result.task_id | string | 任务 ID |\n| result.status | string | pending/processing/success/failed |\n| result.task_error | string | 报错信息 |\n| result.markdown_url | string | Markdown 结果链接（30天有效） |\n| result.parse_result_url | string | JSON 结果 BOS 链接（30天有效） |\n\n### 版面类型（24种）\n\n| 类型 | 说明 | 类型 | 说明 |\n|------|------|------|------|\n| text | 文本 | table | 表格 |\n| image | 图片 | chart | 图表 |\n| doc_title | 文档标题 | paragraph_title | 段落标题 |\n| figure_title | 图片标题 | display_formula | 公式 |\n| inline_formula | 行内公式 | formula_number | 公式编号 |\n| header | 页眉 | footer | 页脚 |\n| header_image | 页眉图片 | footer_image | 页脚图片 |\n| number | 页码 | abstract | 摘要 |\n| algorithm | 算法 | aside_text | 旁注文本 |\n| content | 目录 | footnote | 脚注 |\n| reference | 参考文献 | reference_content | 参考文献内容 |\n| seal | 印章 | vertical_text | 竖排文本 |\n\n## 相关文档\n\n- [官方 API 文档](https://ai.baidu.com/ai-doc/OCR/3mi73at9o)\n- [错误码参考](error_codes.md)\n- [API Key 配置指南](apikey-fetch.md)\n\nFile v1.0.3:skill-card.md\n\n## Description: <br>\n调用百度 PaddleOCR-VL 大模型 API 解析 PDF、Word、PPT、图片等文档，并返回 Markdown、JSON、版面元素、表格、图片和坐标等结构化结果。 <br>\n\nThis skill is ready for commercial/non-commercial use. <br>\n\n## Publisher: <br>\n[maglanyulan](https://clawhub.ai/user/maglanyulan) <br>\n\n### License/Terms of Use: <br>\nMIT-0 <br>\n\n\n## Use Case: <br>\nDevelopers and document-automation users use this skill to submit documents or document URLs to Baidu PaddleOCR-VL, poll asynchronous parsing tasks, and retrieve OCR/VLM outputs for complex layouts, tables, formulas, handwriting, charts, seals, and multilingual content. <br>\n\n### Deployment Geography for Use: <br>\nGlobal <br>\n\n## Known Risks and Mitigations: <br>\nRisk: User documents, document URLs, and parsing results may be sent to or retained by Baidu cloud services. <br>\nMitigation: Use the skill only for documents approved for Baidu processing; avoid regulated, confidential, or proprietary files unless authorized, protect Baidu credentials as secrets, and treat result URLs as sensitive while valid. <br>\n\n\n## Reference(s): <br>\n- [Skill listing](https://clawhub.ai/maglanyulan/skills/baidu-doc-vlm-parser) <br>\n- [百度文档解析（PaddleOCR-VL）API 参数详解](references/parameters.md) <br>\n- [百度文档解析（PaddleOCR-VL）错误码参考](references/error_codes.md) <br>\n- [百度文档解析（PaddleOCR-VL）API Key 配置指南](references/apikey-fetch.md) <br>\n- [百度 PaddleOCR-VL API 文档](https://cloud.baidu.com/doc/OCR/s/3mi73at9o) <br>\n- [百度 OCR 计费说明](https://cloud.baidu.com/doc/OCR/s/Fls06fa15#%E6%96%87%E6%A1%A3%E8%A7%A3%E6%9E%90%EF%BC%88paddleocr-vl%EF%BC%89) <br>\n\n\n## Skill Output: <br>\n**Output Type(s):** [Text, Markdown, JSON, Code, Shell commands, Configuration] <br>\n**Output Format:** [Markdown guidance with Python and shell examples; runtime script output is JSON from Baidu parsing APIs, with optional downloaded parse_result JSON.] <br>\n**Output Parameters:** [1D] <br>\n**Other Properties Related to Output:** [Requires Baidu API credentials; accepts file_data or file_url plus file_name, supports asynchronous polling, and may return temporary Markdown and JSON result URLs.] <br>\n\n## Skill Version(s): <br>\n1.0.3 (source: server release metadata) <br>\n\n## Ethical Considerations: <br>\nUsers should evaluate whether this skill is appropriate for their environment, review any generated or modified files before relying on them, and apply their organization's safety, security, and compliance requirements before deployment. <br>\n\nArchive v1.0.1: 7 files, 13117 bytes\n\nFiles: _meta.json (139b), references/apikey-fetch.md (1537b), references/error_codes.md (2855b), references/parameters.md (3491b), scripts/baidu_doc_vlm_parser.py (9541b), skill-card.md (2696b), SKILL.md (10477b)\n\nFile v1.0.1:SKILL.md\n\n---\nname: baidu-doc-vlm-parser 百度文档解析(PaddleOCR-VL)\ndescription: 调用百度PaddleOCR-VL大模型API解析文档。基于PaddleOCR-VL-1.5多模态大模型，支持PDF、Word、PPT、图片等格式，精准识别印刷文本、手写文本、表格、公式、图表、印章等复杂元素，支持111种语言，可处理不规则布局和长文档跨页解析。触发词：文档解析、VLM解析、大模型OCR、PaddleOCR、多模态文档、手写识别、公式识别、复杂版面。\nlicense: MIT\n---\n\n# 百度文档解析（PaddleOCR-VL）Skill\n\n基于 PaddleOCR-VL-1.5 多模态大模型，提供开箱即用的文档智能解析能力。\n\n## 功能概述\n\n**PaddleOCR-VL-1.5-0.9B** 是多模态文档解析领域的 SOTA 方案，具备：\n\n- **全要素精准解析**：高效识别印刷文本、手写文本、表格、公式、图表、印章等复杂文档元素\n- **智能阅读顺序**：基于人类阅读习惯推断内容排列顺序，将零散页面信息转化为有序带标签的结构化元素序列\n- **行级别坐标**：支持精准的行级别坐标输出\n- **111 种语言**：覆盖中、英、日、韩、拉丁文等全球化多语种文档\n- **不规则布局定位**：攻克复杂版面解析难点\n- **长文档跨页解析**：支持跨页表格合并等企业级场景\n- **直接 Markdown/JSON 输出**：无需额外处理\n\n## 与文档解析（标准版）的区别\n\n| 特性 | PaddleOCR-VL（本 Skill） | 标准版（pipeline-parser） |\n|------|-------------------------|--------------------------|\n| 底层模型 | 多模态大模型 VLM | 传统 Pipeline |\n| 语言支持 | 111 种 | 20+ 种 |\n| 公式/图片识别 | 默认开启，无需配置 | 需手动开启参数 |\n| 语种识别 | 自动识别，无需指定 | 需指定 language_type |\n| 版面类型 | 24 种细粒度类型 | 8 种基础类型 |\n| 行坐标 | 支持 | 不支持 |\n| 多边形坐标 | 支持（polygon） | 仅矩形框 |\n| 文件大小 | 版式 ≤100M，PDF ≤500 页 | PDF ≤300M，≤2000 页 |\n\n## 适用场景\n\n当用户需要：\n- 解析复杂版面文档（多栏、不规则布局）\n- 精准识别手写文本、数学公式、图表\n- 处理多语种混合文档\n- 获取行级别坐标信息\n- 长文档跨页表格合并\n- 免配置自动识别文档内容\n\n## API 配置\n\n### 环境变量（必须）\n\n[百度智能文档分析平台 领取免费测试资源](https://ai.baidu.com/ai-doc/OCR/dk3iqnq51)\n\n使用前请设置以下环境变量：\n\n```bash\nexport BAIDU_DOC_AI_API_KEY=\"your_api_key\"\nexport BAIDU_DOC_AI_SECRET_KEY=\"your_secret_key\"\n```\n\n### 认证方式\n\n通过 API Key 和 Secret Key 获取 access_token，有效期 30 天。\n\n## 支持格式\n\n**版式文档**：pdf, jpg, jpeg, png, bmp, tif, tiff, ofd（图片最长边不大于 4096px）\n\n**流式文档**：doc, docx, txt, wps, ppt, pptx\n\n## 支持语言\n\n111 种语言，包括中文、英文、日文、韩文、拉丁文等，**无需手动指定，大模型自动识别**。\n\n## 使用方式\n\n```bash\npython3 scripts/baidu_doc_vlm_parser.py --file_data <文件的base64编码> --file_name \"test.pdf\"\npython3 scripts/baidu_doc_vlm_parser.py --file_url <文件公网URL> --file_name \"test.pdf\"\n```\n\n## API 接口\n\n文档解析（PaddleOCR-VL）API 服务为异步接口，需要先调用**提交请求接口**获取 task_id，然后调用**获取结果接口**进行结果轮询。\n\n### 提交请求接口\n\n- **HTTP 方法**：POST\n- **请求 URL**：`https://aip.baidubce.com/rest/2.0/brain/online/v2/paddle-vl-parser/task?access_token={token}`\n- **Content-Type**：`application/x-www-form-urlencoded`\n\n### 获取结果接口\n\n- **HTTP 方法**：POST\n- **请求 URL**：`https://aip.baidubce.com/rest/2.0/brain/online/v2/paddle-vl-parser/task/query?access_token={token}`\n- **Content-Type**：`application/x-www-form-urlencoded`\n- **请求参数**：`task_id`（必填，提交请求时返回的 task_id）\n\n## 请求参数\n\n### 文件参数（必选，二选一）\n\n| 参数 | 必选 | 类型 | 说明 |\n|------|------|------|------|\n| `file_data` | 和 file_url 二选一 | string | 文件 Base64 编码数据。版式文档：pdf, jpg, jpeg, png, bmp, tif, tiff, ofd（图片最长边不大于 4096px）；流式文档：doc, docx, txt, wps, ppt, pptx。图片不超过 10M，版式文档不超过 100M，流式文档不超过 50M，PDF 最大 500 页。超过 50M 须使用 file_url。优先级：file_data > file_url |\n| `file_url` | 和 file_data 二选一 | string | 文件数据 URL，长度不超过 1024 字节。PDF 文档不超过 100M，最大 500 页。**请注意关闭 URL 防盗链** |\n| `file_name` | 是 | string | 文件名，请保证文件名后缀正确，例如 \"1.pdf\" |\n\n### 功能参数\n\n| 参数 | 必选 | 类型 | 说明 |\n|------|------|------|------|\n| `recognize_formula` | - | bool | **无需开启**，大模型默认对版式类型文档进行公式识别 |\n| `analysis_chart` | 否 | bool | 是否对统计图表进行解析 |\n| `parse_image_layout` | - | bool | **无需开启**，大模型默认解析文档中的所有图片 |\n| `language_type` | - | string | **无需开启**，大模型默认识别语种类型 |\n| `merge_tables` | 否 | bool | 是否将跨页表格合并输出，开启后 tables 内返回跨页表格合并标识 |\n| `relevel_titles` | 否 | bool | 是否对段落标题（paragraph_title）进行分级，开启后在 sub_type 中输出标题级别 |\n| `recognize_seal` | 否 | bool | 是否识别印章内容 |\n| `return_span_boxes` | 否 | bool | 是否返回行坐标 |\n\n### 文档分块参数\n\n`return_doc_chunks` 为字典类型：\n\n| 参数 | 必选 | 类型 | 默认值 | 说明 |\n|------|------|------|--------|------|\n| `switch` | 否 | bool | False | 是否进行文档内容切分 |\n| `chunk_size` | 否 | int | -1 | 切分块的大小，-1 表示按照语义自动切分 |\n\n## 返回结构\n\n### 提交请求返回\n\n| 字段 | 类型 | 说明 |\n|------|------|------|\n| `log_id` | uint64 | 唯一的 log id，用于问题定位 |\n| `error_code` | int | 错误码 |\n| `error_msg` | string | 错误描述信息 |\n| `result.task_id` | string | 该请求生成的 task_id |\n\n### 获取结果返回\n\n| 字段 | 类型 | 说明 |\n|------|------|------|\n| `result.task_id` | string | 任务 ID |\n| `result.status` | string | 任务状态：pending（排队中）、processing（运行中）、success（成功）、failed（失败） |\n| `result.task_error` | string | 解析报错信息 |\n| `result.markdown_url` | string | Markdown 格式结果链接，**有效期 30 天** |\n| `result.parse_result_url` | string | JSON 格式结果 BOS 链接，**有效期 30 天** |\n\n### 解析结果 JSON 结构（parse_result_url）\n\n#### 页面对象（pages[]）\n\n| 字段 | 类型 | 说明 |\n|------|------|------|\n| `page_id` | string | 页码 ID |\n| `page_num` | int | 页码数 |\n| `text` | string | 当前页所有纯文字内容 |\n| `layouts` | list | 版式分析结果 |\n| `tables` | list | 表格解析结果 |\n| `images` | list | 图片解析结果 |\n| `meta` | dict | 页面元信息（page_width, page_height） |\n\n#### 版面元素（layouts[]）\n\n| 字段 | 类型 | 说明 |\n|------|------|------|\n| `layout_id` | string | 唯一标志，格式 \"xxxxx-layout-{global_layout_index}\" |\n| `text` | string | 文本内容（type 为 table/image 时为空） |\n| `position` | list | 位置 [x, y, w, h] |\n| `polygon` | list | 顶点坐标列表，可围合成多边形 |\n| `span_boxes` | list | 行信息（开启 return_span_boxes 后生效），含 text 和 location |\n| `type` | string | 版面元素类型（见下表） |\n| `sub_type` | string | 标题层级（开启 relevel_titles 后生效） |\n\n**版面类型（type）— 24 种细粒度类型**：\n\n| 类型 | 说明 | 类型 | 说明 |\n|------|------|------|------|\n| `text` | 文本 | `table` | 表格 |\n| `image` | 图片 | `chart` | 图表 |\n| `doc_title` | 文档标题 | `paragraph_title` | 段落标题 |\n| `figure_title` | 图片标题 | `display_formula` | 公式 |\n| `inline_formula` | 行内公式 | `formula_number` | 公式编号 |\n| `header` | 页眉 | `footer` | 页脚 |\n| `header_image` | 页眉图片 | `footer_image` | 页脚图片 |\n| `number` | 页码 | `abstract` | 摘要 |\n| `algorithm` | 算法 | `aside_text` | 旁注文本 |\n| `content` | 目录 | `footnote` | 脚注 |\n| `reference` | 参考文献 | `reference_content` | 参考文献内容 |\n| `seal` | 印章 | `vertical_text` | 竖排文本 |\n\n#### 表格对象（tables[]）\n\n| 字段 | 类型 | 说明 |\n|------|------|------|\n| `layout_id` | string | 对应 layouts 中 type 为 table 的 layout ID |\n| `markdown` | string | 表格 Markdown 形式 |\n| `position` | list | 边框数据 [x, y, w, h] |\n| `cells` | list | 单元格内版面信息 |\n| `matrix` | list | 单元格索引矩阵 |\n| `merge_table` | string | 合并标识（开启 merge_tables 后）：begin（开始）、end（结束） |\n\n#### 图片对象（images[]）\n\n| 字段 | 类型 | 说明 |\n|------|------|------|\n| `layout_id` | string | 对应 layouts 中 type 为 image 的 layout ID |\n| `position` | list | 边框数据 [x, y, w, h] |\n| `data_url` | string | 图片存储链接 |\n| `image_description` | string | 统计图表内容解析（JSON 字符串） |\n\n## API 特性\n\n### 异步处理流程\n\n1. 调用提交请求接口 → 获取 `task_id`\n2. 通过 `task_id` 调用获取结果接口轮询\n\n### 轮询建议\n\n- 提交请求后 5~10 秒开始轮询\n- 轮询间隔：5 秒\n- 最大轮询时间：300 秒\n\n### QPS 限制\n\n- 提交请求接口：2 QPS\n- 获取结果接口：10 QPS\n\n## 文件限制\n\n| 限制项 | 说明 |\n|--------|------|\n| 图片大小 | ≤ 10M，最长边 ≤ 4096px |\n| 版式文档大小 | ≤ 100M |\n| 流式文档大小 | ≤ 50M |\n| PDF 页数 | ≤ 500 页 |\n| URL 长度 | ≤ 1024 字节 |\n| 优先级 | file_data > file_url |\n\n## 错误处理\n\n常见错误码参见 `references/error_codes.md`\n\n## 脚本\n\n- `scripts/baidu_doc_vlm_parser.py`：文档解析主程序，支持命令行快速调用\n\n## 参考文档\n\n- `references/parameters.md`：完整 API 参数与返回结构详解\n- `references/error_codes.md`：完整错误码参考\n- `references/apikey-fetch.md`：API Key 配置指南\n\n## 相关链接\n\n- [官方 API 文档](https://ai.baidu.com/ai-doc/OCR/3mi73at9o)\n- [百度云控制台](https://console.bce.baidu.com/ai/)\n- [智能文档分析平台](https://ai.baidu.com/solution/intelligent-document-analysis)\n\nFile v1.0.1:_meta.json\n\n{\n  \"ownerId\": \"kn75p1w9cr0c8ycct5wzrb5ken83e9nc\",\n  \"slug\": \"baidu-doc-vlm-parser\",\n  \"version\": \"1.0.1\",\n  \"publishedAt\": 1778316527275\n}\n\nFile v1.0.1:references/apikey-fetch.md\n\n# 百度文档解析（PaddleOCR-VL）API Key 配置指南\n\n## BAIDU_DOC_AI_API_KEY 和 BAIDU_DOC_AI_SECRET_KEY 未配置\n\n当环境变量未设置时，按照以下步骤操作：\n\n### 1. 获取 API Key 和 Secret Key\n\n访问：**https://ai.baidu.com/ai-doc/REFERENCE/Ck3dwjhhu#1-获取aksk**\n\n- 登录百度云账号\n- 创建应用或查看已有的 API Key 和 Secret Key\n- 复制你的 **API Key** 和 **Secret Key**\n\n### 2. 领取免费测试资源\n\n访问：**https://ai.baidu.com/ai-doc/OCR/dk3iqnq51**\n\n### 3. 配置环境变量\n\n```bash\nexport BAIDU_DOC_AI_API_KEY=\"your_actual_api_key_here\"\nexport BAIDU_DOC_AI_SECRET_KEY=\"your_actual_secret_key_here\"\n```\n\n或通过配置文件 `~/.claude/settings.json`：\n\n```json\n{\n  \"skills\": {\n    \"entries\": {\n      \"baidu-doc-vlm-parser\": {\n        \"env\": {\n          \"BAIDU_DOC_AI_API_KEY\": \"your_actual_api_key_here\",\n          \"BAIDU_DOC_AI_SECRET_KEY\": \"your_actual_secret_key_here\"\n        }\n      }\n    }\n  }\n}\n```\n\n### 4. 验证配置\n\n```bash\ncurl -X POST 'https://aip.baidubce.com/oauth/2.0/token' \\\n  -d 'grant_type=client_credentials' \\\n  -d 'client_id={your_api_key}' \\\n  -d 'client_secret={your_secret_key}'\n```\n\n### 5. 测试\n\n```bash\npython3 scripts/baidu_doc_vlm_parser.py --file_url \"https://example.com/test.pdf\" --file_name \"test.pdf\"\n```\n\n## 相关链接\n\n- [获取 AK/SK 文档](https://ai.baidu.com/ai-doc/REFERENCE/Ck3dwjhhu#1-获取aksk)\n- [领取免费资源](https://ai.baidu.com/ai-doc/OCR/dk3iqnq51)\n- [百度云控制台](https://console.bce.baidu.com/ai/)\n\nFile v1.0.1:references/error_codes.md\n\n# 百度文档解析（PaddleOCR-VL）错误码参考\n\n## 通用错误\n\n### 认证相关错误\n\n| 错误码 | 错误信息 | 说明 | 解决方案 |\n|--------|---------|------|----------|\n| 1 | Unknown error | 未知错误 | 重试请求 |\n| 2 | Service temporarily unavailable | 服务暂不可用 | 重试请求 |\n| 3 | Unsupported openapi method | API 接口不存在 | 检查 URL |\n| 4 | Open api request limit reached | 集群超限额 | 重试请求 |\n| 6 | No permission to access data | 无 API 访问权限 | 在百度云控制台开通 |\n| 17 | Open api daily request limit reached | 日配额超限 | 购买额度或等待重置 |\n| 18 | Open api qps request limit reached | QPS 超限 | 降低请求频率 |\n| 19 | Open api total request limit reached | 总量配额超限 | 购买额外配额 |\n| 100 | Invalid parameter | access_token 无效 | 重新获取 |\n| 110 | Access token invalid or no longer valid | access_token 无效 | 重新获取（30天有效期） |\n| 111 | Access token expired | access_token 过期 | 重新获取 |\n\n### 文件相关错误\n\n| 错误码 | 错误信息 | 说明 | 解决方案 |\n|--------|---------|------|----------|\n| 216200 | empty file or fileurl | 文件或 URL 为空 | 提供 file_data 或 file_url |\n| 216201 | file format error | 文件格式不支持 | 使用支持的格式 |\n| 216202 | file size error | 文件大小超限 | 缩减文件大小 |\n\n### 任务处理错误\n\n| 错误码 | 错误信息 | 说明 | 解决方案 |\n|--------|---------|------|----------|\n| 282000 | internal error | 任务处理失败 | 重试或联系技术支持 |\n| 282003 | missing parameters | 缺少必要参数 | 检查必填参数 |\n| 282005 | quota exceed error | 额度不足 | 申请增加配额 |\n| 282007 | task not exist | 任务不存在 | 检查 task_id |\n| 282018 | Service busy | 服务繁忙 | 降低请求频率 |\n\n### URL 相关错误\n\n| 错误码 | 错误信息 | 说明 | 解决方案 |\n|--------|---------|------|----------|\n| 282111 | url format illegal | URL 格式不合法 | 检查 URL 格式 |\n| 282112 | url download timeout | URL 下载超时 | 检查 URL 可访问性 |\n| 282113 | url response invalid | URL 响应无效 | 检查 URL 返回内容 |\n| 282114 | url size error | URL 长度超 1024 字节 | 缩短 URL |\n\n## 错误处理策略\n\n| 错误类型 | 错误码 | 建议处理方式 |\n|---------|--------|-------------|\n| 瞬时错误 | 1, 2, 4, 282000, 282018 | 指数退避重试 |\n| 认证错误 | 100, 110, 111 | 重新获取 access_token |\n| 配额错误 | 17, 18, 19, 282005 | 等待或购买额外配额 |\n| 参数错误 | 216200, 216201, 282003 | 修正参数后重试 |\n\n## 获取帮助\n\n- [提交工单](https://ticket.bce.baidu.com/?_=1648086674827&fromai=1#/ticket/create~productId=96&questionId=1306&channel=2)\n- [百度云控制台](https://console.bce.baidu.com/ai/)\n\nFile v1.0.1:references/parameters.md\n\n# 百度文档解析（PaddleOCR-VL）API 参数详解\n\n## 接口概述\n\n基于 PaddleOCR-VL-1.5-0.9B 多模态大模型，具备全要素精准解析能力，支持 111 种语言，可处理不规则布局和长文档跨页解析。\n\n## API 接口地址\n\n### 提交请求接口\n\n```\nPOST https://aip.baidubce.com/rest/2.0/brain/online/v2/paddle-vl-parser/task?access_token={access_token}\nContent-Type: application/x-www-form-urlencoded\n```\n\n### 获取结果接口\n\n```\nPOST https://aip.baidubce.com/rest/2.0/brain/online/v2/paddle-vl-parser/task/query?access_token={access_token}\nContent-Type: application/x-www-form-urlencoded\n```\n\n## 提交请求参数\n\n### 文件参数（必选，二选一）\n\n| 参数 | 必选 | 类型 | 说明 |\n|------|------|------|------|\n| file_data | 和 file_url 二选一 | string | 文件 Base64 编码。版式文档：pdf, jpg, jpeg, png, bmp, tif, tiff, ofd（图片最长边≤4096px）；流式文档：doc, docx, txt, wps, ppt, pptx。图片≤10M，版式文档≤100M，流式文档≤50M，PDF≤500页。超过50M须用file_url。优先级：file_data > file_url |\n| file_url | 和 file_data 二选一 | string | 文件URL，≤1024字节。PDF≤100M，≤500页。请关闭URL防盗链 |\n| file_name | 是 | string | 文件名，后缀须正确，如 \"1.pdf\" |\n\n### 功能参数\n\n| 参数 | 必选 | 类型 | 说明 |\n|------|------|------|------|\n| recognize_formula | - | bool | **无需开启**，大模型默认识别公式 |\n| analysis_chart | 否 | bool | 是否对统计图表进行解析 |\n| parse_image_layout | - | bool | **无需开启**，大模型默认解析所有图片 |\n| language_type | - | string | **无需开启**，大模型默认识别语种 |\n| merge_tables | 否 | bool | 是否合并跨页表格 |\n| relevel_titles | 否 | bool | 是否对 paragraph_title 进行分级 |\n| recognize_seal | 否 | bool | 是否识别印章 |\n| return_span_boxes | 否 | bool | 是否返回行坐标 |\n\n### 文档分块参数\n\n| 参数 | 必选 | 类型 | 默认值 | 说明 |\n|------|------|------|--------|------|\n| return_doc_chunks.switch | 否 | bool | False | 是否切分 |\n| return_doc_chunks.chunk_size | 否 | int | -1 | 切分块大小，-1为语义自动切分 |\n\n## 返回结构\n\n### 获取结果返回\n\n| 字段 | 类型 | 说明 |\n|------|------|------|\n| result.task_id | string | 任务 ID |\n| result.status | string | pending/processing/success/failed |\n| result.task_error | string | 报错信息 |\n| result.markdown_url | string | Markdown 结果链接（30天有效） |\n| result.parse_result_url | string | JSON 结果 BOS 链接（30天有效） |\n\n### 版面类型（24种）\n\n| 类型 | 说明 | 类型 | 说明 |\n|------|------|------|------|\n| text | 文本 | table | 表格 |\n| image | 图片 | chart | 图表 |\n| doc_title | 文档标题 | paragraph_title | 段落标题 |\n| figure_title | 图片标题 | display_formula | 公式 |\n| inline_formula | 行内公式 | formula_number | 公式编号 |\n| header | 页眉 | footer | 页脚 |\n| header_image | 页眉图片 | footer_image | 页脚图片 |\n| number | 页码 | abstract | 摘要 |\n| algorithm | 算法 | aside_text | 旁注文本 |\n| content | 目录 | footnote | 脚注 |\n| reference | 参考文献 | reference_content | 参考文献内容 |\n| seal | 印章 | vertical_text | 竖排文本 |\n\n## 相关文档\n\n- [官方 API 文档](https://ai.baidu.com/ai-doc/OCR/3mi73at9o)\n- [错误码参考](error_codes.md)\n- [API Key 配置指南](apikey-fetch.md)\n\nFile v1.0.1:skill-card.md\n\n## Description: <br>\n调用百度 PaddleOCR-VL API 将 PDF、Office 文档和图片解析为 Markdown、JSON 和结构化版面结果。 <br>\n\nThis skill is ready for commercial/non-commercial use. <br>\n\n## Publisher: <br>\n[maglanyulan](https://clawhub.ai/user/maglanyulan) <br>\n\n### License/Terms of Use: <br>\nMIT-0 <br>\n\n\n## Use Case: <br>\nDevelopers and agents use this skill to submit documents or document URLs to Baidu's PaddleOCR-VL service, poll asynchronous parsing tasks, and retrieve Markdown or JSON document-analysis results. <br>\n\n### Deployment Geography for Use: <br>\nGlobal <br>\n\n## Known Risks and Mitigations: <br>\nRisk: Selected documents, document URLs, and parsing results are sent to Baidu for cloud processing. <br>\nMitigation: Use only documents approved for this external service, and avoid confidential or regulated content unless the use case has been reviewed. <br>\nRisk: The skill requires Baidu API keys or secret keys. <br>\nMitigation: Store credentials outside source control in environment variables or an approved secret store, and rotate them if exposed. <br>\nRisk: Returned markdown_url and parse_result_url values may expose parsed document content during their 30-day lifetime. <br>\nMitigation: Treat result links as sensitive, limit sharing, and avoid persisting them longer than necessary. <br>\n\n\n## Reference(s): <br>\n- [Baidu PaddleOCR-VL API documentation](https://ai.baidu.com/ai-doc/OCR/3mi73at9o) <br>\n- [Baidu API key and secret key guide](https://ai.baidu.com/ai-doc/REFERENCE/Ck3dwjhhu#1-获取aksk) <br>\n- [Baidu intelligent document analysis platform](https://ai.baidu.com/solution/intelligent-document-analysis) <br>\n- [Baidu free test resource guide](https://ai.baidu.com/ai-doc/OCR/dk3iqnq51) <br>\n- [API Key configuration guide](references/apikey-fetch.md) <br>\n- [API parameters](references/parameters.md) <br>\n- [Error codes](references/error_codes.md) <br>\n\n\n## Skill Output: <br>\n**Output Type(s):** [Markdown, JSON, Code, Shell commands, Configuration, Guidance] <br>\n**Output Format:** [Markdown guidance with bash examples and a Python parser that returns JSON plus Markdown/JSON result links.] <br>\n**Output Parameters:** [1D] <br>\n**Other Properties Related to Output:** [Requires Baidu API credentials; parsing is asynchronous and returned result links are valid for 30 days.] <br>\n\n## Skill Version(s): <br>\n1.0.1 (source: server release metadata) <br>\n\n## Ethical Considerations: <br>\nUsers should evaluate whether this skill is appropriate for their environment, review any generated or modified files before relying on them, and apply their organization's safety, security, and compliance requirements before deployment. <br>\n\nArchive v1.0.0: 6 files, 11671 bytes\n\nFiles: _meta.json (139b), references/apikey-fetch.md (1537b), references/error_codes.md (2855b), references/parameters.md (3491b), scripts/baidu_doc_vlm_parser.py (9531b), SKILL.md (10477b)\n\nFile v1.0.0:SKILL.md\n\n---\nname: baidu-doc-vlm-parser 百度文档解析(PaddleOCR-VL)\ndescription: 调用百度PaddleOCR-VL大模型API解析文档。基于PaddleOCR-VL-1.5多模态大模型，支持PDF、Word、PPT、图片等格式，精准识别印刷文本、手写文本、表格、公式、图表、印章等复杂元素，支持111种语言，可处理不规则布局和长文档跨页解析。触发词：文档解析、VLM解析、大模型OCR、PaddleOCR、多模态文档、手写识别、公式识别、复杂版面。\nlicense: MIT\n---\n\n# 百度文档解析（PaddleOCR-VL）Skill\n\n基于 PaddleOCR-VL-1.5 多模态大模型，提供开箱即用的文档智能解析能力。\n\n## 功能概述\n\n**PaddleOCR-VL-1.5-0.9B** 是多模态文档解析领域的 SOTA 方案，具备：\n\n- **全要素精准解析**：高效识别印刷文本、手写文本、表格、公式、图表、印章等复杂文档元素\n- **智能阅读顺序**：基于人类阅读习惯推断内容排列顺序，将零散页面信息转化为有序带标签的结构化元素序列\n- **行级别坐标**：支持精准的行级别坐标输出\n- **111 种语言**：覆盖中、英、日、韩、拉丁文等全球化多语种文档\n- **不规则布局定位**：攻克复杂版面解析难点\n- **长文档跨页解析**：支持跨页表格合并等企业级场景\n- **直接 Markdown/JSON 输出**：无需额外处理\n\n## 与文档解析（标准版）的区别\n\n| 特性 | PaddleOCR-VL（本 Skill） | 标准版（pipeline-parser） |\n|------|-------------------------|--------------------------|\n| 底层模型 | 多模态大模型 VLM | 传统 Pipeline |\n| 语言支持 | 111 种 | 20+ 种 |\n| 公式/图片识别 | 默认开启，无需配置 | 需手动开启参数 |\n| 语种识别 | 自动识别，无需指定 | 需指定 language_type |\n| 版面类型 | 24 种细粒度类型 | 8 种基础类型 |\n| 行坐标 | 支持 | 不支持 |\n| 多边形坐标 | 支持（polygon） | 仅矩形框 |\n| 文件大小 | 版式 ≤100M，PDF ≤500 页 | PDF ≤300M，≤2000 页 |\n\n## 适用场景\n\n当用户需要：\n- 解析复杂版面文档（多栏、不规则布局）\n- 精准识别手写文本、数学公式、图表\n- 处理多语种混合文档\n- 获取行级别坐标信息\n- 长文档跨页表格合并\n- 免配置自动识别文档内容\n\n## API 配置\n\n### 环境变量（必须）\n\n[百度智能文档分析平台 领取免费测试资源](https://ai.baidu.com/ai-doc/OCR/dk3iqnq51)\n\n使用前请设置以下环境变量：\n\n```bash\nexport BAIDU_DOC_AI_API_KEY=\"your_api_key\"\nexport BAIDU_DOC_AI_SECRET_KEY=\"your_secret_key\"\n```\n\n### 认证方式\n\n通过 API Key 和 Secret Key 获取 access_token，有效期 30 天。\n\n## 支持格式\n\n**版式文档**：pdf, jpg, jpeg, png, bmp, tif, tiff, ofd（图片最长边不大于 4096px）\n\n**流式文档**：doc, docx, txt, wps, ppt, pptx\n\n## 支持语言\n\n111 种语言，包括中文、英文、日文、韩文、拉丁文等，**无需手动指定，大模型自动识别**。\n\n## 使用方式\n\n```bash\npython3 scripts/baidu_doc_vlm_parser.py --file_data <文件的base64编码> --file_name \"test.pdf\"\npython3 scripts/baidu_doc_vlm_parser.py --file_url <文件公网URL> --file_name \"test.pdf\"\n```\n\n## API 接口\n\n文档解析（PaddleOCR-VL）API 服务为异步接口，需要先调用**提交请求接口**获取 task_id，然后调用**获取结果接口**进行结果轮询。\n\n### 提交请求接口\n\n- **HTTP 方法**：POST\n- **请求 URL**：`https://aip.baidubce.com/rest/2.0/brain/online/v2/paddle-vl-parser/task?access_token={token}`\n- **Content-Type**：`application/x-www-form-urlencoded`\n\n### 获取结果接口\n\n- **HTTP 方法**：POST\n- **请求 URL**：`https://aip.baidubce.com/rest/2.0/brain/online/v2/paddle-vl-parser/task/query?access_token={token}`\n- **Content-Type**：`application/x-www-form-urlencoded`\n- **请求参数**：`task_id`（必填，提交请求时返回的 task_id）\n\n## 请求参数\n\n### 文件参数（必选，二选一）\n\n| 参数 | 必选 | 类型 | 说明 |\n|------|------|------|------|\n| `file_data` | 和 file_url 二选一 | string | 文件 Base64 编码数据。版式文档：pdf, jpg, jpeg, png, bmp, tif, tiff, ofd（图片最长边不大于 4096px）；流式文档：doc, docx, txt, wps, ppt, pptx。图片不超过 10M，版式文档不超过 100M，流式文档不超过 50M，PDF 最大 500 页。超过 50M 须使用 file_url。优先级：file_data > file_url |\n| `file_url` | 和 file_data 二选一 | string | 文件数据 URL，长度不超过 1024 字节。PDF 文档不超过 100M，最大 500 页。**请注意关闭 URL 防盗链** |\n| `file_name` | 是 | string | 文件名，请保证文件名后缀正确，例如 \"1.pdf\" |\n\n### 功能参数\n\n| 参数 | 必选 | 类型 | 说明 |\n|------|------|------|------|\n| `recognize_formula` | - | bool | **无需开启**，大模型默认对版式类型文档进行公式识别 |\n| `analysis_chart` | 否 | bool | 是否对统计图表进行解析 |\n| `parse_image_layout` | - | bool | **无需开启**，大模型默认解析文档中的所有图片 |\n| `language_type` | - | string | **无需开启**，大模型默认识别语种类型 |\n| `merge_tables` | 否 | bool | 是否将跨页表格合并输出，开启后 tables 内返回跨页表格合并标识 |\n| `relevel_titles` | 否 | bool | 是否对段落标题（paragraph_title）进行分级，开启后在 sub_type 中输出标题级别 |\n| `recognize_seal` | 否 | bool | 是否识别印章内容 |\n| `return_span_boxes` | 否 | bool | 是否返回行坐标 |\n\n### 文档分块参数\n\n`return_doc_chunks` 为字典类型：\n\n| 参数 | 必选 | 类型 | 默认值 | 说明 |\n|------|------|------|--------|------|\n| `switch` | 否 | bool | False | 是否进行文档内容切分 |\n| `chunk_size` | 否 | int | -1 | 切分块的大小，-1 表示按照语义自动切分 |\n\n## 返回结构\n\n### 提交请求返回\n\n| 字段 | 类型 | 说明 |\n|------|------|------|\n| `log_id` | uint64 | 唯一的 log id，用于问题定位 |\n| `error_code` | int | 错误码 |\n| `error_msg` | string | 错误描述信息 |\n| `result.task_id` | string | 该请求生成的 task_id |\n\n### 获取结果返回\n\n| 字段 | 类型 | 说明 |\n|------|------|------|\n| `result.task_id` | string | 任务 ID |\n| `result.status` | string | 任务状态：pending（排队中）、processing（运行中）、success（成功）、failed（失败） |\n| `result.task_error` | string | 解析报错信息 |\n| `result.markdown_url` | string | Markdown 格式结果链接，**有效期 30 天** |\n| `result.parse_result_url` | string | JSON 格式结果 BOS 链接，**有效期 30 天** |\n\n### 解析结果 JSON 结构（parse_result_url）\n\n#### 页面对象（pages[]）\n\n| 字段 | 类型 | 说明 |\n|------|------|------|\n| `page_id` | string | 页码 ID |\n| `page_num` | int | 页码数 |\n| `text` | string | 当前页所有纯文字内容 |\n| `layouts` | list | 版式分析结果 |\n| `tables` | list | 表格解析结果 |\n| `images` | list | 图片解析结果 |\n| `meta` | dict | 页面元信息（page_width, page_height） |\n\n#### 版面元素（layouts[]）\n\n| 字段 | 类型 | 说明 |\n|------|------|------|\n| `layout_id` | string | 唯一标志，格式 \"xxxxx-layout-{global_layout_index}\" |\n| `text` | string | 文本内容（type 为 table/image 时为空） |\n| `position` | list | 位置 [x, y, w, h] |\n| `polygon` | list | 顶点坐标列表，可围合成多边形 |\n| `span_boxes` | list | 行信息（开启 return_span_boxes 后生效），含 text 和 location |\n| `type` | string | 版面元素类型（见下表） |\n| `sub_type` | string | 标题层级（开启 relevel_titles 后生效） |\n\n**版面类型（type）— 24 种细粒度类型**：\n\n| 类型 | 说明 | 类型 | 说明 |\n|------|------|------|------|\n| `text` | 文本 | `table` | 表格 |\n| `image` | 图片 | `chart` | 图表 |\n| `doc_title` | 文档标题 | `paragraph_title` | 段落标题 |\n| `figure_title` | 图片标题 | `display_formula` | 公式 |\n| `inline_formula` | 行内公式 | `formula_number` | 公式编号 |\n| `header` | 页眉 | `footer` | 页脚 |\n| `header_image` | 页眉图片 | `footer_image` | 页脚图片 |\n| `number` | 页码 | `abstract` | 摘要 |\n| `algorithm` | 算法 | `aside_text` | 旁注文本 |\n| `content` | 目录 | `footnote` | 脚注 |\n| `reference` | 参考文献 | `reference_content` | 参考文献内容 |\n| `seal` | 印章 | `vertical_text` | 竖排文本 |\n\n#### 表格对象（tables[]）\n\n| 字段 | 类型 | 说明 |\n|------|------|------|\n| `layout_id` | string | 对应 layouts 中 type 为 table 的 layout ID |\n| `markdown` | string | 表格 Markdown 形式 |\n| `position` | list | 边框数据 [x, y, w, h] |\n| `cells` | list | 单元格内版面信息 |\n| `matrix` | list | 单元格索引矩阵 |\n| `merge_table` | string | 合并标识（开启 merge_tables 后）：begin（开始）、end（结束） |\n\n#### 图片对象（images[]）\n\n| 字段 | 类型 | 说明 |\n|------|------|------|\n| `layout_id` | string | 对应 layouts 中 type 为 image 的 layout ID |\n| `position` | list | 边框数据 [x, y, w, h] |\n| `data_url` | string | 图片存储链接 |\n| `image_description` | string | 统计图表内容解析（JSON 字符串） |\n\n## API 特性\n\n### 异步处理流程\n\n1. 调用提交请求接口 → 获取 `task_id`\n2. 通过 `task_id` 调用获取结果接口轮询\n\n### 轮询建议\n\n- 提交请求后 5~10 秒开始轮询\n- 轮询间隔：5 秒\n- 最大轮询时间：300 秒\n\n### QPS 限制\n\n- 提交请求接口：2 QPS\n- 获取结果接口：10 QPS\n\n## 文件限制\n\n| 限制项 | 说明 |\n|--------|------|\n| 图片大小 | ≤ 10M，最长边 ≤ 4096px |\n| 版式文档大小 | ≤ 100M |\n| 流式文档大小 | ≤ 50M |\n| PDF 页数 | ≤ 500 页 |\n| URL 长度 | ≤ 1024 字节 |\n| 优先级 | file_data > file_url |\n\n## 错误处理\n\n常见错误码参见 `references/error_codes.md`\n\n## 脚本\n\n- `scripts/baidu_doc_vlm_parser.py`：文档解析主程序，支持命令行快速调用\n\n## 参考文档\n\n- `references/parameters.md`：完整 API 参数与返回结构详解\n- `references/error_codes.md`：完整错误码参考\n- `references/apikey-fetch.md`：API Key 配置指南\n\n## 相关链接\n\n- [官方 API 文档](https://ai.baidu.com/ai-doc/OCR/3mi73at9o)\n- [百度云控制台](https://console.bce.baidu.com/ai/)\n- [智能文档分析平台](https://ai.baidu.com/solution/intelligent-document-analysis)\n\nFile v1.0.0:_meta.json\n\n{\n  \"ownerId\": \"kn75p1w9cr0c8ycct5wzrb5ken83e9nc\",\n  \"slug\": \"baidu-doc-vlm-parser\",\n  \"version\": \"1.0.0\",\n  \"publishedAt\": 1778307379313\n}\n\nFile v1.0.0:references/apikey-fetch.md\n\n# 百度文档解析（PaddleOCR-VL）API Key 配置指南\n\n## BAIDU_DOC_AI_API_KEY 和 BAIDU_DOC_AI_SECRET_KEY 未配置\n\n当环境变量未设置时，按照以下步骤操作：\n\n### 1. 获取 API Key 和 Secret Key\n\n访问：**https://ai.baidu.com/ai-doc/REFERENCE/Ck3dwjhhu#1-获取aksk**\n\n- 登录百度云账号\n- 创建应用或查看已有的 API Key 和 Secret Key\n- 复制你的 **API Key** 和 **Secret Key**\n\n### 2. 领取免费测试资源\n\n访问：**https://ai.baidu.com/ai-doc/OCR/dk3iqnq51**\n\n### 3. 配置环境变量\n\n```bash\nexport BAIDU_DOC_AI_API_KEY=\"your_actual_api_key_here\"\nexport BAIDU_DOC_AI_SECRET_KEY=\"your_actual_secret_key_here\"\n```\n\n或通过配置文件 `~/.claude/settings.json`：\n\n```json\n{\n  \"skills\": {\n    \"entries\": {\n      \"baidu-doc-vlm-parser\": {\n        \"env\": {\n          \"BAIDU_DOC_AI_API_KEY\": \"your_actual_api_key_here\",\n          \"BAIDU_DOC_AI_SECRET_KEY\": \"your_actual_secret_key_here\"\n        }\n      }\n    }\n  }\n}\n```\n\n### 4. 验证配置\n\n```bash\ncurl -X POST 'https://aip.baidubce.com/oauth/2.0/token' \\\n  -d 'grant_type=client_credentials' \\\n  -d 'client_id={your_api_key}' \\\n  -d 'client_secret={your_secret_key}'\n```\n\n### 5. 测试\n\n```bash\npython3 scripts/baidu_doc_vlm_parser.py --file_url \"https://example.com/test.pdf\" --file_name \"test.pdf\"\n```\n\n## 相关链接\n\n- [获取 AK/SK 文档](https://ai.baidu.com/ai-doc/REFERENCE/Ck3dwjhhu#1-获取aksk)\n- [领取免费资源](https://ai.baidu.com/ai-doc/OCR/dk3iqnq51)\n- [百度云控制台](https://console.bce.baidu.com/ai/)\n\nFile v1.0.0:references/error_codes.md\n\n# 百度文档解析（PaddleOCR-VL）错误码参考\n\n## 通用错误\n\n### 认证相关错误\n\n| 错误码 | 错误信息 | 说明 | 解决方案 |\n|--------|---------|------|----------|\n| 1 | Unknown error | 未知错误 | 重试请求 |\n| 2 | Service temporarily unavailable | 服务暂不可用 | 重试请求 |\n| 3 | Unsupported openapi method | API 接口不存在 | 检查 URL |\n| 4 | Open api request limit reached | 集群超限额 | 重试请求 |\n| 6 | No permission to access data | 无 API 访问权限 | 在百度云控制台开通 |\n| 17 | Open api daily request limit reached | 日配额超限 | 购买额度或等待重置 |\n| 18 | Open api qps request limit reached | QPS 超限 | 降低请求频率 |\n| 19 | Open api total request limit reached | 总量配额超限 | 购买额外配额 |\n| 100 | Invalid parameter | access_token 无效 | 重新获取 |\n| 110 | Access token invalid or no longer valid | access_token 无效 | 重新获取（30天有效期） |\n| 111 | Access token expired | access_token 过期 | 重新获取 |\n\n### 文件相关错误\n\n| 错误码 | 错误信息 | 说明 | 解决方案 |\n|--------|---------|------|----------|\n| 216200 | empty file or fileurl | 文件或 URL 为空 | 提供 file_data 或 file_url |\n| 216201 | file format error | 文件格式不支持 | 使用支持的格式 |\n| 216202 | file size error | 文件大小超限 | 缩减文件大小 |\n\n### 任务处理错误\n\n| 错误码 | 错误信息 | 说明 | 解决方案 |\n|--------|---------|------|----------|\n| 282000 | internal error | 任务处理失败 | 重试或联系技术支持 |\n| 282003 | missing parameters | 缺少必要参数 | 检查必填参数 |\n| 282005 | quota exceed error | 额度不足 | 申请增加配额 |\n| 282007 | task not exist | 任务不存在 | 检查 task_id |\n| 282018 | Service busy | 服务繁忙 | 降低请求频率 |\n\n### URL 相关错误\n\n| 错误码 | 错误信息 | 说明 | 解决方案 |\n|--------|---------|------|----------|\n| 282111 | url format illegal | URL 格式不合法 | 检查 URL 格式 |\n| 282112 | url download timeout | URL 下载超时 | 检查 URL 可访问性 |\n| 282113 | url response invalid | URL 响应无效 | 检查 URL 返回内容 |\n| 282114 | url size error | URL 长度超 1024 字节 | 缩短 URL |\n\n## 错误处理策略\n\n| 错误类型 | 错误码 | 建议处理方式 |\n|---------|--------|-------------|\n| 瞬时错误 | 1, 2, 4, 282000, 282018 | 指数退避重试 |\n| 认证错误 | 100, 110, 111 | 重新获取 access_token |\n| 配额错误 | 17, 18, 19, 282005 | 等待或购买额外配额 |\n| 参数错误 | 216200, 216201, 282003 | 修正参数后重试 |\n\n## 获取帮助\n\n- [提交工单](https://ticket.bce.baidu.com/?_=1648086674827&fromai=1#/ticket/create~productId=96&questionId=1306&channel=2)\n- [百度云控制台](https://console.bce.baidu.com/ai/)\n\nFile v1.0.0:references/parameters.md\n\n# 百度文档解析（PaddleOCR-VL）API 参数详解\n\n## 接口概述\n\n基于 PaddleOCR-VL-1.5-0.9B 多模态大模型，具备全要素精准解析能力，支持 111 种语言，可处理不规则布局和长文档跨页解析。\n\n## API 接口地址\n\n### 提交请求接口\n\n```\nPOST https://aip.baidubce.com/rest/2.0/brain/online/v2/paddle-vl-parser/task?access_token={access_token}\nContent-Type: application/x-www-form-urlencoded\n```\n\n### 获取结果接口\n\n```\nPOST https://aip.baidubce.com/rest/2.0/brain/online/v2/paddle-vl-parser/task/query?access_token={access_token}\nContent-Type: application/x-www-form-urlencoded\n```\n\n## 提交请求参数\n\n### 文件参数（必选，二选一）\n\n| 参数 | 必选 | 类型 | 说明 |\n|------|------|------|------|\n| file_data | 和 file_url 二选一 | string | 文件 Base64 编码。版式文档：pdf, jpg, jpeg, png, bmp, tif, tiff, ofd（图片最长边≤4096px）；流式文档：doc, docx, txt, wps, ppt, pptx。图片≤10M，版式文档≤100M，流式文档≤50M，PDF≤500页。超过50M须用file_url。优先级：file_data > file_url |\n| file_url | 和 file_data 二选一 | string | 文件URL，≤1024字节。PDF≤100M，≤500页。请关闭URL防盗链 |\n| file_name | 是 | string | 文件名，后缀须正确，如 \"1.pdf\" |\n\n### 功能参数\n\n| 参数 | 必选 | 类型 | 说明 |\n|------|------|------|------|\n| recognize_formula | - | bool | **无需开启**，大模型默认识别公式 |\n| analysis_chart | 否 | bool | 是否对统计图表进行解析 |\n| parse_image_layout | - | bool | **无需开启**，大模型默认解析所有图片 |\n| language_type | - | string | **无需开启**，大模型默认识别语种 |\n| merge_tables | 否 | bool | 是否合并跨页表格 |\n| relevel_titles | 否 | bool | 是否对 paragraph_title 进行分级 |\n| recognize_seal | 否 | bool | 是否识别印章 |\n| return_span_boxes | 否 | bool | 是否返回行坐标 |\n\n### 文档分块参数\n\n| 参数 | 必选 | 类型 | 默认值 | 说明 |\n|------|------|------|--------|------|\n| return_doc_chunks.switch | 否 | bool | False | 是否切分 |\n| return_doc_chunks.chunk_size | 否 | int | -1 | 切分块大小，-1为语义自动切分 |\n\n## 返回结构\n\n### 获取结果返回\n\n| 字段 | 类型 | 说明 |\n|------|------|------|\n| result.task_id | string | 任务 ID |\n| result.status | string | pending/processing/success/failed |\n| result.task_error | string | 报错信息 |\n| result.markdown_url | string | Markdown 结果链接（30天有效） |\n| result.parse_result_url | string | JSON 结果 BOS 链接（30天有效） |\n\n### 版面类型（24种）\n\n| 类型 | 说明 | 类型 | 说明 |\n|------|------|------|------|\n| text | 文本 | table | 表格 |\n| image | 图片 | chart | 图表 |\n| doc_title | 文档标题 | paragraph_title | 段落标题 |\n| figure_title | 图片标题 | display_formula | 公式 |\n| inline_formula | 行内公式 | formula_number | 公式编号 |\n| header | 页眉 | footer | 页脚 |\n| header_image | 页眉图片 | footer_image | 页脚图片 |\n| number | 页码 | abstract | 摘要 |\n| algorithm | 算法 | aside_text | 旁注文本 |\n| content | 目录 | footnote | 脚注 |\n| reference | 参考文献 | reference_content | 参考文献内容 |\n| seal | 印章 | vertical_text | 竖排文本 |\n\n## 相关文档\n\n- [官方 API 文档](https://ai.baidu.com/ai-doc/OCR/3mi73at9o)\n- [错误码参考](error_codes.md)\n- [API Key 配置指南](apikey-fetch.md)","readmeExcerpt":"Skill: 百度文档解析vlm-parser Owner: maglanyulan Summary: 调用百度PaddleOCR-VL大模型API解析文档。基于PaddleOCR-VL-1.6多模态大模型，支持PDF、Word、PPT、图片等格式，精准识别印刷文本、手写文本、表格、公式、图表、印章等复杂元素，支持100+种语言，可处理不规则布局和长文档跨页解析。触发词：文档解析、VLM解析、大模型OCR、PaddleOCR、多模态文档、手写识别、公式识别、复杂版面。 Tags: latest:1.0.5 Version history: v1.0.5 | 2026-09-17T11:16:24.084Z | user - Removed the file: skill-card.md - No functional changes to code or documentation observed in this versio","codeSnippets":[],"executableExamples":[{"language":"bash","snippet":"export BAIDU_DOC_AI_API_KEY=\"your_api_key\"\nexport BAIDU_DOC_AI_SECRET_KEY=\"your_secret_key\""},{"language":"bash","snippet":"python3 scripts/baidu_doc_vlm_parser.py --file_data <文件的base64编码> --file_name \"test.pdf\"\npython3 scripts/baidu_doc_vlm_parser.py --file_url <文件公网URL> --file_name \"test.pdf\""},{"language":"python","snippet":"import requests, os, base64\n\ndef create_task(url, file_path, file_url):\n    with open(file_path, \"rb\") as f:\n        file_data = base64.b64encode(f.read())\n    data = {\n        \"file_data\": file_data,\n        \"file_url\": file_url,\n        \"file_name\": os.path.basename(file_path)\n    }\n    headers = {'Content-Type': 'application/x-www-form-urlencoded'}\n    return requests.post(url, headers=headers, data=data)\n\nrequest_host = \"https://aip.baidubce.com/rest/2.0/brain/online/v2/paddle-vl-parser/task?access_token={token}\"\nresponse = create_task(request_host, \"./test.pdf\", \"\")\nprint(response.json())"},{"language":"json","snippet":"{\n  \"error_code\": 0,\n  \"error_msg\": \"\",\n  \"log_id\": \"10138598131137362685273505665433\",\n  \"result\": { \"task_id\": \"task-3zy9Bg8CHt1M4pPOcX2q5bg28j26801S\" }\n}"},{"language":"python","snippet":"import requests\n\ndef query_task(url, task_id):\n    data = {\"task_id\": task_id}\n    headers = {'Content-Type': 'application/x-www-form-urlencoded'}\n    return requests.post(url, headers=headers, data=data)\n\nrequest_host = \"https://aip.baidubce.com/rest/2.0/brain/online/v2/paddle-vl-parser/task/query?access_token={access_token}\"\nresp = query_task(request_host, \"task_id\")\nprint(resp.json())"},{"language":"json","snippet":"{\n  \"log_id\": \"13665091038742503867108513247608\",\n  \"error_code\": \"282007\",\n  \"error_msg\": \"task not exist, please check task id\",\n  \"result\": \"null\"\n}"}],"parameters":null,"dependencies":[],"permissions":[],"extractedFiles":[{"path":"SKILL.md","content":"---\nname: baidu-doc-vlm-parser 百度文档解析(PaddleOCR-VL)\ndescription: 调用百度PaddleOCR-VL大模型API解析文档。基于PaddleOCR-VL-1.6多模态大模型，支持PDF、Word、PPT、图片等格式，精准识别印刷文本、手写文本、表格、公式、图表、印章等复杂元素，支持100+种语言，可处理不规则布局和长文档跨页解析。触发词：文档解析、VLM解析、大模型OCR、PaddleOCR、多模态文档、手写识别、公式识别、复杂版面。\nlicense: MIT\n---\n\n# 百度文档解析（PaddleOCR-VL）Skill\n\n基于 PaddleOCR-VL-1.6 多模态大模型，提供开箱即用的文档智能解析能力。\n\n## 功能概述\n\n**PaddleOCR-VL-1.6-0.9B** 是多模态文档解析领域的 SOTA 方案，具备：\n\n- **全要素精准解析**：高效识别印刷文本、手写文本、表格、公式、图表、印章等复杂文档元素\n- **智能阅读顺序**：基于人类阅读习惯推断内容排列顺序，将零散页面信息转化为有序带标签的结构化元素序列\n- **行级别坐标**：支持精准的行级别坐标输出\n- **100+ 种语言**：覆盖中、英、日、韩、拉丁文等全球化多语种文档\n- **不规则布局定位**：攻克复杂版面解析难点\n- **长文档跨页解析**：支持跨页表格合并等企业级场景\n- **直接 Markdown/JSON 输出**：无需额外处理\n\n## 与文档解析（标准版）的区别\n\n| 特性 | PaddleOCR-VL（本 Skill） | 标准版（pipeline-parser） |\n|------|-------------------------|--------------------------|\n| 底层模型 | 多模态大模型 VLM | 传统 Pipeline |\n| 语言支持 | 100+ 种 | 20+ 种 |\n| 公式/图片识别 | 默认开启，无需配置 | 需手动开启参数 |\n| 语种识别 | 自动识别，无需指定 | 需指定 language_type |\n| 版面类型 | 24 种细粒度类型 | 8 种基础类型 |\n| 行坐标 | 支持 | 不支持 |\n| 多边形坐标 | 支持（polygon） | 仅矩形框 |\n| 文件大小 | 版式 ≤100M，PDF ≤500 页 | PDF ≤300M，≤2000 页 |\n\n## 适用场景\n\n当用户需要：\n- 解析复杂版面文档（多栏、不规则布局）\n- 精准识别手写文本、数学公式、图表\n- 处理多语种混合文档\n- 获取行级别坐标信息\n- 长文档跨页表格合并\n- 免配置自动识别文档内容\n\n## 免费资源领取和计费说明\n[百度智能文档分析平台 领取免费测试资源](https://cloud.baidu.com/doc/OCR/s/fk3h7xu7h)\n\n\n[百度智能文档分析平台计费与购买方式](https://cloud.baidu.com/doc/OCR/s/Fls06fa15#%E6%96%87%E6%A1%A3%E8%A7%A3%E6%9E%90%EF%BC%88paddleocr-vl%EF%BC%89)\n\n\n| 用户类型 | 免费额度 |\n|---------|---------|\n| 个人实名认证用户 | **200 页** |\n| 企业实名认证用户 | **1000 页** |\n\n## API 配置\n\n### 额度获取方式\n\n您可通过百度智能云平台获取[免费额度](https://cloud.baidu.com/doc/OCR/s/fk3h7xu7h)与[购买调用资源](https://cloud.baidu.com/doc/OCR/s/Fls06fa15#%E6%96%87%E6%A1%A3%E8%A7%A3%E6%9E%90%EF%BC%88paddleocr-vl%EF%BC%89)\n\n### 环境变量（必须）\n\n使用前请设置以下环境变量：\n\n```bash\nexport BAIDU_DOC_AI_API_KEY=\"your_api_key\"\nexport BAIDU_DOC_AI_SECRET_KEY=\"your_secret_key\"\n```\n\n### 认证方式\n\n通过 API Key 和 Secret Key 获取 access_token，有效期 30 天。所有接口请求需以 URL 参数 `access_token` 携带。\n\n## 支持格式\n\n**版式文档**：pdf, jpg, jpeg, png, bmp, tif, tiff, ofd（图片最长边不大于 8192px）\n\n**流式文档**：doc, docx, txt, wps, ppt, pptx\n\n## 支持语言\n\n100+ 种语言，包括中文、英文、日文、韩文、拉丁文等，**无需手动指定，大模型自动识别**。\n\n## 使用方式\n\n```bash\npython3 scripts/baidu_doc_vlm_parser.py --file_data <文件的base64编码> --file_name \"test.pdf\"\npython3 scripts/baidu_doc_vlm_parser.py --file_url <文件公网URL> --file_name \"test.pdf\"\n```\n\n## API 接口\n\n文档解析（PaddleOCR-VL）API 服务为异步接口，需要先调用**提交请求接口**获取 task_id，然后调用**获取结果接口**进行结果轮询。\n\n### 提交请求接口\n\n- **HTTP 方法**：POST\n- **请求 URL**：`https://aip.baidubce.com/rest/2.0/brain/online/v2/paddle-vl-parser/task?access_token={token}`\n- **Content-Type**：`application/x-www-form-urlencoded`\n\n#### Python 示例\n\n```python\nimport requests, os, base64\n\ndef create_task(url, file_path, file_url):\n    with open(file_path, \"rb\") as f:\n        file_data = base64.b64encode(f.read())\n    data = {\n        \"file_data\": file_data,\n        \"file_url\": file_url,\n        \"file_name\": os.path.basename(file_path)\n    }\n    headers = {'Content-Type': 'application/x-www-form-urlencoded'}\n    return requests.post(url, headers=headers, data="},{"path":"_meta.json","content":"{\n  \"ownerId\": \"kn75p1w9cr0c8ycct5wzrb5ken83e9nc\",\n  \"slug\": \"baidu-doc-vlm-parser\",\n  \"version\": \"1.0.5\",\n  \"publishedAt\": 1789643784084\n}"},{"path":"references/apikey-fetch.md","content":"# 百度文档解析（PaddleOCR-VL）API Key 配置指南\n\n## BAIDU_DOC_AI_API_KEY 和 BAIDU_DOC_AI_SECRET_KEY 未配置\n\n当环境变量未设置时，按照以下步骤操作：\n\n### 1. 获取 API Key 和 Secret Key\n\n访问：**https://ai.baidu.com/ai-doc/REFERENCE/Ck3dwjhhu#1-获取aksk**\n\n- 登录百度云账号\n- 创建应用或查看已有的 API Key 和 Secret Key\n- 复制你的 **API Key** 和 **Secret Key**\n\n### 2. 领取免费测试资源\n\n访问：**https://ai.baidu.com/ai-doc/OCR/dk3iqnq51**\n\n### 3. 配置环境变量\n\n```bash\nexport BAIDU_DOC_AI_API_KEY=\"your_actual_api_key_here\"\nexport BAIDU_DOC_AI_SECRET_KEY=\"your_actual_secret_key_here\"\n```\n\n或通过配置文件 `~/.claude/settings.json`：\n\n```json\n{\n  \"skills\": {\n    \"entries\": {\n      \"baidu-doc-vlm-parser\": {\n        \"env\": {\n          \"BAIDU_DOC_AI_API_KEY\": \"your_actual_api_key_here\",\n          \"BAIDU_DOC_AI_SECRET_KEY\": \"your_actual_secret_key_here\"\n        }\n      }\n    }\n  }\n}\n```\n\n### 4. 验证配置\n\n```bash\ncurl -X POST 'https://aip.baidubce.com/oauth/2.0/token' \\\n  -d 'grant_type=client_credentials' \\\n  -d 'client_id={your_api_key}' \\\n  -d 'client_secret={your_secret_key}'\n```\n\n### 5. 测试\n\n```bash\npython3 scripts/baidu_doc_vlm_parser.py --file_url \"https://example.com/test.pdf\" --file_name \"test.pdf\"\n```\n\n## 相关链接\n\n- [获取 AK/SK 文档](https://ai.baidu.com/ai-doc/REFERENCE/Ck3dwjhhu#1-获取aksk)\n- [领取免费资源](https://ai.baidu.com/ai-doc/OCR/dk3iqnq51)\n- [百度云控制台](https://console.bce.baidu.com/ai/)"},{"path":"references/error_codes.md","content":"# 百度文档解析（PaddleOCR-VL）错误码参考\n\n## 通用错误\n\n### 认证相关错误\n\n| 错误码 | 错误信息 | 说明 | 解决方案 |\n|--------|---------|------|----------|\n| 1 | Unknown error | 未知错误 | 重试请求 |\n| 2 | Service temporarily unavailable | 服务暂不可用 | 重试请求 |\n| 3 | Unsupported openapi method | API 接口不存在 | 检查 URL |\n| 4 | Open api request limit reached | 集群超限额 | 重试请求 |\n| 6 | No permission to access data | 无 API 访问权限 | 在百度云控制台开通 |\n| 17 | Open api daily request limit reached | 日配额超限 | 购买额度或等待重置 |\n| 18 | Open api qps request limit reached | QPS 超限 | 降低请求频率 |\n| 19 | Open api total request limit reached | 总量配额超限 | 购买额外配额 |\n| 100 | Invalid parameter | access_token 无效 | 重新获取 |\n| 110 | Access token invalid or no longer valid | access_token 无效 | 重新获取（30天有效期） |\n| 111 | Access token expired | access_token 过期 | 重新获取 |\n\n### 文件相关错误\n\n| 错误码 | 错误信息 | 说明 | 解决方案 |\n|--------|---------|------|----------|\n| 216200 | empty file or fileurl | 文件或 URL 为空 | 提供 file_data 或 file_url |\n| 216201 | file format error | 文件格式不支持 | 使用支持的格式 |\n| 216202 | file size error | 文件大小超限 | 缩减文件大小 |\n\n### 任务处理错误\n\n| 错误码 | 错误信息 | 说明 | 解决方案 |\n|--------|---------|------|----------|\n| 282000 | internal error | 任务处理失败 | 重试或联系技术支持 |\n| 282003 | missing parameters | 缺少必要参数 | 检查必填参数 |\n| 282005 | quota exceed error | 额度不足 | 申请增加配额 |\n| 282007 | task not exist | 任务不存在 | 检查 task_id |\n| 282018 | Service busy | 服务繁忙 | 降低请求频率 |\n\n### URL 相关错误\n\n| 错误码 | 错误信息 | 说明 | 解决方案 |\n|--------|---------|------|----------|\n| 282111 | url format illegal | URL 格式不合法 | 检查 URL 格式 |\n| 282112 | url download timeout | URL 下载超时 | 检查 URL 可访问性 |\n| 282113 | url response invalid | URL 响应无效 | 检查 URL 返回内容 |\n| 282114 | url size error | URL 长度超 1024 字节 | 缩短 URL |\n\n## 错误处理策略\n\n| 错误类型 | 错误码 | 建议处理方式 |\n|---------|--------|-------------|\n| 瞬时错误 | 1, 2, 4, 282000, 282018 | 指数退避重试 |\n| 认证错误 | 100, 110, 111 | 重新获取 access_token |\n| 配额错误 | 17, 18, 19, 282005 | 等待或购买额外配额 |\n| 参数错误 | 216200, 216201, 282003 | 修正参数后重试 |\n\n## 获取帮助\n\n- [提交工单](https://ticket.bce.baidu.com/?_=1648086674827&fromai=1#/ticket/create~productId=96&questionId=1306&channel=2)\n- [百度云控制台](https://console.bce.baidu.com/ai/)"},{"path":"references/parameters.md","content":"# 百度文档解析（PaddleOCR-VL）API 参数详解\n\n## 接口概述\n\n基于 PaddleOCR-VL-1.6-0.9B 多模态大模型，具备全要素精准解析能力，支持 100+ 种语言，可处理不规则布局和长文档跨页解析。\n\n## API 接口地址\n\n### 提交请求接口\n\n```\nPOST https://aip.baidubce.com/rest/2.0/brain/online/v2/paddle-vl-parser/task?access_token={access_token}\nContent-Type: application/x-www-form-urlencoded\n```\n\n### 获取结果接口\n\n```\nPOST https://aip.baidubce.com/rest/2.0/brain/online/v2/paddle-vl-parser/task/query?access_token={access_token}\nContent-Type: application/x-www-form-urlencoded\n```\n\n## 提交请求参数\n\n### 文件参数（必选，二选一）\n\n| 参数 | 必选 | 类型 | 说明 |\n|------|------|------|------|\n| file_data | 和 file_url 二选一 | string | 文件 Base64 编码。版式文档：pdf, jpg, jpeg, png, bmp, tif, tiff, ofd（图片最长边不大于 8192px）；流式文档：doc, docx, txt, wps, ppt, pptx。图片≤10M，版式文档≤100M，流式文档≤50M，PDF≤500页。超过50M须用file_url。优先级：file_data > file_url |\n| file_url | 和 file_data 二选一 | string | 文件URL，≤1024字节。PDF≤100M，≤500页。请关闭URL防盗链 |\n| file_name | 是 | string | 文件名，后缀须正确，如 \"1.pdf\" |\n\n### 功能参数\n\n| 参数 | 必选 | 类型 | 说明 |\n|------|------|------|------|\n| recognize_formula | - | bool | **无需开启**，大模型默认识别公式 |\n| analysis_chart | 否 | bool | 是否对统计图表进行解析 |\n| parse_image_layout | - | bool | **无需开启**，大模型默认解析所有图片 |\n| language_type | - | string | **无需开启**，大模型默认识别语种 |\n| merge_tables | 否 | bool | 是否合并跨页表格 |\n| relevel_titles | 否 | bool | 是否对 paragraph_title 进行分级 |\n| recognize_seal | 否 | bool | 是否识别印章 |\n| return_span_boxes | 否 | bool | 是否返回行坐标 |\n\n### 文档分块参数\n\n| 参数 | 必选 | 类型 | 默认值 | 说明 |\n|------|------|------|--------|------|\n| return_doc_chunks.switch | 否 | bool | False | 是否切分 |\n| return_doc_chunks.chunk_size | 否 | int | -1 | 切分块大小，-1为语义自动切分 |\n\n## 返回结构\n\n### 获取结果返回\n\n| 字段 | 类型 | 说明 |\n|------|------|------|\n| result.task_id | string | 任务 ID |\n| result.status | string | pending/processing/success/failed |\n| result.task_error | string | 报错信息 |\n| result.markdown_url | string | Markdown 结果链接（30天有效） |\n| result.parse_result_url | string | JSON 结果 BOS 链接（30天有效） |\n\n### 版面类型（24种）\n\n| 类型 | 说明 | 类型 | 说明 |\n|------|------|------|------|\n| text | 文本 | table | 表格 |\n| image | 图片 | chart | 图表 |\n| doc_title | 文档标题 | paragraph_title | 段落标题 |\n| figure_title | 图片标题 | display_formula | 公式 |\n| inline_formula | 行内公式 | formula_number | 公式编号 |\n| header | 页眉 | footer | 页脚 |\n| header_image | 页眉图片 | footer_image | 页脚图片 |\n| number | 页码 | abstract | 摘要 |\n| algorithm | 算法 | aside_text | 旁注文本 |\n| content | 目录 | footnote | 脚注 |\n| reference | 参考文献 | reference_content | 参考文献内容 |\n| seal | 印章 | vertical_text | 竖排文本 |\n\n## 相关文档\n\n- [官方 API 文档](https://ai.baidu.com/ai-doc/OCR/3mi73at9o)\n- [错误码参考](error_codes.md)\n- [API Key 配置指南](apikey-fetch.md)"}],"languages":[],"docsSourceLabel":"CLAWHUB","editorialOverview":"调用百度PaddleOCR-VL大模型API解析文档。基于PaddleOCR-VL-1.6多模态大模型，支持PDF、Word、PPT、图片等格式，精准识别印刷文本、手写文本、表格、公式、图表、印章等复杂元素，支持100+种语言，可处理不规则布局和长文档跨页解析。触发词：文档解析、VLM解析、大模型OCR、PaddleOCR、多模态文档、手写识别、公式识别、复杂版面。 Skill: 百度文档解析vlm-parser Owner: maglanyulan Summary: 调用百度PaddleOCR-VL大模型API解析文档。基于PaddleOCR-VL-1.6多模态大模型，支持PDF、Word、PPT、图片等格式，精准识别印刷文本、手写文本、表格、公式、图表、印章等复杂元素，支持100+种语言，可处理不规则布局和长文档跨页解析。触发词：文档解析、VLM解析、大模型OCR、PaddleOCR、多模态文档、手写识别、公式识别、复杂版面。 Tags: latest:1.0.5 Version history: v1.0.5 | 2026-09-17T11:16:24.084Z | user - Removed the file: skill-card.md - No functional changes to code or documentation observed in this versio","editorialQuality":{"score":100,"threshold":65,"status":"ready","wordCount":924,"uniquenessScore":50,"reasons":[]}},"media":{"evidence":{"source":"no-media","verified":false,"confidence":"low","updatedAt":"2026-10-11T06:19:36.184Z","emptyReason":"No screenshots, media assets, or demo links are available."},"primaryImageUrl":null,"mediaAssetCount":0,"assets":[],"demoUrl":null},"ownerResources":{"evidence":{"source":"unclaimed","verified":false,"confidence":"low","updatedAt":"2026-10-11T06:19:36.184Z","emptyReason":"This page has not been claimed by the agent owner."},"hasCustomPage":false,"customPageUpdatedAt":null,"customLinks":[],"structuredLinks":{"docsUrl":null,"demoUrl":null,"supportUrl":null,"pricingUrl":null,"statusUrl":null},"customPage":null},"relatedAgents":{"evidence":{"source":"protocol-neighbors","verified":false,"confidence":"medium","updatedAt":"2026-10-11T08:42:34.173Z","emptyReason":null},"items":[{"id":"8ebccd8e-3863-4187-8355-c3f14e1f9edf","entityType":"agent","canonicalPath":"/agent/iofficeai-aionui","slug":"iofficeai-aionui","name":"AionUi","description":"Free, local, open-source 24/7 Cowork app and OpenClaw for Gemini CLI, Claude Code, Codex, OpenCode, Qwen Code, Goose CLI, Auggie, and more | 🌟 Star if you like it!","url":"https://github.com/iOfficeAI/AionUi","homepage":"https://www.aionui.com","source":"GITHUB_REPOS","protocols":["MCP","OPENCLAW"],"capabilities":[],"safetyScore":100,"overallRank":70,"updatedAt":"2026-10-09T19:11:12.944Z","createdAt":"2026-02-25T03:38:16.584Z","downloads":null},{"id":"b917f68a-ebff-438e-84f8-3f4b2494c0bc","entityType":"agent","canonicalPath":"/agent/activepieces-activepieces","slug":"activepieces-activepieces","name":"activepieces","description":"AI Agents & MCPs & AI Workflow Automation • (~400 MCP servers for AI agents) • AI Automation / AI Agent with MCPs • AI Workflows & AI Agents • MCPs for AI Agents","url":"https://github.com/activepieces/activepieces","homepage":"https://www.activepieces.com","source":"GITHUB_REPOS","protocols":["OPENCLAW"],"capabilities":[],"safetyScore":100,"overallRank":70,"updatedAt":"2026-04-15T02:22:12.426Z","createdAt":"2026-02-25T03:38:12.412Z","downloads":null},{"id":"5cb26759-3a39-483f-94cf-276a98c13bb8","entityType":"agent","canonicalPath":"/agent/cherryhq-cherry-studio","slug":"cherryhq-cherry-studio","name":"cherry-studio","description":"AI productivity studio with smart chat, autonomous agents, and 300+ assistants. Unified access to frontier LLMs","url":"https://github.com/CherryHQ/cherry-studio","homepage":"https://cherry-ai.com","source":"GITHUB_REPOS","protocols":["MCP","OPENCLAW"],"capabilities":[],"safetyScore":100,"overallRank":70,"updatedAt":"2026-04-11T14:38:40.986Z","createdAt":"2026-02-25T03:38:19.379Z","downloads":null},{"id":"6f6582d0-5d76-4f0f-b81d-86520247950b","entityType":"agent","canonicalPath":"/agent/copilotkit-copilotkit","slug":"copilotkit-copilotkit","name":"CopilotKit","description":"The Frontend for Agents & Generative UI. React + Angular","url":"https://github.com/CopilotKit/CopilotKit","homepage":"https://docs.copilotkit.ai","source":"GITHUB_REPOS","protocols":["OPENCLAW"],"capabilities":[],"safetyScore":100,"overallRank":70,"updatedAt":"2026-03-25T09:50:57.846Z","createdAt":"2026-02-25T03:39:14.617Z","downloads":null}],"links":{"hub":"/agent","source":"/agent/source/clawhub","protocols":[{"label":"OpenClaw","href":"/agent/protocol/openclew"}]}}}