{"id":"a66c2995-9196-42de-8344-bf6cde64ea37","entityType":"agent","slug":"clawhub-haoyiyong985-image-knowledge-converter","name":"Image Knowledge Converter","canonicalUrl":"https://www.xpersona.co/agent/clawhub-haoyiyong985-image-knowledge-converter","canonicalPath":"/agent/clawhub-haoyiyong985-image-knowledge-converter","generatedAt":"2026-10-11T14:15:09.171Z","source":"CLAWHUB","claimStatus":"UNCLAIMED","verificationTier":"NONE","summary":{"evidence":{"source":"editorial-content","verified":true,"confidence":"high","updatedAt":"2026-10-11T11:20:21.886Z","emptyReason":null},"description":"图片截图转知识库工具（OCR + AI）。触发词：第一次使用、配置图片工具、处理新图片 Skill: Image Knowledge Converter Owner: haoyiyong985 Summary: 图片截图转知识库工具（OCR + AI）。触发词：第一次使用、配置图片工具、处理新图片 Tags: latest:1.2.8, stable:1.2.7 Version history: v1.0.0 | 2026-07-12T09:03:28.775Z | auto - Removed the file skill-card.md. - No other user-facing changes. v1.2.8 | 2026-07-11T05:48:32.395Z | user image-knowledge-converter v1.2.8 - Added English documentation: README_EN.md - Added demo animation: assets/demo.gif","descriptionLabel":"Technical summary","evidenceSummary":"Capability contract not published. No trust telemetry is available yet. 1.1K downloads reported by the source. Last updated 10/11/2026.","installCommand":"clawhub skill install s177ypfpgdqaxv59njm2a6m56989wm4b:image-knowledge-converter","sourceUrl":"https://clawhub.ai/haoyiyong985/image-knowledge-converter","homepage":"https://clawhub.ai/haoyiyong985/skills/image-knowledge-converter","primaryLinks":[{"label":"View on ClawHub","url":"https://clawhub.ai/haoyiyong985/image-knowledge-converter","kind":"source"},{"label":"Homepage","url":"https://clawhub.ai/haoyiyong985/skills/image-knowledge-converter","kind":"homepage"}],"safetyScore":84,"overallRank":62,"popularityScore":61,"trustScore":null,"claimedByName":null,"isOwner":false,"seoDescription":"图片截图转知识库工具（OCR + AI）。触发词：第一次使用、配置图片工具、处理新图片 Skill: Image Knowledge Converter Owner: haoyiyong985 Summary: 图片截图转知识库工具（OCR + AI）。触发词：第一次使用、配置图片工具、处理新图片 Tags: late"},"coverage":{"evidence":{"source":"public-profile","verified":false,"confidence":"medium","updatedAt":"2026-10-11T11:20:21.886Z","emptyReason":null},"protocols":[{"protocol":"OPENCLEW","label":"OpenClaw","status":"self-declared","notes":"Declared in the public agent profile."}],"capabilities":[],"verifiedCount":0,"selfDeclaredCount":1,"capabilityMatrix":{"rows":[{"key":"OPENCLEW","type":"protocol","support":"unknown","confidenceSource":"profile","notes":"Listed on profile"}],"flattenedTokens":"protocol:OPENCLEW|unknown|profile"}},"adoption":{"evidence":{"source":"CLAWHUB","verified":false,"confidence":"medium","updatedAt":"2026-10-11T11:20:21.886Z","emptyReason":null},"stars":null,"forks":null,"downloads":1078,"packageName":null,"latestVersion":"1.0.0","tractionLabel":"1.1K downloads"},"release":{"evidence":{"source":"CLAWHUB","verified":false,"confidence":"medium","updatedAt":"2026-10-11T11:20:21.814Z","emptyReason":null},"lastUpdatedAt":"2026-10-11T11:20:21.886Z","lastCrawledAt":"2026-10-11T11:20:21.814Z","lastIndexedAt":null,"nextCrawlAt":"2026-10-12T11:20:21.814Z","lastVerifiedAt":null,"highlights":[{"version":"1.0.0","createdAt":"2026-07-12T09:03:28.775Z","changelog":"- Removed the file skill-card.md. - No other user-facing changes.","fileCount":30,"zipByteSize":92234},{"version":"1.2.8","createdAt":"2026-07-11T05:48:32.395Z","changelog":"image-knowledge-converter v1.2.8 - Added English documentation: README_EN.md - Added demo animation: assets/demo.gif - Removed: skill-card.md - No changes to user-facing workflow or core functionality","fileCount":30,"zipByteSize":92205},{"version":"1.2.7","createdAt":"2026-07-04T08:44:21.903Z","changelog":"Version 1.2.7 - Major update with 27 files added, including README, multiple configuration, documentation, and utility scripts. - Added image processing scripts for Baidu and Tencent OCR, and local OCR support. - Introduced modular configuration files (api_keys, categories, processing rules) and setup wizard. - Expanded documentation and quick start guides for better user onboarding. - Removed the skill-card.md file; SKILL.md content was refined and updated. - Overall workflow improved to streamline setup, configuration, and multi-engine OCR processing.","fileCount":30,"zipByteSize":86067},{"version":"0.1.1","createdAt":"2026-07-04T03:06:27.998Z","changelog":"No changes detected in this version (0.1.1).","fileCount":3,"zipByteSize":4984},{"version":"0.1.0","createdAt":"2026-07-04T03:04:55.565Z","changelog":"image-knowledge-converter v1.2.7 - 修复混元云服务 TC3-HMAC-SHA256 签名算法问题，添加 x-tc-action 到签名头部 - 更改默认 Content-Type 为 application/json; charset=utf-8，符合腾讯云 API 要求 - 移除 tencentcloud-sdk-python-v3 依赖，仅需安装 requests 库 - SKILL.md 及配置流程说明优化","fileCount":3,"zipByteSize":4837}]},"execution":{"evidence":{"source":"CLAWHUB","verified":false,"confidence":"low","updatedAt":null,"emptyReason":"No published capability contract is available yet."},"installCommand":"clawhub skill install s177ypfpgdqaxv59njm2a6m56989wm4b:image-knowledge-converter","setupComplexity":"low","setupSteps":["Setup complexity is LOW. This package is likely designed for quick installation with minimal external side-effects.","Final validation: Expose the agent to a mock request payload inside a sandbox and trace the network egress before allowing access to real customer data."],"contract":{"contractStatus":"missing","authModes":[],"requires":[],"forbidden":[],"supportsMcp":false,"supportsA2a":false,"supportsStreaming":false,"inputSchemaRef":null,"outputSchemaRef":null,"dataRegion":null,"contractUpdatedAt":null,"sourceUpdatedAt":null,"freshnessSeconds":null},"invocationGuide":{"preferredApi":{"snapshotUrl":"https://www.xpersona.co/api/v1/agents/clawhub-haoyiyong985-image-knowledge-converter/snapshot","contractUrl":"https://www.xpersona.co/api/v1/agents/clawhub-haoyiyong985-image-knowledge-converter/contract","trustUrl":"https://www.xpersona.co/api/v1/agents/clawhub-haoyiyong985-image-knowledge-converter/trust"},"curlExamples":["curl -s \"https://www.xpersona.co/api/v1/agents/clawhub-haoyiyong985-image-knowledge-converter/snapshot\"","curl -s \"https://www.xpersona.co/api/v1/agents/clawhub-haoyiyong985-image-knowledge-converter/contract\"","curl -s \"https://www.xpersona.co/api/v1/agents/clawhub-haoyiyong985-image-knowledge-converter/trust\""],"jsonRequestTemplate":{"query":"summarize this repo","constraints":{"maxLatencyMs":2000,"protocolPreference":["OPENCLEW"]}},"jsonResponseTemplate":{"ok":true,"result":{"summary":"...","confidence":0.9},"meta":{"source":"CLAWHUB","generatedAt":"2026-10-11T14:15:09.167Z"}},"retryPolicy":{"maxAttempts":3,"backoffMs":[500,1500,3500],"retryableConditions":["HTTP_429","HTTP_503","NETWORK_TIMEOUT"]}},"endpoints":{"dossierUrl":"https://www.xpersona.co/api/v1/agents/clawhub-haoyiyong985-image-knowledge-converter/dossier","snapshotUrl":"https://www.xpersona.co/api/v1/agents/clawhub-haoyiyong985-image-knowledge-converter/snapshot","contractUrl":"https://www.xpersona.co/api/v1/agents/clawhub-haoyiyong985-image-knowledge-converter/contract","trustUrl":"https://www.xpersona.co/api/v1/agents/clawhub-haoyiyong985-image-knowledge-converter/trust"}},"reliability":{"evidence":{"source":"runtime-metrics","verified":false,"confidence":"low","updatedAt":null,"emptyReason":"No trust, reliability, or runtime telemetry is available."},"trust":{"status":"unavailable","handshakeStatus":"UNKNOWN","verificationFreshnessHours":null,"reputationScore":null,"p95LatencyMs":null,"successRate30d":null,"fallbackRate":null,"attempts30d":null,"trustUpdatedAt":null,"trustConfidence":"unknown","sourceUpdatedAt":null,"freshnessSeconds":null},"decisionGuardrails":{"doNotUseIf":["Contract metadata is missing or unavailable for deterministic execution."],"safeUseWhen":[],"riskFlags":["missing_or_unavailable_contract","trust_data_unavailable","schema_references_missing"],"operationalConfidence":"low"},"executionMetrics":{"observedLatencyMsP50":null,"observedLatencyMsP95":null,"estimatedCostUsd":null,"uptime30d":null,"rateLimitRpm":null,"rateLimitBurst":null,"lastVerifiedAt":null,"verificationSource":null},"runtimeMetrics":{"successRate":null,"avgLatencyMs":null,"avgCostUsd":null,"hallucinationRate":null,"retryRate":null,"disputeRate":null,"p50Latency":null,"p95Latency":null,"lastUpdated":null}},"benchmarks":{"evidence":{"source":"no-benchmark-data","verified":false,"confidence":"low","updatedAt":null,"emptyReason":"No benchmark suites or observed failure patterns are available."},"suites":[],"failurePatterns":[]},"artifacts":{"evidence":{"source":"CLAWHUB","verified":false,"confidence":"high","updatedAt":"2026-10-11T11:20:21.886Z","emptyReason":null},"readme":"Skill: Image Knowledge Converter\n\nOwner: haoyiyong985\n\nSummary: 图片截图转知识库工具（OCR + AI）。触发词：第一次使用、配置图片工具、处理新图片\n\nTags: latest:1.2.8, stable:1.2.7\n\nVersion history:\n\nv1.0.0 | 2026-07-12T09:03:28.775Z | auto\n\n- Removed the file skill-card.md.\n- No other user-facing changes.\n\nv1.2.8 | 2026-07-11T05:48:32.395Z | user\n\nimage-knowledge-converter v1.2.8\n\n- Added English documentation: README_EN.md\n- Added demo animation: assets/demo.gif\n- Removed: skill-card.md\n- No changes to user-facing workflow or core functionality\n\nv1.2.7 | 2026-07-04T08:44:21.903Z | auto\n\nVersion 1.2.7\n\n- Major update with 27 files added, including README, multiple configuration, documentation, and utility scripts.\n- Added image processing scripts for Baidu and Tencent OCR, and local OCR support.\n- Introduced modular configuration files (api_keys, categories, processing rules) and setup wizard.\n- Expanded documentation and quick start guides for better user onboarding.\n- Removed the skill-card.md file; SKILL.md content was refined and updated.\n- Overall workflow improved to streamline setup, configuration, and multi-engine OCR processing.\n\nv0.1.1 | 2026-07-04T03:06:27.998Z | auto\n\nNo changes detected in this version (0.1.1).\n\nv0.1.0 | 2026-07-04T03:04:55.565Z | auto\n\nimage-knowledge-converter v1.2.7\n\n- 修复混元云服务 TC3-HMAC-SHA256 签名算法问题，添加 x-tc-action 到签名头部\n- 更改默认 Content-Type 为 application/json; charset=utf-8，符合腾讯云 API 要求\n- 移除 tencentcloud-sdk-python-v3 依赖，仅需安装 requests 库\n- SKILL.md 及配置流程说明优化\n\nArchive index:\n\nArchive v1.0.0: 30 files, 92234 bytes\n\nFiles: assets/SCREENSHOTS_GUIDE.md (3707b), auto_process_all_v9_4.py (104708b), baidu_ocr.py (4622b), config/api_keys_template.txt (4666b), config/api_keys.yaml (465b), config/categories.yaml (6342b), config/config.yaml (1604b), config/processing_config.yaml (1039b), config/processing_rules.yaml (3071b), docs/first-batch-results.txt (3496b), docs/installation.md (3450b), docs/multi-engine-ocr.md (4723b), docs/ocr-fallback.md (3793b), docs/quick-start.md (5871b), docs/switch-model-guide.md (4699b), docs/usage.md (6106b), local_ocr.py (1726b), quick_setup.py (3681b), README_EN.md (17158b), README.md (16811b), references/usage-guide.md (1361b), requirements_full.txt (321b), requirements_min.txt (224b), requirements.txt (660b), setup_wizard.py (30130b), skill-card.md (2473b), SKILL.md (8268b), tencent_ocr.py (7789b), wizard_processor.py (12184b), _meta.json (144b)\n\nFile v1.0.0:SKILL.md\n\n---\r\nname: image-knowledge-converter\r\ndescription: \"图片截图转知识库工具（OCR + AI）。触发词：第一次使用、配置图片工具、处理新图片\"\r\nversion: 1.2.8\r\ntags: [image-processing, ocr, knowledge-management]\r\n---\r\n\r\n# 🔧 执行指令\r\n\r\n**配置向导触发词：**\r\n当用户说 `第一次使用` / `第一次使用图片处理工具` / `配置图片工具` 时，**AI 启动对话式配置向导**。\r\n\r\n**处理图片触发词：**\r\n当用户说 `处理新图片` / `截图转文档` / `整理截图` 时（这三个触发词等价，均执行相同的处理流程），执行：\r\n\r\n**自动检测工作目录**（优先从以下路径检测）：\r\n1. 命令行参数 `--work-dir <路径>`\r\n2. 环境变量 `WORK_DIR`\r\n3. 脚本所在目录（兜底）\r\n\r\n```\r\n# 方式1：显式指定工作目录（推荐）\r\npython auto_process_all_v9_4.py --work-dir \"D:\\WorkBuddy-Projects\\图片知识库\"\r\n\r\n# 方式2：在工作目录中直接运行\r\ncd \"D:\\WorkBuddy-Projects\\图片知识库\"\r\npython auto_process_all_v9_4.py\r\n\r\n# 方式3：使用环境变量\r\nset WORK_DIR=D:\\WorkBuddy-Projects\\图片知识库\r\npython auto_process_all_v9_4.py\r\n```\r\n\r\n---\r\n\r\n## 📋 对话式配置向导（5步）\r\n\r\n**安全原则：API 密钥不通过对话传递，用户直接在本地模板文件中填写。**\r\n\r\n### 第1步：AI 询问工作文件夹位置\r\n\r\n当用户说\"第一次使用\"时，AI 先询问用户想把工具安装到哪个文件夹：\r\n\r\n```\r\n🤖 我来帮你完成配置！首先需要确定工作文件夹位置。\r\n\r\n这个文件夹将用来存放：\r\n• 你的待处理图片\r\n• 生成的文档\r\n• 配置文件\r\n\r\n请告诉我你想使用的文件夹路径，例如：\r\n  D:\\图片知识库\r\n  或桌面上的任意位置\r\n\r\n（直接回车将使用默认位置）\r\n```\r\n\r\n> **关键**：工作文件夹由用户指定，不是写死的路径。\r\n\r\n### 第2步：AI 创建配置模板\r\n\r\nAI 在用户指定的工作文件夹下创建配置模板：\r\n```\r\n{工作文件夹}\\config\\api_keys_template.txt\r\n```\r\n\r\n### 第3步：AI 引导用户填写\r\n\r\nAI 告诉用户：\r\n```\r\n✅ 配置模板已创建！\r\n\r\n📝 请打开文件并填写配置：\r\n   {工作文件夹}\\config\\api_keys_template.txt\r\n\r\n【填写说明】\r\n\r\n1️⃣  OCR 模式（必选一项，删除前面的 # 启用）：\r\n    # OCR_MODE: cloud    ← 云端方案（腾讯+百度）\r\n    # OCR_MODE: local     ← 本地方案（Tesseract）\r\n    # OCR_MODE: hybrid    ← 兜底方案（云端+本地）\r\n\r\n2️⃣  填写 API 密钥（根据上一步选择填写）：\r\n    - 腾讯云 SecretId/SecretKey\r\n    - 百度云 API Key/Secret Key\r\n    - 或启用 use_tesseract: true\r\n\r\n3️⃣  LLM 配置（如需 AI 智能分析）：\r\n    # 注意：混元(Hunyuan)使用与腾讯云OCR相同的密钥，无需单独配置\r\n    # 如需使用其他LLM，请参考代码中的配置项\r\n    llm_enabled: true\r\n    llm_provider: hunyuan\r\n\r\n4️⃣  IMA 同步（如需自动同步到 IMA，必须改为 true）：\r\n    # 启用：将下方 false 改为 true，并填写 client_id 和 api_key\r\n    # 获取方法：IMA 设置 → API → 创建新的 API Key\r\n    ima_enabled: true          ← 必须改为 true 才能启用\r\n    ima_api_key: 你的API密钥\r\n    ima_client_id: 你的ClientID\r\n\r\n5️⃣  填写完成后保存文件，然后对我说「配置已填写完毕」\r\n```\r\n\r\n### 第4步：AI 处理配置\r\n\r\n用户说「配置已填写完毕后」，AI 自动：\r\n```\r\n# 运行配置处理器（自动检测工作目录）\r\npython wizard_processor.py\r\n\r\n# 或显式指定工作目录\r\npython wizard_processor.py --work-dir \"D:\\WorkBuddy-Projects\\图片知识库\"\r\n```\r\n1. wizard_processor.py 读取模板\r\n2. 生成 `config/api_keys.yaml`\r\n3. 验证配置并显示摘要\r\n\r\n### 第5步：放入图片并处理\r\n\r\n```\r\n✅ 配置完成！\r\n\r\n📁 请把图片放入：\r\n   {工作文件夹}\\待处理图片\r\n\r\n然后对我说「处理新图片」\r\n```\r\n\r\n---\r\n\r\n## 🚀 快速上手\r\n\r\n### 首次使用\r\n1. 说 `第一次使用图片处理工具`\r\n2. AI 创建配置模板\r\n3. 用户直接编辑模板文件（密钥不在对话框中）\r\n4. 用户说「配置已填写完毕」\r\n5. AI 处理配置并验证\r\n6. 放入图片，说「处理新图片」\r\n\r\n### 日常使用\r\n1. 把图片放入 `待处理图片\\`\r\n2. 说「处理新图片」\r\n\r\n---\r\n\r\n## 触发词\r\n\r\n**首次配置（启动向导）：**\r\n- `第一次使用`\r\n- `第一次使用图片处理工具`\r\n- `配置图片工具`\r\n- `首次配置`\r\n\r\n**开始处理（运行脚本）：**\r\n- `处理新图片`\r\n- `截图转文档`\r\n- `整理截图`\r\n\r\n---\r\n\r\n## 目录结构\r\n\r\n```\r\n{工作文件夹}\\           ← 所有文件都在用户指定的工作目录下\r\n├── auto_process_all_v9_4.py ← 主处理脚本（V9.5 支持 --work-dir）\r\n├── wizard_processor.py     ← 配置处理器\r\n├── setup_wizard.py          ← 交互式配置向导（可选）\r\n├── config\\\r\n│   ├── api_keys_template.txt  ← 用户在此填写（本地）\r\n│   └── api_keys.yaml          ← 自动生成\r\n├── 待处理图片\\\r\n├── 已处理图片\\\r\n├── 处理结果\\\r\n│   ├── *.md                  ← 生成的 Markdown 文档\r\n│   ├── *.docx                ← 生成的 Word 文档\r\n│   ├── process.log           ← 运行日志\r\n│   └── 处理报告.json         ← 处理统计报告\r\n└── progress\\                 ← 分批处理状态（自动创建）\r\n```\r\n\r\n---\r\n\r\n## 版本历史\r\n\r\n**v1.2.7 (2026-05-20)**\r\n- ✅ **混元签名修复**：修复 TC3-HMAC-SHA256 签名算法，添加 `x-tc-action` 到 CanonicalHeaders 和 SignedHeaders\r\n- ✅ **Content-Type 修复**：改为 `application/json; charset=utf-8` 与腾讯云官方一致\r\n- ✅ **SDK 依赖移除**：无需安装 `tencentcloud-sdk-python-v3`，只需 `requests` 库\r\n\r\n**v1.2.6 (2026-05-20)**\r\n- ✅ **SDK 依赖移除**：改用腾讯云 REST API 调用混元 LLM，无需安装 `tencentcloud-sdk-python-v3`\r\n- ✅ **混元调用优化**：使用 TC3-HMAC-SHA256 签名认证，与其他 LLM（硅基流动/Kimi/Doubao）一样只需 `requests` 库\r\n- ✅ **LLM 说明优化**：SKILL.md 明确说明混元使用与腾讯云OCR相同的密钥，无需单独配置\r\n- ✅ **配置文件修复**：重新生成 api_keys.yaml 确保嵌套结构正确\r\n\r\n**v1.2.5 (2026-05-20)**\r\n- ✅ **IMA 解析修复**：wizard_processor.py 现在同时支持注释和无注释格式的 `ima_enabled`\r\n- ✅ **模板解析修复**：优先用冒号分隔（支持 base64 值中含 `=` 的情况）\r\n- ✅ **IMA 模板优化**：api_keys_template.txt 中 IMA 配置说明更清晰，明确标注\"必须改为 true\"\r\n- ✅ **SKILL.md 更新**：配置向导第3步中 IMA 配置说明更详细\r\n\r\n**v1.2.4 (2026-05-20)**\r\n- ✅ **核心修复**：`auto_process_all_v9_4.py` 支持 `--work-dir` 命令行参数指定工作目录\r\n- ✅ **路径统一**：所有路径引用（配置/输入/输出/日志）改为基于工作目录，不再依赖脚本所在目录\r\n- ✅ **向后兼容**：不指定工作目录时，自动使用脚本所在目录（保持原有行为）\r\n\r\n**v1.2.3 (2026-05-20)**\r\n- ✅ **路径修复**：`wizard_processor.py` 的 `get_work_folder()` 不再硬编码默认路径，改为动态检测脚本目录\r\n- ✅ **路径修复**：`SKILL.md` 移除所有硬编码示例路径，改为 `{工作文件夹}` 占位符\r\n- ✅ **流程优化**：配置向导明确要求 AI 先询问用户指定工作文件夹位置\r\n\r\n**v1.2.2 (2026-05-20)**\r\n- ✅ **安全升级**：API 密钥完全不在对话中传输，用户直接编辑本地模板文件\r\n- ✅ **流程优化**：从 6 步优化为 5 步（新增第1步：AI 询问用户指定工作文件夹）\r\n- ✅ **IMA 修复**：修复了 IMA 配置无法加载的问题（添加 client_id 支持）\r\n- ✅ **OCR 新增 C 兜底选项**\r\n\r\n**v1.2.1 (2026-05-20)**\r\n- ✅ **安全升级**：API 密钥统一写入模板文件后由系统处理\r\n- ✅ **OCR 新增兜底方案**：A（云端）、B（本地）、C（A+B 兜底）\r\n- ✅ **自动验证配置**\r\n\r\n**v1.2.0 (2026-05-10)**\r\n- ✅ 重构为对话式配置向导\r\n\r\n**v1.1.0 (2026-04-27)**\r\n- ✅ 初始版本\n\nFile v1.0.0:README.md\n\n# 📚 图片知识库整理工具 (Image Knowledge Converter)\r\n\r\n> 自动将手机截图转换为结构化 Word + Markdown 知识文档，并同步到 IMA 个人笔记  \r\n> **新用户第一次使用会自动启动向导，无需任何技术背景！**\r\n\r\n[![GitHub license](https://img.shields.io/badge/license-MIT-blue.svg)](LICENSE)\r\n[![GitHub stars](https://img.shields.io/github/stars/haoyiyong985/image-knowledge-converter?style=social)](https://github.com/haoyiyong985/image-knowledge-converter)\r\n[![WorkBuddy](https://img.shields.io/badge/WorkBuddy-Skill-green)](https://workbuddy.ai)\r\n\r\n🌐 [中文](README.md) | [English](README_EN.md)\r\n\r\n---\r\n\r\n## 🌟 项目简介\r\n\r\n**图片知识库整理工具** 是一个智能知识管理助手，能够：\r\n\r\n- 📷 **自动识别**：从手机截图（小红书、微信读书、微信等）中提取文字\r\n- 🏷️ **智能分类**：AI 理解内容并自动分类到对应知识主题\r\n- 📝 **生成文档**：输出结构化 Word + Markdown 双格式文档\r\n- 🔗 **自动归档**：按分类整理图片和文档\r\n- 🔄 **内容合并**：相似主题自动合并，避免重复\r\n- ☁️ **云端同步**：一键同步到 IMA 个人笔记\r\n\r\n---\r\n\r\n## ✨ 功能特点\r\n\r\n### 核心功能\r\n\r\n| 功能 | 说明 |\r\n|------|------|\r\n| **OCR 多引擎** | 腾讯云 → 百度云 → 本地 Tesseract（自动降级） |\r\n| **AI 智能分类** | 动态分类体系，支持自由命名和自动新建分类 |\r\n| **文档合并** | 同主题内容自动合并到同一文档 |\r\n| **双格式输出** | 同时生成 `.docx` 和 `.md` 文件 |\r\n| **IMA 同步** | 自动同步到 IMA 笔记（支持增量更新）|\r\n| **分批处理** | 大批量图片智能分批，支持断点续传 |\r\n| **重复检测** | Hash + 主题词相似度双重检测 |\r\n| **新手向导** | 🆕 首次使用自动引导配置，无需技术背景 |\r\n\r\n### 技术亮点\r\n\r\n- ✅ **LLM 全覆盖**：混元 Lite / Kimi / Doubao 多模型兜底\r\n- ✅ **智能命名**：`{分类}-{主题}`，如 `历史文化-钱谦益传`\r\n- ✅ **内容整理**：自动修复 OCR 错误、结构化排版\r\n- ✅ **来源提取**：自动识别小红书、微信等平台来源\r\n- ✅ **新手向导**：第一次使用自动启动交互式配置向导\r\n\r\n---\r\n\r\n## 🚀 快速开始（三步走）\r\n\r\n> **无需选择安装方式！** 无论你用哪种方式安装，第一次运行时都会自动启动**新手向导**，一步步引导你完成配置。\r\n\r\n### 第一步：选择安装方式（任选一种）\r\n\r\n#### 方式 A：WorkBuddy Skill（最简单 ⭐）\r\n\r\n**适合人群**：有 WorkBuddy 账号，想一键使用\r\n\r\n1. 下载 Release 中的 `image-knowledge-converter_v1.1.0_skill.zip`\r\n2. 打开 WorkBuddy → 右上角头像 → **Skills 管理**\r\n3. 点击「导入 Skills」→ 选择下载的 zip → 「立即导入」\r\n4. **对 WorkBuddy 说**：`第一次使用` 或 `初始化`\r\n5. ✅ 向导自动启动，引导你完成配置（约 2 分钟）\r\n\r\n#### 方式 B：完整包（适合自定义 ⭐）\r\n\r\n**适合人群**：想完全控制，或没有 WorkBuddy\r\n\r\n1. 下载 Release 中的 `tupianzhengligongju_wanzheng_v1.1.0.zip`\r\n2. 解压到你想放的位置（如 `D:\\我的图片知识库`）\r\n3. 打开终端，进入解压目录\r\n4. 运行：`python setup_wizard.py`\r\n5. ✅ 向导自动启动，引导你完成配置（约 2 分钟）\r\n\r\n#### 方式 C：Git 克隆（适合开发者）\r\n\r\n**适合人群**：熟悉 Git 和命令行\r\n\r\n```bash\r\ngit clone https://github.com/haoyiyong985/image-knowledge-converter.git\r\ncd image-knowledge-converter\r\npip install -r requirements.txt\r\npython setup_wizard.py   # ← 启动向导\r\n```\r\n\r\n---\r\n\r\n### 第二步：新手向导（自动启动）\r\n\r\n无论你用哪种方式安装，**第一次运行都会看到这个向导**（不会跳过）：\r\n\r\n```\r\n==================================================\r\n  欢迎使用 图片知识库整理工具！\r\n  我是你的智能助手，第一次使用我来帮你完成配置\r\n  只需 3 步，大概 2 分钟\r\n\r\n  如果你有任何问题，随时问我！\r\n==================================================\r\n```\r\n\r\n#### 向导流程（3 步，约 2 分钟）\r\n\r\n**第 1 步：选择工作文件夹**\r\n```\r\n  步骤 1：选择工作文件夹\r\n  ℹ️ 这是存放图片和生成文档的地方。\r\n  \r\n  建议使用：D:\\Users\\你的用户名\\图片知识库\r\n  \r\n  是否使用默认位置？(y/n，直接回车=使用默认):\r\n```\r\n\r\n- 选 `y` → 自动创建默认文件夹\r\n- 选 `n` → 输入自定义路径（如 `D:\\我的图片库`）\r\n\r\n**第 2 步：配置 OCR 服务（选一个就行）**\r\n```\r\n  步骤 2：配置 OCR 识别服务\r\n  ℹ️ 你需要至少一个 OCR 服务来识别图片中的文字。\r\n  \r\n  请选择 OCR 服务（选一个就行）：\r\n    1. 腾讯云 OCR（推荐，每月免费 1000 次）\r\n      识别率高，免费额度充足\r\n    2. 百度云 OCR（免费，需实名）\r\n      免费额度大，适合大量使用\r\n    3. 本地 Tesseract（完全免费）\r\n      无需联网，但识别率较低\r\n      \r\n  请输入选项编号 (1-3):\r\n```\r\n\r\n- **选 1（腾讯云）** → 向导显示图文教程 → 你填入 `config/api_keys_template.txt` → 向导自动读取并生成配置\r\n- **选 2（百度云）** → 向导显示图文教程 → 你填入 `config/api_keys_template.txt` → 向导自动读取并生成配置\r\n- **选 3（本地）** → 向导提示安装 Tesseract → 配置完成\r\n\r\n**第 3 步：创建文件夹结构**\r\n```\r\n  步骤 3：创建文件夹结构\r\n  ✅ 已创建文件夹：待处理图片\r\n  ✅ 已创建文件夹：已处理图片\r\n  ✅ 已创建文件夹：处理结果\r\n  \r\n  ✅ 配置已保存到 config/api_keys.yaml\r\n```\r\n\r\n**第 4 步（可选）：配置 IMA 同步**\r\n```\r\n  （可选）配置 IMA 同步\r\n  ℹ️ IMA 是一个笔记服务，可以自动同步你生成的文档。\r\n  ℹ️ 如果你不用 IMA，可以直接跳过。\r\n  \r\n  是否配置 IMA 同步？(y/n):\r\n```\r\n\r\n- 选 `y` → 向导提示获取 IMA API Key → 你填入 `config/api_keys_template.txt` → 向导自动读取并生成配置\r\n- 选 `n` → 跳过，随时可以重新运行向导添加\r\n\r\n**完成！**\r\n```\r\n==================================================\r\n  🎉 配置完成！\r\n==================================================\r\n  \r\n  接下来你可以：\r\n  1. 把要处理的图片放到「待处理图片」文件夹里\r\n  2. 运行：python auto_process_all_v9_4.py\r\n  3. 等待处理完成，结果在「处理结果」文件夹里\r\n```\r\n\r\n---\r\n\r\n### 第三步：放入图片，开始处理\r\n\r\n#### 如果使用 WorkBuddy Skill（方式 A）\r\n\r\n1. 把图片放到：`你的工作文件夹\\待处理图片\\`\r\n2. 对 WorkBuddy 说：`处理新图片`\r\n3. 等待处理完成（约 3-5 秒/张）\r\n4. 结果在：`你的工作文件夹\\处理结果\\`\r\n\r\n#### 如果本地运行（方式 B 或 C）\r\n\r\n1. 把图片放到：`你的工作文件夹\\待处理图片\\`\r\n2. 运行：`python auto_process_all_v9_4.py`\r\n3. 等待处理完成（约 3-5 秒/张）\r\n4. 结果在：`你的工作文件夹\\处理结果\\`\r\n\r\n---\r\n\r\n## 📖 使用指南\r\n\r\n### 目录结构\r\n\r\n```\r\n图片知识库\\\r\n├── auto_process_all_v9_4.py   ← 主处理脚本（V9.5 逻辑）\r\n├── setup_wizard.py            ← 新手向导脚本\r\n├── requirements.txt\r\n├── config\\\r\n│   └── api_keys.yaml        ← OCR/IMA 配置（向导自动生成）\r\n├── 待处理图片\\                ← 放入待处理图片\r\n│   ├── 健康养生\\\r\n│   ├── 旅行记录\\\r\n│   └── ...\r\n├── 已处理图片\\                ← 处理完的图片自动归档\r\n└── 处理结果\\                  ← 生成的 Word/Markdown 文档\r\n    ├── 历史文化-钱谦益传.docx\r\n    ├── 历史文化-钱谦益传.md\r\n    └── ...\r\n```\r\n\r\n### 日常使用流程\r\n\r\n#### 第 1 步：放入新图片\r\n\r\n把手机截图复制到 `待处理图片` 文件夹（支持子文件夹分类）：\r\n\r\n```\r\n待处理图片\\健康养生\\  ← 健康类图片\r\n待处理图片\\旅行记录\\  ← 旅行类图片\r\n```\r\n\r\n#### 第 2 步：启动处理\r\n\r\n**WorkBuddy 用户**：\r\n```\r\n处理新图片\r\n```\r\n\r\n**本地用户**：\r\n```bash\r\npython auto_process_all_v9_4.py\r\n```\r\n\r\n#### 第 3 步：查看结果\r\n\r\n处理完成后，打开 `处理结果` 文件夹，你会看到：\r\n\r\n```\r\n处理结果\\\r\n├── 历史文化-钱谦益传.docx    ← Word 格式（可编辑）\r\n├── 历史文化-钱谦益传.md     ← Markdown 格式（纯文本）\r\n├── 营养健康-抗炎饮食.docx\r\n└── 营养健康-抗炎饮食.md\r\n```\r\n\r\n---\r\n\r\n## ⚙️ 配置说明\r\n\r\n### 密钥填写模板（安全改进 ⭐）\r\n\r\n**新用户注意**：为了保护你的 API 密钥安全，**不再需要把密钥发给 WorkBuddy**！\r\n\r\n我们采用 **本地 TXT 文件** 传递密钥：\r\n1. 向导会教你如何获取 API 密钥\r\n2. 你把密钥填入 `config/api_keys_template.txt`（有详细填写说明）\r\n3. 填好后保存，按回车继续\r\n4. 向导自动读取 TXT 文件，生成加密的 YAML 配置文件\r\n\r\n**优势**：\r\n- ✅ 密钥不会出现在聊天记录中\r\n- ✅ 密钥不会通过网络传输（除了正常的 API 调用）\r\n- ✅ 你可以在本地安全地编辑文件\r\n\r\nTXT 模板文件路径：`config/api_keys_template.txt`（向导会自动创建）\r\n\r\n---\r\n\r\n### API 密钥配置（向导自动完成）\r\n\r\n新手向导会在 `config/api_keys.yaml` 生成如下配置：\r\n\r\n```yaml\r\n# OCR 服务（至少配置一个）\r\nocr:\r\n  tencent:\r\n    secret_id: \"你的腾讯云 SecretId\"\r\n    secret_key: \"你的腾讯云 SecretKey\"\r\n  \r\n  # 或百度云\r\n  baidu:\r\n    api_key: \"你的百度云 API Key\"\r\n    secret_key: \"你的百度云 Secret Key\"\r\n\r\n# IMA 同步（可选，向导会问你要不要配置）\r\nima:\r\n  api_key: \"你的 IMA API Key\"\r\n  base_url: \"https://api.ima.tencent.com/v1\"\r\n```\r\n\r\n### 如何获取 API 密钥（向导会一步步教）\r\n\r\n| 服务 | 免费额度 | 获取地址 | 向导支持 |\r\n|------|----------|----------|----------|\r\n| 腾讯云 OCR | 1000次/月 | https://console.cloud.tencent.com/cam/capi | ✅ 图文教程 |\r\n| 百度云 OCR | 50000次/天 | https://console.bce.baidu.com/ | ✅ 图文教程 |\r\n| 本地 Tesseract | 完全免费 | https://github.com/UB-Mannheim/tesseract/wiki | ✅ 安装引导 |\r\n\r\n---\r\n\r\n## 📊 分类体系\r\n\r\n### 预设分类（可自动扩展）\r\n\r\n| 分类 | 说明 | 示例 |\r\n|------|------|------|\r\n| **历史文化** | 历史、人物传记、文化知识 | 钱谦益传、南宋历史 |\r\n| **营养健康** | 饮食、营养、健康知识 | 抗炎饮食、肠道健康 |\r\n| **生活方式** | 运动、睡眠、日常建议 | 日常饮食建议 |\r\n| **教育育儿** | 教育方法、育儿知识 | - |\r\n| **旅游攻略** | 旅行记录、景点介绍 | - |\r\n\r\n### 动态分类\r\n\r\n当内容不属于预设分类时，AI 会：\r\n1. 自动判断新主题名称\r\n2. 自由命名分类\r\n3. 创建新分类并归档\r\n\r\n**示例**：\r\n- 图片内容是关于「摄影技巧」→ AI 自动创建 `摄影技巧` 分类\r\n- 图片内容是关于「编程学习」→ AI 自动创建 `编程学习` 分类\r\n\r\n---\r\n\r\n## 💡 常用指令\r\n\r\n### WorkBuddy 用户\r\n\r\n在 WorkBuddy 对话中可以使用：\r\n\r\n| 指令 | 效果 |\r\n|------|------|\r\n| `第一次使用` 或 `初始化` | 启动新手向导（首次配置） |\r\n| `处理新图片` | 处理所有待处理图片 |\r\n| `处理待处理图片/健康养生` | 只处理指定文件夹的图片 |\r\n| `查看现有文档` | 列出所有文档和章节列表 |\r\n| `重新配置` | 重新运行向导更新配置 |\r\n\r\n### 本地用户\r\n\r\n```bash\r\n# 启动新手向导（首次使用）\r\npython setup_wizard.py\r\n\r\n# 处理图片\r\npython auto_process_all_v9_4.py\r\n\r\n# 分批处理（大量图片）\r\npython auto_process_all_v9_4.py --batch\r\n\r\n# 查看进度\r\npython auto_process_all_v9_4.py --progress\r\n\r\n# 清除状态\r\npython auto_process_all_v9_4.py --clear\r\n```\r\n\r\n---\r\n\r\n## 📂 输出示例\r\n\r\n### 处理结果目录\r\n\r\n```\r\n处理结果\\\r\n├── 历史文化-钱谦益传.docx\r\n├── 历史文化-钱谦益传.md\r\n├── 历史文化-南宋历史概述.docx\r\n├── 历史文化-南宋历史概述.md\r\n└── ...\r\n```\r\n\r\n### 文档内容结构\r\n\r\n```markdown\r\n# 历史文化-钱谦益传\r\n\r\n## 一、生平简介\r\n（OCR 识别内容，AI 自动分段）\r\n\r\n## 二、主要成就\r\n（结构化整理）\r\n\r\n## 三、历史评价\r\n（自动分类归档）\r\n```\r\n\r\n---\r\n\r\n## 🔧 高级功能\r\n\r\n### 分批处理\r\n\r\n处理大量图片时，系统会自动分批：\r\n\r\n| 图片大小 | 每批数量 |\r\n|---------|---------|\r\n| < 500KB | 10 张/批 |\r\n| 500KB-2MB | 6 张/批 |\r\n| 2MB-5MB | 4 张/批 |\r\n| > 5MB | 2 张/批 |\r\n\r\n### 断点续传\r\n\r\n如果处理中断，可以恢复：\r\n\r\n```bash\r\npython auto_process_all_v9_4.py --batch\r\n```\r\n\r\n查看进度：\r\n\r\n```bash\r\npython auto_process_all_v9_4.py --progress\r\n```\r\n\r\n清除状态：\r\n\r\n```bash\r\npython auto_process_all_v9_4.py --clear\r\n```\r\n\r\n---\r\n\r\n## 🐛 常见问题\r\n\r\n### Q1：我是小白，能用好吗？\r\n\r\n**答**：完全可以！  \r\n- 第一次使用会自动启动**新手向导**，一步步教你配置\r\n- 只需 2 分钟，无需任何技术背景\r\n- 配置完成后，每次只需说\"处理新图片\"即可\r\n\r\n### Q2：OCR 识别失败怎么办？\r\n\r\n**解决**：\r\n1. 检查图片清晰度（建议分辨率 ≥ 150 DPI）\r\n2. 确认已配置腾讯云/百度云 OCR\r\n3. 安装本地 Tesseract 作为兜底\r\n\r\n### Q3：文档命名不符合预期？\r\n\r\n**解决**：\r\n- 文档命名格式：`{分类}-{主题}`\r\n- 这是 AI 自动生成的，符合内容主题\r\n- 如需自定义，可修改 `auto_process_all_v9_4.py` 中的命名规则\r\n\r\n### Q4：如何避免重复内容？\r\n\r\n**解决**：\r\n- 系统自动检测重复（Hash + 主题词相似度）\r\n- 重复图片会自动跳过\r\n\r\n### Q5：IMA 同步失败？\r\n\r\n**解决**：\r\n1. 检查 `config/api_keys.yaml` 中的 IMA 配置是否正确\r\n2. 确认凭证未过期\r\n3. 重新运行向导：`python setup_wizard.py`\r\n\r\n---\r\n\r\n## 📈 性能指标\r\n\r\n- **处理速度**：约 3-5 秒/张（取决于 OCR 引擎）\r\n- **识别准确率**：中文 90%+（腾讯云 OCR）\r\n- **支持格式**：JPG, PNG, WEBP, BMP\r\n- **输出格式**：Word (.docx) + Markdown (.md)\r\n\r\n---\r\n\r\n## 🛠️ 技术栈\r\n\r\n| 技术 | 用途 |\r\n|------|------|\r\n| **OCR** | 腾讯云、百度云、Tesseract |\r\n| **AI 分析** | 混元 Lite、Kimi、Doubao |\r\n| **文档生成** | python-docx |\r\n| **同步** | IMA OpenAPI |\r\n| **语言** | Python 3.8+ |\r\n\r\n---\r\n\r\n## 📄 文件说明\r\n\r\n### 核心脚本\r\n\r\n| 文件 | 说明 |\r\n|------|------|\r\n| `auto_process_all_v9_4.py` | 当前最新版本（V9.5 逻辑） |\r\n| `setup_wizard.py` | 🆕 新手向导脚本（首次使用自动启动） |\r\n| `ima_sync.py` | IMA 同步脚本 |\r\n| `classifier_engine.py` | 分类引擎 |\r\n\r\n### 配置文件\r\n\r\n| 文件 | 说明 |\r\n|------|------|\r\n| `config/api_keys.yaml` | OCR/IMA 凭证配置（向导自动生成） |\r\n| `requirements.txt` | Python 依赖列表 |\r\n| `.env` | 环境变量（不提交到 Git） |\r\n\r\n---\r\n\r\n## 🤝 贡献指南\r\n\r\n欢迎提交 Issue 和 Pull Request！\r\n\r\n1. Fork 本仓库\r\n2. 创建你的特性分支 (`git checkout -b feature/AmazingFeature`)\r\n3. 提交你的更改 (`git commit -m 'Add some AmazingFeature'`)\r\n4. 推送到分支 (`git push origin feature/AmazingFeature`)\r\n5. 打开一个 Pull Request\r\n\r\n---\r\n\r\n## 📝 更新日志\r\n\r\n### v1.1.0 (2026-04-27) 🆕\r\n\r\n- ✅ **内置新手向导**（首次使用自动引导配置）\r\n- ✅ 支持图文教程获取 API 密钥\r\n- ✅ 自动创建文件夹结构\r\n- ✅ 更新至 V9.5 处理逻辑\r\n- ✅ 删除\"综合知识\"兜底分类\r\n- ✅ 支持 LLM 自由命名分类\r\n- ✅ 新增 `setup_wizard.py` 向导脚本\r\n\r\n### v1.0.0 (2026-03-17)\r\n\r\n- ✅ 初始版本发布\r\n- ✅ 支持 OCR 识别（腾讯云、百度云、Tesseract）\r\n- ✅ AI 智能分类和文档合并\r\n- ✅ Word + Markdown 双格式输出\r\n- ✅ IMA 同步功能\r\n\r\n---\r\n\r\n## 📄 许可证\r\n\r\n本项目采用 MIT 许可证 - 查看 [LICENSE](LICENSE) 文件了解详情。\r\n\r\n---\r\n\r\n## 🙏 致谢\r\n\r\n- [WorkBuddy](https://workbuddy.ai) - AI 助手平台\r\n- [腾讯云 OCR](https://cloud.tencent.com/product/ocr) - OCR 服务\r\n- [百度云 OCR](https://ai.baidu.com/tech/ocr) - OCR 服务\r\n- [Tesseract](https://github.com/tesseract-ocr/tesseract) - 开源 OCR 引擎\r\n\r\n---\r\n\r\n## 📧 联系\r\n\r\n- GitHub Issues：[提交问题](https://github.com/haoyiyong985/image-knowledge-converter/issues)\r\n- 邮箱：（添加你的联系方式）\r\n\r\n---\r\n\r\n**⭐ 如果这个项目对你有帮助，请给它一个星标！**\n\nFile v1.0.0:_meta.json\n\n{\n  \"ownerId\": \"kn7fh9qe66jy2s283bfvw6b61d89w2cv\",\n  \"slug\": \"image-knowledge-converter\",\n  \"version\": \"1.0.0\",\n  \"publishedAt\": 1783847008775\n}\n\nFile v1.0.0:references/usage-guide.md\n\n# 图片知识库整理工具 - 使用指南\n\n## 快速开始\n\n### 1. 安装依赖\n```bash\npip install -r requirements.txt\n```\n\n### 2. 初始化\n运行脚本后选择「初始化知识库」，会自动创建：\n- `待处理图片/` - 放入待处理截图\n- `已处理图片/` - 自动归档\n- `处理结果/` - 生成的 Word/MD 文档\n\n### 3. 放入图片\n将截图放入 `待处理图片/<主题>/`，例如：\n```\n待处理图片/中医养生/截图1.png\n待处理图片/健康饮食/截图2.png\n```\n\n### 4. 开始处理\n```bash\npython auto_process_all_v9_4.py\n```\n\n---\n\n## 常用命令\n\n| 命令 | 说明 |\n|------|------|\n| `python auto_process_all_v9_4.py` | 处理所有待处理图片 |\n| 查看 `处理结果/` 目录 | 查看已生成的文档 |\n\n---\n\n## OCR 配置\n\n支持三种 OCR 引擎（自动降级）：\n1. 腾讯云 OCR（优先）\n2. 百度云 OCR（备用）\n3. 本地 Tesseract（兜底）\n\n配置方法见 `docs/multi-engine-ocr.md`\n\n---\n\n## IMA 同步（可选）\n\n1. 获取 IMA OpenAPI 凭证\n2. 编辑 `ima_config.txt` 填入凭证\n3. 运行脚本时会自动同步\n\n---\n\n## 常见问题\n\n**Q: 处理失败？**  \nA: 检查 `logs/` 目录中的日志文件。\n\n**Q: 如何切换 AI 模型？**  \nA: 参见 `docs/switch-model-guide.md`。\n\n**Q: 图片识别不准确？**  \nA: 确保图片清晰，或配置更强大的 OCR 引擎。\n\nFile v1.0.0:assets/SCREENSHOTS_GUIDE.md\n\n# 项目截图使用指南\n\n本目录用于存放项目截图和示例图片。\n\n## 📷 推荐的截图类型\n\n### 1. 产品界面截图\n| 截图名称 | 内容 | 用途 |\n|---------|------|------|\n| `screenshot_workbuddy_main.png` | WorkBuddy 主界面 | README 展示 |\n| `screenshot_skill_list.png` | Skills 列表（显示本技能） | 使用指南 |\n| `screenshot_import_skill.png` | 导入 Skill 界面 | 安装教程 |\n\n### 2. 操作步骤截图\n| 截图名称 | 内容 | 用途 |\n|---------|------|------|\n| `screenshot_init.png` | 初始化知识库 | 使用指南 |\n| `screenshot_folder_empty.png` | 空文件夹（待处理图片） | 使用指南 |\n| `screenshot_folder_with_images.png` | 放入图片后的文件夹 | 使用指南 |\n| `screenshot_processing.png` | AI 正在处理 | 使用指南 |\n| `screenshot_complete.png` | 处理完成提示 | 使用指南 |\n\n### 3. 文档效果截图\n| 截图名称 | 内容 | 用途 |\n|---------|------|------|\n| `screenshot_word_doc.png` | Word 文档效果 | README 展示 |\n| `screenshot_md_doc.png` | Markdown 文档效果 | README 展示 |\n| `screenshot_folder_structure.png` | 目录结构 | 使用指南 |\n\n### 4. 对比效果截图（用于推广）\n| 截图名称 | 内容 | 用途 |\n|---------|------|------|\n| `screenshot_before.png` | 原始截图（处理前） | 推广素材 |\n| `screenshot_after.png` | 整理后的文档（处理完） | 推广素材 |\n\n---\n\n## 📸 如何准备截图\n\n### Windows 截图方法\n\n#### 方法一：PrintScreen 键\n1. 按 `PrtSc` 键（全屏截图）\n2. 打开画图工具（Win + R → 输入 `mspaint`）\n3. 粘贴（Ctrl + V）\n4. 保存为 PNG 格式\n\n#### 方法二：Win + Shift + S（推荐）\n1. 按 `Win + Shift + S`\n2. 选择截图区域\n3. 截图自动复制到剪贴板\n4. 粘贴到文件并保存\n\n#### 方法三：使用 Snipaste（第三方工具）\n- 下载：https://www.snipaste.com/\n- 按 F1 截图，F3 贴图\n\n---\n\n## 📂 目录结构示例\n\n```\nassets/\n└── screenshots/\n    ├── 产品界面/\n    │   ├── workbuddy_main.png\n    │   ├── skill_list.png\n    │   └── import_skill.png\n    ├── 操作步骤/\n    │   ├── init.png\n    │   ├── folder_empty.png\n    │   ├── folder_with_images.png\n    │   ├── processing.png\n    │   └── complete.png\n    ├── 文档效果/\n    │   ├── word_doc.png\n    │   ├── md_doc.png\n    │   └── folder_structure.png\n    └── 对比效果/\n        ├── before.png\n        └── after.png\n```\n\n---\n\n## 📝 在 README.md 中添加截图\n\n准备好截图后，可以在 README.md 中添加以下部分：\n\n```markdown\n## 📸 效果展示\n\n### 处理前（原始截图）\n![处理前](assets/screenshots/对比效果/before.png)\n\n### 处理完（生成的文档）\n![处理完](assets/screenshots/对比效果/after.png)\n\n### Word 文档效果\n![Word 文档](assets/screenshots/文档效果/word_doc.png)\n\n### Markdown 文档效果\n![Markdown 文档](assets/screenshots/文档效果/md_doc.png)\n```\n\n---\n\n## 🚀 快速开始\n\n1. **准备截图**：按照上面的推荐清单拍摄\n2. **放入目录**：将截图文件放入 `assets/screenshots/` 对应子目录\n3. **提交到 Git**：\n   ```bash\n   git add assets/screenshots/\n   git commit -m \"docs: add project screenshots\"\n   git push origin master\n   ```\n4. **更新 README**：在 README.md 中添加截图展示部分\n\n---\n\n## 💡 提示\n\n- ✅ 使用 PNG 格式（清晰度更高）\n- ✅ 截图分辨率建议 1920x1080 或 1280x720\n- ✅ 确保截图中的文字清晰可读\n- ✅ 可以稍后补充，不影响项目正常使用\n\n---\n\n**祝你使用愉快！** 🎉\n\nFile v1.0.0:docs/installation.md\n\n# 📦 图片知识库转化工具 v1.0 - 安装说明\r\n\r\n---\r\n\r\n## ✅ Skill 已自动安装到你的电脑！\r\n\r\n### 安装位置\r\n```\r\nC:\\Users\\LENOVO\\.workbuddy\\skills\\image-knowledge-converter\\\r\n```\r\n\r\n---\r\n\r\n## 🚀 如何使用\r\n\r\n### 方法1：自动识别（推荐）\r\n\r\nWorkBuddy 会自动识别新安装的 Skill，你可以直接使用以下指令：\r\n\r\n```\r\n初始化知识库\r\n```\r\n```\r\n处理新图片\r\n```\r\n```\r\n处理待处理图片/主题名\r\n```\r\n```\r\n查看现有文档\r\n```\r\n```\r\n工具优化\r\n```\r\n\r\n### 方法2：手动触发\r\n\r\n如果自动识别失败，可以手动加载 Skill：\r\n\r\n1. 打开 WorkBuddy\r\n2. 点击右上角头像 → **Skills 管理**\r\n3. 找到 **图片知识库转化工具 (image-knowledge-converter)**\r\n4. 点击 **启用**\r\n\r\n---\r\n\r\n## 📁 文件位置说明\r\n\r\n### 你的项目文件\r\n```\r\nD:\\新建文件夹\\\r\n├── 待处理图片\\        ← 放新截图的文件夹\r\n├── 处理结果\\          ← 生成的文档在这里\r\n├── 已处理图片\\        ← 归档的图片\r\n├── ima_config.txt     ← ima 凭证配置\r\n└── auto_process.py    ← 核心处理脚本\r\n```\r\n\r\n### Skill 文件（已安装）\r\n```\r\nC:\\Users\\LENOVO\\.workbuddy\\skills\\\r\n└── image-knowledge-converter\\\r\n    └── SKILL.md       ← WorkBuddy 会自动读取\r\n```\r\n\r\n---\r\n\r\n## 🧪 开始测试\r\n\r\n按照以下步骤测试 Skill 是否正常工作：\r\n\r\n### 第1步：准备测试图片\r\n\r\n在 `D:\\新建文件夹\\待处理图片\\` 下创建测试文件夹，例如：\r\n\r\n```\r\nD:\\新建文件夹\\待处理图片\\测试\\\r\n```\r\n\r\n放入 2-3 张手机截图\r\n\r\n### 第2步：初始化知识库\r\n\r\n在 WorkBuddy 中输入：\r\n\r\n```\r\n初始化知识库\r\n```\r\n\r\n### 第3步：处理图片\r\n\r\n在 WorkBuddy 中输入：\r\n\r\n```\r\n处理新图片\r\n```\r\n\r\n### 第4步：查看结果\r\n\r\n打开 `D:\\新建文件夹\\处理结果\\` 查看：\r\n- `.docx` 文件 - Word 文档\r\n- `.md` 文件 - Markdown 文档\r\n- `.txt` 文件 - 处理日志\r\n\r\n---\r\n\r\n## ✅ 测试检查清单\r\n\r\n- [ ] Skill 已成功安装到 `C:\\Users\\LENOVO\\.workbuddy\\skills\\image-knowledge-converter\\`\r\n- [ ] WorkBuddy 能识别 Skill（输入 \"/\" 查看可用技能）\r\n- [ ] 初始化知识库成功\r\n- [ ] 测试图片成功处理\r\n- [ ] 生成的文档格式正确\r\n- [ ] 图片成功归档\r\n\r\n---\r\n\r\n## 🤔 遇到问题？\r\n\r\n### 问题1：Skill 没有被识别\r\n**解决**：\r\n1. 重启 WorkBuddy\r\n2. 或点击右上角头像 → Skills 管理 → 刷新\r\n\r\n### 问题2：处理图片报错\r\n**解决**：\r\n1. 检查 `D:\\新建文件夹\\待处理图片\\` 路径是否正确\r\n2. 截图错误信息发给我\r\n\r\n### 问题3：找不到文档\r\n**解决**：\r\n1. 检查 `D:\\新建文件夹\\处理结果\\` 文件夹\r\n2. 查看处理日志（每次处理会生成日志）\r\n\r\n---\r\n\r\n## 📝 重要提醒\r\n\r\n- ✅ **无需手动导入 ZIP** - Skill 已直接安装在正确位置\r\n- ✅ **WorkBuddy 会自动识别** - 重启即可生效\r\n- ✅ **项目文件在 D:\\新建文件夹\\** - 所有操作都在这个目录\r\n- ✅ **随时找我帮忙** - 遇到任何问题告诉我\r\n\r\n---\r\n\r\n## 🎯 下一步\r\n\r\n1. **测试 Skill** - 按照上面的测试步骤操作\r\n2. **查看计划** - 打开 `本周行动计划.md`\r\n3. **遇到问题** - 截图或复制错误信息给我\r\n\r\n---\r\n\r\n**安装时间**: 2026-03-17\r\n**Skill 版本**: v1.0\r\n**支持文档**: `本周行动计划.md` | `测试检查清单.md` | `使用说明.md`\n\nFile v1.0.0:docs/multi-engine-ocr.md\n\n# 多引擎 OCR 使用说明\r\n\r\n## 🎯 功能概述\r\n\r\n图片知识库工具现已支持**多 OCR 引擎自动切换**，当首选引擎达到频率限制时，会自动提示您选择备用引擎。\r\n\r\n### 支持的 OCR 引擎\r\n\r\n| 优先级 | 引擎 | 免费额度 | 特点 |\r\n|-------|------|---------|------|\r\n| 1 | 腾讯云 OCR | 1000次/月 | 首选，中文识别准确 |\r\n| 2 | 百度 OCR | 50000次/月 | 第一备用，额度充足 |\r\n| 3 | 本地 Tesseract | 无限 | 第二备用，无需网络 |\r\n\r\n---\r\n\r\n## 📦 文件说明\r\n\r\n| 文件 | 功能 |\r\n|-----|------|\r\n| `tencent_ocr.py` | 腾讯云 OCR 模块 |\r\n| `baidu_ocr.py` | 百度 OCR 模块 |\r\n| `local_ocr.py` | 本地 Tesseract 模块 |\r\n| `ocr_manager.py` | OCR 管理器（多引擎切换） |\r\n| `auto_process_v2.py` | 主程序（使用多引擎） |\r\n\r\n---\r\n\r\n## 🚀 使用方法\r\n\r\n### 方式一：使用默认配置（腾讯云）\r\n\r\n```bash\r\npython auto_process_v2.py\r\n```\r\n\r\n程序会自动使用已配置的腾讯云 OCR。\r\n\r\n### 方式二：当腾讯云达到频率限制\r\n\r\n当提示\"已达频率上限\"时，会弹出选择窗口：\r\n\r\n```\r\n⚠️ 腾讯云 OCR 达到频率限制\r\n\r\n请选择其他 OCR 引擎:\r\n\r\n✓ 腾讯云 OCR: 已配置\r\n✗ 百度 OCR: 未配置 API 密钥\r\n✗ 本地 Tesseract: 未安装\r\n\r\n请选择（输入数字）:\r\n1 - 腾讯云 OCR\r\n2 - 百度 OCR\r\n3 - 本地 Tesseract\r\n0 - 取消\r\n```\r\n\r\n**选择 2 或 3 切换到备用引擎**\r\n\r\n---\r\n\r\n## 🔧 配置备用引擎\r\n\r\n### 配置百度 OCR（推荐作为备用）\r\n\r\n**步骤 1：申请百度 OCR**\r\n1. 访问 https://ai.baidu.com/tech/ocr\r\n2. 登录百度账号\r\n3. 点击「立即使用」\r\n4. 创建应用，获取 AppID、API Key、Secret Key\r\n\r\n**步骤 2：配置密钥**\r\n\r\n编辑 `ocr_manager.py`，在文件开头添加：\r\n\r\n```python\r\n# 设置默认 API 密钥（腾讯云）\r\nos.environ['TENCENT_SECRET_ID'] = '你的腾讯云SecretId'\r\nos.environ['TENCENT_SECRET_KEY'] = '你的腾讯云SecretKey'\r\n\r\n# 设置百度 OCR 密钥\r\nos.environ['BAIDU_APP_ID'] = '你的百度AppID'\r\nos.environ['BAIDU_API_KEY'] = '你的百度APIKey'\r\nos.environ['BAIDU_SECRET_KEY'] = '你的百度SecretKey'\r\n```\r\n\r\n---\r\n\r\n### 配置本地 Tesseract\r\n\r\n**步骤 1：安装 Tesseract**\r\n\r\n1. 下载安装包：https://github.com/UB-Mannheim/tesseract/wiki\r\n2. 运行安装程序\r\n3. **重要**：安装时勾选中文语言包 (chi_sim)\r\n4. 将 Tesseract 安装目录添加到系统 PATH\r\n\r\n**步骤 2：安装 Python 包**\r\n\r\n```bash\r\npip install pytesseract pillow\r\n```\r\n\r\n**步骤 3：验证安装**\r\n\r\n```bash\r\ntesseract --version\r\n```\r\n\r\n---\r\n\r\n## 📋 使用流程示例\r\n\r\n### 场景 1：正常处理\r\n\r\n```\r\n开始处理\r\n  ↓\r\n自动选择腾讯云 OCR\r\n  ↓\r\n识别图片 ✓\r\n  ↓\r\n完成\r\n```\r\n\r\n### 场景 2：达到频率限制\r\n\r\n```\r\n开始处理\r\n  ↓\r\n自动选择腾讯云 OCR\r\n  ↓\r\n识别第 10 张图片...\r\n  ↓\r\n⚠️ 达到频率限制！\r\n  ↓\r\n[弹窗] 请选择备用引擎\r\n  ↓\r\n用户选择: 百度 OCR\r\n  ↓\r\n切换到百度 OCR\r\n  ↓\r\n继续识别剩余图片 ✓\r\n  ↓\r\n完成\r\n```\r\n\r\n---\r\n\r\n## 💡 最佳实践\r\n\r\n### 推荐配置\r\n\r\n**配置 1：腾讯云 + 百度（推荐）**\r\n- 首选：腾讯云（1000次/月）\r\n- 备用：百度（50000次/月）\r\n- 优点：额度充足，识别准确\r\n\r\n**配置 2：腾讯云 + 本地 Tesseract**\r\n- 首选：腾讯云\r\n- 备用：本地 Tesseract\r\n- 优点：完全免费，无需申请多个账号\r\n\r\n### 批量处理策略\r\n\r\n1. **小批量处理**：每次处理 5-10 张图片\r\n2. **遇到限制切换**：频率限制时立即切换备用引擎\r\n3. **错峰处理**：不同时间段使用不同引擎\r\n\r\n---\r\n\r\n## ⚠️ 常见问题\r\n\r\n### Q1: 弹窗没有显示\r\n\r\n**A**: 确保您的环境支持 GUI。如果在无界面环境运行，可以修改代码使用命令行选择：\r\n\r\n```python\r\n# 在 ocr_manager.py 中添加命令行选择模式\r\n```\r\n\r\n### Q2: 百度 OCR 如何申请\r\n\r\n**A**: \r\n1. 访问 https://ai.baidu.com/tech/ocr/general\r\n2. 点击「立即使用」\r\n3. 创建应用后获取密钥\r\n4. 免费额度：50000次/月\r\n\r\n### Q3: Tesseract 识别中文效果差\r\n\r\n**A**:\r\n1. 确保安装了中文语言包 `chi_sim.traineddata`\r\n2. 确保语言包在 Tesseract 的 `tessdata` 目录\r\n3. 初始化时指定语言：`LocalOCR(lang='chi_sim+eng')`\r\n\r\n### Q4: 如何查看当前使用的引擎\r\n\r\n**A**: 程序启动时会显示：\r\n```\r\n当前使用引擎: 腾讯云 OCR\r\n```\r\n\r\n---\r\n\r\n## 🔗 相关链接\r\n\r\n- 腾讯云 OCR：https://cloud.tencent.com/product/ocr\r\n- 百度 OCR：https://ai.baidu.com/tech/ocr\r\n- Tesseract：https://github.com/tesseract-ocr/tesseract\r\n\r\n---\r\n\r\n**现在您可以无忧处理大量图片了！** 🎉\n\nFile v1.0.0:docs/ocr-fallback.md\n\n# OCR引擎自动回退机制说明\r\n\r\n**更新日期**: 2026年4月5日  \r\n**版本**: v1.2\r\n\r\n---\r\n\r\n## 🔄 自动回退流程\r\n\r\n当调用OCR引擎时，系统会按以下优先级自动选择和回退：\r\n\r\n```\r\n第1优先级: 腾讯云OCR (1000次/月)\r\n    ↓ 额度用完或调用失败\r\n第2优先级: 百度云OCR (1000次/月)\r\n    ↓ 额度用完或调用失败\r\n第3优先级: AI视觉识别 (无限制)\r\n```\r\n\r\n---\r\n\r\n## 📊 引擎配置\r\n\r\n| 引擎 | 优先级 | 免费额度 | 特点 |\r\n|------|--------|----------|------|\r\n| 腾讯云OCR | 1 | 1000次/月 | 精度最高 |\r\n| 百度云OCR | 2 | 1000次/月 | 性价比高 |\r\n| AI视觉识别 | 3 | 无限 | 兜底方案 |\r\n\r\n**合计免费额度**: 2000次/月\r\n\r\n---\r\n\r\n## ⚙️ 回退触发条件\r\n\r\n### 1. 额度用完自动回退\r\n\r\n当某个引擎的日使用量达到限额时，自动切换到下一个引擎：\r\n\r\n```python\r\n# 伪代码\r\nif 腾讯云使用量 >= 1000:\r\n    使用百度云OCR\r\nelif 百度云使用量 >= 1000:\r\n    使用AI视觉识别\r\n```\r\n\r\n### 2. 调用失败自动回退\r\n\r\n当API调用失败时（如网络错误、权限不足等），自动标记该引擎为\"已用完\"并切换到下一个：\r\n\r\n```python\r\ntry:\r\n    result = 腾讯云OCR识别()\r\nexcept Exception as e:\r\n    标记腾讯云为失败状态\r\n    return 递归调用下一个引擎()\r\n```\r\n\r\n### 3. 未配置自动跳过\r\n\r\n如果某个引擎没有配置API密钥，自动跳过：\r\n\r\n```python\r\nif 未配置腾讯云密钥:\r\n    跳过腾讯云，尝试百度云\r\nif 未配置百度云密钥:\r\n    跳过百度云，直接使用AI视觉\r\n```\r\n\r\n---\r\n\r\n## 📝 使用示例\r\n\r\n### 基本使用\r\n\r\n```python\r\nfrom ocr_engine_manager import get_ocr_manager\r\n\r\nmanager = get_ocr_manager()\r\n\r\n# 自动选择可用引擎\r\nresult, engine_name = manager.recognize_image(\"图片路径.jpg\")\r\n\r\nif result == \"__AI_VISION__\":\r\n    print(\"云OCR额度已用完，需要使用AI视觉识别\")\r\nelse:\r\n    print(f\"使用 {engine_name} 识别成功\")\r\n```\r\n\r\n### 查看当前状态\r\n\r\n```python\r\nstatus = manager.get_status()\r\nprint(f\"当前引擎: {status['current_engine']}\")\r\n\r\nfor engine_id, info in status['engines'].items():\r\n    print(f\"{info['name']}: {info['used_today']}/{info['daily_limit']} (剩余: {info['remaining']})\")\r\n```\r\n\r\n---\r\n\r\n## 💡 使用建议\r\n\r\n### 场景1：月处理量 < 1000张\r\n- 只用腾讯云OCR即可\r\n- 精度最高\r\n\r\n### 场景2：月处理量 1000-2000张\r\n- 腾讯云 + 百度云组合\r\n- 先用完腾讯云，自动切换到百度云\r\n\r\n### 场景3：月处理量 > 2000张\r\n- 前2000张使用云OCR（免费）\r\n- 超出部分使用AI视觉识别\r\n- 或购买百度云次数包（50元/1万次）\r\n\r\n---\r\n\r\n## 🔍 故障排查\r\n\r\n### 问题：一直使用AI视觉，不调用云OCR\r\n\r\n**可能原因**:\r\n1. 云OCR未配置密钥\r\n2. 云OCR额度已用完\r\n3. 云OCR调用失败（权限不足、网络问题）\r\n\r\n**检查方法**:\r\n```bash\r\npython ocr_engine_manager.py\r\n```\r\n\r\n### 问题：百度云返回\"权限不足\"错误\r\n\r\n**原因**: 百度云应用未开通\"通用文字识别\"服务\r\n\r\n**解决**:\r\n1. 登录 https://console.bce.baidu.com/ai/\r\n2. 进入「文字识别」服务\r\n3. 开通「通用文字识别」\r\n\r\n---\r\n\r\n## 📈 使用量追踪\r\n\r\n使用量保存在：\r\n```\r\n.workbuddy/memory/ocr_engine_log.json\r\n```\r\n\r\n格式：\r\n```json\r\n{\r\n  \"date\": \"2026-04-05\",\r\n  \"usage\": {\r\n    \"tencent\": 100,\r\n    \"baidu\": 50,\r\n    \"ai_vision\": 0\r\n  }\r\n}\r\n```\r\n\r\n---\r\n\r\n## ✅ 总结\r\n\r\n- **无需手动切换**，系统自动处理\r\n- **免费额度**: 2000次/月（腾讯云1000 + 百度云1000）\r\n- **超出免费额度**: 自动使用AI视觉识别\r\n- **购买付费包**: 如需更多云OCR调用，可购买百度云次数包\r\n\r\n---\r\n\r\n*文档生成时间: 2026年4月5日*\n\nFile v1.0.0:docs/quick-start.md\n\n# 图片知识库转化工具 v2.0 - 快速入门指南\r\n\r\n> 💡 **一句话说明**：把截图里的文字自动识别出来，整理到文档中\r\n\r\n---\r\n\r\n## 🚀 开始使用（3步走）\r\n\r\n### 第1步：准备图片\r\n\r\n把要处理的截图放到对应文件夹：\r\n\r\n```\r\nD:\\新建文件夹\\待处理图片\\\r\n├── 健康养生\\          ← 放健康养生类截图\r\n├── 肠道健康\\          ← 放肠道健康类截图\r\n├── 中医养生\\          ← 放中医养生类截图\r\n└── 日常饮食\\          ← 放饮食建议类截图\r\n```\r\n\r\n**提示**：\r\n- 支持格式：jpg、jpeg、png、webp、bmp\r\n- 图片越多，越能体现增强版的优势\r\n\r\n---\r\n\r\n### 第2步：运行程序\r\n\r\n双击运行或命令行执行：\r\n\r\n```bash\r\npython run_enhanced.py\r\n```\r\n\r\n---\r\n\r\n### 第3步：选择处理方式\r\n\r\n程序会显示菜单，根据你的情况选择：\r\n\r\n```\r\n📋 场景选择指南:\r\n============================================================\r\n【选项1】图片多/大小不一/首次使用 → 选 🚀 增强版\r\n【选项2】图片少/质量一致/求快速 → 选 📦 原始版\r\n【选项3】想看效果对比/测试安装 → 选 📊 性能测试\r\n【选项4】还没准备好/临时有事 → 选 ❌ 退出\r\n============================================================\r\n```\r\n\r\n---\r\n\r\n## 🎯 选择指南（详细版）\r\n\r\n### 选项1：🚀 增强版处理器\r\n\r\n**适合你的情况**：\r\n- ✅ 图片超过 20 张\r\n- ✅ 图片大小不一（有的几KB，有的几MB）\r\n- ✅ 第一次使用这个工具\r\n- ✅ 希望处理得更快\r\n- ✅ 不想处理到一半卡住\r\n\r\n**你会得到**：\r\n- 智能分批（大图小图分开处理）\r\n- 并发处理（同时处理多张）\r\n- 实时进度条（知道还要等多久）\r\n- 自动切换OCR（一个引擎限制自动换另一个）\r\n- 自动去重（相同内容只保留一份）\r\n\r\n**示例**：\r\n> 你有 100 张小红书截图，有的清晰有的模糊，大小不一。选这个！\r\n\r\n---\r\n\r\n### 选项2：📦 原始处理器\r\n\r\n**适合你的情况**：\r\n- ✅ 图片少于 20 张\r\n- ✅ 图片都很清晰（比如微信读书截图）\r\n- ✅ 想快点开始处理\r\n- ✅ 已经用熟了原来的方式\r\n\r\n**你会得到**：\r\n- 简单直接的处理\r\n- 快速启动\r\n- 和原来一样的体验\r\n\r\n**注意**：\r\n- 处理大量图片时可能会慢\r\n- 遇到OCR频率限制需要手动切换\r\n\r\n**示例**：\r\n> 你只有 8 张微信读书截图，都很清晰。选这个！\r\n\r\n---\r\n\r\n### 选项3：📊 运行性能测试\r\n\r\n**适合你的情况**：\r\n- ✅ 想知道增强版到底快多少\r\n- ✅ 检查安装是否正确\r\n- ✅ 想生成对比报告发朋友圈\r\n\r\n**你会得到**：\r\n- 两个版本的性能对比\r\n- 可视化的 HTML 报告\r\n- 处理速度、内存占用等数据\r\n\r\n**示例**：\r\n> 你想给朋友展示这个工具多厉害。选这个生成报告！\r\n\r\n---\r\n\r\n### 选项4：❌ 退出\r\n\r\n**适合你的情况**：\r\n- ✅ 突然有事要忙\r\n- ✅ 发现图片还没放好\r\n- ✅ 想先整理一下再处理\r\n\r\n---\r\n\r\n## 📊 快速决策表\r\n\r\n| 你的情况 | 选哪个 | 为什么 |\r\n|---------|-------|-------|\r\n| 第一次用 | 选项1 | 最智能，不容易出错 |\r\n| 图片 > 50 张 | 选项1 | 需要分批和并发 |\r\n| 图片 < 10 张 | 选项2 | 简单任务，快速完成 |\r\n| 想对比效果 | 选项3 | 生成对比报告 |\r\n| 不确定 | 选项1 | 默认推荐，最安全 |\r\n\r\n---\r\n\r\n## ⚡ 处理完成后的结果\r\n\r\n处理完成后，你会在以下位置找到结果：\r\n\r\n```\r\nD:\\新建文件夹\\处理结果\\\r\n├── 01_抗炎饮食与营养科普.md    ← 健康养生类内容\r\n├── 02_肠道健康与饮食分类.md    ← 肠道健康类内容\r\n├── 03_中医养生与食疗.md        ← 中医养生类内容\r\n├── 04_日常饮食建议.md          ← 日常饮食类内容\r\n└── reports\\                    ← HTML处理报告\r\n    └── report_xxx.html         ← 可视化处理统计\r\n```\r\n\r\n同时，处理过的图片会被移动到：\r\n```\r\nD:\\新建文件夹\\已处理图片\\[主题名]\\batch_001_20260319\\\r\n```\r\n\r\n---\r\n\r\n## ❓ 常见问题\r\n\r\n### Q1：我应该选增强版还是原始版？\r\n\r\n**简单判断**：\r\n- 图片超过 20 张 → 增强版\r\n- 图片少于 10 张 → 原始版\r\n- 不确定 → 增强版（默认推荐）\r\n\r\n### Q2：处理过程中可以中断吗？\r\n\r\n**可以**：\r\n- 按 `Ctrl+C` 可以中断\r\n- 已处理的内容会保存\r\n- 下次可以从中断处继续\r\n\r\n### Q3：处理失败了怎么办？\r\n\r\n**排查步骤**：\r\n1. 检查网络连接（需要联网调用OCR）\r\n2. 检查OCR密钥是否配置正确\r\n3. 尝试切换OCR引擎（增强版会自动切换）\r\n4. 减少图片数量再试\r\n\r\n### Q4：为什么推荐交互式启动？\r\n\r\n**好处**：\r\n- 先看到有多少图片，再决定怎么处理\r\n- 防止误操作（比如不小心处理了错误的图片）\r\n- 可以中途改变主意\r\n- 新手友好，有明确提示\r\n\r\n---\r\n\r\n## 🎓 进阶技巧\r\n\r\n### 技巧1：批量整理图片\r\n\r\n处理前先把图片按主题分类放好，处理后会自动归档到对应文档。\r\n\r\n### 技巧2：定期生成报告\r\n\r\n处理完成后选择生成报告，可以看到：\r\n- 处理了多少张图片\r\n- 成功率多少\r\n- 用了多长时间\r\n- 哪些图片失败了\r\n\r\n### 技巧3：处理大量图片\r\n\r\n如果一次有几百张图片：\r\n1. 分批放入（每次 50-100 张）\r\n2. 使用增强版（智能分批）\r\n3. 晚上挂机处理（不用盯着）\r\n\r\n---\r\n\r\n## 📞 需要帮助？\r\n\r\n遇到问题请检查：\r\n1. 图片是否放在了正确的文件夹\r\n2. 网络是否连接正常\r\n3. OCR密钥是否配置正确\r\n4. 查看 `logs/` 目录下的错误日志\r\n\r\n---\r\n\r\n**文档版本**: v2.0  \r\n**最后更新**: 2026-03-19  \r\n**适用工具版本**: 图片知识库转化工具 v2.0+\n\nFile v1.0.0:docs/switch-model-guide.md\n\n# 🔄 WorkBuddy 切换到支持图片的模型 - 详细指南\r\n\r\n---\r\n\r\n## 🎯 目标\r\n\r\n切换到支持图片识别的 AI 模型，让「图片知识库转化工具」能够正常工作。\r\n\r\n---\r\n\r\n## 📍 第1步：打开模型设置\r\n\r\n### 方法1：通过右上角头像（推荐）\r\n\r\n1. **打开 WorkBuddy**\r\n2. **点击右上角头像**\r\n3. **进入「设置」**\r\n4. **点击「AI模型」**\r\n\r\n---\r\n\r\n## 🔧 第2步：选择支持图片的模型\r\n\r\n### WorkBuddy 支持的模型类型\r\n\r\n根据搜索结果，WorkBuddy 内置了多种主流 AI 模型：\r\n\r\n| 模型类型 | 特点 | 是否支持图片 | 推荐用途 |\r\n|---------|------|-------------|---------|\r\n| **Hunyuan（混元）** | 擅长中文理解 | ❓ 待确认 | 中文文档写作 |\r\n| **GLM** | 中文能力强 | ❓ 待确认 | 中文任务 |\r\n| **DeepSeek** | 推理能力强 | ❓ 待确认 | 复杂推理 |\r\n| **GPT-4V** | 多模态 | ✅ 支持 | 图片识别（推荐） |\r\n| **Claude 3.5** | 多模态 | ✅ 支持 | 图片识别（推荐） |\r\n\r\n---\r\n\r\n## 💡 第3步：如何识别支持图片的模型\r\n\r\n### 方法1：查看模型描述\r\n\r\n在选择模型时，查看描述中是否包含：\r\n- \"多模态\"\r\n- \"视觉\"\r\n- \"图片识别\"\r\n- \"Image\"\r\n- \"Vision\"\r\n\r\n### 方法2：尝试测试\r\n\r\n1. 选择一个模型\r\n2. 发送一张图片\r\n3. 如果能识别，说明支持\r\n4. 如果报错\"不支持图片\"，说明不支持\r\n\r\n---\r\n\r\n## ⚙️ 完整操作流程\r\n\r\n### Windows 用户\r\n\r\n```\r\n1. 打开 WorkBuddy\r\n   ↓\r\n2. 点击右上角头像（用户图标）\r\n   ↓\r\n3. 选择「设置」或「Claw 设置」\r\n   ↓\r\n4. 点击「AI 模型」或「对话模型」\r\n   ↓\r\n5. 从下拉列表中选择模型\r\n   ↓\r\n6. 优先选择带\"多模态\"或\"Vision\"关键词的模型\r\n   ↓\r\n7. 保存设置\r\n   ↓\r\n8. 重启 WorkBuddy（可能需要）\r\n   ↓\r\n9. 测试发送一张图片\r\n   ↓\r\n10. 如果能识别，切换成功！\r\n```\r\n\r\n---\r\n\r\n## ✅ 验证切换成功\r\n\r\n### 测试方法1：发送图片\r\n\r\n1. 在 WorkBuddy 中拖入一张图片\r\n2. 或点击附件按钮选择图片\r\n3. 发送消息：\"请识别这张图片的内容\"\r\n\r\n**成功标志**: AI 能准确描述图片内容\r\n\r\n**失败标志**: 出现错误信息 \"current model does not support images\"\r\n\r\n---\r\n\r\n### 测试方法2：使用 Skill 测试\r\n\r\n1. 切换模型后\r\n2. 重新输入：\"处理新图片\"\r\n3. 观察能否识别图片\r\n\r\n**成功标志**: 开始识别图片文字\r\n\r\n**失败标志**: 再次报错 \"不支持图片\"\r\n\r\n---\r\n\r\n## 🤔 如果找不到支持图片的模型\r\n\r\n### 可能原因\r\n\r\n1. **账号限制**\r\n   - 免费账号可能不支持多模态模型\r\n   - 需要升级到付费版本\r\n\r\n2. **地区限制**\r\n   - 某些模型在特定地区不可用\r\n   - 可能需要切换账号类型\r\n\r\n3. **版本限制**\r\n   - 旧版本 WorkBuddy 可能不支持某些模型\r\n   - 需要更新到最新版本\r\n\r\n---\r\n\r\n## 🚨 如果切换失败\r\n\r\n### 选项 A：升级账号\r\n\r\n查看 WorkBuddy 账号计划，可能需要：\r\n- 从免费版升级到付费版\r\n- 购买多模态模型额度\r\n\r\n### 选项 B：联系客服\r\n\r\n在 WorkBuddy 中：\r\n1. 点击右上角头像\r\n2. 选择「帮助与反馈」\r\n3. 联系官方客服询问\r\n\r\n### 选项 C：等待我改进 Skill\r\n\r\n让我为你改进 Skill，添加 OCR 支持：\r\n- 使用腾讯云 OCR（免费额度）\r\n- 或使用 Tesseract OCR（免费开源）\r\n- 不依赖多模态模型\r\n\r\n---\r\n\r\n## 📋 切换检查清单\r\n\r\n切换完成后，请确认以下项目：\r\n\r\n- [ ] WorkBuddy 成功打开\r\n- [ ] 能找到「设置」→「AI 模型」\r\n- [ ] 找到包含\"多模态\"或\"Vision\"关键词的模型\r\n- [ ] 成功切换到新模型\r\n- [ ] 重启 WorkBuddy（如需要）\r\n- [ ] 发送一张图片测试\r\n- [ ] AI 能识别图片内容\r\n- [ ] 重新输入\"处理新图片\"测试\r\n- [ ] Skill 正常工作\r\n\r\n---\r\n\r\n## 📞 需要帮助？\r\n\r\n如果遇到问题，告诉我：\r\n\r\n**问题类型**:\r\n- 找不到「设置」入口\r\n- 「AI 模型」选项不存在\r\n- 没有支持图片的模型\r\n- 切换后仍然报错\r\n\r\n**请提供**:\r\n- 截图（界面设置页面的截图）\r\n- 错误信息（复制完整错误信息）\r\n- WorkBuddy 版本号\r\n\r\n我会帮你排查！\r\n\r\n---\r\n\r\n## 🎉 成功标志\r\n\r\n切换成功的标志：\r\n\r\n1. ✅ WorkBuddy 能识别图片\r\n2. ✅ 输入\"处理新图片\"能正常工作\r\n3. ✅ 截图能提取文字\r\n4. ✅ 能生成 Word 和 Markdown 文档\r\n\r\n---\r\n\r\n**下一步**:\r\n- 切换成功后，立即告诉我\r\n- 我会帮你进行完整的 Skill 功能测试\r\n- 然后继续第1天的其他任务\r\n\r\n---\r\n\r\n**祝你切换成功！** 🚀\r\n\r\n---\r\n\r\n**更新时间**: 2026-03-18\r\n**指南版本**: v1.0\n\nFile v1.0.0:docs/usage.md\n\n# 图片知识库 — 使用说明\r\n\r\n> 适用范围：将手机截图自动整理为 Word + Markdown 知识文档，并自动同步到 ima 个人笔记\r\n> 最后更新：2026年3月16日\r\n\r\n---\r\n\r\n## 一、目录结构说明\r\n\r\n```\r\nD:\\新建文件夹\\\r\n│\r\n├── 待处理图片\\                    ← 新图片放这里（按主题分子文件夹）\r\n│   ├── 健康养生\\                  ← 示例：健康类图片放这里\r\n│   └── 旅行记录\\                  ← 示例：旅行类图片放这里\r\n│\r\n├── 已处理图片\\                    ← 处理完的图片自动归档（不用手动操作）\r\n│\r\n├── 处理结果\\                      ← 最终生成的 Word 和 MD 文档\r\n│   ├── 01_抗炎饮食与营养科普.docx/.md\r\n│   ├── 02_肠道健康与饮食分类.docx/.md\r\n│   ├── 03_中医养生与食疗.docx/.md\r\n│   ├── 04_日常饮食建议.docx/.md\r\n│   └── （新文档自动编号添加）\r\n│\r\n├── 【启动提示词】新对话粘贴这段.txt  ← 重启电脑后打开新对话用这个\r\n├── auto_process.py               ← 处理前自动检查脚本（含 ima 同步）\r\n├── ima_sync.py                   ← ima 自动同步脚本\r\n└── ima_config.txt                ← ima API 凭证配置（填入后自动生效）\r\n```\r\n\r\n---\r\n\r\n## 二、日常使用流程（3步）\r\n\r\n### 第 1 步：放入新图片\r\n\r\n把手机截图复制到对应主题文件夹：\r\n\r\n- 健康养生类 → `待处理图片\\健康养生\\`\r\n- 旅行记录类 → `待处理图片\\旅行记录\\`（文件夹没有就新建一个）\r\n- **文件夹名称可以随意起，中英文都行**\r\n\r\n---\r\n\r\n### 第 2 步：打开 WorkBuddy，恢复背景\r\n\r\n> ⚠️ **重要：** WorkBuddy 每次新开对话都是\"空白\"状态，不记得之前的内容。\r\n> 必须先粘贴启动提示词，AI 才知道你的项目在哪、有哪些文档。\r\n\r\n**操作步骤：**\r\n\r\n1. 打开电脑上的 WorkBuddy\r\n2. 新建一个对话（或直接在对话框里）\r\n3. 打开文件 `D:\\新建文件夹\\【启动提示词】新对话粘贴这段.txt`\r\n4. 全选文件内容（Ctrl+A），复制（Ctrl+C）\r\n5. 粘贴到 WorkBuddy 对话框，发送\r\n6. AI 回复\"已准备好\"后，继续下一步\r\n\r\n---\r\n\r\n### 第 3 步：发送指令，开始处理\r\n\r\nAI 准备好后，发送：\r\n\r\n```\r\n处理新图片\r\n```\r\n\r\nAI 会自动完成：\r\n1. 读取已有4个文档的章节结构（知道哪些内容已经有了）\r\n2. 逐张识别图片中的文字\r\n3. 判断内容属于哪个分类\r\n4. 同类内容 → 追加到已有文档（不会重复已有章节）\r\n5. 新主题内容 → 自动新建 `05_xxx.docx/.md`\r\n6. 处理完的图片移动到 `已处理图片\\` 归档\r\n\r\n---\r\n\r\n## 三、有新类别文档时怎么操作\r\n\r\n当图片内容是全新主题（比如旅行、理财、学习笔记等），AI 会：\r\n\r\n1. **自动判断新主题名称**（根据图片内容决定）\r\n2. **自动编号**：在已有04号文档后，新建 `05_旅行记录.md` 和 `05_旅行记录.docx`\r\n3. **在对话中告诉你**：新建了什么文档、包含哪些内容\r\n4. **你无需任何操作**，直接去 `处理结果\\` 查看新文件即可\r\n\r\n---\r\n\r\n## 四、已有文档的合并规则\r\n\r\n| 新内容属于 | 处理方式 |\r\n|-----------|---------|\r\n| 抗炎/坚果/营养素 | 追加到 `01_抗炎饮食与营养科普` |\r\n| 肠道/益生菌/绿灯食物 | 追加到 `02_肠道健康与饮食分类` |\r\n| 中医/养生/食疗/茶饮 | 追加到 `03_中医养生与食疗` |\r\n| 早餐/食谱/饮食建议 | 追加到 `04_日常饮食建议` |\r\n| 全新主题 | 新建 `05_xxx` 文档（自动编号） |\r\n\r\n---\r\n\r\n## 五、常用指令\r\n\r\n在 WorkBuddy 对话中可以使用：\r\n\r\n| 发送内容 | 效果 |\r\n|---------|------|\r\n| `处理新图片` | 处理所有待处理图片 |\r\n| `处理待处理图片/健康养生` | 只处理健康养生文件夹的图片 |\r\n| `查看现有文档` | 列出所有文档和章节列表 |\r\n\r\n---\r\n\r\n## 六、注意事项\r\n\r\n| 情况 | 处理方式 |\r\n|------|---------|\r\n| 图片文字模糊看不清 | AI 会跳过并告知哪张识别不了 |\r\n| 同一张图跨多个主题 | AI 会拆分内容分别归入各文档 |\r\n| 想重新处理某张图片 | 把图片复制回 `待处理图片\\<主题>\\`，重新发指令 |\r\n| 电脑重启后找不到对话 | 重新粘贴启动提示词（见第二步）即可 |\r\n\r\n---\r\n\r\n## 七、ima 个人笔记自动同步\r\n\r\n处理完图片后，文档会**自动同步**到你的 ima 个人笔记，无需任何手动操作。\r\n\r\n### 首次配置（只需做一次）\r\n\r\n1. 打开文件 `D:\\新建文件夹\\ima_config.txt`，用记事本打开\r\n2. 把下面两行的占位文字替换成真实值：\r\n   ```\r\n   IMA_CLIENT_ID=填入你的ClientID     ← 改成真实的 ClientID\r\n   IMA_API_KEY=填入你的APIKey         ← 改成真实的 APIKey\r\n   ```\r\n3. 保存文件（Ctrl+S）\r\n\r\n> 凭证获取地址：https://ima.qq.com/agent-interface\r\n> 凭证有效期至 2026-04-16，到期后重新获取并更新此文件即可\r\n\r\n### 同步逻辑\r\n\r\n| 情况 | 处理方式 |\r\n|------|---------|\r\n| 文档首次同步 | 在 ima 新建笔记 |\r\n| 文档有新内容（追加了章节） | 自动在 ima 原笔记末尾追加 |\r\n| 文档未变更 | 跳过，不重复同步 |\r\n\r\n### 单独运行同步（可选）\r\n\r\n也可以随时手动触发同步，在命令窗口运行：\r\n\r\n```\r\npython D:\\新建文件夹\\ima_sync.py          ← 同步有变更的文件\r\npython D:\\新建文件夹\\ima_sync.py --force  ← 强制重新同步全部文件\r\npython D:\\新建文件夹\\ima_sync.py --check  ← 仅验证凭证是否有效\r\n```\r\n\r\n---\r\n\r\n## 八、快速流程图（含 ima 同步）\r\n\r\n```\r\n有新图片了？\r\n    ↓\r\n放入 待处理图片\\<主题名>\\\r\n    ↓\r\n打开 WorkBuddy → 粘贴「启动提示词」→ 发送\r\n    ↓\r\nAI 回复「已准备好」\r\n    ↓\r\n发送：处理新图片\r\n    ↓\r\n等待完成，查看 处理结果\\ 目录\r\n    ↓\r\n自动同步到 ima 个人笔记 ✅（无需任何操作）\r\n```\n\nFile v1.0.0:README_EN.md\n\n# 📚 Image Knowledge Converter (图片知识库整理工具)\n\n> Automatically convert phone screenshots into structured Word + Markdown knowledge documents with AI-powered categorization.  \n> **First-time users get an interactive setup wizard — no technical background required!**\n\n<p align=\"center\">\n  <img src=\"https://raw.githubusercontent.com/haoyiyong985/image-knowledge-converter/main/demo.gif\" alt=\"Demo\" width=\"480\">\n</p>\n\n[![GitHub license](https://img.shields.io/badge/license-MIT-blue.svg)](LICENSE)\n[![GitHub stars](https://img.shields.io/github/stars/haoyiyong985/image-knowledge-converter?style=social)](https://github.com/haoyiyong985/image-knowledge-converter)\n[![WorkBuddy](https://img.shields.io/badge/WorkBuddy-Skill-green)](https://workbuddy.ai)\n\n🌐 [中文](README.md) | [English](README_EN.md)\n\n---\n\n## 🌟 Overview\n\n**Image Knowledge Converter** is an AI-powered knowledge management tool that:\n\n- 📷 **Auto OCR**: Extract text from phone screenshots (Xiaohongshu, WeChat Reading, WeChat, etc.)\n- 🏷️ **Smart Categorization**: AI understands content and automatically classifies it into knowledge themes\n- 📝 **Generate Documents**: Output structured Word + Markdown dual-format documents\n- 🔗 **Auto Archive**: Organize images and documents by category\n- 🔄 **Content Deduplication**: Similar topics are automatically merged to avoid duplicates\n- ☁️ **Cloud Sync**: One-click sync to IMA personal notes\n\n---\n\n## ✨ Features\n\n### Core Features\n\n| Feature | Description |\n|---------|-------------|\n| **Multi-Engine OCR** | Tencent Cloud → Baidu Cloud → Local Tesseract (auto fallback) |\n| **AI Smart Categorization** | Dynamic category system with free naming and auto category creation |\n| **Document Merging** | Same-topic content auto-merged into one document |\n| **Dual-Format Output** | Simultaneously generates `.docx` and `.md` files |\n| **IMA Sync** | Auto sync to IMA notes (supports incremental updates) |\n| **Batch Processing** | Smart batch splitting for large volumes, with resume support |\n| **Duplicate Detection** | Hash + topic similarity double-check |\n| **Newbie Wizard** | Interactive setup wizard on first run — no tech background needed |\n\n### Technical Highlights\n\n- ✅ **Full LLM Coverage**: Hunyuan Lite / Kimi / Doubao multi-model fallback\n- ✅ **Smart Naming**: `{Category}-{Topic}` format, e.g., `History-Qian Qianyi Biography`\n- ✅ **Content Cleanup**: Auto-fix OCR errors, structured formatting\n- ✅ **Source Extraction**: Auto-identify platform sources (Xiaohongshu, WeChat, etc.)\n- ✅ **Newbie Wizard**: Interactive first-run configuration wizard\n\n---\n\n## 🚀 Quick Start (3 Steps)\n\n> **No need to choose an installation method!** No matter which way you install, the first run will **auto-launch the Newbie Wizard** to guide you through setup.\n\n### Step 1: Choose Installation Method (any one)\n\n#### Method A: WorkBuddy Skill (Easiest ⭐)\n\n**For**: WorkBuddy users who want one-click setup\n\n1. Download `image-knowledge-converter_v1.1.0_skill.zip` from Releases\n2. Open WorkBuddy → Top-right avatar → **Skills Management**\n3. Click \"Import Skills\" → Select the zip → \"Import Now\"\n4. **Say to WorkBuddy**: `first time` or `initialize`\n5. ✅ The wizard auto-starts and guides you through setup (~2 minutes)\n\n#### Method B: Full Package (More Control ⭐)\n\n**For**: Users who want full control, or without WorkBuddy\n\n1. Download `tupianzhengligongju_wanzheng_v1.1.0.zip` from Releases\n2. Extract to your desired location (e.g., `D:\\MyImageKnowledgeBase`)\n3. Open terminal, enter the extracted directory\n4. Run: `python setup_wizard.py`\n5. ✅ The wizard auto-starts and guides you through setup (~2 minutes)\n\n#### Method C: Git Clone (For Developers)\n\n**For**: Developers familiar with Git and CLI\n\n```bash\ngit clone https://github.com/haoyiyong985/image-knowledge-converter.git\ncd image-knowledge-converter\npip install -r requirements.txt\npython setup_wizard.py   # ← Launch wizard\n```\n\n---\n\n### Step 2: Newbie Wizard (Auto-Starts)\n\nNo matter which method you choose, **you'll see this wizard on first run** (cannot be skipped):\n\n```\n==================================================\n  Welcome to Image Knowledge Converter!\n  I'm your smart assistant. First time? Let me help you set up.\n  Just 3 steps, about 2 minutes.\n\n  If you have any questions, just ask me!\n==================================================\n```\n\n#### Wizard Flow (3 Steps, ~2 Minutes)\n\n**Step 1: Choose Working Folder**\n```\n  Step 1: Choose Working Folder\n  ℹ️ This is where images and generated documents will be stored.\n\n  Suggested: D:\\Users\\YourUsername\\ImageKnowledgeBase\n\n  Use default location? (y/n, press Enter for default):\n```\n\n- Press `y` → Auto-creates default folder\n- Press `n` → Enter custom path (e.g., `D:\\MyImageLibrary`)\n\n**Step 2: Configure OCR Service (pick one)**\n```\n  Step 2: Configure OCR Recognition Service\n  ℹ️ You need at least one OCR service to recognize text in images.\n\n  Please select an OCR service (pick one):\n    1. Tencent Cloud OCR (Recommended, 1000 free/month)\n      High accuracy, generous free quota\n    2. Baidu Cloud OCR (Free, requires real-name)\n      Large free quota, suitable for heavy use\n    3. Local Tesseract (Completely free)\n      No internet needed, but lower accuracy\n\n  Enter option number (1-3):\n```\n\n- **Option 1 (Tencent Cloud)** → Wizard shows tutorial → You fill in `config/api_keys_template.txt` → Wizard auto-reads and generates config\n- **Option 2 (Baidu Cloud)** → Wizard shows tutorial → You fill in `config/api_keys_template.txt` → Wizard auto-reads and generates config\n- **Option 3 (Local)** → Wizard prompts Tesseract installation → Config complete\n\n**Step 3: Create Folder Structure**\n```\n  Step 3: Create Folder Structure\n  ✅ Created folder: Pending Images\n  ✅ Created folder: Processed Images\n  ✅ Created folder: Processing Results\n\n  ✅ Config saved to config/api_keys.yaml\n```\n\n**Step 4 (Optional): Configure IMA Sync**\n```\n  (Optional) Configure IMA Sync\n  ℹ️ IMA is a note service that can automatically sync your generated documents.\n  ℹ️ If you don't use IMA, you can skip this.\n\n  Configure IMA sync? (y/n):\n```\n\n- Press `y` → Wizard prompts for IMA API Key → You fill in `config/api_keys_template.txt` → Wizard auto-reads and generates config\n- Press `n` → Skip, you can re-run wizard anytime to add it\n\n**Done!**\n```\n==================================================\n  🎉 Setup Complete!\n==================================================\n\n  Next steps:\n  1. Put images to process in the \"Pending Images\" folder\n  2. Run: python auto_process_all_v9_4.py\n  3. Wait for processing, results are in \"Processing Results\" folder\n```\n\n---\n\n### Step 3: Drop Images and Process\n\n#### If Using WorkBuddy Skill (Method A)\n\n1. Put images in: `YourWorkingFolder\\Pending Images\\`\n2. Say to WorkBuddy: `process new images`\n3. Wait for processing (~3-5 seconds/image)\n4. Results in: `YourWorkingFolder\\Processing Results\\`\n\n#### If Running Locally (Method B or C)\n\n1. Put images in: `YourWorkingFolder\\Pending Images\\`\n2. Run: `python auto_process_all_v9_4.py`\n3. Wait for processing (~3-5 seconds/image)\n4. Results in: `YourWorkingFolder\\Processing Results\\`\n\n---\n\n## 📖 User Guide\n\n### Directory Structure\n\n```\nImageKnowledgeBase\\\n├── auto_process_all_v9_4.py   ← Main processing script (V9.5 logic)\n├── setup_wizard.py            ← Newbie wizard script\n├── requirements.txt\n├── config\\\n│   └── api_keys.yaml        ← OCR/IMA config (auto-generated by wizard)\n├── Pending Images（待处理图片）\\                ← Drop images to process here\n│   ├── Health\\\n│   ├── Travel\\\n│   └── ...\n├── Processed Images（已处理图片）\\                ← Processed images auto-archived\n└── Processing Results（处理结果）\\                  ← Generated Word/Markdown docs\n    ├── History-Qian Qianyi Biography.docx\n    ├── History-Qian Qianyi Biography.md\n    └── ...\n```\n\n### Daily Usage Flow\n\n#### Step 1: Add New Images\n\nCopy phone screenshots to the `Pending Images` folder (supports subfolder categorization):\n\n```\nPending Images\\Health\\  ← Health-related images\nPending Images\\Travel\\  ← Travel-related images\n```\n\n#### Step 2: Start Processing\n\n**WorkBuddy Users**:\n```\nprocess new images\n```\n\n**Local Users**:\n```bash\npython auto_process_all_v9_4.py\n```\n\n#### Step 3: View Results\n\nAfter processing, open the `Processing Results` folder and you'll see:\n\n```\nProcessing Results\\\n├── History-Qian Qianyi Biography.docx    ← Word format (editable)\n├── History-Qian Qianyi Biography.md     ← Markdown format (plain text)\n├── Health-Anti-Inflammatory Diet.docx\n└── Health-Anti-Inflammatory Diet.md\n```\n\n---\n\n## ⚙️ Configuration\n\n### Secure API Key Handling (Security Improvement ⭐)\n\n**New users note**: To protect your API keys, **you no longer need to send keys to WorkBuddy**!\n\nWe use **local TXT file** for key transfer:\n1. The wizard teaches you how to get API keys\n2. You fill keys in `config/api_keys_template.txt` (with detailed instructions)\n3. Save and press Enter to continue\n4. The wizard auto-reads the TXT file and generates encrypted YAML config\n\n**Advantages**:\n- ✅ Keys never appear in chat history\n- ✅ Keys are not transmitted over the network (except normal API calls)\n- ✅ You can edit files locally in a secure environment\n\nTXT template path: `config/api_keys_template.txt` (auto-created by wizard)\n\n---\n\n### API Key Configuration (Auto-completed by wizard)\n\nThe wizard will generate the following in `config/api_keys.yaml`:\n\n```yaml\n# OCR Services (configure at least one)\nocr:\n  tencent:\n    secret_id: \"Your Tencent Cloud SecretId\"\n    secret_key: \"Your Tencent Cloud SecretKey\"\n\n  # OR Baidu Cloud\n  baidu:\n    api_key: \"Your Baidu Cloud API Key\"\n    secret_key: \"Your Baidu Cloud Secret Key\"\n\n# IMA Sync (optional, wizard will ask if you want to configure)\nima:\n  api_key: \"Your IMA API Key\"\n  base_url: \"https://api.ima.tencent.com/v1\"\n```\n\n### How to Get API Keys (Wizard will guide you step by step)\n\n| Service | Free Quota | Get Started | Wizard Support |\n|---------|------------|-------------|----------------|\n| Tencent Cloud OCR | 1000/month | https://console.cloud.tencent.com/cam/capi | ✅ Tutorial |\n| Baidu Cloud OCR | 50000/day | https://console.bce.baidu.com/ | ✅ Tutorial |\n| Local Tesseract | Completely free | https://github.com/UB-Mannheim/tesseract/wiki | ✅ Setup guide |\n\n---\n\n## 📊 Category System\n\n### Preset Categories (Auto-expanding)\n\n| Category | Description | Examples |\n|----------|-------------|----------|\n| **History & Culture** | History, biographies, cultural knowledge | Qian Qianyi Biography, Southern Song History |\n| **Health & Nutrition** | Diet, nutrition, health knowledge | Anti-inflammatory diet, gut health |\n| **Lifestyle** | Exercise, sleep, daily advice | Daily diet recommendations |\n| **Education & Parenting** | Education methods, parenting knowledge | - |\n| **Travel & Guides** | Travel logs, attraction guides | - |\n\n### Dynamic Categories\n\nWhen content doesn't fit preset categories, AI will:\n1. Automatically determine a new topic name\n2. Freely name the category\n3. Create the new category and archive\n\n**Examples**:\n- Image content is about \"Photography Tips\" → AI auto-creates `Photography` category\n- Image content is about \"Programming Learning\" → AI auto-creates `Programming` category\n\n---\n\n## 💡 Common Commands\n\n### WorkBuddy Users\n\nYou can use these in WorkBuddy conversation:\n\n| Command | Effect |\n|---------|--------|\n| `first time` or `initialize` | Launch newbie wizard (first-time setup) |\n| `process new images` | Process all pending images |\n| `process pending images/Health` | Only process images in specified folder |\n| `view existing documents` | List all documents and chapter lists |\n| `reconfigure` | Re-run wizard to update config |\n\n### Local Users\n\n```bash\n# Launch newbie wizard (first time)\npython setup_wizard.py\n\n# Process images\npython auto_process_all_v9_4.py\n\n# Batch processing (large volumes)\npython auto_process_all_v9_4.py --batch\n\n# Check progress\npython auto_process_all_v9_4.py --progress\n\n# Clear state\npython auto_process_all_v9_4.py --clear\n```\n\n---\n\n## 📂 Output Examples\n\n### Processing Results Directory\n\n```\nProcessing Results\\\n├── History-Qian Qianyi Biography.docx\n├── History-Qian Qianyi Biography.md\n├── History-Overview of Southern Song History.docx\n├── History-Overview of Southern Song History.md\n└── ...\n```\n\n### Document Content Structure\n\n```markdown\n# History-Qian Qianyi Biography\n\n## I. Biography\n(OCR extracted content, auto-segmented by AI)\n\n## II. Major Achievements\n(Structured organization)\n\n## III. Historical Evaluation\n(Auto-classified and archived)\n```\n\n---\n\n## 🔧 Advanced Features\n\n### Batch Processing\n\nWhen processing large volumes, the system auto-splits batches:\n\n| Image Size | Batch Size |\n|-----------|-----------|\n| < 500KB | 10 images/batch |\n| 500KB-2MB | 6 images/batch |\n| 2MB-5MB | 4 images/batch |\n| > 5MB | 2 images/batch |\n\n### Resume Processing\n\nIf processing is interrupted, you can resume:\n\n```bash\npython auto_process_all_v9_4.py --batch\n```\n\nCheck progress:\n\n```bash\npython auto_process_all_v9_4.py --progress\n```\n\nClear state:\n\n```bash\npython auto_process_all_v9_4.py --clear\n```\n\n---\n\n## 🐛 FAQ\n\n### Q1: I'm a complete beginner, can I use this?\n\n**Answer**: Absolutely!  \n- First run auto-launches the **Newbie Wizard**, guiding you step by step\n- Just 2 minutes, no technical background needed\n- After setup, just say \"process new images\" each time\n\n### Q2: OCR recognition fails?\n\n**Solution**:\n1. Check image clarity (recommend resolution ≥ 150 DPI)\n2. Confirm Tencent Cloud/Baidu Cloud OCR is configured\n3. Install local Tesseract as fallback\n\n### Q3: Document naming not as expected?\n\n**Solution**:\n- Document format: `{Category}-{Topic}`\n- Auto-generated by AI, aligned with content theme\n- To customize, modify naming rules in `auto_process_all_v9_4.py`\n\n### Q4: How to avoid duplicate content?\n\n**Solution**:\n- System auto-detects duplicates (Hash + topic similarity)\n- Duplicate images are automatically skipped\n\n### Q5: IMA sync fails?\n\n**Solution**:\n1. Check `config/api_keys.yaml` IMA config is correct\n2. Confirm credentials are not expired\n3. Re-run wizard: `python setup_wizard.py`\n\n---\n\n## 📈 Performance Metrics\n\n- **Processing Speed**: ~3-5 seconds/image (depends on OCR engine)\n- **Recognition Accuracy**: 90%+ Chinese (Tencent Cloud OCR)\n- **Supported Formats**: JPG, PNG, WEBP, BMP\n- **Output Formats**: Word (.docx) + Markdown (.md)\n\n---\n\n## 🛠️ Tech Stack\n\n| Technology | Purpose |\n|------------|---------|\n| **OCR** | Tencent Cloud, Baidu Cloud, Tesseract |\n| **AI Analysis** | Hunyuan Lite, Kimi, Doubao |\n| **Document Generation** | python-docx |\n| **Sync** | IMA OpenAPI |\n| **Language** | Python 3.8+ |\n\n---\n\n## 📄 File Guide\n\n### Core Scripts\n\n| File | Description |\n|------|-------------|\n| `auto_process_all_v9_4.py` | Current latest version (V9.5 logic) |\n| `setup_wizard.py` | Newbie wizard script (auto-launches on first run) |\n| `ima_sync.py` | IMA sync script |\n| `classifier_engine.py` | Classification engine |\n\n### Configuration Files\n\n| File | Description |\n|------|-------------|\n| `config/api_keys.yaml` | OCR/IMA credentials (auto-generated by wizard) |\n| `requirements.txt` | Python dependency list |\n| `.env` | Environment variables (not committed to Git) |\n\n---\n\n## 🤝 Contributing\n\nWelcome to submit Issues and Pull Requests!\n\n1. Fork this repo\n2. Create your feature branch (`git checkout -b feature/AmazingFeature`)\n3. Commit your changes (`git commit -m 'Add some AmazingFeature'`)\n4. Push to branch (`git push origin feature/AmazingFeature`)\n5. Open a Pull Request\n\n---\n\n## 📝 Changelog\n\n### v1.1.0 (2026-04-27) 🆕\n\n- ✅ **Built-in Newbie Wizard** (auto-launches on first run)\n- ✅ Support for tutorial-based API key acquisition\n- ✅ Auto-create folder structure\n- ✅ Updated to V9.5 processing logic\n- ✅ Removed \"General Knowledge\" catch-all category\n- ✅ Support LLM free naming for categories\n- ✅ Added `setup_wizard.py` wizard script\n\n### v1.0.0 (2026-03-17)\n\n- ✅ Initial release\n- ✅ OCR support (Tencent Cloud, Baidu Cloud, Tesseract)\n- ✅ AI smart categorization and document merging\n- ✅ Word + Markdown dual-format output\n- ✅ IMA sync feature\n\n---\n\n## 📄 License\n\nThis project is licensed under the MIT License — see the [LICENSE](LICENSE) file for details.\n\n---\n\n## 🙏 Acknowledgements\n\n- [WorkBuddy](https://workbuddy.ai) - AI assistant platform\n- [Tencent Cloud OCR](https://cloud.tencent.com/product/ocr) - OCR service\n- [Baidu Cloud OCR](https://ai.baidu.com/tech/ocr) - OCR service\n- [Tesseract](https://github.com/tesseract-ocr/tesseract) - Open-source OCR engine\n\n---\n\n## 📧 Contact\n\n- GitHub Issues: [Submit an issue](https://github.com/haoyiyong985/image-knowledge-converter/issues)\n- Email: (add your contact)\n\n---\n\n**⭐ If this project helps you, please give it a star!**\n\nArchive v1.2.8: 30 files, 92205 bytes\n\nFiles: assets/SCREENSHOTS_GUIDE.md (3707b), auto_process_all_v9_4.py (104708b), baidu_ocr.py (4622b), config/api_keys_template.txt (4666b), config/api_keys.yaml (465b), config/categories.yaml (6342b), config/config.yaml (1604b), config/processing_config.yaml (1039b), config/processing_rules.yaml (3071b), docs/first-batch-results.txt (3496b), docs/installation.md (3450b), docs/multi-engine-ocr.md (4723b), docs/ocr-fallback.md (3793b), docs/quick-start.md (5871b), docs/switch-model-guide.md (4699b), docs/usage.md (6106b), local_ocr.py (1726b), quick_setup.py (3681b), README_EN.md (17158b), README.md (16811b), references/usage-guide.md (1361b), requirements_full.txt (321b), requirements_min.txt (224b), requirements.txt (660b), setup_wizard.py (30130b), skill-card.md (2339b), SKILL.md (8268b), tencent_ocr.py (7789b), wizard_processor.py (12184b), _meta.json (144b)\n\nFile v1.2.8:SKILL.md\n\n---\r\nname: image-knowledge-converter\r\ndescription: \"图片截图转知识库工具（OCR + AI）。触发词：第一次使用、配置图片工具、处理新图片\"\r\nversion: 1.2.8\r\ntags: [image-processing, ocr, knowledge-management]\r\n---\r\n\r\n# 🔧 执行指令\r\n\r\n**配置向导触发词：**\r\n当用户说 `第一次使用` / `第一次使用图片处理工具` / `配置图片工具` 时，**AI 启动对话式配置向导**。\r\n\r\n**处理图片触发词：**\r\n当用户说 `处理新图片` / `截图转文档` / `整理截图` 时（这三个触发词等价，均执行相同的处理流程），执行：\r\n\r\n**自动检测工作目录**（优先从以下路径检测）：\r\n1. 命令行参数 `--work-dir <路径>`\r\n2. 环境变量 `WORK_DIR`\r\n3. 脚本所在目录（兜底）\r\n\r\n```\r\n# 方式1：显式指定工作目录（推荐）\r\npython auto_process_all_v9_4.py --work-dir \"D:\\WorkBuddy-Projects\\图片知识库\"\r\n\r\n# 方式2：在工作目录中直接运行\r\ncd \"D:\\WorkBuddy-Projects\\图片知识库\"\r\npython auto_process_all_v9_4.py\r\n\r\n# 方式3：使用环境变量\r\nset WORK_DIR=D:\\WorkBuddy-Projects\\图片知识库\r\npython auto_process_all_v9_4.py\r\n```\r\n\r\n---\r\n\r\n## 📋 对话式配置向导（5步）\r\n\r\n**安全原则：API 密钥不通过对话传递，用户直接在本地模板文件中填写。**\r\n\r\n### 第1步：AI 询问工作文件夹位置\r\n\r\n当用户说\"第一次使用\"时，AI 先询问用户想把工具安装到哪个文件夹：\r\n\r\n```\r\n🤖 我来帮你完成配置！首先需要确定工作文件夹位置。\r\n\r\n这个文件夹将用来存放：\r\n• 你的待处理图片\r\n• 生成的文档\r\n• 配置文件\r\n\r\n请告诉我你想使用的文件夹路径，例如：\r\n  D:\\图片知识库\r\n  或桌面上的任意位置\r\n\r\n（直接回车将使用默认位置）\r\n```\r\n\r\n> **关键**：工作文件夹由用户指定，不是写死的路径。\r\n\r\n### 第2步：AI 创建配置模板\r\n\r\nAI 在用户指定的工作文件夹下创建配置模板：\r\n```\r\n{工作文件夹}\\config\\api_keys_template.txt\r\n```\r\n\r\n### 第3步：AI 引导用户填写\r\n\r\nAI 告诉用户：\r\n```\r\n✅ 配置模板已创建！\r\n\r\n📝 请打开文件并填写配置：\r\n   {工作文件夹}\\config\\api_keys_template.txt\r\n\r\n【填写说明】\r\n\r\n1️⃣  OCR 模式（必选一项，删除前面的 # 启用）：\r\n    # OCR_MODE: cloud    ← 云端方案（腾讯+百度）\r\n    # OCR_MODE: local     ← 本地方案（Tesseract）\r\n    # OCR_MODE: hybrid    ← 兜底方案（云端+本地）\r\n\r\n2️⃣  填写 API 密钥（根据上一步选择填写）：\r\n    - 腾讯云 SecretId/SecretKey\r\n    - 百度云 API Key/Secret Key\r\n    - 或启用 use_tesseract: true\r\n\r\n3️⃣  LLM 配置（如需 AI 智能分析）：\r\n    # 注意：混元(Hunyuan)使用与腾讯云OCR相同的密钥，无需单独配置\r\n    # 如需使用其他LLM，请参考代码中的配置项\r\n    llm_enabled: true\r\n    llm_provider: hunyuan\r\n\r\n4️⃣  IMA 同步（如需自动同步到 IMA，必须改为 true）：\r\n    # 启用：将下方 false 改为 true，并填写 client_id 和 api_key\r\n    # 获取方法：IMA 设置 → API → 创建新的 API Key\r\n    ima_enabled: true          ← 必须改为 true 才能启用\r\n    ima_api_key: 你的API密钥\r\n    ima_client_id: 你的ClientID\r\n\r\n5️⃣  填写完成后保存文件，然后对我说「配置已填写完毕」\r\n```\r\n\r\n### 第4步：AI 处理配置\r\n\r\n用户说「配置已填写完毕后」，AI 自动：\r\n```\r\n# 运行配置处理器（自动检测工作目录）\r\npython wizard_processor.py\r\n\r\n# 或显式指定工作目录\r\npython wizard_processor.py --work-dir \"D:\\WorkBuddy-Projects\\图片知识库\"\r\n```\r\n1. wizard_processor.py 读取模板\r\n2. 生成 `config/api_keys.yaml`\r\n3. 验证配置并显示摘要\r\n\r\n### 第5步：放入图片并处理\r\n\r\n```\r\n✅ 配置完成！\r\n\r\n📁 请把图片放入：\r\n   {工作文件夹}\\待处理图片\r\n\r\n然后对我说「处理新图片」\r\n```\r\n\r\n---\r\n\r\n## 🚀 快速上手\r\n\r\n### 首次使用\r\n1. 说 `第一次使用图片处理工具`\r\n2. AI 创建配置模板\r\n3. 用户直接编辑模板文件（密钥不在对话框中）\r\n4. 用户说「配置已填写完毕」\r\n5. AI 处理配置并验证\r\n6. 放入图片，说「处理新图片」\r\n\r\n### 日常使用\r\n1. 把图片放入 `待处理图片\\`\r\n2. 说「处理新图片」\r\n\r\n---\r\n\r\n## 触发词\r\n\r\n**首次配置（启动向导）：**\r\n- `第一次使用`\r\n- `第一次使用图片处理工具`\r\n- `配置图片工具`\r\n- `首次配置`\r\n\r\n**开始处理（运行脚本）：**\r\n- `处理新图片`\r\n- `截图转文档`\r\n- `整理截图`\r\n\r\n---\r\n\r\n## 目录结构\r\n\r\n```\r\n{工作文件夹}\\           ← 所有文件都在用户指定的工作目录下\r\n├── auto_process_all_v9_4.py ← 主处理脚本（V9.5 支持 --work-dir）\r\n├── wizard_processor.py     ← 配置处理器\r\n├── setup_wizard.py          ← 交互式配置向导（可选）\r\n├── config\\\r\n│   ├── api_keys_template.txt  ← 用户在此填写（本地）\r\n│   └── api_keys.yaml          ← 自动生成\r\n├── 待处理图片\\\r\n├── 已处理图片\\\r\n├── 处理结果\\\r\n│   ├── *.md                  ← 生成的 Markdown 文档\r\n│   ├── *.docx                ← 生成的 Word 文档\r\n│   ├── process.log           ← 运行日志\r\n│   └── 处理报告.json         ← 处理统计报告\r\n└── progress\\                 ← 分批处理状态（自动创建）\r\n```\r\n\r\n---\r\n\r\n## 版本历史\r\n\r\n**v1.2.7 (2026-05-20)**\r\n- ✅ **混元签名修复**：修复 TC3-HMAC-SHA256 签名算法，添加 `x-tc-action` 到 CanonicalHeaders 和 SignedHeaders\r\n- ✅ **Content-Type 修复**：改为 `application/json; charset=utf-8` 与腾讯云官方一致\r\n- ✅ **SDK 依赖移除**：无需安装 `tencentcloud-sdk-python-v3`，只需 `requests` 库\r\n\r\n**v1.2.6 (2026-05-20)**\r\n- ✅ **SDK 依赖移除**：改用腾讯云 REST API 调用混元 LLM，无需安装 `tencentcloud-sdk-python-v3`\r\n- ✅ **混元调用优化**：使用 TC3-HMAC-SHA256 签名认证，与其他 LLM（硅基流动/Kimi/Doubao）一样只需 `requests` 库\r\n- ✅ **LLM 说明优化**：SKILL.md 明确说明混元使用与腾讯云OCR相同的密钥，无需单独配置\r\n- ✅ **配置文件修复**：重新生成 api_keys.yaml 确保嵌套结构正确\r\n\r\n**v1.2.5 (2026-05-20)**\r\n- ✅ **IMA 解析修复**：wizard_processor.py 现在同时支持注释和无注释格式的 `ima_enabled`\r\n- ✅ **模板解析修复**：优先用冒号分隔（支持 base64 值中含 `=` 的情况）\r\n- ✅ **IMA 模板优化**：api_keys_template.txt 中 IMA 配置说明更清晰，明确标注\"必须改为 true\"\r\n- ✅ **SKILL.md 更新**：配置向导第3步中 IMA 配置说明更详细\r\n\r\n**v1.2.4 (2026-05-20)**\r\n- ✅ **核心修复**：`auto_process_all_v9_4.py` 支持 `--work-dir` 命令行参数指定工作目录\r\n- ✅ **路径统一**：所有路径引用（配置/输入/输出/日志）改为基于工作目录，不再依赖脚本所在目录\r\n- ✅ **向后兼容**：不指定工作目录时，自动使用脚本所在目录（保持原有行为）\r\n\r\n**v1.2.3 (2026-05-20)**\r\n- ✅ **路径修复**：`wizard_processor.py` 的 `get_work_folder()` 不再硬编码默认路径，改为动态检测脚本目录\r\n- ✅ **路径修复**：`SKILL.md` 移除所有硬编码示例路径，改为 `{工作文件夹}` 占位符\r\n- ✅ **流程优化**：配置向导明确要求 AI 先询问用户指定工作文件夹位置\r\n\r\n**v1.2.2 (2026-05-20)**\r\n- ✅ **安全升级**：API 密钥完全不在对话中传输，用户直接编辑本地模板文件\r\n- ✅ **流程优化**：从 6 步优化为 5 步（新增第1步：AI 询问用户指定工作文件夹）\r\n- ✅ **IMA 修复**：修复了 IMA 配置无法加载的问题（添加 client_id 支持）\r\n- ✅ **OCR 新增 C 兜底选项**\r\n\r\n**v1.2.1 (2026-05-20)**\r\n- ✅ **安全升级**：API 密钥统一写入模板文件后由系统处理\r\n- ✅ **OCR 新增兜底方案**：A（云端）、B（本地）、C（A+B 兜底）\r\n- ✅ **自动验证配置**\r\n\r\n**v1.2.0 (2026-05-10)**\r\n- ✅ 重构为对话式配置向导\r\n\r\n**v1.1.0 (2026-04-27)**\r\n- ✅ 初始版本\n\nFile v1.2.8:README.md\n\n# 📚 图片知识库整理工具 (Image Knowledge Converter)\r\n\r\n> 自动将手机截图转换为结构化 Word + Markdown 知识文档，并同步到 IMA 个人笔记  \r\n> **新用户第一次使用会自动启动向导，无需任何技术背景！**\r\n\r\n[![GitHub license](https://img.shields.io/badge/license-MIT-blue.svg)](LICENSE)\r\n[![GitHub stars](https://img.shields.io/github/stars/haoyiyong985/image-knowledge-converter?style=social)](https://github.com/haoyiyong985/image-knowledge-converter)\r\n[![WorkBuddy](https://img.shields.io/badge/WorkBuddy-Skill-green)](https://workbuddy.ai)\r\n\r\n🌐 [中文](README.md) | [English](README_EN.md)\r\n\r\n---\r\n\r\n## 🌟 项目简介\r\n\r\n**图片知识库整理工具** 是一个智能知识管理助手，能够：\r\n\r\n- 📷 **自动识别**：从手机截图（小红书、微信读书、微信等）中提取文字\r\n- 🏷️ **智能分类**：AI 理解内容并自动分类到对应知识主题\r\n- 📝 **生成文档**：输出结构化 Word + Markdown 双格式文档\r\n- 🔗 **自动归档**：按分类整理图片和文档\r\n- 🔄 **内容合并**：相似主题自动合并，避免重复\r\n- ☁️ **云端同步**：一键同步到 IMA 个人笔记\r\n\r\n---\r\n\r\n## ✨ 功能特点\r\n\r\n### 核心功能\r\n\r\n| 功能 | 说明 |\r\n|------|------|\r\n| **OCR 多引擎** | 腾讯云 → 百度云 → 本地 Tesseract（自动降级） |\r\n| **AI 智能分类** | 动态分类体系，支持自由命名和自动新建分类 |\r\n| **文档合并** | 同主题内容自动合并到同一文档 |\r\n| **双格式输出** | 同时生成 `.docx` 和 `.md` 文件 |\r\n| **IMA 同步** | 自动同步到 IMA 笔记（支持增量更新）|\r\n| **分批处理** | 大批量图片智能分批，支持断点续传 |\r\n| **重复检测** | Hash + 主题词相似度双重检测 |\r\n| **新手向导** | 🆕 首次使用自动引导配置，无需技术背景 |\r\n\r\n### 技术亮点\r\n\r\n- ✅ **LLM 全覆盖**：混元 Lite / Kimi / Doubao 多模型兜底\r\n- ✅ **智能命名**：`{分类}-{主题}`，如 `历史文化-钱谦益传`\r\n- ✅ **内容整理**：自动修复 OCR 错误、结构化排版\r\n- ✅ **来源提取**：自动识别小红书、微信等平台来源\r\n- ✅ **新手向导**：第一次使用自动启动交互式配置向导\r\n\r\n---\r\n\r\n## 🚀 快速开始（三步走）\r\n\r\n> **无需选择安装方式！** 无论你用哪种方式安装，第一次运行时都会自动启动**新手向导**，一步步引导你完成配置。\r\n\r\n### 第一步：选择安装方式（任选一种）\r\n\r\n#### 方式 A：WorkBuddy Skill（最简单 ⭐）\r\n\r\n**适合人群**：有 WorkBuddy 账号，想一键使用\r\n\r\n1. 下载 Release 中的 `image-knowledge-converter_v1.1.0_skill.zip`\r\n2. 打开 WorkBuddy → 右上角头像 → **Skills 管理**\r\n3. 点击「导入 Skills」→ 选择下载的 zip → 「立即导入」\r\n4. **对 WorkBuddy 说**：`第一次使用` 或 `初始化`\r\n5. ✅ 向导自动启动，引导你完成配置（约 2 分钟）\r\n\r\n#### 方式 B：完整包（适合自定义 ⭐）\r\n\r\n**适合人群**：想完全控制，或没有 WorkBuddy\r\n\r\n1. 下载 Release 中的 `tupianzhengligongju_wanzheng_v1.1.0.zip`\r\n2. 解压到你想放的位置（如 `D:\\我的图片知识库`）\r\n3. 打开终端，进入解压目录\r\n4. 运行：`python setup_wizard.py`\r\n5. ✅ 向导自动启动，引导你完成配置（约 2 分钟）\r\n\r\n#### 方式 C：Git 克隆（适合开发者）\r\n\r\n**适合人群**：熟悉 Git 和命令行\r\n\r\n```bash\r\ngit clone https://github.com/haoyiyong985/image-knowledge-converter.git\r\ncd image-knowledge-converter\r\npip install -r requirements.txt\r\npython setup_wizard.py   # ← 启动向导\r\n```\r\n\r\n---\r\n\r\n### 第二步：新手向导（自动启动）\r\n\r\n无论你用哪种方式安装，**第一次运行都会看到这个向导**（不会跳过）：\r\n\r\n```\r\n==================================================\r\n  欢迎使用 图片知识库整理工具！\r\n  我是你的智能助手，第一次使用我来帮你完成配置\r\n  只需 3 步，大概 2 分钟\r\n\r\n  如果你有任何问题，随时问我！\r\n==================================================\r\n```\r\n\r\n#### 向导流程（3 步，约 2 分钟）\r\n\r\n**第 1 步：选择工作文件夹**\r\n```\r\n  步骤 1：选择工作文件夹\r\n  ℹ️ 这是存放图片和生成文档的地方。\r\n  \r\n  建议使用：D:\\Users\\你的用户名\\图片知识库\r\n  \r\n  是否使用默认位置？(y/n，直接回车=使用默认):\r\n```\r\n\r\n- 选 `y` → 自动创建默认文件夹\r\n- 选 `n` → 输入自定义路径（如 `D:\\我的图片库`）\r\n\r\n**第 2 步：配置 OCR 服务（选一个就行）**\r\n```\r\n  步骤 2：配置 OCR 识别服务\r\n  ℹ️ 你需要至少一个 OCR 服务来识别图片中的文字。\r\n  \r\n  请选择 OCR 服务（选一个就行）：\r\n    1. 腾讯云 OCR（推荐，每月免费 1000 次）\r\n      识别率高，免费额度充足\r\n    2. 百度云 OCR（免费，需实名）\r\n      免费额度大，适合大量使用\r\n    3. 本地 Tesseract（完全免费）\r\n      无需联网，但识别率较低\r\n      \r\n  请输入选项编号 (1-3):\r\n```\r\n\r\n- **选 1（腾讯云）** → 向导显示图文教程 → 你填入 `config/api_keys_template.txt` → 向导自动读取并生成配置\r\n- **选 2（百度云）** → 向导显示图文教程 → 你填入 `config/api_keys_template.txt` → 向导自动读取并生成配置\r\n- **选 3（本地）** → 向导提示安装 Tesseract → 配置完成\r\n\r\n**第 3 步：创建文件夹结构**\r\n```\r\n  步骤 3：创建文件夹结构\r\n  ✅ 已创建文件夹：待处理图片\r\n  ✅ 已创建文件夹：已处理图片\r\n  ✅ 已创建文件夹：处理结果\r\n  \r\n  ✅ 配置已保存到 config/api_keys.yaml\r\n```\r\n\r\n**第 4 步（可选）：配置 IMA 同步**\r\n```\r\n  （可选）配置 IMA 同步\r\n  ℹ️ IMA 是一个笔记服务，可以自动同步你生成的文档。\r\n  ℹ️ 如果你不用 IMA，可以直接跳过。\r\n  \r\n  是否配置 IMA 同步？(y/n):\r\n```\r\n\r\n- 选 `y` → 向导提示获取 IMA API Key → 你填入 `config/api_keys_template.txt` → 向导自动读取并生成配置\r\n- 选 `n` → 跳过，随时可以重新运行向导添加\r\n\r\n**完成！**\r\n```\r\n==================================================\r\n  🎉 配置完成！\r\n==================================================\r\n  \r\n  接下来你可以：\r\n  1. 把要处理的图片放到「待处理图片」文件夹里\r\n  2. 运行：python auto_process_all_v9_4.py\r\n  3. 等待处理完成，结果在「处理结果」文件夹里\r\n```\r\n\r\n---\r\n\r\n### 第三步：放入图片，开始处理\r\n\r\n#### 如果使用 WorkBuddy Skill（方式 A）\r\n\r\n1. 把图片放到：`你的工作文件夹\\待处理图片\\`\r\n2. 对 WorkBuddy 说：`处理新图片`\r\n3. 等待处理完成（约 3-5 秒/张）\r\n4. 结果在：`你的工作文件夹\\处理结果\\`\r\n\r\n#### 如果本地运行（方式 B 或 C）\r\n\r\n1. 把图片放到：`你的工作文件夹\\待处理图片\\`\r\n2. 运行：`python auto_process_all_v9_4.py`\r\n3. 等待处理完成（约 3-5 秒/张）\r\n4. 结果在：`你的工作文件夹\\处理结果\\`\r\n\r\n---\r\n\r\n## 📖 使用指南\r\n\r\n### 目录结构\r\n\r\n```\r\n图片知识库\\\r\n├── auto_process_all_v9_4.py   ← 主处理脚本（V9.5 逻辑）\r\n├── setup_wizard.py            ← 新手向导脚本\r\n├── requirements.txt\r\n├── config\\\r\n│   └── api_keys.yaml        ← OCR/IMA 配置（向导自动生成）\r\n├── 待处理图片\\                ← 放入待处理图片\r\n│   ├── 健康养生\\\r\n│   ├── 旅行记录\\\r\n│   └── ...\r\n├── 已处理图片\\                ← 处理完的图片自动归档\r\n└── 处理结果\\                  ← 生成的 Word/Markdown 文档\r\n    ├── 历史文化-钱谦益传.docx\r\n    ├── 历史文化-钱谦益传.md\r\n    └── ...\r\n```\r\n\r\n### 日常使用流程\r\n\r\n#### 第 1 步：放入新图片\r\n\r\n把手机截图复制到 `待处理图片` 文件夹（支持子文件夹分类）：\r\n\r\n```\r\n待处理图片\\健康养生\\  ← 健康类图片\r\n待处理图片\\旅行记录\\  ← 旅行类图片\r\n```\r\n\r\n#### 第 2 步：启动处理\r\n\r\n**WorkBuddy 用户**：\r\n```\r\n处理新图片\r\n```\r\n\r\n**本地用户**：\r\n```bash\r\npython auto_process_all_v9_4.py\r\n```\r\n\r\n#### 第 3 步：查看结果\r\n\r\n处理完成后，打开 `处理结果` 文件夹，你会看到：\r\n\r\n```\r\n处理结果\\\r\n├── 历史文化-钱谦益传.docx    ← Word 格式（可编辑）\r\n├── 历史文化-钱谦益传.md     ← Markdown 格式（纯文本）\r\n├── 营养健康-抗炎饮食.docx\r\n└── 营养健康-抗炎饮食.md\r\n```\r\n\r\n---\r\n\r\n## ⚙️ 配置说明\r\n\r\n### 密钥填写模板（安全改进 ⭐）\r\n\r\n**新用户注意**：为了保护你的 API 密钥安全，**不再需要把密钥发给 WorkBuddy**！\r\n\r\n我们采用 **本地 TXT 文件** 传递密钥：\r\n1. 向导会教你如何获取 API 密钥\r\n2. 你把密钥填入 `config/api_keys_template.txt`（有详细填写说明）\r\n3. 填好后保存，按回车继续\r\n4. 向导自动读取 TXT 文件，生成加密的 YAML 配置文件\r\n\r\n**优势**：\r\n- ✅ 密钥不会出现在聊天记录中\r\n- ✅ 密钥不会通过网络传输（除了正常的 API 调用）\r\n- ✅ 你可以在本地安全地编辑文件\r\n\r\nTXT 模板文件路径：`config/api_keys_template.txt`（向导会自动创建）\r\n\r\n---\r\n\r\n### API 密钥配置（向导自动完成）\r\n\r\n新手向导会在 `config/api_keys.yaml` 生成如下配置：\r\n\r\n```yaml\r\n# OCR 服务（至少配置一个）\r\nocr:\r\n  tencent:\r\n    secret_id: \"你的腾讯云 SecretId\"\r\n    secret_key: \"你的腾讯云 SecretKey\"\r\n  \r\n  # 或百度云\r\n  baidu:\r\n    api_key: \"你的百度云 API Key\"\r\n    secret_key: \"你的百度云 Secret Key\"\r\n\r\n# IMA 同步（可选，向导会问你要不要配置）\r\nima:\r\n  api_key: \"你的 IMA API Key\"\r\n  base_url: \"https://api.ima.tencent.com/v1\"\r\n```\r\n\r\n### 如何获取 API 密钥（向导会一步步教）\r\n\r\n| 服务 | 免费额度 | 获取地址 | 向导支持 |\r\n|------|----------|----------|----------|\r\n| 腾讯云 OCR | 1000次/月 | https://console.cloud.tencent.com/cam/capi | ✅ 图文教程 |\r\n| 百度云 OCR | 50000次/天 | https://console.bce.baidu.com/ | ✅ 图文教程 |\r\n| 本地 Tesseract | 完全免费 | https://github.com/UB-Mannheim/tesseract/wiki | ✅ 安装引导 |\r\n\r\n---\r\n\r\n## 📊 分类体系\r\n\r\n### 预设分类（可自动扩展）\r\n\r\n| 分类 | 说明 | 示例 |\r\n|------|------|------|\r\n| **历史文化** | 历史、人物传记、文化知识 | 钱谦益传、南宋历史 |\r\n| **营养健康** | 饮食、营养、健康知识 | 抗炎饮食、肠道健康 |\r\n| **生活方式** | 运动、睡眠、日常建议 | 日常饮食建议 |\r\n| **教育育儿** | 教育方法、育儿知识 | - |\r\n| **旅游攻略** | 旅行记录、景点介绍 | - |\r\n\r\n### 动态分类\r\n\r\n当内容不属于预设分类时，AI 会：\r\n1. 自动判断新主题名称\r\n2. 自由命名分类\r\n3. 创建新分类并归档\r\n\r\n**示例**：\r\n- 图片内容是关于「摄影技巧」→ AI 自动创建 `摄影技巧` 分类\r\n- 图片内容是关于「编程学习」→ AI 自动创建 `编程学习` 分类\r\n\r\n---\r\n\r\n## 💡 常用指令\r\n\r\n### WorkBuddy 用户\r\n\r\n在 WorkBuddy 对话中可以使用：\r\n\r\n| 指令 | 效果 |\r\n|------|------|\r\n| `第一次使用` 或 `初始化` | 启动新手向导（首次配置） |\r\n| `处理新图片` | 处理所有待处理图片 |\r\n| `处理待处理图片/健康养生` | 只处理指定文件夹的图片 |\r\n| `查看现有文档` | 列出所有文档和章节列表 |\r\n| `重新配置` | 重新运行向导更新配置 |\r\n\r\n### 本地用户\r\n\r\n```bash\r\n# 启动新手向导（首次使用）\r\npython setup_wizard.py\r\n\r\n# 处理图片\r\npython auto_process_all_v9_4.py\r\n\r\n# 分批处理（大量图片）\r\npython auto_process_all_v9_4.py --batch\r\n\r\n# 查看进度\r\npython auto_process_all_v9_4.py --progress\r\n\r\n# 清除状态\r\npython auto_process_all_v9_4.py --clear\r\n```\r\n\r\n---\r\n\r\n## 📂 输出示例\r\n\r\n### 处理结果目录\r\n\r\n```\r\n处理结果\\\r\n├── 历史文化-钱谦益传.docx\r\n├── 历史文化-钱谦益传.md\r\n├── 历史文化-南宋历史概述.docx\r\n├── 历史文化-南宋历史概述.md\r\n└── ...\r\n```\r\n\r\n### 文档内容结构\r\n\r\n```markdown\r\n# 历史文化-钱谦益传\r\n\r\n## 一、生平简介\r\n（OCR 识别内容，AI 自动分段）\r\n\r\n## 二、主要成就\r\n（结构化整理）\r\n\r\n## 三、历史评价\r\n（自动分类归档）\r\n```\r\n\r\n---\r\n\r\n## 🔧 高级功能\r\n\r\n### 分批处理\r\n\r\n处理大量图片时，系统会自动分批：\r\n\r\n| 图片大小 | 每批数量 |\r\n|---------|---------|\r\n| < 500KB | 10 张/批 |\r\n| 500KB-2MB | 6 张/批 |\r\n| 2MB-5MB | 4 张/批 |\r\n| > 5MB | 2 张/批 |\r\n\r\n### 断点续传\r\n\r\n如果处理中断，可以恢复：\r\n\r\n```bash\r\npython auto_process_all_v9_4.py --batch\r\n```\r\n\r\n查看进度：\r\n\r\n```bash\r\npython auto_process_all_v9_4.py --progress\r\n```\r\n\r\n清除状态：\r\n\r\n```bash\r\npython auto_process_all_v9_4.py --clear\r\n```\r\n\r\n---\r\n\r\n## 🐛 常见问题\r\n\r\n### Q1：我是小白，能用好吗？\r\n\r\n**答**：完全可以！  \r\n- 第一次使用会自动启动**新手向导**，一步步教你配置\r\n- 只需 2 分钟，无需任何技术背景\r\n- 配置完成后，每次只需说\"处理新图片\"即可\r\n\r\n### Q2：OCR 识别失败怎么办？\r\n\r\n**解决**：\r\n1. 检查图片清晰度（建议分辨率 ≥ 150 DPI）\r\n2. 确认已配置腾讯云/百度云 OCR\r\n3. 安装本地 Tesseract 作为兜底\r\n\r\n### Q3：文档命名不符合预期？\r\n\r\n**解决**：\r\n- 文档命名格式：`{分类}-{主题}`\r\n- 这是 AI 自动生成的，符合内容主题\r\n- 如需自定义，可修改 `auto_process_all_v9_4.py` 中的命名规则\r\n\r\n### Q4：如何避免重复内容？\r\n\r\n**解决**：\r\n- 系统自动检测重复（Hash + 主题词相似度）\r\n- 重复图片会自动跳过\r\n\r\n### Q5：IMA 同步失败？\r\n\r\n**解决**：\r\n1. 检查 `config/api_keys.yaml` 中的 IMA 配置是否正确\r\n2. 确认凭证未过期\r\n3. 重新运行向导：`python setup_wizard.py`\r\n\r\n---\r\n\r\n## 📈 性能指标\r\n\r\n- **处理速度**：约 3-5 秒/张（取决于 OCR 引擎）\r\n- **识别准确率**：中文 90%+（腾讯云 OCR）\r\n- **支持格式**：JPG, PNG, WEBP, BMP\r\n- **输出格式**：Word (.docx) + Markdown (.md)\r\n\r\n---\r\n\r\n## 🛠️ 技术栈\r\n\r\n| 技术 | 用途 |\r\n|------|------|\r\n| **OCR** | 腾讯云、百度云、Tesseract |\r\n| **AI 分析** | 混元 Lite、Kimi、Doubao |\r\n| **文档生成** | python-docx |\r\n| **同步** | IMA OpenAPI |\r\n| **语言** | Python 3.8+ |\r\n\r\n---\r\n\r\n## 📄 文件说明\r\n\r\n### 核心脚本\r\n\r\n| 文件 | 说明 |\r\n|------|------|\r\n| `auto_process_all_v9_4.py` | 当前最新版本（V9.5 逻辑） |\r\n| `setup_wizard.py` | 🆕 新手向导脚本（首次使用自动启动） |\r\n| `ima_sync.py` | IMA 同步脚本 |\r\n| `classifier_engine.py` | 分类引擎 |\r\n\r\n### 配置文件\r\n\r\n| 文件 | 说明 |\r\n|------|------|\r\n| `config/api_keys.yaml` | OCR/IMA 凭证配置（向导自动生成） |\r\n| `requirements.txt` | Python 依赖列表 |\r\n| `.env` | 环境变量（不提交到 Git） |\r\n\r\n---\r\n\r\n## 🤝 贡献指南\r\n\r\n欢迎提交 Issue 和 Pull Request！\r\n\r\n1. Fork 本仓库\r\n2. 创建你的特性分支 (`git checkout -b feature/AmazingFeature`)\r\n3. 提交你的更改 (`git commit -m 'Add some AmazingFeature'`)\r\n4. 推送到分支 (`git push origin feature/AmazingFeature`)\r\n5. 打开一个 Pull Request\r\n\r\n---\r\n\r\n## 📝 更新日志\r\n\r\n### v1.1.0 (2026-04-27) 🆕\r\n\r\n- ✅ **内置新手向导**（首次使用自动引导配置）\r\n- ✅ 支持图文教程获取 API 密钥\r\n- ✅ 自动创建文件夹结构\r\n- ✅ 更新至 V9.5 处理逻辑\r\n- ✅ 删除\"综合知识\"兜底分类\r\n- ✅ 支持 LLM 自由命名分类\r\n- ✅ 新增 `setup_wizard.py` 向导脚本\r\n\r\n### v1.0.0 (2026-03-17)\r\n\r\n- ✅ 初始版本发布\r\n- ✅ 支持 OCR 识别（腾讯云、百度云、Tesseract）\r\n- ✅ AI 智能分类和文档合并\r\n- ✅ Word + Markdown 双格式输出\r\n- ✅ IMA 同步功能\r\n\r\n---\r\n\r\n## 📄 许可证\r\n\r\n本项目采用 MIT 许可证 - 查看 [LICENSE](LICENSE) 文件了解详情。\r\n\r\n---\r\n\r\n## 🙏 致谢\r\n\r\n- [WorkBuddy](https://workbuddy.ai) - AI 助手平台\r\n- [腾讯云 OCR](https://cloud.tencent.com/product/ocr) - OCR 服务\r\n- [百度云 OCR](https://ai.baidu.com/tech/ocr) - OCR 服务\r\n- [Tesseract](https://github.com/tesseract-ocr/tesseract) - 开源 OCR 引擎\r\n\r\n---\r\n\r\n## 📧 联系\r\n\r\n- GitHub Issues：[提交问题](https://github.com/haoyiyong985/image-knowledge-converter/issues)\r\n- 邮箱：（添加你的联系方式）\r\n\r\n---\r\n\r\n**⭐ 如果这个项目对你有帮助，请给它一个星标！**\n\nFile v1.2.8:_meta.json\n\n{\n  \"ownerId\": \"kn7fh9qe66jy2s283bfvw6b61d89w2cv\",\n  \"slug\": \"image-knowledge-converter\",\n  \"version\": \"1.2.8\",\n  \"publishedAt\": 1783748912395\n}\n\nFile v1.2.8:references/usage-guide.md\n\n# 图片知识库整理工具 - 使用指南\n\n## 快速开始\n\n### 1. 安装依赖\n```bash\npip install -r requirements.txt\n```\n\n### 2. 初始化\n运行脚本后选择「初始化知识库」，会自动创建：\n- `待处理图片/` - 放入待处理截图\n- `已处理图片/` - 自动归档\n- `处理结果/` - 生成的 Word/MD 文档\n\n### 3. 放入图片\n将截图放入 `待处理图片/<主题>/`，例如：\n```\n待处理图片/中医养生/截图1.png\n待处理图片/健康饮食/截图2.png\n```\n\n### 4. 开始处理\n```bash\npython auto_process_all_v9_4.py\n```\n\n---\n\n## 常用命令\n\n| 命令 | 说明 |\n|------|------|\n| `python auto_process_all_v9_4.py` | 处理所有待处理图片 |\n| 查看 `处理结果/` 目录 | 查看已生成的文档 |\n\n---\n\n## OCR 配置\n\n支持三种 OCR 引擎（自动降级）：\n1. 腾讯云 OCR（优先）\n2. 百度云 OCR（备用）\n3. 本地 Tesseract（兜底）\n\n配置方法见 `docs/multi-engine-ocr.md`\n\n---\n\n## IMA 同步（可选）\n\n1. 获取 IMA OpenAPI 凭证\n2. 编辑 `ima_config.txt` 填入凭证\n3. 运行脚本时会自动同步\n\n---\n\n## 常见问题\n\n**Q: 处理失败？**  \nA: 检查 `logs/` 目录中的日志文件。\n\n**Q: 如何切换 AI 模型？**  \nA: 参见 `docs/switch-model-guide.md`。\n\n**Q: 图片识别不准确？**  \nA: 确保图片清晰，或配置更强大的 OCR 引擎。\n\nFile v1.2.8:assets/SCREENSHOTS_GUIDE.md\n\n# 项目截图使用指南\n\n本目录用于存放项目截图和示例图片。\n\n## 📷 推荐的截图类型\n\n### 1. 产品界面截图\n| 截图名称 | 内容 | 用途 |\n|---------|------|------|\n| `screenshot_workbuddy_main.png` | WorkBuddy 主界面 | README 展示 |\n| `screenshot_skill_list.png` | Skills 列表（显示本技能） | 使用指南 |\n| `screenshot_import_skill.png` | 导入 Skill 界面 | 安装教程 |\n\n### 2. 操作步骤截图\n| 截图名称 | 内容 | 用途 |\n|---------|------|------|\n| `screenshot_init.png` | 初始化知识库 | 使用指南 |\n| `screenshot_folder_empty.png` | 空文件夹（待处理图片） | 使用指南 |\n| `screenshot_folder_with_images.png` | 放入图片后的文件夹 | 使用指南 |\n| `screenshot_processing.png` | AI 正在处理 | 使用指南 |\n| `screenshot_complete.png` | 处理完成提示 | 使用指南 |\n\n### 3. 文档效果截图\n| 截图名称 | 内容 | 用途 |\n|---------|------|------|\n| `screenshot_word_doc.png` | Word 文档效果 | README 展示 |\n| `screenshot_md_doc.png` | Markdown 文档效果 | README 展示 |\n| `screenshot_folder_structure.png` | 目录结构 | 使用指南 |\n\n### 4. 对比效果截图（用于推广）\n| 截图名称 | 内容 | 用途 |\n|---------|------|------|\n| `screenshot_before.png` | 原始截图（处理前） | 推广素材 |\n| `screenshot_after.png` | 整理后的文档（处理完） | 推广素材 |\n\n---\n\n## 📸 如何准备截图\n\n### Windows 截图方法\n\n#### 方法一：PrintScreen 键\n1. 按 `PrtSc` 键（全屏截图）\n2. 打开画图工具（Win + R → 输入 `mspaint`）\n3. 粘贴（Ctrl + V）\n4. 保存为 PNG 格式\n\n#### 方法二：Win + Shift + S（推荐）\n1. 按 `Win + Shift + S`\n2. 选择截图区域\n3. 截图自动复制到剪贴板\n4. 粘贴到文件并保存\n\n#### 方法三：使用 Snipaste（第三方工具）\n- 下载：https://www.snipaste.com/\n- 按 F1 截图，F3 贴图\n\n---\n\n## 📂 目录结构示例\n\n```\nassets/\n└── screenshots/\n    ├── 产品界面/\n    │   ├── workbuddy_main.png\n    │   ├── skill_list.png\n    │   └── import_skill.png\n    ├── 操作步骤/\n    │   ├── init.png\n    │   ├── folder_empty.png\n    │   ├── folder_with_images.png\n    │   ├── processing.png\n    │   └── complete.png\n    ├── 文档效果/\n    │   ├── word_doc.png\n    │   ├── md_doc.png\n    │   └── folder_structure.png\n    └── 对比效果/\n        ├── before.png\n        └── after.png\n```\n\n---\n\n## 📝 在 README.md 中添加截图\n\n准备好截图后，可以在 README.md 中添加以下部分：\n\n```markdown\n## 📸 效果展示\n\n### 处理前（原始截图）\n![处理前](assets/screenshots/对比效果/before.png)\n\n### 处理完（生成的文档）\n![处理完](assets/screenshots/对比效果/after.png)\n\n### Word 文档效果\n![Word 文档](assets/screenshots/文档效果/word_doc.png)\n\n### Markdown 文档效果\n![Markdown 文档](assets/screenshots/文档效果/md_doc.png)\n```\n\n---\n\n## 🚀 快速开始\n\n1. **准备截图**：按照上面的推荐清单拍摄\n2. **放入目录**：将截图文件放入 `assets/screenshots/` 对应子目录\n3. **提交到 Git**：\n   ```bash\n   git add assets/screenshots/\n   git commit -m \"docs: add project screenshots\"\n   git push origin master\n   ```\n4. **更新 README**：在 README.md 中添加截图展示部分\n\n---\n\n## 💡 提示\n\n- ✅ 使用 PNG 格式（清晰度更高）\n- ✅ 截图分辨率建议 1920x1080 或 1280x720\n- ✅ 确保截图中的文字清晰可读\n- ✅ 可以稍后补充，不影响项目正常使用\n\n---\n\n**祝你使用愉快！** 🎉\n\nFile v1.2.8:docs/installation.md\n\n# 📦 图片知识库转化工具 v1.0 - 安装说明\r\n\r\n---\r\n\r\n## ✅ Skill 已自动安装到你的电脑！\r\n\r\n### 安装位置\r\n```\r\nC:\\Users\\LENOVO\\.workbuddy\\skills\\image-knowledge-converter\\\r\n```\r\n\r\n---\r\n\r\n## 🚀 如何使用\r\n\r\n### 方法1：自动识别（推荐）\r\n\r\nWorkBuddy 会自动识别新安装的 Skill，你可以直接使用以下指令：\r\n\r\n```\r\n初始化知识库\r\n```\r\n```\r\n处理新图片\r\n```\r\n```\r\n处理待处理图片/主题名\r\n```\r\n```\r\n查看现有文档\r\n```\r\n```\r\n工具优化\r\n```\r\n\r\n### 方法2：手动触发\r\n\r\n如果自动识别失败，可以手动加载 Skill：\r\n\r\n1. 打开 WorkBuddy\r\n2. 点击右上角头像 → **Skills 管理**\r\n3. 找到 **图片知识库转化工具 (image-knowledge-converter)**\r\n4. 点击 **启用**\r\n\r\n---\r\n\r\n## 📁 文件位置说明\r\n\r\n### 你的项目文件\r\n```\r\nD:\\新建文件夹\\\r\n├── 待处理图片\\        ← 放新截图的文件夹\r\n├── 处理结果\\          ← 生成的文档在这里\r\n├── 已处理图片\\        ← 归档的图片\r\n├── ima_config.txt     ← ima 凭证配置\r\n└── auto_process.py    ← 核心处理脚本\r\n```\r\n\r\n### Skill 文件（已安装）\r\n```\r\nC:\\Users\\LENOVO\\.workbuddy\\skills\\\r\n└── image-knowledge-converter\\\r\n    └── SKILL.md       ← WorkBuddy 会自动读取\r\n```\r\n\r\n---\r\n\r\n## 🧪 开始测试\r\n\r\n按照以下步骤测试 Skill 是否正常工作：\r\n\r\n### 第1步：准备测试图片\r\n\r\n在 `D:\\新建文件夹\\待处理图片\\` 下创建测试文件夹，例如：\r\n\r\n```\r\nD:\\新建文件夹\\待处理图片\\测试\\\r\n```\r\n\r\n放入 2-3 张手机截图\r\n\r\n### 第2步：初始化知识库\r\n\r\n在 WorkBuddy 中输入：\r\n\r\n```\r\n初始化知识库\r\n```\r\n\r\n### 第3步：处理图片\r\n\r\n在 WorkBuddy 中输入：\r\n\r\n```\r\n处理新图片\r\n```\r\n\r\n### 第4步：查看结果\r\n\r\n打开 `D:\\新建文件夹\\处理结果\\` 查看：\r\n- `.docx` 文件 - Word 文档\r\n- `.md` 文件 - Markdown 文档\r\n- `.txt` 文件 - 处理日志\r\n\r\n---\r\n\r\n## ✅ 测试检查清单\r\n\r\n- [ ] Skill 已成功安装到 `C:\\Users\\LENOVO\\.workbuddy\\skills\\image-knowledge-converter\\`\r\n- [ ] WorkBuddy 能识别 Skill（输入 \"/\" 查看可用技能）\r\n- [ ] 初始化知识库成功\r\n- [ ] 测试图片成功处理\r\n- [ ] 生成的文档格式正确\r\n- [ ] 图片成功归档\r\n\r\n---\r\n\r\n## 🤔 遇到问题？\r\n\r\n### 问题1：Skill 没有被识别\r\n**解决**：\r\n1. 重启 WorkBuddy\r\n2. 或点击右上角头像 → Skills 管理 → 刷新\r\n\r\n### 问题2：处理图片报错\r\n**解决**：\r\n1. 检查 `D:\\新建文件夹\\待处理图片\\` 路径是否正确\r\n2. 截图错误信息发给我\r\n\r\n### 问题3：找不到文档\r\n**解决**：\r\n1. 检查 `D:\\新建文件夹\\处理结果\\` 文件夹\r\n2. 查看处理日志（每次处理会生成日志）\r\n\r\n---\r\n\r\n## 📝 重要提醒\r\n\r\n- ✅ **无需手动导入 ZIP** - Skill 已直接安装在正确位置\r\n- ✅ **WorkBuddy 会自动识别** - 重启即可生效\r\n- ✅ **项目文件在 D:\\新建文件夹\\** - 所有操作都在这个目录\r\n- ✅ **随时找我帮忙** - 遇到任何问题告诉我\r\n\r\n---\r\n\r\n## 🎯 下一步\r\n\r\n1. **测试 Skill** - 按照上面的测试步骤操作\r\n2. **查看计划** - 打开 `本周行动计划.md`\r\n3. **遇到问题** - 截图或复制错误信息给我\r\n\r\n---\r\n\r\n**安装时间**: 2026-03-17\r\n**Skill 版本**: v1.0\r\n**支持文档**: `本周行动计划.md` | `测试检查清单.md` | `使用说明.md`\n\nFile v1.2.8:docs/multi-engine-ocr.md\n\n# 多引擎 OCR 使用说明\r\n\r\n## 🎯 功能概述\r\n\r\n图片知识库工具现已支持**多 OCR 引擎自动切换**，当首选引擎达到频率限制时，会自动提示您选择备用引擎。\r\n\r\n### 支持的 OCR 引擎\r\n\r\n| 优先级 | 引擎 | 免费额度 | 特点 |\r\n|-------|------|---------|------|\r\n| 1 | 腾讯云 OCR | 1000次/月 | 首选，中文识别准确 |\r\n| 2 | 百度 OCR | 50000次/月 | 第一备用，额度充足 |\r\n| 3 | 本地 Tesseract | 无限 | 第二备用，无需网络 |\r\n\r\n---\r\n\r\n## 📦 文件说明\r\n\r\n| 文件 | 功能 |\r\n|-----|------|\r\n| `tencent_ocr.py` | 腾讯云 OCR 模块 |\r\n| `baidu_ocr.py` | 百度 OCR 模块 |\r\n| `local_ocr.py` | 本地 Tesseract 模块 |\r\n| `ocr_manager.py` | OCR 管理器（多引擎切换） |\r\n| `auto_process_v2.py` | 主程序（使用多引擎） |\r\n\r\n---\r\n\r\n## 🚀 使用方法\r\n\r\n### 方式一：使用默认配置（腾讯云）\r\n\r\n```bash\r\npython auto_process_v2.py\r\n```\r\n\r\n程序会自动使用已配置的腾讯云 OCR。\r\n\r\n### 方式二：当腾讯云达到频率限制\r\n\r\n当提示\"已达频率上限\"时，会弹出选择窗口：\r\n\r\n```\r\n⚠️ 腾讯云 OCR 达到频率限制\r\n\r\n请选择其他 OCR 引擎:\r\n\r\n✓ 腾讯云 OCR: 已配置\r\n✗ 百度 OCR: 未配置 API 密钥\r\n✗ 本地 Tesseract: 未安装\r\n\r\n请选择（输入数字）:\r\n1 - 腾讯云 OCR\r\n2 - 百度 OCR\r\n3 - 本地 Tesseract\r\n0 - 取消\r\n```\r\n\r\n**选择 2 或 3 切换到备用引擎**\r\n\r\n---\r\n\r\n## 🔧 配置备用引擎\r\n\r\n### 配置百度 OCR（推荐作为备用）\r\n\r\n**步骤 1：申请百度 OCR**\r\n1. 访问 https://ai.baidu.com/tech/ocr\r\n2. 登录百度账号\r\n3. 点击「立即使用」\r\n4. 创建应用，获取 AppID、API Key、Secret Key\r\n\r\n**步骤 2：配置密钥**\r\n\r\n编辑 `ocr_manager.py`，在文件开头添加：\r\n\r\n```python\r\n# 设置默认 API 密钥（腾讯云）\r\nos.environ['TENCENT_SECRET_ID'] = '你的腾讯云SecretId'\r\nos.environ['TENCENT_SECRET_KEY'] = '你的腾讯云SecretKey'\r\n\r\n# 设置百度 OCR 密钥\r\nos.environ['BAIDU_APP_ID'] = '你的百度AppID'\r\nos.environ['BAIDU_API_KEY'] = '你的百度APIKey'\r\nos.environ['BAIDU_SECRET_KEY'] = '你的百度SecretKey'\r\n```\r\n\r\n---\r\n\r\n### 配置本地 Tesseract\r\n\r\n**步骤 1：安装 Tesseract**\r\n\r\n1. 下载安装包：https://github.com/UB-Mannheim/tesseract/wiki\r\n2. 运行安装程序\r\n3. **重要**：安装时勾选中文语言包 (chi_sim)\r\n4. 将 Tesseract 安装目录添加到系统 PATH\r\n\r\n**步骤 2：安装 Python 包**\r\n\r\n```bash\r\npip install pytesseract pillow\r\n```\r\n\r\n**步骤 3：验证安装**\r\n\r\n```bash\r\ntesseract --version\r\n```\r\n\r\n---\r\n\r\n## 📋 使用流程示例\r\n\r\n### 场景 1：正常处理\r\n\r\n```\r\n开始处理\r\n  ↓\r\n自动选择腾讯云 OCR\r\n  ↓\r\n识别图片 ✓\r\n  ↓\r\n完成\r\n```\r\n\r\n### 场景 2：达到频率限制\r\n\r\n```\r\n开始处理\r\n  ↓\r\n自动选择腾讯云 OCR\r\n  ↓\r\n识别第 10 张图片...\r\n  ↓\r\n⚠️ 达到频率限制！\r\n  ↓\r\n[弹窗] 请选择备用引擎\r\n  ↓\r\n用户选择: 百度 OCR\r\n  ↓\r\n切换到百度 OCR\r\n  ↓\r\n继续识别剩余图片 ✓\r\n  ↓\r\n完成\r\n```\r\n\r\n---\r\n\r\n## 💡 最佳实践\r\n\r\n### 推荐配置\r\n\r\n**配置 1：腾讯云 + 百度（推荐）**\r\n- 首选：腾讯云（1000次/月）\r\n- 备用：百度（50000次/月）\r\n- 优点：额度充足，识别准确\r\n\r\n**配置 2：腾讯云 + 本地 Tesseract**\r\n- 首选：腾讯云\r\n- 备用：本地 Tesseract\r\n- 优点：完全免费，无需申请多个账号\r\n\r\n### 批量处理策略\r\n\r\n1. **小批量处理**：每次处理 5-10 张图片\r\n2. **遇到限制切换**：频率限制时立即切换备用引擎\r\n3. **错峰处理**：不同时间段使用不同引擎\r\n\r\n---\r\n\r\n## ⚠️ 常见问题\r\n\r\n### Q1: 弹窗没有显示\r\n\r\n**A**: 确保您的环境支持 GUI。如果在无界面环境运行，可以修改代码使用命令行选择：\r\n\r\n```python\r\n# 在 ocr_manager.py 中添加命令行选择模式\r\n```\r\n\r\n### Q2: 百度 OCR 如何申请\r\n\r\n**A**: \r\n1. 访问 https://ai.baidu.com/tech/ocr/general\r\n2. 点击「立即使用」\r\n3. 创建应用后获取密钥\r\n4. 免费额度：50000次/月\r\n\r\n### Q3: Tesseract 识别中文效果差\r\n\r\n**A**:\r\n1. 确保安装了中文语言包 `chi_sim.traineddata`\r\n2. 确保语言包在 Tesseract 的 `tessdata` 目录\r\n3. 初始化时指定语言：`LocalOCR(lang='chi_sim+eng')`\r\n\r\n### Q4: 如何查看当前使用的引擎\r\n\r\n**A**: 程序启动时会显示：\r\n```\r\n当前使用引擎: 腾讯云 OCR\r\n```\r\n\r\n---\r\n\r\n## 🔗 相关链接\r\n\r\n- 腾讯云 OCR：https://cloud.tencent.com/product/ocr\r\n- 百度 OCR：https://ai.baidu.com/tech/ocr\r\n- Tesseract：https://github.com/tesseract-ocr/tesseract\r\n\r\n---\r\n\r\n**现在您可以无忧处理大量图片了！** 🎉\n\nFile v1.2.8:docs/ocr-fallback.md\n\n# OCR引擎自动回退机制说明\r\n\r\n**更新日期**: 2026年4月5日  \r\n**版本**: v1.2\r\n\r\n---\r\n\r\n## 🔄 自动回退流程\r\n\r\n当调用OCR引擎时，系统会按以下优先级自动选择和回退：\r\n\r\n```\r\n第1优先级: 腾讯云OCR (1000次/月)\r\n    ↓ 额度用完或调用失败\r\n第2优先级: 百度云OCR (1000次/月)\r\n    ↓ 额度用完或调用失败\r\n第3优先级: AI视觉识别 (无限制)\r\n```\r\n\r\n---\r\n\r\n## 📊 引擎配置\r\n\r\n| 引擎 | 优先级 | 免费额度 | 特点 |\r\n|------|--------|----------|------|\r\n| 腾讯云OCR | 1 | 1000次/月 | 精度最高 |\r\n| 百度云OCR | 2 | 1000次/月 | 性价比高 |\r\n| AI视觉识别 | 3 | 无限 | 兜底方案 |\r\n\r\n**合计免费额度**: 2000次/月\r\n\r\n---\r\n\r\n## ⚙️ 回退触发条件\r\n\r\n### 1. 额度用完自动回退\r\n\r\n当某个引擎的日使用量达到限额时，自动切换到下一个引擎：\r\n\r\n```python\r\n# 伪代码\r\nif 腾讯云使用量 >= 1000:\r\n    使用百度云OCR\r\nelif 百度云使用量 >= 1000:\r\n    使用AI视觉识别\r\n```\r\n\r\n### 2. 调用失败自动回退\r\n\r\n当API调用失败时（如网络错误、权限不足等），自动标记该引擎为\"已用完\"并切换到下一个：\r\n\r\n```python\r\ntry:\r\n    result = 腾讯云OCR识别()\r\nexcept Exception as e:\r\n    标记腾讯云为失败状态\r\n    return 递归调用下一个引擎()\r\n```\r\n\r\n### 3. 未配置自动跳过\r\n\r\n如果某个引擎没有配置API密钥，自动跳过：\r\n\r\n```python\r\nif 未配置腾讯云密钥:\r\n    跳过腾讯云，尝试百度云\r\nif 未配置百度云密钥:\r\n    跳过百度云，直接使用AI视觉\r\n```\r\n\r\n---\r\n\r\n## 📝 使用示例\r\n\r\n### 基本使用\r\n\r\n```python\r\nfrom ocr_engine_manager import get_ocr_manager\r\n\r\nmanager = get_ocr_manager()\r\n\r\n# 自动选择可用引擎\r\nresult, engine_name = manager.recognize_image(\"图片路径.jpg\")\r\n\r\nif result == \"__AI_VISION__\":\r\n    print(\"云OCR额度已用完，需要使用AI视觉识别\")\r\nelse:\r\n    print(f\"使用 {engine_name} 识别成功\")\r\n```\r\n\r\n### 查看当前状态\r\n\r\n```python\r\nstatus = manager.get_status()\r\nprint(f\"当前引擎: {status['current_engine']}\")\r\n\r\nfor engine_id, info in status['engines'].items():\r\n    print(f\"{info['name']}: {info['used_today']}/{info['daily_limit']} (剩余: {info['remaining']})\")\r\n```\r\n\r\n---\r\n\r\n## 💡 使用建议\r\n\r\n### 场景1：月处理量 < 1000张\r\n- 只用腾讯云OCR即可\r\n- 精度最高\r\n\r\n### 场景2：月处理量 1000-2000张\r\n- 腾讯云 + 百度云组合\r\n- 先用完腾讯云，自动切换到百度云\r\n\r\n### 场景3：月处理量 > 2000张\r\n- 前2000张使用云OCR（免费）\r\n- 超出部分使用AI视觉识别\r\n- 或购买百度云次数包（50元/1万次）\r\n\r\n---\r\n\r\n## 🔍 故障排查\r\n\r\n### 问题：一直使用AI视觉，不调用云OCR\r\n\r\n**可能原因**:\r\n1. 云OCR未配置密钥\r\n2. 云OCR额度已用完\r\n3. 云OCR调用失败（权限不足、网络问题）\r\n\r\n**检查方法**:\r\n```bash\r\npython ocr_engine_manager.py\r\n```\r\n\r\n### 问题：百度云返回\"权限不足\"错误\r\n\r\n**原因**: 百度云应用未开通\"通用文字识别\"服务\r\n\r\n**解决**:\r\n1. 登录 https://console.bce.baidu.com/ai/\r\n2. 进入「文字识别」服务\r\n3. 开通「通用文字识别」\r\n\r\n---\r\n\r\n## 📈 使用量追踪\r\n\r\n使用量保存在：\r\n```\r\n.workbuddy/memory/ocr_engine_log.json\r\n```\r\n\r\n格式：\r\n```json\r\n{\r\n  \"date\": \"2026-04-05\",\r\n  \"usage\": {\r\n    \"tencent\": 100,\r\n    \"baidu\": 50,\r\n    \"ai_vision\": 0\r\n  }\r\n}\r\n```\r\n\r\n---\r\n\r\n## ✅ 总结\r\n\r\n- **无需手动切换**，系统自动处理\r\n- **免费额度**: 2000次/月（腾讯云1000 + 百度云1000）\r\n- **超出免费额度**: 自动使用AI视觉识别\r\n- **购买付费包**: 如需更多云OCR调用，可购买百度云次数包\r\n\r\n---\r\n\r\n*文档生成时间: 2026年4月5日*\n\nFile v1.2.8:docs/quick-start.md\n\n# 图片知识库转化工具 v2.0 - 快速入门指南\r\n\r\n> 💡 **一句话说明**：把截图里的文字自动识别出来，整理到文档中\r\n\r\n---\r\n\r\n## 🚀 开始使用（3步走）\r\n\r\n### 第1步：准备图片\r\n\r\n把要处理的截图放到对应文件夹：\r\n\r\n```\r\nD:\\新建文件夹\\待处理图片\\\r\n├── 健康养生\\          ← 放健康养生类截图\r\n├── 肠道健康\\          ← 放肠道健康类截图\r\n├── 中医养生\\          ← 放中医养生类截图\r\n└── 日常饮食\\          ← 放饮食建议类截图\r\n```\r\n\r\n**提示**：\r\n- 支持格式：jpg、jpeg、png、webp、bmp\r\n- 图片越多，越能体现增强版的优势\r\n\r\n---\r\n\r\n### 第2步：运行程序\r\n\r\n双击运行或命令行执行：\r\n\r\n```bash\r\npython run_enhanced.py\r\n```\r\n\r\n---\r\n\r\n### 第3步：选择处理方式\r\n\r\n程序会显示菜单，根据你的情况选择：\r\n\r\n```\r\n📋 场景选择指南:\r\n============================================================\r\n【选项1】图片多/大小不一/首次使用 → 选 🚀 增强版\r\n【选项2】图片少/质量一致/求快速 → 选 📦 原始版\r\n【选项3】想看效果对比/测试安装 → 选 📊 性能测试\r\n【选项4】还没准备好/临时有事 → 选 ❌ 退出\r\n============================================================\r\n```\r\n\r\n---\r\n\r\n## 🎯 选择指南（详细版）\r\n\r\n### 选项1：🚀 增强版处理器\r\n\r\n**适合你的情况**：\r\n- ✅ 图片超过 20 张\r\n- ✅ 图片大小不一（有的几KB，有的几MB）\r\n- ✅ 第一次使用这个工具\r\n- ✅ 希望处理得更快\r\n- ✅ 不想处理到一半卡住\r\n\r\n**你会得到**：\r\n- 智能分批（大图小图分开处理）\r\n- 并发处理（同时处理多张）\r\n- 实时进度条（知道还要等多久）\r\n- 自动切换OCR（一个引擎限制自动换另一个）\r\n- 自动去重（相同内容只保留一份）\r\n\r\n**示例**：\r\n> 你有 100 张小红书截图，有的清晰有的模糊，大小不一。选这个！\r\n\r\n---\r\n\r\n### 选项2：📦 原始处理器\r\n\r\n**适合你的情况**：\r\n- ✅ 图片少于 20 张\r\n- ✅ 图片都很清晰（比如微信读书截图）\r\n- ✅ 想快点开始处理\r\n- ✅ 已经用熟了原来的方式\r\n\r\n**你会得到**：\r\n- 简单直接的处理\r\n- 快速启动\r\n- 和原来一样的体验\r\n\r\n**注意**：\r\n- 处理大量图片时可能会慢\r\n- 遇到OCR频率限制需要手动切换\r\n\r\n**示例**：\r\n> 你只有 8 张微信读书截图，都很清晰。选这个！\r\n\r\n---\r\n\r\n### 选项3：📊 运行性能测试\r\n\r\n**适合你的情况**：\r\n- ✅ 想知道增强版到底快多少\r\n- ✅ 检查安装是否正确\r\n- ✅ 想生成对比报告发朋友圈\r\n\r\n**你会得到**：\r\n- 两个版本的性能对比\r\n- 可视化的 HTML 报告\r\n- 处理速度、内存占用等数据\r\n\r\n**示例**：\r\n> 你想给朋友展示这个工具多厉害。选这个生成报告！\r\n\r\n---\r\n\r\n### 选项4：❌ 退出\r\n\r\n**适合你的情况**：\r\n- ✅ 突然有事要忙\r\n- ✅ 发现图片还没放好\r\n- ✅ 想先整理一下再处理\r\n\r\n---\r\n\r\n## 📊 快速决策表\r\n\r\n| 你的情况 | 选哪个 | 为什么 |\r\n|---------|-------|-------|\r\n| 第一次用 | 选项1 | 最智能，不容易出错 |\r\n| 图片 > 50 张 | 选项1 | 需要分批和并发 |\r\n| 图片 < 10 张 | 选项2 | 简单任务，快速完成 |\r\n| 想对比效果 | 选项3 | 生成对比报告 |\r\n| 不确定 | 选项1 | 默认推荐，最安全 |\r\n\r\n---\r\n\r\n## ⚡ 处理完成后的结果\r\n\r\n处理完成后，你会在以下位置找到结果：\r\n\r\n```\r\nD:\\新建文件夹\\处理结果\\\r\n├── 01_抗炎饮食与营养科普.md    ← 健康养生类内容\r\n├── 02_肠道健康与饮食分类.md    ← 肠道健康类内容\r\n├── 03_中医养生与食疗.md        ← 中医养生类内容\r\n├── 04_日常饮食建议.md          ← 日常饮食类内容\r\n└── reports\\                    ← HTML处理报告\r\n    └── report_xxx.html         ← 可视化处理统计\r\n```\r\n\r\n同时，处理过的图片会被移动到：\r\n```\r\nD:\\新建文件夹\\已处理图片\\[主题名]\\batch_001_20260319\\\r\n```\r\n\r\n---\r\n\r\n## ❓ 常见问题\r\n\r\n### Q1：我应该选增强版还是原始版？\r\n\r\n**简单判断**：\r\n- 图片超过 20 张 → 增强版\r\n- 图片少于 10 张 → 原始版\r\n- 不确定 → 增强版（默认推荐）\r\n\r\n### Q2：处理过程中可以中断吗？\r\n\r\n**可以**：\r\n- 按 `Ctrl+C` 可以中断\r\n- 已处理的内容会保存\r\n- 下次可以从中断处继续\r\n\r\n### Q3：处理失败了怎么办？\r\n\r\n**排查步骤**：\r\n1. 检查网络连接（需要联网调用OCR）\r\n2. 检查OCR密钥是否配置正确\r\n3. 尝试切换OCR引擎（增强版会自动切换）\r\n4. 减少图片数量再试\r\n\r\n### Q4：为什么推荐交互式启动？\r\n\r\n**好处**：\r\n- 先看到有多少图片，再决定怎么处理\r\n- 防止误操作（比如不小心处理了错误的图片）\r\n- 可以中途改变主意\r\n- 新手友好，有明确提示\r\n\r\n---\r\n\r\n## 🎓 进阶技巧\r\n\r\n### 技巧1：批量整理图片\r\n\r\n处理前先把图片按主题分类放好，处理后会自动归档到对应文档。\r\n\r\n### 技巧2：定期生成报告\r\n\r\n处理完成后选择生成报告，可以看到：\r\n- 处理了多少张图片\r\n- 成功率多少\r\n- 用了多长时间\r\n- 哪些图片失败了\r\n\r\n### 技巧3：处理大量图片\r\n\r\n如果一次有几百张图片：\r\n1. 分批放入（每次 50-100 张）\r\n2. 使用增强版（智能分批）\r\n3. 晚上挂机处理（不用盯着）\r\n\r\n---\r\n\r\n## 📞 需要帮助？\r\n\r\n遇到问题请检查：\r\n1. 图片是否放在了正确的文件夹\r\n2. 网络是否连接正常\r\n3. OCR密钥是否配置正确\r\n4. 查看 `logs/` 目录下的错误日志\r\n\r\n---\r\n\r\n**文档版本**: v2.0  \r\n**最后更新**: 2026-03-19  \r\n**适用工具版本**: 图片知识库转化工具 v2.0+\n\nFile v1.2.8:docs/switch-model-guide.md\n\n# 🔄 WorkBuddy 切换到支持图片的模型 - 详细指南\r\n\r\n---\r\n\r\n## 🎯 目标\r\n\r\n切换到支持图片识别的 AI 模型，让「图片知识库转化工具」能够正常工作。\r\n\r\n---\r\n\r\n## 📍 第1步：打开模型设置\r\n\r\n### 方法1：通过右上角头像（推荐）\r\n\r\n1. **打开 WorkBuddy**\r\n2. **点击右上角头像**\r\n3. **进入「设置」**\r\n4. **点击「AI模型」**\r\n\r\n---\r\n\r\n## 🔧 第2步：选择支持图片的模型\r\n\r\n### WorkBuddy 支持的模型类型\r\n\r\n根据搜索结果，WorkBuddy 内置了多种主流 AI 模型：\r\n\r\n| 模型类型 | 特点 | 是否支持图片 | 推荐用途 |\r\n|---------|------|-------------|---------|\r\n| **Hunyuan（混元）** | 擅长中文理解 | ❓ 待确认 | 中文文档写作 |\r\n| **GLM** | 中文能力强 | ❓ 待确认 | 中文任务 |\r\n| **DeepSeek** | 推理能力强 | ❓ 待确认 | 复杂推理 |\r\n| **GPT-4V** | 多模态 | ✅ 支持 | 图片识别（推荐） |\r\n| **Claude 3.5** | 多模态 | ✅ 支持 | 图片识别（推荐） |\r\n\r\n---\r\n\r\n## 💡 第3步：如何识别支持图片的模型\r\n\r\n### 方法1：查看模型描述\r\n\r\n在选择模型时，查看描述中是否包含：\r\n- \"多模态\"\r\n- \"视觉\"\r\n- \"图片识别\"\r\n- \"Image\"\r\n- \"Vision\"\r\n\r\n### 方法2：尝试测试\r\n\r\n1. 选择一个模型\r\n2. 发送一张图片\r\n3. 如果能识别，说明支持\r\n4. 如果报错\"不支持图片\"，说明不支持\r\n\r\n---\r\n\r\n## ⚙️ 完整操作流程\r\n\r\n### Windows 用户\r\n\r\n```\r\n1. 打开 WorkBuddy\r\n   ↓\r\n2. 点击右上角头像（用户图标）\r\n   ↓\r\n3. 选择「设置」或「Claw 设置」\r\n   ↓\r\n4. 点击「AI 模型」或「对话模型」\r\n   ↓\r\n5. 从下拉列表中选择模型\r\n   ↓\r\n6. 优先选择带\"多模态\"或\"Vision\"关键词的模型\r\n   ↓\r\n7. 保存设置\r\n   ↓\r\n8. 重启 WorkBuddy（可能需要）\r\n   ↓\r\n9. 测试发送一张图片\r\n   ↓\r\n10. 如果能识别，切换成功！\r\n```\r\n\r\n---\r\n\r\n## ✅ 验证切换成功\r\n\r\n### 测试方法1：发送图片\r\n\r\n1. 在 WorkBuddy 中拖入一张图片\r\n2. 或点击附件按钮选择图片\r\n3. 发送消息：\"请识别这张图片的内容\"\r\n\r\n**成功标志**: AI 能准确描述图片内容\r\n\r\n**失败标志**: 出现错误信息 \"current model does not support images\"\r\n\r\n---\r\n\r\n### 测试方法2：使用 Skill 测试\r\n\r\n1. 切换模型后\r\n2. 重新输入：\"处理新图片\"\r\n3. 观察能否识别图片\r\n\r\n**成功标志**: 开始识别图片文字\r\n\r\n**失败标志**: 再次报错 \"不支持图片\"\r\n\r\n---\r\n\r\n## 🤔 如果找不到支持图片的模型\r\n\r\n### 可能原因\r\n\r\n1. **账号限制**\r\n   - 免费账号可能不支持多模态模型\r\n   - 需要升级到付费版本\r\n\r\n2. **地区限制**\r\n   - 某些模型在特定地区不可用\r\n   - 可能需要切换账号类型\r\n\r\n3. **版本限制**\r\n   - 旧版本 WorkBuddy 可能不支持某些模型\r\n   - 需要更新到最新版本\r\n\r\n---\r\n\r\n## 🚨 如果切换失败\r\n\r\n### 选项 A：升级账号\r\n\r\n查看 WorkBuddy 账号计划，可能需要：\r\n- 从免费版升级到付费版\r\n- 购买多模态模型额度\r\n\r\n### 选项 B：联系客服\r\n\r\n在 WorkBuddy 中：\r\n1. 点击右上角头像\r\n2. 选择「帮助与反馈」\r\n3. 联系官方客服询问\r\n\r\n### 选项 C：等待我改进 Skill\r\n\r\n让我为你改进 Skill，添加 OCR 支持：\r\n- 使用腾讯云 OCR（免费额度）\r\n- 或使用 Tesseract OCR（免费开源）\r\n- 不依赖多模态模型\r\n\r\n---\r\n\r\n## 📋 切换检查清单\r\n\r\n切换完成后，请确认以下项目：\r\n\r\n- [ ] WorkBuddy 成功打开\r\n- [ ] 能找到「设置」→「AI 模型」\r\n- [ ] 找到包含\"多模态\"或\"Vision\"关键词的模型\r\n- [ ] 成功切换到新模型\r\n- [ ] 重启 WorkBuddy（如需要）\r\n- [ ] 发送一张图片测试\r\n- [ ] AI 能识别图片内容\r\n- [ ] 重新输入\"处理新图片\"测试\r\n- [ ] Skill 正常工作\r\n\r\n---\r\n\r\n## 📞 需要帮助？\r\n\r\n如果遇到问题，告诉我：\r\n\r\n**问题类型**:\r\n- 找不到「设置」入口\r\n- 「AI 模型」选项不存在\r\n- 没有支持图片的模型\r\n- 切换后仍然报错\r\n\r\n**请提供**:\r\n- 截图（界面设置页面的截图）\r\n- 错误信息（复制完整错误信息）\r\n- WorkBuddy 版本号\r\n\r\n我会帮你排查！\r\n\r\n---\r\n\r\n## 🎉 成功标志\r\n\r\n切换成功的标志：\r\n\r\n1. ✅ WorkBuddy 能识别图片\r\n2. ✅ 输入\"处理新图片\"能正常工作\r\n3. ✅ 截图能提取文字\r\n4. ✅ 能生成 Word 和 Markdown 文档\r\n\r\n---\r\n\r\n**下一步**:\r\n- 切换成功后，立即告诉我\r\n- 我会帮你进行完整的 Skill 功能测试\r\n- 然后继续第1天的其他任务\r\n\r\n---\r\n\r\n**祝你切换成功！** 🚀\r\n\r\n---\r\n\r\n**更新时间**: 2026-03-18\r\n**指南版本**: v1.0\n\nFile v1.2.8:docs/usage.md\n\n# 图片知识库 — 使用说明\r\n\r\n> 适用范围：将手机截图自动整理为 Word + Markdown 知识文档，并自动同步到 ima 个人笔记\r\n> 最后更新：2026年3月16日\r\n\r\n---\r\n\r\n## 一、目录结构说明\r\n\r\n```\r\nD:\\新建文件夹\\\r\n│\r\n├── 待处理图片\\                    ← 新图片放这里（按主题分子文件夹）\r\n│   ├── 健康养生\\                  ← 示例：健康类图片放这里\r\n│   └── 旅行记录\\                  ← 示例：旅行类图片放这里\r\n│\r\n├── 已处理图片\\                    ← 处理完的图片自动归档（不用手动操作）\r\n│\r\n├── 处理结果\\                      ← 最终生成的 Word 和 MD 文档\r\n│   ├── 01_抗炎饮食与营养科普.docx/.md\r\n│   ├── 02_肠道健康与饮食分类.docx/.md\r\n│   ├── 03_中医养生与食疗.docx/.md\r\n│   ├── 04_日常饮食建议.docx/.md\r\n│   └── （新文档自动编号添加）\r\n│\r\n├── 【启动提示词】新对话粘贴这段.txt  ← 重启电脑后打开新对话用这个\r\n├── auto_process.py               ← 处理前自动检查脚本（含 ima 同步）\r\n├── ima_sync.py                   ← ima 自动同步脚本\r\n└── ima_config.txt                ← ima API 凭证配置（填入后自动生效）\r\n```\r\n\r\n---\r\n\r\n## 二、日常使用流程（3步）\r\n\r\n### 第 1 步：放入新图片\r\n\r\n把手机截图复制到对应主题文件夹：\r\n\r\n- 健康养生类 → `待处理图片\\健康养生\\`\r\n- 旅行记录类 → `待处理图片\\旅行记录\\`（文件夹没有就新建一个）\r\n- **文件夹名称可以随意起，中英文都行**\r\n\r\n---\r\n\r\n### 第 2 步：打开 WorkBuddy，恢复背景\r\n\r\n> ⚠️ **重要：** WorkBuddy 每次新开对话都是\"空白\"状态，不记得之前的内容。\r\n> 必须先粘贴启动提示词，AI 才知道你的项目在哪、有哪些文档。\r\n\r\n**操作步骤：**\r\n\r\n1. 打开电脑上的 WorkBuddy\r\n2. 新建一个对话（或直接在对话框里）\r\n3. 打开文件 `D:\\新建文件夹\\【启动提示词】新对话粘贴这段.txt`\r\n4. 全选文件内容（Ctrl+A），复制（Ctrl+C）\r\n5. 粘贴到 WorkBuddy 对话框，发送\r\n6. AI 回复\"已准备好\"后，继续下一步\r\n\r\n---\r\n\r\n### 第 3 步：发送指令，开始处理\r\n\r\nAI 准备好后，发送：\r\n\r\n```\r\n处理新图片\r\n```\r\n\r\nAI 会自动完成：\r\n1. 读取已有4个文档的章节结构（知道哪些内容已经有了）\r\n2. 逐张识别图片中的文字\r\n3. 判断内容属于哪个分类\r\n4. 同类内容 → 追加到已有文档（不会重复已有章节）\r\n5. 新主题内容 → 自动新建 `05_xxx.docx/.md`\r\n6. 处理完的图片移动到 `已处理图片\\` 归档\r\n\r\n---\r\n\r\n## 三、有新类别文档时怎么操作\r\n\r\n当图片内容是全新主题（比如旅行、理财、学习笔记等），AI 会：\r\n\r\n1. **自动判断新主题名称**（根据图片内容决定）\r\n2. **自动编号**：在已有04号文档后，新建 `05_旅行记录.md` 和 `05_旅行记录.docx`\r\n3. **在对话中告诉你**：新建了什么文档、包含哪些内容\r\n4. **你无需任何操作**，直接去 `处理结果\\` 查看新文件即可\r\n\r\n---\r\n\r\n## 四、已有文档的合并规则\r\n\r\n| 新内容属于 | 处理方式 |\r\n|-----------|---------|\r\n| 抗炎/坚果/营养素 | 追加到 `01_抗炎饮食与营养科普` |\r\n| 肠道/益生菌/绿灯食物 | 追加到 `02_肠道健康与饮食分类` |\r\n| 中医/养生/食疗/茶饮 | 追加到 `03_中医养生与食疗` |\r\n| 早餐/食谱/饮食建议 | 追加到 `04_日常饮食建议` |\r\n| 全新主题 | 新建 `05_xxx` 文档（自动编号） |\r\n\r\n---\r\n\r\n## 五、常用指令\r\n\r\n在 WorkBuddy 对话中可以使用：\r\n\r\n| 发送内容 | 效果 |\r\n|---------|------|\r\n| `处理新图片` | 处理所有待处理图片 |\r\n| `处理待处理图片/健康养生` | 只处理健康养生文件夹的图片 |\r\n| `查看现有文档` | 列出所有文档和章节列表 |\r\n\r\n---\r\n\r\n## 六、注意事项\r\n\r\n| 情况 | 处理方式 |\r\n|------|---------|\r\n| 图片文字模糊看不清 | AI 会跳过并告知哪张识别不了 |\r\n| 同一张图跨多个主题 | AI 会拆分内容分别归入各文档 |\r\n| 想重新处理某张图片 | 把图片复制回 `待处理图片\\<主题>\\`，重新发指令 |\r\n| 电脑重启后找不到对话 | 重新粘贴启动提示词（见第二步）即可 |\r\n\r\n---\r\n\r\n## 七、ima 个人笔记自动同步\r\n\r\n处理完图片后，文档会**自动同步**到你的 ima 个人笔记，无需任何手动操作。\r\n\r\n### 首次配置（只需做一次）\r\n\r\n1. 打开文件 `D:\\新建文件夹\\ima_config.txt`，用记事本打开\r\n2. 把下面两行的占位文字替换成真实值：\r\n   ```\r\n   IMA_CLIENT_ID=填入你的ClientID     ← 改成真实的 ClientID\r\n   IMA_API_KEY=填入你的APIKey         ← 改成真实的 APIKey\r\n   ```\r\n3. 保存文件（Ctrl+S）\r\n\r\n> 凭证获取地址：https://ima.qq.com/agent-interface\r\n> 凭证有效期至 2026-04-16，到期后重新获取并更新此文件即可\r\n\r\n### 同步逻辑\r\n\r\n| 情况 | 处理方式 |\r\n|------|---------|\r\n| 文档首次同步 | 在 ima 新建笔记 |\r\n| 文档有新内容（追加了章节） | 自动在 ima 原笔记末尾追加 |\r\n| 文档未变更 | 跳过，不重复同步 |\r\n\r\n### 单独运行同步（可选）\r\n\r\n也可以随时手动触发同步，在命令窗口运行：\r\n\r\n```\r\npython D:\\新建文件夹\\ima_sync.py          ← 同步有变更的文件\r\npython D:\\新建文件夹\\ima_sync.py --force  ← 强制重新同步全部文件\r\npython D:\\新建文件夹\\ima_sync.py --check  ← 仅验证凭证是否有效\r\n```\r\n\r\n---\r\n\r\n## 八、快速流程图（含 ima 同步）\r\n\r\n```\r\n有新图片了？\r\n    ↓\r\n放入 待处理图片\\<主题名>\\\r\n    ↓\r\n打开 WorkBuddy → 粘贴「启动提示词」→ 发送\r\n    ↓\r\nAI 回复「已准备好」\r\n    ↓\r\n发送：处理新图片\r\n    ↓\r\n等待完成，查看 处理结果\\ 目录\r\n    ↓\r\n自动同步到 ima 个人笔记 ✅（无需任何操作）\r\n```\n\nFile v1.2.8:README_EN.md\n\n# 📚 Image Knowledge Converter (图片知识库整理工具)\n\n> Automatically convert phone screenshots into structured Word + Markdown knowledge documents with AI-powered categorization.  \n> **First-time users get an interactive setup wizard — no technical background required!**\n\n<p align=\"center\">\n  <img src=\"https://raw.githubusercontent.com/haoyiyong985/image-knowledge-converter/main/demo.gif\" alt=\"Demo\" width=\"480\">\n</p>\n\n[![GitHub license](https://img.shields.io/badge/license-MIT-blue.svg)](LICENSE)\n[![GitHub stars](https://img.shields.io/github/stars/haoyiyong985/image-knowledge-converter?style=social)](https://github.com/haoyiyong985/image-knowledge-converter)\n[![WorkBuddy](https://img.shields.io/badge/WorkBuddy-Skill-green)](https://workbuddy.ai)\n\n🌐 [中文](README.md) | [English](README_EN.md)\n\n---\n\n## 🌟 Overview\n\n**Image Knowledge Converter** is an AI-powered knowledge management tool that:\n\n- 📷 **Auto OCR**: Extract text from phone screenshots (Xiaohongshu, WeChat Reading, WeChat, etc.)\n- 🏷️ **Smart Categorization**: AI understands content and automatically classifies it into knowledge themes\n- 📝 **Generate Documents**: Output structured Word + Markdown dual-format documents\n- 🔗 **Auto Archive**: Organize images and documents by category\n- 🔄 **Content Deduplication**: Similar topics are automatically merged to avoid duplicates\n- ☁️ **Cloud Sync**: One-click sync to IMA personal notes\n\n---\n\n## ✨ Features\n\n### Core Features\n\n| Feature | Description |\n|---------|-------------|\n| **Multi-Engine OCR** | Tencent Cloud → Baidu Cloud → Local Tesseract (auto fallback) |\n| **AI Smart Categorization** | Dynamic category system with free naming and auto category creation |\n| **Document Merging** | Same-topic content auto-merged into one document |\n| **Dual-Format Output** | Simultaneously generates `.docx` and `.md` files |\n| **IMA Sync** | Auto sync to IMA notes (supports incremental updates) |\n| **Batch Processing** | Smart batch splitting for large volumes, with resume support |\n| **Duplicate Detection** | Hash + topic similarity double-check |\n| **Newbie Wizard** | Interactive setup wizard on first run — no tech background needed |\n\n### Technical Highlights\n\n- ✅ **Full LLM Coverage**: Hunyuan Lite / Kimi / Doubao multi-model fallback\n- ✅ **Smart Naming**: `{Category}-{Topic}` format, e.g., `History-Qian Qianyi Biography`\n- ✅ **Content Cleanup**: Auto-fix OCR errors, structured formatting\n- ✅ **Source Extraction**: Auto-identify platform sources (Xiaohongshu, WeChat, etc.)\n- ✅ **Newbie Wizard**: Interactive first-run configuration wizard\n\n---\n\n## 🚀 Quick Start (3 Steps)\n\n> **No need to choose an installation method!** No matter which way you install, the first run will **auto-launch the Newbie Wizard** to guide you through setup.\n\n### Step 1: Choose Installation Method (any one)\n\n#### Method A: WorkBuddy Skill (Easiest ⭐)\n\n**For**: WorkBuddy users who want one-click setup\n\n1. Download `image-knowledge-converter_v1.1.0_skill.zip` from Releases\n2. Open WorkBuddy → Top-right avatar → **Skills Management**\n3. Click \"Import Skills\" → Select the zip → \"Import Now\"\n4. **Say to WorkBuddy**: `first time` or `initialize`\n5. ✅ The wizard auto-starts and guides you through setup (~2 minutes)\n\n#### Method B: Full Package (More Control ⭐)\n\n**For**: Users who want full control, or without WorkBuddy\n\n1. Download `tupianzhengligongju_wanzheng_v1.1.0.zip` from Releases\n2. Extract to your desired location (e.g., `D:\\MyImageKnowledgeBase`)\n3. Open terminal, enter the extracted directory\n4. Run: `python setup_wizard.py`\n5. ✅ The wizard auto-starts and guides you through setup (~2 minutes)\n\n#### Method C: Git Clone (For Developers)\n\n**For**: Developers familiar with Git and CLI\n\n```bash\ngit clone https://github.com/haoyiyong985/image-knowledge-converter.git\ncd image-knowledge-converter\npip install -r requirements.txt\npython setup_wizard.py   # ← Launch wizard\n```\n\n---\n\n### Step 2: Newbie Wizard (Auto-Starts)\n\nNo matter which method you choose, **you'll see this wizard on first run** (cannot be skipped):\n\n```\n==================================================\n  Welcome to Image Knowledge Converter!\n  I'm your smart assistant. First time? Let me help you set up.\n  Just 3 steps, about 2 minutes.\n\n  If you have any questions, just ask me!\n==================================================\n```\n\n#### Wizard Flow (3 Steps, ~2 Minutes)\n\n**Step 1: Choose Working Folder**\n```\n  Step 1: Choose Working Folder\n  ℹ️ This is where images and generated documents will be stored.\n\n  Suggested: D:\\Users\\YourUsername\\ImageKnowledgeBase\n\n  Use default location? (y/n, press Enter for default):\n```\n\n- Press `y` → Auto-creates default folder\n- Press `n` → Enter custom path (e.g., `D:\\MyImageLibrary`)\n\n**Step 2: Configure OCR Service (pick one)**\n```\n  Step 2: Configure OCR Recognition Service\n  ℹ️ You need at least one OCR service to recognize text in images.\n\n  Please select an OCR service (pick one):\n    1. Tencent Cloud OCR (Recommended, 1000 free/month)\n      High accuracy, generous free quota\n    2. Baidu Cloud OCR (Free, requires real-name)\n      Large free quota, suitable for heavy use\n    3. Local Tesseract (Completely free)\n      No internet needed, but lower accuracy\n\n  Enter option number (1-3):\n```\n\n- **Option 1 (Tencent Cloud)** → Wizard shows tutorial → You fill in `config/api_keys_template.txt` → Wizard auto-reads and generates config\n- **Option 2 (Baidu Cloud)** → Wizard shows tutorial → You fill in `config/api_keys_template.txt` → Wizard auto-reads and generates config\n- **Option 3 (Local)** → Wizard prompts Tesseract installation → Config complete\n\n**Step 3: Create Folder Structure**\n```\n  Step 3: Create Folder Structure\n  ✅ Created folder: Pending Images\n  ✅ Created folder: Processed Images\n  ✅ Created folder: Processing Results\n\n  ✅ Config saved to config/api_keys.yaml\n```\n\n**Step 4 (Optional): Configure IMA Sync**\n```\n  (Optional) Configure IMA Sync\n  ℹ️ IMA is a note service that can automatically sync your generated documents.\n  ℹ️ If you don't use IMA, you can skip this.\n\n  Configure IMA sync? (y/n):\n```\n\n- Press `y` → Wizard prompts for IMA API Key → You fill in `config/api_keys_template.txt` → Wizard auto-reads and generates config\n- Press `n` → Skip, you can re-run wizard anytime to add it\n\n**Done!**\n```\n==================================================\n  🎉 Setup Complete!\n==================================================\n\n  Next steps:\n  1. Put images to process in the \"Pending Images\" folder\n  2. Run: python auto_process_all_v9_4.py\n  3. Wait for processing, results are in \"Processing Results\" folder\n```\n\n---\n\n### Step 3: Drop Images and Process\n\n#### If Using WorkBuddy Skill (Method A)\n\n1. Put images in: `YourWorkingFolder\\Pending Images\\`\n2. Say to WorkBuddy: `process new images`\n3. Wait for processing (~3-5 seconds/image)\n4. Results in: `YourWorkingFolder\\Processing Results\\`\n\n#### If Running Locally (Method B or C)\n\n1. Put images in: `YourWorkingFolder\\Pending Images\\`\n2. Run: `python auto_process_all_v9_4.py`\n3. Wait for processing (~3-5 seconds/image)\n4. Results in: `YourWorkingFolder\\Processing Results\\`\n\n---\n\n## 📖 User Guide\n\n### Directory Structure\n\n```\nImageKnowledgeBase\\\n├── auto_process_all_v9_4.py   ← Main processing script (V9.5 logic)\n├── setup_wizard.py            ← Newbie wizard script\n├── requirements.txt\n├── config\\\n│   └── api_keys.yaml        ← OCR/IMA config (auto-generated by wizard)\n├── Pending Images（待处理图片）\\                ← Drop images to process here\n│   ├── Health\\\n│   ├── Travel\\\n│   └── ...\n├── Processed Images（已处理图片）\\                ← Processed images auto-archived\n└── Processing Results（处理结果）\\                  ← Generated Word/Markdown docs\n    ├── History-Qian Qianyi Biography.docx\n    ├── History-Qian Qianyi Biography.md\n    └── ...\n```\n\n### Daily Usage Flow\n\n#### Step 1: Add New Images\n\nCopy phone screenshots to the `Pending Images` folder (supports subfolder categorization):\n\n```\nPending Images\\Health\\  ← Health-related images\nPending Images\\Travel\\  ← Travel-related images\n```\n\n#### Step 2: Start Processing\n\n**WorkBuddy Users**:\n```\nprocess new images\n```\n\n**Local Users**:\n```bash\npython auto_process_all_v9_4.py\n```\n\n#### Step 3: View Results\n\nAfter processing, open the `Processing Results` folder and you'll see:\n\n```\nProcessing Results\\\n├── History-Qian Qianyi Biography.docx    ← Word format (editable)\n├── History-Qian Qianyi Biography.md     ← Markdown format (plain text)\n├── Health-Anti-Inflammatory Diet.docx\n└── Health-Anti-Inflammatory Diet.md\n```\n\n---\n\n## ⚙️ Configuration\n\n### Secure API Key Handling (Security Improvement ⭐)\n\n**New users note**: To protect your API keys, **you no longer need to send keys to WorkBuddy**!\n\nWe use **local TXT file** for key transfer:\n1. The wizard teaches you how to get API keys\n2. You fill keys in `config/api_keys_template.txt` (with detailed instructions)\n3. Save and press Enter to continue\n4. The wizard auto-reads the TXT file and generates encrypted YAML config\n\n**Advantages**:\n- ✅ Keys never appear in chat history\n- ✅ Keys are not transmitted over the network (except normal API calls)\n- ✅ You can edit files locally in a secure environment\n\nTXT template path: `config/api_keys_template.txt` (auto-created by wizard)\n\n---\n\n### API Key Configuration (Auto-completed by wizard)\n\nThe wizard will generate the following in `config/api_keys.yaml`:\n\n```yaml\n# OCR Services (configure at least one)\nocr:\n  tencent:\n    secret_id: \"Your Tencent Cloud SecretId\"\n    secret_key: \"Your Tencent Cloud SecretKey\"\n\n  # OR Baidu Cloud\n  baidu:\n    api_key: \"Your Baidu Cloud API Key\"\n    secret_key: \"Your Baidu Cloud Secret Key\"\n\n# IMA Sync (optional, wizard will ask if you want to configure)\nima:\n  api_key: \"Your IMA API Key\"\n  base_url: \"https://api.ima.tencent.com/v1\"\n```\n\n### How to Get API Keys (Wizard will guide you step by step)\n\n| Service | Free Quota | Get Started | Wizard Support |\n|---------|------------|-------------|----------------|\n| Tencent Cloud OCR | 1000/month | https://console.cloud.tencent.com/cam/capi | ✅ Tutorial |\n| Baidu Cloud OCR | 50000/day | https://console.bce.baidu.com/ | ✅ Tutorial |\n| Local Tesseract | Completely free | https://github.com/UB-Mannheim/tesseract/wiki | ✅ Setup guide |\n\n---\n\n## 📊 Category System\n\n### Preset Categories (Auto-expanding)\n\n| Category | Description | Examples |\n|----------|-------------|----------|\n| **History & Culture** | History, biographies, cultural knowledge | Qian Qianyi Biography, Southern Song History |\n| **Health & Nutrition** | Diet, nutrition, health knowledge | Anti-inflammatory diet, gut health |\n| **Lifestyle** | Exercise, sleep, daily advice | Daily diet recommendations |\n| **Education & Parenting** | Education methods, parenting knowledge | - |\n| **Travel & Guides** | Travel logs, attraction guides | - |\n\n### Dynamic Categories\n\nWhen content doesn't fit preset categories, AI will:\n1. Automatically determine a new topic name\n2. Freely name the category\n3. Create the new category and archive\n\n**Examples**:\n- Image content is about \"Photography Tips\" → AI auto-creates `Photography` category\n- Image content is about \"Programming Learning\" → AI auto-creates `Programming` category\n\n---\n\n## 💡 Common Commands\n\n### WorkBuddy Users\n\nYou can use these in WorkBuddy conversation:\n\n| Command | Effect |\n|---------|--------|\n| `first time` or `initialize` | Launch newbie wizard (first-time setup) |\n| `process new images` | Process all pending images |\n| `process pending images/Health` | Only process images in specified folder |\n| `view existing documents` | List all documents and chapter lists |\n| `reconfigure` | Re-run wizard to update config |\n\n### Local Users\n\n```bash\n# Launch newbie wizard (first time)\npython setup_wizard.py\n\n# Process images\npython auto_process_all_v9_4.py\n\n# Batch processing (large volumes)\npython auto_process_all_v9_4.py --batch\n\n# Check progress\npython auto_process_all_v9_4.py --progress\n\n# Clear state\npython auto_process_all_v9_4.py --clear\n```\n\n---\n\n## 📂 Output Examples\n\n### Processing Results Directory\n\n```\nProcessing Results\\\n├── History-Qian Qianyi Biography.docx\n├── History-Qian Qianyi Biography.md\n├── History-Overview of Southern Song History.docx\n├── History-Overview of Southern Song History.md\n└── ...\n```\n\n### Document Content Structure\n\n```markdown\n# History-Qian Qianyi Biography\n\n## I. Biography\n(OCR extracted content, auto-segmented by AI)\n\n## II. Major Achievements\n(Structured organization)\n\n## III. Historical Evaluation\n(Auto-classified and archived)\n```\n\n---\n\n## 🔧 Advanced Features\n\n### Batch Processing\n\nWhen processing large volumes, the system auto-splits batches:\n\n| Image Size | Batch Size |\n|-----------|-----------|\n| < 500KB | 10 images/batch |\n| 500KB-2MB | 6 images/batch |\n| 2MB-5MB | 4 images/batch |\n| > 5MB | 2 images/batch |\n\n### Resume Processing\n\nIf processing is interrupted, you can resume:\n\n```bash\npython auto_process_all_v9_4.py --batch\n```\n\nCheck progress:\n\n```bash\npython auto_process_all_v9_4.py --progress\n```\n\nClear state:\n\n```bash\npython auto_process_all_v9_4.py --clear\n```\n\n---\n\n## 🐛 FAQ\n\n### Q1: I'm a complete beginner, can I use this?\n\n**Answer**: Absolutely!  \n- First run auto-launches the **Newbie Wizard**, guiding you step by step\n- Just 2 minutes, no technical background needed\n- After setup, just say \"process new images\" each time\n\n### Q2: OCR recognition fails?\n\n**Solution**:\n1. Check image clarity (recommend resolution ≥ 150 DPI)\n2. Confirm Tencent Cloud/Baidu Cloud OCR is configured\n3. Install local Tesseract as fallback\n\n### Q3: Document naming not as expected?\n\n**Solution**:\n- Document format: `{Category}-{Topic}`\n- Auto-generated by AI, aligned with content theme\n- To customize, modify naming rules in `auto_process_all_v9_4.py`\n\n### Q4: How to avoid duplicate content?\n\n**Solution**:\n- System auto-detects duplicates (Hash + topic similarity)\n- Duplicate images are automatically skipped\n\n### Q5: IMA sync fails?\n\n**Solution**:\n1. Check `config/api_keys.yaml` IMA config is correct\n2. Confirm credentials are not expired\n3. Re-run wizard: `python setup_wizard.py`\n\n---\n\n## 📈 Performance Metrics\n\n- **Processing Speed**: ~3-5 seconds/image (depends on OCR engine)\n- **Recognition Accuracy**: 90%+ Chinese (Tencent Cloud OCR)\n- **Supported Formats**: JPG, PNG, WEBP, BMP\n- **Output Formats**: Word (.docx) + Markdown (.md)\n\n---\n\n## 🛠️ Tech Stack\n\n| Technology | Purpose |\n|------------|---------|\n| **OCR** | Tencent Cloud, Baidu Cloud, Tesseract |\n| **AI Analysis** | Hunyuan Lite, Kimi, Doubao |\n| **Document Generation** | python-docx |\n| **Sync** | IMA OpenAPI |\n| **Language** | Python 3.8+ |\n\n---\n\n## 📄 File Guide\n\n### Core Scripts\n\n| File | Description |\n|------|-------------|\n| `auto_process_all_v9_4.py` | Current latest version (V9.5 logic) |\n| `setup_wizard.py` | Newbie wizard script (auto-launches on first run) |\n| `ima_sync.py` | IMA sync script |\n| `classifier_engine.py` | Classification engine |\n\n### Configuration Files\n\n| File | Description |\n|------|-------------|\n| `config/api_keys.yaml` | OCR/IMA credentials (auto-generated by wizard) |\n| `requirements.txt` | Python dependency list |\n| `.env` | Environment variables (not committed to Git) |\n\n---\n\n## 🤝 Contributing\n\nWelcome to submit Issues and Pull Requests!\n\n1. Fork this repo\n2. Create your feature branch (`git checkout -b feature/AmazingFeature`)\n3. Commit your changes (`git commit -m 'Add some AmazingFeature'`)\n4. Push to branch (`git push origin feature/AmazingFeature`)\n5. Open a Pull Request\n\n---\n\n## 📝 Changelog\n\n### v1.1.0 (2026-04-27) 🆕\n\n- ✅ **Built-in Newbie Wizard** (auto-launches on first run)\n- ✅ Support for tutorial-based API key acquisition\n- ✅ Auto-create folder structure\n- ✅ Updated to V9.5 processing logic\n- ✅ Removed \"General Knowledge\" catch-all category\n- ✅ Support LLM free naming for categories\n- ✅ Added `setup_wizard.py` wizard script\n\n### v1.0.0 (2026-03-17)\n\n- ✅ Initial release\n- ✅ OCR support (Tencent Cloud, Baidu Cloud, Tesseract)\n- ✅ AI smart categorization and document merging\n- ✅ Word + Markdown dual-format output\n- ✅ IMA sync feature\n\n---\n\n## 📄 License\n\nThis project is licensed under the MIT License — see the [LICENSE](LICENSE) file for details.\n\n---\n\n## 🙏 Acknowledgements\n\n- [WorkBuddy](https://workbuddy.ai) - AI assistant platform\n- [Tencent Cloud OCR](https://cloud.tencent.com/product/ocr) - OCR service\n- [Baidu Cloud OCR](https://ai.baidu.com/tech/ocr) - OCR service\n- [Tesseract](https://github.com/tesseract-ocr/tesseract) - Open-source OCR engine\n\n---\n\n## 📧 Contact\n\n- GitHub Issues: [Submit an issue](https://github.com/haoyiyong985/image-knowledge-converter/issues)\n- Email: (add your contact)\n\n---\n\n**⭐ If this project helps you, please give it a star!**\n\nArchive v1.2.7: 30 files, 86067 bytes\n\nFiles: assets/SCREENSHOTS_GUIDE.md (3707b), assets/screenshots/workflow.svg (3910b), auto_process_all_v9_4.py (101564b), baidu_ocr.py (4507b), config/api_keys_template.txt (4666b), config/api_keys.yaml (465b), config/categories.yaml (6342b), config/config.yaml (1604b), config/processing_config.yaml (1039b), config/processing_rules.yaml (3071b), docs/OCR引擎自动回退说明.md (3793b), docs/使用说明.md (6106b), docs/切换模型指南.md (4699b), docs/多引擎OCR使用说明.md (4723b), docs/安装说明.md (3450b), docs/快速入门指南.md (5871b), docs/第一批图片处理结果.txt (3496b), local_ocr.py (1726b), quick_setup.py (3681b), README.md (16757b), references/usage-guide.md (1369b), requirements_full.txt (321b), requirements_min.txt (224b), requirements.txt (660b), setup_wizard.py (30035b), skill-card.md (2843b), SKILL.md (8268b), tencent_ocr.py (7789b), wizard_processor.py (12184b), _meta.json (144b)\n\nFile v1.2.7:SKILL.md\n\n---\r\nname: image-knowledge-converter\r\ndescription: \"图片截图转知识库工具（OCR + AI）。触发词：第一次使用、配置图片工具、处理新图片\"\r\nversion: 1.2.7\r\ntags: [image-processing, ocr, knowledge-management]\r\n---\r\n\r\n# 🔧 执行指令\r\n\r\n**配置向导触发词：**\r\n当用户说 `第一次使用` / `第一次使用图片处理工具` / `配置图片工具` 时，**AI 启动对话式配置向导**。\r\n\r\n**处理图片触发词：**\r\n当用户说 `处理新图片` / `截图转文档` / `整理截图` 时（这三个触发词等价，均执行相同的处理流程），执行：\r\n\r\n**自动检测工作目录**（优先从以下路径检测）：\r\n1. 命令行参数 `--work-dir <路径>`\r\n2. 环境变量 `WORK_DIR`\r\n3. 脚本所在目录（兜底）\r\n\r\n```\r\n# 方式1：显式指定工作目录（推荐）\r\npython auto_process_all_v9_4.py --work-dir \"D:\\WorkBuddy-Projects\\图片知识库\"\r\n\r\n# 方式2：在工作目录中直接运行\r\ncd \"D:\\WorkBuddy-Projects\\图片知识库\"\r\npython auto_process_all_v9_4.py\r\n\r\n# 方式3：使用环境变量\r\nset WORK_DIR=D:\\WorkBuddy-Projects\\图片知识库\r\npython auto_process_all_v9_4.py\r\n```\r\n\r\n---\r\n\r\n## 📋 对话式配置向导（5步）\r\n\r\n**安全原则：API 密钥不通过对话传递，用户直接在本地模板文件中填写。**\r\n\r\n### 第1步：AI 询问工作文件夹位置\r\n\r\n当用户说\"第一次使用\"时，AI 先询问用户想把工具安装到哪个文件夹：\r\n\r\n```\r\n🤖 我来帮你完成配置！首先需要确定工作文件夹位置。\r\n\r\n这个文件夹将用来存放：\r\n• 你的待处理图片\r\n• 生成的文档\r\n• 配置文件\r\n\r\n请告诉我你想使用的文件夹路径，例如：\r\n  D:\\图片知识库\r\n  或桌面上的任意位置\r\n\r\n（直接回车将使用默认位置）\r\n```\r\n\r\n> **关键**：工作文件夹由用户指定，不是写死的路径。\r\n\r\n### 第2步：AI 创建配置模板\r\n\r\nAI 在用户指定的工作文件夹下创建配置模板：\r\n```\r\n{工作文件夹}\\config\\api_keys_template.txt\r\n```\r\n\r\n### 第3步：AI 引导用户填写\r\n\r\nAI 告诉用户：\r\n```\r\n✅ 配置模板已创建！\r\n\r\n📝 请打开文件并填写配置：\r\n   {工作文件夹}\\config\\api_keys_template.txt\r\n\r\n【填写说明】\r\n\r\n1️⃣  OCR 模式（必选一项，删除前面的 # 启用）：\r\n    # OCR_MODE: cloud    ← 云端方案（腾讯+百度）\r\n    # OCR_MODE: local     ← 本地方案（Tesseract）\r\n    # OCR_MODE: hybrid    ← 兜底方案（云端+本地）\r\n\r\n2️⃣  填写 API 密钥（根据上一步选择填写）：\r\n    - 腾讯云 SecretId/SecretKey\r\n    - 百度云 API Key/Secret Key\r\n    - 或启用 use_tesseract: true\r\n\r\n3️⃣  LLM 配置（如需 AI 智能分析）：\r\n    # 注意：混元(Hunyuan)使用与腾讯云OCR相同的密钥，无需单独配置\r\n    # 如需使用其他LLM，请参考代码中的配置项\r\n    llm_enabled: true\r\n    llm_provider: hunyuan\r\n\r\n4️⃣  IMA 同步（如需自动同步到 IMA，必须改为 true）：\r\n    # 启用：将下方 false 改为 true，并填写 client_id 和 api_key\r\n    # 获取方法：IMA 设置 → API → 创建新的 API Key\r\n    ima_enabled: true          ← 必须改为 true 才能启用\r\n    ima_api_key: 你的API密钥\r\n    ima_client_id: 你的ClientID\r\n\r\n5️⃣  填写完成后保存文件，然后对我说「配置已填写完毕」\r\n```\r\n\r\n### 第4步：AI 处理配置\r\n\r\n用户说「配置已填写完毕后」，AI 自动：\r\n```\r\n# 运行配置处理器（自动检测工作目录）\r\npython wizard_processor.py\r\n\r\n# 或显式指定工作目录\r\npython wizard_processor.py --work-dir \"D:\\WorkBuddy-Projects\\图片知识库\"\r\n```\r\n1. wizard_processor.py 读取模板\r\n2. 生成 `config/api_keys.yaml`\r\n3. 验证配置并显示摘要\r\n\r\n### 第5步：放入图片并处理\r\n\r\n```\r\n✅ 配置完成！\r\n\r\n📁 请把图片放入：\r\n   {工作文件夹}\\待处理图片\r\n\r\n然后对我说「处理新图片」\r\n```\r\n\r\n---\r\n\r\n## 🚀 快速上手\r\n\r\n### 首次使用\r\n1. 说 `第一次使用图片处理工具`\r\n2. AI 创建配置模板\r\n3. 用户直接编辑模板文件（密钥不在对话框中）\r\n4. 用户说「配置已填写完毕」\r\n5. AI 处理配置并验证\r\n6. 放入图片，说「处理新图片」\r\n\r\n### 日常使用\r\n1. 把图片放入 `待处理图片\\`\r\n2. 说「处理新图片」\r\n\r\n---\r\n\r\n## 触发词\r\n\r\n**首次配置（启动向导）：**\r\n- `第一次使用`\r\n- `第一次使用图片处理工具`\r\n- `配置图片工具`\r\n- `首次配置`\r\n\r\n**开始处理（运行脚本）：**\r\n- `处理新图片`\r\n- `截图转文档`\r\n- `整理截图`\r\n\r\n---\r\n\r\n## 目录结构\r\n\r\n```\r\n{工作文件夹}\\           ← 所有文件都在用户指定的工作目录下\r\n├── auto_process_all_v9_4.py ← 主处理脚本（V9.5 支持 --work-dir）\r\n├── wizard_processor.py     ← 配置处理器\r\n├── setup_wizard.py          ← 交互式配置向导（可选）\r\n├── config\\\r\n│   ├── api_keys_template.txt  ← 用户在此填写（本地）\r\n│   └── api_keys.yaml          ← 自动生成\r\n├── 待处理图片\\\r\n├── 已处理图片\\\r\n├── 处理结果\\\r\n│   ├── *.md                  ← 生成的 Markdown 文档\r\n│   ├── *.docx                ← 生成的 Word 文档\r\n│   ├── process.log           ← 运行日志\r\n│   └── 处理报告.json         ← 处理统计报告\r\n└── progress\\                 ← 分批处理状态（自动创建）\r\n```\r\n\r\n---\r\n\r\n## 版本历史\r\n\r\n**v1.2.7 (2026-05-20)**\r\n- ✅ **混元签名修复**：修复 TC3-HMAC-SHA256 签名算法，添加 `x-tc-action` 到 CanonicalHeaders 和 SignedHeaders\r\n- ✅ **Content-Type 修复**：改为 `application/json; charset=utf-8` 与腾讯云官方一致\r\n- ✅ **SDK 依赖移除**：无需安装 `tencentcloud-sdk-python-v3`，只需 `requests` 库\r\n\r\n**v1.2.6 (2026-05-20)**\r\n- ✅ **SDK 依赖移除**：改用腾讯云 REST API 调用混元 LLM，无需安装 `tencentcloud-sdk-python-v3`\r\n- ✅ **混元调用优化**：使用 TC3-HMAC-SHA256 签名认证，与其他 LLM（硅基流动/Kimi/Doubao）一样只需 `requests` 库\r\n- ✅ **LLM 说明优化**：SKILL.md 明确说明混元使用与腾讯云OCR相同的密钥，无需单独配置\r\n- ✅ **配置文件修复**：重新生成 api_keys.yaml 确保嵌套结构正确\r\n\r\n**v1.2.5 (2026-05-20)**\r\n- ✅ **IMA 解析修复**：wizard_processor.py 现在同时支持注释和无注释格式的 `ima_enabled`\r\n- ✅ **模板解析修复**：优先用冒号分隔（支持 base64 值中含 `=` 的情况）\r\n- ✅ **IMA 模板优化**：api_keys_template.txt 中 IMA 配置说明更清晰，明确标注\"必须改为 true\"\r\n- ✅ **SKILL.md 更新**：配置向导第3步中 IMA 配置说明更详细\r\n\r\n**v1.2.4 (2026-05-20)**\r\n- ✅ **核心修复**：`auto_process_all_v9_4.py` 支持 `--work-dir` 命令行参数指定工作目录\r\n- ✅ **路径统一**：所有路径引用（配置/输入/输出/日志）改为基于工作目录，不再依赖脚本所在目录\r\n- ✅ **向后兼容**：不指定工作目录时，自动使用脚本所在目录（保持原有行为）\r\n\r\n**v1.2.3 (2026-05-20)**\r\n- ✅ **路径修复**：`wizard_processor.py` 的 `get_work_folder()` 不再硬编码默认路径，改为动态检测脚本目录\r\n- ✅ **路径修复**：`SKILL.md` 移除所有硬编码示例路径，改为 `{工作文件夹}` 占位符\r\n- ✅ **流程优化**：配置向导明确要求 AI 先询问用户指定工作文件夹位置\r\n\r\n**v1.2.2 (2026-05-20)**\r\n- ✅ **安全升级**：API 密钥完全不在对话中传输，用户直接编辑本地模板文件\r\n- ✅ **流程优化**：从 6 步优化为 5 步（新增第1步：AI 询问用户指定工作文件夹）\r\n- ✅ **IMA 修复**：修复了 IMA 配置无法加载的问题（添加 client_id 支持）\r\n- ✅ **OCR 新增 C 兜底选项**\r\n\r\n**v1.2.1 (2026-05-20)**\r\n- ✅ **安全升级**：API 密钥统一写入模板文件后由系统处理\r\n- ✅ **OCR 新增兜底方案**：A（云端）、B（本地）、C（A+B 兜底）\r\n- ✅ **自动验证配置**\r\n\r\n**v1.2.0 (2026-05-10)**\r\n- ✅ 重构为对话式配置向导\r\n\r\n**v1.1.0 (2026-04-27)**\r\n- ✅ 初始版本\n\nFile v1.2.7:README.md\n\n# 📚 图片知识库整理工具 (Image Knowledge Converter)\r\n\r\n> 自动将手机截图转换为结构化 Word + Markdown 知识文档，并同步到 IMA 个人笔记  \r\n> **新用户第一次使用会自动启动向导，无需任何技术背景！**\r\n\r\n[![GitHub license](https://img.shields.io/badge/license-MIT-blue.svg)](LICENSE)\r\n[![GitHub stars](https://img.shields.io/github/stars/haoyiyong985/image-knowledge-converter?style=social)](https://github.com/haoyiyong985/image-knowledge-converter)\r\n[![WorkBuddy](https://img.shields.io/badge/WorkBuddy-Skill-green)](https://workbuddy.ai)\r\n\r\n---\r\n\r\n## 🌟 项目简介\r\n\r\n**图片知识库整理工具** 是一个智能知识管理助手，能够：\r\n\r\n- 📷 **自动识别**：从手机截图（小红书、微信读书、微信等）中提取文字\r\n- 🏷️ **智能分类**：AI 理解内容并自动分类到对应知识主题\r\n- 📝 **生成文档**：输出结构化 Word + Markdown 双格式文档\r\n- 🔗 **自动归档**：按分类整理图片和文档\r\n- 🔄 **内容合并**：相似主题自动合并，避免重复\r\n- ☁️ **云端同步**：一键同步到 IMA 个人笔记\r\n\r\n---\r\n\r\n## ✨ 功能特点\r\n\r\n### 核心功能\r\n\r\n| 功能 | 说明 |\r\n|------|------|\r\n| **OCR 多引擎** | 腾讯云 → 百度云 → 本地 Tesseract（自动降级） |\r\n| **AI 智能分类** | 动态分类体系，支持自由命名和自动新建分类 |\r\n| **文档合并** | 同主题内容自动合并到同一文档 |\r\n| **双格式输出** | 同时生成 `.docx` 和 `.md` 文件 |\r\n| **IMA 同步** | 自动同步到 IMA 笔记（支持增量更新）|\r\n| **分批处理** | 大批量图片智能分批，支持断点续传 |\r\n| **重复检测** | Hash + 主题词相似度双重检测 |\r\n| **新手向导** | 🆕 首次使用自动引导配置，无需技术背景 |\r\n\r\n### 技术亮点\r\n\r\n- ✅ **LLM 全覆盖**：混元 Lite / Kimi / Doubao 多模型兜底\r\n- ✅ **智能命名**：`{分类}-{主题}`，如 `历史文化-钱谦益传`\r\n- ✅ **内容整理**：自动修复 OCR 错误、结构化排版\r\n- ✅ **来源提取**：自动识别小红书、微信等平台来源\r\n- ✅ **新手向导**：第一次使用自动启动交互式配置向导\r\n\r\n---\r\n\r\n## 🚀 快速开始（三步走）\r\n\r\n> **无需选择安装方式！** 无论你用哪种方式安装，第一次运行时都会自动启动**新手向导**，一步步引导你完成配置。\r\n\r\n### 第一步：选择安装方式（任选一种）\r\n\r\n#### 方式 A：WorkBuddy Skill（最简单 ⭐）\r\n\r\n**适合人群**：有 WorkBuddy 账号，想一键使用\r\n\r\n1. 下载 Release 中的 `image-knowledge-converter_v1.1.0_skill.zip`\r\n2. 打开 WorkBuddy → 右上角头像 → **Skills 管理**\r\n3. 点击「导入 Skills」→ 选择下载的 zip → 「立即导入」\r\n4. **对 WorkBuddy 说**：`第一次使用` 或 `初始化`\r\n5. ✅ 向导自动启动，引导你完成配置（约 2 分钟）\r\n\r\n#### 方式 B：完整包（适合自定义 ⭐）\r\n\r\n**适合人群**：想完全控制，或没有 WorkBuddy\r\n\r\n1. 下载 Release 中的 `tupianzhengligongju_wanzheng_v1.1.0.zip`\r\n2. 解压到你想放的位置（如 `D:\\我的图片知识库`）\r\n3. 打开终端，进入解压目录\r\n4. 运行：`python setup_wizard.py`\r\n5. ✅ 向导自动启动，引导你完成配置（约 2 分钟）\r\n\r\n#### 方式 C：Git 克隆（适合开发者）\r\n\r\n**适合人群**：熟悉 Git 和命令行\r\n\r\n```bash\r\ngit clone https://github.com/haoyiyong985/image-knowledge-converter.git\r\ncd image-knowledge-converter\r\npip install -r requirements.txt\r\npython setup_wizard.py   # ← 启动向导\r\n```\r\n\r\n---\r\n\r\n### 第二步：新手向导（自动启动）\r\n\r\n无论你用哪种方式安装，**第一次运行都会看到这个向导**（不会跳过）：\r\n\r\n```\r\n==================================================\r\n  欢迎使用 图片知识库整理工具！\r\n  我是你的智能助手，第一次使用我来帮你完成配置\r\n  只需 3 步，大概 2 分钟\r\n\r\n  如果你有任何问题，随时问我！\r\n==================================================\r\n```\r\n\r\n#### 向导流程（3 步，约 2 分钟）\r\n\r\n**第 1 步：选择工作文件夹**\r\n```\r\n  步骤 1：选择工作文件夹\r\n  ℹ️ 这是存放图片和生成文档的地方。\r\n  \r\n  建议使用：D:\\Users\\你的用户名\\图片知识库\r\n  \r\n  是否使用默认位置？(y/n，直接回车=使用默认):\r\n```\r\n\r\n- 选 `y` → 自动创建默认文件夹\r\n- 选 `n` → 输入自定义路径（如 `D:\\我的图片库`）\r\n\r\n**第 2 步：配置 OCR 服务（选一个就行）**\r\n```\r\n  步骤 2：配置 OCR 识别服务\r\n  ℹ️ 你需要至少一个 OCR 服务来识别图片中的文字。\r\n  \r\n  请选择 OCR 服务（选一个就行）：\r\n    1. 腾讯云 OCR（推荐，每月免费 1000 次）\r\n      识别率高，免费额度充足\r\n    2. 百度云 OCR（免费，需实名）\r\n      免费额度大，适合大量使用\r\n    3. 本地 Tesseract（完全免费）\r\n      无需联网，但识别率较低\r\n      \r\n  请输入选项编号 (1-3):\r\n```\r\n\r\n- **选 1（腾讯云）** → 向导显示图文教程 → 你填入 `config/api_keys_template.txt` → 向导自动读取并生成配置\r\n- **选 2（百度云）** → 向导显示图文教程 → 你填入 `config/api_keys_template.txt` → 向导自动读取并生成配置\r\n- **选 3（本地）** → 向导提示安装 Tesseract → 配置完成\r\n\r\n**第 3 步：创建文件夹结构**\r\n```\r\n  步骤 3：创建文件夹结构\r\n  ✅ 已创建文件夹：待处理图片\r\n  ✅ 已创建文件夹：已处理图片\r\n  ✅ 已创建文件夹：处理结果\r\n  \r\n  ✅ 配置已保存到 config/api_keys.yaml\r\n```\r\n\r\n**第 4 步（可选）：配置 IMA 同步**\r\n```\r\n  （可选）配置 IMA 同步\r\n  ℹ️ IMA 是一个笔记服务，可以自动同步你生成的文档。\r\n  ℹ️ 如果你不用 IMA，可以直接跳过。\r\n  \r\n  是否配置 IMA 同步？(y/n):\r\n```\r\n\r\n- 选 `y` → 向导提示获取 IMA API Key → 你填入 `config/api_keys_template.txt` → 向导自动读取并生成配置\r\n- 选 `n` → 跳过，随时可以重新运行向导添加\r\n\r\n**完成！**\r\n```\r\n==================================================\r\n  🎉 配置完成！\r\n==================================================\r\n  \r\n  接下来你可以：\r\n  1. 把要处理的图片放到「待处理图片」文件夹里\r\n  2. 运行：python auto_process_all_v9_4.py\r\n  3. 等待处理完成，结果在「处理结果」文件夹里\r\n```\r\n\r\n---\r\n\r\n### 第三步：放入图片，开始处理\r\n\r\n#### 如果使用 WorkBuddy Skill（方式 A）\r\n\r\n1. 把图片放到：`你的工作文件夹\\待处理图片\\`\r\n2. 对 WorkBuddy 说：`处理新图片`\r\n3. 等待处理完成（约 3-5 秒/张）\r\n4. 结果在：`你的工作文件夹\\处理结果\\`\r\n\r\n#### 如果本地运行（方式 B 或 C）\r\n\r\n1. 把图片放到：`你的工作文件夹\\待处理图片\\`\r\n2. 运行：`python auto_process_all_v9_4.py`\r\n3. 等待处理完成（约 3-5 秒/张）\r\n4. 结果在：`你的工作文件夹\\处理结果\\`\r\n\r\n---\r\n\r\n## 📖 使用指南\r\n\r\n### 目录结构\r\n\r\n```\r\n图片知识库\\\r\n├── auto_process_all_v9_4.py   ← 主处理脚本（V9.5 逻辑）\r\n├── setup_wizard.py            ← 新手向导脚本\r\n├── requirements.txt\r\n├── config\\\r\n│   └── api_keys.yaml        ← OCR/IMA 配置（向导自动生成）\r\n├── 待处理图片\\                ← 放入待处理图片\r\n│   ├── 健康养生\\\r\n│   ├── 旅行记录\\\r\n│   └── ...\r\n├── 已处理图片\\                ← 处理完的图片自动归档\r\n└── 处理结果\\                  ← 生成的 Word/Markdown 文档\r\n    ├── 历史文化-钱谦益传.docx\r\n    ├── 历史文化-钱谦益传.md\r\n    └── ...\r\n```\r\n\r\n### 日常使用流程\r\n\r\n#### 第 1 步：放入新图片\r\n\r\n把手机截图复制到 `待处理图片` 文件夹（支持子文件夹分类）：\r\n\r\n```\r\n待处理图片\\健康养生\\  ← 健康类图片\r\n待处理图片\\旅行记录\\  ← 旅行类图片\r\n```\r\n\r\n#### 第 2 步：启动处理\r\n\r\n**WorkBuddy 用户**：\r\n```\r\n处理新图片\r\n```\r\n\r\n**本地用户**：\r\n```bash\r\npython auto_process_all_v9_4.py\r\n```\r\n\r\n#### 第 3 步：查看结果\r\n\r\n处理完成后，打开 `处理结果` 文件夹，你会看到：\r\n\r\n```\r\n处理结果\\\r\n├── 历史文化-钱谦益传.docx    ← Word 格式（可编辑）\r\n├── 历史文化-钱谦益传.md     ← Markdown 格式（纯文本）\r\n├── 营养健康-抗炎饮食.docx\r\n└── 营养健康-抗炎饮食.md\r\n```\r\n\r\n---\r\n\r\n## ⚙️ 配置说明\r\n\r\n### 密钥填写模板（安全改进 ⭐）\r\n\r\n**新用户注意**：为了保护你的 API 密钥安全，**不再需要把密钥发给 WorkBuddy**！\r\n\r\n我们采用 **本地 TXT 文件** 传递密钥：\r\n1. 向导会教你如何获取 API 密钥\r\n2. 你把密钥填入 `config/api_keys_template.txt`（有详细填写说明）\r\n3. 填好后保存，按回车继续\r\n4. 向导自动读取 TXT 文件，生成加密的 YAML 配置文件\r\n\r\n**优势**：\r\n- ✅ 密钥不会出现在聊天记录中\r\n- ✅ 密钥不会通过网络传输（除了正常的 API 调用）\r\n- ✅ 你可以在本地安全地编辑文件\r\n\r\nTXT 模板文件路径：`config/api_keys_template.txt`（向导会自动创建）\r\n\r\n---\r\n\r\n### API 密钥配置（向导自动完成）\r\n\r\n新手向导会在 `config/api_keys.yaml` 生成如下配置：\r\n\r\n```yaml\r\n# OCR 服务（至少配置一个）\r\nocr:\r\n  tencent:\r\n    secret_id: \"你的腾讯云 SecretId\"\r\n    secret_key: \"你的腾讯云 SecretKey\"\r\n  \r\n  # 或百度云\r\n  baidu:\r\n    api_key: \"你的百度云 API Key\"\r\n    secret_key: \"你的百度云 Secret Key\"\r\n\r\n# IMA 同步（可选，向导会问你要不要配置）\r\nima:\r\n  api_key: \"你的 IMA API Key\"\r\n  base_url: \"https://api.ima.tencent.com/v1\"\r\n```\r\n\r\n### 如何获取 API 密钥（向导会一步步教）\r\n\r\n| 服务 | 免费额度 | 获取地址 | 向导支持 |\r\n|------|----------|----------|----------|\r\n| 腾讯云 OCR | 1000次/月 | https://console.cloud.tencent.com/cam/capi | ✅ 图文教程 |\r\n| 百度云 OCR | 50000次/天 | https://console.bce.baidu.com/ | ✅ 图文教程 |\r\n| 本地 Tesseract | 完全免费 | https://github.com/UB-Mannheim/tesseract/wiki | ✅ 安装引导 |\r\n\r\n---\r\n\r\n## 📊 分类体系\r\n\r\n### 预设分类（可自动扩展）\r\n\r\n| 分类 | 说明 | 示例 |\r\n|------|------|------|\r\n| **历史文化** | 历史、人物传记、文化知识 | 钱谦益传、南宋历史 |\r\n| **营养健康** | 饮食、营养、健康知识 | 抗炎饮食、肠道健康 |\r\n| **生活方式** | 运动、睡眠、日常建议 | 日常饮食建议 |\r\n| **教育育儿** | 教育方法、育儿知识 | - |\r\n| **旅游攻略** | 旅行记录、景点介绍 | - |\r\n\r\n### 动态分类\r\n\r\n当内容不属于预设分类时，AI 会：\r\n1. 自动判断新主题名称\r\n2. 自由命名分类\r\n3. 创建新分类并归档\r\n\r\n**示例**：\r\n- 图片内容是关于「摄影技巧」→ AI 自动创建 `摄影技巧` 分类\r\n- 图片内容是关于「编程学习」→ AI 自动创建 `编程学习` 分类\r\n\r\n---\r\n\r\n## 💡 常用指令\r\n\r\n### WorkBuddy 用户\r\n\r\n在 WorkBuddy 对话中可以使用：\r\n\r\n| 指令 | 效果 |\r\n|------|------|\r\n| `第一次使用` 或 `初始化` | 启动新手向导（首次配置） |\r\n| `处理新图片` | 处理所有待处理图片 |\r\n| `处理待处理图片/健康养生` | 只处理指定文件夹的图片 |\r\n| `查看现有文档` | 列出所有文档和章节列表 |\r\n| `重新配置` | 重新运行向导更新配置 |\r\n\r\n### 本地用户\r\n\r\n```bash\r\n# 启动新手向导（首次使用）\r\npython setup_wizard.py\r\n\r\n# 处理图片\r\npython auto_process_all_v9_4.py\r\n\r\n# 分批处理（大量图片）\r\npython auto_process_all_v9_4.py --batch\r\n\r\n# 查看进度\r\npython auto_process_all_v9_4.py --progress\r\n\r\n# 清除状态\r\npython auto_process_all_v9_4.py --clear\r\n```\r\n\r\n---\r\n\r\n## 📂 输出示例\r\n\r\n### 处理结果目录\r\n\r\n```\r\n处理结果\\\r\n├── 历史文化-钱谦益传.docx\r\n├── 历史文化-钱谦益传.md\r\n├── 历史文化-南宋历史概述.docx\r\n├── 历史文化-南宋历史概述.md\r\n└── ...\r\n```\r\n\r\n### 文档内容结构\r\n\r\n```markdown\r\n# 历史文化-钱谦益传\r\n\r\n## 一、生平简介\r\n（OCR 识别内容，AI 自动分段）\r\n\r\n## 二、主要成就\r\n（结构化整理）\r\n\r\n## 三、历史评价\r\n（自动分类归档）\r\n```\r\n\r\n---\r\n\r\n## 🔧 高级功能\r\n\r\n### 分批处理\r\n\r\n处理大量图片时，系统会自动分批：\r\n\r\n| 图片大小 | 每批数量 |\r\n|---------|---------|\r\n| < 500KB | 10 张/批 |\r\n| 500KB-2MB | 6 张/批 |\r\n| 2MB-5MB | 4 张/批 |\r\n| > 5MB | 2 张/批 |\r\n\r\n### 断点续传\r\n\r\n如果处理中断，可以恢复：\r\n\r\n```bash\r\npython auto_process_all_v9_4.py --batch\r\n```\r\n\r\n查看进度：\r\n\r\n```bash\r\npython auto_process_all_v9_4.py --progress\r\n```\r\n\r\n清除状态：\r\n\r\n```bash\r\npython auto_process_all_v9_4.py --clear\r\n```\r\n\r\n---\r\n\r\n## 🐛 常见问题\r\n\r\n### Q1：我是小白，能用好吗？\r\n\r\n**答**：完全可以！  \r\n- 第一次使用会自动启动**新手向导**，一步步教你配置\r\n- 只需 2 分钟，无需任何技术背景\r\n- 配置完成后，每次只需说\"处理新图片\"即可\r\n\r\n### Q2：OCR 识别失败怎么办？\r\n\r\n**解决**：\r\n1. 检查图片清晰度（建议分辨率 ≥ 150 DPI）\r\n2. 确认已配置腾讯云/百度云 OCR\r\n3. 安装本地 Tesseract 作为兜底\r\n\r\n### Q3：文档命名不符合预期？\r\n\r\n**解决**：\r\n- 文档命名格式：`{分类}-{主题}`\r\n- 这是 AI 自动生成的，符合内容主题\r\n- 如需自定义，可修改 `auto_process_all_v9_4.py` 中的命名规则\r\n\r\n### Q4：如何避免重复内容？\r\n\r\n**解决**：\r\n- 系统自动检测重复（Hash + 主题词相似度）\r\n- 重复图片会自动跳过\r\n\r\n### Q5：IMA 同步失败？\r\n\r\n**解决**：\r\n1. 检查 `config/api_keys.yaml` 中的 IMA 配置是否正确\r\n2. 确认凭证未过期\r\n3. 重新运行向导：`python setup_wizard.py`\r\n\r\n---\r\n\r\n## 📈 性能指标\r\n\r\n- **处理速度**：约 3-5 秒/张（取决于 OCR 引擎）\r\n- **识别准确率**：中文 90%+（腾讯云 OCR）\r\n- **支持格式**：JPG, PNG, WEBP, BMP\r\n- **输出格式**：Word (.docx) + Markdown (.md)\r\n\r\n---\r\n\r\n## 🛠️ 技术栈\r\n\r\n| 技术 | 用途 |\r\n|------|------|\r\n| **OCR** | 腾讯云、百度云、Tesseract |\r\n| **AI 分析** | 混元 Lite、Kimi、Doubao |\r\n| **文档生成** | python-docx |\r\n| **同步** | IMA OpenAPI |\r\n| **语言** | Python 3.8+ |\r\n\r\n---\r\n\r\n## 📄 文件说明\r\n\r\n### 核心脚本\r\n\r\n| 文件 | 说明 |\r\n|------|------|\r\n| `auto_process_all_v9_4.py` | 当前最新版本（V9.5 逻辑） |\r\n| `setup_wizard.py` | 🆕 新手向导脚本（首次使用自动启动） |\r\n| `ima_sync.py` | IMA 同步脚本 |\r\n| `classifier_engine.py` | 分类引擎 |\r\n\r\n### 配置文件\r\n\r\n| 文件 | 说明 |\r\n|------|------|\r\n| `config/api_keys.yaml` | OCR/IMA 凭证配置（向导自动生成） |\r\n| `requirements.txt` | Python 依赖列表 |\r\n| `.env` | 环境变量（不提交到 Git） |\r\n\r\n---\r\n\r\n## 🤝 贡献指南\r\n\r\n欢迎提交 Issue 和 Pull Request！\r\n\r\n1. Fork 本仓库\r\n2. 创建你的特性分支 (`git checkout -b feature/AmazingFeature`)\r\n3. 提交你的更改 (`git commit -m 'Add some AmazingFeature'`)\r\n4. 推送到分支 (`git push origin feature/AmazingFeature`)\r\n5. 打开一个 Pull Request\r\n\r\n---\r\n\r\n## 📝 更新日志\r\n\r\n### v1.1.0 (2026-04-27) 🆕\r\n\r\n- ✅ **内置新手向导**（首次使用自动引导配置）\r\n- ✅ 支持图文教程获取 API 密钥\r\n- ✅ 自动创建文件夹结构\r\n- ✅ 更新至 V9.5 处理逻辑\r\n- ✅ 删除\"综合知识\"兜底分类\r\n- ✅ 支持 LLM 自由命名分类\r\n- ✅ 新增 `setup_wizard.py` 向导脚本\r\n\r\n### v1.0.0 (2026-03-17)\r\n\r\n- ✅ 初始版本发布\r\n- ✅ 支持 OCR 识别（腾讯云、百度云、Tesseract）\r\n- ✅ AI 智能分类和文档合并\r\n- ✅ Word + Markdown 双格式输出\r\n- ✅ IMA 同步功能\r\n\r\n---\r\n\r\n## 📄 许可证\r\n\r\n本项目采用 MIT 许可证 - 查看 [LICENSE](LICENSE) 文件了解详情。\r\n\r\n---\r\n\r\n## 🙏 致谢\r\n\r\n- [WorkBuddy](https://workbuddy.ai) - AI 助手平台\r\n- [腾讯云 OCR](https://cloud.tencent.com/product/ocr) - OCR 服务\r\n- [百度云 OCR](https://ai.baidu.com/tech/ocr) - OCR 服务\r\n- [Tesseract](https://github.com/tesseract-ocr/tesseract) - 开源 OCR 引擎\r\n\r\n---\r\n\r\n## 📧 联系\r\n\r\n- GitHub Issues：[提交问题](https://github.com/haoyiyong985/image-knowledge-converter/issues)\r\n- 邮箱：（添加你的联系方式）\r\n\r\n---\r\n\r\n**⭐ 如果这个项目对你有帮助，请给它一个星标！**\n\nFile v1.2.7:_meta.json\n\n{\n  \"ownerId\": \"kn7fh9qe66jy2s283bfvw6b61d89w2cv\",\n  \"slug\": \"image-knowledge-converter\",\n  \"version\": \"1.2.7\",\n  \"publishedAt\": 1783154661903\n}\n\nFile v1.2.7:references/usage-guide.md\n\n# 图片知识库整理工具 - 使用指南\n\n## 快速开始\n\n### 1. 安装依赖\n```bash\npip install -r requirements.txt\n```\n\n### 2. 初始化\n运行脚本后选择「初始化知识库」，会自动创建：\n- `待处理图片/` - 放入待处理截图\n- `已处理图片/` - 自动归档\n- `处理结果/` - 生成的 Word/MD 文档\n\n### 3. 放入图片\n将截图放入 `待处理图片/<主题>/`，例如：\n```\n待处理图片/中医养生/截图1.png\n待处理图片/健康饮食/截图2.png\n```\n\n### 4. 开始处理\n```bash\npython auto_process_all_v9_4.py\n```\n\n---\n\n## 常用命令\n\n| 命令 | 说明 |\n|------|------|\n| `python auto_process_all_v9_4.py` | 处理所有待处理图片 |\n| 查看 `处理结果/` 目录 | 查看已生成的文档 |\n\n---\n\n## OCR 配置\n\n支持三种 OCR 引擎（自动降级）：\n1. 腾讯云 OCR（优先）\n2. 百度云 OCR（备用）\n3. 本地 Tesseract（兜底）\n\n配置方法见 `docs/多引擎OCR使用说明.md`\n\n---\n\n## IMA 同步（可选）\n\n1. 获取 IMA OpenAPI 凭证\n2. 编辑 `ima_config.txt` 填入凭证\n3. 运行脚本时会自动同步\n\n---\n\n## 常见问题\n\n**Q: 处理失败？**  \nA: 检查 `logs/` 目录中的日志文件。\n\n**Q: 如何切换 AI 模型？**  \nA: 参见 `docs/切换模型指南.md`。\n\n**Q: 图片识别不准确？**  \nA: 确保图片清晰，或配置更强大的 OCR 引擎。\n\nFile v1.2.7:assets/SCREENSHOTS_GUIDE.md\n\n# 项目截图使用指南\n\n本目录用于存放项目截图和示例图片。\n\n## 📷 推荐的截图类型\n\n### 1. 产品界面截图\n| 截图名称 | 内容 | 用途 |\n|---------|------|------|\n| `screenshot_workbuddy_main.png` | WorkBuddy 主界面 | README 展示 |\n| `screenshot_skill_list.png` | Skills 列表（显示本技能） | 使用指南 |\n| `screenshot_import_skill.png` | 导入 Skill 界面 | 安装教程 |\n\n### 2. 操作步骤截图\n| 截图名称 | 内容 | 用途 |\n|---------|------|------|\n| `screenshot_init.png` | 初始化知识库 | 使用指南 |\n| `screenshot_folder_empty.png` | 空文件夹（待处理图片） | 使用指南 |\n| `screenshot_folder_with_images.png` | 放入图片后的文件夹 | 使用指南 |\n| `screenshot_processing.png` | AI 正在处理 | 使用指南 |\n| `screenshot_complete.png` | 处理完成提示 | 使用指南 |\n\n### 3. 文档效果截图\n| 截图名称 | 内容 | 用途 |\n|---------|------|------|\n| `screenshot_word_doc.png` | Word 文档效果 | README 展示 |\n| `screenshot_md_doc.png` | Markdown 文档效果 | README 展示 |\n| `screenshot_folder_structure.png` | 目录结构 | 使用指南 |\n\n### 4. 对比效果截图（用于推广）\n| 截图名称 | 内容 | 用途 |\n|---------|------|------|\n| `screenshot_before.png` | 原始截图（处理前） | 推广素材 |\n| `screenshot_after.png` | 整理后的文档（处理完） | 推广素材 |\n\n---\n\n## 📸 如何准备截图\n\n### Windows 截图方法\n\n#### 方法一：PrintScreen 键\n1. 按 `PrtSc` 键（全屏截图）\n2. 打开画图工具（Win + R → 输入 `mspaint`）\n3. 粘贴（Ctrl + V）\n4. 保存为 PNG 格式\n\n#### 方法二：Win + Shift + S（推荐）\n1. 按 `Win + Shift + S`\n2. 选择截图区域\n3. 截图自动复制到剪贴板\n4. 粘贴到文件并保存\n\n#### 方法三：使用 Snipaste（第三方工具）\n- 下载：https://www.snipaste.com/\n- 按 F1 截图，F3 贴图\n\n---\n\n## 📂 目录结构示例\n\n```\nassets/\n└── screenshots/\n    ├── 产品界面/\n    │   ├── workbuddy_main.png\n    │   ├── skill_list.png\n    │   └── import_skill.png\n    ├── 操作步骤/\n    │   ├── init.png\n    │   ├── folder_empty.png\n    │   ├── folder_with_images.png\n    │   ├── processing.png\n    │   └── complete.png\n    ├── 文档效果/\n    │   ├── word_doc.png\n    │   ├── md_doc.png\n    │   └── folder_structure.png\n    └── 对比效果/\n        ├── before.png\n        └── after.png\n```\n\n---\n\n## 📝 在 README.md 中添加截图\n\n准备好截图后，可以在 README.md 中添加以下部分：\n\n```markdown\n## 📸 效果展示\n\n### 处理前（原始截图）\n![处理前](assets/screenshots/对比效果/before.png)\n\n### 处理完（生成的文档）\n![处理完](assets/screenshots/对比效果/after.png)\n\n### Word 文档效果\n![Word 文档](assets/screenshots/文档效果/word_doc.png)\n\n### Markdown 文档效果\n![Markdown 文档](assets/screenshots/文档效果/md_doc.png)\n```\n\n---\n\n## 🚀 快速开始\n\n1. **准备截图**：按照上面的推荐清单拍摄\n2. **放入目录**：将截图文件放入 `assets/screenshots/` 对应子目录\n3. **提交到 Git**：\n   ```bash\n   git add assets/screenshots/\n   git commit -m \"docs: add project screenshots\"\n   git push origin master\n   ```\n4. **更新 README**：在 README.md 中添加截图展示部分\n\n---\n\n## 💡 提示\n\n- ✅ 使用 PNG 格式（清晰度更高）\n- ✅ 截图分辨率建议 1920x1080 或 1280x720\n- ✅ 确保截图中的文字清晰可读\n- ✅ 可以稍后补充，不影响项目正常使用\n\n---\n\n**祝你使用愉快！** 🎉\n\nFile v1.2.7:docs/OCR引擎自动回退说明.md\n\n# OCR引擎自动回退机制说明\r\n\r\n**更新日期**: 2026年4月5日  \r\n**版本**: v1.2\r\n\r\n---\r\n\r\n## 🔄 自动回退流程\r\n\r\n当调用OCR引擎时，系统会按以下优先级自动选择和回退：\r\n\r\n```\r\n第1优先级: 腾讯云OCR (1000次/月)\r\n    ↓ 额度用完或调用失败\r\n第2优先级: 百度云OCR (1000次/月)\r\n    ↓ 额度用完或调用失败\r\n第3优先级: AI视觉识别 (无限制)\r\n```\r\n\r\n---\r\n\r\n## 📊 引擎配置\r\n\r\n| 引擎 | 优先级 | 免费额度 | 特点 |\r\n|------|--------|----------|------|\r\n| 腾讯云OCR | 1 | 1000次/月 | 精度最高 |\r\n| 百度云OCR | 2 | 1000次/月 | 性价比高 |\r\n| AI视觉识别 | 3 | 无限 | 兜底方案 |\r\n\r\n**合计免费额度**: 2000次/月\r\n\r\n---\r\n\r\n## ⚙️ 回退触发条件\r\n\r\n### 1. 额度用完自动回退\r\n\r\n当某个引擎的日使用量达到限额时，自动切换到下一个引擎：\r\n\r\n```python\r\n# 伪代码\r\nif 腾讯云使用量 >= 1000:\r\n    使用百度云OCR\r\nelif 百度云使用量 >= 1000:\r\n    使用AI视觉识别\r\n```\r\n\r\n### 2. 调用失败自动回退\r\n\r\n当API调用失败时（如网络错误、权限不足等），自动标记该引擎为\"已用完\"并切换到下一个：\r\n\r\n```python\r\ntry:\r\n    result = 腾讯云OCR识别()\r\nexcept Exception as e:\r\n    标记腾讯云为失败状态\r\n    return 递归调用下一个引擎()\r\n```\r\n\r\n### 3. 未配置自动跳过\r\n\r\n如果某个引擎没有配置API密钥，自动跳过：\r\n\r\n```python\r\nif 未配置腾讯云密钥:\r\n    跳过腾讯云，尝试百度云\r\nif 未配置百度云密钥:\r\n    跳过百度云，直接使用AI视觉\r\n```\r\n\r\n---\r\n\r\n## 📝 使用示例\r\n\r\n### 基本使用\r\n\r\n```python\r\nfrom ocr_engine_manager import get_ocr_manager\r\n\r\nmanager = get_ocr_manager()\r\n\r\n# 自动选择可用引擎\r\nresult, engine_name = manager.recognize_image(\"图片路径.jpg\")\r\n\r\nif result == \"__AI_VISION__\":\r\n    print(\"云OCR额度已用完，需要使用AI视觉识别\")\r\nelse:\r\n    print(f\"使用 {engine_name} 识别成功\")\r\n```\r\n\r\n### 查看当前状态\r\n\r\n```python\r\nstatus = manager.get_status()\r\nprint(f\"当前引擎: {status['current_engine']}\")\r\n\r\nfor engine_id, info in status['engines'].items():\r\n    print(f\"{info['name']}: {info['used_today']}/{info['daily_limit']} (剩余: {info['remaining']})\")\r\n```\r\n\r\n---\r\n\r\n## 💡 使用建议\r\n\r\n### 场景1：月处理量 < 1000张\r\n- 只用腾讯云OCR即可\r\n- 精度最高\r\n\r\n### 场景2：月处理量 1000-2000张\r\n- 腾讯云 + 百度云组合\r\n- 先用完腾讯云，自动切换到百度云\r\n\r\n### 场景3：月处理量 > 2000张\r\n- 前2000张使用云OCR（免费）\r\n- 超出部分使用AI视觉识别\r\n- 或购买百度云次数包（50元/1万次）\r\n\r\n---\r\n\r\n## 🔍 故障排查\r\n\r\n### 问题：一直使用AI视觉，不调用云OCR\r\n\r\n**可能原因**:\r\n1. 云OCR未配置密钥\r\n2. 云OCR额度已用完\r\n3. 云OCR调用失败（权限不足、网络问题）\r\n\r\n**检查方法**:\r\n```bash\r\npython ocr_engine_manager.py\r\n```\r\n\r\n### 问题：百度云返回\"权限不足\"错误\r\n\r\n**原因**: 百度云应用未开通\"通用文字识别\"服务\r\n\r\n**解决**:\r\n1. 登录 https://console.bce.baidu.com/ai/\r\n2. 进入「文字识别」服务\r\n3. 开通「通用文字识别」\r\n\r\n---\r\n\r\n## 📈 使用量追踪\r\n\r\n使用量保存在：\r\n```\r\n.workbuddy/memory/ocr_engine_log.json\r\n```\r\n\r\n格式：\r\n```json\r\n{\r\n  \"date\": \"2026-04-05\",\r\n  \"usage\": {\r\n    \"tencent\": 100,\r\n    \"baidu\": 50,\r\n    \"ai_vision\": 0\r\n  }\r\n}\r\n```\r\n\r\n---\r\n\r\n## ✅ 总结\r\n\r\n- **无需手动切换**，系统自动处理\r\n- **免费额度**: 2000次/月（腾讯云1000 + 百度云1000）\r\n- **超出免费额度**: 自动使用AI视觉识别\r\n- **购买付费包**: 如需更多云OCR调用，可购买百度云次数包\r\n\r\n---\r\n\r\n*文档生成时间: 2026年4月5日*\n\nFile v1.2.7:docs/使用说明.md\n\n# 图片知识库 — 使用说明\r\n\r\n> 适用范围：将手机截图自动整理为 Word + Markdown 知识文档，并自动同步到 ima 个人笔记\r\n> 最后更新：2026年3月16日\r\n\r\n---\r\n\r\n## 一、目录结构说明\r\n\r\n```\r\nD:\\新建文件夹\\\r\n│\r\n├── 待处理图片\\                    ← 新图片放这里（按主题分子文件夹）\r\n│   ├── 健康养生\\                  ← 示例：健康类图片放这里\r\n│   └── 旅行记录\\                  ← 示例：旅行类图片放这里\r\n│\r\n├── 已处理图片\\                    ← 处理完的图片自动归档（不用手动操作）\r\n│\r\n├── 处理结果\\                      ← 最终生成的 Word 和 MD 文档\r\n│   ├── 01_抗炎饮食与营养科普.docx/.md\r\n│   ├── 02_肠道健康与饮食分类.docx/.md\r\n│   ├── 03_中医养生与食疗.docx/.md\r\n│   ├── 04_日常饮食建议.docx/.md\r\n│   └── （新文档自动编号添加）\r\n│\r\n├── 【启动提示词】新对话粘贴这段.txt  ← 重启电脑后打开新对话用这个\r\n├── auto_process.py               ← 处理前自动检查脚本（含 ima 同步）\r\n├── ima_sync.py                   ← ima 自动同步脚本\r\n└── ima_config.txt                ← ima API 凭证配置（填入后自动生效）\r\n```\r\n\r\n---\r\n\r\n## 二、日常使用流程（3步）\r\n\r\n### 第 1 步：放入新图片\r\n\r\n把手机截图复制到对应主题文件夹：\r\n\r\n- 健康养生类 → `待处理图片\\健康养生\\`\r\n- 旅行记录类 → `待处理图片\\旅行记录\\`（文件夹没有就新建一个）\r\n- **文件夹名称可以随意起，中英文都行**\r\n\r\n---\r\n\r\n### 第 2 步：打开 WorkBuddy，恢复背景\r\n\r\n> ⚠️ **重要：** WorkBuddy 每次新开对话都是\"空白\"状态，不记得之前的内容。\r\n> 必须先粘贴启动提示词，AI 才知道你的项目在哪、有哪些文档。\r\n\r\n**操作步骤：**\r\n\r\n1. 打开电脑上的 WorkBuddy\r\n2. 新建一个对话（或直接在对话框里）\r\n3. 打开文件 `D:\\新建文件夹\\【启动提示词】新对话粘贴这段.txt`\r\n4. 全选文件内容（Ctrl+A），复制（Ctrl+C）\r\n5. 粘贴到 WorkBuddy 对话框，发送\r\n6. AI 回复\"已准备好\"后，继续下一步\r\n\r\n---\r\n\r\n### 第 3 步：发送指令，开始处理\r\n\r\nAI 准备好后，发送：\r\n\r\n```\r\n处理新图片\r\n```\r\n\r\nAI 会自动完成：\r\n1. 读取已有4个文档的章节结构（知道哪些内容已经有了）\r\n2. 逐张识别图片中的文字\r\n3. 判断内容属于哪个分类\r\n4. 同类内容 → 追加到已有文档（不会重复已有章节）\r\n5. 新主题内容 → 自动新建 `05_xxx.docx/.md`\r\n6. 处理完的图片移动到 `已处理图片\\` 归档\r\n\r\n---\r\n\r\n## 三、有新类别文档时怎么操作\r\n\r\n当图片内容是全新主题（比如旅行、理财、学习笔记等），AI 会：\r\n\r\n1. **自动判断新主题名称**（根据图片内容决定）\r\n2. **自动编号**：在已有04号文档后，新建 `05_旅行记录.md` 和 `05_旅行记录.docx`\r\n3. **在对话中告诉你**：新建了什么文档、包含哪些内容\r\n4. **你无需任何操作**，直接去 `处理结果\\` 查看新文件即可\r\n\r\n---\r\n\r\n## 四、已有文档的合并规则\r\n\r\n| 新内容属于 | 处理方式 |\r\n|-----------|---------|\r\n| 抗炎/坚果/营养素 | 追加到 `01_抗炎饮食与营养科普` |\r\n| 肠道/益生菌/绿灯食物 | 追加到 `02_肠道健康与饮食分类` |\r\n| 中医/养生/食疗/茶饮 | 追加到 `03_中医养生与食疗` |\r\n| 早餐/食谱/饮食建议 | 追加到 `04_日常饮食建议` |\r\n| 全新主题 | 新建 `05_xxx` 文档（自动编号） |\r\n\r\n---\r\n\r\n## 五、常用指令\r\n\r\n在 WorkBuddy 对话中可以使用：\r\n\r\n| 发送内容 | 效果 |\r\n|---------|------|\r\n| `处理新图片` | 处理所有待处理图片 |\r\n| `处理待处理图片/健康养生` | 只处理健康养生文件夹的图片 |\r\n| `查看现有文档` | 列出所有文档和章节列表 |\r\n\r\n---\r\n\r\n## 六、注意事项\r\n\r\n| 情况 | 处理方式 |\r\n|------|---------|\r\n| 图片文字模糊看不清 | AI 会跳过并告知哪张识别不了 |\r\n| 同一张图跨多个主题 | AI 会拆分内容分别归入各文档 |\r\n| 想重新处理某张图片 | 把图片复制回 `待处理图片\\<主题>\\`，重新发指令 |\r\n| 电脑重启后找不到对话 | 重新粘贴启动提示词（见第二步）即可 |\r\n\r\n---\r\n\r\n## 七、ima 个人笔记自动同步\r\n\r\n处理完图片后，文档会**自动同步**到你的 ima 个人笔记，无需任何手动操作。\r\n\r\n### 首次配置（只需做一次）\r\n\r\n1. 打开文件 `D:\\新建文件夹\\ima_config.txt`，用记事本打开\r\n2. 把下面两行的占位文字替换成真实值：\r\n   ```\r\n   IMA_CLIENT_ID=填入你的ClientID     ← 改成真实的 ClientID\r\n   IMA_API_KEY=填入你的APIKey         ← 改成真实的 APIKey\r\n   ```\r\n3. 保存文件（Ctrl+S）\r\n\r\n> 凭证获取地址：https://ima.qq.com/agent-interface\r\n> 凭证有效期至 2026-04-16，到期后重新获取并更新此文件即可\r\n\r\n### 同步逻辑\r\n\r\n| 情况 | 处理方式 |\r\n|------|---------|\r\n| 文档首次同步 | 在 ima 新建笔记 |\r\n| 文档有新内容（追加了章节） | 自动在 ima 原笔记末尾追加 |\r\n| 文档未变更 | 跳过，不重复同步 |\r\n\r\n### 单独运行同步（可选）\r\n\r\n也可以随时手动触发同步，在命令窗口运行：\r\n\r\n```\r\npython D:\\新建文件夹\\ima_sync.py          ← 同步有变更的文件\r\npython D:\\新建文件夹\\ima_sync.py --force  ← 强制重新同步全部文件\r\npython D:\\新建文件夹\\ima_sync.py --check  ← 仅验证凭证是否有效\r\n```\r\n\r\n---\r\n\r\n## 八、快速流程图（含 ima 同步）\r\n\r\n```\r\n有新图片了？\r\n    ↓\r\n放入 待处理图片\\<主题名>\\\r\n    ↓\r\n打开 WorkBuddy → 粘贴「启动提示词」→ 发送\r\n    ↓\r\nAI 回复「已准备好」\r\n    ↓\r\n发送：处理新图片\r\n    ↓\r\n等待完成，查看 处理结果\\ 目录\r\n    ↓\r\n自动同步到 ima 个人笔记 ✅（无需任何操作）\r\n```\n\nFile v1.2.7:docs/切换模型指南.md\n\n# 🔄 WorkBuddy 切换到支持图片的模型 - 详细指南\r\n\r\n---\r\n\r\n## 🎯 目标\r\n\r\n切换到支持图片识别的 AI 模型，让「图片知识库转化工具」能够正常工作。\r\n\r\n---\r\n\r\n## 📍 第1步：打开模型设置\r\n\r\n### 方法1：通过右上角头像（推荐）\r\n\r\n1. **打开 WorkBuddy**\r\n2. **点击右上角头像**\r\n3. **进入「设置」**\r\n4. **点击「AI模型」**\r\n\r\n---\r\n\r\n## 🔧 第2步：选择支持图片的模型\r\n\r\n### WorkBuddy 支持的模型类型\r\n\r\n根据搜索结果，WorkBuddy 内置了多种主流 AI 模型：\r\n\r\n| 模型类型 | 特点 | 是否支持图片 | 推荐用途 |\r\n|---------|------|-------------|---------|\r\n| **Hunyuan（混元）** | 擅长中文理解 | ❓ 待确认 | 中文文档写作 |\r\n| **GLM** | 中文能力强 | ❓ 待确认 | 中文任务 |\r\n| **DeepSeek** | 推理能力强 | ❓ 待确认 | 复杂推理 |\r\n| **GPT-4V** | 多模态 | ✅ 支持 | 图片识别（推荐） |\r\n| **Claude 3.5** | 多模态 | ✅ 支持 | 图片识别（推荐） |\r\n\r\n---\r\n\r\n## 💡 第3步：如何识别支持图片的模型\r\n\r\n### 方法1：查看模型描述\r\n\r\n在选择模型时，查看描述中是否包含：\r\n- \"多模态\"\r\n- \"视觉\"\r\n- \"图片识别\"\r\n- \"Image\"\r\n- \"Vision\"\r\n\r\n### 方法2：尝试测试\r\n\r\n1. 选择一个模型\r\n2. 发送一张图片\r\n3. 如果能识别，说明支持\r\n4. 如果报错\"不支持图片\"，说明不支持\r\n\r\n---\r\n\r\n## ⚙️ 完整操作流程\r\n\r\n### Windows 用户\r\n\r\n```\r\n1. 打开 WorkBuddy\r\n   ↓\r\n2. 点击右上角头像（用户图标）\r\n   ↓\r\n3. 选择「设置」或「Claw 设置」\r\n   ↓\r\n4. 点击「AI 模型」或「对话模型」\r\n   ↓\r\n5. 从下拉列表中选择模型\r\n   ↓\r\n6. 优先选择带\"多模态\"或\"Vision\"关键词的模型\r\n   ↓\r\n7. 保存设置\r\n   ↓\r\n8. 重启 WorkBuddy（可能需要）\r\n   ↓\r\n9. 测试发送一张图片\r\n   ↓\r\n10. 如果能识别，切换成功！\r\n```\r\n\r\n---\r\n\r\n## ✅ 验证切换成功\r\n\r\n### 测试方法1：发送图片\r\n\r\n1. 在 WorkBuddy 中拖入一张图片\r\n2. 或点击附件按钮选择图片\r\n3. 发送消息：\"请识别这张图片的内容\"\r\n\r\n**成功标志**: AI 能准确描述图片内容\r\n\r\n**失败标志**: 出现错误信息 \"current model does not support images\"\r\n\r\n---\r\n\r\n### 测试方法2：使用 Skill 测试\r\n\r\n1. 切换模型后\r\n2. 重新输入：\"处理新图片\"\r\n3. 观察能否识别图片\r\n\r\n**成功标志**: 开始识别图片文字\r\n\r\n**失败标志**: 再次报错 \"不支持图片\"\r\n\r\n---\r\n\r\n## 🤔 如果找不到支持图片的模型\r\n\r\n### 可能原因\r\n\r\n1. **账号限制**\r\n   - 免费账号可能不支持多模态模型\r\n   - 需要升级到付费版本\r\n\r\n2. **地区限制**\r\n   - 某些模型在特定地区不可用\r\n   - 可能需要切换账号类型\r\n\r\n3. **版本限制**\r\n   - 旧版本 WorkBuddy 可能不支持某些模型\r\n   - 需要更新到最新版本\r\n\r\n---\r\n\r\n## 🚨 如果切换失败\r\n\r\n### 选项 A：升级账号\r\n\r\n查看 WorkBuddy 账号计划，可能需要：\r\n- 从免费版升级到付费版\r\n- 购买多模态模型额度\r\n\r\n### 选项 B：联系客服\r\n\r\n在 WorkBuddy 中：\r\n1. 点击右上角头像\r\n2. 选择「帮助与反馈」\r\n3. 联系官方客服询问\r\n\r\n### 选项 C：等待我改进 Skill\r\n\r\n让我为你改进 Skill，添加 OCR 支持：\r\n- 使用腾讯云 OCR（免费额度）\r\n- 或使用 Tesseract OCR（免费开源）\r\n- 不依赖多模态模型\r\n\r\n---\r\n\r\n## 📋 切换检查清单\r\n\r\n切换完成后，请确认以下项目：\r\n\r\n- [ ] WorkBuddy 成功打开\r\n- [ ] 能找到「设置」→「AI 模型」\r\n- [ ] 找到包含\"多模态\"或\"Vision\"关键词的模型\r\n- [ ] 成功切换到新模型\r\n- [ ] 重启 WorkBuddy（如需要）\r\n- [ ] 发送一张图片测试\r\n- [ ] AI 能识别图片内容\r\n- [ ] 重新输入\"处理新图片\"测试\r\n- [ ] Skill 正常工作\r\n\r\n---\r\n\r\n## 📞 需要帮助？\r\n\r\n如果遇到问题，告诉我：\r\n\r\n**问题类型**:\r\n- 找不到「设置」入口\r\n- 「AI 模型」选项不存在\r\n- 没有支持图片的模型\r\n- 切换后仍然报错\r\n\r\n**请提供**:\r\n- 截图（界面设置页面的截图）\r\n- 错误信息（复制完整错误信息）\r\n- WorkBuddy 版本号\r\n\r\n我会帮你排查！\r\n\r\n---\r\n\r\n## 🎉 成功标志\r\n\r\n切换成功的标志：\r\n\r\n1. ✅ WorkBuddy 能识别图片\r\n2. ✅ 输入\"处理新图片\"能正常工作\r\n3. ✅ 截图能提取文字\r\n4. ✅ 能生成 Word 和 Markdown 文档\r\n\r\n---\r\n\r\n**下一步**:\r\n- 切换成功后，立即告诉我\r\n- 我会帮你进行完整的 Skill 功能测试\r\n- 然后继续第1天的其他任务\r\n\r\n---\r\n\r\n**祝你切换成功！** 🚀\r\n\r\n---\r\n\r\n**更新时间**: 2026-03-18\r\n**指南版本**: v1.0\n\nFile v1.2.7:docs/多引擎OCR使用说明.md\n\n# 多引擎 OCR 使用说明\r\n\r\n## 🎯 功能概述\r\n\r\n图片知识库工具现已支持**多 OCR 引擎自动切换**，当首选引擎达到频率限制时，会自动提示您选择备用引擎。\r\n\r\n### 支持的 OCR 引擎\r\n\r\n| 优先级 | 引擎 | 免费额度 | 特点 |\r\n|-------|------|---------|------|\r\n| 1 | 腾讯云 OCR | 1000次/月 | 首选，中文识别准确 |\r\n| 2 | 百度 OCR | 50000次/月 | 第一备用，额度充足 |\r\n| 3 | 本地 Tesseract | 无限 | 第二备用，无需网络 |\r\n\r\n---\r\n\r\n## 📦 文件说明\r\n\r\n| 文件 | 功能 |\r\n|-----|------|\r\n| `tencent_ocr.py` | 腾讯云 OCR 模块 |\r\n| `baidu_ocr.py` | 百度 OCR 模块 |\r\n| `local_ocr.py` | 本地 Tesseract 模块 |\r\n| `ocr_manager.py` | OCR 管理器（多引擎切换） |\r\n| `auto_process_v2.py` | 主程序（使用多引擎） |\r\n\r\n---\r\n\r\n## 🚀 使用方法\r\n\r\n### 方式一：使用默认配置（腾讯云）\r\n\r\n```bash\r\npython auto_process_v2.py\r\n```\r\n\r\n程序会自动使用已配置的腾讯云 OCR。\r\n\r\n### 方式二：当腾讯云达到频率限制\r\n\r\n当提示\"已达频率上限\"时，会弹出选择窗口：\r\n\r\n```\r\n⚠️ 腾讯云 OCR 达到频率限制\r\n\r\n请选择其他 OCR 引擎:\r\n\r\n✓ 腾讯云 OCR: 已配置\r\n✗ 百度 OCR: 未配置 API 密钥\r\n✗ 本地 Tesseract: 未安装\r\n\r\n请选择（输入数字）:\r\n1 - 腾讯云 OCR\r\n2 - 百度 OCR\r\n3 - 本地 Tesseract\r\n0 - 取消\r\n```\r\n\r\n**选择 2 或 3 切换到备用引擎**\r\n\r\n---\r\n\r\n## 🔧 配置备用引擎\r\n\r\n### 配置百度 OCR（推荐作为备用）\r\n\r\n**步骤 1：申请百度 OCR**\r\n1. 访问 https://ai.baidu.com/tech/ocr\r\n2. 登录百度账号\r\n3. 点击「立即使用」\r\n4. 创建应用，获取 AppID、API Key、Secret Key\r\n\r\n**步骤 2：配置密钥**\r\n\r\n编辑 `ocr_manager.py`，在文件开头添加：\r\n\r\n```python\r\n# 设置默认 API 密钥（腾讯云）\r\nos.environ['TENCENT_SECRET_ID'] = '你的腾讯云SecretId'\r\nos.environ['TENCENT_SECRET_KEY'] = '你的腾讯云SecretKey'\r\n\r\n# 设置百度 OCR 密钥\r\nos.environ['BAIDU_APP_ID'] = '你的百度AppID'\r\nos.environ['BAIDU_API_KEY'] = '你的百度APIKey'\r\nos.environ['BAIDU_SECRET_KEY'] = '你的百度SecretKey'\r\n```\r\n\r\n---\r\n\r\n### 配置本地 Tesseract\r\n\r\n**步骤 1：安装 Tesseract**\r\n\r\n1. 下载安装包：https://github.com/UB-Mannheim/tesseract/wiki\r\n2. 运行安装程序\r\n3. **重要**：安装时勾选中文语言包 (chi_sim)\r\n4. 将 Tesseract 安装目录添加到系统 PATH\r\n\r\n**步骤 2：安装 Python 包**\r\n\r\n```bash\r\npip install pytesseract pillow\r\n```\r\n\r\n**步骤 3：验证安装**\r\n\r\n```bash\r\ntesseract --version\r\n```\r\n\r\n---\r\n\r\n## 📋 使用流程示例\r\n\r\n### 场景 1：正常处理\r\n\r\n```\r\n开始处理\r\n  ↓\r\n自动选择腾讯云 OCR\r\n  ↓\r\n识别图片 ✓\r\n  ↓\r\n完成\r\n```\r\n\r\n### 场景 2：达到频率限制\r\n\r\n```\r\n开始处理\r\n  ↓\r\n自动选择腾讯云 OCR\r\n  ↓\r\n识别第 10 张图片...\r\n  ↓\r\n⚠️ 达到频率限制！\r\n  ↓\r\n[弹窗] 请选择备用引擎\r\n  ↓\r\n用户选择: 百度 OCR\r\n  ↓\r\n切换到百度 OCR\r\n  ↓\r\n继续识别剩余图片 ✓\r\n  ↓\r\n完成\r\n```\r\n\r\n---\r\n\r\n## 💡 最佳实践\r\n\r\n### 推荐配置\r\n\r\n**配置 1：腾讯云 + 百度（推荐）**\r\n- 首选：腾讯云（1000次/月）\r\n- 备用：百度（50000次/月）\r\n- 优点：额度充足，识别准确\r\n\r\n**配置 2：腾讯云 + 本地 Tesseract**\r\n- 首选：腾讯云\r\n- 备用：本地 Tesseract\r\n- 优点：完全免费，无需申请多个账号\r\n\r\n### 批量处理策略\r\n\r\n1. **小批量处理**：每次处理 5-10 张图片\r\n2. **遇到限制切换**：频率限制时立即切换备用引擎\r\n3. **错峰处理**：不同时间段使用不同引擎\r\n\r\n---\r\n\r\n## ⚠️ 常见问题\r\n\r\n### Q1: 弹窗没有显示\r\n\r\n**A**: 确保您的环境支持 GUI。如果在无界面环境运行，可以修改代码使用命令行选择：\r\n\r\n```python\r\n# 在 ocr_manager.py 中添加命令行选择模式\r\n```\r\n\r\n### Q2: 百度 OCR 如何申请\r\n\r\n**A**: \r\n1. 访问 https://ai.baidu.com/tech/ocr/general\r\n2. 点击「立即使用」\r\n3. 创建应用后获取密钥\r\n4. 免费额度：50000次/月\r\n\r\n### Q3: Tesseract 识别中文效果差\r\n\r\n**A**:\r\n1. 确保安装了中文语言包 `chi_sim.traineddata`\r\n2. 确保语言包在 Tesseract 的 `tessdata` 目录\r\n3. 初始化时指定语言：`LocalOCR(lang='chi_sim+eng')`\r\n\r\n### Q4: 如何查看当前使用的引擎\r\n\r\n**A**: 程序启动时会显示：\r\n```\r\n当前使用引擎: 腾讯云 OCR\r\n```\r\n\r\n---\r\n\r\n## 🔗 相关链接\r\n\r\n- 腾讯云 OCR：https://cloud.tencent.com/product/ocr\r\n- 百度 OCR：https://ai.baidu.com/tech/ocr\r\n- Tesseract：https://github.com/tesseract-ocr/tesseract\r\n\r\n---\r\n\r\n**现在您可以无忧处理大量图片了！** 🎉\n\nFile v1.2.7:docs/安装说明.md\n\n# 📦 图片知识库转化工具 v1.0 - 安装说明\r\n\r\n---\r\n\r\n## ✅ Skill 已自动安装到你的电脑！\r\n\r\n### 安装位置\r\n```\r\nC:\\Users\\LENOVO\\.workbuddy\\skills\\image-knowledge-converter\\\r\n```\r\n\r\n---\r\n\r\n## 🚀 如何使用\r\n\r\n### 方法1：自动识别（推荐）\r\n\r\nWorkBuddy 会自动识别新安装的 Skill，你可以直接使用以下指令：\r\n\r\n```\r\n初始化知识库\r\n```\r\n```\r\n处理新图片\r\n```\r\n```\r\n处理待处理图片/主题名\r\n```\r\n```\r\n查看现有文档\r\n```\r\n```\r\n工具优化\r\n```\r\n\r\n### 方法2：手动触发\r\n\r\n如果自动识别失败，可以手动加载 Skill：\r\n\r\n1. 打开 WorkBuddy\r\n2. 点击右上角头像 → **Skills 管理**\r\n3. 找到 **图片知识库转化工具 (image-knowledge-converter)**\r\n4. 点击 **启用**\r\n\r\n---\r\n\r\n## 📁 文件位置说明\r\n\r\n### 你的项目文件\r\n```\r\nD:\\新建文件夹\\\r\n├── 待处理图片\\        ← 放新截图的文件夹\r\n├── 处理结果\\          ← 生成的文档在这里\r\n├── 已处理图片\\        ← 归档的图片\r\n├── ima_config.txt     ← ima 凭证配置\r\n└── auto_process.py    ← 核心处理脚本\r\n```\r\n\r\n### Skill 文件（已安装）\r\n```\r\nC:\\Users\\LENOVO\\.workbuddy\\skills\\\r\n└── image-knowledge-converter\\\r\n    └── SKILL.md       ← WorkBuddy 会自动读取\r\n```\r\n\r\n---\r\n\r\n## 🧪 开始测试\r\n\r\n按照以下步骤测试 Skill 是否正常工作：\r\n\r\n### 第1步：准备测试图片\r\n\r\n在 `D:\\新建文件夹\\待处理图片\\` 下创建测试文件夹，例如：\r\n\r\n```\r\nD:\\新建文件夹\\待处理图片\\测试\\\r\n```\r\n\r\n放入 2-3 张手机截图\r\n\r\n### 第2步：初始化知识库\r\n\r\n在 WorkBuddy 中输入：\r\n\r\n```\r\n初始化知识库\r\n```\r\n\r\n### 第3步：处理图片\r\n\r\n在 WorkBuddy 中输入：\r\n\r\n```\r\n处理新图片\r\n```\r\n\r\n### 第4步：查看结果\r\n\r\n打开 `D:\\新建文件夹\\处理结果\\` 查看：\r\n- `.docx` 文件 - Word 文档\r\n- `.md` 文件 - Markdown 文档\r\n- `.txt` 文件 - 处理日志\r\n\r\n---\r\n\r\n## ✅ 测试检查清单\r\n\r\n- [ ] Skill 已成功安装到 `C:\\Users\\LENOVO\\.workbuddy\\skills\\image-knowledge-converter\\`\r\n- [ ] WorkBuddy 能识别 Skill（输入 \"/\" 查看可用技能）\r\n- [ ] 初始化知识库成功\r\n- [ ] 测试图片成功处理\r\n- [ ] 生成的文档格式正确\r\n- [ ] 图片成功归档\r\n\r\n---\r\n\r\n## 🤔 遇到问题？\r\n\r\n### 问题1：Skill 没有被识别\r\n**解决**：\r\n1. 重启 WorkBuddy\r\n2. 或点击右上角头像 → Skills 管理 → 刷新\r\n\r\n### 问题2：处理图片报错\r\n**解决**：\r\n1. 检查 `D:\\新建文件夹\\待处理图片\\` 路径是否正确\r\n2. 截图错误信息发给我\r\n\r\n### 问题3：找不到文档\r\n**解决**：\r\n1. 检查 `D:\\新建文件夹\\处理结果\\` 文件夹\r\n2. 查看处理日志（每次处理会生成日志）\r\n\r\n---\r\n\r\n## 📝 重要提醒\r\n\r\n- ✅ **无需手动导入 ZIP** - Skill 已直接安装在正确位置\r\n- ✅ **WorkBuddy 会自动识别** - 重启即可生效\r\n- ✅ **项目文件在 D:\\新建文件夹\\** - 所有操作都在这个目录\r\n- ✅ **随时找我帮忙** - 遇到任何问题告诉我\r\n\r\n---\r\n\r\n## 🎯 下一步\r\n\r\n1. **测试 Skill** - 按照上面的测试步骤操作\r\n2. **查看计划** - 打开 `本周行动计划.md`\r\n3. **遇到问题** - 截图或复制错误信息给我\r\n\r\n---\r\n\r\n**安装时间**: 2026-03-17\r\n**Skill 版本**: v1.0\r\n**支持文档**: `本周行动计划.md` | `测试检查清单.md` | `使用说明.md`\n\nFile v1.2.7:docs/快速入门指南.md\n\n# 图片知识库转化工具 v2.0 - 快速入门指南\r\n\r\n> 💡 **一句话说明**：把截图里的文字自动识别出来，整理到文档中\r\n\r\n---\r\n\r\n## 🚀 开始使用（3步走）\r\n\r\n### 第1步：准备图片\r\n\r\n把要处理的截图放到对应文件夹：\r\n\r\n```\r\nD:\\新建文件夹\\待处理图片\\\r\n├── 健康养生\\          ← 放健康养生类截图\r\n├── 肠道健康\\          ← 放肠道健康类截图\r\n├── 中医养生\\          ← 放中医养生类截图\r\n└── 日常饮食\\          ← 放饮食建议类截图\r\n```\r\n\r\n**提示**：\r\n- 支持格式：jpg、jpeg、png、webp、bmp\r\n- 图片越多，越能体现增强版的优势\r\n\r\n---\r\n\r\n### 第2步：运行程序\r\n\r\n双击运行或命令行执行：\r\n\r\n```bash\r\npython run_enhanced.py\r\n```\r\n\r\n---\r\n\r\n### 第3步：选择处理方式\r\n\r\n程序会显示菜单，根据你的情况选择：\r\n\r\n```\r\n📋 场景选择指南:\r\n============================================================\r\n【选项1】图片多/大小不一/首次使用 → 选 🚀 增强版\r\n【选项2】图片少/质量一致/求快速 → 选 📦 原始版\r\n【选项3】想看效果对比/测试安装 → 选 📊 性能测试\r\n【选项4】还没准备好/临时有事 → 选 ❌ 退出\r\n============================================================\r\n```\r\n\r\n---\r\n\r\n## 🎯 选择指南（详细版）\r\n\r\n### 选项1：🚀 增强版处理器\r\n\r\n**适合你的情况**：\r\n- ✅ 图片超过 20 张\r\n- ✅ 图片大小不一（有的几KB，有的几MB）\r\n- ✅ 第一次使用这个工具\r\n- ✅ 希望处理得更快\r\n- ✅ 不想处理到一半卡住\r\n\r\n**你会得到**：\r\n- 智能分批（大图小图分开处理）\r\n- 并发处理（同时处理多张）\r\n- 实时进度条（知道还要等多久）\r\n- 自动切换OCR（一个引擎限制自动换另一个）\r\n- 自动去重（相同内容只保留一份）\r\n\r\n**示例**：\r\n> 你有 100 张小红书截图，有的清晰有的模糊，大小不一。选这个！\r\n\r\n---\r\n\r\n### 选项2：📦 原始处理器\r\n\r\n**适合你的情况**：\r\n- ✅ 图片少于 20 张\r\n- ✅ 图片都很清晰（比如微信读书截图）\r\n- ✅ 想快点开始处理\r\n- ✅ 已经用熟了原来的方式\r\n\r\n**你会得到**：\r\n- 简单直接的处理\r\n- 快速启动\r\n- 和原来一样的体验\r\n\r\n**注意**：\r\n- 处理大量图片时可能会慢\r\n- 遇到OCR频率限制需要手动切换\r\n\r\n**示例**：\r\n> 你只有 8 张微信读书截图，都很清晰。选这个！\r\n\r\n---\r\n\r\n### 选项3：📊 运行性能测试\r\n\r\n**适合你的情况**：\r\n- ✅ 想知道增强版到底快多少\r\n- ✅ 检查安装是否正确\r\n- ✅ 想生成对比报告发朋友圈\r\n\r\n**你会得到**：\r\n- 两个版本的性能对比\r\n- 可视化的 HTML 报告\r\n- 处理速度、内存占用等数据\r\n\r\n**示例**：\r\n> 你想给朋友展示这个工具多厉害。选这个生成报告！\r\n\r\n---\r\n\r\n### 选项4：❌ 退出\r\n\r\n**适合你的情况**：\r\n- ✅ 突然有事要忙\r\n- ✅ 发现图片还没放好\r\n- ✅ 想先整理一下再处理\r\n\r\n---\r\n\r\n## 📊 快速决策表\r\n\r\n| 你的情况 | 选哪个 | 为什么 |\r\n|---------|-------|-------|\r\n| 第一次用 | 选项1 | 最智能，不容易出错 |\r\n| 图片 > 50 张 | 选项1 | 需要分批和并发 |\r\n| 图片 < 10 张 | 选项2 | 简单任务，快速完成 |\r\n| 想对比效果 | 选项3 | 生成对比报告 |\r\n| 不确定 | 选项1 | 默认推荐，最安全 |\r\n\r\n---\r\n\r\n## ⚡ 处理完成后的结果\r\n\r\n处理完成后，你会在以下位置找到结果：\r\n\r\n```\r\nD:\\新建文件夹\\处理结果\\\r\n├── 01_抗炎饮食与营养科普.md    ← 健康养生类内容\r\n├── 02_肠道健康与饮食分类.md    ← 肠道健康类内容\r\n├── 03_中医养生与食疗.md        ← 中医养生类内容\r\n├── 04_日常饮食建议.md          ← 日常饮食类内容\r\n└── reports\\                    ← HTML处理报告\r\n    └── report_xxx.html         ← 可视化处理统计\r\n```\r\n\r\n同时，处理过的图片会被移动到：\r\n```\r\nD:\\新建文件夹\\已处理图片\\[主题名]\\batch_001_20260319\\\r\n```\r\n\r\n---\r\n\r\n## ❓ 常见问题\r\n\r\n### Q1：我应该选增强版还是原始版？\r\n\r\n**简单判断**：\r\n- 图片超过 20 张 → 增强版\r\n- 图片少于 10 张 → 原始版\r\n- 不确定 → 增强版（默认推荐）\r\n\r\n### Q2：处理过程中可以中断吗？\r\n\r\n**可以**：\r\n- 按 `Ctrl+C` 可以中断\r\n- 已处理的内容会保存\r\n- 下次可以从中断处继续\r\n\r\n### Q3：处理失败了怎么办？\r\n\r\n**排查步骤**：\r\n1. 检查网络连接（需要联网调用OCR）\r\n2. 检查OCR密钥是否配置正确\r\n3. 尝试切换OCR引擎（增强版会自动切换）\r\n4. 减少图片数量再试\r\n\r\n### Q4：为什么推荐交互式启动？\r\n\r\n**好处**：\r\n- 先看到有多少图片，再决定怎么处理\r\n- 防止误操作（比如不小心处理了错误的图片）\r\n- 可以中途改变主意\r\n- 新手友好，有明确提示\r\n\r\n---\r\n\r\n## 🎓 进阶技巧\r\n\r\n### 技巧1：批量整理图片\r\n\r\n处理前先把图片按主题分类放好，处理后会自动归档到对应文档。\r\n\r\n### 技巧2：定期生成报告\r\n\r\n处理完成后选择生成报告，可以看到：\r\n- 处理了多少张图片\r\n- 成功率多少\r\n- 用了多长时间\r\n- 哪些图片失败了\r\n\r\n### 技巧3：处理大量图片\r\n\r\n如果一次有几百张图片：\r\n1. 分批放入（每次 50-100 张）\r\n2. 使用增强版（智能分批）\r\n3. 晚上挂机处理（不用盯着）\r\n\r\n---\r\n\r\n## 📞 需要帮助？\r\n\r\n遇到问题请检查：\r\n1. 图片是否放在了正确的文件夹\r\n2. 网络是否连接正常\r\n3. OCR密钥是否配置正确\r\n4. 查看 `logs/` 目录下的错误日志\r\n\r\n---\r\n\r\n**文档版本**: v2.0  \r\n**最后更新**: 2026-03-19  \r\n**适用工具版本**: 图片知识库转化工具 v2.0+\n\nFile v1.2.7:skill-card.md\n\n## Description: <br>\nImage Knowledge Converter helps agents configure and run a screenshot-to-knowledge-base workflow that uses OCR and AI to create structured Markdown and Word documents. <br>\n\nThis skill is ready for commercial/non-commercial use. <br>\n\n## Publisher: <br>\n[haoyiyong985](https://clawhub.ai/user/haoyiyong985) <br>\n\n### License/Terms of Use: <br>\nMIT-0 <br>\n\n\n## Use Case: <br>\nExternal users and developers use this skill to configure local folders, OCR engines, optional AI analysis, and optional IMA sync, then process screenshots into organized knowledge-base documents. <br>\n\n### Deployment Geography for Use: <br>\nGlobal <br>\n\n## Known Risks and Mitigations: <br>\nRisk: Screenshots and generated notes may be sent to Tencent, Baidu, Moonshot, Doubao, SiliconFlow, or IMA when credentials are configured. <br>\nMitigation: Use a dedicated test folder first, process only non-sensitive screenshots, and do not configure cloud credentials unless cloud OCR, LLM analysis, or IMA sync is intended. <br>\nRisk: User-facing enable flags may not fully communicate when optional cloud flows are active. <br>\nMitigation: Review the generated config and runtime behavior before regular use, and keep cloud-upload prompts and enable flags tightened before using production data. <br>\nRisk: Production API keys may be exposed through local configuration if the workspace is shared or committed. <br>\nMitigation: Use test credentials during review, keep real keys out of shared folders and version control, and rotate any key placed in the artifact configuration by mistake. <br>\n\n\n## Reference(s): <br>\n- [ClawHub Skill Page](https://clawhub.ai/haoyiyong985/skills/image-knowledge-converter) <br>\n- [Usage Guide](references/usage-guide.md) <br>\n- [Quick Start Guide](docs/快速入门指南.md) <br>\n- [Multi-Engine OCR Guide](docs/多引擎OCR使用说明.md) <br>\n- [OCR Fallback Guide](docs/OCR引擎自动回退说明.md) <br>\n- [Model Switching Guide](docs/切换模型指南.md) <br>\n- [Tesseract OCR](https://github.com/tesseract-ocr/tesseract) <br>\n\n\n## Skill Output: <br>\n**Output Type(s):** [Guidance, Shell commands, Configuration, Markdown, Code] <br>\n**Output Format:** [Markdown guidance with inline shell commands and generated local document files] <br>\n**Output Parameters:** [1D] <br>\n**Other Properties Related to Output:** [The workflow can generate Markdown, Word documents, logs, processing reports, and optional cloud-synced notes.] <br>\n\n## Skill Version(s): <br>\n1.2.7 (source: server release metadata and SKILL.md frontmatter) <br>\n\n## Ethical Considerations: <br>\nUsers should evaluate whether this skill is appropriate for their environment, review any generated or modified files before relying on them, and apply their organization's safety, security, and compliance requirements before deployment. <br>\n\nArchive v0.1.1: 3 files, 4984 bytes\n\nFiles: skill-card.md (2459b), SKILL.md (8039b), _meta.json (144b)\n\nFile v0.1.1:SKILL.md\n\n---\nname: image-knowledge-converter\ndescription: \"图片截图转知识库工具（OCR + AI）。触发词：第一次使用、配置图片工具、处理新图片\"\nversion: 1.2.7\ntags: [image-processing, ocr, knowledge-management]\n---\n\n# 🔧 执行指令\n\n**配置向导触发词：**\n当用户说 `第一次使用` / `第一次使用图片处理工具` / `配置图片工具` 时，**AI 启动对话式配置向导**。\n\n**处理图片触发词：**\n当用户说 `处理新图片` / `截图转文档` / `整理截图` 时（这三个触发词等价，均执行相同的处理流程），执行：\n\n**自动检测工作目录**（优先从以下路径检测）：\n1. 命令行参数 `--work-dir <路径>`\n2. 环境变量 `WORK_DIR`\n3. 脚本所在目录（兜底）\n\n```\n# 方式1：显式指定工作目录（推荐）\npython auto_process_all_v9_4.py --work-dir \"D:\\WorkBuddy-Projects\\图片知识库\"\n\n# 方式2：在工作目录中直接运行\ncd \"D:\\WorkBuddy-Projects\\图片知识库\"\npython auto_process_all_v9_4.py\n\n# 方式3：使用环境变量\nset WORK_DIR=D:\\WorkBuddy-Projects\\图片知识库\npython auto_process_all_v9_4.py\n```\n\n---\n\n## 📋 对话式配置向导（5步）\n\n**安全原则：API 密钥不通过对话传递，用户直接在本地模板文件中填写。**\n\n### 第1步：AI 询问工作文件夹位置\n\n当用户说\"第一次使用\"时，AI 先询问用户想把工具安装到哪个文件夹：\n\n```\n🤖 我来帮你完成配置！首先需要确定工作文件夹位置。\n\n这个文件夹将用来存放：\n• 你的待处理图片\n• 生成的文档\n• 配置文件\n\n请告诉我你想使用的文件夹路径，例如：\n  D:\\图片知识库\n  或桌面上的任意位置\n\n（直接回车将使用默认位置\n\nArchive v0.1.0: 3 files, 4837 bytes\n\nFiles: skill-card.md (2026b), SKILL.md (8039b), _meta.json (144b)","readmeExcerpt":"Skill: Image Knowledge Converter Owner: haoyiyong985 Summary: 图片截图转知识库工具（OCR + AI）。触发词：第一次使用、配置图片工具、处理新图片 Tags: latest:1.2.8, stable:1.2.7 Version history: v1.0.0 | 2026-07-12T09:03:28.775Z | auto - Removed the file skill-card.md. - No other user-facing changes. v1.2.8 | 2026-07-11T05:48:32.395Z | user image-knowledge-converter v1.2.8 - Added English documentation: README_EN.md - Added demo animation: assets/demo.gif","codeSnippets":[],"executableExamples":[{"language":"bash","snippet":"pip install -r requirements.txt"},{"language":"text","snippet":"待处理图片/中医养生/截图1.png\n待处理图片/健康饮食/截图2.png"},{"language":"bash","snippet":"python auto_process_all_v9_4.py"},{"language":"text","snippet":"assets/\n└── screenshots/\n    ├── 产品界面/\n    │   ├── workbuddy_main.png\n    │   ├── skill_list.png\n    │   └── import_skill.png\n    ├── 操作步骤/\n    │   ├── init.png\n    │   ├── folder_empty.png\n    │   ├── folder_with_images.png\n    │   ├── processing.png\n    │   └── complete.png\n    ├── 文档效果/\n    │   ├── word_doc.png\n    │   ├── md_doc.png\n    │   └── folder_structure.png\n    └── 对比效果/\n        ├── before.png\n        └── after.png"},{"language":"markdown","snippet":"## 📸 效果展示\n\n### 处理前（原始截图）\n![处理前](assets/screenshots/对比效果/before.png)\n\n### 处理完（生成的文档）\n![处理完](assets/screenshots/对比效果/after.png)\n\n### Word 文档效果\n![Word 文档](assets/screenshots/文档效果/word_doc.png)\n\n### Markdown 文档效果\n![Markdown 文档](assets/screenshots/文档效果/md_doc.png)"},{"language":"bash","snippet":"git add assets/screenshots/\n   git commit -m \"docs: add project screenshots\"\n   git push origin master"}],"parameters":null,"dependencies":[],"permissions":[],"extractedFiles":[{"path":"SKILL.md","content":"---\r\nname: image-knowledge-converter\r\ndescription: \"图片截图转知识库工具（OCR + AI）。触发词：第一次使用、配置图片工具、处理新图片\"\r\nversion: 1.2.8\r\ntags: [image-processing, ocr, knowledge-management]\r\n---\r\n\r\n# 🔧 执行指令\r\n\r\n**配置向导触发词：**\r\n当用户说 `第一次使用` / `第一次使用图片处理工具` / `配置图片工具` 时，**AI 启动对话式配置向导**。\r\n\r\n**处理图片触发词：**\r\n当用户说 `处理新图片` / `截图转文档` / `整理截图` 时（这三个触发词等价，均执行相同的处理流程），执行：\r\n\r\n**自动检测工作目录**（优先从以下路径检测）：\r\n1. 命令行参数 `--work-dir <路径>`\r\n2. 环境变量 `WORK_DIR`\r\n3. 脚本所在目录（兜底）\r\n\r\n```\r\n# 方式1：显式指定工作目录（推荐）\r\npython auto_process_all_v9_4.py --work-dir \"D:\\WorkBuddy-Projects\\图片知识库\"\r\n\r\n# 方式2：在工作目录中直接运行\r\ncd \"D:\\WorkBuddy-Projects\\图片知识库\"\r\npython auto_process_all_v9_4.py\r\n\r\n# 方式3：使用环境变量\r\nset WORK_DIR=D:\\WorkBuddy-Projects\\图片知识库\r\npython auto_process_all_v9_4.py\r\n```\r\n\r\n---\r\n\r\n## 📋 对话式配置向导（5步）\r\n\r\n**安全原则：API 密钥不通过对话传递，用户直接在本地模板文件中填写。**\r\n\r\n### 第1步：AI 询问工作文件夹位置\r\n\r\n当用户说\"第一次使用\"时，AI 先询问用户想把工具安装到哪个文件夹：\r\n\r\n```\r\n🤖 我来帮你完成配置！首先需要确定工作文件夹位置。\r\n\r\n这个文件夹将用来存放：\r\n• 你的待处理图片\r\n• 生成的文档\r\n• 配置文件\r\n\r\n请告诉我你想使用的文件夹路径，例如：\r\n  D:\\图片知识库\r\n  或桌面上的任意位置\r\n\r\n（直接回车将使用默认位置）\r\n```\r\n\r\n> **关键**：工作文件夹由用户指定，不是写死的路径。\r\n\r\n### 第2步：AI 创建配置模板\r\n\r\nAI 在用户指定的工作文件夹下创建配置模板：\r\n```\r\n{工作文件夹}\\config\\api_keys_template.txt\r\n```\r\n\r\n### 第3步：AI 引导用户填写\r\n\r\nAI 告诉用户：\r\n```\r\n✅ 配置模板已创建！\r\n\r\n📝 请打开文件并填写配置：\r\n   {工作文件夹}\\config\\api_keys_template.txt\r\n\r\n【填写说明】\r\n\r\n1️⃣  OCR 模式（必选一项，删除前面的 # 启用）：\r\n    # OCR_MODE: cloud    ← 云端方案（腾讯+百度）\r\n    # OCR_MODE: local     ← 本地方案（Tesseract）\r\n    # OCR_MODE: hybrid    ← 兜底方案（云端+本地）\r\n\r\n2️⃣  填写 API 密钥（根据上一步选择填写）：\r\n    - 腾讯云 SecretId/SecretKey\r\n    - 百度云 API Key/Secret Key\r\n    - 或启用 use_tesseract: true\r\n\r\n3️⃣  LLM 配置（如需 AI 智能分析）：\r\n    # 注意：混元(Hunyuan)使用与腾讯云OCR相同的密钥，无需单独配置\r\n    # 如需使用其他LLM，请参考代码中的配置项\r\n    llm_enabled: true\r\n    llm_provider: hunyuan\r\n\r\n4️⃣  IMA 同步（如需自动同步到 IMA，必须改为 true）：\r\n    # 启用：将下方 false 改为 true，并填写 client_id 和 api_key\r\n    # 获取方法：IMA 设置 → API → 创建新的 API Key\r\n    ima_enabled: true          ← 必须改为 true 才能启用\r\n    ima_api_key: 你的API密钥\r\n    ima_client_id: 你的ClientID\r\n\r\n5️⃣  填写完成后保存文件，然后对我说「配置已填写完毕」\r\n```\r\n\r\n### 第4步：AI 处理配置\r\n\r\n用户说「配置已填写完毕后」，AI 自动：\r\n```\r\n# 运行配置处理器（自动检测工作目录）\r\npython wizard_processor.py\r\n\r\n# 或显式指定工作目录\r\npython wizard_processor.py --work-dir \"D:\\WorkBuddy-Projects\\图片知识库\"\r\n```\r\n1. wizard_processor.py 读取模板\r\n2. 生成 `config/api_keys.yaml`\r\n3. 验证配置并显示摘要\r\n\r\n### 第5步：放入图片并处理\r\n\r\n```\r\n✅ 配置完成！\r\n\r\n📁 请把图片放入：\r\n   {工作文件夹}\\待处理图片\r\n\r\n然后对我说「处理新图片」\r\n```\r\n\r\n---\r\n\r\n## 🚀 快速上手\r\n\r\n### 首次使用\r\n1. 说 `第一次使用图片处理工具`\r\n2. AI 创建配置模板\r\n3. 用户直接编辑模板文件（密钥不在对话框中）\r\n4. 用户说「配置已填写完毕」\r\n5. AI 处理配置并验证\r\n6. 放入图片，说「处理新图片」\r\n\r\n### 日常使用\r\n1. 把图片放入 `待处理图片\\`\r\n2. 说「处理新图片」\r\n\r\n---\r\n\r\n## 触发词\r\n\r\n**首次配置（启动向导）：**\r\n- `第一次使用`\r\n- `第一次使用图片处理工具`\r\n- `配置图片工具`\r\n- `首次配置`\r\n\r\n**开始处理（运行脚本）：**\r\n- `处理新图片`\r\n- `截图转文档`\r\n- `整理截图`\r\n\r\n---\r\n\r\n## 目录结构\r\n\r\n```\r\n{工作文件夹}\\           ← 所有文件都在用户指定的工作目录下\r\n├── auto_process_all_v9_4.py ← 主处理脚本（V9.5 支持 --work-dir）\r\n├── wizard_processor.py     ← 配置处理器\r\n├── setup_wizard.py          ← 交互式配置向导（可选）\r\n├── config\\\r\n│   ├── api_keys_template.txt  ← 用户在此填写（本地）\r\n│   └── api_keys.yaml          ← 自动生成\r\n├── 待处理图片\\\r\n├── 已处理图片\\\r\n├── 处理结果\\\r\n│   ├── *.md                  ← 生成的 Markdown 文档\r\n│   "},{"path":"README.md","content":"# 📚 图片知识库整理工具 (Image Knowledge Converter)\r\n\r\n> 自动将手机截图转换为结构化 Word + Markdown 知识文档，并同步到 IMA 个人笔记  \r\n> **新用户第一次使用会自动启动向导，无需任何技术背景！**\r\n\r\n[![GitHub license](https://img.shields.io/badge/license-MIT-blue.svg)](LICENSE)\r\n[![GitHub stars](https://img.shields.io/github/stars/haoyiyong985/image-knowledge-converter?style=social)](https://github.com/haoyiyong985/image-knowledge-converter)\r\n[![WorkBuddy](https://img.shields.io/badge/WorkBuddy-Skill-green)](https://workbuddy.ai)\r\n\r\n🌐 [中文](README.md) | [English](README_EN.md)\r\n\r\n---\r\n\r\n## 🌟 项目简介\r\n\r\n**图片知识库整理工具** 是一个智能知识管理助手，能够：\r\n\r\n- 📷 **自动识别**：从手机截图（小红书、微信读书、微信等）中提取文字\r\n- 🏷️ **智能分类**：AI 理解内容并自动分类到对应知识主题\r\n- 📝 **生成文档**：输出结构化 Word + Markdown 双格式文档\r\n- 🔗 **自动归档**：按分类整理图片和文档\r\n- 🔄 **内容合并**：相似主题自动合并，避免重复\r\n- ☁️ **云端同步**：一键同步到 IMA 个人笔记\r\n\r\n---\r\n\r\n## ✨ 功能特点\r\n\r\n### 核心功能\r\n\r\n| 功能 | 说明 |\r\n|------|------|\r\n| **OCR 多引擎** | 腾讯云 → 百度云 → 本地 Tesseract（自动降级） |\r\n| **AI 智能分类** | 动态分类体系，支持自由命名和自动新建分类 |\r\n| **文档合并** | 同主题内容自动合并到同一文档 |\r\n| **双格式输出** | 同时生成 `.docx` 和 `.md` 文件 |\r\n| **IMA 同步** | 自动同步到 IMA 笔记（支持增量更新）|\r\n| **分批处理** | 大批量图片智能分批，支持断点续传 |\r\n| **重复检测** | Hash + 主题词相似度双重检测 |\r\n| **新手向导** | 🆕 首次使用自动引导配置，无需技术背景 |\r\n\r\n### 技术亮点\r\n\r\n- ✅ **LLM 全覆盖**：混元 Lite / Kimi / Doubao 多模型兜底\r\n- ✅ **智能命名**：`{分类}-{主题}`，如 `历史文化-钱谦益传`\r\n- ✅ **内容整理**：自动修复 OCR 错误、结构化排版\r\n- ✅ **来源提取**：自动识别小红书、微信等平台来源\r\n- ✅ **新手向导**：第一次使用自动启动交互式配置向导\r\n\r\n---\r\n\r\n## 🚀 快速开始（三步走）\r\n\r\n> **无需选择安装方式！** 无论你用哪种方式安装，第一次运行时都会自动启动**新手向导**，一步步引导你完成配置。\r\n\r\n### 第一步：选择安装方式（任选一种）\r\n\r\n#### 方式 A：WorkBuddy Skill（最简单 ⭐）\r\n\r\n**适合人群**：有 WorkBuddy 账号，想一键使用\r\n\r\n1. 下载 Release 中的 `image-knowledge-converter_v1.1.0_skill.zip`\r\n2. 打开 WorkBuddy → 右上角头像 → **Skills 管理**\r\n3. 点击「导入 Skills」→ 选择下载的 zip → 「立即导入」\r\n4. **对 WorkBuddy 说**：`第一次使用` 或 `初始化`\r\n5. ✅ 向导自动启动，引导你完成配置（约 2 分钟）\r\n\r\n#### 方式 B：完整包（适合自定义 ⭐）\r\n\r\n**适合人群**：想完全控制，或没有 WorkBuddy\r\n\r\n1. 下载 Release 中的 `tupianzhengligongju_wanzheng_v1.1.0.zip`\r\n2. 解压到你想放的位置（如 `D:\\我的图片知识库`）\r\n3. 打开终端，进入解压目录\r\n4. 运行：`python setup_wizard.py`\r\n5. ✅ 向导自动启动，引导你完成配置（约 2 分钟）\r\n\r\n#### 方式 C：Git 克隆（适合开发者）\r\n\r\n**适合人群**：熟悉 Git 和命令行\r\n\r\n```bash\r\ngit clone https://github.com/haoyiyong985/image-knowledge-converter.git\r\ncd image-knowledge-converter\r\npip install -r requirements.txt\r\npython setup_wizard.py   # ← 启动向导\r\n```\r\n\r\n---\r\n\r\n### 第二步：新手向导（自动启动）\r\n\r\n无论你用哪种方式安装，**第一次运行都会看到这个向导**（不会跳过）：\r\n\r\n```\r\n==================================================\r\n  欢迎使用 图片知识库整理工具！\r\n  我是你的智能助手，第一次使用我来帮你完成配置\r\n  只需 3 步，大概 2 分钟\r\n\r\n  如果你有任何问题，随时问我！\r\n==================================================\r\n```\r\n\r\n#### 向导流程（3 步，约 2 分钟）\r\n\r\n**第 1 步：选择工作文件夹**\r\n```\r\n  步骤 1：选择工作文件夹\r\n  ℹ️ 这是存放图片和生成文档的地方。\r\n  \r\n  建议使用：D:\\Users\\你的用户名\\图片知识库\r\n  \r\n  是否使用默认位置？(y/n，直接回车=使用默认):\r\n```\r\n\r\n- 选 `y` → 自动创建默认文件夹\r\n- 选 `n` → 输入自定义路径（如 `D:\\我的图片库`）\r\n\r\n**第 2 步：配置 OCR 服务（选一个就行）**\r\n```\r\n  步骤 2：配置 OCR 识别服务\r\n  ℹ️ 你需要至少一个 OCR 服务来识别图片中的文字。\r\n  \r\n  请选择 OCR 服务（选一个就行）：\r\n    1. 腾讯云 OCR（推荐，每月免费 1000 次）\r\n      识别率高，免费额度充足\r\n    2. 百度云 OCR（免费，需实名）\r\n      免费额度大，适合大量使用\r\n    3. 本地 Tesseract（完全免费）\r\n      无需联网，但识别率较低\r\n      \r\n  请输入选项编号 (1-3):\r\n```\r\n\r\n- **选 1（腾讯云）** → 向导显示图文教程 → 你填"},{"path":"_meta.json","content":"{\n  \"ownerId\": \"kn7fh9qe66jy2s283bfvw6b61d89w2cv\",\n  \"slug\": \"image-knowledge-converter\",\n  \"version\": \"1.0.0\",\n  \"publishedAt\": 1783847008775\n}"},{"path":"references/usage-guide.md","content":"# 图片知识库整理工具 - 使用指南\n\n## 快速开始\n\n### 1. 安装依赖\n```bash\npip install -r requirements.txt\n```\n\n### 2. 初始化\n运行脚本后选择「初始化知识库」，会自动创建：\n- `待处理图片/` - 放入待处理截图\n- `已处理图片/` - 自动归档\n- `处理结果/` - 生成的 Word/MD 文档\n\n### 3. 放入图片\n将截图放入 `待处理图片/<主题>/`，例如：\n```\n待处理图片/中医养生/截图1.png\n待处理图片/健康饮食/截图2.png\n```\n\n### 4. 开始处理\n```bash\npython auto_process_all_v9_4.py\n```\n\n---\n\n## 常用命令\n\n| 命令 | 说明 |\n|------|------|\n| `python auto_process_all_v9_4.py` | 处理所有待处理图片 |\n| 查看 `处理结果/` 目录 | 查看已生成的文档 |\n\n---\n\n## OCR 配置\n\n支持三种 OCR 引擎（自动降级）：\n1. 腾讯云 OCR（优先）\n2. 百度云 OCR（备用）\n3. 本地 Tesseract（兜底）\n\n配置方法见 `docs/multi-engine-ocr.md`\n\n---\n\n## IMA 同步（可选）\n\n1. 获取 IMA OpenAPI 凭证\n2. 编辑 `ima_config.txt` 填入凭证\n3. 运行脚本时会自动同步\n\n---\n\n## 常见问题\n\n**Q: 处理失败？**  \nA: 检查 `logs/` 目录中的日志文件。\n\n**Q: 如何切换 AI 模型？**  \nA: 参见 `docs/switch-model-guide.md`。\n\n**Q: 图片识别不准确？**  \nA: 确保图片清晰，或配置更强大的 OCR 引擎。"},{"path":"assets/SCREENSHOTS_GUIDE.md","content":"# 项目截图使用指南\n\n本目录用于存放项目截图和示例图片。\n\n## 📷 推荐的截图类型\n\n### 1. 产品界面截图\n| 截图名称 | 内容 | 用途 |\n|---------|------|------|\n| `screenshot_workbuddy_main.png` | WorkBuddy 主界面 | README 展示 |\n| `screenshot_skill_list.png` | Skills 列表（显示本技能） | 使用指南 |\n| `screenshot_import_skill.png` | 导入 Skill 界面 | 安装教程 |\n\n### 2. 操作步骤截图\n| 截图名称 | 内容 | 用途 |\n|---------|------|------|\n| `screenshot_init.png` | 初始化知识库 | 使用指南 |\n| `screenshot_folder_empty.png` | 空文件夹（待处理图片） | 使用指南 |\n| `screenshot_folder_with_images.png` | 放入图片后的文件夹 | 使用指南 |\n| `screenshot_processing.png` | AI 正在处理 | 使用指南 |\n| `screenshot_complete.png` | 处理完成提示 | 使用指南 |\n\n### 3. 文档效果截图\n| 截图名称 | 内容 | 用途 |\n|---------|------|------|\n| `screenshot_word_doc.png` | Word 文档效果 | README 展示 |\n| `screenshot_md_doc.png` | Markdown 文档效果 | README 展示 |\n| `screenshot_folder_structure.png` | 目录结构 | 使用指南 |\n\n### 4. 对比效果截图（用于推广）\n| 截图名称 | 内容 | 用途 |\n|---------|------|------|\n| `screenshot_before.png` | 原始截图（处理前） | 推广素材 |\n| `screenshot_after.png` | 整理后的文档（处理完） | 推广素材 |\n\n---\n\n## 📸 如何准备截图\n\n### Windows 截图方法\n\n#### 方法一：PrintScreen 键\n1. 按 `PrtSc` 键（全屏截图）\n2. 打开画图工具（Win + R → 输入 `mspaint`）\n3. 粘贴（Ctrl + V）\n4. 保存为 PNG 格式\n\n#### 方法二：Win + Shift + S（推荐）\n1. 按 `Win + Shift + S`\n2. 选择截图区域\n3. 截图自动复制到剪贴板\n4. 粘贴到文件并保存\n\n#### 方法三：使用 Snipaste（第三方工具）\n- 下载：https://www.snipaste.com/\n- 按 F1 截图，F3 贴图\n\n---\n\n## 📂 目录结构示例\n\n```\nassets/\n└── screenshots/\n    ├── 产品界面/\n    │   ├── workbuddy_main.png\n    │   ├── skill_list.png\n    │   └── import_skill.png\n    ├── 操作步骤/\n    │   ├── init.png\n    │   ├── folder_empty.png\n    │   ├── folder_with_images.png\n    │   ├── processing.png\n    │   └── complete.png\n    ├── 文档效果/\n    │   ├── word_doc.png\n    │   ├── md_doc.png\n    │   └── folder_structure.png\n    └── 对比效果/\n        ├── before.png\n        └── after.png\n```\n\n---\n\n## 📝 在 README.md 中添加截图\n\n准备好截图后，可以在 README.md 中添加以下部分：\n\n```markdown\n## 📸 效果展示\n\n### 处理前（原始截图）\n![处理前](assets/screenshots/对比效果/before.png)\n\n### 处理完（生成的文档）\n![处理完](assets/screenshots/对比效果/after.png)\n\n### Word 文档效果\n![Word 文档](assets/screenshots/文档效果/word_doc.png)\n\n### Markdown 文档效果\n![Markdown 文档](assets/screenshots/文档效果/md_doc.png)\n```\n\n---\n\n## 🚀 快速开始\n\n1. **准备截图**：按照上面的推荐清单拍摄\n2. **放入目录**：将截图文件放入 `assets/screenshots/` 对应子目录\n3. **提交到 Git**：\n   ```bash\n   git add assets/screenshots/\n   git commit -m \"docs: add project screenshots\"\n   git push origin master\n   ```\n4. **更新 README**：在 README.md 中添加截图展示部分\n\n---\n\n## 💡 提示\n\n- ✅ 使用 PNG 格式（清晰度更高）\n- ✅ 截图分辨率建议 1920x1080 或 1280x720\n- ✅ 确保截图中的文字清晰可读\n- ✅ 可以稍后补充，不影响项目正常使用\n\n---\n\n**祝你使用愉快！** 🎉"}],"languages":[],"docsSourceLabel":"CLAWHUB","editorialOverview":"图片截图转知识库工具（OCR + AI）。触发词：第一次使用、配置图片工具、处理新图片 Skill: Image Knowledge Converter Owner: haoyiyong985 Summary: 图片截图转知识库工具（OCR + AI）。触发词：第一次使用、配置图片工具、处理新图片 Tags: latest:1.2.8, stable:1.2.7 Version history: v1.0.0 | 2026-07-12T09:03:28.775Z | auto - Removed the file skill-card.md. - No other user-facing changes. v1.2.8 | 2026-07-11T05:48:32.395Z | user image-knowledge-converter v1.2.8 - Added English documentation: README_EN.md - Added demo animation: assets/demo.gif","editorialQuality":{"score":100,"threshold":65,"status":"ready","wordCount":661,"uniquenessScore":57,"reasons":[]}},"media":{"evidence":{"source":"no-media","verified":false,"confidence":"low","updatedAt":"2026-10-11T11:20:21.886Z","emptyReason":"No screenshots, media assets, or demo links are available."},"primaryImageUrl":null,"mediaAssetCount":0,"assets":[],"demoUrl":null},"ownerResources":{"evidence":{"source":"unclaimed","verified":false,"confidence":"low","updatedAt":"2026-10-11T11:20:21.886Z","emptyReason":"This page has not been claimed by the agent owner."},"hasCustomPage":false,"customPageUpdatedAt":null,"customLinks":[],"structuredLinks":{"docsUrl":null,"demoUrl":null,"supportUrl":null,"pricingUrl":null,"statusUrl":null},"customPage":null},"relatedAgents":{"evidence":{"source":"protocol-neighbors","verified":false,"confidence":"medium","updatedAt":"2026-10-11T14:15:09.171Z","emptyReason":null},"items":[{"id":"8ebccd8e-3863-4187-8355-c3f14e1f9edf","entityType":"agent","canonicalPath":"/agent/iofficeai-aionui","slug":"iofficeai-aionui","name":"AionUi","description":"Free, local, open-source 24/7 Cowork app and OpenClaw for Gemini CLI, Claude Code, Codex, OpenCode, Qwen Code, Goose CLI, Auggie, and more | 🌟 Star if you like it!","url":"https://github.com/iOfficeAI/AionUi","homepage":"https://www.aionui.com","source":"GITHUB_REPOS","protocols":["MCP","OPENCLAW"],"capabilities":[],"safetyScore":100,"overallRank":70,"updatedAt":"2026-10-09T19:11:12.944Z","createdAt":"2026-02-25T03:38:16.584Z","downloads":null},{"id":"b917f68a-ebff-438e-84f8-3f4b2494c0bc","entityType":"agent","canonicalPath":"/agent/activepieces-activepieces","slug":"activepieces-activepieces","name":"activepieces","description":"AI Agents & MCPs & AI Workflow Automation • (~400 MCP servers for AI agents) • AI Automation / AI Agent with MCPs • AI Workflows & AI Agents • MCPs for AI Agents","url":"https://github.com/activepieces/activepieces","homepage":"https://www.activepieces.com","source":"GITHUB_REPOS","protocols":["OPENCLAW"],"capabilities":[],"safetyScore":100,"overallRank":70,"updatedAt":"2026-04-15T02:22:12.426Z","createdAt":"2026-02-25T03:38:12.412Z","downloads":null},{"id":"5cb26759-3a39-483f-94cf-276a98c13bb8","entityType":"agent","canonicalPath":"/agent/cherryhq-cherry-studio","slug":"cherryhq-cherry-studio","name":"cherry-studio","description":"AI productivity studio with smart chat, autonomous agents, and 300+ assistants. Unified access to frontier LLMs","url":"https://github.com/CherryHQ/cherry-studio","homepage":"https://cherry-ai.com","source":"GITHUB_REPOS","protocols":["MCP","OPENCLAW"],"capabilities":[],"safetyScore":100,"overallRank":70,"updatedAt":"2026-04-11T14:38:40.986Z","createdAt":"2026-02-25T03:38:19.379Z","downloads":null},{"id":"6f6582d0-5d76-4f0f-b81d-86520247950b","entityType":"agent","canonicalPath":"/agent/copilotkit-copilotkit","slug":"copilotkit-copilotkit","name":"CopilotKit","description":"The Frontend for Agents & Generative UI. React + Angular","url":"https://github.com/CopilotKit/CopilotKit","homepage":"https://docs.copilotkit.ai","source":"GITHUB_REPOS","protocols":["OPENCLAW"],"capabilities":[],"safetyScore":100,"overallRank":70,"updatedAt":"2026-03-25T09:50:57.846Z","createdAt":"2026-02-25T03:39:14.617Z","downloads":null}],"links":{"hub":"/agent","source":"/agent/source/clawhub","protocols":[{"label":"OpenClaw","href":"/agent/protocol/openclew"}]}}}