Image Knowledge Converter
图片截图转知识库工具(OCR + AI)。触发词:第一次使用、配置图片工具、处理新图片 Skill: Image Knowledge Converter Owner: haoyiyong985 Summary: 图片截图转知识库工具(OCR + AI)。触发词:第一次使用、配置图片工具、处理新图片 Tags: latest:1.2.8, stable:1.2.7 Version history: v1.0.0 | 2026-07-12T09:03:28.775Z | auto - Removed the file skill-card.md. - No other user-facing changes. v1.2.8 | 2026-07-11T05:48:32.395Z | user image-knowledge-converter v1.2.8 - Added English documentation: README_EN.md - Added demo animation: assets/demo.gif
Rank
62
Safety
84
Downloads
1.1k
Updated
Oct 11, 2026
Version
1.0.0
Source
CLAWHUB
About
What it does, and when to use it.
Capability contract not published. No trust telemetry is available yet. 1.1K downloads reported by the source. Last updated 10/11/2026.
Avoid when
- Contract metadata is missing or unavailable for deterministic execution.
Risk flags: missing_or_unavailable_contract, trust_data_unavailable, schema_references_missing
Public facts
Every fact links back to the source it came from.
- Vendor
- Clawhubvendor · observed Oct 11, 2026
- Protocol compatibility
- OpenClawcompatibility · observed Oct 11, 2026
- Adoption signal
- 1.1K downloadsadoption · observed Oct 11, 2026
- Latest release
- 1.0.0release · observed Jul 12, 2026
- Handshake status
- UNKNOWNsecurity
Install and run
Setup complexity: low.
clawhub skill install s177ypfpgdqaxv59njm2a6m56989wm4b:image-knowledge-converter- Setup complexity is LOW. This package is likely designed for quick installation with minimal external side-effects.
- Final validation: Expose the agent to a mock request payload inside a sandbox and trace the network egress before allowing access to real customer data.
Contract: missing
curl -s "https://www.xpersona.co/api/v1/agents/clawhub-haoyiyong985-image-knowledge-converter/snapshot"
Documentation
CLAWHUB
145,620 characters of source documentation, loaded on request.
Extracted files
5 files captured from the source.
SKILL.md
---
name: image-knowledge-converter
description: "图片截图转知识库工具(OCR + AI)。触发词:第一次使用、配置图片工具、处理新图片"
version: 1.2.8
tags: [image-processing, ocr, knowledge-management]
---
# 🔧 执行指令
**配置向导触发词:**
当用户说 `第一次使用` / `第一次使用图片处理工具` / `配置图片工具` 时,**AI 启动对话式配置向导**。
**处理图片触发词:**
当用户说 `处理新图片` / `截图转文档` / `整理截图` 时(这三个触发词等价,均执行相同的处理流程),执行:
**自动检测工作目录**(优先从以下路径检测):
1. 命令行参数 `--work-dir <路径>`
2. 环境变量 `WORK_DIR`
3. 脚本所在目录(兜底)
```
# 方式1:显式指定工作目录(推荐)
python auto_process_all_v9_4.py --work-dir "D:\WorkBuddy-Projects\图片知识库"
# 方式2:在工作目录中直接运行
cd "D:\WorkBuddy-Projects\图片知识库"
python auto_process_all_v9_4.py
# 方式3:使用环境变量
set WORK_DIR=D:\WorkBuddy-Projects\图片知识库
python auto_process_all_v9_4.py
```
---
## 📋 对话式配置向导(5步)
**安全原则:API 密钥不通过对话传递,用户直接在本地模板文件中填写。**
### 第1步:AI 询问工作文件夹位置
当用户说"第一次使用"时,AI 先询问用户想把工具安装到哪个文件夹:
```
🤖 我来帮你完成配置!首先需要确定工作文件夹位置。
这个文件夹将用来存放:
• 你的待处理图片
• 生成的文档
• 配置文件
请告诉我你想使用的文件夹路径,例如:
D:\图片知识库
或桌面上的任意位置
(直接回车将使用默认位置)
```
> **关键**:工作文件夹由用户指定,不是写死的路径。
### 第2步:AI 创建配置模板
AI 在用户指定的工作文件夹下创建配置模板:
```
{工作文件夹}\config\api_keys_template.txt
```
### 第3步:AI 引导用户填写
AI 告诉用户:
```
✅ 配置模板已创建!
📝 请打开文件并填写配置:
{工作文件夹}\config\api_keys_template.txt
【填写说明】
1️⃣ OCR 模式(必选一项,删除前面的 # 启用):
# OCR_MODE: cloud ← 云端方案(腾讯+百度)
# OCR_MODE: local ← 本地方案(Tesseract)
# OCR_MODE: hybrid ← 兜底方案(云端+本地)
2️⃣ 填写 API 密钥(根据上一步选择填写):
- 腾讯云 SecretId/SecretKey
- 百度云 API Key/Secret Key
- 或启用 use_tesseract: true
3️⃣ LLM 配置(如需 AI 智能分析):
# 注意:混元(Hunyuan)使用与腾讯云OCR相同的密钥,无需单独配置
# 如需使用其他LLM,请参考代码中的配置项
llm_enabled: true
llm_provider: hunyuan
4️⃣ IMA 同步(如需自动同步到 IMA,必须改为 true):
# 启用:将下方 false 改为 true,并填写 client_id 和 api_key
# 获取方法:IMA 设置 → API → 创建新的 API Key
ima_enabled: true ← 必须改为 true 才能启用
ima_api_key: 你的API密钥
ima_client_id: 你的ClientID
5️⃣ 填写完成后保存文件,然后对我说「配置已填写完毕」
```
### 第4步:AI 处理配置
用户说「配置已填写完毕后」,AI 自动:
```
# 运行配置处理器(自动检测工作目录)
python wizard_processor.py
# 或显式指定工作目录
python wizard_processor.py --work-dir "D:\WorkBuddy-Projects\图片知识库"
```
1. wizard_processor.py 读取模板
2. 生成 `config/api_keys.yaml`
3. 验证配置并显示摘要
### 第5步:放入图片并处理
```
✅ 配置完成!
📁 请把图片放入:
{工作文件夹}\待处理图片
然后对我说「处理新图片」
```
---
## 🚀 快速上手
### 首次使用
1. 说 `第一次使用图片处理工具`
2. AI 创建配置模板
3. 用户直接编辑模板文件(密钥不在对话框中)
4. 用户说「配置已填写完毕」
5. AI 处理配置并验证
6. 放入图片,说「处理新图片」
### 日常使用
1. 把图片放入 `待处理图片\`
2. 说「处理新图片」
---
## 触发词
**首次配置(启动向导):**
- `第一次使用`
- `第一次使用图片处理工具`
- `配置图片工具`
- `首次配置`
**开始处理(运行脚本):**
- `处理新图片`
- `截图转文档`
- `整理截图`
---
## 目录结构
```
{工作文件夹}\ ← 所有文件都在用户指定的工作目录下
├── auto_process_all_v9_4.py ← 主处理脚本(V9.5 支持 --work-dir)
├── wizard_processor.py ← 配置处理器
├── setup_wizard.py ← 交互式配置向导(可选)
├── config\
│ ├── api_keys_template.txt ← 用户在此填写(本地)
│ └── api_keys.yaml ← 自动生成
├── 待处理图片\
├── 已处理图片\
├── 处理结果\
│ ├── *.md ← 生成的 Markdown 文档
│ README.md
# 📚 图片知识库整理工具 (Image Knowledge Converter)
> 自动将手机截图转换为结构化 Word + Markdown 知识文档,并同步到 IMA 个人笔记
> **新用户第一次使用会自动启动向导,无需任何技术背景!**
[](LICENSE)
[](https://github.com/haoyiyong985/image-knowledge-converter)
[](https://workbuddy.ai)
🌐 [中文](README.md) | [English](README_EN.md)
---
## 🌟 项目简介
**图片知识库整理工具** 是一个智能知识管理助手,能够:
- 📷 **自动识别**:从手机截图(小红书、微信读书、微信等)中提取文字
- 🏷️ **智能分类**:AI 理解内容并自动分类到对应知识主题
- 📝 **生成文档**:输出结构化 Word + Markdown 双格式文档
- 🔗 **自动归档**:按分类整理图片和文档
- 🔄 **内容合并**:相似主题自动合并,避免重复
- ☁️ **云端同步**:一键同步到 IMA 个人笔记
---
## ✨ 功能特点
### 核心功能
| 功能 | 说明 |
|------|------|
| **OCR 多引擎** | 腾讯云 → 百度云 → 本地 Tesseract(自动降级) |
| **AI 智能分类** | 动态分类体系,支持自由命名和自动新建分类 |
| **文档合并** | 同主题内容自动合并到同一文档 |
| **双格式输出** | 同时生成 `.docx` 和 `.md` 文件 |
| **IMA 同步** | 自动同步到 IMA 笔记(支持增量更新)|
| **分批处理** | 大批量图片智能分批,支持断点续传 |
| **重复检测** | Hash + 主题词相似度双重检测 |
| **新手向导** | 🆕 首次使用自动引导配置,无需技术背景 |
### 技术亮点
- ✅ **LLM 全覆盖**:混元 Lite / Kimi / Doubao 多模型兜底
- ✅ **智能命名**:`{分类}-{主题}`,如 `历史文化-钱谦益传`
- ✅ **内容整理**:自动修复 OCR 错误、结构化排版
- ✅ **来源提取**:自动识别小红书、微信等平台来源
- ✅ **新手向导**:第一次使用自动启动交互式配置向导
---
## 🚀 快速开始(三步走)
> **无需选择安装方式!** 无论你用哪种方式安装,第一次运行时都会自动启动**新手向导**,一步步引导你完成配置。
### 第一步:选择安装方式(任选一种)
#### 方式 A:WorkBuddy Skill(最简单 ⭐)
**适合人群**:有 WorkBuddy 账号,想一键使用
1. 下载 Release 中的 `image-knowledge-converter_v1.1.0_skill.zip`
2. 打开 WorkBuddy → 右上角头像 → **Skills 管理**
3. 点击「导入 Skills」→ 选择下载的 zip → 「立即导入」
4. **对 WorkBuddy 说**:`第一次使用` 或 `初始化`
5. ✅ 向导自动启动,引导你完成配置(约 2 分钟)
#### 方式 B:完整包(适合自定义 ⭐)
**适合人群**:想完全控制,或没有 WorkBuddy
1. 下载 Release 中的 `tupianzhengligongju_wanzheng_v1.1.0.zip`
2. 解压到你想放的位置(如 `D:\我的图片知识库`)
3. 打开终端,进入解压目录
4. 运行:`python setup_wizard.py`
5. ✅ 向导自动启动,引导你完成配置(约 2 分钟)
#### 方式 C:Git 克隆(适合开发者)
**适合人群**:熟悉 Git 和命令行
```bash
git clone https://github.com/haoyiyong985/image-knowledge-converter.git
cd image-knowledge-converter
pip install -r requirements.txt
python setup_wizard.py # ← 启动向导
```
---
### 第二步:新手向导(自动启动)
无论你用哪种方式安装,**第一次运行都会看到这个向导**(不会跳过):
```
==================================================
欢迎使用 图片知识库整理工具!
我是你的智能助手,第一次使用我来帮你完成配置
只需 3 步,大概 2 分钟
如果你有任何问题,随时问我!
==================================================
```
#### 向导流程(3 步,约 2 分钟)
**第 1 步:选择工作文件夹**
```
步骤 1:选择工作文件夹
ℹ️ 这是存放图片和生成文档的地方。
建议使用:D:\Users\你的用户名\图片知识库
是否使用默认位置?(y/n,直接回车=使用默认):
```
- 选 `y` → 自动创建默认文件夹
- 选 `n` → 输入自定义路径(如 `D:\我的图片库`)
**第 2 步:配置 OCR 服务(选一个就行)**
```
步骤 2:配置 OCR 识别服务
ℹ️ 你需要至少一个 OCR 服务来识别图片中的文字。
请选择 OCR 服务(选一个就行):
1. 腾讯云 OCR(推荐,每月免费 1000 次)
识别率高,免费额度充足
2. 百度云 OCR(免费,需实名)
免费额度大,适合大量使用
3. 本地 Tesseract(完全免费)
无需联网,但识别率较低
请输入选项编号 (1-3):
```
- **选 1(腾讯云)** → 向导显示图文教程 → 你填_meta.json
{
"ownerId": "kn7fh9qe66jy2s283bfvw6b61d89w2cv",
"slug": "image-knowledge-converter",
"version": "1.0.0",
"publishedAt": 1783847008775
}references/usage-guide.md
# 图片知识库整理工具 - 使用指南 ## 快速开始 ### 1. 安装依赖 ```bash pip install -r requirements.txt ``` ### 2. 初始化 运行脚本后选择「初始化知识库」,会自动创建: - `待处理图片/` - 放入待处理截图 - `已处理图片/` - 自动归档 - `处理结果/` - 生成的 Word/MD 文档 ### 3. 放入图片 将截图放入 `待处理图片/<主题>/`,例如: ``` 待处理图片/中医养生/截图1.png 待处理图片/健康饮食/截图2.png ``` ### 4. 开始处理 ```bash python auto_process_all_v9_4.py ``` --- ## 常用命令 | 命令 | 说明 | |------|------| | `python auto_process_all_v9_4.py` | 处理所有待处理图片 | | 查看 `处理结果/` 目录 | 查看已生成的文档 | --- ## OCR 配置 支持三种 OCR 引擎(自动降级): 1. 腾讯云 OCR(优先) 2. 百度云 OCR(备用) 3. 本地 Tesseract(兜底) 配置方法见 `docs/multi-engine-ocr.md` --- ## IMA 同步(可选) 1. 获取 IMA OpenAPI 凭证 2. 编辑 `ima_config.txt` 填入凭证 3. 运行脚本时会自动同步 --- ## 常见问题 **Q: 处理失败?** A: 检查 `logs/` 目录中的日志文件。 **Q: 如何切换 AI 模型?** A: 参见 `docs/switch-model-guide.md`。 **Q: 图片识别不准确?** A: 确保图片清晰,或配置更强大的 OCR 引擎。
assets/SCREENSHOTS_GUIDE.md
# 项目截图使用指南
本目录用于存放项目截图和示例图片。
## 📷 推荐的截图类型
### 1. 产品界面截图
| 截图名称 | 内容 | 用途 |
|---------|------|------|
| `screenshot_workbuddy_main.png` | WorkBuddy 主界面 | README 展示 |
| `screenshot_skill_list.png` | Skills 列表(显示本技能) | 使用指南 |
| `screenshot_import_skill.png` | 导入 Skill 界面 | 安装教程 |
### 2. 操作步骤截图
| 截图名称 | 内容 | 用途 |
|---------|------|------|
| `screenshot_init.png` | 初始化知识库 | 使用指南 |
| `screenshot_folder_empty.png` | 空文件夹(待处理图片) | 使用指南 |
| `screenshot_folder_with_images.png` | 放入图片后的文件夹 | 使用指南 |
| `screenshot_processing.png` | AI 正在处理 | 使用指南 |
| `screenshot_complete.png` | 处理完成提示 | 使用指南 |
### 3. 文档效果截图
| 截图名称 | 内容 | 用途 |
|---------|------|------|
| `screenshot_word_doc.png` | Word 文档效果 | README 展示 |
| `screenshot_md_doc.png` | Markdown 文档效果 | README 展示 |
| `screenshot_folder_structure.png` | 目录结构 | 使用指南 |
### 4. 对比效果截图(用于推广)
| 截图名称 | 内容 | 用途 |
|---------|------|------|
| `screenshot_before.png` | 原始截图(处理前) | 推广素材 |
| `screenshot_after.png` | 整理后的文档(处理完) | 推广素材 |
---
## 📸 如何准备截图
### Windows 截图方法
#### 方法一:PrintScreen 键
1. 按 `PrtSc` 键(全屏截图)
2. 打开画图工具(Win + R → 输入 `mspaint`)
3. 粘贴(Ctrl + V)
4. 保存为 PNG 格式
#### 方法二:Win + Shift + S(推荐)
1. 按 `Win + Shift + S`
2. 选择截图区域
3. 截图自动复制到剪贴板
4. 粘贴到文件并保存
#### 方法三:使用 Snipaste(第三方工具)
- 下载:https://www.snipaste.com/
- 按 F1 截图,F3 贴图
---
## 📂 目录结构示例
```
assets/
└── screenshots/
├── 产品界面/
│ ├── workbuddy_main.png
│ ├── skill_list.png
│ └── import_skill.png
├── 操作步骤/
│ ├── init.png
│ ├── folder_empty.png
│ ├── folder_with_images.png
│ ├── processing.png
│ └── complete.png
├── 文档效果/
│ ├── word_doc.png
│ ├── md_doc.png
│ └── folder_structure.png
└── 对比效果/
├── before.png
└── after.png
```
---
## 📝 在 README.md 中添加截图
准备好截图后,可以在 README.md 中添加以下部分:
```markdown
## 📸 效果展示
### 处理前(原始截图)

### 处理完(生成的文档)

### Word 文档效果

### Markdown 文档效果

```
---
## 🚀 快速开始
1. **准备截图**:按照上面的推荐清单拍摄
2. **放入目录**:将截图文件放入 `assets/screenshots/` 对应子目录
3. **提交到 Git**:
```bash
git add assets/screenshots/
git commit -m "docs: add project screenshots"
git push origin master
```
4. **更新 README**:在 README.md 中添加截图展示部分
---
## 💡 提示
- ✅ 使用 PNG 格式(清晰度更高)
- ✅ 截图分辨率建议 1920x1080 或 1280x720
- ✅ 确保截图中的文字清晰可读
- ✅ 可以稍后补充,不影响项目正常使用
---
**祝你使用愉快!** 🎉AionUi
Free, local, open-source 24/7 Cowork app and OpenClaw for Gemini CLI, Claude Code, Codex, OpenCode, Qwen Code, Goose CLI, Auggie, and more | 🌟 Star if you like it!
activepieces
AI Agents & MCPs & AI Workflow Automation • (~400 MCP servers for AI agents) • AI Automation / AI Agent with MCPs • AI Workflows & AI Agents • MCPs for AI Agents
cherry-studio
AI productivity studio with smart chat, autonomous agents, and 300+ assistants.
CopilotKit
The Frontend for Agents & Generative UI. React + Angular
Machine-readable data
The same record, as JSON, for agents and crawlers.
{
"facts": [
{
"factKey": "vendor",
"category": "vendor",
"label": "Vendor",
"value": "Clawhub",
"href": "https://clawhub.ai/haoyiyong985/skills/image-knowledge-converter",
"sourceUrl": "https://clawhub.ai/haoyiyong985/skills/image-knowledge-converter",
"sourceType": "profile",
"confidence": "medium",
"observedAt": "2026-10-11T11:20:21.886Z",
"isPublic": true
},
{
"factKey": "protocols",
"category": "compatibility",
"label": "Protocol compatibility",
"value": "OpenClaw",
"href": "https://www.xpersona.co/api/v1/agents/clawhub-haoyiyong985-image-knowledge-converter/contract",
"sourceUrl": "https://www.xpersona.co/api/v1/agents/clawhub-haoyiyong985-image-knowledge-converter/contract",
"sourceType": "contract",
"confidence": "medium",
"observedAt": "2026-10-11T11:20:21.886Z",
"isPublic": true
},
{
"factKey": "traction",
"category": "adoption",
"label": "Adoption signal",
"value": "1.1K downloads",
"href": "https://clawhub.ai/haoyiyong985/image-knowledge-converter",
"sourceUrl": "https://clawhub.ai/haoyiyong985/image-knowledge-converter",
"sourceType": "profile",
"confidence": "medium",
"observedAt": "2026-10-11T11:20:21.886Z",
"isPublic": true
},
{
"factKey": "latest_release",
"category": "release",
"label": "Latest release",
"value": "1.0.0",
"href": "https://clawhub.ai/haoyiyong985/image-knowledge-converter",
"sourceUrl": "https://clawhub.ai/haoyiyong985/image-knowledge-converter",
"sourceType": "release",
"confidence": "medium",
"observedAt": "2026-07-12T09:03:28.775Z",
"isPublic": true
},
{
"factKey": "handshake_status",
"category": "security",
"label": "Handshake status",
"value": "UNKNOWN",
"href": "https://www.xpersona.co/api/v1/agents/clawhub-haoyiyong985-image-knowledge-converter/trust",
"sourceUrl": "https://www.xpersona.co/api/v1/agents/clawhub-haoyiyong985-image-knowledge-converter/trust",
"sourceType": "trust",
"confidence": "medium",
"observedAt": null,
"isPublic": true
}
],
"events": [
{
"eventType": "release",
"title": "Release 1.0.0",
"description": "- Removed the file skill-card.md. - No other user-facing changes.",
"href": "https://clawhub.ai/haoyiyong985/image-knowledge-converter",
"sourceUrl": "https://clawhub.ai/haoyiyong985/image-knowledge-converter",
"sourceType": "release",
"confidence": "medium",
"observedAt": "2026-07-12T09:03:28.775Z",
"isPublic": true
}
]
}Record generated Oct 11, 2026.
