agentCLAWHUBUnverified

微信收藏知识库

微信收藏夹导出、智能分类与知识库管理。支持从解析后的 favorite.db 导出收藏记录、自动归纳分类(从用户内容发现自然类别)、LLM 智能增强(可选)、批量导入 IMA 知识库(可选)、多平台导出(Obsidian/Notion,可选)、增量分类。核心功能支持离线使用,网络功能默认关闭。

OpenClaw

Rank

62

Safety

84

Downloads

1.3k

Updated

Oct 10, 2026

Version

1.2.0

Source

CLAWHUB

About

What it does, and when to use it.

Capability contract not published. No trust telemetry is available yet. 1.3K downloads reported by the source. Last updated 10/10/2026.

Avoid when

  • Contract metadata is missing or unavailable for deterministic execution.

Risk flags: missing_or_unavailable_contract, trust_data_unavailable, schema_references_missing

Public facts

Every fact links back to the source it came from.

Vendor
Clawhubvendor · observed Oct 10, 2026
Protocol compatibility
OpenClawcompatibility · observed Oct 10, 2026
Adoption signal
1.3K downloadsadoption · observed Oct 10, 2026
Latest release
1.2.0release · observed Jun 7, 2026
Handshake status
UNKNOWNsecurity

Install and run

Setup complexity: low.

clawhub skill install s177hjk4wtsf8s6hwg4159e14n859ahk:wechat-favorites
  1. Install using `clawhub skill install s177hjk4wtsf8s6hwg4159e14n859ahk:wechat-favorites` in an isolated environment before connecting it to live workloads.
  2. No published capability contract is available yet, so validate auth and request/response behavior manually.
  3. Review the upstream CLAWHUB listing at https://clawhub.ai/geosun/wechat-favorites before using production credentials.

Contract: missing

curl -s "https://www.xpersona.co/api/v1/agents/clawhub-geosun-wechat-favorites/snapshot"

Documentation

CLAWHUB

131,534 characters of source documentation, loaded on request.

Extracted files

5 files captured from the source.

SKILL.md

---
name: wechat-favorites
description: 微信收藏夹导出、智能分类与知识库管理。支持从解析后的 favorite.db 导出收藏记录、自动归纳分类(从用户内容发现自然类别)、LLM 智能增强(可选)、批量导入 IMA 知识库(可选)、多平台导出(Obsidian/Notion,可选)、增量分类。核心功能支持离线使用,网络功能默认关闭。
metadata:
  version: 1.2.0
  display_name: 微信收藏知识库
---

# 微信收藏知识库

Decrypt, categorize and organize wechat favorites (Official Account collection) into knowledge base

收藏夹导出 · 智能分类 · 知识库导入 · 多平台导出

**快速上手:** 解析收藏夹 → 导出记录 → 自动归纳类别 → 智能分类 → 导出到 Obsidian/Notion 或导入 IMA

> 💡 **试试这样说:** "帮我整理微信收藏" / "导出收藏夹并自动归纳分类" / "从我的收藏中发现自然类别" / "把微信收藏导入知识库"

---

**触发词:** 微信收藏(WeChat Favorites)、收藏夹导出(favorites export)、收藏文章分类(favorites classification)、自动归纳分类(auto-discover categories)、IMA 知识库导入(knowledge base import)、Obsidian 导出(Obsidian export)、Notion 导出(Notion export)、收藏整理(favorites organizer)

---

## 新增功能

> 完整更新日志见 [CHANGELOG.md](CHANGELOG.md)

- **自动归纳分类** — 从收藏内容中 LLM 发现自然类别,不再受限于固定 9 大类
- **Obsidian / Notion 导出** — Markdown 按年月归档+增量同步 / 批量导入 Notion 数据库
- **LLM 增量分类** — 新增收藏无需全量重跑,支持结果合并与标签标准化
- **自定义分类** — classify_favorites.py 新增 `--categories` 参数,支持自定义分类 JSON

---

## 为什么用这个工具?

微信收藏夹积累了大量文章:随手打的标签越来越复杂,待读越积越多,从来没有真正整理过,也不记得读了哪些、学到了什么。这个工具可以:

- **自动归纳** — 从你的收藏中发现自然类别,不再受限于固定分类
- **关键词匹配** — 快速扫描全部收藏,按关键词归类
- **LLM 增强** — 低置信度条目用大模型智能重判(可选)
- **知识库导入** — 一键导入 IMA,构建个人知识库(可选)
- **多平台导出** — 导出为 Markdown 到 Obsidian,或批量导入 Notion 数据库(可选)
- **增量分类** — 新增收藏无需全量重跑,LLM 增量分类 + 结果合并

---

## 核心能力

| 能力 | 说明 |
|------|------|
| **收藏导出** | 从解析后的 `favorite.db` 导出全部收藏记录为 CSV |
| **自动归纳** | 从用户收藏内容自动发现分类体系(v1.2 新增) |
| **关键词分类** | 默认 9 大类(生物医药/AI/投资等),或使用自定义分类 |
| **标签增强** | 二级标签 57 个 + 跨领域标签 6 类(仅默认分类) |
| **LLM 增强(可选)** | 置信度低时自动调用 LLM 二次分类,需配置 API Key |
| **IMA导入(可选)** | 批量导入到 IMA 知识库,需配置凭证 |
| **Notion 导出(可选)** | 导出收藏到 Notion 数据库,需配置 API Token(v1.2 新增) |
| **Obsidian 导出(可选)** | 导出收藏为 Markdown 文件到 Obsidian vault(v1.2 新增) |
| **报告生成** | 分类统计、各分类 CSV 导出 |

---

## 前置条件

### 1. 微信收藏数据库

本工具需要已解析的 `favorite.db` 文件。解析步骤请使用专门的微信数据库处理工具。

### 2. Python 环境

```bash
pip install pycryptodome zstandard
```

### 3. LLM 配置(自动归纳需要)

自动归纳功能需要调用 LLM API:

```bash
export LLM_API_KEY="your-openrouter-api-key"
export LLM_API_URL="https://openrouter.ai/api/v1/chat/completions"
export LLM_MODEL="deepseek/deepseek-chat"
```

或使用本地模型:

```bash
export LLM_API_URL="http://localhost:11434/v1/chat/completions"
export LLM_MODEL="qwen2.5:14b"
```

### 4. IMA 导入(可选)

如需导入 IMA 知识库,配置凭证:`~/.config/ima/client_id` 和 `~/.config/ima/api_key`

### 5. Notion 导出(可选)

如需导出到 Notion,配置 API Token:

```bash
export NOTION_API_TOKEN="secret_xxx"
```

### 6. Obsidian 导出(可选)

无需额外配置,直接指定 vault 路径即可。

---

## 快速开始

### 方式一:自动归纳分类(推荐)

```bash
cd scripts

# 1. 导出收藏记录
python export_favorites.py

# 2. 自动发现分类体系
python auto_discover.py

# 3. 使用自定义分类
python classify_favorites.py --categories user_categories.json

# 4. 导入 IMA(可选)
python import_ima.py
```

### 方式二:使用默认 9 大类

```bash
cd scripts

# 1. 导出收藏记录
python export_favorites.py

# 2. 使用默认分类
python classify_favorites.py

# 3. 导入 IMA(可选)
python import_ima.py
```

### 方式三:导出到 Notion / 

_meta.json

{
  "ownerId": "kn7fh7azcgp5wwsg434v6km1x5858t33",
  "slug": "wechat-favorites",
  "version": "1.2.0",
  "publishedAt": 1780806779002
}

references/classification.md

# 收藏分类算法 v1.2.0

## 分类流程

```
favorites_all.csv
      │
      ▼ 关键词多标签分类(一级)
  categories 列(中文标签,管道分隔)
  confidence 列(0~0.5)
      │
      ▼ 二级分类(基于正则匹配)
  subcategory 列(管道分隔,可多个)
      │
      ▼ 跨领域标签(主分类 + 跨领域关键词)
  cross_domain 列(管道分隔,可多个)
      │
      ▼ [可选] LLM 二次分类(confidence < threshold)
  更新 categories, subcategory, cross_domain
  追加 _llm_reason, _llm_confidence 列
      │
      ▼ [可选] 标签标准化
  category 列(标准英文 key)
```

## 第一步:关键词多标签分类(一级)

每篇文章可同时归属多个分类。

```python
CATEGORIES = {
    "生物医药": ["创新药", "ADC", "CAR-T", "mRNA", ...],
    "AI科技":   ["GPT", "大模型", "LLM", "Agent", ...],
    "投资金融": ["IPO", "融资", "估值", "科创板", ...],
    "科学研究": ["Nature", "Science", "论文", ...],
    "商业财经": ["企业", "战略", "行业", ...],
    "生活方式": ["健康", "运动", "旅行", ...],
    "媒体资讯": ["新闻", "热点", "评论", ...],
    "政治国际": ["国际", "外交", "地缘", ...],
}
```

置信度规则:
- 0 = 未命中任何关键词
- 0.3 = 命中单个分类
- 0.5 = 命中多个分类(多标签反而更难判断主次)

## 第二步:二级分类

基于一级分类结果,对每个命中的一级分类用正则匹配二级标签。

```python
SUBCATEGORIES = {
    "生物医药": {
        "临床": r"临床|IND|NDA|CDE|FDA|NMPA|III期|II期|I期|获批|批准",
        "神经": r"阿尔茨海默|帕金森|神经|脑科学|抑郁|...",
        "创新药": r"创新药|新药|first-in-class|best-in-class",
        # ... 14 个二级标签
    },
    "AI科技": {
        "AI应用": r"AI应用|AI\+|赋能|落地|智能化|用AI|...",
        "大模型/LLM": r"大模型|LLM|GPT|Claude|Gemini|...",
        # ... 9 个二级标签
    },
    # ... 共 6 个一级分类有二级标签
}
```

特点:
- 一篇文章可命中多个二级标签(如 "ADC+肿瘤+临床")
- 不是所有文章都有二级标签(泛泛讨论只保留一级)
- 每个一级分类下二级标签互不排斥

覆盖率(实测):
- 生物医药: 47.0%
- 商业财经: 44.2%
- 投资金融: 43.8%
- AI科技: 29.1%
- 科学研究: 27.9%
- 生活方式: 20.9%

## 第三步:跨领域标签

检测文章是否同时涉及两个领域。

```python
CROSS_DOMAIN_RULES = [
    # (标签, 主分类, 跨领域关键词正则)
    ("生物医药+投资", "生物医药", r"融资|估值|IPO|上市|投资|..."),
    ("AI+医疗",       "AI科技",   r"医疗|药|临床|诊断|医院|..."),
    ("AI+投资",       "AI科技",   r"融资|估值|IPO|上市|投资|..."),
    ("生物医药+AI",   "生物医药", r"AI|人工智能|机器学习|计算|..."),
    ("科学+政策",     "科学研究", r"政策|监管|伦理|法规|..."),
    ("商业+政治",     "商业财经", r"制裁|贸易战|关税|地缘|..."),
]
```

逻辑:先确定文章的主分类,再检查是否含跨领域关键词。
一篇文章可有多个跨领域标签。

分布(实测 32333 篇):
- 生物医药+投资: 2974
- AI+医疗: 546
- AI+投资: 339
- 生物医药+AI: 203
- 商业+政治: 68
- 科学+政策: 19

## 第四步:LLM 二次分类

对关键词分类置信度不足(默认 < 0.4)的条目,用大模型进行智能重判。

### Prompt 结构

```
文章标题:{title}
来源公众号:{source}
文章链接:{url}

一级分类(可多选):
生物医药、AI科技、投资金融、科学研究、商业财经、生活方式、媒体资讯、政治国际

二级分类(选填,根据一级分类选对应的子标签):
- 生物医药:临床、神经、创新药、肿瘤、...
- AI科技:AI应用、大模型/LLM、AI医疗、...
- ...

跨领域标签(选填,文章同时涉及两个领域时标注):
生物医药+投资、AI+医疗、AI+投资、生物医药+AI、科学+政策、商业+政治

输出 JSON:{"tags": [...], "subcategories": [...], "cross_domain": [...], "reason": "...", "confidence": 0~1}
```

### LLM 结果解析

1. 提取 JSON(支持 ```json 代码块包裹)
2. 过滤无效一级标签(只保留 8 个标准分类)
3. 过滤无效二级标签(只保留 SUBCATEGORY_TAGS 中定义的)
4. 过滤无效跨领域标签(只保留 CROSS_DOMAIN_TAGS 中定义的)
5. confidence >= 0.5 时采纳,否则保留原分类

### 增量处理

对于大量 other 条目(>1000),推荐增量模式:
- `llm_incremental.py`:每批 50 条,并发 20,每 5 分钟保存检查点
- 中断后重新运行自动续传
- 合并:`merge_llm_results.py` 将检查点结果写回 CSV

## 第五步:标签标准化

LLM 和关键词可能输出不同格式的标签,标准化映射:

| 标准分类 | 英文 key | 接受的输入格式 |
|---------|----------|--------------|
| 生物医药 | `biomed` | 生物医药, biomed |
| AI科技 | `ai` | AI科技, ai, tech |

references/schema.md

# favorite.db 数据库结构

## 表:fav_db_item

存储所有收藏记录。

| 字段 | 类型 | 说明 |
|------|------|------|
| local_id | INTEGER | 主键,收藏记录ID |
| fav_local_type | INTEGER | 收藏类型 |
| status | INTEGER | 状态标记 |
| create_time | INTEGER | 收藏时间(Unix时间戳) |
| source_id | TEXT | 来源用户/公众号 wxid |
| source_type | INTEGER | 来源类型 |
| content | BLOB | 收藏内容(XML格式,可能压缩) |
| WCDB_CT_content | INTEGER | 压缩类型(4=zstd) |

## fav_local_type 类型值

| 值 | 类型 |
|----|------|
| 1 | 文章/链接 |
| 2 | 图片 |
| 3 | 视频 |
| 4 | 文件 |
| 5 | 语音 |
| 6 | 位置 |
| 7 | 名片 |
| 8 | 文本笔记 |

## content XML 结构

文章类型(fav_local_type=1)的 content 示例:

```xml
<favitem>
  <type>1</type>
  <title>文章标题</title>
  <desc>文章摘要</desc>
  <url>https://mp.weixin.qq.com/s/xxx</url>
  <source>公众号名称</source>
  <sourcetype>9</sourcetype>
  <thumburl>封面图URL</thumburl>
</favitem>
```

## 解析代码

```python
import xml.etree.ElementTree as ET

def parse_favorite_content(content_bytes, ct):
    # 解压 zstd
    if ct == 4:
        import zstandard as zstd
        content = zstd.ZstdDecompressor().decompress(content_bytes)
    else:
        content = content_bytes
    
    root = ET.fromstring(content)
    return {
        'type': root.findtext('type'),
        'title': root.findtext('title', ''),
        'desc': root.findtext('desc', ''),
        'url': root.findtext('url', ''),
        'source': root.findtext('source', ''),
    }
```

## 相关表

- `favorite_fts.db` — 全文搜索索引(SQLite FTS)

CHANGELOG.md

# 更新日志

## v1.2.0 — 2026-06-07

### 1. 智能分类体系升级

**自动归纳分类(auto_discover.py)**

不再局限于固定的 9 大类,而是从**你的收藏内容**中自动发现自然分类:

```bash
# 第一步:自动发现分类体系
python auto_discover.py

# 输出:user_categories.json(根据你的收藏内容归纳出 8-15 个类别)

# 第二步:使用自定义分类对全部收藏分类
python classify_favorites.py --categories user_categories.json
```

**工作原理:**
1. 随机采样 500 条标题(可调)
2. 发送给 LLM 分析,请求归纳 8-15 个自然分类
3. LLM 返回:类别名 + 描述 + 10-20 个关键词
4. 保存为 `user_categories.json`

**三种分类方式对比:**

| 方式 | 类别来源 | 适用场景 |
|------|---------|---------|
| 默认(固定 9 类) | 预定义的生物医药、AI、投资等 | 内容聚焦投资/科技/医疗领域 |
| 自动归纳 | 从用户收藏中 LLM 发现 | 内容多元、预定义类别不匹配 |
| 自定义 JSON | 用户手动编辑 | 有明确分类需求 |

**LLM 分类增强工具:**

| 脚本 | 功能 |
|------|------|
| `llm_incremental.py` | 对新增收藏执行 LLM 分类,无需全量重跑 |
| `merge_llm_results.py` | 合并多次 LLM 分类结果,避免重复处理 |
| `normalize_categories.py` | 统一不同来源的分类标签为标准格式 |

**classify_favorites.py 增强:**
- 新增 `--categories` 参数,支持自定义分类 JSON
- 支持动态标签匹配(配合 auto_discover.py 输出)

---

### 2. 多平台导出

**Obsidian 导出(export_to_obsidian.py)**

将收藏导出为 Markdown 文件到 Obsidian vault:

```bash
python export_to_obsidian.py --input articles_final.csv --vault "D:\Obsidian\MyVault"
```

- 按 `年/月/` 目录结构自动归档
- YAML frontmatter:title、url、category、tags、author、nickname、created、imported
- 增量同步:已存在的文件自动跳过
- 支持 `--limit` 限制数量、`--dry-run` 预览

**Notion 导出(export_to_notion.py)**

将收藏批量导入 Notion 数据库:

```bash
python export_to_notion.py --input articles_final.csv --database-id YOUR_DB_ID
```

需配置环境变量:`NOTION_API_TOKEN="secret_xxx"`

---

### 3. 文档与安全优化

- SKILL.md 全面完善:补充分类逻辑说明、LLM 使用指南、实测数据、文件格式说明
- 快速上手简化:精简配置示例、优化命令说明、增强引导提示、补充常用触发词
- 安全说明强化:新增 ## 安全说明章节,强调本地化、隐私保护与数据安全
- 新建 CHANGELOG.md:版本更新细节独立存放,SKILL.md 保持精简

---

## v1.1.4 — 2026-04-26

- 安全审核修复:SAFE_MODE 离线模式,核心功能默认关闭网络
- 中英双语文档完善
- 安全说明强化:新增 ## 安全说明章节,强调本地化、隐私保护与数据安全

---

## v1.1 — 2026-04

- 分类体系升级:新增三级分类体系——9大主类、57个二级标签、6个跨领域标签,分类更精细多元
- 文档全面优化:完善 SKILL.md,补充分类逻辑说明、LLM 使用指南、实测数据、文件格式说明
- 快速上手简化:精简配置示例、优化命令说明、增强引导提示、补充常用触发词,方便快速上手
- LLM 智能增强(可选):新增 LLM 辅助分类脚本(llm_classify.py、llm_incremental.py、merge_llm_results.py、normalize_categories.py),低置信度或模糊条目可交由大模型重新分类
- 安全说明强化:新增## 安全说明章节,强调本地化、隐私保护与数据安全
- 版本升级:1.1.0 → 1.1,新显示名(微信收藏知识库)
Github ReposUpdated 1d agoRank 70

AionUi

Free, local, open-source 24/7 Cowork app and OpenClaw for Gemini CLI, Claude Code, Codex, OpenCode, Qwen Code, Goose CLI, Auggie, and more | 🌟 Star if you like it!

MCPOPENCLAW
Github ReposUpdated 6mo agoRank 70

activepieces

AI Agents & MCPs & AI Workflow Automation • (~400 MCP servers for AI agents) • AI Automation / AI Agent with MCPs • AI Workflows & AI Agents • MCPs for AI Agents

OPENCLAW
Github ReposUpdated 6mo agoRank 70

cherry-studio

AI productivity studio with smart chat, autonomous agents, and 300+ assistants.

MCPOPENCLAW
Github ReposUpdated 7mo agoRank 70

CopilotKit

The Frontend for Agents & Generative UI. React + Angular

OPENCLAW

Machine-readable data

The same record, as JSON, for agents and crawlers.

{
  "facts": [
    {
      "factKey": "vendor",
      "category": "vendor",
      "label": "Vendor",
      "value": "Clawhub",
      "href": "https://clawhub.ai/geosun/skills/wechat-favorites",
      "sourceUrl": "https://clawhub.ai/geosun/skills/wechat-favorites",
      "sourceType": "profile",
      "confidence": "medium",
      "observedAt": "2026-10-10T20:28:16.506Z",
      "isPublic": true
    },
    {
      "factKey": "protocols",
      "category": "compatibility",
      "label": "Protocol compatibility",
      "value": "OpenClaw",
      "href": "https://www.xpersona.co/api/v1/agents/clawhub-geosun-wechat-favorites/contract",
      "sourceUrl": "https://www.xpersona.co/api/v1/agents/clawhub-geosun-wechat-favorites/contract",
      "sourceType": "contract",
      "confidence": "medium",
      "observedAt": "2026-10-10T20:28:16.506Z",
      "isPublic": true
    },
    {
      "factKey": "traction",
      "category": "adoption",
      "label": "Adoption signal",
      "value": "1.3K downloads",
      "href": "https://clawhub.ai/geosun/wechat-favorites",
      "sourceUrl": "https://clawhub.ai/geosun/wechat-favorites",
      "sourceType": "profile",
      "confidence": "medium",
      "observedAt": "2026-10-10T20:28:16.506Z",
      "isPublic": true
    },
    {
      "factKey": "latest_release",
      "category": "release",
      "label": "Latest release",
      "value": "1.2.0",
      "href": "https://clawhub.ai/geosun/wechat-favorites",
      "sourceUrl": "https://clawhub.ai/geosun/wechat-favorites",
      "sourceType": "release",
      "confidence": "medium",
      "observedAt": "2026-06-07T04:32:59.002Z",
      "isPublic": true
    },
    {
      "factKey": "handshake_status",
      "category": "security",
      "label": "Handshake status",
      "value": "UNKNOWN",
      "href": "https://www.xpersona.co/api/v1/agents/clawhub-geosun-wechat-favorites/trust",
      "sourceUrl": "https://www.xpersona.co/api/v1/agents/clawhub-geosun-wechat-favorites/trust",
      "sourceType": "trust",
      "confidence": "medium",
      "observedAt": null,
      "isPublic": true
    }
  ],
  "events": [
    {
      "eventType": "release",
      "title": "Release 1.2.0",
      "description": "**Summary: Adds auto-discovery and multi-platform export features.** - New: Automatic category discovery from user content via LLM, breaking free from fixed 9-class system. - New: Export to Obsidian (Markdown by month) and Notion (via API), supporting external knowledge bases. - New: Incremental LLM classification—no need to re-run all items for new favorites; supports results merging and normalization. - Enhancement: classify_favorites.py allows custom category JSON via --categories argument. - Docs: SKILL.md updated with new workflows, feature comparison, usage instructions, and security explanation. - Maintenance: Added CHANGELOG, scripts for auto-discover, Notion, and Obsidian export; removed legacy skill-card.md.",
      "href": "https://clawhub.ai/geosun/wechat-favorites",
      "sourceUrl": "https://clawhub.ai/geosun/wechat-favorites",
      "sourceType": "release",
      "confidence": "medium",
      "observedAt": "2026-06-07T04:32:59.002Z",
      "isPublic": true
    }
  ]
}

Record generated Oct 10, 2026.

Sponsored

Ads related to 微信收藏知识库 and adjacent AI workflows.