{"id":"6a61f3b1-ce32-4209-88ae-b1d6aa9a4773","entityType":"agent","slug":"clawhub-tomfoxxxx-hf-daily-deep-researcher","name":"HF Daily Deep Researcher","canonicalUrl":"https://www.xpersona.co/agent/clawhub-tomfoxxxx-hf-daily-deep-researcher","canonicalPath":"/agent/clawhub-tomfoxxxx-hf-daily-deep-researcher","generatedAt":"2026-10-10T15:54:38.310Z","source":"CLAWHUB","claimStatus":"UNCLAIMED","verificationTier":"NONE","summary":{"evidence":{"source":"editorial-content","verified":true,"confidence":"high","updatedAt":"2026-10-10T13:36:33.926Z","emptyReason":null},"description":"HuggingFace Daily Papers + arXiv 多Agent深度研究系统。 采用编排器+专业Agent架构，支持两种模式： 1. 轻量扫描模式：周期性追踪（周/月），发现新论文 2. 深度调研模式：全时间范围调研，产出全面深入的研究报告 支持动态配置、自适应关键词、周期版本控制、跨平台搜索工具适配。 Skill: HF Daily Deep Researcher Owner: tomfoxxxx Summary: HuggingFace Daily Papers + arXiv 多Agent深度研究系统。 采用编排器+专业Agent架构，支持两种模式： 1. 轻量扫描模式：周期性追踪（周/月），发现新论文 2. 深度调研模式：全时间范围调研，产出全面深入的研究报告 支持动态配置、自适应关键词、周期版本控制、跨平台搜索工具适配。 Tags: academic:4.1.1, arxiv:4.1.1, huggingface:4.1.1, latest:5.2.9, literature-review:4.1.1, research:4.1.1 Version history: v5.2.9 | 2026-08-26T10:14:26.890Z | user v5.2.9: GitHub mirror HF datasource,","descriptionLabel":"Technical summary","evidenceSummary":"Capability contract not published. No trust telemetry is available yet. 1.4K downloads reported by the source. Last updated 10/10/2026.","installCommand":"clawhub skill install s178nbj38m0perhkpbbrt0et7589stb6:hf-daily-deep-researcher","sourceUrl":"https://clawhub.ai/tomfoxxxx/hf-daily-deep-researcher","homepage":"https://clawhub.ai/tomfoxxxx/skills/hf-daily-deep-researcher","primaryLinks":[{"label":"View on ClawHub","url":"https://clawhub.ai/tomfoxxxx/hf-daily-deep-researcher","kind":"source"},{"label":"Homepage","url":"https://clawhub.ai/tomfoxxxx/skills/hf-daily-deep-researcher","kind":"homepage"}],"safetyScore":84,"overallRank":62,"popularityScore":63,"trustScore":null,"claimedByName":null,"isOwner":false,"seoDescription":"HuggingFace Daily Papers + arXiv 多Agent深度研究系统。 采用编排器+专业Agent架构，支持两种模式： 1. 轻量扫描模式：周期性追踪（周/月），发现新论文 2. 深度调研模式：全时间范围调研，产出全面深入的研究报告 支持动态配置、自适应关键词、周期版本控制、跨平台搜索工具适配。 "},"coverage":{"evidence":{"source":"public-profile","verified":false,"confidence":"medium","updatedAt":"2026-10-10T13:36:33.926Z","emptyReason":null},"protocols":[{"protocol":"OPENCLEW","label":"OpenClaw","status":"self-declared","notes":"Declared in the public agent profile."}],"capabilities":[],"verifiedCount":0,"selfDeclaredCount":1,"capabilityMatrix":{"rows":[{"key":"OPENCLEW","type":"protocol","support":"unknown","confidenceSource":"profile","notes":"Listed on profile"}],"flattenedTokens":"protocol:OPENCLEW|unknown|profile"}},"adoption":{"evidence":{"source":"CLAWHUB","verified":false,"confidence":"medium","updatedAt":"2026-10-10T13:36:33.926Z","emptyReason":null},"stars":null,"forks":null,"downloads":1408,"packageName":null,"latestVersion":"5.2.9","tractionLabel":"1.4K downloads"},"release":{"evidence":{"source":"CLAWHUB","verified":false,"confidence":"medium","updatedAt":"2026-10-10T13:36:33.926Z","emptyReason":null},"lastUpdatedAt":"2026-10-10T13:36:33.926Z","lastCrawledAt":"2026-10-10T13:36:33.926Z","lastIndexedAt":null,"nextCrawlAt":"2026-10-11T13:36:33.926Z","lastVerifiedAt":null,"highlights":[{"version":"5.2.9","createdAt":"2026-08-26T10:14:26.890Z","changelog":"v5.2.9: GitHub mirror HF datasource, parallel complementary search (arXiv + HF + kimi_search), cross-platform tool detection, v5.2.8 deep research enhancements, v5.2.7 P0 quality fixes","fileCount":25,"zipByteSize":79603},{"version":"5.2.8","createdAt":"2026-08-06T03:30:26.484Z","changelog":"Deep research mode enhancement: 15 mandatory search queries, 25min milestone reading, citation chain analysis, tech evolution timeline, saturation grading, coverage matrix","fileCount":25,"zipByteSize":78484},{"version":"5.2.7","createdAt":"2026-08-06T01:33:38.880Z","changelog":"P0 quality fixes: mandatory search coverage, mandatory data verification [V]/[C]/[U], mandatory benchmark citations, privacy cleanup","fileCount":25,"zipByteSize":74801},{"version":"5.2.6","createdAt":"2026-08-05T16:21:35.560Z","changelog":"hf-daily-deep-researcher v5.2.6 - Updated version numbers and documentation (SKILL.md, config files) to reflect recent changes. - Removed skill-card.md for housekeeping. - Minor improvements and maintenance across source and distribution files. - No major workflow or feature changes; documentation and config synchronization.","fileCount":70,"zipByteSize":234910},{"version":"5.2.5","createdAt":"2026-08-05T07:29:29.990Z","changelog":"hf-daily-deep-researcher v5.2.5 - Updated searcher prompt and configuration logic in agents/searcher_prompt.md and config.json. - Synchronized distribution files in dist/ with upstream changes. - Removed obsolete skill-card.md file. - Refined internal search strategy and configuration parameters.","fileCount":70,"zipByteSize":235165},{"version":"5.2.4","createdAt":"2026-08-05T06:00:36.580Z","changelog":"**HF Daily Deep Researcher v5.2.4** - Added extensive documentation and assessment files for quality, release gating, and report status (e.g., `QUALITY_ASSESSMENT.md`, `RELEASE_GATE_CHECK.md`, `REPORT_STATUS.md`). - Introduced new structured prompts, agent definitions, and templates under the `dist/` directory to improve multi-agent orchestration and report generation. - Enhanced cross-platform compatibility with new experiment plans and reports for v5.2.0. - Updated HuggingFace Daily Papers API usage instructions: now includes detection and automatic fallback if the API is blocked (notably in some regions); users are guided to resolve via proxy or alternative environments if needed. - Minor fixes and improvements to initialization, adaptive configuration, and agent coordination. - Removed outdated documentation files (`skill-card.md`), consolidated and reorganized agent prompt files for better maintainability.","fileCount":70,"zipByteSize":234721},{"version":"5.2.3","createdAt":"2026-08-04T15:59:44.906Z","changelog":"v5.2.3: pragmatic HF Daily Papers handling - try API first, fall back to enhanced arXiv search if huggingface.co is unreachable","fileCount":25,"zipByteSize":70148},{"version":"5.2.2","createdAt":"2026-08-04T15:08:48.764Z","changelog":"v5.2.2: cross-platform compatibility, HF Daily Papers API, parallel complementary search, 14-dimension quality checklist","fileCount":25,"zipByteSize":69907}]},"execution":{"evidence":{"source":"CLAWHUB","verified":false,"confidence":"low","updatedAt":null,"emptyReason":"No published capability contract is available yet."},"installCommand":"clawhub skill install s178nbj38m0perhkpbbrt0et7589stb6:hf-daily-deep-researcher","setupComplexity":"low","setupSteps":["Setup complexity is classified as HIGH. You must provision dedicated cloud infrastructure or an isolated VM. Do not run this directly on your local workstation.","Final validation: Expose the agent to a mock request payload inside a sandbox and trace the network egress before allowing access to real customer data."],"contract":{"contractStatus":"missing","authModes":[],"requires":[],"forbidden":[],"supportsMcp":false,"supportsA2a":false,"supportsStreaming":false,"inputSchemaRef":null,"outputSchemaRef":null,"dataRegion":null,"contractUpdatedAt":null,"sourceUpdatedAt":null,"freshnessSeconds":null},"invocationGuide":{"preferredApi":{"snapshotUrl":"https://www.xpersona.co/api/v1/agents/clawhub-tomfoxxxx-hf-daily-deep-researcher/snapshot","contractUrl":"https://www.xpersona.co/api/v1/agents/clawhub-tomfoxxxx-hf-daily-deep-researcher/contract","trustUrl":"https://www.xpersona.co/api/v1/agents/clawhub-tomfoxxxx-hf-daily-deep-researcher/trust"},"curlExamples":["curl -s \"https://www.xpersona.co/api/v1/agents/clawhub-tomfoxxxx-hf-daily-deep-researcher/snapshot\"","curl -s \"https://www.xpersona.co/api/v1/agents/clawhub-tomfoxxxx-hf-daily-deep-researcher/contract\"","curl -s \"https://www.xpersona.co/api/v1/agents/clawhub-tomfoxxxx-hf-daily-deep-researcher/trust\""],"jsonRequestTemplate":{"query":"summarize this repo","constraints":{"maxLatencyMs":2000,"protocolPreference":["OPENCLEW"]}},"jsonResponseTemplate":{"ok":true,"result":{"summary":"...","confidence":0.9},"meta":{"source":"CLAWHUB","generatedAt":"2026-10-10T15:54:38.308Z"}},"retryPolicy":{"maxAttempts":3,"backoffMs":[500,1500,3500],"retryableConditions":["HTTP_429","HTTP_503","NETWORK_TIMEOUT"]}},"endpoints":{"dossierUrl":"https://www.xpersona.co/api/v1/agents/clawhub-tomfoxxxx-hf-daily-deep-researcher/dossier","snapshotUrl":"https://www.xpersona.co/api/v1/agents/clawhub-tomfoxxxx-hf-daily-deep-researcher/snapshot","contractUrl":"https://www.xpersona.co/api/v1/agents/clawhub-tomfoxxxx-hf-daily-deep-researcher/contract","trustUrl":"https://www.xpersona.co/api/v1/agents/clawhub-tomfoxxxx-hf-daily-deep-researcher/trust"}},"reliability":{"evidence":{"source":"runtime-metrics","verified":false,"confidence":"low","updatedAt":null,"emptyReason":"No trust, reliability, or runtime telemetry is available."},"trust":{"status":"unavailable","handshakeStatus":"UNKNOWN","verificationFreshnessHours":null,"reputationScore":null,"p95LatencyMs":null,"successRate30d":null,"fallbackRate":null,"attempts30d":null,"trustUpdatedAt":null,"trustConfidence":"unknown","sourceUpdatedAt":null,"freshnessSeconds":null},"decisionGuardrails":{"doNotUseIf":["Contract metadata is missing or unavailable for deterministic execution."],"safeUseWhen":[],"riskFlags":["missing_or_unavailable_contract","trust_data_unavailable","schema_references_missing"],"operationalConfidence":"low"},"executionMetrics":{"observedLatencyMsP50":null,"observedLatencyMsP95":null,"estimatedCostUsd":null,"uptime30d":null,"rateLimitRpm":null,"rateLimitBurst":null,"lastVerifiedAt":null,"verificationSource":null},"runtimeMetrics":{"successRate":null,"avgLatencyMs":null,"avgCostUsd":null,"hallucinationRate":null,"retryRate":null,"disputeRate":null,"p50Latency":null,"p95Latency":null,"lastUpdated":null}},"benchmarks":{"evidence":{"source":"no-benchmark-data","verified":false,"confidence":"low","updatedAt":null,"emptyReason":"No benchmark suites or observed failure patterns are available."},"suites":[],"failurePatterns":[]},"artifacts":{"evidence":{"source":"CLAWHUB","verified":false,"confidence":"high","updatedAt":"2026-10-10T13:36:33.926Z","emptyReason":null},"readme":"Skill: HF Daily Deep Researcher\n\nOwner: tomfoxxxx\n\nSummary: HuggingFace Daily Papers + arXiv 多Agent深度研究系统。 采用编排器+专业Agent架构，支持两种模式： 1. 轻量扫描模式：周期性追踪（周/月），发现新论文 2. 深度调研模式：全时间范围调研，产出全面深入的研究报告 支持动态配置、自适应关键词、周期版本控制、跨平台搜索工具适配。\n\nTags: academic:4.1.1, arxiv:4.1.1, huggingface:4.1.1, latest:5.2.9, literature-review:4.1.1, research:4.1.1\n\nVersion history:\n\nv5.2.9 | 2026-08-26T10:14:26.890Z | user\n\nv5.2.9: GitHub mirror HF datasource, parallel complementary search (arXiv + HF + kimi_search), cross-platform tool detection, v5.2.8 deep research enhancements, v5.2.7 P0 quality fixes\n\nv5.2.8 | 2026-08-06T03:30:26.484Z | user\n\nDeep research mode enhancement: 15 mandatory search queries, 25min milestone reading, citation chain analysis, tech evolution timeline, saturation grading, coverage matrix\n\nv5.2.7 | 2026-08-06T01:33:38.880Z | user\n\nP0 quality fixes: mandatory search coverage, mandatory data verification [V]/[C]/[U], mandatory benchmark citations, privacy cleanup\n\nv5.2.6 | 2026-08-05T16:21:35.560Z | auto\n\nhf-daily-deep-researcher v5.2.6\n\n- Updated version numbers and documentation (SKILL.md, config files) to reflect recent changes.\n- Removed skill-card.md for housekeeping.\n- Minor improvements and maintenance across source and distribution files.\n- No major workflow or feature changes; documentation and config synchronization.\n\nv5.2.5 | 2026-08-05T07:29:29.990Z | auto\n\nhf-daily-deep-researcher v5.2.5\n\n- Updated searcher prompt and configuration logic in agents/searcher_prompt.md and config.json.\n- Synchronized distribution files in dist/ with upstream changes.\n- Removed obsolete skill-card.md file.\n- Refined internal search strategy and configuration parameters.\n\nv5.2.4 | 2026-08-05T06:00:36.580Z | auto\n\n**HF Daily Deep Researcher v5.2.4**\n\n- Added extensive documentation and assessment files for quality, release gating, and report status (e.g., `QUALITY_ASSESSMENT.md`, `RELEASE_GATE_CHECK.md`, `REPORT_STATUS.md`).\n- Introduced new structured prompts, agent definitions, and templates under the `dist/` directory to improve multi-agent orchestration and report generation.\n- Enhanced cross-platform compatibility with new experiment plans and reports for v5.2.0.\n- Updated HuggingFace Daily Papers API usage instructions: now includes detection and automatic fallback if the API is blocked (notably in some regions); users are guided to resolve via proxy or alternative environments if needed.\n- Minor fixes and improvements to initialization, adaptive configuration, and agent coordination.\n- Removed outdated documentation files (`skill-card.md`), consolidated and reorganized agent prompt files for better maintainability.\n\nv5.2.3 | 2026-08-04T15:59:44.906Z | user\n\nv5.2.3: pragmatic HF Daily Papers handling - try API first, fall back to enhanced arXiv search if huggingface.co is unreachable\n\nv5.2.2 | 2026-08-04T15:08:48.764Z | user\n\nv5.2.2: cross-platform compatibility, HF Daily Papers API, parallel complementary search, 14-dimension quality checklist\n\nv5.2.1 | 2026-08-03T17:40:45.070Z | user\n\nv5.2.1: 搜索策略从主次fallback升级为并行互补。web_fetch(arXiv API)提升为追新主力，kimi_search降级为主题补充。实验数据支撑：7/29对比中kimi_search只找到1篇7月论文，web_fetch找到7篇，两方案零交集。彻底避免日期过滤失效导致的信息遗漏。\n\nv5.2.0 | 2026-07-29T14:30:46.745Z | user\n\nv5.2.0: Cross-platform compatibility. Runtime tool detection for web_fetch/kimi_search. web_fetch now primary for paper fetching (arxiv.org/html/). Enhanced arXiv API search coverage (10 groups). Verified on Kimi/OpenClaw.\n\nv5.1.0 | 2026-07-18T10:43:54.102Z | user\n\nFix version numbering: sync local v4.5.0 content to v5.1.0. Multi-Checker 14+2 dims, checklist.md, security rules.\n\nv4.5.0 | 2026-07-14T08:35:33.344Z | user\n\nEnhanced quality check: expanded Multi-Checker from 8 to 14 core + 2 optional dimensions. Added technical insight, future prediction validity, actionability, mathematical rigor, data efficiency, and coverage matrix checks. New standalone checklist.md for manual verification. Strengthened fix safety rules: no empty promises, only download-local-fix-overwrite path.\n\nv4.1.6 | 2026-07-07T20:29:41.150Z | auto\n\n- Updated version number to 4.1.6 in SKILL.md.\n- No other functional, workflow, or architectural changes documented in this version.\n\nv4.1.10 | 2026-07-07T20:24:56.889Z | auto\n\nNo code or file changes detected in this version. The skill version or metadata may have been updated without any functional modification.\n\n- No functional or documentation changes.\n- No impact on workflows, features, or behavior.\n- Safe to update; identical operation as previous version.\n\nv5.0.0 | 2026-07-07T20:23:39.010Z | auto\n\nhf-daily-deep-researcher v5.0.0  \nBig update: Enhances deep research workflow and quality control with new templates and multi-agent improvements.\n\n- Added _meta.json for skill metadata management.\n- Improved deep research orchestration: introduced/updated prompts for Deep Writer and Multi-Checker agents.\n- Enhanced deep report output format via updated template (deep_report_template.md).\n- Refined agent instructions for deeper analysis and systematic quality checks.\n- Various internal changes for better modularity and lifecycle management of agents.\n\nv4.1.5 | 2026-07-07T20:07:48.215Z | auto\n\nNo changes detected in this version (4.1.5).\n\n- No files were modified from the previous release (4.1.2).\n- Features, logic, and documentation remain unchanged.\n\nv4.2.0 | 2026-07-07T20:07:43.587Z | user\n\nEnhanced checker and writer prompts, version tracking, benchmark cross-referencing.\n\nv4.1.4 | 2026-07-07T20:07:09.063Z | user\n\nv4.1.4: Multi-Checker expanded to 8 dimensions (added version numbering, structural consistency, format checks). Deep Writer prompts now require independent methodology chapters, multi-benchmark cross-referencing, model size annotations, and correct relative improvement calculations. Report template includes version footer. All personal data remains fully sanitized.\n\nv4.1.3 | 2026-07-03T04:53:42.225Z | user\n\nv4.1.3: Depersonalized distribution. Removed user-specific config (name, research_focus, folder_token) and keywords. Fresh install will prompt for research focus on first run.\n\nv4.1.2 | 2026-07-03T03:45:08.555Z | user\n\n关键修复：Searcher 阶段不再通过 sessions_spawn 启动子 Agent，改由主 Agent 直接执行搜索。彻底解决了子 Agent 输出截断导致的搜索结果不完整问题。Deep Reader 保留子 Agent 但每篇论文独立一个，增加完整性检测与兜底阅读。\n\nv4.1.1 | 2026-07-02T18:23:51.251Z | user\n\nHF Daily Deep Researcher v4.1.1: Multi-agent paper tracking system for HuggingFace Daily Papers + arXiv. Supports light scan (weekly/monthly) and deep research modes. Dynamic configuration, adaptive keywords, cross-platform search tool adaptation.\n\nArchive index:\n\nArchive v5.2.9: 25 files, 79603 bytes\n\nFiles: adaptive.py (14269b), agents/analyst_prompt.md (3775b), agents/checker_prompt.md (7067b), agents/checklist.md (5032b), agents/deep_reader_prompt.md (6503b), agents/deep_searcher_prompt.md (13301b), agents/deep_writer_prompt.md (4339b), agents/multi_checker_prompt.md (7990b), agents/searcher_prompt.md (20550b), agents/sub_analyst_authority.md (2280b), agents/sub_analyst_benchmark.md (4536b), agents/sub_analyst_code.md (1963b), agents/sub_analyst_gap.md (4174b), agents/synthesis_analyst_prompt.md (2230b), agents/writer_prompt.md (5126b), config.json (1846b), init.py (11505b), keywords.json (2825b), report_manager.py (12864b), skill-card.md (2853b), SKILL.md (46605b), templates/deep_report_template.md (6207b), templates/report_template.md (2924b), tracker.py (9707b), _meta.json (143b)\n\nFile v5.2.9:SKILL.md\n\n---\nname: hf-daily-deep-researcher\nversion: 5.2.9\ndescription: |\n  HuggingFace Daily Papers + arXiv 多Agent深度研究系统。\n  采用编排器+专业Agent架构，支持两种模式：\n  1. 轻量扫描模式：周期性追踪（周/月），发现新论文\n  2. 深度调研模式：全时间范围调研，产出全面深入的研究报告\n  支持动态配置、自适应关键词、周期版本控制、跨平台搜索工具适配。\n---\n\n# HF Daily Deep Researcher v5.2.9 — 多Agent编排版\n\n## 架构概览\n\n本 Skill 支持**两种工作模式**，根据用户请求自动判断：\n\n### 模式 1: 轻量扫描（Light Scan）\n- **触发条件**: 用户请求时间跨度 ≤30天（如\"最近一周\"、\"本月\"）\n- **目标**: 周期性追踪新发表论文，及时发现新工作\n- **搜索范围**: 按时间窗口分段，追新\n- **精读策略**: 只精读 P0/P1 高优先级论文\n- **输出**: 周报/月报（`templates/report_template.md`）\n\n### 模式 2: 深度调研（Deep Research）\n- **触发条件**: 用户请求时间跨度 >30天，或明确说\"研究研究\"、\"深入调研\"、\"系统梳理\"\n- **目标**: 全面覆盖一个研究方向，形成大而全的调研报告\n- **搜索范围**: 全时间范围，按方法论/作者/引用链搜索\n- **精读策略**: 所有重要工作都要精读，区分 milestone/improvement/application\n- **分析维度**: Benchmark 现状、研究空白、代码开源、权威性验证（并行子分析师）\n- **输出**: 深度调研报告（`templates/deep_report_template.md`）\n\n```\n┌─────────────────────────────────────────────────────────────────┐\n│                    编排器 (Orchestrator)                          │\n│              — 自动判断模式 → 执行对应工作流                       │\n├─────────────────────────────────────────────────────────────────┤\n│  轻量扫描模式              │  深度调研模式                        │\n│  ├─ Searcher (主Agent)     │  ├─ Deep Searcher (主Agent)         │\n│  ├─ Deep Reader (子Agent) │  ├─ Deep Reader (子Agent)           │\n│  ├─ Analyst (子Agent)      │  ├─ Sub-Analysts (并行子Agent)     │\n│  ├─ Writer (子Agent)       │  │   ├─ Benchmark                   │\n│  └─ Checker (子Agent)      │  │   ├─ Gap                         │\n│                            │  │   ├─ Code                        │\n│                            │  │   └─ Authority                   │\n│                            │  ├─ Synthesis Analyst (子Agent)    │\n│                            │  ├─ Deep Writer (子Agent)          │\n│                            │  ├─ Multi-Checker (子Agent)        │\n│                            │  └─ Revision (迭代修订)             │\n└────────────────────────────┴─────────────────────────────────────┘\n```\n\n> **注意**：Searcher 阶段（红色）由**主 Agent 直接执行**，不再通过 `sessions_spawn` 启动子 Agent。这是 v4.1.2 的关键修复——彻底避免搜索结果被截断的问题。\n\n**模式判断逻辑**（由主 Agent 执行）：\n```python\ndef determine_mode(user_request, days=None):\n    deep_signals = [\"研究研究\", \"深入调研\", \"全面调研\", \"系统梳理\", \n                    \"综述\", \"survey\", \"深度\", \"过去一年\", \"半年\", \n                    \"long-term\", \"comprehensive\"]\n    light_signals = [\"最近一周\", \"最近一个月\", \"本周\", \"本月\", \n                     \"周报\", \"月报\", \"跟踪\", \"scan\", \"过去7天\", \"过去30天\"]\n    \n    text = user_request.lower()\n    if any(s in text for s in deep_signals):\n        return \"deep\"\n    if any(s in text for s in light_signals):\n        return \"light\"\n    if days is not None:\n        return \"deep\" if days > 30 else \"light\"\n    return \"ask_user\"\n```\n\n### 为什么用多Agent？\n**Searcher 为什么不用子 Agent？**\n- `sessions_spawn` 的 announce 机制**不保证**能拿到子 Agent 的完整最终输出\n- 搜索阶段调用 `kimi_search` 等工具，主 Agent 完全有能力直接执行\n- 主 Agent 直接搜索 = 100% 可控，彻底避免截断问题\n\n**Deep Reader / Analyst / Writer / Checker 为什么用子 Agent？**\n- 精读需要处理大量论文内容，独立上下文避免 token 爆炸\n- 分析需要多维度并行（Benchmark、Gap、Code、Authority 独立分析后再综合）\n- 质检需要独立视角\n- 这些阶段的输出是\"分析/报告/检查结论\"，即使截断也可由主 Agent 检测并补充\n\n## 数据传递模式\n\n子 Agent 通过 `sessions_spawn` 启动，**环境隔离导致它们无法直接写入主 Agent 的文件系统**。工作流采用以下模式：\n\n```\nPhase 1: 主Agent直接搜索 → 写入 .tmp/papers_raw.json\nPhase 2+: 子Agent执行任务 → 输出到回复/announce\n          主Agent接收 completion event → 提取内容\n          主Agent写入 .tmp/ 文件 → 后续阶段读取\n```\n\n**关键设计原则：信息准确 > 格式统一**\n\n- 搜索信息来源多样（arXiv、HuggingFace、GitHub、gist 等），格式不可能标准化\n- 主 Agent 直接执行搜索并整理结果，**确保数据完整性**\n- 子 Agent 负责分析/撰写/检查，主 Agent 负责解析和结构化\n\n**⚠️ 子Agent输出截断问题（Deep Reader阶段）**\n\n子Agent在执行过程中可能产生多轮输出。`sessions_spawn` 的 announce 机制可能**只截取其中某一轮的内容**。\n\n**应对措施**：\n1. **每篇论文一个独立 Deep Reader Agent**：减少单个 Agent 的输出量，降低截断概率\n2. **主Agent检测完整性**：收到子Agent结果后，检查内容是否明显不完整（如字数过少、没有核心方法描述）\n3. **主Agent兜底阅读**：如果检测到某篇论文分析不完整，主Agent自行下载并补充分析\n\n### Phase 1: 搜索（主Agent直接执行）\n\n**输入**: config.json + keywords.json\n**输出**: 主 Agent 直接写入 `.tmp/papers_raw.json`（轻量）或 `.tmp/deep_papers_raw.json`（深度）\n\n**执行方式**:\n```python\ndef run_search(focus_keywords, days=None, mode=\"light\"):\n    \"\"\"\n    主 Agent 直接执行搜索，不再通过 sessions_spawn 启动子 Agent。\n    v5.2.3 关键改进：搜索阶段从\"主次 fallback\"改为\"并行互补\"，\n    web_fetch 追新 + kimi_search 主题补充，结果合并去重，彻底避免遗漏。\n    \"\"\"\n    all_results = []\n    \n    # === 工具可用性检测（v5.2.3 保留）===\n    available_tools = {\"kimi_search\": False, \"web_fetch\": False, \"browser\": False}\n    \n    # 尝试 kimi_search（Kimi 平台特有）\n    try:\n        test_result = kimi_search(\"test query\")\n        available_tools[\"kimi_search\"] = True\n    except Exception:\n        available_tools[\"kimi_search\"] = False\n    \n    # 尝试 web_fetch（标准 OpenClaw 工具，最广泛可用）\n    try:\n        test_result = web_fetch(\"https://export.arxiv.org/api/query?search_query=all:test&max_results=1\")\n        available_tools[\"web_fetch\"] = True\n    except Exception:\n        available_tools[\"web_fetch\"] = False\n    \n    # 尝试 browser（部分环境可用）\n    try:\n        available_tools[\"browser\"] = available_tools[\"web_fetch\"]\n    except Exception:\n        available_tools[\"browser\"] = False\n    \n    print(f\"可用工具: kimi_search={available_tools['kimi_search']}, web_fetch={available_tools['web_fetch']}\")\n    \n    # === v5.2.3 核心改动：并行互补搜索，而非主次 fallback ===\n    # web_fetch 负责追新（arXiv API 按日期排序，时间精确，不漏最新论文）\n    # kimi_search 负责主题补充（找 GitHub、博客、HuggingFace 讨论等跨平台资源）\n    # 两套并行跑，结果合并去重\n    \n    for focus in focus_keywords:\n        # --- 分支 1: web_fetch 追新（只要可用，必跑）---\n        if available_tools[\"web_fetch\"]:\n            web_queries = generate_web_fetch_queries(focus, mode=mode)\n            for query in web_queries:\n                api_url = f\"https://export.arxiv.org/api/query?search_query={query}&sortBy=submittedDate&sortOrder=descending&max_results=50\"\n                raw = web_fetch(api_url)\n                results = parse_arxiv_api_results(raw)\n                all_results.extend(results)\n        \n        # --- 分支 2: kimi_search 主题补充（仅当可用时跑）---\n        if available_tools[\"kimi_search\"]:\n            kimi_queries = generate_kimi_search_queries(focus, mode=mode)\n            for query in kimi_queries:\n                results = kimi_search(query)\n                all_results.extend(results)\n    \n    # 去重、过滤黑名单、计算优先级\n    papers = deduplicate_and_rank(all_results)\n    \n    # 主 Agent 直接写入文件\n    save_json(f\".tmp/{'deep_' if mode == 'deep' else ''}papers_raw.json\", papers)\n    \n    return papers\n```\n\n**搜索策略**（主 Agent 参考 `agents/searcher_prompt.md`）:\n- **轻量模式**：按时间窗口搜索（过去 N 天），追新\n- **深度模式**：不限时间，按方法论/作者/引用链全面搜索\n- 关键词组合：research_focus + 自适应关键词 + 时间限定\n- 来源：\n  - **arXiv API**（主力追新，按提交日期排序）\n  - **HuggingFace Daily Papers（GitHub 镜像 JSON）**（核心 curated 数据源，与 arXiv 并列。社区 upvote 筛选 + star 数参考）\n  - **GitHub**（代码资源）\n\n**HF Daily Papers 数据源（v5.2.9 更新）**：\n\n本 Skill 通过 **GitHub 镜像 JSON** 获取 HuggingFace Daily Papers 的 curated 内容，替代直接访问 HF 官方 API。\n\n**数据源**：\n```\nhttps://raw.githubusercontent.com/AtharvaDomale/Daily-HuggingFace-AI-Papers/main/data/latest.json\n```\n\n**为什么用 GitHub 镜像？**\n- **稳定可靠**：GitHub raw content CDN 全球可用，不受 HF 网络封锁影响\n- **一次请求拿全量**：无需逐页翻，一次 `curl` 拉取最近几天的全部 curated 论文\n- **结构化数据**：JSON 格式，包含标题、摘要、作者、arXiv ID、HF star 数、GitHub 链接\n- **自动更新**：上游 repo 每日通过 GitHub Actions 自动同步\n\n**使用方法**：\n1. 搜索阶段通过 `exec \"curl ...\"` 拉取完整 JSON\n2. 本地按 `scraped_date` 筛选目标日期范围\n3. 对标题+摘要做关键词匹配，按研究方向过滤\n4. HF star 数高的论文优先保留（社区 curated 的高质量内容）\n5. 与 arXiv API 结果按 arXiv ID 合并去重\n\n**降级策略**（GitHub 镜像不可用时）：\n1. 尝试官方 HF API：`https://huggingface.co/api/daily_papers?date=YYYY-MM-DD`\n2. 如果官方 API 也不可用 → 执行 arXiv 补偿搜索（增加 4 组额外查询）\n3. 在搜索报告中明确标注数据源状态和降级原因\n\n**为什么这样设计？**\n- 主 Agent 直接调用 `kimi_search` 等工具，输出完全可控\n- 不需要担心 announce 截断——工具返回的结果在主 Agent 的上下文中\n- 搜索策略放在 `agents/searcher_prompt.md` 中作为参考，主 Agent 按需读取\n\n### Phase 2: 深度精读 (Deep Reader Agents — 并行)\n\n**输入**: 单篇论文 arXiv ID + 已有工作上下文\n**输出**: 子 Agent 在回复中输出分析 → 主 Agent 提取并保存为 `paper_analysis_{arxiv_id}.md`\n\n**任务定义**:\n```\n你是一名论文精读Agent。任务：\n1. 下载论文 arXiv HTML 实验版（完整无截断）\n2. 分段提取核心内容（方法、公式、实验数据）\n3. 数据三级验证（自检 → 交叉核对 → 标注验证级别）\n4. 在最终回复中一次性完整输出 Markdown 分析报告（不要写入文件）\n   ⚠️ 不要在中间轮次输出任何文本，只在最终轮输出完整分析\n```\n\n**调用方式**:\n```python\n# 主 Agent 并行启动多个 Deep Reader（每篇 P0 论文一个）\nreader_tasks = []\nfor paper in p0_papers[:3]:  # 最多精读3篇P0\n    task = sessions_spawn(\n        task=f\"精读论文 {paper['arxiv_id']}...\",\n        label=f\"HF-DeepReader-{paper['arxiv_id']}\",\n        runTimeoutSeconds=900  # 15 分钟\n    )\n    reader_tasks.append((paper['arxiv_id'], task))\n\n# 等待所有 completion events，检测完整性\nfor arxiv_id, task in reader_tasks:\n    content = extract_content_from_completion(task)\n    \n    # 检测是否完整\n    if not check_reader_completeness(content):\n        print(f\"警告：论文 {arxiv_id} 分析不完整，主Agent自行补充\")\n        content = perform_backup_reading(arxiv_id)\n    \n    save_file(f\".tmp/paper_analysis_{arxiv_id}.md\", content)\n```\n\n**并行策略**:\n- P0 论文：每篇一个独立 Deep Reader Agent（并行）\n- P1 论文：每篇一个 Agent（如果数量多，可分批）\n- P2/P3：不精读，仅记录基本信息\n\n**完整性检测**:\n```python\ndef check_reader_completeness(content: str) -> bool:\n    \"\"\"检测论文分析是否完整\"\"\"\n    if len(content) < 300:\n        return False  # 字数过少\n    if \"核心方法\" not in content and \"方法\" not in content:\n        return False  # 缺少方法描述\n    if \"实验\" not in content and \"结果\" not in content:\n        return False  # 缺少实验结果\n    return True\n```\n\n### Phase 3: 综合分析 (Analyst Agent)\n\n**输入**: 主 Agent 提供论文分析文件路径（或内容摘要）\n**输出**: 子 Agent 在回复中输出分析 → 主 Agent 提取并保存为 `analysis_summary.md`\n\n**任务定义**:\n```\n你是一名研究分析Agent。任务：\n1. 读取所有论文分析内容（主 Agent 会在任务描述中提供）\n2. 识别方法簇、分析趋势变化\n3. 评估对当前研究项目的潜在影响\n4. 在最终回复中一次性完整输出结构化分析（不要写入文件）\n```\n\n### Phase 4: 报告撰写 (Writer Agent)\n\n**输入**: 主 Agent 提供论文列表 + 分析内容 + 报告模板\n**输出**: 子 Agent 在回复中输出报告 → 主 Agent 提取并保存为报告文件\n\n**任务定义**:\n```\n你是一名报告撰写Agent。任务：\n1. 根据提供的论文列表和分析内容\n2. 按统一模板组织完整报告\n3. 在最终回复中一次性完整输出报告内容（不要写入文件）\n```\n\n### Phase 5: 质量检查 (Checker Agent)\n\n**输入**: 主 Agent 提供报告内容\n**输出**: 子 Agent 在回复中输出检查结果\n\n**检查清单**:\n```\n你是一名质量检查Agent。任务：对报告做独立质量审查。\n检查维度：内容完整性、数据准确性、研究观点、格式规范、去重\n在回复中直接输出检查结果（PASSED/FAILED + 问题清单）\n```\n\n## 执行流程（编排器逻辑）\n\n### 轻量扫描模式工作流\n\n```python\ndef run_light_scan(days=7):\n    # Step 1: 读取配置\n    config = load_config()\n    focus = config[\"user_profile\"][\"research_focus\"]\n    \n    # Step 1.5: 确认研究方向\n    if not focus or len(focus) == 0:\n        user_focus = ask_user(\"请确认你的研究方向（用逗号分隔）：\")\n        config[\"user_profile\"][\"research_focus\"] = [f.strip() for f in user_focus.split(\",\")]\n        save_config(config)\n        focus = config[\"user_profile\"][\"research_focus\"]\n    \n    # Step 2: 主 Agent 直接搜索（不再启动 Searcher 子 Agent）\n    papers = run_search(focus, days=days, mode=\"light\")\n    # papers 已自动保存到 .tmp/papers_raw.json\n    \n    # Step 3: 并行 Deep Readers（只读 top N）\n    p0_papers = [p for p in papers if p[\"priority\"] >= 0.8]\n    \n    reader_tasks = []\n    for paper in p0_papers[:3]:  # 最多精读3篇P0\n        task = sessions_spawn(\n            task=f\"精读论文 {paper['arxiv_id']}...\",\n            label=f\"HF-DeepReader-{paper['arxiv_id']}\",\n            runTimeoutSeconds=900\n        )\n        reader_tasks.append((paper['arxiv_id'], task))\n    \n    for arxiv_id, task in reader_tasks:\n        content = extract_content_from_completion(task)\n        if not check_reader_completeness(content):\n            content = perform_backup_reading(arxiv_id)\n        save_file(f\".tmp/paper_analysis_{arxiv_id}.md\", content)\n    \n    # Step 4: Analyst（趋势分析）\n    analyst = sessions_spawn(\n        task=\"分析趋势...\",\n        label=\"HF-Analyst\",\n        runTimeoutSeconds=600\n    )\n    analysis_content = extract_content_from_completion(analyst)\n    save_file(\".tmp/analysis_summary.md\", analysis_content)\n    \n    # Step 5: Writer（周报）\n    writer = sessions_spawn(\n        task=\"撰写周报...\",\n        label=\"HF-Writer\",\n        runTimeoutSeconds=900\n    )\n    report_content = extract_content_from_completion(writer)\n    \n    # Step 6: Checker（单一质检）\n    checker = sessions_spawn(\n        task=\"检查周报质量...\",\n        label=\"HF-Checker\",\n        runTimeoutSeconds=600\n    )\n    check_result = extract_content_from_completion(checker)\n    \n    # Step 7: 保存\n    save_report(report_content, template=\"report_template.md\", mode=\"light\")\n    \n    return report_content\n```\n\n### 深度调研模式工作流\n\n```python\ndef run_deep_research(research_topic, days=None):\n    \"\"\"\n    深度调研模式：全时间范围，多维度分析，迭代修订\n    \"\"\"\n    # Step 1: 读取配置与主题\n    config = load_config()\n    focus = config[\"user_profile\"][\"research_focus\"]\n    \n    # Step 2: 主 Agent 直接深度搜索（不再启动 Deep Searcher 子 Agent）\n    papers = run_search(\n        focus + [research_topic], \n        mode=\"deep\"\n    )\n    # papers 已自动保存到 .tmp/deep_papers_raw.json\n    \n    # Step 3: 并行 Deep Readers（所有重要工作）\n    milestone_papers = [p for p in papers if p.get(\"type\") == \"milestone\"]\n    improvement_papers = [p for p in papers if p.get(\"type\") == \"improvement\"]\n    \n    reader_tasks = []\n    # 所有 milestone 必须精读\n    for paper in milestone_papers:\n        task = sessions_spawn(\n            task=f\"精读里程碑论文 {paper['arxiv_id']}...\",\n            label=f\"HF-DeepReader-{paper['arxiv_id']}\",\n            runTimeoutSeconds=900\n        )\n        reader_tasks.append((paper['arxiv_id'], task))\n    # 重要的 improvement 也要精读\n    for paper in improvement_papers[:10]:\n        task = sessions_spawn(\n            task=f\"精读改进论文 {paper['arxiv_id']}...\",\n            label=f\"HF-DeepReader-{paper['arxiv_id']}\",\n            runTimeoutSeconds=900\n        )\n        reader_tasks.append((paper['arxiv_id'], task))\n    \n    for arxiv_id, task in reader_tasks:\n        content = extract_content_from_completion(task)\n        if not check_reader_completeness(content):\n            content = perform_backup_reading(arxiv_id)\n        save_file(f\".tmp/paper_analysis_{arxiv_id}.md\", content)\n    \n    # Step 4: 并行 Sub-Analysts（多维度分析）\n    benchmark_analyst = sessions_spawn(\n        task=\"分析该领域 Benchmark 现状与饱和度...\",\n        label=\"HF-SubAnalyst-Benchmark\",\n        runTimeoutSeconds=600\n    )\n    gap_analyst = sessions_spawn(\n        task=\"识别研究空白与可做方向...\",\n        label=\"HF-SubAnalyst-Gap\",\n        runTimeoutSeconds=600\n    )\n    code_analyst = sessions_spawn(\n        task=\"检查代码开源情况...\",\n        label=\"HF-SubAnalyst-Code\",\n        runTimeoutSeconds=600\n    )\n    authority_analyst = sessions_spawn(\n        task=\"验证论文权威性与引用准确性...\",\n        label=\"HF-SubAnalyst-Authority\",\n        runTimeoutSeconds=600\n    )\n    \n    benchmark_result = extract_content_from_completion(benchmark_analyst)\n    gap_result = extract_content_from_completion(gap_analyst)\n    code_result = extract_content_from_completion(code_analyst)\n    authority_result = extract_content_from_completion(authority_analyst)\n    \n    save_file(\".tmp/sub_benchmark.md\", benchmark_result)\n    save_file(\".tmp/sub_gap.md\", gap_result)\n    save_file(\".tmp/sub_code.md\", code_result)\n    save_file(\".tmp/sub_authority.md\", authority_result)\n    \n    # Step 5: Synthesis Analyst（综合整合）\n    synthesis = sessions_spawn(\n        task=\"整合所有子分析结果...\",\n        label=\"HF-Synthesis-Analyst\",\n        runTimeoutSeconds=600\n    )\n    synthesis_result = extract_content_from_completion(synthesis)\n    save_file(\".tmp/synthesis.md\", synthesis_result)\n    \n    # Step 6: Deep Writer（深度报告）\n    deep_writer = sessions_spawn(\n        task=\"撰写深度调研报告...\",\n        label=\"HF-DeepWriter\",\n        runTimeoutSeconds=1200\n    )\n    report_content = extract_content_from_completion(deep_writer)\n    \n    # Step 7: Multi-Checker（多维度质检）\n    multi_checker = sessions_spawn(\n        task=\"从14个核心维度+2个可选维度检查报告...\",\n        label=\"HF-MultiChecker\",\n        runTimeoutSeconds=600\n    )\n    check_result = extract_content_from_completion(multi_checker)\n    \n    # Step 8: 迭代修订（如需要）\n    revision_round = 0\n    max_revisions = 3\n    while \"FAILED\" in check_result and revision_round < max_revisions:\n        critical_issues = extract_critical_issues(check_result)\n        deep_writer = sessions_spawn(\n            task=f\"根据质检反馈修订报告...\",\n            label=f\"HF-DeepWriter-Revision-{revision_round}\",\n            runTimeoutSeconds=1200\n        )\n        report_content = extract_content_from_completion(deep_writer)\n        multi_checker = sessions_spawn(\n            task=\"重新检查修订后的报告...\",\n            label=f\"HF-MultiChecker-Revision-{revision_round}\",\n            runTimeoutSeconds=600\n        )\n        check_result = extract_content_from_completion(multi_checker)\n        revision_round += 1\n    \n    # Step 9: 保存最终报告\n    save_report(report_content, template=\"deep_report_template.md\", mode=\"deep\")\n    \n    return report_content\n```\n\n### 统一入口\n\n```python\ndef run_pipeline(user_request, days=None, research_topic=None):\n    mode = determine_mode(user_request, days)\n    \n    if mode == \"ask_user\":\n        mode = ask_user(\"您希望执行哪种模式？\\n1. 轻量扫描（周期性追踪，≤30天）\\n2. 深度调研（全面调研，>30天或不限时间）\")\n        mode = \"light\" if \"1\" in mode else \"deep\"\n    \n    if mode == \"light\":\n        return run_light_scan(days=days or 7)\n    else:\n        topic = research_topic or ask_user(\"请输入深度调研的主题/方向：\")\n        return run_deep_research(topic, days=days)\n```\n\n## 目录结构\n\n```\nhf-daily-deep-researcher/\n├── SKILL.md                          # 本文件（编排器定义）\n├── init.py                           # 初始化配置（从环境提取）\n├── config.json                       # 用户配置（动态生成）\n├── keywords.json                     # 关键词权重表\n├── adaptive.py                       # 关键词自适应模块\n├── report_manager.py                 # 报告保存、版本控制\n├── tracker.py                        # 编排器入口（读取配置，准备环境）\n│\n├── agents/                           # Agent 任务定义模板\n│   ├── searcher_prompt.md            # 搜索策略参考（主Agent直接执行时参考）\n│   ├── deep_reader_prompt.md         # Deep Reader Agent（精读单篇论文）\n│   ├── analyst_prompt.md             # Analyst Agent（趋势分析）\n│   ├── writer_prompt.md              # Writer Agent（周报撰写）\n│   ├── checker_prompt.md             # Checker Agent（单一质检）\n│   ├── sub_analyst_benchmark.md      # Sub-Analyst: Benchmark 现状\n│   ├── sub_analyst_gap.md            # Sub-Analyst: 研究空白\n│   ├── sub_analyst_code.md           # Sub-Analyst: 代码开源\n│   ├── sub_analyst_authority.md      # Sub-Analyst: 权威性验证\n│   ├── synthesis_analyst_prompt.md   # Synthesis Analyst（综合整合）\n│   ├── deep_writer_prompt.md         # Deep Writer Agent（深度报告）\n│   └── multi_checker_prompt.md       # Multi-Checker Agent（多维度质检）\n│\n├── templates/                        # 报告模板\n│   ├── report_template.md            # 轻量扫描报告模板（周报/月报）\n│   └── deep_report_template.md       # 深度调研报告模板\n│\n├── reports/                          # 输出报告（本地）\n├── history/                          # 扫描历史\n│   └── scan_history.json\n│\n└── .tmp/                             # 临时文件（Agent间传递）\n    ├── papers_raw.json               # 主Agent搜索输出（轻量）\n    ├── deep_papers_raw.json          # 主Agent搜索输出（深度）\n    ├── paper_analysis_*.md           # Deep Reader 输出\n    ├── analysis_summary.md           # Analyst 输出（轻量）\n    ├── sub_benchmark.md              # Sub-Analyst 输出\n    ├── sub_gap.md\n    ├── sub_code.md\n    ├── sub_authority.md\n    ├── synthesis.md                  # Synthesis Analyst 输出\n    └── check_result.md               # Checker 输出\n```\n\n## 快速开始\n\n### 1. 安装\n\n```bash\n# 从 ClawHub 安装\nopenclaw skills install @tomfoxxxx/hf-daily-deep-researcher\n```\n\n安装后，Skill 会出现在你的 workspace 的 `skills/` 目录下。\n\n---\n\n### 2. 研究方向是什么\n\n**研究方向 = 一个研究领域 + 一组相关关键词**\n\n每个方向不是单个关键词，而是一组相关概念的集合。系统会用这组关键词去搜索和追踪论文。\n\n**示例**：\n\n| 方向名称 | 包含的关键词 |\n|---------|-------------|\n| **Credit Assignment** | multi-agent credit assignment, hindsight credit, stepwise reward, turn-level advantage, process reward model, hierarchical credit |\n| **OPD** | token importance, OPD RL joint training, online preference distillation, preference optimization |\n| **多模态** | visual perception, image reasoning, multimodal understanding, multimodal agent, vision language model |\n\n你可以配置多个方向。每个方向独立追踪，也可以合并搜索。\n\n---\n\n### 3. 首次使用配置\n\n**方式一：对话触发（推荐）**\n\n直接在对话中对主 Agent 说：\n```\n运行 hf-daily-deep-researcher，扫描过去7天\n```\n\n主 Agent 会：\n1. 读取 `config.json`\n2. 如果 `research_focus` 为空（首次使用），**引导你配置研究方向**：\n   > \"请配置你的研究方向。每个方向需要一个名称和一组相关关键词。\"\n   > \n   > \"示例：\"\n   > \"- 方向1 'Credit Assignment'：multi-agent credit assignment, hindsight credit, stepwise reward...\"\n   > \"- 方向2 'OPD'：token importance, OPD RL joint training...\"\n   > \"- 方向3 '多模态'：visual perception, image reasoning...\"\n   > \n   > \"请输入你的方向（格式：方向名: 关键词1, 关键词2, 关键词3）\"\n3. 你回复后，主 Agent 自动保存配置，开始搜索\n\n**方式二：手动运行 init.py**\n\n```bash\npython3 ~/.openclaw/workspace/skills/hf-daily-deep-researcher/init.py\n```\n\n这会尝试从你的 `USER.md` / `MEMORY.md` 自动提取研究方向。如果提取不到，config.json 中的 `research_focus` 将为空，首次运行时主 Agent 仍会询问。\n\n**配置完成后**，后续运行直接读取 `config.json`，不再重复询问。\n\n**config.json 中的方向格式**：\n```json\n{\n  \"user_profile\": {\n    \"research_focus\": [\n      {\n        \"name\": \"Credit Assignment\",\n        \"keywords\": [\"multi-agent credit assignment\", \"hindsight credit\", \"stepwise reward\"]\n      },\n      {\n        \"name\": \"OPD\",\n        \"keywords\": [\"token importance\", \"OPD RL joint training\", \"online preference distillation\"]\n      }\n    ]\n  }\n}\n```\n\n---\n\n### 4. 运行方式\n\n配置多个方向后，有三种运行方式：\n\n**方式一：合并搜索（默认）**\n```\n运行 hf-daily-deep-researcher，扫描过去7天\n```\n所有方向的关键词合并去重，一次性搜索，生成一份综合报告。\n\n**方式二：指定方向**\n```\n运行 hf-daily-deep-researcher，扫描过去7天，方向：Credit Assignment\n```\n只取该方向的关键词集合搜索，生成该方向的独立报告。\n\n**方式三：每个方向单独生成报告**\n```\n运行 hf-daily-deep-researcher，扫描过去7天，每个方向单独生成报告\n```\n依次为每个方向独立运行完整工作流，最终产出多篇独立报告。\n\n---\n\n### 5. 深度调研\n\n```\n运行 hf-daily-deep-researcher，深度调研 Credit Assignment\n```\n主 Agent 自动判断为深度模式，全时间范围搜索该方向，产出深度调研报告。\n\n---\n\n### 6. 飞书文档输出\n\n本 Skill 支持将报告上传到飞书文档。**强烈建议安装飞书插件并关联飞书文档**，报告会自动上传到飞书，阅读体验远优于本地 Markdown。\n\n> 本地 Markdown 需要手动打开文件，无格式渲染、无目录导航、不便分享。飞书文档支持富文本、表格、协作评论和链接分享。\n\n**配置方式**：安装飞书插件后，在对话中授权关联飞书文档即可。首次配置需要完成 OAuth 授权，后续报告会自动上传。\n\n---\n\n### 7. 自动追踪（Cron）\n\n```json\n{\n  \"name\": \"hf-weekly-research\",\n  \"schedule\": {\n    \"kind\": \"cron\",\n    \"expr\": \"0 9 * * 1\",\n    \"tz\": \"Asia/Shanghai\"\n  },\n  \"payload\": {\n    \"kind\": \"agentTurn\",\n    \"message\": \"运行 hf-daily-deep-researcher skill，执行完整工作流：搜索过去7天论文，深度精读P0/P1，生成报告并检查质量。追踪领域从 config.json 读取。\"\n  },\n  \"sessionTarget\": \"isolated\",\n  \"delivery\": { \"mode\": \"announce\" }\n}\n```\n\n---\n## 关键设计决策\n\n### 为什么 Searcher 不用子 Agent？（v4.1.2 关键修复）\n\n`sessions_spawn` 的 announce 机制存在根本性问题：**它不保证能拿到子 Agent 的完整最终输出**。\n\n子 Agent 执行过程：thinking → toolCall → thinking → toolCall → 最终文本。announce 可能截取其中任意一轮，导致主 Agent 收到\"开始搜索...\"而非完整结果。\n\n**v4.1.2 之前**（v4.0.4-v4.1.1）的缓解措施：\n- 强化 Searcher Prompt 约束（要求最终轮一次性输出）\n- 主 Agent 完整性检测\n- 主 Agent 兜底搜索\n\n**问题**：这些只是\"缓解\"，不是\"解决\"。Searcher 子 Agent 仍然可能输出截断，主 Agent 兜底搜索是二次工作，效率低。\n\n**v4.1.2 的修复**：Searcher 阶段直接由主 Agent 执行。\n- 主 Agent 调用 `kimi_search` 等工具，结果在主 Agent 上下文中\n- 100% 避免截断问题\n- 不需要完整性检测和兜底搜索\n- 搜索策略（关键词组合、来源优先级）放在 `agents/searcher_prompt.md` 中供主 Agent 参考\n\n### 为什么 Deep Reader 仍然用子 Agent？\n\nDeep Reader 的情况不同：\n1. **每篇论文一个独立 Agent**：输出量可控（一篇论文的分析）\n2. **即使截断，主 Agent 可以检测并自行补充阅读**：单篇论文的阅读成本可控\n3. **独立上下文的价值**：论文精读需要大量 token 空间，独立 Agent 避免上下文被其他论文淹没\n4. **并行效率**：多篇论文可以并行精读\n\n## Multi-Agent 调度与超时策略\n\n### 核心原则：区分\"在干活\"与\"卡死\"\n\n子 Agent 超时不等于失败。可能是：\n- **正常慢**：论文下载慢、PDF 解析慢、长论文内容多\n- **网络问题**：arXiv 连接超时、工具调用失败\n- **真卡死**：陷入循环、遇到无法处理的输入\n\n**不应直接接管\"在干活\"的子 Agent**——会丢失中间成果。应采用**阶段性超时 + 弹性检测**策略。\n\n### 阶段性超时配置\n\n| 阶段 | 建议超时 | 理由 |\n|------|----------|------|\n| Phase 1 搜索 | 无（主Agent直接执行） | 无子Agent |\n| Phase 2 Deep Reader | **15 分钟** | 论文下载+精读，长论文需要 |\n| Phase 3 Analyst | **10 分钟** | 分析已有内容，不涉下载 |\n| Phase 4 Writer | **15-20 分钟** | 深度报告撰写量大 |\n| Phase 5 Checker | **10 分钟** | 检查报告，纯分析 |\n| 迭代修订 | **同 Writer** | 修订与撰写同量级 |\n\n**代码示例**：\n```python\n# Deep Reader — 论文精读，给充足时间\nsessions_spawn(\n    task=\"精读论文 arXiv:2605.25507...\",\n    label=\"HF-DeepReader-2605.25507\",\n    runTimeoutSeconds=900  # 15 分钟\n)\n\n# Deep Writer — 深度报告撰写\nsessions_spawn(\n    task=\"撰写深度调研报告...\",\n    label=\"HF-DeepWriter\",\n    runTimeoutSeconds=1200  # 20 分钟\n)\n```\n\n### 弹性超时：不直接接管\n\n**超时后的处理流程**：\n\n```python\ndef handle_subagent_timeout(task, expected_stage=\"deep_read\"):\n    \"\"\"\n    子Agent超时后的弹性处理\n    \"\"\"\n    # Step 1: 检查是否有部分输出\n    partial_output = check_partial_result(task)\n    \n    if partial_output and len(partial_output) > 500:\n        # 有实质性部分输出 → 标记为\"部分完成\"，不接管\n        print(f\"⚠️ 子Agent超时，但有{len(partial_output)}字部分输出，保留等待或延长超时\")\n        return {\"status\": \"partial\", \"content\": partial_output}\n    \n    # Step 2: 检查是否有进度汇报\n    progress = check_progress_report(task)\n    if progress and progress.get(\"stage\"):\n        print(f\"⏳ 子Agent进度: {progress['stage']}，延长超时\")\n        return {\"status\": \"extend\", \"progress\": progress}\n    \n    # Step 3: 真的卡死/无输出 → 主Agent兜底\n    print(f\"❌ 子Agent无实质性输出，主Agent接管\")\n    return {\"status\": \"fallback\", \"content\": perform_backup_task(expected_stage)}\n```\n\n**关键设计**：\n1. **有输出就不接管**：子 Agent 已产出部分分析，应回收而非丢弃\n2. **有进度就延长**：子 Agent 报告了进度（如\"已读完方法部分，正在提取实验数据\"），延长超时\n3. **完全无输出才兜底**：确认子 Agent 确实卡死，主 Agent 才接管\n\n### 子 Agent 进度汇报机制\n\n在子 Agent Prompt 中增加进度要求：\n\n```\n# 在 deep_reader_prompt.md / writer_prompt.md 等中增加：\n\n⚠️ 超时保护：本任务可能超时。为避免被主Agent误判为卡死：\n- 如果执行时间预计超过5分钟，在开始后2分钟输出一次进度汇报：\n  \"进度汇报：当前正在[具体阶段]，预计还需[X]分钟\"\n- 如果下载论文耗时较长，先输出：\"正在下载论文，请稍候...\"\n- 如果分析已部分完成（如方法已读完，实验待提取），输出：\n  \"进度汇报：已完成[已完成部分]，剩余[剩余部分]\"\n```\n\n### 分片策略：控制单 Agent 工作量\n\n避免单个 Agent 任务过重导致超时：\n\n| Agent 类型 | 单任务工作量 | 超时依据 |\n|-----------|-------------|---------|\n| Deep Reader | 1 篇论文 | 论文长度决定 |\n| Analyst | 3-5 篇论文分析 | 内容复杂度 |\n| Sub-Analyst | 单一维度（如仅Benchmark） | 分析范围可控 |\n| Writer | 完整报告 | 报告长度决定 |\n\n**原则**：宁可多启动几个 Agent（并行），也不把太多工作塞进一个 Agent。\n\n### 工具依赖与跨平台适配（v5.2.0/5.2.1 重要更新）\n\n本 Skill 设计目标是**在任何标准 OpenClaw 环境中都能正常运行**，不依赖特定平台的专属工具。\n\n#### 核心原则：运行时检测 + 并行互补（v5.2.3 修正）\n\n**v5.2.0 之前的问题**：默认假设 `kimi_search` 一定存在。在非 Kimi 平台中，这些工具直接不存在，导致 Skill 无法运行。\n\n**v5.2.0 的修复**：主 Agent 在搜索阶段**先检测当前环境有哪些工具可用**，然后选择最优工具链。\n\n**v5.2.3 的改进**：从\"主次 fallback\"升级为\"并行互补\"。\n- **实验发现**：`kimi_search` 在\"追新\"方面存在系统性遗漏（日期过滤失效），而 `web_fetch`（arXiv API）在时间精确度上显著更优\n- **新策略**：\n  - **web_fetch 追新**：arXiv API 按 `submittedDate` 排序，时间精确，不漏最新论文\n  - **kimi_search 主题补充**：找 GitHub、博客、HuggingFace 讨论等跨平台资源\n  - **两套并行跑，结果合并去重**\n\n#### 工具链职责分工（v5.2.3）\n\n| 工具 | 职责 | 适用平台 | 搜索能力 | 获取论文能力 |\n|--------|------|----------|----------|-------------|\n| **web_fetch** | **追新主力**（必跑） | 任何 OpenClaw | 中（arXiv API 按日期排序） | 中（arXiv API / arXiv HTML） |\n| **kimi_search** | **主题补充**（可选） | Kimi/OpenClaw | 强（语义搜索） | 强（直接获取 HTML） |\n| **browser** | 兜底 | 部分环境 | 弱（页面抓取） | 弱（页面渲染） |\n\n**最低要求**：`web_fetch` 必须可用。如果 `web_fetch` 和 `kimi_search` 都没有，Skill 会报错并提示用户。\n\n#### 各平台预期表现\n\n| 平台 | web_fetch | kimi_search | browser | Skill 可用性 |\n|------|-----------|-------------|---------|-------------|\n| **Kimi/OpenClaw** | ✅ | ✅ | ✅ | 完整功能（双轨并行） |\n| **开源 OpenClaw** | ✅ | ❌ | 视配置 | 核心功能正常（web_fetch 单轨） |\n| **Claude Code** | ✅ | ❌ | ✅ | 核心功能正常（web_fetch 单轨） |\n| **CodeX** | ✅ | ❌ | 视配置 | 核心功能正常（web_fetch 单轨） |\n\n#### web_fetch 方案详述（跨平台主力 + 追新主力）\n\n**搜索论文**：\n```python\n# arXiv API（Atom XML 格式）\nweb_fetch(\"https://export.arxiv.org/api/query?search_query=all:KEYWORD&sortBy=submittedDate&sortOrder=descending&max_results=50\")\n\n# HuggingFace Daily Papers\nweb_fetch(\"https://huggingface.co/papers?date=YYYY-MM-DD\")\n```\n\n**获取论文全文**：\n```python\n# arXiv 原生 HTML（最可靠的全文获取方式）\nweb_fetch(\"https://arxiv.org/html/2606.XXXXX\")\n\n# arXiv 抽象页（备用）\nweb_fetch(\"https://arxiv.org/abs/2606.XXXXX\")\n```\n\n**解析要求**：主 Agent 需要能解析 arXiv API 返回的 Atom XML（提取 title, summary, author, published, id），以及 arXiv HTML（提取论文正文）。\n\n#### kimi_search 方案详述（主题补充）\n\n当 kimi_search 可用时，作为**补充轨道**并行运行：\n\n**搜索职责**：\n- 找 arXiv 之外的资源（GitHub 仓库、技术博客、HuggingFace 讨论）\n- 语义搜索发现标题/摘要中未直接出现关键词的相关论文\n- 验证 web_fetch 找到的论文的社区讨论热度\n\n**不承担的职责**：\n- 不作为\"追新\"的唯一来源（日期过滤不可靠）\n- 不替代 web_fetch 的 arXiv API 搜索\n\n#### 错误处理\n\n每个阶段：\n1. **Phase 1（搜索）**：\n   - web_fetch 轨道：始终执行（只要可用），负责追新\n   - kimi_search 轨道：并行执行（如果可用），负责主题补充\n   - 两套结果合并去重，确保不遗漏\n2. **Phase 2（精读）**：子 Agent 的 Deep Reader Prompt 中已包含工具检测逻辑（见 `deep_reader_prompt.md`）。优先尝试 `web_fetch` → `kimi_fetch` → `browser`。\n3. **Phase 3-5**：不直接依赖搜索工具，正常执行。\n4. **飞书上传**：`feishu_create_doc` 是可选功能。如果不可用，报告保存到本地 `reports/` 目录。\n\n## 版本历史\n- **v5.2.9** (2026-08-25): **HF 数据源重构 — GitHub 镜像替代直接 API**。解决 HF 官方 API 在网络受限环境中的可用性问题：\n  - 将 HF Daily Papers 数据源从直接访问 `huggingface.co/api/daily_papers` 改为 **GitHub 镜像 JSON**（`raw.githubusercontent.com/AtharvaDomale/Daily-HuggingFace-AI-Papers/main/data/latest.json`）\n  - 新增 `exec`（curl）工具链支持，一次请求拉取全量 curated 论文数据\n  - searcher_prompt.md: 重写 HF 数据源获取逻辑（A4 步骤），增加 JSON 解析和关键词过滤说明\n  - deep_searcher_prompt.md: 更新工具检测和自检清单，GitHub 镜像作为可选补充\n  - SKILL.md: 重写 HF Daily Papers 数据源说明，移除网络可用性警告，改为 GitHub 镜像使用指南\n  - 所有文件版本号统一为 5.2.9\n\n- **v5.2.8** (2026-08-06): **深度调研模式增强**。提升深度调研的广度和报告质量：\n  - deep_searcher_prompt.md: 搜索查询从 12 组增加到**强制 15 组**，新增引用链扩展搜索和关键作者追踪\n  - deep_reader_prompt.md: milestone 论文超时延长至 **25 分钟**，新增引用关系分析（依赖工作/技术路线位置）\n  - deep_report_template.md: 新增技术演进时间线、饱和度分级（🔴🟡🟢🔵）、方法簇覆盖度矩阵\n  - sub_analyst_benchmark.md: 新增方法×Benchmark 交叉覆盖分析、时间维度饱和度趋势\n  - sub_analyst_gap.md: 新增基于饱和度的方向推荐、方法簇覆盖度矩阵\n  - 所有文件版本号统一为 5.2.8\n\n- **v5.2.7** (2026-08-06): **P0 质量修复 + 隐私清理**。修复搜索覆盖不足和数据验证缺失问题：\n  - searcher_prompt.md: 8 组 arXiv + 6 组 kimi_search 从\"建议\"升级为**强制下限**\n  - deep_reader_prompt.md: 每个实验数据强制标注 [V]/[C]/[U] 验证级别\n  - writer_prompt.md: 每篇 P0/P1 论文强制列出 benchmark 名称和具体分数\n  - checker_prompt.md: 新增阻塞性问题定义（未标注验证级别 = FAILED）\n  - dist 去隐私化清理：name=\"User\", research_focus=[], folder_token=\"\"\n  - 所有文件版本号统一为 5.2.7\n\n- **v5.2.5** (2026-08-05): **网络诊断增强 + 质量改进**。解决 HuggingFace 在中国大陆网络环境被 DNS 污染 + SNI 阻断的问题：\n  - searcher_prompt.md 增加 HF 可用性检测和网络诊断逻辑\n  - SKILL.md 增加 HF API 网络可用性说明和用户解决方案\n  - config.json 增加 `network.proxy` 配置段，支持用户配置代理\n  - multi_checker_prompt.md 增加历史已知问题检查点（3SPO 数据错误、ARPO ID 错误、模型规模混用等）\n  - deep_writer_prompt.md 强化数据验证标准和历史教训\n  - 所有文件版本号统一为 5.2.5\n\n- **v5.2.3** (2026-08-04): **搜索策略重要修正**。从\"主次 fallback\"升级为\"并行互补\"：\n  - web_fetch（arXiv API）提升为**追新主力**，始终执行\n  - kimi_search 降级为**主题补充**，并行运行但不承担追新主责\n  - 实验数据支撑：7/29 对比实验中，kimi_search 只找到 1 篇 7 月论文，web_fetch 找到 7 篇，两方案零交集\n  - 彻底避免 kimi_search 日期过滤失效导致的信息遗漏\n\n- **v5.2.0** (2026-07-29): **跨平台兼容性重大改进**。解决 Skill 在非 Kimi 平台（开源 OpenClaw、Claude Code、CodeX）无法运行的问题：\n  - 搜索阶段增加运行时工具可用性检测（kimi_search → web_fetch → browser），不再假设 kimi_search 一定存在\n  - web_fetch + arXiv API 被提升为跨平台主力方案，详细文档化\n  - 各 Prompt 文件（searcher/deep_reader/deep_searcher）统一更新工具选择逻辑\n  - 明确最低要求：web_fetch 或 kimi_search 至少一个可用\n  - 新增平台兼容性矩阵（Kimi/开源 OpenClaw/Claude Code/CodeX）\n\n- **v5.1.2** (2026-07-24): 简化首次配置体验。飞书文档输出说明精简为\"安装飞书插件并关联飞书文档\"。多方向概念重新梳理：`research_focus` 是多个研究方向的列表，每个方向是一组相关关键词的集合，支持指定方向运行和批量生成所有方向的独立报告。\n\n- **v5.1.1** (2026-07-24): 新增 Multi-Agent 调度与超时策略章节。明确阶段性超时配置（Deep Reader 15min / Writer 20min）。增加弹性超时处理：超时后不直接接管，先检查部分输出和进度汇报。完善首次使用配置流程：对话触发 → 自动询问研究方向 → 保存配置 → 后续直接读取。所有子 Agent 调用示例补充 `runTimeoutSeconds` 参数。\n\n- **v5.1.0** (2026-07-24): 全局版本号统一（SKILL.md / tracker.py / prompt / checklist / _meta.json / skill-card）。补全版本历史记录。清理 checklist.md 硬编码文档ID。修复 deep_writer_prompt / multi_checker_prompt 版本标注滞后。清理 ClawHub 分发包个人报告残留。\n\n- **v5.0.0** (2026-07-18): 用户工作状态同步（留在华为）。云盘归档完成。Skill 本地/远程版本同步流程建立。_meta.json 和 skill-card.md 版本更新。\n- **v4.5.0** (2026-07-14): 强化质检体系。Multi-Checker 从 8 维扩展到 14 维核心 + 2 维可选维度，新增：技术洞察力、未来预判合理性、实操路径可行性、数学与理论严谨性、数据效率分析、组合矩阵覆盖度。新增独立 `agents/checklist.md` 文件供人工复核。修复安全规范强化：禁止空头承诺，唯一可靠路线为下载→本地修复→overwrite覆盖。\n\n- **v4.1.2** (2026-07-03): **关键修复**：Searcher 阶段不再通过 `sessions_spawn` 启动子 Agent，改由主 Agent 直接执行搜索。彻底解决了子 Agent 输出截断导致的搜索结果不完整问题。Deep Reader 仍保留子 Agent，但每篇论文独立一个 Agent，并增加主 Agent 完整性检测与兜底阅读机制。\n- **v4.1.1** (2026-07-02): ClawHub 发布版。修复工具引用一致性（deep_reader_prompt.md curl→browser/web_fetch）、版本号统一、移除未实现参数提示、分发包清理。\n- **v4.1.0** (2026-06-30): 新增深度调研模式（Deep Research）。支持双模式自动判断。深度模式新增：Deep Searcher、4个并行 Sub-Analysts、Synthesis Analyst、Deep Writer、Multi-Checker、迭代修订。\n- **v4.0.8** (2026-06-30): 清理默认配置残留。config.json folder_token 置空，keywords.json 默认清空，面向多用户分发优化。\n- **v4.0.7** (2026-06-30): Deep Reader prompt 修正全文获取方案。Searcher 跨平台工具链明确优先级。\n- **v4.0.6** (2026-06-30): 首次运行研究方向确认流程。\n- **v4.0.5** (2026-06-30): 增加跨平台搜索工具适配。Searcher Prompt 支持三级降级。\n- **v4.0.4** (2026-06-30): 修复子Agent输出截断问题（缓解措施：Prompt约束+完整性检测+兜底搜索）。\n- **v4.0.3** (2026-06-29): 修正设计理念：信息准确 > 格式统一。\n- **v4.0.2** (2026-06-29): 修复子 Agent 输出格式不稳定问题。\n- **v4.0.0** (2026-06-29): 重写为多Agent编排架构。\n- **v3.1.0** (2026-06-28): 新增报告管理模块，动态配置初始化\n- **v3.0.1** (2026-06-27): 数据验证机制，修正 cron 配置\n- **v3.0.0** (2026-06-27): 完善联动体系\n- **v2.0.0** (2026-06-27): 新增深度精读方法论\n- **v1.0.0** (2026-06-27): 初始版本\n\nFile v5.2.9:_meta.json\n\n{\n  \"ownerId\": \"kn78wj2tfjmqfd3jq5mrrwz4yh89sgkh\",\n  \"slug\": \"hf-daily-deep-researcher\",\n  \"version\": \"5.2.9\",\n  \"publishedAt\": 1787739266890\n}\n\nFile v5.2.9:agents/analyst_prompt.md\n\n# Analyst Agent 任务定义\n\n## 角色\n你是一名研究方向分析Agent。你的任务是分析论文间的关联、识别技术趋势、评估对用户项目的影响，**输出结构化 Markdown 分析报告**。\n\n## 重要约束（⚠️ 致命）\n1. **不要写入文件系统**。环境隔离导致子 Agent 无法写入主 Agent 的文件系统。\n2. **你必须在回复消息中直接输出完整的 Markdown 分析**。这是你的唯一输出方式。\n3. **输出格式必须是结构化 Markdown**，不是散文、不是列表、不是要点。必须包含指定的章节结构。\n\n## 输入\n- 多个论文分析文件（主 Agent 在任务描述中提供内容摘要）\n- 当前研究焦点（从 config.json 获取）\n\n## 分析维度\n\n### 1. 论文间关联分析\n- 技术路线关联（哪些论文是同一方向的不同方法）\n- 互补性分析（哪些论文可以组合使用）\n- 竞争关系（哪些论文解决同一问题但方法不同）\n- 演进关系（哪些论文是后续工作，改进了什么）\n\n### 2. 技术趋势识别\n- 本期出现的新概念/新框架\n- 方法演进方向（从粗粒度到细粒度？从单一到多源？）\n- 实验基准变化（新 benchmark？新评估指标？）\n- 与上一期相比，哪些方向变热了/变冷了\n\n### 3. 对用户项目的具体影响\n- 哪些方法可以直接复用？\n- 哪些思路可以借鉴？\n- 哪些陷阱需要避免？\n- 推荐的实验顺序\n\n### 4. 研究方向建议\n- 短期（1-2周）可以尝试什么？\n- 中期（1-2个月）可以探索什么？\n- 长期（3-6个月）可以布局什么？\n\n## 输出格式（⚠️ 必须严格遵循）\n\n在回复中**直接输出**以下格式的 Markdown 分析（不要加任何其他文字、不要解释）：\n\n```markdown\n# 分析摘要\n\n## 核心结论速览\n| 维度 | 判断 |\n|---|---|\n| **本期主线** | ... |\n| **关键洞察** | ... |\n| **对当前项目的直接影响** | ... |\n| **最大风险** | ... |\n\n## 1. 论文间关联分析\n\n### 1.1 技术路线定位\n{用文本或 Mermaid 描述论文间关系}\n\n### 1.2 互补性\n| 论文 | 解决的核心问题 | 提供的关键组件 | 与另一篇的互补 |\n|---|---|---|---|\n\n### 1.3 竞争关系\n{分析}\n\n## 2. 技术趋势识别\n\n### 2.1 本期新概念\n| 概念 | 来源 | 核心含义 |\n\n### 2.2 方法演进方向\n{分析，不是罗列}\n\n## 3. 对当前研究项目的具体影响\n\n### 3.1 直接可借鉴的技术\n| 技术点 | 来源 | 适用性评估 |\n\n### 3.2 需要重新评估的设计选择\n{分析}\n\n## 4. 推荐方向\n\n### 4.1 短期（1-2周）\n- {建议1}\n\n### 4.2 中期（1-2月）\n- {建议2}\n\n### 4.3 长期（3-6月）\n- {建议3}\n\n## 5. 风险信号\n\n### 5.1 竞争风险\n{分析}\n\n### 5.2 技术风险\n{分析}\n\n### 5.3 方向风险\n{分析}\n```\n\n**输出格式要求**：\n- 必须包含上述所有章节（核心结论速览、论文间关联分析、技术趋势识别、对当前项目的具体影响、推荐方向、风险信号）\n- 核心结论速览必须包含表格\n- 分析要有自己的判断，不能只是罗列论文\n- 评估要具体，避免泛泛而谈\n- 如果某篇论文信息不足，明确标注「信息不足，无法评估」\n- 不要在 Markdown 前后添加任何解释文字\n\n## 输出验证（自检）\n\n在回复前，请检查：\n- [ ] 输出是 Markdown 格式，不是散文或列表\n- [ ] 包含所有指定章节\n- [ ] 核心结论速览包含表格\n- [ ] 分析有自己的判断，不是简单罗列\n- [ ] 没有 Markdown 以外的解释文字\n\n## 常见陷阱\n- 不要简单罗列论文，要有自己的分析观点\n- 评估要具体，避免泛泛而谈\n- **不要尝试写入文件系统，直接输出 Markdown 到回复**\n- **不要在 Markdown 前后添加任何解释文字**\n\nFile v5.2.9:agents/checker_prompt.md\n\n# Checker Agent 任务定义\n\n## 角色\n你是一名质量检查Agent。你的任务是对论文追踪报告做独立质量审查，输出结构化的检查结果。\n\n## 重要约束（⚠️ 致命）\n1. **不要写入文件系统**。环境隔离导致子 Agent 无法写入主 Agent 的文件系统。\n2. **你必须在回复消息中直接输出结构化的检查结果**。这是你的唯一输出方式。\n3. **输出格式必须是结构化 Markdown**，不是散文、不是要点列表。必须包含检查表格和评级。\n\n## 检查维度\n\n### 1. 内容完整性\n- [ ] 报告是否覆盖了所有论文？（P0、P1、P2 都必须在正文中有分析）\n- [ ] P0 论文是否有至少 300 字的详细分析？\n- [ ] P1 论文是否有至少 150 字的分析？\n- [ ] P2 论文是否有至少 100 字的分析？\n- [ ] 执行摘要、统计、趋势分析、项目影响、新方向、数据声明、去重附录是否齐全？\n\n### 2. 数据准确性\n- [ ] arXiv ID 是否正确？\n- [ ] 日期是否正确？\n- [ ] 性能数字是否与输入数据一致？\n- [ ] 作者/机构信息是否正确？\n- [ ] 是否有免责声明？\n\n### 3. 数据验证级别检查（v5.2.6 新增 — P0 质量修复）\n- [ ] **每个性能数字是否标注了 [V]/[C]/[U]？** 未标注 = 阻塞性问题\n- [ ] P0 论文的关键数据是否有至少一个 [V]（已验证）？\n- [ ] 是否存在大量 [U]（未验证）数据却未注明\"建议人工复核\"？\n- [ ] 验证级别与来源说明是否匹配？（如标记 [V] 但来源是\"搜索结果片段\" → 矛盾）\n\n### 4. Benchmark 引用检查（v5.2.6 新增 — P0 质量修复）\n- [ ] **每篇 P0 论文是否列出了具体的 benchmark 名称？**（如 WebShop、ALFWorld）\n- [ ] **是否列出了关键指标的具体分数？**（如 64.5% / 72.3%）\n- [ ] **是否说明了与 strongest baseline 的对比？**\n- [ ] 是否存在\"在多个 benchmark 上测试\"但不列名称的模糊表述？\n\n### 5. 搜索覆盖检查（v5.2.6 新增 — P0 质量修复）\n- [ ] **搜索说明中是否报告了 web_fetch 查询数？** 是否达到 8 组？\n- [ ] **kimi_search 查询数是否达到 6 组**（如果 kimi_search 可用）？\n- [ ] 如果查询数不足，是否标记了 [ERROR: 搜索覆盖不足]？\n- [ ] HF API 状态是否明确报告？\n\n### 6. 研究观点质量\n- [ ] 分析是否有洞察力？不是简单罗列\n- [ ] 是否有自己的判断？不是\"论文A做了X，论文B做了Y\"\n- [ ] 趋势分析是否提炼了共同主题？\n- [ ] 对当前项目的影响是否具体可操作？\n\n### 7. 格式规范\n- [ ] Markdown 格式是否正确？\n- [ ] 表格是否对齐？\n- [ ] 标题层级是否正确？\n- [ ] 超链接格式是否正确？\n\n### 8. 去重声明\n- [ ] 是否检查了与往期报告的重叠？\n- [ ] 新论文是否明确标记？\n- [ ] 疑似重复是否标注？\n\n## 阻塞性问题定义（v5.2.6 更新）\n\n以下问题任一出现，总体评级必须为 **FAILED**：\n\n1. **P0 论文零分析**或分析少于 300 字\n2. **P1 论文一句话概括**（少于 150 字实质性分析）\n3. **性能数字未标注 [V]/[C]/[U]**（即使只有一个数字遗漏也算）\n4. **P0 论文未列出具体 benchmark 名称和分数**\n5. **搜索覆盖严重不足**（web_fetch < 8 组 或 kimi_search < 6 组且未标记 ERROR）\n6. **§9 去重对比附录完全缺失**\n\n## 输出格式（⚠️ 必须严格遵循）\n\n在回复中**直接输出**以下格式的 Markdown 检查结果（不要加任何其他文字、不要解释）：\n\n```markdown\n## 质量检查报告\n\n### 总体评级: {PASSED / CONDITIONAL / FAILED}\n\n### 1. 内容完整性 — {✅/⚠️/❌}\n\n| 检查项 | 状态 | 说明 |\n|--------|------|------|\n| P0论文深度分析 | ... | ... |\n| P1论文分析 | ... | ... |\n| P2论文分析 | ... | ... |\n| 结构完整性 | ... | ... |\n\n### 2. 数据准确性 — {✅/⚠️/❌}\n\n| 检查项 | 状态 | 说明 |\n|--------|------|------|\n| arXiv ID | ... | ... |\n| 日期信息 | ... | ... |\n| 性能数字 | ... | ... |\n| 机构信息 | ... | ... |\n| 代码链接 | ... | ... |\n\n### 3. 数据验证级别 — {✅/⚠️/❌}\n\n| 检查项 | 状态 | 说明 |\n|--------|------|------|\n| 所有数字标注 [V]/[C]/[U] | ... | ... |\n| P0 有关键数据 [V] | ... | ... |\n| [U] 数据有复核提示 | ... | ... |\n| 级别与来源匹配 | ... | ... |\n\n### 4. Benchmark 引用 — {✅/⚠️/❌}\n\n| 检查项 | 状态 | 说明 |\n|--------|------|------|\n| P0 有具体 benchmark 名称 | ... | ... |\n| P0 有具体分数 | ... | ... |\n| 有 baseline 对比 | ... | ... |\n| 无模糊表述 | ... | ... |\n\n### 5. 搜索覆盖 — {✅/⚠️/❌}\n\n| 检查项 | 状态 | 说明 |\n|--------|------|------|\n| web_fetch >= 8 组 | ... | ... |\n| kimi_search >= 6 组（如可用） | ... | ... |\n| 不足时有 ERROR 标记 | ... | ... |\n| HF 状态已报告 | ... | ... |\n\n### 6. 研究观点质量 — {✅/⚠️/❌}\n\n**亮点：**\n- ...\n\n**不足：**\n- ...\n\n### 7. 格式规范 — {✅/⚠️/❌}\n\n| 检查项 | 状态 | 说明 |\n|--------|------|------|\n| Markdown标题层级 | ... | ... |\n| 表格格式 | ... | ... |\n| 超链接 | ... | ... |\n| 强调与标记 | ... | ... |\n\n### 8. 去重声明 — {✅/⚠️/❌}\n\n| 检查项 | 状态 | 说明 |\n|--------|------|------|\n| 去重章节存在 | ... | ... |\n| 新论文标记 | ... | ... |\n| 疑似重复标记 | ... | ... |\n\n### 阻塞性问题清单\n\n| # | 问题 | 严重度 |\n|---|------|--------|\n| 1 | ... | FAILED / CONDITIONAL |\n\n### 总结\n\n| 维度 | 评级 | 关键问题 |\n|------|------|----------|\n| 内容完整性 | ... | ... |\n| 数据准确性 | ... | ... |\n| 数据验证级别 | ... | ... |\n| Benchmark 引用 | ... | ... |\n| 搜索覆盖 | ... | ... |\n| 研究观点质量 | ... | ... |\n| 格式规范 | ... | ... |\n| 去重声明 | ... | ... |\n\n**阻塞性问题**：{如有，列出}\n**建议改进**：{如有，列出}\n```\n\n**输出格式要求**：\n- 必须包含所有 8 个检查维度\n- 每个维度必须有状态评级（✅/⚠️/❌）\n- 总体评级必须是 PASSED / CONDITIONAL / FAILED 之一\n- 如果有阻塞性问题，必须明确指出\n- 不要在 Markdown 前后添加任何解释文字\n\n## 输出验证（自检）\n\n在回复前，请检查：\n- [ ] 输出是 Markdown 格式，不是散文\n- [ ] 包含所有 8 个检查维度\n- [ ] 总体评级明确（PASSED/CONDITIONAL/FAILED）\n- [ ] 阻塞性问题（如有）已明确指出\n- [ ] 没有 Markdown 以外的解释文字\n\n## 常见陷阱\n- P2 论文零分析是常见阻塞性问题，必须检查\n- P1 论文一句话概括是常见问题，必须检查\n- 研究趋势只是罗列论文是常见问题，必须检查\n- **数字未标注 [V]/[C]/[U] 是阻塞性问题，必须检查**\n- **P0 论文未列 benchmark 名称和分数是阻塞性问题，必须检查**\n- **搜索覆盖不足（web_fetch < 8 组）是阻塞性问题，必须检查**\n- **不要尝试写入文件系统，直接输出 Markdown 到回复**\n- **不要在 Markdown 前后添加任何解释文字**\n\nFile v5.2.9:agents/checklist.md\n\n# 深度调研报告检查清单 v2.0\n\n## 检查日期：（运行当天）\n## 适用文档：深度调研报告\n## 文档ID：（当前报告文档ID）\n\n---\n\n## 检查维度（14维核心 + 2维可选）\n\n### 基础质量（8维）\n\n#### 1. 版本一致性\n- [ ] 标题/正文/底部版本号一致\n- [ ] 生成日期与最后更新日期合理\n- [ ] 版本号与内容同步（内容刷新时版本号自动更新）\n\n#### 2. 章节结构\n- [ ] 编号连续无重复（如 4.1→4.15）\n- [ ] 标题层级正确（无跳级）\n- [ ] 目录与内容对应\n- [ ] 修改编号后检查连锁反应\n\n#### 3. 数据准确性\n- [ ] 每个实验数字可溯源（论文+模型规模）\n- [ ] 相对提升计算正确（差值=绝对值差，百分比=相对基线）\n- [ ] 不同模型规模数据不混用（标注1.5B/7B）\n- [ ] 无\"来源待确认\"的未确认数据\n- [ ] 验证方法：从头到尾读一遍、验证一遍\n\n#### 4. arXiv ID 与引用\n- [ ] 所有ID准确可验证\n- [ ] 无xxxxx占位符\n- [ ] 引用格式统一（作者+年份/会议）\n- [ ] 反向查找来源论文确认\n\n#### 5. 内容逻辑\n- [ ] 无重复内容（交叉引用替代重复）\n- [ ] 判断有依据（标注引用来源）\n- [ ] 分析与数据一致\n- [ ] 结论有证据支撑，章节间无矛盾\n\n#### 6. 表格完整性\n- [ ] 表格有来源说明（论文Table X）\n- [ ] 表格数据与正文一致\n- [ ] 无断裂/碎片表格\n- [ ] 表头与内容对应\n\n#### 7. 附录与修复记录\n- [ ] 修复记录表完整（日期+版本+内容+严重程度）\n- [ ] 新增论文有记录\n- [ ] 版本变更历史清晰\n\n#### 8. 可读性\n- [ ] 格式统一（Markdown/飞书格式）\n- [ ] 无孤立代码块/碎片\n- [ ] 术语使用一致\n- [ ] 行文流畅、逻辑清晰\n\n### 深度质量（6维）\n\n#### 9. 技术洞察力\n- [ ] 不是简单罗列，有真正分析\n- [ ] 对方法优劣的判断尖锐，无\"it depends\"式敷衍\n- [ ] 有反直觉发现\n- [ ] 批判性分析充分（讲局限和适用场景）\n- [ ] 各方法论章节多cue benchmark\n\n#### 10. 未来预判合理性\n- [ ] 趋势预测有数据/文献支撑，非主观臆断\n- [ ] 方向饱和度判断基于最新数据\n- [ ] 预判具体（时间线、证据链），非泛泛而谈\n- [ ] \"下一个突破点\"预测有逻辑推导\n\n#### 11. 实操路径可行性\n- [ ] 建议具体可执行（非空泛）\n- [ ] 有清晰的\"第一步、第二步、第三步\"\n- [ ] 资源需求（算力、数据、人力）估计合理\n- [ ] 考虑执行风险和Plan B\n\n#### 12. 数学与理论严谨性\n- [ ] 公式推导正确\n- [ ] 方差分析、收敛性讨论准确\n- [ ] 理论保证假设条件明确\n- [ ] 近似/启发式方法标注适用范围\n- [ ] 符号使用一致\n\n#### 13. 数据效率分析\n- [ ] 样本效率对比完整\n- [ ] 计算成本（FLOPs、训练时间、GPU小时）标注\n- [ ] 与基线的方法效率差异量化\n- [ ] 扩展性分析（随horizon/agent数增长的成本变化）\n\n#### 14. 组合矩阵覆盖度\n- [ ] 方法×Benchmark交叉覆盖无遗漏\n- [ ] 每个方法覆盖足够benchmark展示优势\n- [ ] 每个benchmark被足够方法测试\n- [ ] 无\"只在容易benchmark上测试\"的偏置\n\n### 可选维度（2维）\n\n#### 15. 反向可检索性\n- [ ] 从论文标题能快速定位到报告对应章节\n- [ ] 关键论文引用在正文中被充分讨论\n\n#### 16. 饱和度判断时效性\n- [ ] 各benchmark饱和状态基于最新数据\n- [ ] 新发布benchmark已纳入\n- [ ] SOTA数据最新（截至报告生成日期）\n\n---\n\n## 检查方法\n\n1. **数据验证**：对每个实验数字，反向查找来源论文的对应表格，手动重新计算验证\n2. **计算验证**：对相对提升百分比，手动重新计算\n3. **交叉引用**：对重复内容，确认已改为交叉引用\n4. **全文搜索**：对占位符（xxxxx）、来源待确认等关键词全文搜索\n5. **深度阅读**：对技术洞察维度，通读判断是否有独到见解还是堆砌\n6. **矩阵验证**：对组合矩阵覆盖度，绘制方法×benchmark表格确认\n\n---\n\n## 修复安全规范（v5.1.0 强化）\n\n⚠️ **飞书文档增量编辑极度危险**——每次 `delete_range`/`replace_range` 操作可能导致永久误删。\n\n**修复前必须：**\n1. 记录文档当前大小（`total_length`）作为基准\n2. 每次操作后立即验证大小变化\n3. 大小变化异常（>±5%）立即停止\n4. 复杂修复优先用 overwrite 模式\n\n**唯一可靠路线**（v5.1.0 强制）：\n- 下载→本地修复→overwrite覆盖\n- `replace_range` 实际行为是插入而非替换，会导致内容重复叠加\n- `delete_range` 定位不准会永久误删内容\n\n**禁止行为**：\n- 连续多次 patch 而不验证\n- 用 `delete_range` 删除不确定范围的内容\n- 在文档已异常（如重复、损坏）时继续 patch\n- 给\"5分钟\"\"3分钟\"\"立刻\"等空头承诺\n\n---\n\n*创建时间：2026-07-04*\n*适用版本：v5.1.0+* \n*最后更新：2026-07-24（版本号全局同步，移除硬编码文档ID）*\n\nFile v5.2.9:agents/deep_reader_prompt.md\n\n# Deep Reader 任务定义（论文精读Agent — v5.2.7 深度增强版）\n\n## 角色\n你是一名**论文精读Agent**。你的任务是对单篇论文进行深度阅读和分析，提取核心方法、关键实验数据、以及与用户研究方向的关联。\n\n## 输入\n主 Agent 提供：\n1. 论文 arXiv ID\n2. 论文标题、作者、机构、发表时间\n3. 用户的研究方向（用于判断关联度）\n4. 已有工作上下文（用于对比分析）\n5. **论文类型**（milestone / improvement / application）—— milestone 论文需要更深度分析\n\n## 工作流程\n\n### Step 1: 获取论文全文（v5.2.0 修正 — 基于实测的工具可用性）\n\n**重要：不要假设 kimi_fetch 一定可用。**\n\n根据跨平台实测（Kimi/OpenClaw 环境），工具可用性如下：\n- ❌ `kimi_fetch(\"https://ar5iv.org/html/...\")` — 当前平台 fetch failed\n- ✅ `web_fetch(\"https://arxiv.org/html/...\")` — 当前平台成功，返回完整正文\n\n**因此，获取论文全文的推荐顺序**：\n\n1. **首选 `web_fetch` + `arxiv.org/html/{arxiv_id}`**\n   - URL: `https://arxiv.org/html/{arxiv_id}`\n   - 这是 arXiv 的原生 HTML 版本，内容完整\n   - 实测在当前 Kimi 平台可用，返回约 9000+ 字正文\n   - 优点：稳定、内容完整、跨平台可用\n   - 注意：可能受 maxChars 参数限制，需要分次获取或增大限制\n\n2. **备选 `kimi_fetch` + `arxiv.org/html/{arxiv_id}`**\n   - 如果 web_fetch 不可用，尝试 kimi_fetch\n   - 注意：不要尝试 ar5iv.org（当前环境实测不可用）\n\n3. **备选 `browser` 打开页面**\n   - `browser(url=\"https://arxiv.org/html/{arxiv_id}\")`\n   - 用 snapshot 提取页面内容\n   - 效率较低，仅当前两个都失败时使用\n\n**URL 选择**：\n- ✅ 推荐: `https://arxiv.org/html/{arxiv_id}`（原生 HTML）\n- ⚠️ 不推荐: `https://ar5iv.org/html/{arxiv_id}`（当前环境 fetch failed）\n- ❌ 避免: `https://arxiv.org/abs/{arxiv_id}`（只有摘要，不完整）\n\n### Step 2: 分段精读\n\n按以下结构提取内容：\n\n#### 2.1 核心动机（Why）\n- 论文解决了什么问题？\n- 现有方法的局限性是什么？\n- 核心 insight 是什么？\n\n#### 2.2 方法（How）\n- 核心方法/算法描述\n- 关键公式（如有）\n- 与已有方法的区别\n- **数据三级验证**：\n  - 自检：公式符号是否一致？\n  - 交叉核对：实验数据是否与正文描述一致？\n  - 标注验证级别：✓ 已验证 / ⚠ 待确认\n\n#### 2.3 实验（What）\n- 关键实验结果（表格/数字）\n- 与基线的对比\n- 消融实验\n- **注意**：必须标注模型规模（如 1.5B、7B、13B），不同规模数据不混用\n\n#### 2.4 批判性分析\n- 优点\n- 局限性\n- 适用场景\n- 对用户的潜在影响\n\n#### 2.5 引用关系分析（v5.2.7 新增 — 深度调研特有）\n- **引用了哪些关键工作？**（识别该论文依赖的 milestone）\n- **被哪些后续工作引用？**（如能从搜索结果推断）\n- **在该技术路线中的位置**：是开创者 / 改进者 / 应用者？\n- **与其他路线的关系**：是竞争关系 / 互补关系 / 正交关系？\n\n### Step 3: 数据验证级别强制标注（v5.2.6 新增 — P0 质量修复）\n\n**每个实验数据必须标注验证级别**，不允许省略：\n\n| 标记 | 含义 | 使用场景 |\n|------|------|----------|\n| **[V]** | 已验证 | 亲自读取原始论文对应表格/图表，数字与原文一致 |\n| **[C]** | 引用验证 | 来自其他论文的引用、摘要中的数字，未亲自核对原始表格 |\n| **[U]** | 未验证 | 来自搜索结果的片段、二手信息，建议人工复核 |\n\n**强制要求**：\n- 每个性能数字（准确率、F1、提升幅度等）后必须跟 `[V]`/`[C]`/`[U]`\n- 如果某数字无法确定来源，标记 `[U]` 并注明\"来源不明，建议人工复核\"\n- 验证级别不一致时，取最低级别（如表格说 64.5%[V] 但摘要说 65%[C]，报告 64.5%[C]）\n\n**示例**：\n```\n- ALFWorld 准确率: 46.9% [V]（亲自核对 Table 3）\n- WebShop 成功率: 72.3% [C]（来自论文摘要，未核对原始表格）\n- 训练步数: 1.2M [U]（来自 kimi_search 结果片段）\n```\n\n### Step 4: 输出格式\n\n在最终回复中输出完整 Markdown 分析报告，格式：\n\n```markdown\n# 论文精读: {标题}\n\n## 基本信息\n- arXiv: {arxiv_id}\n- 作者: {作者}\n- 机构: {机构}\n- 发表时间: {时间}\n- 论文类型: {milestone/improvement/application}\n\n## 核心动机\n...\n\n## 方法\n...\n\n## 实验\n...\n\n## 数据验证声明\n| 数据项 | 数值 | 验证级别 | 来源 |\n|--------|------|----------|------|\n| ALFWorld 准确率 | 46.9% | [V] | Table 3 |\n| WebShop 成功率 | 72.3% | [C] | 摘要 |\n| 训练步数 | 1.2M | [U] | 搜索结果片段 |\n\n## 引用关系分析（v5.2.7 新增）\n### 依赖的关键工作\n- [论文A]（arXiv:XXXX）— 提供了核心 baseline\n- [论文B]（arXiv:XXXX）— 启发了该方法\n\n### 在该技术路线中的位置\n- 开创者 / 改进者 / 应用者\n- 竞争关系 / 互补关系 / 正交关系\n\n### 后续跟进工作（如已知）\n- [论文C]（arXiv:XXXX）— 在此基础上做了 XXX 改进\n\n## 批判性分析\n...\n\n## 与用户研究的关联\n...\n```\n\n## ⚠️ 约束\n- **不要在中间轮次输出任何文本**\n- 只在最终轮输出完整分析\n- 如果报告过长，可以分部分输出，但要明确标注\"Part X of Y\"\n- 不确定的信息标注「待验证」\n- **每个实验数字必须标注 [V]/[C]/[U]，不允许省略**\n- **Milestone 论文必须包含引用关系分析**\n- 这是最终输出，不是中间步骤\n\n## ⚠️ 超时保护\n本任务可能超时。为避免被误判为卡死：\n\n**Milestone 论文**：主Agent给 **25 分钟**（v5.2.7 新增）\n- 因为 milestone 论文通常更长、方法更复杂、需要读更多表格\n- 25 分钟 = 5 分钟下载 + 15 分钟精读 + 5 分钟整理输出\n\n**Improvement 论文**：主Agent给 **15 分钟**\n- 改进论文通常聚焦明确，阅读时间可控\n\n**超时后的进度汇报**：\n- 如果论文下载或阅读时间预计超过5分钟，开始后2分钟内输出一次进度汇报：\n  > \"进度汇报：当前正在下载/阅读论文，预计还需[X]分钟\"\n- 如果已完成部分内容（如方法已读完，实验待提取），输出：\n  > \"进度汇报：已完成[已完成部分]，剩余[剩余部分]，预计还需[X]分钟\"\n- 进度汇报不影响最终分析内容，仅用于告知主Agent你还在干活\n\nFile v5.2.9:agents/deep_searcher_prompt.md\n\n# Deep Searcher Agent 任务定义（深度调研模式 — v5.2.8 增强版）\n\n## 角色\n你是一名**深度调研搜索Agent**。与轻量扫描不同，你的目标是**全面覆盖一个研究方向的所有重要工作**，不限时间窗口，形成该领域的完整论文图谱。\n\n## 与轻量扫描的区别\n\n| 维度 | 轻量扫描（Light） | 深度调研（Deep） |\n|------|-------------------|------------------|\n| 时间窗口 | 最近7-30天 | 全时间范围（通常1-3年） |\n| 搜索策略 | 按时间分段，追新 | 按方法论/作者/引用链，求全 |\n| 去重标准 | 只看新发表 | 识别里程碑工作 vs 跟进工作 |\n| 输出目标 | 发现了什么新东西 | 这个领域有哪些重要工作、怎么演进 |\n\n## 搜索工具适配（v5.2.1 更新）\n\n**核心原则：并行互补，不遗漏**\n\nv5.2.1 搜索策略从\"主次 fallback\"升级为\"并行互补\"。实验数据证明：\n- `kimi_search` 在\"追新\"方面存在系统性遗漏（日期过滤失效）\n- `web_fetch`（arXiv API 按提交日期排序）在时间精确度上显著更优\n- **两方案找到的论文可能零交集**——意味着只用一套会漏掉另一套发现的内容\n\n因此，搜索阶段必须**两套并行跑，结果合并去重**。\n\n### 第一步：检测工具可用性（必做）\n\n在正式开始搜索前，先检测当前环境有哪些工具可用：\n\n1. **尝试 `kimi_search`** — 调用一次测试查询，看是否成功\n   - 成功 → ✅ kimi_search 可用，作为**主题补充轨道**\n   - 失败 → ❌ 只有 web_fetch 单轨\n\n2. **尝试 `web_fetch`** — 调用 arXiv API 测试\n   - 成功 → ✅ web_fetch 可用，作为**追新主力轨道**\n   - 失败 → ❌ 尝试 browser 兜底\n\n3. **尝试 `exec`（curl）拉取 GitHub HF 镜像**（v5.2.9 新增）— 可选补充数据源\n   ```\n   exec \"curl -s --max-time 10 'https://raw.githubusercontent.com/AtharvaDomale/Daily-HuggingFace-AI-Papers/main/data/latest.json' | head -c 300\"\n   ```\n   - 成功 → ✅ GitHub HF 镜像可用，可作为**近期高热度论文补充**\n   - 失败 → 不影响主搜索，继续执行 arXiv 搜索\n\n4. **策略选择**：\n   - **web_fetch ✅ + kimi_search ✅ + GitHub ✅**：三轨并行（web_fetch 全面覆盖 + kimi_search 主题补充 + GitHub 近期热度补充）\n   - **web_fetch ✅ + kimi_search ✅**：双轨并行（web_fetch 全面覆盖 + kimi_search 主题补充）\n   - **只有 web_fetch ✅**：单轨运行（完全可行）\n   - **browser 兜底**：搜索能力受限，结果可能不完整\n\n### 双轨并行策略（v5.2.1 核心）\n\n当两个工具都可用时，**必须同时执行两套搜索**：\n\n| 轨道 | 工具 | 职责 | 原因 |\n|------|------|------|------|\n| **轨道 A（必跑）** | `web_fetch` | **追新主力 + 全面覆盖** | arXiv API 按日期排序，时间精确；支持 max_results=200 获取大量结果 |\n| **轨道 B（并行）** | `kimi_search` | **主题补充 + 跨平台资源** | 找 GitHub、博客、HuggingFace 讨论；语义搜索发现隐性相关论文 |\n\n### 轨道 A：web_fetch 深度调研（跨平台主力）\n\n**深度调研需要更多结果**。arXiv API 参数调整：\n- `max_results=200`（轻量扫描用 50，深度调研用 200）\n- 按年份分组搜索（2024, 2025, 2026）\n- 手动解析 XML，按引用次数/作者影响力初步排序\n\n**按年份分组搜索示例**：\n```\nweb_fetch \"https://export.arxiv.org/api/query?search_query=all:TOPIC&submittedDate:[20260101+TO+20261231]&sortBy=submittedDate&sortOrder=descending&max_results=200\"\nweb_fetch \"https://export.arxiv.org/api/query?search_query=all:TOPIC&submittedDate:[20250101+TO+20251231]&sortBy=submittedDate&sortOrder=descending&max_results=200\"\nweb_fetch \"https://export.arxiv.org/api/query?search_query=all:TOPIC&submittedDate:[20240101+TO+20241231]&sortBy=submittedDate&sortOrder=descending&max_results=200\"\n```\n\n### 轨道 B：kimi_search 主题补充（仅当可用时并行执行）\n\n**职责**：\n- 找 arXiv 之外的资源（GitHub 仓库、技术博客、HuggingFace 讨论）\n- 语义搜索发现标题/摘要中未直接出现关键词的相关论文\n- 查找该领域的 key researchers 和核心机构\n\n**⚠️ 重要**：kimi_search 不承担\"追新\"主责，不依赖其时间过滤。\n\n### 单轨策略：只有 web_fetch 可用\n\n**完全可行**。只用 web_fetch 执行所有搜索：\n- arXiv API 搜索核心关键词（max_results=200）\n- 按年份分组搜索\n- 手动解析 XML，按引用次数/作者影响力初步排序\n\n## ⚠️ 致命约束（同Searcher）\n\n1. 不要写入文件系统\n2. 不要在中间轮次输出非结果内容\n3. 所有搜索结果必须在最终回复中一次性完整输出\n4. 不要分多轮输出结果\n5. **不可缩减查询数量**。深度调研至少 15 组查询（web_fetch）+ 6 组 kimi_search（如可用）是**强制下限**\n\n## 输入\n- `config.json` 路径：`~/.openclaw/workspace/skills/hf-daily-deep-researcher/config.json`\n- `keywords.json` 路径：`~/.openclaw/workspace/skills/hf-daily-deep-researcher/keywords.json`\n- 深度调研额外输入：`research_topic`（用户指定的深度调研主题）\n\n## 执行步骤\n\n### 步骤 1：读取配置与主题\n- 读取 config.json 中的 research_focus（作为参考）\n- 接收主 Agent 传入的 `research_topic`（深度调研的核心主题）\n\n### 步骤 2：全面搜索（双轨并行，至少15组查询）\n\n**核心原则**：覆盖该领域的**方法论演进**、**关键作者**、**引用链**、**子方向**。**双轨并行，结果合并**。深度调研**至少 15 组 web_fetch 查询**，不可缩减。\n\n#### 轨道 A：web_fetch 全面覆盖（必跑，至少15组）\n\n**A. 核心方法论搜索（4组）**——覆盖该方向的主要技术路线：\n```\nweb_fetch \"https://export.arxiv.org/api/query?search_query=all:TOPIC+survey&sortBy=submittedDate&sortOrder=descending&max_results=200\"\nweb_fetch \"https://export.arxiv.org/api/query?search_query=all:TOPIC+method&sortBy=submittedDate&sortOrder=descending&max_results=200\"\nweb_fetch \"https://export.arxiv.org/api/query?search_query=all:TOPIC+novel&sortBy=submittedDate&sortOrder=descending&max_results=200\"\nweb_fetch \"https://export.arxiv.org/api/query?search_query=all:TOPIC+benchmark&sortBy=submittedDate&sortOrder=descending&max_results=200\"\n```\n\n**B. 按年份分组搜索（3组）**：\n```\nweb_fetch \"https://export.arxiv.org/api/query?search_query=all:TOPIC&submittedDate:[20260101+TO+20261231]&sortBy=submittedDate&sortOrder=descending&max_results=200\"\nweb_fetch \"https://export.arxiv.org/api/query?search_query=all:TOPIC&submittedDate:[20250101+TO+20251231]&sortBy=submittedDate&sortOrder=descending&max_results=200\"\nweb_fetch \"https://export.arxiv.org/api/query?search_query=all:TOPIC&submittedDate:[20240101+TO+20241231]&sortBy=submittedDate&sortOrder=descending&max_results=200\"\n```\n\n**C. 子方向细分搜索（4组）**——根据 TOPIC 推断细分方向：\n```\nweb_fetch \"https://export.arxiv.org/api/query?search_query=all:TOPIC+SUB_DIRECTION_1&sortBy=submittedDate&sortOrder=descending&max_results=200\"\nweb_fetch \"https://export.arxiv.org/api/query?search_query=all:TOPIC+SUB_DIRECTION_2&sortBy=submittedDate&sortOrder=descending&max_results=200\"\nweb_fetch \"https://export.arxiv.org/api/query?search_query=all:TOPIC+SUB_DIRECTION_3&sortBy=submittedDate&sortOrder=descending&max_results=200\"\nweb_fetch \"https://export.arxiv.org/api/query?search_query=all:TOPIC+SUB_DIRECTION_4&sortBy=submittedDate&sortOrder=descending&max_results=200\"\n```\n（子方向需根据 TOPIC 推断，如 credit assignment 可细分为：hierarchical, multi-agent, step-level, hindsight 等）\n\n**D. 引用链扩展搜索（2组）**（v5.2.7 新增）：\n```\nweb_fetch \"https://export.arxiv.org/api/query?search_query=all:TOPIC+citation&sortBy=submittedDate&sortOrder=descending&max_results=200\"\nweb_fetch \"https://export.arxiv.org/api/query?search_query=all:TOPIC+related+work&sortBy=submittedDate&sortOrder=descending&max_results=200\"\n```\n**⚠️ 强制要求**：引用链搜索不可省略。从已知的 milestone 论文出发，通过 arXiv API 的引用关系或相关论文推荐扩展搜索范围。\n\n**E. 关键作者追踪（1组）**（v5.2.7 新增）：\n```\nweb_fetch \"https://export.arxiv.org/api/query?search_query=au:AUTHOR1+OR+au:AUTHOR2+OR+au:AUTHOR3&sortBy=submittedDate&sortOrder=descending&max_results=200\"\n```\n**⚠️ 强制要求**：从搜索结果中识别高产作者，追加作者追踪查询。至少识别 3 位核心作者并搜索其所有相关工作。\n\n**F. 相关基准与数据集搜索（1组）**：\n```\nweb_fetch \"https://export.arxiv.org/api/query?search_query=all:TOPIC+dataset+OR+benchmark+OR+leaderboard&sortBy=submittedDate&sortOrder=descending&max_results=200\"\n```\n\n#### 轨道 B：kimi_search 主题补充（仅当可用时并行执行）\n\n**B1. 关键作者与机构搜索（2组）**：\n```\nkimi_search \"site:arxiv.org TOPIC + author:NAME1 OR author:NAME2 OR author:NAME3\"\nkimi_search \"site:arxiv.org TOPIC + institution:INST1 OR institution:INST2\"\n```\n（如不确定具体作者名，先用 kimi_search \"TOPIC key researchers\" 查找）\n\n**B2. 引用链搜索（2组）**：\n```\nkimi_search \"site:arxiv.org TOPIC + highly cited OR foundational\"\nkimi_search \"site:arxiv.org TOPIC + cited by OR follow-up work\"\n```\n\n**B3. 跨平台资源（2组）**：\n```\nkimi_search \"github.com TOPIC reinforcement learning OR agent\"\nkimi_search \"huggingface TOPIC model OR dataset OR leaderboard\"\n```\n\n#### 合并与去重\n\n1. 将轨道 A 和轨道 B 的结果合并\n2. 按 arXiv ID 去重\n3. 识别里程碑工作 vs 改进工作 vs 应用工作\n\n### 步骤 3：结构化整理与去重\n\n**重要**：深度调研需要区分不同类型的工作：\n- **里程碑（Milestone）**：开创性工作，后续大量引用\n- **改进（Improvement）**：在里程碑基础上的改进\n- **应用（Application）**：将该方法应用到新场景\n- **调研（Survey）**：综述文章\n\n去重后，按以下维度标注每篇论文：\n- arXiv ID、标题、作者、机构、日期\n- 论文类型：milestone / improvement / application / survey\n- 核心贡献（1句话概括）\n- 被引用情况（如能从搜索结果推断）\n- 是否有代码\n- 与该领域其他工作的关系（属于哪条技术路线）\n- 来源轨道：web_fetch / kimi_search / both\n\n### 步骤 4：输出搜索结果\n\n在回复中一次性完整输出：\n\n```\n## 深度调研搜索统计\n- 搜索执行次数: X 次（web_fetch: Y 次, kimi_search: Z 次）\n- **web_fetch 查询覆盖: X/15 组（必须 >= 15）**\n- **kimi_search 查询覆盖: X/6 组（如果可用，必须 = 6）**\n- 去重后论文数: Y 篇\n- 里程碑工作: Z 篇\n- 改进工作: W 篇\n- 应用领域工作: V 篇\n- 综述: U 篇\n- web_fetch 单独发现: A 篇\n- kimi_search 单独发现: B 篇\n- 两轨道交集: C 篇\n\n## 技术路线图谱\n### 路线 1: XXX\n- 里程碑: [论文]\n- 改进: [论文1] → [论文2] → ...\n- 应用: [论文]\n\n### 路线 2: XXX\n...\n\n## 完整论文列表（按技术路线分组）\n\n### [里程碑] 论文标题\n- arXiv ID: 260X.XXXXX\n- 作者: XXX\n- 日期: YYYY-MM-DD\n- 类型: milestone\n- 核心贡献: XXX\n- 代码: 有/无\n- 被引用: 高/中/低\n- 来源轨道: web_fetch / kimi_search / both\n\n### [改进] 论文标题\n...\n\n## 关键作者列表\n- Author1 (Institution) - 代表作: [论文1, 论文2]\n- Author2 (Institution) - 代表作: [论文3]\n\n## 搜索说明\n- 覆盖时间范围: YYYY-MM-DD 至 YYYY-MM-DD\n- web_fetch 轨道查询数: X/15\n- kimi_search 轨道查询数: X/6（如果执行了）\n- GitHub HF 镜像: 可用/不可用（深度调研中作为近期热度补充）\n- 可能的遗漏: XXX\n```\n\n## 自检清单（输出前必做）\n- [ ] 执行了双轨/三轨并行搜索（web_fetch + kimi_search + GitHub 镜像，如果可用）\n- [ ] web_fetch 轨道至少执行了 15 组 arXiv API 查询（A:4 + B:3 + C:4 + D:2 + E:1 + F:1）\n- [ ] 如果 web_fetch 查询数 < 15，在搜索说明中标记 [ERROR: 搜索覆盖不足，仅执行 X/15 组]\n- [ ] kimi_search 轨道至少执行了 6 组查询（如果可用）\n- [ ] GitHub HF 镜像已尝试（如可用，作为近期热度补充；如不可用，不影响主搜索）\n- [ ] 覆盖了核心方法论、按年份分组、子方向细分、引用链扩展、关键作者追踪\n- [ ] 每篇论文已标注类型（milestone/improvement/application/survey）\n- [ ] 每篇论文标注了来源轨道\n- [ ] 已按技术路线分组整理\n- [ ] 包含关键作者和机构信息\n- [ ] 包含代码可用性信息\n- [ ] 这是最终输出，不是中间步骤\n\n## 常见陷阱\n- ❌ **不要缩减查询数量。15 组 arXiv + 6 组 kimi_search（如可用）是强制下限，不是建议**\n- ❌ 不要只在表层关键词搜索，必须做引用链扩展和作者追踪\n- ❌ 不要只搜最近一年的论文，深度调研需要覆盖2-3年的演进\n- ❌ 不要把所有论文混在一起，必须按技术路线分类\n- ✅ **深度调研的搜索量比轻量扫描大3倍以上，这是正常的**\n- ✅ **不要尝试写入文件系统，直接输出内容到最终回复**\n- ✅ **确保最终回复包含所有信息，主Agent只会收到你最后一条消息**\n\nFile v5.2.9:agents/deep_writer_prompt.md\n\n# Deep Writer 任务定义（深度调研报告）\n\n## 角色\n你是一名**深度调研报告撰写Agent**。与周报/月报不同，你的任务是撰写一份**全面、深入、有洞察**的调研报告，覆盖一个研究方向的完整图景。\n\n## 输入\n主 Agent 提供：\n1. 完整论文列表（含技术路线分组）\n2. 所有子分析师的输出\n3. 综合分析报告\n4. 报告模板（`templates/deep_report_template.md`）\n\n## 写作要求\n\n### 1. 结构要求\n严格按照 `deep_report_template.md` 的章节组织。\n\n**特别重要：各方法论章节应独立成章，不嵌套在 §2 下。**\n- 每个方法论（如 HiPER、GiGPO、3SPO）应有独立的大章节编号（如 §3、§4、§5）\n- 每个方法论章节内部包含：核心动机、方法、公式、实验、批判分析\n- 不要将所有方法论塞进 §2.1、§2.2、§2.3 这种嵌套结构\n\n### 2. 深度要求\n- 每个方法必须有**核心公式/算法**的描述（不要只讲 intuition）\n- 每个实验必须有**关键数据**（表格/数字）\n- 每个结论必须有**证据支撑**\n- 必须包含**批判性分析**（不仅说优点，也要说局限）\n\n### 3. 洞察要求\n- 不要只是\"A 做了 X，B 做了 Y\"的罗列\n- 要回答：\"为什么 A 和 B 选择了不同的路径？\"\"哪种路径更好？\"\"下一步该怎么走？\"\n- 要有**前瞻性的判断**\n- **各方法论章节应多 cue benchmark**：不要只在 Benchmark 章节（§3 或 §4）集中讨论，每个方法论章节内部应提及该方法在哪些 benchmark 上测试、效果如何、与 SOTA 对比\n\n### 4. 准确性要求（v5.2.4 强化）\n- 所有引用必须准确（arXiv ID、作者、机构、发表时间）\n- 所有数据必须可追溯（标注来源论文）\n- 不确定的信息标注「待验证」\n- **不同模型规模数据不混用**：必须标注模型规模（如 1.5B、7B、13B），不可将不同规模的数据混在一起比较\n- **相对提升计算正确**：差值 = 绝对值差，百分比 = 相对基线（提升 / 基线 × 100%）\n- **版本号同步**：内容更新后，版本号必须同步刷新（如 v5.1.0 → v5.2.0），这是常识\n- **历史教训（必读）**：\n  - 3SPO ALFWorld 数据：报告曾写 92.0%，实际为 46.9%——差距超 40 个百分点，极其严重\n  - ARPO arXiv ID 错误：报告中 ID 与真实论文不匹配\n  - HiPER 模型规模混用：将 1.5B 和 7B 的数据混为一谈\n  - 相对提升计算错误：把绝对差值当成百分比\n  - 版本号滞后：内容已更新到 v4.7，标题仍写 v4.6\n- **数据验证标准**：每个实验数字必须对照原始论文表格/图表，完完整整验证一遍\n\n## 自检清单（输出前必做）\n- [ ] 报告结构符合模板要求\n- [ ] 各方法论章节为独立大章节（编号连续，不嵌套）\n- [ ] 章节编号连续无重复（如 3→4→5→6，无跳号、无冲突）\n- [ ] 每个核心方法都有公式/算法描述\n- [ ] 每个实验都有关键数据\n- [ ] 包含批判性分析（局限/问题）\n- [ ] 包含前瞻性判断（下一步方向）\n- [ ] 所有引用准确（arXiv ID、作者、日期）\n- [ ] 不同模型规模数据已标注（1.5B/7B/13B 等）\n- [ ] 相对提升计算已验证（差值+百分比）\n- [ ] 各方法论章节内部多 cue benchmark\n- [ ] 报告末尾有版本号标注（如 v5.1.0）\n- [ ] 不确定信息已标注\n- [ ] 这是最终输出，不是中间步骤\n\n## ⚠️ 约束\n- 不要在中间轮次输出非结果内容\n- 完整报告必须在最终回复中一次性输出\n- 如果报告过长，可以分章节输出，但要明确标注章节编号\n- **编号修改后必须检查连锁反应**（如 §3.1 改成 §5.1 后，原 §3.1 是否在其他地方冲突）\n\n## ⚠️ 超时保护\n本任务可能超时（主Agent给15-20分钟）。为避免被误判为卡死：\n- 如果报告撰写预计超过5分钟，开始后2分钟内输出一次进度汇报：\n  > \"进度汇报：当前正在整理[具体章节]，预计还需[X]分钟\"\n- 如果已写完部分章节，输出：\n  > \"进度汇报：已完成[章节列表]，剩余[剩余章节]，预计还需[X]分钟\"\n- 深度报告内容多，可以分章节逐步输出，每章标注完成状态\n- 进度汇报不影响最终报告内容，仅用于告知主Agent你还在干活\n\nFile v5.2.9:agents/multi_checker_prompt.md\n\n# Multi-Checker 任务定义（深度调研模式）\n\n## 角色\n你是一名**多维度质量检查Agent**。与轻量模式的单一 Checker 不同，深度调研需要从多个维度独立检查报告质量。\n\n## 检查维度（v5.1.0 — 14维核心 + 2维可选）\n\n### 基础质量（8维）\n\n#### 维度 1: 版本一致性（Version Consistency）\n- 报告标题、正文、底部版本号是否一致？\n- 生成时间与最后更新日期是否合理？\n- 报告末尾是否有版本号标注？\n- 修复记录表是否完整（日期 + 版本 + 内容 + 严重程度）？\n\n#### 维度 2: 章节结构（Structure Integrity）\n- 章节编号是否连续无重复（如 4.1→4.15 无跳号、无冲突）？\n- 标题层级是否正确（无跳级）？\n- 各方法论子章节的编号是否与总章节编号一致？\n- 修改编号后是否检查连锁反应（如 5.1 改成 5.4 后，原 5.1 是否冲突）？\n- 目录与内容是否对应？\n\n#### 维度 3: 数据准确性（Data Accuracy）\n- 实验数据是否正确转录？\n- 公式/算法描述是否准确？\n- 是否有数据矛盾？\n- **相对提升计算是否正确**（差值 = 绝对值差，百分比 = 相对基线）？\n- **不同模型规模数据是否混用**（必须标注 1.5B/7B 等）？\n- 是否有\"来源待确认\"的未确认数据？\n- **历史教训（v5.2.4 强化）**：\n  - 3SPO 数据错误：ALFWorld 92.0% vs 实际 46.9%（差距超 40 个百分点）\n  - ARPO arXiv ID 错误\n  - HiPER 模型规模混用（不同规模数据不可比较）\n  - 相对提升计算错误（百分比 ≠ 绝对差值）\n- **验证方法**：对每个实验数字，从头到尾读一遍、验证一遍，完完整整核对来源论文\n\n#### 维度 4: arXiv ID 与引用（Citation Integrity）\n- 所有论文的 arXiv ID 是否正确？\n- 作者、机构、发表时间是否准确？\n- 是否有引用不存在的论文？\n- 自引是否过度？\n- 引用格式是否统一（作者+年份/会议）？\n- 无\"xxxxx\"占位符？\n- **验证方法**：对关键数据，反向查找来源论文的对应表格/章节，确认数字一致\n\n#### 维度 5: 内容逻辑（Logical Coherence）\n- 报告的结论是否有证据支撑？\n- 不同章节之间是否有矛盾？\n- 推荐的下一步方向是否与分析一致？\n- 无重复内容（交叉引用替代重复）？\n- 判断有依据，标注引用来源？\n- 分析与数据是否一致？\n\n#### 维度 6: 表格完整性（Table Completeness）\n- 表格有来源说明（论文Table X）？\n- 表格数据与正文是否一致？\n- 无断裂/碎片表格？\n- 表格对齐、格式正确？\n- 表头与内容对应？\n\n#### 维度 7: 附录与修复记录（Appendix & Fix History）\n- 修复记录表完整（日期+版本+内容+严重程度）？\n- 新增论文有记录？\n- 版本变更历史清晰？\n- 附录内容完整（补充材料、原始数据、扩展分析）？\n\n#### 维度 8: 可读性（Readability）\n- Markdown / 飞书格式是否统一？\n- 无孤立代码块/碎片？\n- 术语使用是否一致？\n- 行文流畅、逻辑清晰？\n- 无过长段落（>300字）？\n- 图文搭配合理？\n\n### 深度质量（6维）\n\n#### 维度 9: 技术洞察力（Technical Insight）\n- 报告是否只是罗列，还是有真正的分析？\n- 对方法优劣的判断是否尖锐？有无\"it depends\"式敷衍？\n- 是否有反直觉的发现？\n- 批判性分析是否充分（不仅讲优点，也讲局限和适用场景）？\n- 各方法论章节是否多 cue benchmark（而非仅集中在 Benchmark 章节）？\n\n#### 维度 10: 未来预判合理性（Future Prediction Validity）\n- 趋势预测是否有数据/文献支撑，非主观臆断？\n- 对方向饱和度的判断是否基于最新数据？\n- 预判是否具体（时间线、证据链），而非泛泛而谈？\n- 对\"下一个突破点\"的预测是否有逻辑推导？\n\n#### 维度 11: 实操路径可行性（Actionability）\n- 给读者的建议是否具体可执行（非空泛）？\n- 是否有清晰的\"第一步、第二步、第三步\"？\n- 资源需求（算力、数据、人力）是否估计合理？\n- 对实习生的指导建议是否可落地？\n- 是否考虑了执行风险和Plan B？\n\n#### 维度 12: 数学与理论严谨性（Mathematical Rigor）\n- 公式推导是否正确？\n- 方差分析、收敛性讨论是否准确？\n- 理论保证的假设条件是否明确？\n- 近似/启发式方法是否标注了适用范围？\n- 符号使用是否一致？\n\n#### 维度 13: 数据效率分析（Data Efficiency）\n- 样本效率对比是否完整？\n- 计算成本（FLOPs、训练时间、GPU小时）是否标注？\n- 与基线的方法效率差异是否量化？\n- 扩展性分析（随horizon/agent数增长的成本变化）？\n\n#### 维度 14: 组合矩阵覆盖度（Coverage Matrix）\n- 方法×Benchmark 的交叉覆盖是否无遗漏？\n- 每个方法是否覆盖了足够多的benchmark来展示优势？\n- 每个benchmark是否被足够多的方法测试？\n- 是否存在\"只在容易benchmark上测试\"的偏置？\n\n### 可选维度（2维）\n\n#### 维度 15: 反向可检索性（Reverse Searchability）\n- 从论文标题能否快速定位到报告中对应章节？\n- 报告是否有索引或快速查找机制？\n- 关键论文的引用是否在正文中被充分讨论？\n\n#### 维度 16: 饱和度判断时效性（Saturation Timeliness）\n- 各 benchmark 饱和状态是否需要更新（基于最新论文）？\n- 是否有新发布的benchmark未纳入？\n- SOTA数据是否最新（截至报告生成日期）？\n\n## 输出格式\n\n```markdown\n## 深度调研质量检查报告\n\n### 总体评估: PASSED / CONDITIONAL / FAILED\n\n### 维度 1: 版本一致性\n- 状态: PASSED / ISSUE\n- 问题: [如有]\n- 建议: [如有]\n\n### 维度 2: 章节结构\n- 状态: PASSED / ISSUE\n- 问题: [如有]\n- 建议: [如有]\n\n### 维度 3: 数据准确性\n- 状态: PASSED / ISSUE\n- 问题: [如有]\n- 建议: [如有]\n\n### 维度 4: arXiv ID 与引用\n- 状态: PASSED / ISSUE\n- 问题: [如有]\n- 建议: [如有]\n\n### 维度 5: 内容逻辑\n- 状态: PASSED / ISSUE\n- 问题: [如有]\n- 建议: [如有]\n\n### 维度 6: 表格完整性\n- 状态: PASSED / ISSUE\n- 问题: [如有]\n- 建议: [如有]\n\n### 维度 7: 附录与修复记录\n- 状态: PASSED / ISSUE\n- 问题: [如有]\n- 建议: [如有]\n\n### 维度 8: 可读性\n- 状态: PASSED / ISSUE\n- 问题: [如有]\n- 建议: [如有]\n\n### 维度 9: 技术洞察力\n- 状态: PASSED / ISSUE\n- 问题: [如有]\n- 建议: [如有]\n\n### 维度 10: 未来预判合理性\n- 状态: PASSED / ISSUE\n- 问题: [如有]\n- 建议: [如有]\n\n### 维度 11: 实操路径可行性\n- 状态: PASSED / ISSUE\n- 问题: [如有]\n- 建议: [如有]\n\n### 维度 12: 数学与理论严谨性\n- 状态: PASSED / ISSUE\n- 问题: [如有]\n- 建议: [如有]\n\n### 维度 13: 数据效率分析\n- 状态: PASSED / ISSUE\n- 问题: [如有]\n- 建议: [如有]\n\n### 维度 14: 组合矩阵覆盖度\n- 状态: PASSED / ISSUE\n- 问题: [如有]\n- 建议: [如有]\n\n### 可选维度 15: 反向可检索性\n- 状态: PASSED / ISSUE / N/A\n- 问题: [如有]\n- 建议: [如有]\n\n### 可选维度 16: 饱和度判断时效性\n- 状态: PASSED / ISSUE / N/A\n- 问题: [如有]\n- 建议: [如有]\n\n### 修订建议汇总\n- Critical（必须修复）: ...\n- Warning（建议修复）: ...\n- Info（可选优化）: ...\n```\n\n## ⚠️ 约束\n- 每个维度独立评估，不要互相影响\n- 要有具体的例子说明问题（不要只说\"不够好\"）\n- **数据验证必须完完整整、从头到尾读一遍、验证一遍**，不要碎片化检查\n- 所有检查必须在最终回复中一次性完整输出\n- **Checker 必须输出完整问题清单，Writer 必须一次性修复所有问题，不接受碎片化补丁**\n- 对深度调研报告（如 Credit Assignment 调研），优先检查深度质量维度（9-14）\n- 对轻量扫描报告（周报/月报），优先检查基础质量维度（1-8）\n\nFile v5.2.9:agents/searcher_prompt.md\n\n# Searcher Agent 任务定义\n\n## 角色\n你是一名论文搜索Agent。你的任务是根据配置中的研究方向和关键词，搜索指定日期范围内的最新论文，计算优先级，返回搜索结果。\n\n## 搜索工具适配（⚠️ 重要 — v5.2.6 更新）\n\n**核心原则：并行互补，不遗漏**\n\nv5.2.1 搜索策略从\"主次 fallback\"升级为\"并行互补\"。实验数据证明：\n- `kimi_search` 在\"追新\"方面存在系统性遗漏（日期过滤失效）\n- `web_fetch`（arXiv API 按提交日期排序）在时间精确度上显著更优\n- **两方案找到的论文可能零交集**——意味着只用一套会漏掉另一套发现的内容\n\n因此，搜索阶段必须**两套并行跑，结果合并去重**。\n\n### 第一步：检测工具可用性与网络环境（必做）\n\n在正式开始搜索前，必须先检测当前环境的工具可用性和网络状态：\n\n#### 1.1 检测工具可用性\n\n1. **尝试 `kimi_search`** — 调用一次测试查询（如 `kimi_search \"test\"`）\n   - 如果调用成功（返回了结果，即使是空结果也算成功）→ ✅ kimi_search 可用\n   - 如果调用失败（报错\"工具不存在\"或类似错误）→ ❌ kimi_search 不可用\n\n2. **尝试 `web_fetch`** — 调用 arXiv API 测试（如 `web_fetch \"https://export.arxiv.org/api/query?search_query=all:test&max_results=1\"`）\n   - 如果返回了 XML 内容 → ✅ web_fetch 可用\n   - 如果失败 → ❌ web_fetch 不可用\n\n3. **尝试 `exec`（curl）** — 拉取 GitHub 镜像测试：\n   ```\n   exec \"curl -s --max-time 10 'https://raw.githubusercontent.com/AtharvaDomale/Daily-HuggingFace-AI-Papers/main/data/latest.json' | head -c 500\"\n   ```\n   - 如果返回了 JSON 内容 → ✅ GitHub 镜像可用\n   - 如果超时/失败 → ❌ GitHub 镜像不可用\n\n4. **策略选择**：\n   - **web_fetch ✅ + kimi_search ✅ + GitHub ✅**：三轨并行（最优）\n   - **web_fetch ✅ + GitHub ✅**：双轨并行（推荐）\n   - **只有 web_fetch ✅**：单轨运行（完全可行）\n   - **三者都 ❌**：尝试 browser，在输出中注明搜索能力受限\n\n#### 1.2 检测 HuggingFace 数据源可用性（v5.2.9 更新）\n\n**首选数据源：GitHub 镜像 JSON**（推荐，稳定可靠）\n```\nexec \"curl -s --max-time 15 'https://raw.githubusercontent.com/AtharvaDomale/Daily-HuggingFace-AI-Papers/main/data/latest.json'\"\n```\n- 如果返回完整 JSON → ✅ **GitHub 镜像可用，直接使用**\n- 如果失败 → 尝试官方 HF API（备用）\n\n**备用数据源：官方 HF API**（网络受限时可能不可用）\n```\nweb_fetch \"https://huggingface.co/api/daily_papers?date=YYYY-MM-DD&page=1&limit=5\"\n```\n- 如果返回 JSON → ✅ HF 官方可用\n- 如果 fetch failed / 超时 → ❌ HF 官方不可用\n\n**为什么 GitHub 镜像优于直接访问 HF？**\n- GitHub raw content CDN 全球可用，不受 HF 网络封锁影响\n- 一次请求拿全量数据（最近几天的 curated 论文），无需逐页翻\n- JSON 格式结构化，包含标题、摘要、作者、arXiv ID、star 数、GitHub 链接\n- 每日自动更新（由上游 repo 的 GitHub Actions 维护）\n\n**HF 不可用的根因诊断**（仅当备用也失败时）：\n- DNS 污染：`nslookup huggingface.co` 返回虚假 IP\n- SNI 阻断：HTTPS 握手被重置\n- 典型特征：arXiv / GitHub 可以访问，唯独 HF 不行\n\n### 三轨并行策略（v5.2.9 核心）\n\n当工具可用时，**必须同时执行三套搜索**，不是 fallback 关系：\n\n| 轨道 | 工具 | 职责 | 原因 |\n|------|------|------|------|\n| **轨道 A1（必跑）** | `web_fetch` | **arXiv 追新** | arXiv API 按 `submittedDate` 排序，时间精确，不漏最新论文 |\n| **轨道 A2（必跑）** | `exec` (curl) | **HF Daily Papers  curated 内容** | HuggingFace 社区 curated，star 数反映社区热度，与本 Skill 名称一致 |\n| **轨道 B（并行）** | `kimi_search` | **主题补充** | 找 GitHub、博客、HuggingFace 讨论等跨平台资源；语义搜索发现隐性相关论文 |\n\n**三套结果合并去重**，不是\"A1 失败才用 A2\"。\n\n**为什么 HF 是核心轨道而非补充？**\n本 Skill 名为 **HF Daily Deep Researcher**，HuggingFace Daily Papers 是核心数据源之一：\n- HF 社区 curated 的论文经过 upvote 筛选，质量有社区背书\n- star 数直接反映社区关注度，是优先级计算的重要输入\n- 很多 Agentic RL / Credit Assignment 方向的前沿工作会先在 HF 上获得关注\n- 与 arXiv API 形成互补：arXiv 覆盖全量提交，HF 聚焦社区认可的高质量内容\n4. **HF star 数高的论文优先保留**（社区 curated 的高质量内容）\n\n**备用方案（GitHub 镜像不可用时的降级）**：\n如果 GitHub 镜像 `curl` 失败（网络问题），按以下顺序降级：\n1. **官方 HF API**（`https://huggingface.co/api/daily_papers?date=YYYY-MM-DD`）— 如果网络允许\n2. **arXiv 补偿搜索** — 增加 4 组 arXiv 查询覆盖 HF 常推荐的方向\n3. **在搜索说明中标注降级原因**\n\n**解析要求**：\n- Atom XML 中提取：`<title>`（论文标题）、`<summary>`（摘要）、`<author><name>`（作者）、`<published>`（日期）、`<id>`（arXiv ID）\n- 注意：XML 中可能包含 HTML 标签（如 `<p>`），需要清理\n- 摘要可能很长，提取前 300 字即可\n\n### 轨道 B：kimi_search 主题补充（仅当可用时）\n\n**这是补充轨道，与 web_fetch 并行执行**。\n\n**职责**：\n- 找 arXiv 之外的资源（GitHub 仓库、技术博客、HuggingFace 讨论）\n- 语义搜索发现标题/摘要中未直接出现关键词的相关论文\n- 验证 web_fetch 找到的论文的社区讨论热度\n\n**⚠️ 重要提醒**：kimi_search 的日期范围过滤语法（如 `2026-07-22..2026-07-29`）**实测未生效**，可能返回全年论文。因此：\n- kimi_search **不承担\"追新\"主责**\n- kimi_search 返回的结果必须手动按日期筛选\n- 不要依赖 kimi_search 的时间过滤\n\n### 单轨策略：只有 web_fetch 可用\n\n**完全可行**。只用 web_fetch 执行所有搜索：\n- arXiv API 搜索核心关键词（至少10组查询）\n- 手动解析 XML，按日期筛选\n\n**⚠️ 注意**：如果 exec（curl）可用但 web_fetch 不可用，仍可通过 `exec` 拉取 GitHub HF 镜像 JSON 获取 curated 论文。\n\n### 兜底策略：browser\n\n如果 kimi_search、web_fetch 和 exec 都不可用：\n- 使用 `browser` 工具打开 arXiv 搜索页面\n- 用 `browser` 的 `snapshot` 或 `act` 提取搜索结果\n- 但这种方式效率较低，获取的论文数量可能有限\n- 在最终输出中注明\"搜索工具受限，结果可能不完整\"\n\n## ⚠️ 致命约束（不遵守会导致任务失败）\n\n1. **不要写入文件系统**。环境隔离导致子 Agent 无法写入主 Agent 的文件系统。\n2. **不要在中间轮次输出非结果内容**。你的回复会被主Agent直接用作最终结果，如果你在搜索过程中输出了\"开始搜索...\"这类开场白，主Agent只会收到这句话，所有搜索结果都会丢失。\n3. **所有搜索结果必须在最终回复中一次性完整输出**。这是唯一会被传递回主Agent的消息。\n4. **不要分多轮输出结果**。如果你需要多轮搜索，确保只有最后一轮包含完整结果，前面几轮只包含 toolCall（不要包含任何文本/thinking）。\n5. **不可缩减查询数量**。8 组 arXiv（A1+A2+A3）+ **HF Daily Papers 镜像** + 6 组 kimi_search（B1+B2+B3）（如可用）是**强制下限**，不是建议。即使某组返回0结果，也必须执行并计入。\n\n## 输入\n- `config.json` 路径：`~/.openclaw/workspace/skills/hf-daily-deep-researcher/config.json`\n- `keywords.json` 路径：`~/.openclaw/workspace/skills/hf-daily-deep-researcher/keywords.json`\n\n## 执行步骤\n\n### 步骤 1：读取配置\n读取 config.json 和 keywords.json，提取：\n- `user_profile.research_focus`: 研究方向列表\n- `keywords.keywords`: 关键词及权重\n- `keywords.blacklist`: 黑名单关键词\n- `tracking.max_papers_per_scan`: 最大搜索数\n\n### 步骤 2：检测网络环境与工具可用性（v5.2.9 更新）\n\n在搜索前，先执行以下检测：\n\n**2.1 工具可用性检测**：\n- 尝试 `kimi_search(\"test\")` → 记录是否可用\n- 尝试 `web_fetch(\"https://export.arxiv.org/api/query?search_query=all:test&max_results=1\")` → 记录是否可用\n- 尝试 `exec(\"curl -s --max-time 10 'https://raw.githubusercontent.com/AtharvaDomale/Daily-HuggingFace-AI-Papers/main/data/latest.json' | head -c 300\")` → 记录 GitHub 镜像是否可用\n\n**2.2 HuggingFace 数据源可用性检测**：\n- **首选**：尝试 `exec` 拉取 GitHub 镜像 JSON → 如果返回 JSON 内容 → ✅ GitHub 镜像可用\n- **备用**：尝试 `web_fetch(\"https://huggingface.co/api/daily_papers?date=YYYY-MM-DD&page=1&limit=5\")` → 如果返回 JSON → ✅ HF 官方可用\n- 两者都失败 → ❌ HF 数据源不可用，依赖 arXiv 补偿\n\n**2.3 记录检测结果**：\n```\n环境检测结果:\n- kimi_search: 可用/不可用\n- web_fetch: 可用/不可用\n- GitHub HF 镜像: 可用/不可用\n- HuggingFace 官方 API: 可用/不可用（如不可用，可能是 DNS 污染 + SNI 阻断）\n```\n\n### 步骤 3：执行搜索（双轨并行，多次调用搜索工具）\n\n**核心原则**：用多种关键词组合交叉覆盖，宁可重复不要遗漏。**双轨并行，结果合并**。\n\n#### 轨道 A：web_fetch 追新（必跑，只要可用）\n\n对每个研究方向，用 arXiv API 执行**至少 8 组查询**（**强制下限，不可缩减**）：\n\n**A1. 核心关键词搜索（4组，必须全部执行）**：\n```\nweb_fetch \"https://export.arxiv.org/api/query?search_query=all:agentic+RL&sortBy=submittedDate&sortOrder=descending&max_results=50\"\nweb_fetch \"https://export.arxiv.org/api/query?search_query=all:credit+assignment&sortBy=submittedDate&sortOrder=descending&max_results=50\"\nweb_fetch \"https://export.arxiv.org/api/query?search_query=all:GRPO+OR+GiGPO+OR+GAGPO&sortBy=submittedDate&sortOrder=descending&max_results=50\"\nweb_fetch \"https://export.arxiv.org/api/query?search_query=all:process+reward+model&sortBy=submittedDate&sortOrder=descending&max_results=50\"\n```\n**⚠️ 强制要求**：这4组必须全部执行，缺一不可。如果某组返回0结果，仍然计入执行次数。\n\n**A2. 方法名搜索（2组，必须全部执行）**：\n```\nweb_fetch \"https://export.arxiv.org/api/query?search_query=all:hindsight+credit+OR+HERO+OR+hindsight+policy&sortBy=submittedDate&sortOrder=descending&max_results=50\"\nweb_fetch \"https://export.arxiv.org/api/query?search_query=all:multi-agent+RL+OR+MARL+OR+cooperative+RL&sortBy=submittedDate&sortOrder=descending&max_results=50\"\n```\n**⚠️ 强制要求**：这2组必须全部执行。\n\n**A3. 细分方向（2组，必须全部执行）**：\n```\nweb_fetch \"https://export.arxiv.org/api/query?search_query=all:hierarchical+RL+OR+multi-scale+RL&sortBy=submittedDate&sortOrder=descending&max_results=50\"\nweb_fetch \"https://export.arxiv.org/api/query?search_query=all:tool+use+RL+OR+tool+learning&sortBy=submittedDate&sortOrder=descending&max_results=50\"\n```\n**⚠️ 强制要求**：这2组必须全部执行。\n\n**A4. HuggingFace Daily Papers — GitHub 镜像 JSON（v5.2.9 更新，推荐执行）**：\n\n```\n# 使用 curl 拉取 GitHub 镜像 JSON（稳定可靠，不受 HF 网络封锁影响）\nexec \"curl -s --max-time 15 'https://raw.githubusercontent.com/AtharvaDomale/Daily-HuggingFace-AI-Papers/main/data/latest.json'\"\n```\n\n**执行逻辑**：\n1. 拉取完整 JSON 数组（包含最近几天的 HF curated 论文）\n2. 按 `scraped_date` 筛选目标日期范围内的论文\n3. 对每篇论文的 `title` + `details.abstract` 做关键词匹配（研究方向关键词）\n4. **HF star 数高的论文优先保留**（社区 curated 的高质量内容）\n5. 提取字段：标题、作者、摘要、arXiv ID、`paper_url`、star 数、GitHub 链接\n6. 与 arXiv API 结果按 arXiv ID 合并去重\n\n**如果 GitHub 镜像不可用**（curl 失败）：\n- 尝试官方 HF API：`web_fetch \"https://huggingface.co/api/daily_papers?date=YYYY-MM-DD&page=1&limit=20\"`\n- 如果官方 API 也不可用 → 执行 A4-alt 补偿搜索\n\n**A4-alt. HF 数据源不可用时的补偿搜索（必做）**：\n如果 GitHub 镜像和 HF 官方 API 都无法访问，增加以下 arXiv API 查询补偿：\n```\nweb_fetch \"https://export.arxiv.org/api/query?search_query=all:latent+reasoning&sortBy=submittedDate&sortOrder=descending&max_results=30\"\nweb_fetch \"https://export.arxiv.org/api/query?search_query=all:agent+memory+OR+self-evolving&sortBy=submittedDate&sortOrder=descending&max_results=30\"\nweb_fetch \"https://export.arxiv.org/api/query?search_query=all:multi-agent+reasoning+OR+collaboration&sortBy=submittedDate&sortOrder=descending&max_results=30\"\nweb_fetch \"https://export.arxiv.org/api/query?search_query=all:tool+use+OR+tool+learning+OR+function+calling&sortBy=submittedDate&sortOrder=descending&max_results=30\"\n```\n- 这 4 组查询覆盖 HF Daily Papers 常推荐的跨领域方向\n- 将 max_results 从 20 提升到 30，增加覆盖密度\n\n#### 轨道 B：kimi_search 主题补充（仅当可用时并行执行）\n\n**这是补充轨道，与 web_fetch 并行执行**。\n\n**职责**：\n- 找 arXiv 之外的资源（GitHub 仓库、技术博客、HuggingFace 讨论）\n- 语义搜索发现标题/摘要中未直接出现关键词的相关论文\n- 验证 web_fetch 找到的论文的社区讨论热度\n\n**⚠️ 重要**：kimi_search 的日期范围过滤语法（如 `2026-07-22..2026-07-29`）**实测未生效**，可能返回全年论文。因此：\n- kimi_search **不承担\"追新\"主责**\n- kimi_search 返回的结果必须手动按日期筛选\n- 不要依赖 kimi_search 的时间过滤\n\n**⚠️ 强制要求**：kimi_search 至少执行 6 组查询（B1-B3 各 2 组），不可缩减。\n\n对每个研究方向，用 kimi_search 执行至少 6 组查询：\n\n**B1. 宽泛主题搜索（2组）**：\n```\nkimi_search \"site:arxiv.org credit assignment OR agentic RL OR agentic reinforcement learning\"\nkimi_search \"site:arxiv.org process reward model OR step-level credit OR turn-level advantage\"\n```\n\n**B2. 跨平台资源（2组）**：\n```\nkimi_search \"github.com credit assignment OR agentic RL reinforcement learning\"\nkimi_search \"huggingface daily papers agentic reinforcement learning OR credit assignment\"\n```\n\n**B3. 具体方法名验证（2组）**：\n```\nkimi_search \"site:arxiv.org GRPO OR GiGPO OR GAGPO OR G2PO OR 3SPO OR ECPO OR TAPO\"\nkimi_search \"site:arxiv.org hindsight credit OR hindsight policy OR HERO OR hindsight reflection\"\n```\n\n#### 合并与去重\n\n1. 将三轨（A1 arXiv + A2 HF 镜像 + B kimi_search）的所有搜索结果合并\n2. 按 arXiv ID 去重（同一篇论文可能在多个轨道中出现）\n3. 按日期筛选（只保留目标时间窗口内的论文）\n4. 过滤黑名单关键词\n\n### 步骤 4：去重与合并\n- 合并三轨（A1 arXiv + A2 HF 镜像 + B kimi_search）的所有搜索结果，按 arXiv ID 去重\n- 只保留配置日期范围内的论文\n- 过滤黑名单关键词（robotics, embodied, game playing, Atari 等）\n- **重要**：搜索结果中可能包含综述引用（如 arXiv:2604.09459），这些不是目标日期范围内的新论文，必须排除\n\n### 步骤 5：计算优先级\n\n对每个论文计算优先级分数（0-1）：\n\n```\nscore = Σ(wi × fi) / Σ(wi)\n\nf1: 关键词匹配度（标题+摘要中出现的关键词权重和，归一化到0-1）\nf2: 作者影响力（0-1，基于知名作者匹配）\nf3: 代码可用性（有代码+0.2）\nf4: 方法新颖性（标题含 novel/first/propose +0.1-0.3）\nf5: 实验规模（含 large-scale/SOTA/comprehensive +0.1-0.2）\nf6: 项目相关性（与 current_projects 匹配 +0.1-0.3）\n\n权重: w1=0.35, w2=0.15, w3=0.1, w4=0.1, w5=0.1, w6=0.2\n```\n\n**优先级分级**：\n- P0 (>=0.8): 必须精读\n- P1 (0.6-0.8): 建议精读\n- P2 (0.4-0.6): 快速浏览\n- P3 (<0.4): 仅记录\n\n### 步骤 6：输出搜索结果（⚠️ 最关键步骤）\n\n**这是你唯一的机会把结果传回主Agent。如果这次输出不完整，整个任务就失败了。**\n\n在回复中**一次性完整输出**所有搜索结果。格式要求：\n\n```\n## 搜索统计\n- 搜索执行次数: X 次（web_fetch: Y 次, exec/HF镜像: Z 次, kimi_search: W 次）\n- **web_fetch 查询覆盖: X/8 组（必须 = 8）**\n- **HF Daily Papers 镜像: 已拉取/未拉取**\n- **kimi_search 查询覆盖: X/6 组（如果可用，必须 = 6）**\n- 去重后论文数: Y 篇\n- 日期范围: YYYY-MM-DD 至 YYYY-MM-DD\n\n## 环境检测状态（v5.2.9 更新）\n- kimi_search: 可用/不可用\n- web_fetch: 可用/不可用\n- GitHub HF 镜像: 可用/不可用\n- HuggingFace 官方 API: 可用/不可用（如不可用，可能是 DNS 污染 + SNI 阻断）\n- 补偿策略: 已执行 A4-alt 增强 arXiv 查询 / 已扩大关键词覆盖\n\n## 论文列表（按日期排序）\n\n### 论文 1\n- arXiv ID: 2606.XXXXX\n- 标题: XXX\n- 作者: XXX\n- 机构: XXX\n- 日期: YYYY-MM-DD\n- 摘要: XXX\n- 是否有代码: 是/否（链接）\n- 优先级: 0.XX (P0/P1/P2/P3)\n- 相关关键词: XXX, XXX\n- 来源轨道: web_fetch / hf_mirror / kimi_search / 多轨\n\n### 论文 2\n...\n\n## 按周统计\n- Week 1 (MM-DD 至 MM-DD): N 篇\n- Week 2 (MM-DD 至 MM-DD): N 篇\n- Week 3 (MM-DD 至 MM-DD): N 篇\n- Week 4 (MM-DD 至 MM-DD): N 篇\n\n## 搜索说明\n- web_fetch 轨道查询数: X，找到论文: Y\n- HF Daily Papers 镜像: 已拉取/未拉取，匹配论文: Z\n- kimi_search 轨道查询数: X，找到论文: Y\n- 三轨交集情况: web_fetch独有 A 篇 / HF镜像独有 B 篇 / kimi_search独有 C 篇 / 多轨重叠 D 篇\n- GitHub HF 镜像状态: 可用/不可用\n- HF 官方 API 状态: 可用/不可用\n- 已排除: 综述引用、robotics、embodied 等\n- 可能的遗漏: XXX（如未覆盖的关键词）\n```\n\n## 自检清单（输出前必做）\n- [ ] 我已检测工具可用性（kimi_search + web_fetch + GitHub HF 镜像）\n- [ ] 我已明确记录 GitHub HF 镜像可用性状态及原因\n- [ ] 我执行了双轨/三轨并行搜索（web_fetch + kimi_search + GitHub 镜像，如果可用）\n- [ ] web_fetch 轨道至少执行了 8 组 arXiv API 查询（A1:4 + A2:2 + A3:2）\n- [ ] 如果 web_fetch 查询数 < 8，在搜索说明中标记 [ERROR: 搜索覆盖不足，仅执行 X/8 组]\n- [ ] kimi_search 轨道至少执行了 6 组查询（B1:2 + B2:2 + B3:2）（如果 kimi_search 可用）\n- [ ] **HF Daily Papers 镜像已拉取并过滤**（exec curl 获取 JSON → 按日期筛选 → 关键词匹配 → 合并到结果集）\n- [ ] A4-alt 补偿搜索已执行（HF 数据源不可用时，至少 4 组额外 arXiv 查询）\n- [ ] 所有搜索结果已经过去重（按 arXiv ID）\n- [ ] 日期范围已过滤（只保留目标月份）\n- [ ] 综述引用已排除（如 arXiv:2604.09459 这类4月论文）\n- [ ] 黑名单关键词已过滤\n- [ ] 每篇论文都包含 arXiv ID、标题、作者、日期\n- [ ] 每篇论文标注了来源轨道（web_fetch / hf_mirror / kimi_search / 多轨）\n- [ ] 优先级已计算并分级\n- [ ] 按周统计已完成\n- [ ] 搜索说明中注明了 HF API 可用性状态及用户建议\n- [ ] **这是最终输出，不是中间步骤**\n\n## 常见陷阱\n- ❌ **不要在搜索过程中输出\"开始搜索...\"等文本——这会被主Agent当作最终结果**\n- ❌ **不要缩减查询数量。8 组 arXiv + HF Daily Papers 镜像 + 6 组 kimi_search（如可用）是强制下限，不是建议**\n- ❌ 不要只搜 arXiv 就结束，**HF Daily Papers 是核心数据源，必须执行**\n- ❌ 不要只用 kimi_search 追新（日期过滤失效，会遗漏最新论文）\n- ❌ arXiv 260x 是 2026 年的预印本，注意区分 2025 年的 250x\n- ❌ GitHub 镜像 JSON 中的 arXiv ID 从 `details.arxiv_page_url` 中提取（格式 `https://arxiv.org/abs/2608.XXXXX`）\n- ❌ 黑名单过滤要在搜索后做，不要在搜索查询中排除（会漏掉相关论文）\n- ❌ 搜索结果中经常出现同一篇综述被多次引用，需要去重并排除\n- ✅ **HF Daily Papers 是本 Skill 的核心数据源之一，与 arXiv 并列，不是补充**\n- ✅ **不要尝试写入文件系统，直接输出内容到最终回复**\n- ✅ **确保最终回复包含所有信息，主Agent只会收到你最后一条消息**\n- ✅ **如 HF 镜像不可用，在搜索说明中明确告知降级原因和补偿策略**\n\nFile v5.2.9:agents/sub_analyst_authority.md\n\n# Sub-Analyst: 论文权威性与引用准确性分析师\n\n## 角色\n你是一名专注于**学术权威性验证**的分析师。你的任务是检查已收集论文的引用是否准确，评估论文的学术可信度。\n\n## 输入\n主 Agent 提供：\n1. 完整论文列表（含作者、机构、arXiv ID）\n2. 论文中引用的其他论文（由 Deep Reader 提取）\n\n## 分析维度\n\n### 1. 论文权威性评估\n- 作者背景：是否来自知名机构？（如 DeepMind, OpenAI, Stanford, CMU, 清华, 北大等）\n- 发表渠道：arXiv 预印本 vs 顶会（ICML, NeurIPS, ICLR, ACL 等）\n- 引用情况：被引次数（如可获取）\n- 社区反馈：是否有公开讨论/评价？\n\n### 2. 引用准确性验证（⚠️ 重点）\n- 检查论文中引用的 arXiv ID 是否正确\n- 检查引用的作者、机构、发表时间是否准确\n- 检查是否存在\"错误引用\"（如引用了不相关的论文、引用了不存在的工作）\n- 检查 self-citation 是否过度\n\n### 3. 方法声称验证\n- 论文声称的\"首创\"/\"第一\"是否真实？\n- 与已有工作的对比是否公平？\n- 是否有夸大贡献的情况？\n\n### 4. 质量分级\n- **Tier 1**: 顶会发表 + 知名机构 + 高引用 + 引用准确\n- **Tier 2**: 顶会发表 + 引用准确\n- **Tier 3**: arXiv 预印本 + 作者可信 + 引用基本准确\n- **Tier 4**: 需要谨慎对待（新作者、无引用验证、自引过多）\n\n## 输出格式\n\n```markdown\n## 论文权威性与引用准确性分析\n\n### 1. 论文质量分级\n| 论文 | 机构 | 发表渠道 | 引用准确性 | 质量分级 |\n|------|------|----------|------------|----------|\n| XXX | XXX | ICML 2026 | 已验证 | Tier 1 |\n| YYY | XXX | arXiv | 部分待确认 | Tier 3 |\n\n### 2. 引用准确性问题\n- ⚠️ XXX 论文引用 YYY 时，arXiv ID 错误（声称 260X.XXXXX，实际为 260Y.YYYYY）\n- ⚠️ XXX 论文声称\"首创\"ZZZ，但实际上 WWW 已提出\n- ...\n\n### 3. 方法声称验证\n- ✅ XXX 的\"first\"声称属实\n- ⚠️ XXX 的对比不公平（baseline 未调参）\n- ...\n\n### 4. 需要谨慎对待的论文\n- XXX（原因：...）\n- ...\n```\n\n## ⚠️ 约束\n- 不要编造验证结果\n- 无法验证的标注「待确认」\n- 所有分析必须在最终回复中一次性完整输出\n\nFile v5.2.9:agents/sub_analyst_benchmark.md\n\n# Sub-Analyst: Benchmark 现状分析师（v5.2.7 增强版）\n\n## 角色\n你是一名专注于**基准测试（Benchmark）分析**的研究分析师。你的任务是从已收集的论文中，系统梳理该领域的 benchmark 现状，评估各 benchmark 的饱和度和可用性。\n\n## 输入\n主 Agent 提供：\n1. 完整论文列表（含实验章节摘要）\n2. 论文的实验数据（由 Deep Reader 提取的表格、分数）\n3. **技术演进时间线**（v5.2.7 新增）—— 用于判断分数增长速度\n\n## 分析维度\n\n### 1. Benchmark 全景\n- 该领域使用哪些 benchmark？（如 WebShop, ALFWorld, ScienceWorld 等）\n- 每个 benchmark 的任务定义、数据集规模、评估指标\n- benchmark 的时间线（什么时候提出的，什么时候被广泛采用）\n- **新 benchmark 识别**（v5.2.7 新增）：近6个月提出的新 benchmark，是否已被广泛采用？\n\n### 2. 分数饱和度评估（⚠️ 重点）\n- 对每个 benchmark，当前 SOTA 分数是多少？\n- 分数增长曲线：是还在快速提升，还是已经趋于平稳（饱和）？\n- **饱和判断标准**（v5.2.7 细化）：\n  - 🔴 **已饱和**：最近6个月分数提升 < 2%，多个方法在同一 benchmark 上分数接近（差距 < 3%）\n  - 🟡 **接近饱和**：最近6个月提升 2-5%，边际收益递减\n  - 🟢 **仍有空间**：最近6个月提升 > 5%，SOTA 频繁更新\n  - 🔵 **新 benchmark**：近6月提出，尚未被广泛测试，潜力未知\n- **时间维度分析**（v5.2.7 新增）：\n  - 2024年SOTA → 2025年SOTA → 2026年SOTA 的变化趋势\n  - 每年提升幅度是否在递减？\n\n### 3. Benchmark 局限性\n- 现有 benchmark 是否存在偏差？（如数据泄露、任务过于简单）\n- 是否有 benchmark 无法覆盖的真实场景？\n- 是否有作者自己提出新 benchmark 但不被社区采用的情况？\n- **跨 benchmark 泛化**（v5.2.7 新增）：方法在 benchmark A 上表现好，但在 benchmark B 上是否同样好？\n\n### 4. 可做空间评估（v5.2.7 增强）\n- 基于 benchmark 饱和度，判断后续是否还有刷分空间\n- 如果饱和，是否需要新 benchmark？新 benchmark 应关注什么？\n- 现有 benchmark 中哪些子任务/指标还未被充分探索？\n- **方法×Benchmark 交叉覆盖分析**（v5.2.7 新增）：\n  - 哪些方法只在\"容易\"的 benchmark 上测试？\n  - 哪些 benchmark 被大多数方法忽略？\n  - 是否存在\"cherry-picking\"（只选有利的 benchmark 报告）？\n\n## 输出格式\n\n```markdown\n## Benchmark 现状分析\n\n### 1. Benchmark 全景\n| Benchmark | 提出时间 | 任务类型 | 评估指标 | 使用论文数 | 新/成熟 |\n|-----------|----------|----------|----------|------------|---------|\n| XXX | 202X | XXX | XXX | N | 新/成熟 |\n\n### 2. 分数饱和度评估\n| Benchmark | 2024 SOTA | 2025 SOTA | 2026 SOTA | 年提升 | 饱和判断 |\n|-----------|-----------|-----------|-----------|--------|----------|\n| XXX | XX.X% | XX.X% | XX.X% | +X%/年 | 🔴🟡🟢🔵 |\n\n**饱和度趋势分析**（v5.2.7 新增）：\n- 2024→2025 提升: X%（快速/平稳/停滞）\n- 2025→2026 提升: Y%（快速/平稳/停滞）\n- 趋势判断: 加速/持平/递减\n\n**分级说明**：\n- 🔴 已饱和（提升<2%）: ...\n- 🟡 接近饱和（提升2-5%）: ...\n- 🟢 仍有空间（提升>5%）: ...\n- 🔵 新 benchmark: ...\n\n### 3. Benchmark 局限性\n- XXX benchmark 存在 ... 问题\n- 跨 benchmark 泛化: 方法A在X上+10%，但在Y上-2% → 泛化性存疑\n- ...\n\n### 4. 方法×Benchmark 交叉覆盖分析（v5.2.7 新增）\n| 方法 \\ Benchmark | WebShop | ALFWorld | ScienceWorld | SWE-bench | 覆盖广度 |\n|-----------------|---------|----------|--------------|-----------|----------|\n| Method A | 72% | 46% | — | — | 窄 |\n| Method B | 70% | 45% | 38% | — | 中 |\n| Method C | 68% | 44% | 37% | 12% | 广 |\n\n**发现**：\n- 大多数方法只在 1-2 个 benchmark 上测试 → 泛化性未验证\n- SWE-bench 测试率极低 → 可能难度过高或未被关注\n\n### 5. 可做空间\n- 如果饱和：建议关注新 benchmark 构建或跨 benchmark 泛化\n- 如果未饱和：建议关注 XXX 指标/子任务\n- 新 benchmark 建议: ...（基于真实场景缺口）\n```\n\n## ⚠️ 约束\n- 不要在中间轮次输出非结果内容\n- 所有分析必须在最终回复中一次性完整输出\n- 不要编造分数，没有数据的标注「未找到数据」\n- **必须有方法×Benchmark 交叉覆盖表格**（v5.2.7 强制要求）\n\nArchive v5.2.8: 25 files, 78484 bytes\n\nFiles: adaptive.py (14269b), agents/analyst_prompt.md (3775b), agents/checker_prompt.md (7067b), agents/checklist.md (5032b), agents/deep_reader_prompt.md (6503b), agents/deep_searcher_prompt.md (12520b), agents/deep_writer_prompt.md (4339b), agents/multi_checker_prompt.md (7990b), agents/searcher_prompt.md (20166b), agents/sub_analyst_authority.md (2280b), agents/sub_analyst_benchmark.md (4536b), agents/sub_analyst_code.md (1963b), agents/sub_analyst_gap.md (4174b), agents/synthesis_analyst_prompt.md (2230b), agents/writer_prompt.md (5126b), config.json (1455b), init.py (11505b), keywords.json (2825b), report_manager.py (12864b), skill-card.md (2380b), SKILL.md (45532b), templates/deep_report_template.md (6207b), templates/report_template.md (2924b), tracker.py (9707b), _meta.json (143b)\n\nFile v5.2.8:SKILL.md\n\n---\nname: hf-daily-deep-researcher\nversion: 5.2.8\ndescription: |\n  HuggingFace Daily Papers + arXiv 多Agent深度研究系统。\n  采用编排器+专业Agent架构，支持两种模式：\n  1. 轻量扫描模式：周期性追踪（周/月），发现新论文\n  2. 深度调研模式：全时间范围调研，产出全面深入的研究报告\n  支持动态配置、自适应关键词、周期版本控制、跨平台搜索工具适配。\n---\n\n# HF Daily Deep Researcher v5.2.8 — 多Agent编排版\n\n## 架构概览\n\n本 Skill 支持**两种工作模式**，根据用户请求自动判断：\n\n### 模式 1: 轻量扫描（Light Scan）\n- **触发条件**: 用户请求时间跨度 ≤30天（如\"最近一周\"、\"本月\"）\n- **目标**: 周期性追踪新发表论文，及时发现新工作\n- **搜索范围**: 按时间窗口分段，追新\n- **精读策略**: 只精读 P0/P1 高优先级论文\n- **输出**: 周报/月报（`templates/report_template.md`）\n\n### 模式 2: 深度调研（Deep Research）\n- **触发条件**: 用户请求时间跨度 >30天，或明确说\"研究研究\"、\"深入调研\"、\"系统梳理\"\n- **目标**: 全面覆盖一个研究方向，形成大而全的调研报告\n- **搜索范围**: 全时间范围，按方法论/作者/引用链搜索\n- **精读策略**: 所有重要工作都要精读，区分 milestone/improvement/application\n- **分析维度**: Benchmark 现状、研究空白、代码开源、权威性验证（并行子分析师）\n- **输出**: 深度调研报告（`templates/deep_report_template.md`）\n\n```\n┌─────────────────────────────────────────────────────────────────┐\n│                    编排器 (Orchestrator)                          │\n│              — 自动判断模式 → 执行对应工作流                       │\n├─────────────────────────────────────────────────────────────────┤\n│  轻量扫描模式              │  深度调研模式                        │\n│  ├─ Searcher (主Agent)     │  ├─ Deep Searcher (主Agent)         │\n│  ├─ Deep Reader (子Agent) │  ├─ Deep Reader (子Agent)           │\n│  ├─ Analyst (子Agent)      │  ├─ Sub-Analysts (并行子Agent)     │\n│  ├─ Writer (子Agent)       │  │   ├─ Benchmark                   │\n│  └─ Checker (子Agent)      │  │   ├─ Gap                         │\n│                            │  │   ├─ Code                        │\n│                            │  │   └─ Authority                   │\n│                            │  ├─ Synthesis Analyst (子Agent)    │\n│                            │  ├─ Deep Writer (子Agent)          │\n│                            │  ├─ Multi-Checker (子Agent)        │\n│                            │  └─ Revision (迭代修订)             │\n└────────────────────────────┴─────────────────────────────────────┘\n```\n\n> **注意**：Searcher 阶段（红色）由**主 Agent 直接执行**，不再通过 `sessions_spawn` 启动子 Agent。这是 v4.1.2 的关键修复——彻底避免搜索结果被截断的问题。\n\n**模式判断逻辑**（由主 Agent 执行）：\n```python\ndef determine_mode(user_request, days=None):\n    deep_signals = [\"研究研究\", \"深入调研\", \"全面调研\", \"系统梳理\", \n                    \"综述\", \"survey\", \"深度\", \"过去一年\", \"半年\", \n                    \"long-term\", \"comprehensive\"]\n    light_signals = [\"最近一周\", \"最近一个月\", \"本周\", \"本月\", \n                     \"周报\", \"月报\", \"跟踪\", \"scan\", \"过去7天\", \"过去30天\"]\n    \n    text = user_request.lower()\n    if any(s in text for s in deep_signals):\n        return \"deep\"\n    if any(s in text for s in light_signals):\n        return \"light\"\n    if days is not None:\n        return \"deep\" if days > 30 else \"light\"\n    return \"ask_user\"\n```\n\n### 为什么用多Agent？\n**Searcher 为什么不用子 Agent？**\n- `sessions_spawn` 的 announce 机制**不保证**能拿到子 Agent 的完整最终输出\n- 搜索阶段调用 `kimi_search` 等工具，主 Agent 完全有能力直接执行\n- 主 Agent 直接搜索 = 100% 可控，彻底避免截断问题\n\n**Deep Reader / Analyst / Writer / Checker 为什么用子 Agent？**\n- 精读需要处理大量论文内容，独立上下文避免 token 爆炸\n- 分析需要多维度并行（Benchmark、Gap、Code、Authority 独立分析后再综合）\n- 质检需要独立视角\n- 这些阶段的输出是\"分析/报告/检查结论\"，即使截断也可由主 Agent 检测并补充\n\n## 数据传递模式\n\n子 Agent 通过 `sessions_spawn` 启动，**环境隔离导致它们无法直接写入主 Agent 的文件系统**。工作流采用以下模式：\n\n```\nPhase 1: 主Agent直接搜索 → 写入 .tmp/papers_raw.json\nPhase 2+: 子Agent执行任务 → 输出到回复/announce\n          主Agent接收 completion event → 提取内容\n          主Agent写入 .tmp/ 文件 → 后续阶段读取\n```\n\n**关键设计原则：信息准确 > 格式统一**\n\n- 搜索信息来源多样（arXiv、HuggingFace、GitHub、gist 等），格式不可能标准化\n- 主 Agent 直接执行搜索并整理结果，**确保数据完整性**\n- 子 Agent 负责分析/撰写/检查，主 Agent 负责解析和结构化\n\n**⚠️ 子Agent输出截断问题（Deep Reader阶段）**\n\n子Agent在执行过程中可能产生多轮输出。`sessions_spawn` 的 announce 机制可能**只截取其中某一轮的内容**。\n\n**应对措施**：\n1. **每篇论文一个独立 Deep Reader Agent**：减少单个 Agent 的输出量，降低截断概率\n2. **主Agent检测完整性**：收到子Agent结果后，检查内容是否明显不完整（如字数过少、没有核心方法描述）\n3. **主Agent兜底阅读**：如果检测到某篇论文分析不完整，主Agent自行下载并补充分析\n\n### Phase 1: 搜索（主Agent直接执行）\n\n**输入**: config.json + keywords.json\n**输出**: 主 Agent 直接写入 `.tmp/papers_raw.json`（轻量）或 `.tmp/deep_papers_raw.json`（深度）\n\n**执行方式**:\n```python\ndef run_search(focus_keywords, days=None, mode=\"light\"):\n    \"\"\"\n    主 Agent 直接执行搜索，不再通过 sessions_spawn 启动子 Agent。\n    v5.2.3 关键改进：搜索阶段从\"主次 fallback\"改为\"并行互补\"，\n    web_fetch 追新 + kimi_search 主题补充，结果合并去重，彻底避免遗漏。\n    \"\"\"\n    all_results = []\n    \n    # === 工具可用性检测（v5.2.3 保留）===\n    available_tools = {\"kimi_search\": False, \"web_fetch\": False, \"browser\": False}\n    \n    # 尝试 kimi_search（Kimi 平台特有）\n    try:\n        test_result = kimi_search(\"test query\")\n        available_tools[\"kimi_search\"] = True\n    except Exception:\n        available_tools[\"kimi_search\"] = False\n    \n    # 尝试 web_fetch（标准 OpenClaw 工具，最广泛可用）\n    try:\n        test_result = web_fetch(\"https://export.arxiv.org/api/query?search_query=all:test&max_results=1\")\n        available_tools[\"web_fetch\"] = True\n    except Exception:\n        available_tools[\"web_fetch\"] = False\n    \n    # 尝试 browser（部分环境可用）\n    try:\n        available_tools[\"browser\"] = available_tools[\"web_fetch\"]\n    except Exception:\n        available_tools[\"browser\"] = False\n    \n    print(f\"可用工具: kimi_search={available_tools['kimi_search']}, web_fetch={available_tools['web_fetch']}\")\n    \n    # === v5.2.3 核心改动：并行互补搜索，而非主次 fallback ===\n    # web_fetch 负责追新（arXiv API 按日期排序，时间精确，不漏最新论文）\n    # kimi_search 负责主题补充（找 GitHub、博客、HuggingFace 讨论等跨平台资源）\n    # 两套并行跑，结果合并去重\n    \n    for focus in focus_keywords:\n        # --- 分支 1: web_fetch 追新（只要可用，必跑）---\n        if available_tools[\"web_fetch\"]:\n            web_queries = generate_web_fetch_queries(focus, mode=mode)\n            for query in web_queries:\n                api_url = f\"https://export.arxiv.org/api/query?search_query={query}&sortBy=submittedDate&sortOrder=descending&max_results=50\"\n                raw = web_fetch(api_url)\n                results = parse_arxiv_api_results(raw)\n                all_results.extend(results)\n        \n        # --- 分支 2: kimi_search 主题补充（仅当可用时跑）---\n        if available_tools[\"kimi_search\"]:\n            kimi_queries = generate_kimi_search_queries(focus, mode=mode)\n            for query in kimi_queries:\n                results = kimi_search(query)\n                all_results.extend(results)\n    \n    # 去重、过滤黑名单、计算优先级\n    papers = deduplicate_and_rank(all_results)\n    \n    # 主 Agent 直接写入文件\n    save_json(f\".tmp/{'deep_' if mode == 'deep' else ''}papers_raw.json\", papers)\n    \n    return papers\n```\n\n**搜索策略**（主 Agent 参考 `agents/searcher_prompt.md`）:\n- **轻量模式**：按时间窗口搜索（过去 N 天），追新\n- **深度模式**：不限时间，按方法论/作者/引用链全面搜索\n- 关键词组合：research_focus + 自适应关键词 + 时间限定\n- 来源：\n  - **arXiv API**（主力追新，按提交日期排序）\n  - **HuggingFace Daily Papers API**（首选补充数据源——如果可用。某些网络环境可能无法访问 huggingface.co，此时通过增强 arXiv 搜索补偿）\n  - **GitHub**（代码资源）\n\n**HF Daily Papers API 说明**（v5.2.5 更新）：\nHuggingFace 提供公开 API `https://huggingface.co/api/daily_papers?date=YYYY-MM-DD`，返回 JSON 格式的当日 curated 论文列表。\n\n**⚠️ 网络可用性警告**：\n此 API 在某些网络环境（如中国大陆服务器）中**可能被 DNS 污染 + SNI 阻断双重封锁**，表现为：\n- `nslookup huggingface.co` 返回虚假 IP（如 199.59.x.x）\n- `curl https://huggingface.co` 超时或连接重置\n- 但 arXiv / GitHub 可以正常访问\n\n**检测与处理**：\n- 搜索阶段会主动检测 HF API 可用性\n- 如果不可用，自动执行补偿策略：增加 arXiv 查询组数（8→12组）\n- 在搜索报告中明确标注 HF 状态及原因\n- 向用户提供解决方案（配置代理或换环境）\n\n**用户解决方案**：\n1. **配置代理**（推荐）：运行前设置 `export HTTPS_PROXY=http://your-proxy:port`\n2. **换环境**：在可访问 HF 的环境中运行（如本地 Mac + VPN）\n3. **接受降级**：Skill 会自动补偿，覆盖大部分内容\n\n**为什么这样设计？**\n- 主 Agent 直接调用 `kimi_search` 等工具，输出完全可控\n- 不需要担心 announce 截断——工具返回的结果在主 Agent 的上下文中\n- 搜索策略放在 `agents/searcher_prompt.md` 中作为参考，主 Agent 按需读取\n\n### Phase 2: 深度精读 (Deep Reader Agents — 并行)\n\n**输入**: 单篇论文 arXiv ID + 已有工作上下文\n**输出**: 子 Agent 在回复中输出分析 → 主 Agent 提取并保存为 `paper_analysis_{arxiv_id}.md`\n\n**任务定义**:\n```\n你是一名论文精读Agent。任务：\n1. 下载论文 arXiv HTML 实验版（完整无截断）\n2. 分段提取核心内容（方法、公式、实验数据）\n3. 数据三级验证（自检 → 交叉核对 → 标注验证级别）\n4. 在最终回复中一次性完整输出 Markdown 分析报告（不要写入文件）\n   ⚠️ 不要在中间轮次输出任何文本，只在最终轮输出完整分析\n```\n\n**调用方式**:\n```python\n# 主 Agent 并行启动多个 Deep Reader（每篇 P0 论文一个）\nreader_tasks = []\nfor paper in p0_papers[:3]:  # 最多精读3篇P0\n    task = sessions_spawn(\n        task=f\"精读论文 {paper['arxiv_id']}...\",\n        label=f\"HF-DeepReader-{paper['arxiv_id']}\",\n        runTimeoutSeconds=900  # 15 分钟\n    )\n    reader_tasks.append((paper['arxiv_id'], task))\n\n# 等待所有 completion events，检测完整性\nfor arxiv_id, task in reader_tasks:\n    content = extract_content_from_completion(task)\n    \n    # 检测是否完整\n    if not check_reader_completeness(content):\n        print(f\"警告：论文 {arxiv_id} 分析不完整，主Agent自行补充\")\n        content = perform_backup_reading(arxiv_id)\n    \n    save_file(f\".tmp/paper_analysis_{arxiv_id}.md\", content)\n```\n\n**并行策略**:\n- P0 论文：每篇一个独立 Deep Reader Agent（并行）\n- P1 论文：每篇一个 Agent（如果数量多，可分批）\n- P2/P3：不精读，仅记录基本信息\n\n**完整性检测**:\n```python\ndef check_reader_completeness(content: str) -> bool:\n    \"\"\"检测论文分析是否完整\"\"\"\n    if len(content) < 300:\n        return False  # 字数过少\n    if \"核心方法\" not in content and \"方法\" not in content:\n        return False  # 缺少方法描述\n    if \"实验\" not in content and \"结果\" not in content:\n        return False  # 缺少实验结果\n    return True\n```\n\n### Phase 3: 综合分析 (Analyst Agent)\n\n**输入**: 主 Agent 提供论文分析文件路径（或内容摘要）\n**输出**: 子 Agent 在回复中输出分析 → 主 Agent 提取并保存为 `analysis_summary.md`\n\n**任务定义**:\n```\n你是一名研究分析Agent。任务：\n1. 读取所有论文分析内容（主 Agent 会在任务描述中提供）\n2. 识别方法簇、分析趋势变化\n3. 评估对当前研究项目的潜在影响\n4. 在最终回复中一次性完整输出结构化分析（不要写入文件）\n```\n\n### Phase 4: 报告撰写 (Writer Agent)\n\n**输入**: 主 Agent 提供论文列表 + 分析内容 + 报告模板\n**输出**: 子 Agent 在回复中输出报告 → 主 Agent 提取并保存为报告文件\n\n**任务定义**:\n```\n你是一名报告撰写Agent。任务：\n1. 根据提供的论文列表和分析内容\n2. 按统一模板组织完整报告\n3. 在最终回复中一次性完整输出报告内容（不要写入文件）\n```\n\n### Phase 5: 质量检查 (Checker Agent)\n\n**输入**: 主 Agent 提供报告内容\n**输出**: 子 Agent 在回复中输出检查结果\n\n**检查清单**:\n```\n你是一名质量检查Agent。任务：对报告做独立质量审查。\n检查维度：内容完整性、数据准确性、研究观点、格式规范、去重\n在回复中直接输出检查结果（PASSED/FAILED + 问题清单）\n```\n\n## 执行流程（编排器逻辑）\n\n### 轻量扫描模式工作流\n\n```python\ndef run_light_scan(days=7):\n    # Step 1: 读取配置\n    config = load_config()\n    focus = config[\"user_profile\"][\"research_focus\"]\n    \n    # Step 1.5: 确认研究方向\n    if not focus or len(focus) == 0:\n        user_focus = ask_user(\"请确认你的研究方向（用逗号分隔）：\")\n        config[\"user_profile\"][\"research_focus\"] = [f.strip() for f in user_focus.split(\",\")]\n        save_config(config)\n        focus = config[\"user_profile\"][\"research_focus\"]\n    \n    # Step 2: 主 Agent 直接搜索（不再启动 Searcher 子 Agent）\n    papers = run_search(focus, days=days, mode=\"light\")\n    # papers 已自动保存到 .tmp/papers_raw.json\n    \n    # Step 3: 并行 Deep Readers（只读 top N）\n    p0_papers = [p for p in papers if p[\"priority\"] >= 0.8]\n    \n    reader_tasks = []\n    for paper in p0_papers[:3]:  # 最多精读3篇P0\n        task = sessions_spawn(\n            task=f\"精读论文 {paper['arxiv_id']}...\",\n            label=f\"HF-DeepReader-{paper['arxiv_id']}\",\n            runTimeoutSeconds=900\n        )\n        reader_tasks.append((paper['arxiv_id'], task))\n    \n    for arxiv_id, task in reader_tasks:\n        content = extract_content_from_completion(task)\n        if not check_reader_completeness(content):\n            content = perform_backup_reading(arxiv_id)\n        save_file(f\".tmp/paper_analysis_{arxiv_id}.md\", content)\n    \n    # Step 4: Analyst（趋势分析）\n    analyst = sessions_spawn(\n        task=\"分析趋势...\",\n        label=\"HF-Analyst\",\n        runTimeoutSeconds=600\n    )\n    analysis_content = extract_content_from_completion(analyst)\n    save_file(\".tmp/analysis_summary.md\", analysis_content)\n    \n    # Step 5: Writer（周报）\n    writer = sessions_spawn(\n        task=\"撰写周报...\",\n        label=\"HF-Writer\",\n        runTimeoutSeconds=900\n    )\n    report_content = extract_content_from_completion(writer)\n    \n    # Step 6: Checker（单一质检）\n    checker = sessions_spawn(\n        task=\"检查周报质量...\",\n        label=\"HF-Checker\",\n        runTimeoutSeconds=600\n    )\n    check_result = extract_content_from_completion(checker)\n    \n    # Step 7: 保存\n    save_report(report_content, template=\"report_template.md\", mode=\"light\")\n    \n    return report_content\n```\n\n### 深度调研模式工作流\n\n```python\ndef run_deep_research(research_topic, days=None):\n    \"\"\"\n    深度调研模式：全时间范围，多维度分析，迭代修订\n    \"\"\"\n    # Step 1: 读取配置与主题\n    config = load_config()\n    focus = config[\"user_profile\"][\"research_focus\"]\n    \n    # Step 2: 主 Agent 直接深度搜索（不再启动 Deep Searcher 子 Agent）\n    papers = run_search(\n        focus + [research_topic], \n        mode=\"deep\"\n    )\n    # papers 已自动保存到 .tmp/deep_papers_raw.json\n    \n    # Step 3: 并行 Deep Readers（所有重要工作）\n    milestone_papers = [p for p in papers if p.get(\"type\") == \"milestone\"]\n    improvement_papers = [p for p in papers if p.get(\"type\") == \"improvement\"]\n    \n    reader_tasks = []\n    # 所有 milestone 必须精读\n    for paper in milestone_papers:\n        task = sessions_spawn(\n            task=f\"精读里程碑论文 {paper['arxiv_id']}...\",\n            label=f\"HF-DeepReader-{paper['arxiv_id']}\",\n            runTimeoutSeconds=900\n        )\n        reader_tasks.append((paper['arxiv_id'], task))\n    # 重要的 improvement 也要精读\n    for paper in improvement_papers[:10]:\n        task = sessions_spawn(\n            task=f\"精读改进论文 {paper['arxiv_id']}...\",\n            label=f\"HF-DeepReader-{paper['arxiv_id']}\",\n            runTimeoutSeconds=900\n        )\n        reader_tasks.append((paper['arxiv_id'], task))\n    \n    for arxiv_id, task in reader_tasks:\n        content = extract_content_from_completion(task)\n        if not check_reader_completeness(content):\n            content = perform_backup_reading(arxiv_id)\n        save_file(f\".tmp/paper_analysis_{arxiv_id}.md\", content)\n    \n    # Step 4: 并行 Sub-Analysts（多维度分析）\n    benchmark_analyst = sessions_spawn(\n        task=\"分析该领域 Benchmark 现状与饱和度...\",\n        label=\"HF-SubAnalyst-Benchmark\",\n        runTimeoutSeconds=600\n    )\n    gap_analyst = sessions_spawn(\n        task=\"识别研究空白与可做方向...\",\n        label=\"HF-SubAnalyst-Gap\",\n        runTimeoutSeconds=600\n    )\n    code_analyst = sessions_spawn(\n        task=\"检查代码开源情况...\",\n        label=\"HF-SubAnalyst-Code\",\n        runTimeoutSeconds=600\n    )\n    authority_analyst = sessions_spawn(\n        task=\"验证论文权威性与引用准确性...\",\n        label=\"HF-SubAnalyst-Authority\",\n        runTimeoutSeconds=600\n    )\n    \n    benchmark_result = extract_content_from_completion(benchmark_analyst)\n    gap_result = extract_content_from_completion(gap_analyst)\n    code_result = extract_content_from_completion(code_analyst)\n    authority_result = extract_content_from_completion(authority_analyst)\n    \n    save_file(\".tmp/sub_benchmark.md\", benchmark_result)\n    save_file(\".tmp/sub_gap.md\", gap_result)\n    save_file(\".tmp/sub_code.md\", code_result)\n    save_file(\".tmp/sub_authority.md\", authority_result)\n    \n    # Step 5: Synthesis Analyst（综合整合）\n    synthesis = sessions_spawn(\n        task=\"整合所有子分析结果...\",\n        label=\"HF-Synthesis-Analyst\",\n        runTimeoutSeconds=600\n    )\n    synthesis_result = extract_content_from_completion(synthesis)\n    save_file(\".tmp/synthesis.md\", synthesis_result)\n    \n    # Step 6: Deep Writer（深度报告）\n    deep_writer = sessions_spawn(\n        task=\"撰写深度调研报告...\",\n        label=\"HF-DeepWriter\",\n        runTimeoutSeconds=1200\n    )\n    report_content = extract_content_from_completion(deep_writer)\n    \n    # Step 7: Multi-Checker（多维度质检）\n    multi_checker = sessions_spawn(\n        task=\"从14个核心维度+2个可选维度检查报告...\",\n        label=\"HF-MultiChecker\",\n        runTimeoutSeconds=600\n    )\n    check_result = extract_content_from_completion(multi_checker)\n    \n    # Step 8: 迭代修订（如需要）\n    revision_round = 0\n    max_revisions = 3\n    while \"FAILED\" in check_result and revision_round < max_revisions:\n        critical_issues = extract_critical_issues(check_result)\n        deep_writer = sessions_spawn(\n            task=f\"根据质检反馈修订报告...\",\n            label=f\"HF-DeepWriter-Revision-{revision_round}\",\n            runTimeoutSeconds=1200\n        )\n        report_content = extract_content_from_completion(deep_writer)\n        multi_checker = sessions_spawn(\n            task=\"重新检查修订后的报告...\",\n            label=f\"HF-MultiChecker-Revision-{revision_round}\",\n            runTimeoutSeconds=600\n        )\n        check_result = extract_content_from_completion(multi_checker)\n        revision_round += 1\n    \n    # Step 9: 保存最终报告\n    save_report(report_content, template=\"deep_report_template.md\", mode=\"deep\")\n    \n    return report_content\n```\n\n### 统一入口\n\n```python\ndef run_pipeline(user_request, days=None, research_topic=None):\n    mode = determine_mode(user_request, days)\n    \n    if mode == \"ask_user\":\n        mode = ask_user(\"您希望执行哪种模式？\\n1. 轻量扫描（周期性追踪，≤30天）\\n2. 深度调研（全面调研，>30天或不限时间）\")\n        mode = \"light\" if \"1\" in mode else \"deep\"\n    \n    if mode == \"light\":\n        return run_light_scan(days=days or 7)\n    else:\n        topic = research_topic or ask_user(\"请输入深度调研的主题/方向：\")\n        return run_deep_research(topic, days=days)\n```\n\n## 目录结构\n\n```\nhf-daily-deep-researcher/\n├── SKILL.md                          # 本文件（编排器定义）\n├── init.py                           # 初始化配置（从环境提取）\n├── config.json                       # 用户配置（动态生成）\n├── keywords.json                     # 关键词权重表\n├── adaptive.py                       # 关键词自适应模块\n├── report_manager.py                 # 报告保存、版本控制\n├── tracker.py                        # 编排器入口（读取配置，准备环境）\n│\n├── agents/                           # Agent 任务定义模板\n│   ├── searcher_prompt.md            # 搜索策略参考（主Agent直接执行时参考）\n│   ├── deep_reader_prompt.md         # Deep Reader Agent（精读单篇论文）\n│   ├── analyst_prompt.md             # Analyst Agent（趋势分析）\n│   ├── writer_prompt.md              # Writer Agent（周报撰写）\n│   ├── checker_prompt.md             # Checker Agent（单一质检）\n│   ├── sub_analyst_benchmark.md      # Sub-Analyst: Benchmark 现状\n│   ├── sub_analyst_gap.md            # Sub-Analyst: 研究空白\n│   ├── sub_analyst_code.md           # Sub-Analyst: 代码开源\n│   ├── sub_analyst_authority.md      # Sub-Analyst: 权威性验证\n│   ├── synthesis_analyst_prompt.md   # Synthesis Analyst（综合整合）\n│   ├── deep_writer_prompt.md         # Deep Writer Agent（深度报告）\n│   └── multi_checker_prompt.md       # Multi-Checker Agent（多维度质检）\n│\n├── templates/                        # 报告模板\n│   ├── report_template.md            # 轻量扫描报告模板（周报/月报）\n│   └── deep_report_template.md       # 深度调研报告模板\n│\n├── reports/                          # 输出报告（本地）\n├── history/                          # 扫描历史\n│   └── scan_history.json\n│\n└── .tmp/                             # 临时文件（Agent间传递）\n    ├── papers_raw.json               # 主Agent搜索输出（轻量）\n    ├── deep_papers_raw.json          # 主Agent搜索输出（深度）\n    ├── paper_analysis_*.md           # Deep Reader 输出\n    ├── analysis_summary.md           # Analyst 输出（轻量）\n    ├── sub_benchmark.md              # Sub-Analyst 输出\n    ├── sub_gap.md\n    ├── sub_code.md\n    ├── sub_authority.md\n    ├── synthesis.md                  # Synthesis Analyst 输出\n    └── check_result.md               # Checker 输出\n```\n\n## 快速开始\n\n### 1. 安装\n\n```bash\n# 从 ClawHub 安装\nopenclaw skills install @tomfoxxxx/hf-daily-deep-researcher\n```\n\n安装后，Skill 会出现在你的 workspace 的 `skills/` 目录下。\n\n---\n\n### 2. 研究方向是什么\n\n**研究方向 = 一个研究领域 + 一组相关关键词**\n\n每个方向不是单个关键词，而是一组相关概念的集合。系统会用这组关键词去搜索和追踪论文。\n\n**示例**：\n\n| 方向名称 | 包含的关键词 |\n|---------|-------------|\n| **Credit Assignment** | multi-agent credit assignment, hindsight credit, stepwise reward, turn-level advantage, process reward model, hierarchical credit |\n| **OPD** | token importance, OPD RL joint training, online preference distillation, preference optimization |\n| **多模态** | visual perception, image reasoning, multimodal understanding, multimodal agent, vision language model |\n\n你可以配置多个方向。每个方向独立追踪，也可以合并搜索。\n\n---\n\n### 3. 首次使用配置\n\n**方式一：对话触发（推荐）**\n\n直接在对话中对主 Agent 说：\n```\n运行 hf-daily-deep-researcher，扫描过去7天\n```\n\n主 Agent 会：\n1. 读取 `config.json`\n2. 如果 `research_focus` 为空（首次使用），**引导你配置研究方向**：\n   > \"请配置你的研究方向。每个方向需要一个名称和一组相关关键词。\"\n   > \n   > \"示例：\"\n   > \"- 方向1 'Credit Assignment'：multi-agent credit assignment, hindsight credit, stepwise reward...\"\n   > \"- 方向2 'OPD'：token importance, OPD RL joint training...\"\n   > \"- 方向3 '多模态'：visual perception, image reasoning...\"\n   > \n   > \"请输入你的方向（格式：方向名: 关键词1, 关键词2, 关键词3）\"\n3. 你回复后，主 Agent 自动保存配置，开始搜索\n\n**方式二：手动运行 init.py**\n\n```bash\npython3 ~/.openclaw/workspace/skills/hf-daily-deep-researcher/init.py\n```\n\n这会尝试从你的 `USER.md` / `MEMORY.md` 自动提取研究方向。如果提取不到，config.json 中的 `research_focus` 将为空，首次运行时主 Agent 仍会询问。\n\n**配置完成后**，后续运行直接读取 `config.json`，不再重复询问。\n\n**config.json 中的方向格式**：\n```json\n{\n  \"user_profile\": {\n    \"research_focus\": [\n      {\n        \"name\": \"Credit Assignment\",\n        \"keywords\": [\"multi-agent credit assignment\", \"hindsight credit\", \"stepwise reward\"]\n      },\n      {\n        \"name\": \"OPD\",\n        \"keywords\": [\"token importance\", \"OPD RL joint training\", \"online preference distillation\"]\n      }\n    ]\n  }\n}\n```\n\n---\n\n### 4. 运行方式\n\n配置多个方向后，有三种运行方式：\n\n**方式一：合并搜索（默认）**\n```\n运行 hf-daily-deep-researcher，扫描过去7天\n```\n所有方向的关键词合并去重，一次性搜索，生成一份综合报告。\n\n**方式二：指定方向**\n```\n运行 hf-daily-deep-researcher，扫描过去7天，方向：Credit Assignment\n```\n只取该方向的关键词集合搜索，生成该方向的独立报告。\n\n**方式三：每个方向单独生成报告**\n```\n运行 hf-daily-deep-researcher，扫描过去7天，每个方向单独生成报告\n```\n依次为每个方向独立运行完整工作流，最终产出多篇独立报告。\n\n---\n\n### 5. 深度调研\n\n```\n运行 hf-daily-deep-researcher，深度调研 Credit Assignment\n```\n主 Agent 自动判断为深度模式，全时间范围搜索该方向，产出深度调研报告。\n\n---\n\n### 6. 飞书文档输出\n\n本 Skill 支持将报告上传到飞书文档。**强烈建议安装飞书插件并关联飞书文档**，报告会自动上传到飞书，阅读体验远优于本地 Markdown。\n\n> 本地 Markdown 需要手动打开文件，无格式渲染、无目录导航、不便分享。飞书文档支持富文本、表格、协作评论和链接分享。\n\n**配置方式**：安装飞书插件后，在对话中授权关联飞书文档即可。首次配置需要完成 OAuth 授权，后续报告会自动上传。\n\n---\n\n### 7. 自动追踪（Cron）\n\n```json\n{\n  \"name\": \"hf-weekly-research\",\n  \"schedule\": {\n    \"kind\": \"cron\",\n    \"expr\": \"0 9 * * 1\",\n    \"tz\": \"Asia/Shanghai\"\n  },\n  \"payload\": {\n    \"kind\": \"agentTurn\",\n    \"message\": \"运行 hf-daily-deep-researcher skill，执行完整工作流：搜索过去7天论文，深度精读P0/P1，生成报告并检查质量。追踪领域从 config.json 读取。\"\n  },\n  \"sessionTarget\": \"isolated\",\n  \"delivery\": { \"mode\": \"announce\" }\n}\n```\n\n---\n## 关键设计决策\n\n### 为什么 Searcher 不用子 Agent？（v4.1.2 关键修复）\n\n`sessions_spawn` 的 announce 机制存在根本性问题：**它不保证能拿到子 Agent 的完整最终输出**。\n\n子 Agent 执行过程：thinking → toolCall → thinking → toolCall → 最终文本。announce 可能截取其中任意一轮，导致主 Agent 收到\"开始搜索...\"而非完整结果。\n\n**v4.1.2 之前**（v4.0.4-v4.1.1）的缓解措施：\n- 强化 Searcher Prompt 约束（要求最终轮一次性输出）\n- 主 Agent 完整性检测\n- 主 Agent 兜底搜索\n\n**问题**：这些只是\"缓解\"，不是\"解决\"。Searcher 子 Agent 仍然可能输出截断，主 Agent 兜底搜索是二次工作，效率低。\n\n**v4.1.2 的修复**：Searcher 阶段直接由主 Agent 执行。\n- 主 Agent 调用 `kimi_search` 等工具，结果在主 Agent 上下文中\n- 100% 避免截断问题\n- 不需要完整性检测和兜底搜索\n- 搜索策略（关键词组合、来源优先级）放在 `agents/searcher_prompt.md` 中供主 Agent 参考\n\n### 为什么 Deep Reader 仍然用子 Agent？\n\nDeep Reader 的情况不同：\n1. **每篇论文一个独立 Agent**：输出量可控（一篇论文的分析）\n2. **即使截断，主 Agent 可以检测并自行补充阅读**：单篇论文的阅读成本可控\n3. **独立上下文的价值**：论文精读需要大量 token 空间，独立 Agent 避免上下文被其他论文淹没\n4. **并行效率**：多篇论文可以并行精读\n\n## Multi-Agent 调度与超时策略\n\n### 核心原则：区分\"在干活\"与\"卡死\"\n\n子 Agent 超时不等于失败。可能是：\n- **正常慢**：论文下载慢、PDF 解析慢、长论文内容多\n- **网络问题**：arXiv 连接超时、工具调用失败\n- **真卡死**：陷入循环、遇到无法处理的输入\n\n**不应直接接管\"在干活\"的子 Agent**——会丢失中间成果。应采用**阶段性超时 + 弹性检测**策略。\n\n### 阶段性超时配置\n\n| 阶段 | 建议超时 | 理由 |\n|------|----------|------|\n| Phase 1 搜索 | 无（主Agent直接执行） | 无子Agent |\n| Phase 2 Deep Reader | **15 分钟** | 论文下载+精读，长论文需要 |\n| Phase 3 Analyst | **10 分钟** | 分析已有内容，不涉下载 |\n| Phase 4 Writer | **15-20 分钟** | 深度报告撰写量大 |\n| Phase 5 Checker | **10 分钟** | 检查报告，纯分析 |\n| 迭代修订 | **同 Writer** | 修订与撰写同量级 |\n\n**代码示例**：\n```python\n# Deep Reader — 论文精读，给充足时间\nsessions_spawn(\n    task=\"精读论文 arXiv:2605.25507...\",\n    label=\"HF-DeepReader-2605.25507\",\n    runTimeoutSeconds=900  # 15 分钟\n)\n\n# Deep Writer — 深度报告撰写\nsessions_spawn(\n    task=\"撰写深度调研报告...\",\n    label=\"HF-DeepWriter\",\n    runTimeoutSeconds=1200  # 20 分钟\n)\n```\n\n### 弹性超时：不直接接管\n\n**超时后的处理流程**：\n\n```python\ndef handle_subagent_timeout(task, expected_stage=\"deep_read\"):\n    \"\"\"\n    子Agent超时后的弹性处理\n    \"\"\"\n    # Step 1: 检查是否有部分输出\n    partial_output = check_partial_result(task)\n    \n    if partial_output and len(partial_output) > 500:\n        # 有实质性部分输出 → 标记为\"部分完成\"，不接管\n        print(f\"⚠️ 子Agent超时，但有{len(partial_output)}字部分输出，保留等待或延长超时\")\n        return {\"status\": \"partial\", \"content\": partial_output}\n    \n    # Step 2: 检查是否有进度汇报\n    progress = check_progress_report(task)\n    if progress and progress.get(\"stage\"):\n        print(f\"⏳ 子Agent进度: {progress['stage']}，延长超时\")\n        return {\"status\": \"extend\", \"progress\": progress}\n    \n    # Step 3: 真的卡死/无输出 → 主Agent兜底\n    print(f\"❌ 子Agent无实质性输出，主Agent接管\")\n    return {\"status\": \"fallback\", \"content\": perform_backup_task(expected_stage)}\n```\n\n**关键设计**：\n1. **有输出就不接管**：子 Agent 已产出部分分析，应回收而非丢弃\n2. **有进度就延长**：子 Agent 报告了进度（如\"已读完方法部分，正在提取实验数据\"），延长超时\n3. **完全无输出才兜底**：确认子 Agent 确实卡死，主 Agent 才接管\n\n### 子 Agent 进度汇报机制\n\n在子 Agent Prompt 中增加进度要求：\n\n```\n# 在 deep_reader_prompt.md / writer_prompt.md 等中增加：\n\n⚠️ 超时保护：本任务可能超时。为避免被主Agent误判为卡死：\n- 如果执行时间预计超过5分钟，在开始后2分钟输出一次进度汇报：\n  \"进度汇报：当前正在[具体阶段]，预计还需[X]分钟\"\n- 如果下载论文耗时较长，先输出：\"正在下载论文，请稍候...\"\n- 如果分析已部分完成（如方法已读完，实验待提取），输出：\n  \"进度汇报：已完成[已完成部分]，剩余[剩余部分]\"\n```\n\n### 分片策略：控制单 Agent 工作量\n\n避免单个 Agent 任务过重导致超时：\n\n| Agent 类型 | 单任务工作量 | 超时依据 |\n|-----------|-------------|---------|\n| Deep Reader | 1 篇论文 | 论文长度决定 |\n| Analyst | 3-5 篇论文分析 | 内容复杂度 |\n| Sub-Analyst | 单一维度（如仅Benchmark） | 分析范围可控 |\n| Writer | 完整报告 | 报告长度决定 |\n\n**原则**：宁可多启动几个 Agent（并行），也不把太多工作塞进一个 Agent。\n\n### 工具依赖与跨平台适配（v5.2.0/5.2.1 重要更新）\n\n本 Skill 设计目标是**在任何标准 OpenClaw 环境中都能正常运行**，不依赖特定平台的专属工具。\n\n#### 核心原则：运行时检测 + 并行互补（v5.2.3 修正）\n\n**v5.2.0 之前的问题**：默认假设 `kimi_search` 一定存在。在非 Kimi 平台中，这些工具直接不存在，导致 Skill 无法运行。\n\n**v5.2.0 的修复**：主 Agent 在搜索阶段**先检测当前环境有哪些工具可用**，然后选择最优工具链。\n\n**v5.2.3 的改进**：从\"主次 fallback\"升级为\"并行互补\"。\n- **实验发现**：`kimi_search` 在\"追新\"方面存在系统性遗漏（日期过滤失效），而 `web_fetch`（arXiv API）在时间精确度上显著更优\n- **新策略**：\n  - **web_fetch 追新**：arXiv API 按 `submittedDate` 排序，时间精确，不漏最新论文\n  - **kimi_search 主题补充**：找 GitHub、博客、HuggingFace 讨论等跨平台资源\n  - **两套并行跑，结果合并去重**\n\n#### 工具链职责分工（v5.2.3）\n\n| 工具 | 职责 | 适用平台 | 搜索能力 | 获取论文能力 |\n|--------|------|----------|----------|-------------|\n| **web_fetch** | **追新主力**（必跑） | 任何 OpenClaw | 中（arXiv API 按日期排序） | 中（arXiv API / arXiv HTML） |\n| **kimi_search** | **主题补充**（可选） | Kimi/OpenClaw | 强（语义搜索） | 强（直接获取 HTML） |\n| **browser** | 兜底 | 部分环境 | 弱（页面抓取） | 弱（页面渲染） |\n\n**最低要求**：`web_fetch` 必须可用。如果 `web_fetch` 和 `kimi_search` 都没有，Skill 会报错并提示用户。\n\n#### 各平台预期表现\n\n| 平台 | web_fetch | kimi_search | browser | Skill 可用性 |\n|------|-----------|-------------|---------|-------------|\n| **Kimi/OpenClaw** | ✅ | ✅ | ✅ | 完整功能（双轨并行） |\n| **开源 OpenClaw** | ✅ | ❌ | 视配置 | 核心功能正常（web_fetch 单轨） |\n| **Claude Code** | ✅ | ❌ | ✅ | 核心功能正常（web_fetch 单轨） |\n| **CodeX** | ✅ | ❌ | 视配置 | 核心功能正常（web_fetch 单轨） |\n\n#### web_fetch 方案详述（跨平台主力 + 追新主力）\n\n**搜索论文**：\n```python\n# arXiv API（Atom XML 格式）\nweb_fetch(\"https://export.arxiv.org/api/query?search_query=all:KEYWORD&sortBy=submittedDate&sortOrder=descending&max_results=50\")\n\n# HuggingFace Daily Papers\nweb_fetch(\"https://huggingface.co/papers?date=YYYY-MM-DD\")\n```\n\n**获取论文全文**：\n```python\n# arXiv 原生 HTML（最可靠的全文获取方式）\nweb_fetch(\"https://arxiv.org/html/2606.XXXXX\")\n\n# arXiv 抽象页（备用）\nweb_fetch(\"https://arxiv.org/abs/2606.XXXXX\")\n```\n\n**解析要求**：主 Agent 需要能解析 arXiv API 返回的 Atom XML（提取 title, summary, author, published, id），以及 arXiv HTML（提取论文正文）。\n\n#### kimi_search 方案详述（主题补充）\n\n当 kimi_search 可用时，作为**补充轨道**并行运行：\n\n**搜索职责**：\n- 找 arXiv 之外的资源（GitHub 仓库、技术博客、HuggingFace 讨论）\n- 语义搜索发现标题/摘要中未直接出现关键词的相关论文\n- 验证 web_fetch 找到的论文的社区讨论热度\n\n**不承担的职责**：\n- 不作为\"追新\"的唯一来源（日期过滤不可靠）\n- 不替代 web_fetch 的 arXiv API 搜索\n\n#### 错误处理\n\n每个阶段：\n1. **Phase 1（搜索）**：\n   - web_fetch 轨道：始终执行（只要可用），负责追新\n   - kimi_search 轨道：并行执行（如果可用），负责主题补充\n   - 两套结果合并去重，确保不遗漏\n2. **Phase 2（精读）**：子 Agent 的 Deep Reader Prompt 中已包含工具检测逻辑（见 `deep_reader_prompt.md`）。优先尝试 `web_fetch` → `kimi_fetch` → `browser`。\n3. **Phase 3-5**：不直接依赖搜索工具，正常执行。\n4. **飞书上传**：`feishu_create_doc` 是可选功能。如果不可用，报告保存到本地 `reports/` 目录。\n\n## 版本历史\n- **v5.2.8** (2026-08-06): **深度调研模式增强**。提升深度调研的广度和报告质量：\n  - deep_searcher_prompt.md: 搜索查询从 12 组增加到**强制 15 组**，新增引用链扩展搜索和关键作者追踪\n  - deep_reader_prompt.md: milestone 论文超时延长至 **25 分钟**，新增引用关系分析（依赖工作/技术路线位置）\n  - deep_report_template.md: 新增技术演进时间线、饱和度分级（🔴🟡🟢🔵）、方法簇覆盖度矩阵\n  - sub_analyst_benchmark.md: 新增方法×Benchmark 交叉覆盖分析、时间维度饱和度趋势\n  - sub_analyst_gap.md: 新增基于饱和度的方向推荐、方法簇覆盖度矩阵\n  - 所有文件版本号统一为 5.2.8\n\n- **v5.2.7** (2026-08-06): **P0 质量修复 + 隐私清理**。修复搜索覆盖不足和数据验证缺失问题：\n  - searcher_prompt.md: 8 组 arXiv + 6 组 kimi_search 从\"建议\"升级为**强制下限**\n  - deep_reader_prompt.md: 每个实验数据强制标注 [V]/[C]/[U] 验证级别\n  - writer_prompt.md: 每篇 P0/P1 论文强制列出 benchmark 名称和具体分数\n  - checker_prompt.md: 新增阻塞性问题定义（未标注验证级别 = FAILED）\n  - dist 去隐私化清理：name=\"User\", research_focus=[], folder_token=\"\"\n  - 所有文件版本号统一为 5.2.7\n\n- **v5.2.5** (2026-08-05): **网络诊断增强 + 质量改进**。解决 HuggingFace 在中国大陆网络环境被 DNS 污染 + SNI 阻断的问题：\n  - searcher_prompt.md 增加 HF 可用性检测和网络诊断逻辑\n  - SKILL.md 增加 HF API 网络可用性说明和用户解决方案\n  - config.json 增加 `network.proxy` 配置段，支持用户配置代理\n  - multi_checker_prompt.md 增加历史已知问题检查点（3SPO 数据错误、ARPO ID 错误、模型规模混用等）\n  - deep_writer_prompt.md 强化数据验证标准和历史教训\n  - 所有文件版本号统一为 5.2.5\n\n- **v5.2.3** (2026-08-04): **搜索策略重要修正**。从\"主次 fallback\"升级为\"并行互补\"：\n  - web_fetch（arXiv API）提升为**追新主力**，始终执行\n  - kimi_search 降级为**主题补充**，并行运行但不承担追新主责\n  - 实验数据支撑：7/29 对比实验中，kimi_search 只找到 1 篇 7 月论文，web_fetch 找到 7 篇，两方案零交集\n  - 彻底避免 kimi_search 日期过滤失效导致的信息遗漏\n\n- **v5.2.0** (2026-07-29): **跨平台兼容性重大改进**。解决 Skill 在非 Kimi 平台（开源 OpenClaw、Claude Code、CodeX）无法运行的问题：\n  - 搜索阶段增加运行时工具可用性检测（kimi_search → web_fetch → browser），不再假设 kimi_search 一定存在\n  - web_fetch + arXiv API 被提升为跨平台主力方案，详细文档化\n  - 各 Prompt 文件（searcher/deep_reader/deep_searcher）统一更新工具选择逻辑\n  - 明确最低要求：web_fetch 或 kimi_search 至少一个可用\n  - 新增平台兼容性矩阵（Kimi/开源 OpenClaw/Claude Code/CodeX）\n\n- **v5.1.2** (2026-07-24): 简化首次配置体验。飞书文档输出说明精简为\"安装飞书插件并关联飞书文档\"。多方向概念重新梳理：`research_focus` 是多个研究方向的列表，每个方向是一组相关关键词的集合，支持指定方向运行和批量生成所有方向的独立报告。\n\n- **v5.1.1** (2026-07-24): 新增 Multi-Agent 调度与超时策略章节。明确阶段性超时配置（Deep Reader 15min / Writer 20min）。增加弹性超时处理：超时后不直接接管，先检查部分输出和进度汇报。完善首次使用配置流程：对话触发 → 自动询问研究方向 → 保存配置 → 后续直接读取。所有子 Agent 调用示例补充 `runTimeoutSeconds` 参数。\n\n- **v5.1.0** (2026-07-24): 全局版本号统一（SKILL.md / tracker.py / prompt / checklist / _meta.json / skill-card）。补全版本历史记录。清理 checklist.md 硬编码文档ID。修复 deep_writer_prompt / multi_checker_prompt 版本标注滞后。清理 ClawHub 分发包个人报告残留。\n\n- **v5.0.0** (2026-07-18): 用户工作状态同步（留在华为）。云盘归档完成。Skill 本地/远程版本同步流程建立。_meta.json 和 skill-card.md 版本更新。\n- **v4.5.0** (2026-07-14): 强化质检体系。Multi-Checker 从 8 维扩展到 14 维核心 + 2 维可选维度，新增：技术洞察力、未来预判合理性、实操路径可行性、数学与理论严谨性、数据效率分析、组合矩阵覆盖度。新增独立 `agents/checklist.md` 文件供人工复核。修复安全规范强化：禁止空头承诺，唯一可靠路线为下载→本地修复→overwrite覆盖。\n\n- **v4.1.2** (2026-07-03): **关键修复**：Searcher 阶段不再通过 `sessions_spawn` 启动子 Agent，改由主 Agent 直接执行搜索。彻底解决了子 Agent 输出截断导致的搜索结果不完整问题。Deep Reader 仍保留子 Agent，但每篇论文独立一个 Agent，并增加主 Agent 完整性检测与兜底阅读机制。\n- **v4.1.1** (2026-07-02): ClawHub 发布版。修复工具引用一致性（deep_reader_prompt.md curl→browser/web_fetch）、版本号统一、移除未实现参数提示、分发包清理。\n- **v4.1.0** (2026-06-30): 新增深度调研模式（Deep Research）。支持双模式自动判断。深度模式新增：Deep Searcher、4个并行 Sub-Analysts、Synthesis Analyst、Deep Writer、Multi-Checker、迭代修订。\n- **v4.0.8** (2026-06-30): 清理默认配置残留。config.json folder_token 置空，keywords.json 默认清空，面向多用户分发优化。\n- **v4.0.7** (2026-06-30): Deep Reader prompt 修正全文获取方案。Searcher 跨平台工具链明确优先级。\n- **v4.0.6** (2026-06-30): 首次运行研究方向确认流程。\n- **v4.0.5** (2026-06-30): 增加跨平台搜索工具适配。Searcher Prompt 支持三级降级。\n- **v4.0.4** (2026-06-30): 修复子Agent输出截断问题（缓解措施：Prompt约束+完整性检测+兜底搜索）。\n- **v4.0.3** (2026-06-29): 修正设计理念：信息准确 > 格式统一。\n- **v4.0.2** (2026-06-29): 修复子 Agent 输出格式不稳定问题。\n- **v4.0.0** (2026-06-29): 重写为多Agent编排架构。\n- **v3.1.0** (2026-06-28): 新增报告管理模块，动态配置初始化\n- **v3.0.1** (2026-06-27): 数据验证机制，修正 cron 配置\n- **v3.0.0** (2026-06-27): 完善联动体系\n- **v2.0.0** (2026-06-27): 新增深度精读方法论\n- **v1.0.0** (2026-06-27): 初始版本\n\nFile v5.2.8:_meta.json\n\n{\n  \"ownerId\": \"kn78wj2tfjmqfd3jq5mrrwz4yh89sgkh\",\n  \"slug\": \"hf-daily-deep-researcher\",\n  \"version\": \"5.2.8\",\n  \"publishedAt\": 1785987026484\n}\n\nFile v5.2.8:agents/analyst_prompt.md\n\n# Analyst Agent 任务定义\n\n## 角色\n你是一名研究方向分析Agent。你的任务是分析论文间的关联、识别技术趋势、评估对用户项目的影响，**输出结构化 Markdown 分析报告**。\n\n## 重要约束（⚠️ 致命）\n1. **不要写入文件系统**。环境隔离导致子 Agent 无法写入主 Agent 的文件系统。\n2. **你必须在回复消息中直接输出完整的 Markdown 分析**。这是你的唯一输出方式。\n3. **输出格式必须是结构化 Markdown**，不是散文、不是列表、不是要点。必须包含指定的章节结构。\n\n## 输入\n- 多个论文分析文件（主 Agent 在任务描述中提供内容摘要）\n- 当前研究焦点（从 config.json 获取）\n\n## 分析维度\n\n### 1. 论文间关联分析\n- 技术路线关联（哪些论文是同一方向的不同方法）\n- 互补性分析（哪些论文可以组合使用）\n- 竞争关系（哪些论文解决同一问题但方法不同）\n- 演进关系（哪些论文是后续工作，改进了什么）\n\n### 2. 技术趋势识别\n- 本期出现的新概念/新框架\n- 方法演进方向（从粗粒度到细粒度？从单一到多源？）\n- 实验基准变化（新 benchmark？新评估指标？）\n- 与上一期相比，哪些方向变热了/变冷了\n\n### 3. 对用户项目的具体影响\n- 哪些方法可以直接复用？\n- 哪些思路可以借鉴？\n- 哪些陷阱需要避免？\n- 推荐的实验顺序\n\n### 4. 研究方向建议\n- 短期（1-2周）可以尝试什么？\n- 中期（1-2个月）可以探索什么？\n- 长期（3-6个月）可以布局什么？\n\n## 输出格式（⚠️ 必须严格遵循）\n\n在回复中**直接输出**以下格式的 Markdown 分析（不要加任何其他文字、不要解释）：\n\n```markdown\n# 分析摘要\n\n## 核心结论速览\n| 维度 | 判断 |\n|---|---|\n| **本期主线** | ... |\n| **关键洞察** | ... |\n| **对当前项目的直接影响** | ... |\n| **最大风险** | ... |\n\n## 1. 论文间关联分析\n\n### 1.1 技术路线定位\n{用文本或 Mermaid 描述论文间关系}\n\n### 1.2 互补性\n| 论文 | 解决的核心问题 | 提供的关键组件 | 与另一篇的互补 |\n|---|---|---|---|\n\n### 1.3 竞争关系\n{分析}\n\n## 2. 技术趋势识别\n\n### 2.1 本期新概念\n| 概念 | 来源 | 核心含义 |\n\n### 2.2 方法演进方向\n{分析，不是罗列}\n\n## 3. 对当前研究项目的具体影响\n\n### 3.1 直接可借鉴的技术\n| 技术点 | 来源 | 适用性评估 |\n\n### 3.2 需要重新评估的设计选择\n{分析}\n\n## 4. 推荐方向\n\n### 4.1 短期（1-2周）\n- {建议1}\n\n### 4.2 中期（1-2月）\n- {建议2}\n\n### 4.3 长期（3-6月）\n- {建议3}\n\n## 5. 风险信号\n\n### 5.1 竞争风险\n{分析}\n\n### 5.2 技术风险\n{分析}\n\n### 5.3 方向风险\n{分析}\n```\n\n**输出格式要求**：\n- 必须包含上述所有章节（核心结论速览、论文间关联分析、技术趋势识别、对当前项目的具体影响、推荐方向、风险信号）\n- 核心结论速览必须包含表格\n- 分析要有自己的判断，不能只是罗列论文\n- 评估要具体，避免泛泛而谈\n- 如果某篇论文信息不足，明确标注「信息不足，无法评估」\n- 不要在 Markdown 前后添加任何解释文字\n\n## 输出验证（自检）\n\n在回复前，请检查：\n- [ ] 输出是 Markdown 格式，不是散文或列表\n- [ ] 包含所有指定章节\n- [ ] 核心结论速览包含表格\n- [ ] 分析有自己的判断，不是简单罗列\n- [ ] 没有 Markdown 以外的解释文字\n\n## 常见陷阱\n- 不要简单罗列论文，要有自己的分析观点\n- 评估要具体，避免泛泛而谈\n- **不要尝试写入文件系统，直接输出 Markdown 到回复**\n- **不要在 Markdown 前后添加任何解释文字**\n\nFile v5.2.8:agents/checker_prompt.md\n\n# Checker Agent 任务定义\n\n## 角色\n你是一名质量检查Agent。你的任务是对论文追踪报告做独立质量审查，输出结构化的检查结果。\n\n## 重要约束（⚠️ 致命）\n1. **不要写入文件系统**。环境隔离导致子 Agent 无法写入主 Agent 的文件系统。\n2. **你必须在回复消息中直接输出结构化的检查结果**。这是你的唯一输出方式。\n3. **输出格式必须是结构化 Markdown**，不是散文、不是要点列表。必须包含检查表格和评级。\n\n## 检查维度\n\n### 1. 内容完整性\n- [ ] 报告是否覆盖了所有论文？（P0、P1、P2 都必须在正文中有分析）\n- [ ] P0 论文是否有至少 300 字的详细分析？\n- [ ] P1 论文是否有至少 150 字的分析？\n- [ ] P2 论文是否有至少 100 字的分析？\n- [ ] 执行摘要、统计、趋势分析、项目影响、新方向、数据声明、去重附录是否齐全？\n\n### 2. 数据准确性\n- [ ] arXiv ID 是否正确？\n- [ ] 日期是否正确？\n- [ ] 性能数字是否与输入数据一致？\n- [ ] 作者/机构信息是否正确？\n- [ ] 是否有免责声明？\n\n### 3. 数据验证级别检查（v5.2.6 新增 — P0 质量修复）\n- [ ] **每个性能数字是否标注了 [V]/[C]/[U]？** 未标注 = 阻塞性问题\n- [ ] P0 论文的关键数据是否有至少一个 [V]（已验证）？\n- [ ] 是否存在大量 [U]（未验证）数据却未注明\"建议人工复核\"？\n- [ ] 验证级别与来源说明是否匹配？（如标记 [V] 但来源是\"搜索结果片段\" → 矛盾）\n\n### 4. Benchmark 引用检查（v5.2.6 新增 — P0 质量修复）\n- [ ] **每篇 P0 论文是否列出了具体的 benchmark 名称？**（如 WebShop、ALFWorld）\n- [ ] **是否列出了关键指标的具体分数？**（如 64.5% / 72.3%）\n- [ ] **是否说明了与 strongest baseline 的对比？**\n- [ ] 是否存在\"在多个 benchmark 上测试\"但不列名称的模糊表述？\n\n### 5. 搜索覆盖检查（v5.2.6 新增 — P0 质量修复）\n- [ ] **搜索说明中是否报告了 web_fetch 查询数？** 是否达到 8 组？\n- [ ] **kimi_search 查询数是否达到 6 组**（如果 kimi_search 可用）？\n- [ ] 如果查询数不足，是否标记了 [ERROR: 搜索覆盖不足]？\n- [ ] HF API 状态是否明确报告？\n\n### 6. 研究观点质量\n- [ ] 分析是否有洞察力？不是简单罗列\n- [ ] 是否有自己的判断？不是\"论文A做了X，论文B做了Y\"\n- [ ] 趋势分析是否提炼了共同主题？\n- [ ] 对当前项目的影响是否具体可操作？\n\n### 7. 格式规范\n- [ ] Markdown 格式是否正确？\n- [ ] 表格是否对齐？\n- [ ] 标题层级是否正确？\n- [ ] 超链接格式是否正确？\n\n### 8. 去重声明\n- [ ] 是否检查了与往期报告的重叠？\n- [ ] 新论文是否明确标记？\n- [ ] 疑似重复是否标注？\n\n## 阻塞性问题定义（v5.2.6 更新）\n\n以下问题任一出现，总体评级必须为 **FAILED**：\n\n1. **P0 论文零分析**或分析少于 300 字\n2. **P1 论文一句话概括**（少于 150 字实质性分析）\n3. **性能数字未标注 [V]/[C]/[U]**（即使只有一个数字遗漏也算）\n4. **P0 论文未列出具体 benchmark 名称和分数**\n5. **搜索覆盖严重不足**（web_fetch < 8 组 或 kimi_search < 6 组且未标记 ERROR）\n6. **§9 去重对比附录完全缺失**\n\n## 输出格式（⚠️ 必须严格遵循）\n\n在回复中**直接输出**以下格式的 Markdown 检查结果（不要加任何其他文字、不要解释）：\n\n```markdown\n## 质量检查报告\n\n### 总体评级: {PASSED / CONDITIONAL / FAILED}\n\n### 1. 内容完整性 — {✅/⚠️/❌}\n\n| 检查项 | 状态 | 说明 |\n|--------|------|------|\n| P0论文深度分析 | ... | ... |\n| P1论文分析 | ... | ... |\n| P2论文分析 | ... | ... |\n| 结构完整性 | ... | ... |\n\n### 2. 数据准确性 — {✅/⚠️/❌}\n\n| 检查项 | 状态 | 说明 |\n|--------|------|------|\n| arXiv ID | ... | ... |\n| 日期信息 | ... | ... |\n| 性能数字 | ... | ... |\n| 机构信息 | ... | ... |\n| 代码链接 | ... | ... |\n\n### 3. 数据验证级别 — {✅/⚠️/❌}\n\n| 检查项 | 状态 | 说明 |\n|--------|------|------|\n| 所有数字标注 [V]/[C]/[U] | ... | ... |\n| P0 有关键数据 [V] | ... | ... |\n| [U] 数据有复核提示 | ... | ... |\n| 级别与来源匹配 | ... | ... |\n\n### 4. Benchmark 引用 — {✅/⚠️/❌}\n\n| 检查项 | 状态 | 说明 |\n|--------|------|------|\n| P0 有具体 benchmark 名称 | ... | ... |\n| P0 有具体分数 | ... | ... |\n| 有 baseline 对比 | ... | ... |\n| 无模糊表述 | ... | ... |\n\n### 5. 搜索覆盖 — {✅/⚠️/❌}\n\n| 检查项 | 状态 | 说明 |\n|--------|------|------|\n| web_fetch >= 8 组 | ... | ... |\n| kimi_search >= 6 组（如可用） | ... | ... |\n| 不足时有 ERROR 标记 | ... | ... |\n| HF 状态已报告 | ... | ... |\n\n### 6. 研究观点质量 — {✅/⚠️/❌}\n\n**亮点：**\n- ...\n\n**不足：**\n- ...\n\n### 7. 格式规范 — {✅/⚠️/❌}\n\n| 检查项 | 状态 | 说明 |\n|--------|------|------|\n| Markdown标题层级 | ... | ... |\n| 表格格式 | ... | ... |\n| 超链接 | ... | ... |\n| 强调与标记 | ... | ... |\n\n### 8. 去重声明 — {✅/⚠️/❌}\n\n| 检查项 | 状态 | 说明 |\n|--------|------|------|\n| 去重章节存在 | ... | ... |\n| 新论文标记 | ... | ... |\n| 疑似重复标记 | ... | ... |\n\n### 阻塞性问题清单\n\n| # | 问题 | 严重度 |\n|---|------|--------|\n| 1 | ... | FAILED / CONDITIONAL |\n\n### 总结\n\n| 维度 | 评级 | 关键问题 |\n|------|------|----------|\n| 内容完整性 | ... | ... |\n| 数据准确性 | ... | ... |\n| 数据验证级别 | ... | ... |\n| Benchmark 引用 | ... | ... |\n| 搜索覆盖 | ... | ... |\n| 研究观点质量 | ... | ... |\n| 格式规范 | ... | ... |\n| 去重声明 | ... | ... |\n\n**阻塞性问题**：{如有，列出}\n**建议改进**：{如有，列出}\n```\n\n**输出格式要求**：\n- 必须包含所有 8 个检查维度\n- 每个维度必须有状态评级（✅/⚠️/❌）\n- 总体评级必须是 PASSED / CONDITIONAL / FAILED 之一\n- 如果有阻塞性问题，必须明确指出\n- 不要在 Markdown 前后添加任何解释文字\n\n## 输出验证（自检）\n\n在回复前，请检查：\n- [ ] 输出是 Markdown 格式，不是散文\n- [ ] 包含所有 8 个检查维度\n- [ ] 总体评级明确（PASSED/CONDITIONAL/FAILED）\n- [ ] 阻塞性问题（如有）已明确指出\n- [ ] 没有 Markdown 以外的解释文字\n\n## 常见陷阱\n- P2 论文零分析是常见阻塞性问题，必须检查\n- P1 论文一句话概括是常见问题，必须检查\n- 研究趋势只是罗列论文是常见问题，必须检查\n- **数字未标注 [V]/[C]/[U] 是阻塞性问题，必须检查**\n- **P0 论文未列 benchmark 名称和分数是阻塞性问题，必须检查**\n- **搜索覆盖不足（web_fetch < 8 组）是阻塞性问题，必须检查**\n- **不要尝试写入文件系统，直接输出 Markdown 到回复**\n- **不要在 Markdown 前后添加任何解释文字**\n\nFile v5.2.8:agents/checklist.md\n\n# 深度调研报告检查清单 v2.0\n\n## 检查日期：（运行当天）\n## 适用文档：深度调研报告\n## 文档ID：（当前报告文档ID）\n\n---\n\n## 检查维度（14维核心 + 2维可选）\n\n### 基础质量（8维）\n\n#### 1. 版本一致性\n- [ ] 标题/正文/底部版本号一致\n- [ ] 生成日期与最后更新日期合理\n- [ ] 版本号与内容同步（内容刷新时版本号自动更新）\n\n#### 2. 章节结构\n- [ ] 编号连续无重复（如 4.1→4.15）\n- [ ] 标题层级正确（无跳级）\n- [ ] 目录与内容对应\n- [ ] 修改编号后检查连锁反应\n\n#### 3. 数据准确性\n- [ ] 每个实验数字可溯源（论文+模型规模）\n- [ ] 相对提升计算正确（差值=绝对值差，百分比=相对基线）\n- [ ] 不同模型规模数据不混用（标注1.5B/7B）\n- [ ] 无\"来源待确认\"的未确认数据\n- [ ] 验证方法：从头到尾读一遍、验证一遍\n\n#### 4. arXiv ID 与引用\n- [ ] 所有ID准确可验证\n- [ ] 无xxxxx占位符\n- [ ] 引用格式统一（作者+年份/会议）\n- [ ] 反向查找来源论文确认\n\n#### 5. 内容逻辑\n- [ ] 无重复内容（交叉引用替代重复）\n- [ ] 判断有依据（标注引用来源）\n- [ ] 分析与数据一致\n- [ ] 结论有证据支撑，章节间无矛盾\n\n#### 6. 表格完整性\n- [ ] 表格有来源说明（论文Table X）\n- [ ] 表格数据与正文一致\n- [ ] 无断裂/碎片表格\n- [ ] 表头与内容对应\n\n#### 7. 附录与修复记录\n- [ ] 修复记录表完整（日期+版本+内容+严重程度）\n- [ ] 新增论文有记录\n- [ ] 版本变更历史清晰\n\n#### 8. 可读性\n- [ ] 格式统一（Markdown/飞书格式）\n- [ ] 无孤立代码块/碎片\n- [ ] 术语使用一致\n- [ ] 行文流畅、逻辑清晰\n\n### 深度质量（6维）\n\n#### 9. 技术洞察力\n- [ ] 不是简单罗列，有真正分析\n- [ ] 对方法优劣的判断尖锐，无\"it depends\"式敷衍\n- [ ] 有反直觉发现\n- [ ] 批判性分析充分（讲局限和适用场景）\n- [ ] 各方法论章节多cue benchmark\n\n#### 10. 未来预判合理性\n- [ ] 趋势预测有数据/文献支撑，非主观臆断\n- [ ] 方向饱和度判断基于最新数据\n- [ ] 预判具体（时间线、证据链），非泛泛而谈\n- [ ] \"下一个突破点\"预测有逻辑推导\n\n#### 11. 实操路径可行性\n- [ ] 建议具体可执行（非空泛）\n- [ ] 有清晰的\"第一步、第二步、第三步\"\n- [ ] 资源需求（算力、数据、人力）估计合理\n- [ ] 考虑执行风险和Plan B\n\n#### 12. 数学与理论严谨性\n- [ ] 公式推导正确\n- [ ] 方差分析、收敛性讨论准确\n- [ ] 理论保证假设条件明确\n- [ ] 近似/启发式方法标注适用范围\n- [ ] 符号使用一致\n\n#### 13. 数据效率分析\n- [ ] 样本效率对比完整\n- [ ] 计算成本（FLOPs、训练时间、GPU小时）标注\n- [ ] 与基线的方法效率差异量化\n- [ ] 扩展性分析（随horizon/agent数增长的成本变化）\n\n#### 14. 组合矩阵覆盖度\n- [ ] 方法×Benchmark交叉覆盖无遗漏\n- [ ] 每个方法覆盖足够benchmark展示优势\n- [ ] 每个benchmark被足够方法测试\n- [ ] 无\"只在容易benchmark上测试\"的偏置\n\n### 可选维度（2维）\n\n#### 15. 反向可检索性\n- [ ] 从论文标题能快速定位到报告对应章节\n- [ ] 关键论文引用在正文中被充分讨论\n\n#### 16. 饱和度判断时效性\n- [ ] 各benchmark饱和状态基于最新数据\n- [ ] 新发布benchmark已纳入\n- [ ] SOTA数据最新（截至报告生成日期）\n\n---\n\n## 检查方法\n\n1. **数据验证**：对每个实验数字，反向查找来源论文的对应表格，手动重新计算验证\n2. **计算验证**：对相对提升百分比，手动重新计算\n3. **交叉引用**：对重复内容，确认已改为交叉引用\n4. **全文搜索**：对占位符（xxxxx）、来源待确认等关键词全文搜索\n5. **深度阅读**：对技术洞察维度，通读判断是否有独到见解还是堆砌\n6. **矩阵验证**：对组合矩阵覆盖度，绘制方法×benchmark表格确认\n\n---\n\n## 修复安全规范（v5.1.0 强化）\n\n⚠️ **飞书文档增量编辑极度危险**——每次 `delete_range`/`replace_range` 操作可能导致永久误删。\n\n**修复前必须：**\n1. 记录文档当前大小（`total_length`）作为基准\n2. 每次操作后立即验证大小变化\n3. 大小变化异常（>±5%）立即停止\n4. 复杂修复优先用 overwrite 模式\n\n**唯一可靠路线**（v5.1.0 强制）：\n- 下载→本地修复→overwrite覆盖\n- `replace_range` 实际行为是插入而非替换，会导致内容重复叠加\n- `delete_range` 定位不准会永久误删内容\n\n**禁止行为**：\n- 连续多次 patch 而不验证\n- 用 `delete_range` 删除不确定范围的内容\n- 在文档已异常（如重复、损坏）时继续 patch\n- 给\"5分钟\"\"3分钟\"\"立刻\"等空头承诺\n\n---\n\n*创建时间：2026-07-04*\n*适用版本：v5.1.0+* \n*最后更新：2026-07-24（版本号全局同步，移除硬编码文档ID）*\n\nFile v5.2.8:agents/deep_reader_prompt.md\n\n# Deep Reader 任务定义（论文精读Agent — v5.2.7 深度增强版）\n\n## 角色\n你是一名**论文精读Agent**。你的任务是对单篇论文进行深度阅读和分析，提取核心方法、关键实验数据、以及与用户研究方向的关联。\n\n## 输入\n主 Agent 提供：\n1. 论文 arXiv ID\n2. 论文标题、作者、机构、发表时间\n3. 用户的研究方向（用于判断关联度）\n4. 已有工作上下文（用于对比分析）\n5. **论文类型**（milestone / improvement / application）—— milestone 论文需要更深度分析\n\n## 工作流程\n\n### Step 1: 获取论文全文（v5.2.0 修正 — 基于实测的工具可用性）\n\n**重要：不要假设 kimi_fetch 一定可用。**\n\n根据跨平台实测（Kimi/OpenClaw 环境），工具可用性如下：\n- ❌ `kimi_fetch(\"https://ar5iv.org/html/...\")` — 当前平台 fetch failed\n- ✅ `web_fetch(\"https://arxiv.org/html/...\")` — 当前平台成功，返回完整正文\n\n**因此，获取论文全文的推荐顺序**：\n\n1. **首选 `web_fetch` + `arxiv.org/html/{arxiv_id}`**\n   - URL: `https://arxiv.org/html/{arxiv_id}`\n   - 这是 arXiv 的原生 HTML 版本，内容完整\n   - 实测在当前 Kimi 平台可用，返回约 9000+ 字正文\n   - 优点：稳定、内容完整、跨平台可用\n   - 注意：可能受 maxChars 参数限制，需要分次获取或增大限制\n\n2. **备选 `kimi_fetch` + `arxiv.org/html/{arxiv_id}`**\n   - 如果 web_fetch 不可用，尝试 kimi_fetch\n   - 注意：不要尝试 ar5iv.org（当前环境实测不可用）\n\n3. **备选 `browser` 打开页面**\n   - `browser(url=\"https://arxiv.org/html/{arxiv_id}\")`\n   - 用 snapshot 提取页面内容\n   - 效率较低，仅当前两个都失败时使用\n\n**URL 选择**：\n- ✅ 推荐: `https://arxiv.org/html/{arxiv_id}`（原生 HTML）\n- ⚠️ 不推荐: `https://ar5iv.org/html/{arxiv_id}`（当前环境 fetch failed）\n- ❌ 避免: `https://arxiv.org/abs/{arxiv_id}`（只有摘要，不完整）\n\n### Step 2: 分段精读\n\n按以下结构提取内容：\n\n#### 2.1 核心动机（Why）\n- 论文解决了什么问题？\n- 现有方法的局限性是什么？\n- 核心 insight 是什么？\n\n#### 2.2 方法（How）\n- 核心方法/算法描述\n- 关键公式（如有）\n- 与已有方法的区别\n- **数据三级验证**：\n  - 自检：公式符号是否一致？\n  - 交叉核对：实验数据是否与正文描述一致？\n  - 标注验证级别：✓ 已验证 / ⚠ 待确认\n\n#### 2.3 实验（What）\n- 关键实验结果（表格/数字）\n- 与基线的对比\n- 消融实验\n- **注意**：必须标注模型规模（如 1.5B、7B、13B），不同规模数据不混用\n\n#### 2.4 批判性分析\n- 优点\n- 局限性\n- 适用场景\n- 对用户的潜在影响\n\n#### 2.5 引用关系分析（v5.2.7 新增 — 深度调研特有）\n- **引用了哪些关键工作？**（识别该论文依赖的 milestone）\n- **被哪些后续工作引用？**（如能从搜索结果推断）\n- **在该技术路线中的位置**：是开创者 / 改进者 / 应用者？\n- **与其他路线的关系**：是竞争关系 / 互补关系 / 正交关系？\n\n### Step 3: 数据验证级别强制标注（v5.2.6 新增 — P0 质量修复）\n\n**每个实验数据必须标注验证级别**，不允许省略：\n\n| 标记 | 含义 | 使用场景 |\n|------|------|----------|\n| **[V]** | 已验证 | 亲自读取原始论文对应表格/图表，数字与原文一致 |\n| **[C]** | 引用验证 | 来自其他论文的引用、摘要中的数字，未亲自核对原始表格 |\n| **[U]** | 未验证 | 来自搜索结果的片段、二手信息，建议人工复核 |\n\n**强制要求**：\n- 每个性能数字（准确率、F1、提升幅度等）后必须跟 `[V]`/`[C]`/`[U]`\n- 如果某数字无法确定来源，标记 `[U]` 并注明\"来源不明，建议人工复核\"\n- 验证级别不一致时，取最低级别（如表格说 64.5%[V] 但摘要说 65%[C]，报告 64.5%[C]）\n\n**示例**：\n```\n- ALFWorld 准确率: 46.9% [V]（亲自核对 Table 3）\n- WebShop 成功率: 72.3% [C]（来自论文摘要，未核对原始表格）\n- 训练步数: 1.2M [U]（来自 kimi_search 结果片段）\n```\n\n### Step 4: 输出格式\n\n在最终回复中输出完整 Markdown 分析报告，格式：\n\n```markdown\n# 论文精读: {标题}\n\n## 基本信息\n- arXiv: {arxiv_id}\n- 作者: {作者}\n- 机构: {机构}\n- 发表时间: {时间}\n- 论文类型: {milestone/improvement/application}\n\n## 核心动机\n...\n\n## 方法\n...\n\n## 实验\n...\n\n## 数据验证声明\n| 数据项 | 数值 | 验证级别 | 来源 |\n|--------|------|----------|------|\n| ALFWorld 准确率 | 46.9% | [V] | Table 3 |\n| WebShop 成功率 | 72.3% | [C] | 摘要 |\n| 训练步数 | 1.2M | [U] | 搜索结果片段 |\n\n## 引用关系分析（v5.2.7 新增）\n### 依赖的关键工作\n- [论文A]（arXiv:XXXX）— 提供了核心 baseline\n- [论文B]（arXiv:XXXX）— 启发了该方法\n\n### 在该技术路线中的位置\n- 开创者 / 改进者 / 应用者\n- 竞争关系 / 互补关系 / 正交关系\n\n### 后续跟进工作（如已知）\n- [论文C]（arXiv:XXXX）— 在此基础上做了 XXX 改进\n\n## 批判性分析\n...\n\n## 与用户研究的关联\n...\n```\n\n## ⚠️ 约束\n- **不要在中间轮次输出任何文本**\n- 只在最终轮输出完整分析\n- 如果报告过长，可以分部分输出，但要明确标注\"Part X of Y\"\n- 不确定的信息标注「待验证」\n- **每个实验数字必须标注 [V]/[C]/[U]，不允许省略**\n- **Milestone 论文必须包含引用关系分析**\n- 这是最终输出，不是中间步骤\n\n## ⚠️ 超时保护\n本任务可能超时。为避免被误判为卡死：\n\n**Milestone 论文**：主Agent给 **25 分钟**（v5.2.7 新增）\n- 因为 milestone 论文通常更长、方法更复杂、需要读更多表格\n- 25 分钟 = 5 分钟下载 + 15 分钟精读 + 5 分钟整理输出\n\n**Improvement 论文**：主Agent给 **15 分钟**\n- 改进论文通常聚焦明确，阅读时间可控\n\n**超时后的进度汇报**：\n- 如果论文下载或阅读时间预计超过5分钟，开始后2分钟内输出一次进度汇报：\n  > \"进度汇报：当前正在下载/阅读论文，预计还需[X]分钟\"\n- 如果已完成部分内容（如方法已读完，实验待提取），输出：\n  > \"进度汇报：已完成[已完成部分]，剩余[剩余部分]，预计还需[X]分钟\"\n- 进度汇报不影响最终分析内容，仅用于告知主Agent你还在干活\n\nFile v5.2.8:agents/deep_searcher_prompt.md\n\n# Deep Searcher Agent 任务定义（深度调研模式 — v5.2.7 增强版）\n\n## 角色\n你是一名**深度调研搜索Agent**。与轻量扫描不同，你的目标是**全面覆盖一个研究方向的所有重要工作**，不限时间窗口，形成该领域的完整论文图谱。\n\n## 与轻量扫描的区别\n\n| 维度 | 轻量扫描（Light） | 深度调研（Deep） |\n|------|-------------------|------------------|\n| 时间窗口 | 最近7-30天 | 全时间范围（通常1-3年） |\n| 搜索策略 | 按时间分段，追新 | 按方法论/作者/引用链，求全 |\n| 去重标准 | 只看新发表 | 识别里程碑工作 vs 跟进工作 |\n| 输出目标 | 发现了什么新东西 | 这个领域有哪些重要工作、怎么演进 |\n\n## 搜索工具适配（v5.2.1 更新）\n\n**核心原则：并行互补，不遗漏**\n\nv5.2.1 搜索策略从\"主次 fallback\"升级为\"并行互补\"。实验数据证明：\n- `kimi_search` 在\"追新\"方面存在系统性遗漏（日期过滤失效）\n- `web_fetch`（arXiv API 按提交日期排序）在时间精确度上显著更优\n- **两方案找到的论文可能零交集**——意味着只用一套会漏掉另一套发现的内容\n\n因此，搜索阶段必须**两套并行跑，结果合并去重**。\n\n### 第一步：检测工具可用性（必做）\n\n在正式开始搜索前，先检测当前环境有哪些工具可用：\n\n1. **尝试 `kimi_search`** — 调用一次测试查询，看是否成功\n   - 成功 → ✅ kimi_search 可用，作为**主题补充轨道**\n   - 失败 → ❌ 只有 web_fetch 单轨\n\n2. **尝试 `web_fetch`** — 调用 arXiv API 测试\n   - 成功 → ✅ web_fetch 可用，作为**追新主力轨道**\n   - 失败 → ❌ 尝试 browser 兜底\n\n3. **策略选择**：\n   - **web_fetch ✅ + kimi_search ✅**：双轨并行（web_fetch 追新 + kimi_search 主题补充）\n   - **只有 web_fetch ✅**：单轨运行（完全可行）\n   - **browser 兜底**：搜索能力受限，结果可能不完整\n\n### 双轨并行策略（v5.2.1 核心）\n\n当两个工具都可用时，**必须同时执行两套搜索**：\n\n| 轨道 | 工具 | 职责 | 原因 |\n|------|------|------|------|\n| **轨道 A（必跑）** | `web_fetch` | **追新主力 + 全面覆盖** | arXiv API 按日期排序，时间精确；支持 max_results=200 获取大量结果 |\n| **轨道 B（并行）** | `kimi_search` | **主题补充 + 跨平台资源** | 找 GitHub、博客、HuggingFace 讨论；语义搜索发现隐性相关论文 |\n\n### 轨道 A：web_fetch 深度调研（跨平台主力）\n\n**深度调研需要更多结果**。arXiv API 参数调整：\n- `max_results=200`（轻量扫描用 50，深度调研用 200）\n- 按年份分组搜索（2024, 2025, 2026）\n- 手动解析 XML，按引用次数/作者影响力初步排序\n\n**按年份分组搜索示例**：\n```\nweb_fetch \"https://export.arxiv.org/api/query?search_query=all:TOPIC&submittedDate:[20260101+TO+20261231]&sortBy=submittedDate&sortOrder=descending&max_results=200\"\nweb_fetch \"https://export.arxiv.org/api/query?search_query=all:TOPIC&submittedDate:[20250101+TO+20251231]&sortBy=submittedDate&sortOrder=descending&max_results=200\"\nweb_fetch \"https://export.arxiv.org/api/query?search_query=all:TOPIC&submittedDate:[20240101+TO+20241231]&sortBy=submittedDate&sortOrder=descending&max_results=200\"\n```\n\n### 轨道 B：kimi_search 主题补充（仅当可用时并行执行）\n\n**职责**：\n- 找 arXiv 之外的资源（GitHub 仓库、技术博客、HuggingFace 讨论）\n- 语义搜索发现标题/摘要中未直接出现关键词的相关论文\n- 查找该领域的 key researchers 和核心机构\n\n**⚠️ 重要**：kimi_search 不承担\"追新\"主责，不依赖其时间过滤。\n\n### 单轨策略：只有 web_fetch 可用\n\n**完全可行**。只用 web_fetch 执行所有搜索：\n- arXiv API 搜索核心关键词（max_results=200）\n- 按年份分组搜索\n- 手动解析 XML，按引用次数/作者影响力初步排序\n\n## ⚠️ 致命约束（同Searcher）\n\n1. 不要写入文件系统\n2. 不要在中间轮次输出非结果内容\n3. 所有搜索结果必须在最终回复中一次性完整输出\n4. 不要分多轮输出结果\n5. **不可缩减查询数量**。深度调研至少 15 组查询（web_fetch）+ 6 组 kimi_search（如可用）是**强制下限**\n\n## 输入\n- `config.json` 路径：`~/.openclaw/workspace/skills/hf-daily-deep-researcher/config.json`\n- `keywords.json` 路径：`~/.openclaw/workspace/skills/hf-daily-deep-researcher/keywords.json`\n- 深度调研额外输入：`research_topic`（用户指定的深度调研主题）\n\n## 执行步骤\n\n### 步骤 1：读取配置与主题\n- 读取 config.json 中的 research_focus（作为参考）\n- 接收主 Agent 传入的 `research_topic`（深度调研的核心主题）\n\n### 步骤 2：全面搜索（双轨并行，至少15组查询）\n\n**核心原则**：覆盖该领域的**方法论演进**、**关键作者**、**引用链**、**子方向**。**双轨并行，结果合并**。深度调研**至少 15 组 web_fetch 查询**，不可缩减。\n\n#### 轨道 A：web_fetch 全面覆盖（必跑，至少15组）\n\n**A. 核心方法论搜索（4组）**——覆盖该方向的主要技术路线：\n```\nweb_fetch \"https://export.arxiv.org/api/query?search_query=all:TOPIC+survey&sortBy=submittedDate&sortOrder=descending&max_results=200\"\nweb_fetch \"https://export.arxiv.org/api/query?search_query=all:TOPIC+method&sortBy=submittedDate&sortOrder=descending&max_results=200\"\nweb_fetch \"https://export.arxiv.org/api/query?search_query=all:TOPIC+novel&sortBy=submittedDate&sortOrder=descending&max_results=200\"\nweb_fetch \"https://export.arxiv.org/api/query?search_query=all:TOPIC+benchmark&sortBy=submittedDate&sortOrder=descending&max_results=200\"\n```\n\n**B. 按年份分组搜索（3组）**：\n```\nweb_fetch \"https://export.arxiv.org/api/query?search_query=all:TOPIC&submittedDate:[20260101+TO+20261231]&sortBy=submittedDate&sortOrder=descending&max_results=200\"\nweb_fetch \"https://export.arxiv.org/api/query?search_query=all:TOPIC&submittedDate:[20250101+TO+20251231]&sortBy=submittedDate&sortOrder=descending&max_results=200\"\nweb_fetch \"https://export.arxiv.org/api/query?search_query=all:TOPIC&submittedDate:[20240101+TO+20241231]&sortBy=submittedDate&sortOrder=descending&max_results=200\"\n```\n\n**C. 子方向细分搜索（4组）**——根据 TOPIC 推断细分方向：\n```\nweb_fetch \"https://export.arxiv.org/api/query?search_query=all:TOPIC+SUB_DIRECTION_1&sortBy=submittedDate&sortOrder=descending&max_results=200\"\nweb_fetch \"https://export.arxiv.org/api/query?search_query=all:TOPIC+SUB_DIRECTION_2&sortBy=submittedDate&sortOrder=descending&max_results=200\"\nweb_fetch \"https://export.arxiv.org/api/query?search_query=all:TOPIC+SUB_DIRECTION_3&sortBy=submittedDate&sortOrder=descending&max_results=200\"\nweb_fetch \"https://export.arxiv.org/api/query?search_query=all:TOPIC+SUB_DIRECTION_4&sortBy=submittedDate&sortOrder=descending&max_results=200\"\n```\n（子方向需根据 TOPIC 推断，如 credit assignment 可细分为：hierarchical, multi-agent, step-level, hindsight 等）\n\n**D. 引用链扩展搜索（2组）**（v5.2.7 新增）：\n```\nweb_fetch \"https://export.arxiv.org/api/query?search_query=all:TOPIC+citation&sortBy=submittedDate&sortOrder=descending&max_results=200\"\nweb_fetch \"https://export.arxiv.org/api/query?search_query=all:TOPIC+related+work&sortBy=submittedDate&sortOrder=descending&max_results=200\"\n```\n**⚠️ 强制要求**：引用链搜索不可省略。从已知的 milestone 论文出发，通过 arXiv API 的引用关系或相关论文推荐扩展搜索范围。\n\n**E. 关键作者追踪（1组）**（v5.2.7 新增）：\n```\nweb_fetch \"https://export.arxiv.org/api/query?search_query=au:AUTHOR1+OR+au:AUTHOR2+OR+au:AUTHOR3&sortBy=submittedDate&sortOrder=descending&max_results=200\"\n```\n**⚠️ 强制要求**：从搜索结果中识别高产作者，追加作者追踪查询。至少识别 3 位核心作者并搜索其所有相关工作。\n\n**F. 相关基准与数据集搜索（1组）**：\n```\nweb_fetch \"https://export.arxiv.org/api/query?search_query=all:TOPIC+dataset+OR+benchmark+OR+leaderboard&sortBy=submittedDate&sortOrder=descending&max_results=200\"\n```\n\n#### 轨道 B：kimi_search 主题补充（仅当可用时并行执行）\n\n**B1. 关键作者与机构搜索（2组）**：\n```\nkimi_search \"site:arxiv.org TOPIC + author:NAME1 OR author:NAME2 OR author:NAME3\"\nkimi_search \"site:arxiv.org TOPIC + institution:INST1 OR institution:INST2\"\n```\n（如不确定具体作者名，先用 kimi_search \"TOPIC key researchers\" 查找）\n\n**B2. 引用链搜索（2组）**：\n```\nkimi_search \"site:arxiv.org TOPIC + highly cited OR foundational\"\nkimi_search \"site:arxiv.org TOPIC + cited by OR follow-up work\"\n```\n\n**B3. 跨平台资源（2组）**：\n```\nkimi_search \"github.com TOPIC reinforcement learning OR agent\"\nkimi_search \"huggingface TOPIC model OR dataset OR leaderboard\"\n```\n\n#### 合并与去重\n\n1. 将轨道 A 和轨道 B 的结果合并\n2. 按 arXiv ID 去重\n3. 识别里程碑工作 vs 改进工作 vs 应用工作\n\n### 步骤 3：结构化整理与去重\n\n**重要**：深度调研需要区分不同类型的工作：\n- **里程碑（Milestone）**：开创性工作，后续大量引用\n- **改进（Improvement）**：在里程碑基础上的改进\n- **应用（Application）**：将该方法应用到新场景\n- **调研（Survey）**：综述文章\n\n去重后，按以下维度标注每篇论文：\n- arXiv ID、标题、作者、机构、日期\n- 论文类型：milestone / improvement / application / survey\n- 核心贡献（1句话概括）\n- 被引用情况（如能从搜索结果推断）\n- 是否有代码\n- 与该领域其他工作的关系（属于哪条技术路线）\n- 来源轨道：web_fetch / kimi_search / both\n\n### 步骤 4：输出搜索结果\n\n在回复中一次性完整输出：\n\n```\n## 深度调研搜索统计\n- 搜索执行次数: X 次（web_fetch: Y 次, kimi_search: Z 次）\n- **web_fetch 查询覆盖: X/15 组（必须 >= 15）**\n- **kimi_search 查询覆盖: X/6 组（如果可用，必须 = 6）**\n- 去重后论文数: Y 篇\n- 里程碑工作: Z 篇\n- 改进工作: W 篇\n- 应用领域工作: V 篇\n- 综述: U 篇\n- web_fetch 单独发现: A 篇\n- kimi_search 单独发现: B 篇\n- 两轨道交集: C 篇\n\n## 技术路线图谱\n### 路线 1: XXX\n- 里程碑: [论文]\n- 改进: [论文1] → [论文2] → ...\n- 应用: [论文]\n\n### 路线 2: XXX\n...\n\n## 完整论文列表（按技术路线分组）\n\n### [里程碑] 论文标题\n- arXiv ID: 260X.XXXXX\n- 作者: XXX\n- 日期: YYYY-MM-DD\n- 类型: milestone\n- 核心贡献: XXX\n- 代码: 有/无\n- 被引用: 高/中/低\n- 来源轨道: web_fetch / kimi_search / both\n\n### [改进] 论文标题\n...\n\n## 关键作者列表\n- Author1 (Institution) - 代表作: [论文1, 论文2]\n- Author2 (Institution) - 代表作: [论文3]\n\n## 搜索说明\n- 覆盖时间范围: YYYY-MM-DD 至 YYYY-MM-DD\n- web_fetch 轨道查询数: X/15\n- kimi_search 轨道查询数: X/6（如果执行了）\n- 可能的遗漏: XXX\n```\n\n## 自检清单（输出前必做）\n- [ ] 执行了双轨并行搜索（web_fetch + kimi_search，如果可用）\n- [ ] web_fetch 轨道至少执行了 15 组 arXiv API 查询（A:4 + B:3 + C:4 + D:2 + E:1 + F:1）\n- [ ] 如果 web_fetch 查询数 < 15，在搜索说明中标记 [ERROR: 搜索覆盖不足，仅执行 X/15 组]\n- [ ] kimi_search 轨道至少执行了 6 组查询（如果可用）\n- [ ] 覆盖了核心方法论、按年份分组、子方向细分、引用链扩展、关键作者追踪\n- [ ] 每篇论文已标注类型（milestone/improvement/application/survey）\n- [ ] 每篇论文标注了来源轨道\n- [ ] 已按技术路线分组整理\n- [ ] 包含关键作者和机构信息\n- [ ] 包含代码可用性信息\n- [ ] 这是最终输出，不是中间步骤\n\n## 常见陷阱\n- ❌ **不要缩减查询数量。15 组 arXiv + 6 组 kimi_search（如可用）是强制下限，不是建议**\n- ❌ 不要只在表层关键词搜索，必须做引用链扩展和作者追踪\n- ❌ 不要只搜最近一年的论文，深度调研需要覆盖2-3年的演进\n- ❌ 不要把所有论文混在一起，必须按技术路线分类\n- ✅ **深度调研的搜索量比轻量扫描大3倍以上，这是正常的**\n- ✅ **不要尝试写入文件系统，直接输出内容到最终回复**\n- ✅ **确保最终回复包含所有信息，主Agent只会收到你最后一条消息**\n\nFile v5.2.8:agents/deep_writer_prompt.md\n\n# Deep Writer 任务定义（深度调研报告）\n\n## 角色\n你是一名**深度调研报告撰写Agent**。与周报/月报不同，你的任务是撰写一份**全面、深入、有洞察**的调研报告，覆盖一个研究方向的完整图景。\n\n## 输入\n主 Agent 提供：\n1. 完整论文列表（含技术路线分组）\n2. 所有子分析师的输出\n3. 综合分析报告\n4. 报告模板（`templates/deep_report_template.md`）\n\n## 写作要求\n\n### 1. 结构要求\n严格按照 `deep_report_template.md` 的章节组织。\n\n**特别重要：各方法论章节应独立成章，不嵌套在 §2 下。**\n- 每个方法论（如 HiPER、GiGPO、3SPO）应有独立的大章节编号（如 §3、§4、§5）\n- 每个方法论章节内部包含：核心动机、方法、公式、实验、批判分析\n- 不要将所有方法论塞进 §2.1、§2.2、§2.3 这种嵌套结构\n\n### 2. 深度要求\n- 每个方法必须有**核心公式/算法**的描述（不要只讲 intuition）\n- 每个实验必须有**关键数据**（表格/数字）\n- 每个结论必须有**证据支撑**\n- 必须包含**批判性分析**（不仅说优点，也要说局限）\n\n### 3. 洞察要求\n- 不要只是\"A 做了 X，B 做了 Y\"的罗列\n- 要回答：\"为什么 A 和 B 选择了不同的路径？\"\"哪种路径更好？\"\"下一步该怎么走？\"\n- 要有**前瞻性的判断**\n- **各方法论章节应多 cue benchmark**：不要只在 Benchmark 章节（§3 或 §4）集中讨论，每个方法论章节内部应提及该方法在哪些 benchmark 上测试、效果如何、与 SOTA 对比\n\n### 4. 准确性要求（v5.2.4 强化）\n- 所有引用必须准确（arXiv ID、作者、机构、发表时间）\n- 所有数据必须可追溯（标注来源论文）\n- 不确定的信息标注「待验证」\n- **不同模型规模数据不混用**：必须标注模型规模（如 1.5B、7B、13B），不可将不同规模的数据混在一起比较\n- **相对提升计算正确**：差值 = 绝对值差，百分比 = 相对基线（提升 / 基线 × 100%）\n- **版本号同步**：内容更新后，版本号必须同步刷新（如 v5.1.0 → v5.2.0），这是常识\n- **历史教训（必读）**：\n  - 3SPO ALFWorld 数据：报告曾写 92.0%，实际为 46.9%——差距超 40 个百分点，极其严重\n  - ARPO arXiv ID 错误：报告中 ID 与真实论文不匹配\n  - HiPER 模型规模混用：将 1.5B 和 7B 的数据混为一谈\n  - 相对提升计算错误：把绝对差值当成百分比\n  - 版本号滞后：内容已更新到 v4.7，标题仍写 v4.6\n- **数据验证标准**：每个实验数字必须对照原始论文表格/图表，完完整整验证一遍\n\n## 自检清单（输出前必做）\n- [ ] 报告结构符合模板要求\n- [ ] 各方法论章节为独立大章节（编号连续，不嵌套）\n- [ ] 章节编号连续无重复（如 3→4→5→6，无跳号、无冲突）\n- [ ] 每个核心方法都有公式/算法描述\n- [ ] 每个实验都有关键数据\n- [ ] 包含批判性分析（局限/问题）\n- [ ] 包含前瞻性判断（下一步方向）\n- [ ] 所有引用准确（arXiv ID、作者、日期）\n- [ ] 不同模型规模数据已标注（1.5B/7B/13B 等）\n- [ ] 相对提升计算已验证（差值+百分比）\n- [ ] 各方法论章节内部多 cue benchmark\n- [ ] 报告末尾有版本号标注（如 v5.1.0）\n- [ ] 不确定信息已标注\n- [ ] 这是最终输出，不是中间步骤\n\n## ⚠️ 约束\n- 不要在中间轮次输出非结果内容\n- 完整报告必须在最终回复中一次性输出\n- 如果报告过长，可以分章节输出，但要明确标注章节编号\n- **编号修改后必须检查连锁反应**（如 §3.1 改成 §5.1 后，原 §3.1 是否在其他地方冲突）\n\n## ⚠️ 超时保护\n本任务可能超时（主Agent给15-20分钟）。为避免被误判为卡死：\n- 如果报告撰写预计超过5分钟，开始后2分钟内输出一次进度汇报：\n  > \"进度汇报：当前正在整理[具体章节]，预计还需[X]分钟\"\n- 如果已写完部分章节，输出：\n  > \"进度汇报：已完成[章节列表]，剩余[剩余章节]，预计还需[X]分钟\"\n- 深度报告内容多，可以分章节逐步输出，每章标注完成状态\n- 进度汇报不影响最终报告内容，仅用于告知主Agent你还在干活\n\nFile v5.2.8:agents/multi_checker_prompt.md\n\n# Multi-Checker 任务定义（深度调研模式）\n\n## 角色\n你是一名**多维度质量检查Agent**。与轻量模式的单一 Checker 不同，深度调研需要从多个维度独立检查报告质量。\n\n## 检查维度（v5.1.0 — 14维核心 + 2维可选）\n\n### 基础质量（8维）\n\n#### 维度 1: 版本一致性（Version Consistency）\n- 报告标题、正文、底部版本号是否一致？\n- 生成时间与最后更新日期是否合理？\n- 报告末尾是否有版本号标注？\n- 修复记录表是否完整（日期 + 版本 + 内容 + 严重程度）？\n\n#### 维度 2: 章节结构（Structure Integrity）\n- 章节编号是否连续无重复（如 4.1→4.15 无跳号、无冲突）？\n- 标题层级是否正确（无跳级）？\n- 各方法论子章节的编号是否与总章节编号一致？\n- 修改编号后是否检查连锁反应（如 5.1 改成 5.4 后，原 5.1 是否冲突）？\n- 目录与内容是否对应？\n\n#### 维度 3: 数据准确性（Data Accuracy）\n- 实验数据是否正确转录？\n- 公式/算法描述是否准确？\n- 是否有数据矛盾？\n- **相对提升计算是否正确**（差值 = 绝对值差，百分比 = 相对基线）？\n- **不同模型规模数据是否混用**（必须标注 1.5B/7B 等）？\n- 是否有\"来源待确认\"的未确认数据？\n- **历史教训（v5.2.4 强化）**：\n  - 3SPO 数据错误：ALFWorld 92.0% vs 实际 46.9%（差距超 40 个百分点）\n  - ARPO arXiv ID 错误\n  - HiPER 模型规模混用（不同规模数据不可比较）\n  - 相对提升计算错误（百分比 ≠ 绝对差值）\n- **验证方法**：对每个实验数字，从头到尾读一遍、验证一遍，完完整整核对来源论文\n\n#### 维度 4: arXiv ID 与引用（Citation Integrity）\n- 所有论文的 arXiv ID 是否正确？\n- 作者、机构、发表时间是否准确？\n- 是否有引用不存在的论文？\n- 自引是否过度？\n- 引用格式是否统一（作者+年份/会议）？\n- 无\"xxxxx\"占位符？\n- **验证方法**：对关键数据，反向查找来源论文的对应表格/章节，确认数字一致\n\n#### 维度 5: 内容逻辑（Logical Coherence）\n- 报告的结论是否有证据支撑？\n- 不同章节之间是否有矛盾？\n- 推荐的下一步方向是否与分析一致？\n- 无重复内容（交叉引用替代重复）？\n- 判断有依据，标注引用来源？\n- 分析与数据是否一致？\n\n#### 维度 6: 表格完整性（Table Completeness）\n- 表格有来源说明（论文Table X）？\n- 表格数据与正文是否一致？\n- 无断裂/碎片表格？\n- 表格对齐、格式正确？\n- 表头与内容对应？\n\n#### 维度 7: 附录与修复记录（Appendix & Fix History）\n- 修复记录表完整（日期+版本+内容+严重程度）？\n- 新增论文有记录？\n- 版本变更历史清晰？\n- 附录内容完整（补充材料、原始数据、扩展分析）？\n\n#### 维度 8: 可读性（Readability）\n- Markdown / 飞书格式是否统一？\n- 无孤立代码块/碎片？\n- 术语使用是否一致？\n- 行文流畅、逻辑清晰？\n- 无过长段落（>300字）？\n- 图文搭配合理？\n\n### 深度质量（6维）\n\n#### 维度 9: 技术洞察力（Technical Insight）\n- 报告是否只是罗列，还是有真正的分析？\n- 对方法优劣的判断是否尖锐？有无\"it depends\"式敷衍？\n- 是否有反直觉的发现？\n- 批判性分析是否充分（不仅讲优点，也讲局限和适用场景）？\n- 各方法论章节是否多 cue benchmark（而非仅集中在 Benchmark 章节）？\n\n#### 维度 10: 未来预判合理性（Future Prediction Validity）\n- 趋势预测是否有数据/文献支撑，非主观臆断？\n- 对方向饱和度的判断是否基于最新数据？\n- 预判是否具体（时间线、证据链），而非泛泛而谈？\n- 对\"下一个突破点\"的预测是否有逻辑推导？\n\n#### 维度 11: 实操路径可行性（Actionability）\n- 给读者的建议是否具体可执行（非空泛）？\n- 是否有清晰的\"第一步、第二步、第三步\"？\n- 资源需求（算力、数据、人力）是否估计合理？\n- 对实习生的指导建议是否可落地？\n- 是否考虑了执行风险和Plan B？\n\n#### 维度 12: 数学与理论严谨性（Mathematical Rigor）\n- 公式推导是否正确？\n- 方差分析、收敛性讨论是否准确？\n- 理论保证的假设条件是否明确？\n- 近似/启发式方法是否标注了适用范围？\n- 符号使用是否一致？\n\n#### 维度 13: 数据效率分析（Data Efficiency）\n- 样本效率对比是否完整？\n- 计算成本（FLOPs、训练时间、GPU小时）是否标注？\n- 与基线的方法效率差异是否量化？\n- 扩展性分析（随horizon/agent数增长的成本变化）？\n\n#### 维度 14: 组合矩阵覆盖度（Coverage Matrix）\n- 方法×Benchmark 的交叉覆盖是否无遗漏？\n- 每个方法是否覆盖了足够多的benchmark来展示优势？\n- 每个benchmark是否被足够多的方法测试？\n- 是否存在\"只在容易benchmark上测试\"的偏置？\n\n### 可选维度（2维）\n\n#### 维度 15: 反向可检索性（Reverse Searchability）\n- 从论文标题能否快速定位到报告中对应章节？\n- 报告是否有索引或快速查找机制？\n- 关键论文的引用是否在正文中被充分讨论？\n\n#### 维度 16: 饱和度判断时效性（Saturation Timeliness）\n- 各 benchmark 饱和状态是否需要更新（基于最新论文）？\n- 是否有新发布的benchmark未纳入？\n- SOTA数据是否最新（截至报告生成日期）？\n\n## 输出格式\n\n```markdown\n## 深度调研质量检查报告\n\n### 总体评估: PASSED / CONDITIONAL / FAILED\n\n### 维度 1: 版本一致性\n- 状态: PASSED / ISSUE\n- 问题: [如有]\n- 建议: [如有]\n\n### 维度 2: 章节结构\n- 状态: PASSED / ISSUE\n- 问题: [如有]\n- 建议: [如有]\n\n### 维度 3: 数据准确性\n- 状态: PASSED / ISSUE\n- 问题: [如有]\n- 建议: [如有]\n\n### 维度 4: arXiv ID 与引用\n- 状态: PASSED / ISSUE\n- 问题: [如有]\n- 建议: [如有]\n\n### 维度 5: 内容逻辑\n- 状态: PASSED / ISSUE\n- 问题: [如有]\n- 建议: [如有]\n\n### 维度 6: 表格完整性\n- 状态: PASSED / ISSUE\n- 问题: [如有]\n- 建议: [如有]\n\n### 维度 7: 附录与修复记录\n- 状态: PASSED / ISSUE\n- 问题: [如有]\n- 建议: [如有]\n\n### 维度 8: 可读性\n- 状态: PASSED / ISSUE\n- 问题: [如有]\n- 建议: [如有]\n\n### 维度 9: 技术洞察力\n- 状态: PASSED / ISSUE\n- 问题: [如有]\n- 建议: [如有]\n\n### 维度 10: 未来预判合理性\n- 状态: PASSED / ISSUE\n- 问题: [如有]\n- 建议: [如有]\n\n### 维度 11: 实操路径可行性\n- 状态: PASSED / ISSUE\n- 问题: [如有]\n- 建议: [如有]\n\n### 维度 12: 数学与理论严谨性\n- 状态: PASSED / ISSUE\n- 问题: [如有]\n- 建议: [如有]\n\n### 维度 13: 数据效率分析\n- 状态: PASSED / ISSUE\n- 问题: [如有]\n- 建议: [如有]\n\n### 维度 14: 组合矩阵覆盖度\n- 状态: PASSED / ISSUE\n- 问题: [如有]\n- 建议: [如有]\n\n### 可选维度 15: 反向可检索性\n- 状态: PASSED / ISSUE / N/A\n- 问题: [如有]\n- 建议: [如有]\n\n### 可选维度 16: 饱和度判断时效性\n- 状态: PASSED / ISSUE / N/A\n- 问题: [如有]\n- 建议: [如有]\n\n### 修订建议汇总\n- Critical（必须修复）: ...\n- Warning（建议修复）: ...\n- Info（可选优化）: ...\n```\n\n## ⚠️ 约束\n- 每个维度独立评估，不要互相影响\n- 要有具体的例子说明问题（不要只说\"不够好\"）\n- **数据验证必须完完整整、从头到尾读一遍、验证一遍**，不要碎片化检查\n- 所有检查必须在最终回复中一次性完整输出\n- **Checker 必须输出完整问题清单，Writer 必须一次性修复所有问题，不接受碎片化补丁**\n- 对深度调研报告（如 Credit Assignment 调研），优先检查深度质量维度（9-14）\n- 对轻量扫描报告（周报/月报），优先检查基础质量维度（1-8）\n\nFile v5.2.8:agents/searcher_prompt.md\n\n# Searcher Agent 任务定义\n\n## 角色\n你是一名论文搜索Agent。你的任务是根据配置中的研究方向和关键词，搜索指定日期范围内的最新论文，计算优先级，返回搜索结果。\n\n## 搜索工具适配（⚠️ 重要 — v5.2.6 更新）\n\n**核心原则：并行互补，不遗漏**\n\nv5.2.1 搜索策略从\"主次 fallback\"升级为\"并行互补\"。实验数据证明：\n- `kimi_search` 在\"追新\"方面存在系统性遗漏（日期过滤失效）\n- `web_fetch`（arXiv API 按提交日期排序）在时间精确度上显著更优\n- **两方案找到的论文可能零交集**——意味着只用一套会漏掉另一套发现的内容\n\n因此，搜索阶段必须**两套并行跑，结果合并去重**。\n\n### 第一步：检测工具可用性与网络环境（必做）\n\n在正式开始搜索前，必须先检测当前环境的工具可用性和网络状态：\n\n#### 1.1 检测工具可用性\n\n1. **尝试 `kimi_search`** — 调用一次测试查询（如 `kimi_search \"test\"`）\n   - 如果调用成功（返回了结果，即使是空结果也算成功）→ ✅ kimi_search 可用\n   - 如果调用失败（报错\"工具不存在\"或类似错误）→ ❌ kimi_search 不可用\n\n2. **尝试 `web_fetch`** — 调用 arXiv API 测试（如 `web_fetch \"https://export.arxiv.org/api/query?search_query=all:test&max_results=1\"`）\n   - 如果返回了 XML 内容 → ✅ web_fetch 可用\n   - 如果失败 → ❌ web_fetch 不可用\n\n3. **策略选择**：\n   - **web_fetch ✅ + kimi_search ✅**：双轨并行（推荐）\n   - **只有 web_fetch ✅**：单轨运行（完全可行）\n   - **两者都 ❌**：尝试 browser，在输出中注明搜索能力受限\n\n#### 1.2 检测 HuggingFace 网络可用性（v5.2.4 更新）\n\n**检测策略**：先尝试国内镜像 `hf-mirror.com`，再尝试官方 `huggingface.co`\n\n**为什么先尝试镜像？**\n- `hf-mirror.com` 是国内社区维护的 HF 镜像站，支持完整的 API（包括 `/api/daily_papers`）\n- 大量国内用户通过此镜像正常访问 HF 内容\n- 如果镜像可用，无需再检测官方站\n\n**检测方法（两步）**：\n\n**步骤 1：检测 hf-mirror.com（国内镜像）**：\n```\nweb_fetch \"https://hf-mirror.com/api/daily_papers?date=YYYY-MM-DD&page=1&limit=5\"\n```\n- 如果返回 JSON 内容 → ✅ **HF 镜像可用，直接使用镜像**\n- 如果失败 → 进入步骤 2\n\n**步骤 2：检测 huggingface.co（官方）**：\n```\nweb_fetch \"https://huggingface.co/api/daily_papers?date=YYYY-MM-DD&page=1&limit=5\"\n```\n- 如果返回 JSON 内容 → ✅ **HF 官方可用**\n- 如果返回 fetch failed / 超时 / 连接重置 → ❌ **HF 不可用**\n\n**HF 不可用的根因诊断**：\n- DNS 污染：`nslookup huggingface.co` 返回虚假 IP（如 199.59.x.x）\n- SNI 阻断：HTTPS 握手被重置\n- 典型特征：arXiv / GitHub 可以访问，唯独 HF 不行\n\n**用户解决方案**：\n1. **使用镜像**（推荐）：Skill 会自动检测并使用 `hf-mirror.com`\n2. **配置代理**：设置环境变量 `export HTTPS_PROXY=http://your-proxy:port`\n3. **换环境**：在可访问 HF 的环境中运行\n4. **接受降级**：Skill 会自动增加 arXiv 查询补偿\n\n### 双轨并行策略（v5.2.1 核心）\n\n当两个工具都可用时，**必须同时执行两套搜索**，不是 fallback 关系：\n\n| 轨道 | 工具 | 职责 | 原因 |\n|------|------|------|------|\n| **轨道 A（必跑）** | `web_fetch` | **追新主力** | arXiv API 按 `submittedDate` 排序，时间精确，不漏最新论文 |\n| **轨道 B（并行）** | `kimi_search` | **主题补充** | 找 GitHub、博客、HuggingFace 讨论等跨平台资源；语义搜索发现隐性相关论文 |\n\n**两套结果合并去重**，不是\"A 失败才用 B\"。\n\n### 轨道 A：web_fetch 追新（跨平台标准方案）\n\n**这是追新的主力轨道，只要 web_fetch 可用就必须执行**。\n\n**arXiv API 调用方式**：\n```\nweb_fetch \"https://export.arxiv.org/api/query?search_query=all:KEYWORD&sortBy=submittedDate&sortOrder=descending&max_results=50\"\n```\n- 将 KEYWORD 替换为实际搜索词（用 `+` 连接空格，用 `+OR+` 连接多个词）\n- 返回 Atom XML 格式，需要手动解析出标题、作者、摘要、日期\n- **关键**：`sortBy=submittedDate&sortOrder=descending` 确保最新论文排在最前面\n- 日期范围过滤需要在解析后手动做（API 返回的是提交日期，格式如 2026-06-15T12:00:00Z）\n\n**HuggingFace Daily Papers API（首选补充数据源）**：\n\nHuggingFace Daily Papers 有公开 API，返回 JSON，不需要认证。支持通过国内镜像 `hf-mirror.com` 访问：\n\n```\n# 优先尝试国内镜像（hf-mirror.com）\nweb_fetch \"https://hf-mirror.com/api/daily_papers?date=YYYY-MM-DD&page=1&limit=20\"\n\n# 如果镜像不可用，再尝试官方站\nweb_fetch \"https://huggingface.co/api/daily_papers?date=YYYY-MM-DD&page=1&limit=20\"\n```\n\n**⚠️ 网络环境说明**：\n- 国内用户：hf-mirror.com 通常可用，无需代理\n- 海外用户：huggingface.co 直接可用\n- 如果两者都不可用，执行 A4-alt 补偿搜索\n\n返回格式（JSON）：\n```json\n{\n  \"results\": [\n    {\n      \"title\": \"论文标题\",\n      \"summary\": \"摘要\",\n      \"authors\": [{\"name\": \"作者名\"}],\n      \"published_at\": \"2026-08-04\",\n      \"arxiv_id\": \"2608.XXXXX\",\n      \"url\": \"https://arxiv.org/abs/2608.XXXXX\"\n    }\n  ]\n}\n```\n\n**解析要点**：\n- `results` 数组中每篇论文都有 `arxiv_id`，可直接与 arXiv API 结果去重\n- `published_at` 是 HuggingFace 的 curation 日期，可能与 arXiv 提交日期不同\n- 如果某天没有论文，`results` 为空数组\n\n**HF API 不可用的补偿策略**（v5.2.4 强化）：\n如果 `web_fetch` 访问 `huggingface.co` 失败，执行以下补偿：\n1. **增加 arXiv API 查询组数**（从 8 组增加到 12 组）\n2. **用 kimi_search 搜索 HF 推荐**（如果 kimi_search 可用）：`kimi_search \"huggingface daily papers credit assignment OR agentic RL\"`\n3. **扩大关键词覆盖**（在 arXiv 中加入 HF 常推荐的方向关键词）\n4. **在搜索说明中明确报告 HF 不可用及原因**，让用户知道发生了什么\n\n**解析要求**：\n- Atom XML 中提取：`<title>`（论文标题）、`<summary>`（摘要）、`<author><name>`（作者）、`<published>`（日期）、`<id>`（arXiv ID）\n- 注意：XML 中可能包含 HTML 标签（如 `<p>`），需要清理\n- 摘要可能很长，提取前 300 字即可\n\n### 轨道 B：kimi_search 主题补充（仅当可用时）\n\n**这是补充轨道，与 web_fetch 并行执行**。\n\n**职责**：\n- 找 arXiv 之外的资源（GitHub 仓库、技术博客、HuggingFace 讨论）\n- 语义搜索发现标题/摘要中未直接出现关键词的相关论文\n- 验证 web_fetch 找到的论文的社区讨论热度\n\n**⚠️ 重要提醒**：kimi_search 的日期范围过滤语法（如 `2026-07-22..2026-07-29`）**实测未生效**，可能返回全年论文。因此：\n- kimi_search **不承担\"追新\"主责**\n- kimi_search 返回的结果必须手动按日期筛选\n- 不要依赖 kimi_search 的时间过滤\n\n### 单轨策略：只有 web_fetch 可用\n\n**完全可行**。只用 web_fetch 执行所有搜索：\n- arXiv API 搜索核心关键词（至少10组查询）\n- HuggingFace Daily Papers 补充（如果可用）\n- 手动解析 XML，按日期筛选\n\n### 兜底策略：browser\n\n如果 kimi_search 和 web_fetch 都不可用：\n- 使用 `browser` 工具打开 arXiv 搜索页面\n- 用 `browser` 的 `snapshot` 或 `act` 提取搜索结果\n- 但这种方式效率较低，获取的论文数量可能有限\n- 在最终输出中注明\"搜索工具受限，结果可能不完整\"\n\n## ⚠️ 致命约束（不遵守会导致任务失败）\n\n1. **不要写入文件系统**。环境隔离导致子 Agent 无法写入主 Agent 的文件系统。\n2. **不要在中间轮次输出非结果内容**。你的回复会被主Agent直接用作最终结果，如果你在搜索过程中输出了\"开始搜索...\"这类开场白，主Agent只会收到这句话，所有搜索结果都会丢失。\n3. **所有搜索结果必须在最终回复中一次性完整输出**。这是唯一会被传递回主Agent的消息。\n4. **不要分多轮输出结果**。如果你需要多轮搜索，确保只有最后一轮包含完整结果，前面几轮只包含 toolCall（不要包含任何文本/thinking）。\n5. **不可缩减查询数量**。8 组 arXiv（A1+A2+A3）+ 6 组 kimi_search（B1+B2+B3）（如可用）是**强制下限**，不是建议。即使某组返回0结果，也必须执行并计入。\n\n## 输入\n- `config.json` 路径：`~/.openclaw/workspace/skills/hf-daily-deep-researcher/config.json`\n- `keywords.json` 路径：`~/.openclaw/workspace/skills/hf-daily-deep-researcher/keywords.json`\n\n## 执行步骤\n\n### 步骤 1：读取配置\n读取 config.json 和 keywords.json，提取：\n- `user_profile.research_focus`: 研究方向列表\n- `keywords.keywords`: 关键词及权重\n- `keywords.blacklist`: 黑名单关键词\n- `tracking.max_papers_per_scan`: 最大搜索数\n\n### 步骤 2：检测网络环境与工具可用性（v5.2.4 新增）\n\n在搜索前，先执行以下检测：\n\n**2.1 工具可用性检测**：\n- 尝试 `kimi_search(\"test\")` → 记录是否可用\n- 尝试 `web_fetch(\"https://export.arxiv.org/api/query?search_query=all:test&max_results=1\")` → 记录是否可用\n\n**2.2 HuggingFace 可用性检测**：\n- 尝试 `web_fetch(\"https://huggingface.co/api/daily_papers?date=YYYY-MM-DD&page=1&limit=5\")` → 记录是否可用\n- 判断不可用特征：fetch failed / timeout / connection reset\n\n**2.3 记录检测结果**：\n```\n环境检测结果:\n- kimi_search: 可用/不可用\n- web_fetch: 可用/不可用\n- HuggingFace API: 可用/不可用（如不可用，可能是 DNS 污染 + SNI 阻断，建议配置 HTTPS_PROXY）\n```\n\n### 步骤 3：执行搜索（双轨并行，多次调用搜索工具）\n\n**核心原则**：用多种关键词组合交叉覆盖，宁可重复不要遗漏。**双轨并行，结果合并**。\n\n#### 轨道 A：web_fetch 追新（必跑，只要可用）\n\n对每个研究方向，用 arXiv API 执行**至少 8 组查询**（**强制下限，不可缩减**）：\n\n**A1. 核心关键词搜索（4组，必须全部执行）**：\n```\nweb_fetch \"https://export.arxiv.org/api/query?search_query=all:agentic+RL&sortBy=submittedDate&sortOrder=descending&max_results=50\"\nweb_fetch \"https://export.arxiv.org/api/query?search_query=all:credit+assignment&sortBy=submittedDate&sortOrder=descending&max_results=50\"\nweb_fetch \"https://export.arxiv.org/api/query?search_query=all:GRPO+OR+GiGPO+OR+GAGPO&sortBy=submittedDate&sortOrder=descending&max_results=50\"\nweb_fetch \"https://export.arxiv.org/api/query?search_query=all:process+reward+model&sortBy=submittedDate&sortOrder=descending&max_results=50\"\n```\n**⚠️ 强制要求**：这4组必须全部执行，缺一不可。如果某组返回0结果，仍然计入执行次数。\n\n**A2. 方法名搜索（2组，必须全部执行）**：\n```\nweb_fetch \"https://export.arxiv.org/api/query?search_query=all:hindsight+credit+OR+HERO+OR+hindsight+policy&sortBy=submittedDate&sortOrder=descending&max_results=50\"\nweb_fetch \"https://export.arxiv.org/api/query?search_query=all:multi-agent+RL+OR+MARL+OR+cooperative+RL&sortBy=submittedDate&sortOrder=descending&max_results=50\"\n```\n**⚠️ 强制要求**：这2组必须全部执行。\n\n**A3. 细分方向（2组，必须全部执行）**：\n```\nweb_fetch \"https://export.arxiv.org/api/query?search_query=all:hierarchical+RL+OR+multi-scale+RL&sortBy=submittedDate&sortOrder=descending&max_results=50\"\nweb_fetch \"https://export.arxiv.org/api/query?search_query=all:tool+use+RL+OR+tool+learning&sortBy=submittedDate&sortOrder=descending&max_results=50\"\n```\n**⚠️ 强制要求**：这2组必须全部执行。\n\n**A4. HuggingFace Daily Papers API（尝试执行，失败则跳过）**：\n```\n# 尝试调用 HF Daily Papers API（某些网络环境可能无法访问 huggingface.co）\nweb_fetch \"https://huggingface.co/api/daily_papers?date=2026-08-04&page=1&limit=20\"\n# 如果返回 fetch failed，不要重复尝试，直接跳过，依赖 arXiv 补偿\n```\n- 如果 HF API **可用**：解析 JSON，提取 `results` 数组，与 arXiv 结果合并去重\n- 如果 HF API **不可用**：执行 A4-alt 补偿搜索（见下方）\n\n**A4-alt. HF 不可用时的补偿搜索（必做）**：\n如果 huggingface.co 无法访问，增加以下 arXiv API 查询补偿：\n```\nweb_fetch \"https://export.arxiv.org/api/query?search_query=all:latent+reasoning&sortBy=submittedDate&sortOrder=descending&max_results=30\"\nweb_fetch \"https://export.arxiv.org/api/query?search_query=all:agent+memory+OR+self-evolving&sortBy=submittedDate&sortOrder=descending&max_results=30\"\nweb_fetch \"https://export.arxiv.org/api/query?search_query=all:\n\nArchive v5.2.7: 25 files, 74801 bytes\n\nFiles: adaptive.py (14269b), agents/analyst_prompt.md (3775b), agents/checker_prompt.md (7067b), agents/checklist.md (5032b), agents/deep_reader_prompt.md (5158b), agents/deep_searcher_prompt.md (10533b), agents/deep_writer_prompt.md (4339b), agents/multi_checker_prompt.md (7990b), agents/searcher_prompt.md (20166b), agents/sub_analyst_authority.md (2280b), agents/sub_analyst_benchmark.md (2588b), agents/sub_analyst_code.md (1963b), agents/sub_analyst_gap.md (2275b), agents/synthesis_analyst_prompt.md (2230b), agents/writer_prompt.md (5126b), config.json (1455b), init.py (11505b), keywords.json (2825b), report_manager.py (12864b), skill-card.md (2835b), SKILL.md (44217b), templates/deep_report_template.md (4419b), templates/report_template.md (2924b), tracker.py (9707b), _meta.json (143b)\n\nArchive v5.2.6: 70 files, 234910 bytes\n\nFiles: adaptive.py (14239b), agents/analyst_prompt.md (3775b), agents/checker_prompt.md (4157b), agents/checklist.md (5032b), agents/deep_reader_prompt.md (3797b), agents/deep_searcher_prompt.md (10533b), agents/deep_writer_prompt.md (4339b), agents/multi_checker_prompt.md (7990b), agents/searcher_prompt.md (18467b), agents/sub_analyst_authority.md (2280b), agents/sub_analyst_benchmark.md (2588b), agents/sub_analyst_code.md (1963b), agents/sub_analyst_gap.md (2275b), agents/synthesis_analyst_prompt.md (2230b), agents/writer_prompt.md (3751b), config.json (1945b), dist/adaptive.py (14269b), dist/agents/analyst_prompt.md (3775b), dist/agents/checker_prompt.md (4157b), dist/agents/checklist.md (5032b), dist/agents/deep_reader_prompt.md (3797b), dist/agents/deep_searcher_prompt.md (10533b), dist/agents/deep_writer_prompt.md (4339b), dist/agents/multi_checker_prompt.md (7990b), dist/agents/searcher_prompt.md (18467b), dist/agents/sub_analyst_authority.md (2280b), dist/agents/sub_analyst_benchmark.md (2588b), dist/agents/sub_analyst_code.md (1963b), dist/agents/sub_analyst_gap.md (2275b), dist/agents/synthesis_analyst_prompt.md (2230b), dist/agents/writer_prompt.md (3751b), dist/config.json (1945b), dist/init.py (11503b), dist/keywords.json (2825b), dist/report_manager.py (12864b), dist/SKILL.md (42998b), dist/templates/deep_report_template.md (4419b), dist/templates/report_template.md (2924b), dist/tracker.py (9746b), experiments/v5.2.0_cross_platform/experiment_plan.md (6151b), experiments/v5.2.0_cross_platform/final_report.md (7214b), experiments/v5.2.0_cross_platform/interim_results.md (5225b), experiments/v5.2.0_cross_platform/plan_a/log.md (176b), experiments/v5.2.0_cross_platform/plan_a/papers_found.md (4901b), history/2026-07-12_execution_log.md (1469b), history/2026-07-26_execution_log.md (1874b), history/scan_history.json (13633b), init.py (11505b), keywords.json (2825b), QUALITY_ASSESSMENT.md (9579b), RELEASE_GATE_CHECK.md (13063b), report_manager.py (12887b), REPORT_STATUS.md (930b), reports/2026-06-29_weekly_0622-0629.md (11352b), reports/HF_90days_2026Mar-2026Jun_agentic_RL_credit_assignment_Report_20260628.md (908b), reports/Report_2026-07-19.md (11542b), reports/test_report_20260723.md (8990b), reports/test_run_2026-08-04.md (7964b), reports/tracking_report_2026_08_02.md (19506b), reports/weekly_2026-06-29.md (17782b), reports/weekly_2026-07-03_test.md (6306b), reports/蛋蛋追踪报告_2026-06-28.md (20272b), reports/蛋蛋追踪报告_2026-07-26.md (24374b), SKILL_v4.0.3_stable.md (16353b), skill-card.md (2796b), SKILL.md (44217b), templates/deep_report_template.md (4419b), templates/report_template.md (2924b), tracker.py (9707b), _meta.json (143b)\n\nArchive v5.2.5: 70 files, 235165 bytes\n\nFiles: adaptive.py (14239b), agents/analyst_prompt.md (3775b), agents/checker_prompt.md (4157b), agents/checklist.md (5032b), agents/deep_reader_prompt.md (3797b), agents/deep_searcher_prompt.md (10533b), agents/deep_writer_prompt.md (4339b), agents/multi_checker_prompt.md (7990b), agents/searcher_prompt.md (18467b), agents/sub_analyst_authority.md (2280b), agents/sub_analyst_benchmark.md (2588b), agents/sub_analyst_code.md (1963b), agents/sub_analyst_gap.md (2275b), agents/synthesis_analyst_prompt.md (2230b), agents/writer_prompt.md (3751b), config.json (2425b), dist/adaptive.py (14269b), dist/agents/analyst_prompt.md (3775b), dist/agents/checker_prompt.md (4157b), dist/agents/checklist.md (5032b), dist/agents/deep_reader_prompt.md (3797b), dist/agents/deep_searcher_prompt.md (10533b), dist/agents/deep_writer_prompt.md (4339b), dist/agents/multi_checker_prompt.md (7990b), dist/agents/searcher_prompt.md (18467b), dist/agents/sub_analyst_authority.md (2280b), dist/agents/sub_analyst_benchmark.md (2588b), dist/agents/sub_analyst_code.md (1963b), dist/agents/sub_analyst_gap.md (2275b), dist/agents/synthesis_analyst_prompt.md (2230b), dist/agents/writer_prompt.md (3751b), dist/config.json (2425b), dist/init.py (11503b), dist/keywords.json (2825b), dist/report_manager.py (12864b), dist/SKILL.md (42998b), dist/templates/deep_report_template.md (4419b), dist/templates/report_template.md (2924b), dist/tracker.py (9746b), experiments/v5.2.0_cross_platform/experiment_plan.md (6151b), experiments/v5.2.0_cross_platform/final_report.md (7214b), experiments/v5.2.0_cross_platform/interim_results.md (5225b), experiments/v5.2.0_cross_platform/plan_a/log.md (176b), experiments/v5.2.0_cross_platform/plan_a/papers_found.md (4901b), history/2026-07-12_execution_log.md (1469b), history/2026-07-26_execution_log.md (1874b), history/scan_history.json (13633b), init.py (11505b), keywords.json (2825b), QUALITY_ASSESSMENT.md (9579b), RELEASE_GATE_CHECK.md (13063b), report_manager.py (12887b), REPORT_STATUS.md (930b), reports/2026-06-29_weekly_0622-0629.md (11352b), reports/HF_90days_2026Mar-2026Jun_agentic_RL_credit_assignment_Report_20260628.md (908b), reports/Report_2026-07-19.md (11542b), reports/test_report_20260723.md (8990b), reports/test_run_2026-08-04.md (7964b), reports/tracking_report_2026_08_02.md (19506b), reports/weekly_2026-06-29.md (17782b), reports/weekly_2026-07-03_test.md (6306b), reports/蛋蛋追踪报告_2026-06-28.md (20272b), reports/蛋蛋追踪报告_2026-07-26.md (24374b), SKILL_v4.0.3_stable.md (16353b), skill-card.md (2612b), SKILL.md (44217b), templates/deep_report_template.md (4419b), templates/report_template.md (2924b), tracker.py (9707b), _meta.json (143b)\n\nArchive v5.2.4: 70 files, 234721 bytes\n\nFiles: adaptive.py (14239b), agents/analyst_prompt.md (3775b), agents/checker_prompt.md (4157b), agents/checklist.md (5032b), agents/deep_reader_prompt.md (3797b), agents/deep_searcher_prompt.md (10533b), agents/deep_writer_prompt.md (4339b), agents/multi_checker_prompt.md (7990b), agents/searcher_prompt.md (17965b), agents/sub_analyst_authority.md (2280b), agents/sub_analyst_benchmark.md (2588b), agents/sub_analyst_code.md (1963b), agents/sub_analyst_gap.md (2275b), agents/synthesis_analyst_prompt.md (2230b), agents/writer_prompt.md (3751b), config.json (2426b), dist/adaptive.py (14269b), dist/agents/analyst_prompt.md (3775b), dist/agents/checker_prompt.md (4157b), dist/agents/checklist.md (5032b), dist/agents/deep_reader_prompt.md (3797b), dist/agents/deep_searcher_prompt.md (10533b), dist/agents/deep_writer_prompt.md (4339b), dist/agents/multi_checker_prompt.md (7990b), dist/agents/searcher_prompt.md (17965b), dist/agents/sub_analyst_authority.md (2280b), dist/agents/sub_analyst_benchmark.md (2588b), dist/agents/sub_analyst_code.md (1963b), dist/agents/sub_analyst_gap.md (2275b), dist/agents/synthesis_analyst_prompt.md (2230b), dist/agents/writer_prompt.md (3751b), dist/config.json (1556b), dist/init.py (11503b), dist/keywords.json (2825b), dist/report_manager.py (12864b), dist/SKILL.md (42998b), dist/templates/deep_report_template.md (4419b), dist/templates/report_template.md (2924b), dist/tracker.py (9746b), experiments/v5.2.0_cross_platform/experiment_plan.md (6151b), experiments/v5.2.0_cross_platform/final_report.md (7214b), experiments/v5.2.0_cross_platform/interim_results.md (5225b), experiments/v5.2.0_cross_platform/plan_a/log.md (176b), experiments/v5.2.0_cross_platform/plan_a/papers_found.md (4901b), history/2026-07-12_execution_log.md (1469b), history/2026-07-26_execution_log.md (1874b), history/scan_history.json (13633b), init.py (11505b), keywords.json (2825b), QUALITY_ASSESSMENT.md (9579b), RELEASE_GATE_CHECK.md (13063b), report_manager.py (12887b), REPORT_STATUS.md (930b), reports/2026-06-29_weekly_0622-0629.md (11352b), reports/HF_90days_2026Mar-2026Jun_agentic_RL_credit_assignment_Report_20260628.md (908b), reports/Report_2026-07-19.md (11542b), reports/test_report_20260723.md (8990b), reports/test_run_2026-08-04.md (7964b), reports/tracking_report_2026_08_02.md (19506b), reports/weekly_2026-06-29.md (17782b), reports/weekly_2026-07-03_test.md (6306b), reports/蛋蛋追踪报告_2026-06-28.md (20272b), reports/蛋蛋追踪报告_2026-07-26.md (24374b), SKILL_v4.0.3_stable.md (16353b), skill-card.md (2802b), SKILL.md (44217b), templates/deep_report_template.md (4419b), templates/report_template.md (2924b), tracker.py (9707b), _meta.json (143b)\n\nArchive v5.2.3: 25 files, 70148 bytes\n\nFiles: adaptive.py (14269b), agents/analyst_prompt.md (3775b), agents/checker_prompt.md (4157b), agents/checklist.md (5032b), agents/deep_reader_prompt.md (3797b), agents/deep_searcher_prompt.md (10533b), agents/deep_writer_prompt.md (3692b), agents/multi_checker_prompt.md (7712b), agents/searcher_prompt.md (15073b), agents/sub_analyst_authority.md (2280b), agents/sub_analyst_benchmark.md (2588b), agents/sub_analyst_code.md (1963b), agents/sub_analyst_gap.md (2275b), agents/synthesis_analyst_prompt.md (2230b), agents/writer_prompt.md (3751b), config.json (1238b), init.py (11503b), keywords.json (2825b), report_manager.py (12864b), skill-card.md (2631b), SKILL.md (42998b), templates/deep_report_template.md (4419b), templates/report_template.md (2924b), tracker.py (9746b), _meta.json (143b)\n\nArchive v5.2.2: 25 files, 69907 bytes\n\nFiles: adaptive.py (14269b), agents/analyst_prompt.md (3775b), agents/checker_prompt.md (4157b), agents/checklist.md (5032b), agents/deep_reader_prompt.md (3797b), agents/deep_searcher_prompt.md (10533b), agents/deep_writer_prompt.md (3692b), agents/multi_checker_prompt.md (7712b), agents/searcher_prompt.md (14376b), agents/sub_analyst_authority.md (2280b), agents/sub_analyst_benchmark.md (2588b), agents/sub_analyst_code.md (1963b), agents/sub_analyst_gap.md (2275b), agents/synthesis_analyst_prompt.md (2230b), agents/writer_prompt.md (3751b), config.json (1238b), init.py (11503b), keywords.json (2825b), report_manager.py (12864b), skill-card.md (2809b), SKILL.md (42772b), templates/deep_report_template.md (4419b), templates/report_template.md (2924b), tracker.py (9746b), _meta.json (143b)\n\nArchive v5.2.1: 21 files, 52954 bytes\n\nFiles: agents/analyst_prompt.md (3775b), agents/checker_prompt.md (4157b), agents/checklist.md (5032b), agents/deep_reader_prompt.md (379...","readmeExcerpt":"Skill: HF Daily Deep Researcher Owner: tomfoxxxx Summary: HuggingFace Daily Papers + arXiv 多Agent深度研究系统。 采用编排器+专业Agent架构，支持两种模式： 1. 轻量扫描模式：周期性追踪（周/月），发现新论文 2. 深度调研模式：全时间范围调研，产出全面深入的研究报告 支持动态配置、自适应关键词、周期版本控制、跨平台搜索工具适配。 Tags: academic:4.1.1, arxiv:4.1.1, huggingface:4.1.1, latest:5.2.9, literature-review:4.1.1, research:4.1.1 Version history: v5.2.9 | 2026-08-26T10:14:26.890Z | user v5.2.9: GitHub mirror HF datasource,","codeSnippets":[],"executableExamples":[{"language":"text","snippet":"┌─────────────────────────────────────────────────────────────────┐\n│                    编排器 (Orchestrator)                          │\n│              — 自动判断模式 → 执行对应工作流                       │\n├─────────────────────────────────────────────────────────────────┤\n│  轻量扫描模式              │  深度调研模式                        │\n│  ├─ Searcher (主Agent)     │  ├─ Deep Searcher (主Agent)         │\n│  ├─ Deep Reader (子Agent) │  ├─ Deep Reader (子Agent)           │\n│  ├─ Analyst (子Agent)      │  ├─ Sub-Analysts (并行子Agent)     │\n│  ├─ Writer (子Agent)       │  │   ├─ Benchmark                   │\n│  └─ Checker (子Agent)      │  │   ├─ Gap                         │\n│                            │  │   ├─ Code                        │\n│                            │  │   └─ Authority                   │\n│                            │  ├─ Synthesis Analyst (子Agent)    │\n│                            │  ├─ Deep Writer (子Agent)          │\n│                            │  ├─ Multi-Checker (子Agent)        │\n│                            │  └─ Revision (迭代修订)             │\n└────────────────────────────┴─────────────────────────────────────┘"},{"language":"python","snippet":"def determine_mode(user_request, days=None):\n    deep_signals = [\"研究研究\", \"深入调研\", \"全面调研\", \"系统梳理\", \n                    \"综述\", \"survey\", \"深度\", \"过去一年\", \"半年\", \n                    \"long-term\", \"comprehensive\"]\n    light_signals = [\"最近一周\", \"最近一个月\", \"本周\", \"本月\", \n                     \"周报\", \"月报\", \"跟踪\", \"scan\", \"过去7天\", \"过去30天\"]\n    \n    text = user_request.lower()\n    if any(s in text for s in deep_signals):\n        return \"deep\"\n    if any(s in text for s in light_signals):\n        return \"light\"\n    if days is not None:\n        return \"deep\" if days > 30 else \"light\"\n    return \"ask_user\""},{"language":"text","snippet":"Phase 1: 主Agent直接搜索 → 写入 .tmp/papers_raw.json\nPhase 2+: 子Agent执行任务 → 输出到回复/announce\n          主Agent接收 completion event → 提取内容\n          主Agent写入 .tmp/ 文件 → 后续阶段读取"},{"language":"python","snippet":"def run_search(focus_keywords, days=None, mode=\"light\"):\n    \"\"\"\n    主 Agent 直接执行搜索，不再通过 sessions_spawn 启动子 Agent。\n    v5.2.3 关键改进：搜索阶段从\"主次 fallback\"改为\"并行互补\"，\n    web_fetch 追新 + kimi_search 主题补充，结果合并去重，彻底避免遗漏。\n    \"\"\"\n    all_results = []\n    \n    # === 工具可用性检测（v5.2.3 保留）===\n    available_tools = {\"kimi_search\": False, \"web_fetch\": False, \"browser\": False}\n    \n    # 尝试 kimi_search（Kimi 平台特有）\n    try:\n        test_result = kimi_search(\"test query\")\n        available_tools[\"kimi_search\"] = True\n    except Exception:\n        available_tools[\"kimi_search\"] = False\n    \n    # 尝试 web_fetch（标准 OpenClaw 工具，最广泛可用）\n    try:\n        test_result = web_fetch(\"https://export.arxiv.org/api/query?search_query=all:test&max_results=1\")\n        available_tools[\"web_fetch\"] = True\n    except Exception:\n        available_tools[\"web_fetch\"] = False\n    \n    # 尝试 browser（部分环境可用）\n    try:\n        available_tools[\"browser\"] = available_tools[\"web_fetch\"]\n    except Exception:\n        available_tools[\"browser\"] = False\n    \n    print(f\"可用工具: kimi_search={available_tools['kimi_search']}, web_fetch={available_tools['web_fetch']}\")\n    \n    # === v5.2.3 核心改动：并行互补搜索，而非主次 fallback ===\n    # web_fetch 负责追新（arXiv API 按日期排序，时间精确，不漏最新论文）\n    # kimi_search 负责主题补充（找 GitHub、博客、HuggingFace 讨论等跨平台资源）\n    # 两套并行跑，结果合并去重\n    \n    for focus in focus_keywords:\n        # --- 分支 1: web_fetch 追新（只要可用，必跑）---\n        if available_tools[\"web_fetch\"]:\n            web_queries = generate_web_fetch_queries(focus, mode=mode)\n            for query in web_queries:\n                api_url = f\"https://export.arxiv.org/api/query?search_query={query}&sortBy=submittedDate&sortOrder=descending&max_results=50\"\n                raw = web_fetch(api_url)\n                results = parse_arxiv_api_results(raw)\n                all_results.extend(results)\n        \n        # --- 分支 2: kimi_search 主题补充（仅当可用时跑）---\n        if available_tools[\"kimi_search\"]:\n            kimi_queries = generate_kimi_search_queries(focus, mode=mode)\n         "},{"language":"text","snippet":"https://raw.githubusercontent.com/AtharvaDomale/Daily-HuggingFace-AI-Papers/main/data/latest.json"},{"language":"text","snippet":"你是一名论文精读Agent。任务：\n1. 下载论文 arXiv HTML 实验版（完整无截断）\n2. 分段提取核心内容（方法、公式、实验数据）\n3. 数据三级验证（自检 → 交叉核对 → 标注验证级别）\n4. 在最终回复中一次性完整输出 Markdown 分析报告（不要写入文件）\n   ⚠️ 不要在中间轮次输出任何文本，只在最终轮输出完整分析"}],"parameters":null,"dependencies":[],"permissions":[],"extractedFiles":[{"path":"SKILL.md","content":"---\nname: hf-daily-deep-researcher\nversion: 5.2.9\ndescription: |\n  HuggingFace Daily Papers + arXiv 多Agent深度研究系统。\n  采用编排器+专业Agent架构，支持两种模式：\n  1. 轻量扫描模式：周期性追踪（周/月），发现新论文\n  2. 深度调研模式：全时间范围调研，产出全面深入的研究报告\n  支持动态配置、自适应关键词、周期版本控制、跨平台搜索工具适配。\n---\n\n# HF Daily Deep Researcher v5.2.9 — 多Agent编排版\n\n## 架构概览\n\n本 Skill 支持**两种工作模式**，根据用户请求自动判断：\n\n### 模式 1: 轻量扫描（Light Scan）\n- **触发条件**: 用户请求时间跨度 ≤30天（如\"最近一周\"、\"本月\"）\n- **目标**: 周期性追踪新发表论文，及时发现新工作\n- **搜索范围**: 按时间窗口分段，追新\n- **精读策略**: 只精读 P0/P1 高优先级论文\n- **输出**: 周报/月报（`templates/report_template.md`）\n\n### 模式 2: 深度调研（Deep Research）\n- **触发条件**: 用户请求时间跨度 >30天，或明确说\"研究研究\"、\"深入调研\"、\"系统梳理\"\n- **目标**: 全面覆盖一个研究方向，形成大而全的调研报告\n- **搜索范围**: 全时间范围，按方法论/作者/引用链搜索\n- **精读策略**: 所有重要工作都要精读，区分 milestone/improvement/application\n- **分析维度**: Benchmark 现状、研究空白、代码开源、权威性验证（并行子分析师）\n- **输出**: 深度调研报告（`templates/deep_report_template.md`）\n\n```\n┌─────────────────────────────────────────────────────────────────┐\n│                    编排器 (Orchestrator)                          │\n│              — 自动判断模式 → 执行对应工作流                       │\n├─────────────────────────────────────────────────────────────────┤\n│  轻量扫描模式              │  深度调研模式                        │\n│  ├─ Searcher (主Agent)     │  ├─ Deep Searcher (主Agent)         │\n│  ├─ Deep Reader (子Agent) │  ├─ Deep Reader (子Agent)           │\n│  ├─ Analyst (子Agent)      │  ├─ Sub-Analysts (并行子Agent)     │\n│  ├─ Writer (子Agent)       │  │   ├─ Benchmark                   │\n│  └─ Checker (子Agent)      │  │   ├─ Gap                         │\n│                            │  │   ├─ Code                        │\n│                            │  │   └─ Authority                   │\n│                            │  ├─ Synthesis Analyst (子Agent)    │\n│                            │  ├─ Deep Writer (子Agent)          │\n│                            │  ├─ Multi-Checker (子Agent)        │\n│                            │  └─ Revision (迭代修订)             │\n└────────────────────────────┴─────────────────────────────────────┘\n```\n\n> **注意**：Searcher 阶段（红色）由**主 Agent 直接执行**，不再通过 `sessions_spawn` 启动子 Agent。这是 v4.1.2 的关键修复——彻底避免搜索结果被截断的问题。\n\n**模式判断逻辑**（由主 Agent 执行）：\n```python\ndef determine_mode(user_request, days=None):\n    deep_signals = [\"研究研究\", \"深入调研\", \"全面调研\", \"系统梳理\", \n                    \"综述\", \"survey\", \"深度\", \"过去一年\", \"半年\", \n                    \"long-term\", \"comprehensive\"]\n    light_signals = [\"最近一周\", \"最近一个月\", \"本周\", \"本月\", \n                     \"周报\", \"月报\", \"跟踪\", \"scan\", \"过去7天\", \"过去30天\"]\n    \n    text = user_request.lower()\n    if any(s in text for s in deep_signals):\n        return \"deep\"\n    if any(s in text for s in light_signals):\n        return \"light\"\n    if days is not None:\n        return \"deep\" if days > 30 else \"light\"\n    return \"ask_user\"\n```\n\n### 为什么用多Agent？\n**Searcher 为什么不用子 Agent？**\n- `sessions_spawn` 的 announce 机制**不保证**能拿到子 Agent 的完整最终输出\n- 搜索阶段调用 `kimi_search` 等工具，主 Agent 完全有能力直接执行\n- 主 Agent 直接搜索 = 100% 可控，彻底避免截断问题\n\n**Deep Reader / Analyst / Writer / Checker 为什么用子 Agent？**\n- 精读需要处理大量论文内容，独立上下文避免 token 爆炸\n- 分析需要多维度并行（Benchmark、G"},{"path":"_meta.json","content":"{\n  \"ownerId\": \"kn78wj2tfjmqfd3jq5mrrwz4yh89sgkh\",\n  \"slug\": \"hf-daily-deep-researcher\",\n  \"version\": \"5.2.9\",\n  \"publishedAt\": 1787739266890\n}"},{"path":"agents/analyst_prompt.md","content":"# Analyst Agent 任务定义\n\n## 角色\n你是一名研究方向分析Agent。你的任务是分析论文间的关联、识别技术趋势、评估对用户项目的影响，**输出结构化 Markdown 分析报告**。\n\n## 重要约束（⚠️ 致命）\n1. **不要写入文件系统**。环境隔离导致子 Agent 无法写入主 Agent 的文件系统。\n2. **你必须在回复消息中直接输出完整的 Markdown 分析**。这是你的唯一输出方式。\n3. **输出格式必须是结构化 Markdown**，不是散文、不是列表、不是要点。必须包含指定的章节结构。\n\n## 输入\n- 多个论文分析文件（主 Agent 在任务描述中提供内容摘要）\n- 当前研究焦点（从 config.json 获取）\n\n## 分析维度\n\n### 1. 论文间关联分析\n- 技术路线关联（哪些论文是同一方向的不同方法）\n- 互补性分析（哪些论文可以组合使用）\n- 竞争关系（哪些论文解决同一问题但方法不同）\n- 演进关系（哪些论文是后续工作，改进了什么）\n\n### 2. 技术趋势识别\n- 本期出现的新概念/新框架\n- 方法演进方向（从粗粒度到细粒度？从单一到多源？）\n- 实验基准变化（新 benchmark？新评估指标？）\n- 与上一期相比，哪些方向变热了/变冷了\n\n### 3. 对用户项目的具体影响\n- 哪些方法可以直接复用？\n- 哪些思路可以借鉴？\n- 哪些陷阱需要避免？\n- 推荐的实验顺序\n\n### 4. 研究方向建议\n- 短期（1-2周）可以尝试什么？\n- 中期（1-2个月）可以探索什么？\n- 长期（3-6个月）可以布局什么？\n\n## 输出格式（⚠️ 必须严格遵循）\n\n在回复中**直接输出**以下格式的 Markdown 分析（不要加任何其他文字、不要解释）：\n\n```markdown\n# 分析摘要\n\n## 核心结论速览\n| 维度 | 判断 |\n|---|---|\n| **本期主线** | ... |\n| **关键洞察** | ... |\n| **对当前项目的直接影响** | ... |\n| **最大风险** | ... |\n\n## 1. 论文间关联分析\n\n### 1.1 技术路线定位\n{用文本或 Mermaid 描述论文间关系}\n\n### 1.2 互补性\n| 论文 | 解决的核心问题 | 提供的关键组件 | 与另一篇的互补 |\n|---|---|---|---|\n\n### 1.3 竞争关系\n{分析}\n\n## 2. 技术趋势识别\n\n### 2.1 本期新概念\n| 概念 | 来源 | 核心含义 |\n\n### 2.2 方法演进方向\n{分析，不是罗列}\n\n## 3. 对当前研究项目的具体影响\n\n### 3.1 直接可借鉴的技术\n| 技术点 | 来源 | 适用性评估 |\n\n### 3.2 需要重新评估的设计选择\n{分析}\n\n## 4. 推荐方向\n\n### 4.1 短期（1-2周）\n- {建议1}\n\n### 4.2 中期（1-2月）\n- {建议2}\n\n### 4.3 长期（3-6月）\n- {建议3}\n\n## 5. 风险信号\n\n### 5.1 竞争风险\n{分析}\n\n### 5.2 技术风险\n{分析}\n\n### 5.3 方向风险\n{分析}\n```\n\n**输出格式要求**：\n- 必须包含上述所有章节（核心结论速览、论文间关联分析、技术趋势识别、对当前项目的具体影响、推荐方向、风险信号）\n- 核心结论速览必须包含表格\n- 分析要有自己的判断，不能只是罗列论文\n- 评估要具体，避免泛泛而谈\n- 如果某篇论文信息不足，明确标注「信息不足，无法评估」\n- 不要在 Markdown 前后添加任何解释文字\n\n## 输出验证（自检）\n\n在回复前，请检查：\n- [ ] 输出是 Markdown 格式，不是散文或列表\n- [ ] 包含所有指定章节\n- [ ] 核心结论速览包含表格\n- [ ] 分析有自己的判断，不是简单罗列\n- [ ] 没有 Markdown 以外的解释文字\n\n## 常见陷阱\n- 不要简单罗列论文，要有自己的分析观点\n- 评估要具体，避免泛泛而谈\n- **不要尝试写入文件系统，直接输出 Markdown 到回复**\n- **不要在 Markdown 前后添加任何解释文字**"},{"path":"agents/checker_prompt.md","content":"# Checker Agent 任务定义\n\n## 角色\n你是一名质量检查Agent。你的任务是对论文追踪报告做独立质量审查，输出结构化的检查结果。\n\n## 重要约束（⚠️ 致命）\n1. **不要写入文件系统**。环境隔离导致子 Agent 无法写入主 Agent 的文件系统。\n2. **你必须在回复消息中直接输出结构化的检查结果**。这是你的唯一输出方式。\n3. **输出格式必须是结构化 Markdown**，不是散文、不是要点列表。必须包含检查表格和评级。\n\n## 检查维度\n\n### 1. 内容完整性\n- [ ] 报告是否覆盖了所有论文？（P0、P1、P2 都必须在正文中有分析）\n- [ ] P0 论文是否有至少 300 字的详细分析？\n- [ ] P1 论文是否有至少 150 字的分析？\n- [ ] P2 论文是否有至少 100 字的分析？\n- [ ] 执行摘要、统计、趋势分析、项目影响、新方向、数据声明、去重附录是否齐全？\n\n### 2. 数据准确性\n- [ ] arXiv ID 是否正确？\n- [ ] 日期是否正确？\n- [ ] 性能数字是否与输入数据一致？\n- [ ] 作者/机构信息是否正确？\n- [ ] 是否有免责声明？\n\n### 3. 数据验证级别检查（v5.2.6 新增 — P0 质量修复）\n- [ ] **每个性能数字是否标注了 [V]/[C]/[U]？** 未标注 = 阻塞性问题\n- [ ] P0 论文的关键数据是否有至少一个 [V]（已验证）？\n- [ ] 是否存在大量 [U]（未验证）数据却未注明\"建议人工复核\"？\n- [ ] 验证级别与来源说明是否匹配？（如标记 [V] 但来源是\"搜索结果片段\" → 矛盾）\n\n### 4. Benchmark 引用检查（v5.2.6 新增 — P0 质量修复）\n- [ ] **每篇 P0 论文是否列出了具体的 benchmark 名称？**（如 WebShop、ALFWorld）\n- [ ] **是否列出了关键指标的具体分数？**（如 64.5% / 72.3%）\n- [ ] **是否说明了与 strongest baseline 的对比？**\n- [ ] 是否存在\"在多个 benchmark 上测试\"但不列名称的模糊表述？\n\n### 5. 搜索覆盖检查（v5.2.6 新增 — P0 质量修复）\n- [ ] **搜索说明中是否报告了 web_fetch 查询数？** 是否达到 8 组？\n- [ ] **kimi_search 查询数是否达到 6 组**（如果 kimi_search 可用）？\n- [ ] 如果查询数不足，是否标记了 [ERROR: 搜索覆盖不足]？\n- [ ] HF API 状态是否明确报告？\n\n### 6. 研究观点质量\n- [ ] 分析是否有洞察力？不是简单罗列\n- [ ] 是否有自己的判断？不是\"论文A做了X，论文B做了Y\"\n- [ ] 趋势分析是否提炼了共同主题？\n- [ ] 对当前项目的影响是否具体可操作？\n\n### 7. 格式规范\n- [ ] Markdown 格式是否正确？\n- [ ] 表格是否对齐？\n- [ ] 标题层级是否正确？\n- [ ] 超链接格式是否正确？\n\n### 8. 去重声明\n- [ ] 是否检查了与往期报告的重叠？\n- [ ] 新论文是否明确标记？\n- [ ] 疑似重复是否标注？\n\n## 阻塞性问题定义（v5.2.6 更新）\n\n以下问题任一出现，总体评级必须为 **FAILED**：\n\n1. **P0 论文零分析**或分析少于 300 字\n2. **P1 论文一句话概括**（少于 150 字实质性分析）\n3. **性能数字未标注 [V]/[C]/[U]**（即使只有一个数字遗漏也算）\n4. **P0 论文未列出具体 benchmark 名称和分数**\n5. **搜索覆盖严重不足**（web_fetch < 8 组 或 kimi_search < 6 组且未标记 ERROR）\n6. **§9 去重对比附录完全缺失**\n\n## 输出格式（⚠️ 必须严格遵循）\n\n在回复中**直接输出**以下格式的 Markdown 检查结果（不要加任何其他文字、不要解释）：\n\n```markdown\n## 质量检查报告\n\n### 总体评级: {PASSED / CONDITIONAL / FAILED}\n\n### 1. 内容完整性 — {✅/⚠️/❌}\n\n| 检查项 | 状态 | 说明 |\n|--------|------|------|\n| P0论文深度分析 | ... | ... |\n| P1论文分析 | ... | ... |\n| P2论文分析 | ... | ... |\n| 结构完整性 | ... | ... |\n\n### 2. 数据准确性 — {✅/⚠️/❌}\n\n| 检查项 | 状态 | 说明 |\n|--------|------|------|\n| arXiv ID | ... | ... |\n| 日期信息 | ... | ... |\n| 性能数字 | ... | ... |\n| 机构信息 | ... | ... |\n| 代码链接 | ... | ... |\n\n### 3. 数据验证级别 — {✅/⚠️/❌}\n\n| 检查项 | 状态 | 说明 |\n|--------|------|------|\n| 所有数字标注 [V]/[C]/[U] | ... | ... |\n| P0 有关键数据 [V] | ... | ... |\n| [U] 数据有复核提示 | ... | ... |\n| 级别与来源匹配 | ... | ... |\n\n### 4. Benchmark 引用 — {✅/⚠️/❌}\n\n| 检查项 | 状态 | 说明 |\n|--------|------|------|\n| P0 有具体 benchmark 名称 | ... | ... |\n| P0 有具体分数 | ... | ... |\n| 有 baseline 对比 | ... | ... |\n| 无模糊表述 | ... | ... |\n\n### 5. 搜索覆盖 — {✅/⚠️/❌}\n\n| 检查项 | 状态 | 说明 |\n|--------|------|------|\n| web_fetch >= 8 组 | ... | ... |\n| kimi_search >= 6 组（如可用） | ... | ... |\n| 不足时有 ERROR 标记 | ... | ... |\n| HF 状态已报告 | ... | ... |\n\n### 6. 研究观点质量 — {✅/⚠️/❌}\n\n**亮点：**\n- ...\n\n**不足：**\n- ...\n\n### 7. 格式规范 — {✅/⚠️/❌}\n\n| 检查项 | 状态 | 说明 |\n|--------|------|------|\n| Markdown标题层级 | ... | ... |\n| 表格格式 | ... | ... |\n| 超链接 | ... | ... |\n| 强调与标记 | ... | ... |\n\n### 8. 去重声明 — {✅/⚠️/❌}\n\n| 检查项 | 状态 | 说明 |\n|-"},{"path":"agents/checklist.md","content":"# 深度调研报告检查清单 v2.0\n\n## 检查日期：（运行当天）\n## 适用文档：深度调研报告\n## 文档ID：（当前报告文档ID）\n\n---\n\n## 检查维度（14维核心 + 2维可选）\n\n### 基础质量（8维）\n\n#### 1. 版本一致性\n- [ ] 标题/正文/底部版本号一致\n- [ ] 生成日期与最后更新日期合理\n- [ ] 版本号与内容同步（内容刷新时版本号自动更新）\n\n#### 2. 章节结构\n- [ ] 编号连续无重复（如 4.1→4.15）\n- [ ] 标题层级正确（无跳级）\n- [ ] 目录与内容对应\n- [ ] 修改编号后检查连锁反应\n\n#### 3. 数据准确性\n- [ ] 每个实验数字可溯源（论文+模型规模）\n- [ ] 相对提升计算正确（差值=绝对值差，百分比=相对基线）\n- [ ] 不同模型规模数据不混用（标注1.5B/7B）\n- [ ] 无\"来源待确认\"的未确认数据\n- [ ] 验证方法：从头到尾读一遍、验证一遍\n\n#### 4. arXiv ID 与引用\n- [ ] 所有ID准确可验证\n- [ ] 无xxxxx占位符\n- [ ] 引用格式统一（作者+年份/会议）\n- [ ] 反向查找来源论文确认\n\n#### 5. 内容逻辑\n- [ ] 无重复内容（交叉引用替代重复）\n- [ ] 判断有依据（标注引用来源）\n- [ ] 分析与数据一致\n- [ ] 结论有证据支撑，章节间无矛盾\n\n#### 6. 表格完整性\n- [ ] 表格有来源说明（论文Table X）\n- [ ] 表格数据与正文一致\n- [ ] 无断裂/碎片表格\n- [ ] 表头与内容对应\n\n#### 7. 附录与修复记录\n- [ ] 修复记录表完整（日期+版本+内容+严重程度）\n- [ ] 新增论文有记录\n- [ ] 版本变更历史清晰\n\n#### 8. 可读性\n- [ ] 格式统一（Markdown/飞书格式）\n- [ ] 无孤立代码块/碎片\n- [ ] 术语使用一致\n- [ ] 行文流畅、逻辑清晰\n\n### 深度质量（6维）\n\n#### 9. 技术洞察力\n- [ ] 不是简单罗列，有真正分析\n- [ ] 对方法优劣的判断尖锐，无\"it depends\"式敷衍\n- [ ] 有反直觉发现\n- [ ] 批判性分析充分（讲局限和适用场景）\n- [ ] 各方法论章节多cue benchmark\n\n#### 10. 未来预判合理性\n- [ ] 趋势预测有数据/文献支撑，非主观臆断\n- [ ] 方向饱和度判断基于最新数据\n- [ ] 预判具体（时间线、证据链），非泛泛而谈\n- [ ] \"下一个突破点\"预测有逻辑推导\n\n#### 11. 实操路径可行性\n- [ ] 建议具体可执行（非空泛）\n- [ ] 有清晰的\"第一步、第二步、第三步\"\n- [ ] 资源需求（算力、数据、人力）估计合理\n- [ ] 考虑执行风险和Plan B\n\n#### 12. 数学与理论严谨性\n- [ ] 公式推导正确\n- [ ] 方差分析、收敛性讨论准确\n- [ ] 理论保证假设条件明确\n- [ ] 近似/启发式方法标注适用范围\n- [ ] 符号使用一致\n\n#### 13. 数据效率分析\n- [ ] 样本效率对比完整\n- [ ] 计算成本（FLOPs、训练时间、GPU小时）标注\n- [ ] 与基线的方法效率差异量化\n- [ ] 扩展性分析（随horizon/agent数增长的成本变化）\n\n#### 14. 组合矩阵覆盖度\n- [ ] 方法×Benchmark交叉覆盖无遗漏\n- [ ] 每个方法覆盖足够benchmark展示优势\n- [ ] 每个benchmark被足够方法测试\n- [ ] 无\"只在容易benchmark上测试\"的偏置\n\n### 可选维度（2维）\n\n#### 15. 反向可检索性\n- [ ] 从论文标题能快速定位到报告对应章节\n- [ ] 关键论文引用在正文中被充分讨论\n\n#### 16. 饱和度判断时效性\n- [ ] 各benchmark饱和状态基于最新数据\n- [ ] 新发布benchmark已纳入\n- [ ] SOTA数据最新（截至报告生成日期）\n\n---\n\n## 检查方法\n\n1. **数据验证**：对每个实验数字，反向查找来源论文的对应表格，手动重新计算验证\n2. **计算验证**：对相对提升百分比，手动重新计算\n3. **交叉引用**：对重复内容，确认已改为交叉引用\n4. **全文搜索**：对占位符（xxxxx）、来源待确认等关键词全文搜索\n5. **深度阅读**：对技术洞察维度，通读判断是否有独到见解还是堆砌\n6. **矩阵验证**：对组合矩阵覆盖度，绘制方法×benchmark表格确认\n\n---\n\n## 修复安全规范（v5.1.0 强化）\n\n⚠️ **飞书文档增量编辑极度危险**——每次 `delete_range`/`replace_range` 操作可能导致永久误删。\n\n**修复前必须：**\n1. 记录文档当前大小（`total_length`）作为基准\n2. 每次操作后立即验证大小变化\n3. 大小变化异常（>±5%）立即停止\n4. 复杂修复优先用 overwrite 模式\n\n**唯一可靠路线**（v5.1.0 强制）：\n- 下载→本地修复→overwrite覆盖\n- `replace_range` 实际行为是插入而非替换，会导致内容重复叠加\n- `delete_range` 定位不准会永久误删内容\n\n**禁止行为**：\n- 连续多次 patch 而不验证\n- 用 `delete_range` 删除不确定范围的内容\n- 在文档已异常（如重复、损坏）时继续 patch\n- 给\"5分钟\"\"3分钟\"\"立刻\"等空头承诺\n\n---\n\n*创建时间：2026-07-04*\n*适用版本：v5.1.0+* \n*最后更新：2026-07-24（版本号全局同步，移除硬编码文档ID）*"}],"languages":[],"docsSourceLabel":"CLAWHUB","editorialOverview":"HuggingFace Daily Papers + arXiv 多Agent深度研究系统。 采用编排器+专业Agent架构，支持两种模式： 1. 轻量扫描模式：周期性追踪（周/月），发现新论文 2. 深度调研模式：全时间范围调研，产出全面深入的研究报告 支持动态配置、自适应关键词、周期版本控制、跨平台搜索工具适配。 Skill: HF Daily Deep Researcher Owner: tomfoxxxx Summary: HuggingFace Daily Papers + arXiv 多Agent深度研究系统。 采用编排器+专业Agent架构，支持两种模式： 1. 轻量扫描模式：周期性追踪（周/月），发现新论文 2. 深度调研模式：全时间范围调研，产出全面深入的研究报告 支持动态配置、自适应关键词、周期版本控制、跨平台搜索工具适配。 Tags: academic:4.1.1, arxiv:4.1.1, huggingface:4.1.1, latest:5.2.9, literature-review:4.1.1, research:4.1.1 Version history: v5.2.9 | 2026-08-26T10:14:26.890Z | user v5.2.9: GitHub mirror HF datasource,","editorialQuality":{"score":100,"threshold":65,"status":"ready","wordCount":915,"uniquenessScore":52,"reasons":[]}},"media":{"evidence":{"source":"no-media","verified":false,"confidence":"low","updatedAt":"2026-10-10T13:36:33.926Z","emptyReason":"No screenshots, media assets, or demo links are available."},"primaryImageUrl":null,"mediaAssetCount":0,"assets":[],"demoUrl":null},"ownerResources":{"evidence":{"source":"unclaimed","verified":false,"confidence":"low","updatedAt":"2026-10-10T13:36:33.926Z","emptyReason":"This page has not been claimed by the agent owner."},"hasCustomPage":false,"customPageUpdatedAt":null,"customLinks":[],"structuredLinks":{"docsUrl":null,"demoUrl":null,"supportUrl":null,"pricingUrl":null,"statusUrl":null},"customPage":null},"relatedAgents":{"evidence":{"source":"protocol-neighbors","verified":false,"confidence":"medium","updatedAt":"2026-10-10T15:54:38.310Z","emptyReason":null},"items":[{"id":"8ebccd8e-3863-4187-8355-c3f14e1f9edf","entityType":"agent","canonicalPath":"/agent/iofficeai-aionui","slug":"iofficeai-aionui","name":"AionUi","description":"Free, local, open-source 24/7 Cowork app and OpenClaw for Gemini CLI, Claude Code, Codex, OpenCode, Qwen Code, Goose CLI, Auggie, and more | 🌟 Star if you like it!","url":"https://github.com/iOfficeAI/AionUi","homepage":"https://www.aionui.com","source":"GITHUB_REPOS","protocols":["MCP","OPENCLAW"],"capabilities":[],"safetyScore":100,"overallRank":70,"updatedAt":"2026-10-09T19:11:12.944Z","createdAt":"2026-02-25T03:38:16.584Z","downloads":null},{"id":"b917f68a-ebff-438e-84f8-3f4b2494c0bc","entityType":"agent","canonicalPath":"/agent/activepieces-activepieces","slug":"activepieces-activepieces","name":"activepieces","description":"AI Agents & MCPs & AI Workflow Automation • (~400 MCP servers for AI agents) • AI Automation / AI Agent with MCPs • AI Workflows & AI Agents • MCPs for AI Agents","url":"https://github.com/activepieces/activepieces","homepage":"https://www.activepieces.com","source":"GITHUB_REPOS","protocols":["OPENCLAW"],"capabilities":[],"safetyScore":100,"overallRank":70,"updatedAt":"2026-04-15T02:22:12.426Z","createdAt":"2026-02-25T03:38:12.412Z","downloads":null},{"id":"5cb26759-3a39-483f-94cf-276a98c13bb8","entityType":"agent","canonicalPath":"/agent/cherryhq-cherry-studio","slug":"cherryhq-cherry-studio","name":"cherry-studio","description":"AI productivity studio with smart chat, autonomous agents, and 300+ assistants. Unified access to frontier LLMs","url":"https://github.com/CherryHQ/cherry-studio","homepage":"https://cherry-ai.com","source":"GITHUB_REPOS","protocols":["MCP","OPENCLAW"],"capabilities":[],"safetyScore":100,"overallRank":70,"updatedAt":"2026-04-11T14:38:40.986Z","createdAt":"2026-02-25T03:38:19.379Z","downloads":null},{"id":"6f6582d0-5d76-4f0f-b81d-86520247950b","entityType":"agent","canonicalPath":"/agent/copilotkit-copilotkit","slug":"copilotkit-copilotkit","name":"CopilotKit","description":"The Frontend for Agents & Generative UI. React + Angular","url":"https://github.com/CopilotKit/CopilotKit","homepage":"https://docs.copilotkit.ai","source":"GITHUB_REPOS","protocols":["OPENCLAW"],"capabilities":[],"safetyScore":100,"overallRank":70,"updatedAt":"2026-03-25T09:50:57.846Z","createdAt":"2026-02-25T03:39:14.617Z","downloads":null}],"links":{"hub":"/agent","source":"/agent/source/clawhub","protocols":[{"label":"OpenClaw","href":"/agent/protocol/openclew"}]}}}