vscode-templete/.claude/skills/auto-wiki-cn/references/source-validation.md

5.7 KiB
Raw Permalink Blame History

信息来源校验

来源可信度分级

每条信息标注来源类型,不同类型对应不同 confidence 默认值:

来源类型 标记 默认 confidence 说明
一手来源 [一手] high 本人著作、官方文件、原始数据、亲自参与的会议
权威二手 [二手·权威] high 权威媒体报道、学术论文、监管机构发布
普通二手 [二手] medium 行业研报、分析文章、第三方整理
转述 [转述] low 二次加工内容、社交媒体讨论、未标来源的信息
推断 [推断] low Agent 或用户基于已有信息推导的结论
口述 [口述] medium 用户口述、会议纪要、未录音的对话

在 source 摘要页中标注

---
title: 人社部企业年金新规
type: source
source_type: 一手             # 来源类型
source_origin: 人社部官网      # 来源出处
source_date: 2026-04-01        # 原始材料日期
source_url: ""                 # 来源 URL如有
---

## 关键信息

- [一手] 企业年金可携带转移新规发布...
- [一手] 受托人准入门槛提升至...

在实体/概念页中标注

当引用不同可信度的来源时,在正文中标注:

## 管理规模

截至 2025 年底,管理规模达 1200 亿元。[一手](来源:[[2026-04-06-hrss-policy]]

市场排名约第 3 位。[二手](来源:[[2025-industry-report]],非官方数据)

来源黑名单

以下渠道不作为独立来源使用(可作为线索但不引用):

渠道 原因
知乎 洗稿严重,信息失真率高
微信公众号 封闭生态,无法验证,大量二手转述
百度百科/百度知道 信息陈旧且不可靠
未标来源的聚合内容 无法追溯,不可审计

中文可接受渠道36氪、极客公园、晚点 LatePost、财新、第一财经、虎嗅、少数派、机器之心、监管机构官网、上市公司公告。

工具依赖检查

首次使用时的环境检查

Agent 在第一次执行 ingest 时,检查用户环境中的可用工具:

┌─────────────────────────────────────────────────────────┐
│ 知识编译器 · 环境检查                                      │
│                                                          │
│ ✅ 文件读写    — 可以创建和编辑 wiki 页面                   │
│ ✅ 本地搜索    — 可以 grep wiki 内容                       │
│                                                          │
│ ⚠️ 以下能力取决于你的配置:                                 │
│ {?} 网络搜索   — 需要 WebSearch 工具或搜索类 MCP           │
│ {?} 网页读取   — 需要 WebFetch 工具                        │
│ {?} PDF 读取   — 需要 Agent 支持 PDFClaude Code 支持)   │
│ {?} 领域数据   — 需要对应领域的数据 MCP                   │
│                                                          │
│ 📝 当前模式:                                              │
│ • 用户提供源文件 → ✅ 随时可用                              │
│ • Agent 自主搜索 → 需要搜索工具                            │
└─────────────────────────────────────────────────────────┘

两种工作模式

模式 需要的工具 说明
被动模式 只需文件读写 用户提供源文件Agent 编译进 wiki。零依赖
主动模式 搜索 + 网页读取 Agent 自主搜索信息,再 ingest。需要 MCP/WebSearch

Skill 默认为被动模式——用户丢文件进来Agent 编译。不假设用户有任何搜索工具。

当用户说"帮我研究 XX"但没提供源文件时

Agent: 你希望我怎么获取材料?

1. 你提供文件/文本 → 我直接编译(推荐)
2. 我自主搜索 → 需要确认你有以下工具:
   - WebSearch 或搜索类 MCP 工具
   - WebFetch读取网页内容
   如果没有,我无法自主获取材料。

搜索工具适配

如果用户有搜索工具Agent 的 ingest 流程扩展为:

1. 根据研究主题制定搜索计划(搜什么、去哪搜)
2. 执行搜索,获取候选来源列表
3. 按来源可信度分级,优先读取一手/权威来源
4. 对每个有价值的来源执行标准 ingest 流程
5. 在 source 摘要页中记录搜索关键词和筛选过程

关键原则:搜索是获取源文件的手段,不改变 ingest 的核心逻辑(读旧比新改旧)。

Deep-Dive 搜索来源的标注

当来源由 deep-dive 管道的自动搜索获取时source 摘要页需要额外记录 deep-dive 元数据:

---
title: Alpha Corp 2025 年报摘要
type: source
source_type: 二手          # 按实际判定,不因搜索方式改变
source_origin: 财新网
source_date: 2025-06-15
source_url: "https://..."
deep_dive_meta:            # deep-dive 特有字段
  search_query: "Alpha Corp 企业年金 年报 2025"
  gap_filled: "single_source:alpha-corp"
  search_date: 2026-04-09
---

Confidence 上限规则

  • 搜索获取的来源confidence 上限为 medium除非来源满足"一手"或"二手·权威"标准
  • 多个搜索来源佐证同一结论时confidence 可提升至 high
  • 来源的 source_type 仍按标准分级判定,不因获取方式(搜索 vs 用户提供)而改变