vscode-templete/.claude/skills/auto-wiki-cn/references/source-validation.md

142 lines
5.7 KiB
Markdown
Raw Permalink Normal View History

# 信息来源校验
## 来源可信度分级
每条信息标注来源类型,不同类型对应不同 confidence 默认值:
| 来源类型 | 标记 | 默认 confidence | 说明 |
|---------|------|----------------|------|
| 一手来源 | `[一手]` | high | 本人著作、官方文件、原始数据、亲自参与的会议 |
| 权威二手 | `[二手·权威]` | high | 权威媒体报道、学术论文、监管机构发布 |
| 普通二手 | `[二手]` | medium | 行业研报、分析文章、第三方整理 |
| 转述 | `[转述]` | low | 二次加工内容、社交媒体讨论、未标来源的信息 |
| 推断 | `[推断]` | low | Agent 或用户基于已有信息推导的结论 |
| 口述 | `[口述]` | medium | 用户口述、会议纪要、未录音的对话 |
### 在 source 摘要页中标注
```markdown
---
title: 人社部企业年金新规
type: source
source_type: 一手 # 来源类型
source_origin: 人社部官网 # 来源出处
source_date: 2026-04-01 # 原始材料日期
source_url: "" # 来源 URL如有
---
## 关键信息
- [一手] 企业年金可携带转移新规发布...
- [一手] 受托人准入门槛提升至...
```
### 在实体/概念页中标注
当引用不同可信度的来源时,在正文中标注:
```markdown
## 管理规模
截至 2025 年底,管理规模达 1200 亿元。[一手](来源:[[2026-04-06-hrss-policy]]
市场排名约第 3 位。[二手](来源:[[2025-industry-report]],非官方数据)
```
## 来源黑名单
以下渠道不作为独立来源使用(可作为线索但不引用):
| 渠道 | 原因 |
|------|------|
| 知乎 | 洗稿严重,信息失真率高 |
| 微信公众号 | 封闭生态,无法验证,大量二手转述 |
| 百度百科/百度知道 | 信息陈旧且不可靠 |
| 未标来源的聚合内容 | 无法追溯,不可审计 |
**中文可接受渠道**36氪、极客公园、晚点 LatePost、财新、第一财经、虎嗅、少数派、机器之心、监管机构官网、上市公司公告。
## 工具依赖检查
### 首次使用时的环境检查
Agent 在第一次执行 ingest 时,检查用户环境中的可用工具:
```
┌─────────────────────────────────────────────────────────┐
│ 知识编译器 · 环境检查 │
│ │
│ ✅ 文件读写 — 可以创建和编辑 wiki 页面 │
│ ✅ 本地搜索 — 可以 grep wiki 内容 │
│ │
│ ⚠️ 以下能力取决于你的配置: │
│ {?} 网络搜索 — 需要 WebSearch 工具或搜索类 MCP │
│ {?} 网页读取 — 需要 WebFetch 工具 │
│ {?} PDF 读取 — 需要 Agent 支持 PDFClaude Code 支持) │
│ {?} 领域数据 — 需要对应领域的数据 MCP │
│ │
│ 📝 当前模式: │
│ • 用户提供源文件 → ✅ 随时可用 │
│ • Agent 自主搜索 → 需要搜索工具 │
└─────────────────────────────────────────────────────────┘
```
### 两种工作模式
| 模式 | 需要的工具 | 说明 |
|------|-----------|------|
| **被动模式** | 只需文件读写 | 用户提供源文件Agent 编译进 wiki。零依赖 |
| **主动模式** | 搜索 + 网页读取 | Agent 自主搜索信息,再 ingest。需要 MCP/WebSearch |
**Skill 默认为被动模式**——用户丢文件进来Agent 编译。不假设用户有任何搜索工具。
**当用户说"帮我研究 XX"但没提供源文件时**
```
Agent: 你希望我怎么获取材料?
1. 你提供文件/文本 → 我直接编译(推荐)
2. 我自主搜索 → 需要确认你有以下工具:
- WebSearch 或搜索类 MCP 工具
- WebFetch读取网页内容
如果没有,我无法自主获取材料。
```
### 搜索工具适配
如果用户有搜索工具Agent 的 ingest 流程扩展为:
```
1. 根据研究主题制定搜索计划(搜什么、去哪搜)
2. 执行搜索,获取候选来源列表
3. 按来源可信度分级,优先读取一手/权威来源
4. 对每个有价值的来源执行标准 ingest 流程
5. 在 source 摘要页中记录搜索关键词和筛选过程
```
**关键原则:搜索是获取源文件的手段,不改变 ingest 的核心逻辑(读旧比新改旧)。**
### Deep-Dive 搜索来源的标注
当来源由 deep-dive 管道的自动搜索获取时source 摘要页需要额外记录 deep-dive 元数据:
```yaml
---
title: Alpha Corp 2025 年报摘要
type: source
source_type: 二手 # 按实际判定,不因搜索方式改变
source_origin: 财新网
source_date: 2025-06-15
source_url: "https://..."
deep_dive_meta: # deep-dive 特有字段
search_query: "Alpha Corp 企业年金 年报 2025"
gap_filled: "single_source:alpha-corp"
search_date: 2026-04-09
---
```
**Confidence 上限规则**
- 搜索获取的来源confidence 上限为 medium除非来源满足"一手"或"二手·权威"标准
- 多个搜索来源佐证同一结论时confidence 可提升至 high
- 来源的 source_type 仍按标准分级判定,不因获取方式(搜索 vs 用户提供)而改变