vscode-templete/.claude/skills/auto-wiki-cn/references/source-validation.md

142 lines
5.7 KiB
Markdown
Raw Permalink Blame History

This file contains ambiguous Unicode characters

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

# 信息来源校验
## 来源可信度分级
每条信息标注来源类型,不同类型对应不同 confidence 默认值:
| 来源类型 | 标记 | 默认 confidence | 说明 |
|---------|------|----------------|------|
| 一手来源 | `[一手]` | high | 本人著作、官方文件、原始数据、亲自参与的会议 |
| 权威二手 | `[二手·权威]` | high | 权威媒体报道、学术论文、监管机构发布 |
| 普通二手 | `[二手]` | medium | 行业研报、分析文章、第三方整理 |
| 转述 | `[转述]` | low | 二次加工内容、社交媒体讨论、未标来源的信息 |
| 推断 | `[推断]` | low | Agent 或用户基于已有信息推导的结论 |
| 口述 | `[口述]` | medium | 用户口述、会议纪要、未录音的对话 |
### 在 source 摘要页中标注
```markdown
---
title: 人社部企业年金新规
type: source
source_type: 一手 # 来源类型
source_origin: 人社部官网 # 来源出处
source_date: 2026-04-01 # 原始材料日期
source_url: "" # 来源 URL如有
---
## 关键信息
- [一手] 企业年金可携带转移新规发布...
- [一手] 受托人准入门槛提升至...
```
### 在实体/概念页中标注
当引用不同可信度的来源时,在正文中标注:
```markdown
## 管理规模
截至 2025 年底,管理规模达 1200 亿元。[一手](来源:[[2026-04-06-hrss-policy]]
市场排名约第 3 位。[二手](来源:[[2025-industry-report]],非官方数据)
```
## 来源黑名单
以下渠道不作为独立来源使用(可作为线索但不引用):
| 渠道 | 原因 |
|------|------|
| 知乎 | 洗稿严重,信息失真率高 |
| 微信公众号 | 封闭生态,无法验证,大量二手转述 |
| 百度百科/百度知道 | 信息陈旧且不可靠 |
| 未标来源的聚合内容 | 无法追溯,不可审计 |
**中文可接受渠道**36氪、极客公园、晚点 LatePost、财新、第一财经、虎嗅、少数派、机器之心、监管机构官网、上市公司公告。
## 工具依赖检查
### 首次使用时的环境检查
Agent 在第一次执行 ingest 时,检查用户环境中的可用工具:
```
┌─────────────────────────────────────────────────────────┐
│ 知识编译器 · 环境检查 │
│ │
│ ✅ 文件读写 — 可以创建和编辑 wiki 页面 │
│ ✅ 本地搜索 — 可以 grep wiki 内容 │
│ │
│ ⚠️ 以下能力取决于你的配置: │
│ {?} 网络搜索 — 需要 WebSearch 工具或搜索类 MCP │
│ {?} 网页读取 — 需要 WebFetch 工具 │
│ {?} PDF 读取 — 需要 Agent 支持 PDFClaude Code 支持) │
│ {?} 领域数据 — 需要对应领域的数据 MCP │
│ │
│ 📝 当前模式: │
│ • 用户提供源文件 → ✅ 随时可用 │
│ • Agent 自主搜索 → 需要搜索工具 │
└─────────────────────────────────────────────────────────┘
```
### 两种工作模式
| 模式 | 需要的工具 | 说明 |
|------|-----------|------|
| **被动模式** | 只需文件读写 | 用户提供源文件Agent 编译进 wiki。零依赖 |
| **主动模式** | 搜索 + 网页读取 | Agent 自主搜索信息,再 ingest。需要 MCP/WebSearch |
**Skill 默认为被动模式**——用户丢文件进来Agent 编译。不假设用户有任何搜索工具。
**当用户说"帮我研究 XX"但没提供源文件时**
```
Agent: 你希望我怎么获取材料?
1. 你提供文件/文本 → 我直接编译(推荐)
2. 我自主搜索 → 需要确认你有以下工具:
- WebSearch 或搜索类 MCP 工具
- WebFetch读取网页内容
如果没有,我无法自主获取材料。
```
### 搜索工具适配
如果用户有搜索工具Agent 的 ingest 流程扩展为:
```
1. 根据研究主题制定搜索计划(搜什么、去哪搜)
2. 执行搜索,获取候选来源列表
3. 按来源可信度分级,优先读取一手/权威来源
4. 对每个有价值的来源执行标准 ingest 流程
5. 在 source 摘要页中记录搜索关键词和筛选过程
```
**关键原则:搜索是获取源文件的手段,不改变 ingest 的核心逻辑(读旧比新改旧)。**
### Deep-Dive 搜索来源的标注
当来源由 deep-dive 管道的自动搜索获取时source 摘要页需要额外记录 deep-dive 元数据:
```yaml
---
title: Alpha Corp 2025 年报摘要
type: source
source_type: 二手 # 按实际判定,不因搜索方式改变
source_origin: 财新网
source_date: 2025-06-15
source_url: "https://..."
deep_dive_meta: # deep-dive 特有字段
search_query: "Alpha Corp 企业年金 年报 2025"
gap_filled: "single_source:alpha-corp"
search_date: 2026-04-09
---
```
**Confidence 上限规则**
- 搜索获取的来源confidence 上限为 medium除非来源满足"一手"或"二手·权威"标准
- 多个搜索来源佐证同一结论时confidence 可提升至 high
- 来源的 source_type 仍按标准分级判定,不因获取方式(搜索 vs 用户提供)而改变