142 lines
5.7 KiB
Markdown
142 lines
5.7 KiB
Markdown
# 信息来源校验
|
||
|
||
## 来源可信度分级
|
||
|
||
每条信息标注来源类型,不同类型对应不同 confidence 默认值:
|
||
|
||
| 来源类型 | 标记 | 默认 confidence | 说明 |
|
||
|---------|------|----------------|------|
|
||
| 一手来源 | `[一手]` | high | 本人著作、官方文件、原始数据、亲自参与的会议 |
|
||
| 权威二手 | `[二手·权威]` | high | 权威媒体报道、学术论文、监管机构发布 |
|
||
| 普通二手 | `[二手]` | medium | 行业研报、分析文章、第三方整理 |
|
||
| 转述 | `[转述]` | low | 二次加工内容、社交媒体讨论、未标来源的信息 |
|
||
| 推断 | `[推断]` | low | Agent 或用户基于已有信息推导的结论 |
|
||
| 口述 | `[口述]` | medium | 用户口述、会议纪要、未录音的对话 |
|
||
|
||
### 在 source 摘要页中标注
|
||
|
||
```markdown
|
||
---
|
||
title: 人社部企业年金新规
|
||
type: source
|
||
source_type: 一手 # 来源类型
|
||
source_origin: 人社部官网 # 来源出处
|
||
source_date: 2026-04-01 # 原始材料日期
|
||
source_url: "" # 来源 URL(如有)
|
||
---
|
||
|
||
## 关键信息
|
||
|
||
- [一手] 企业年金可携带转移新规发布...
|
||
- [一手] 受托人准入门槛提升至...
|
||
```
|
||
|
||
### 在实体/概念页中标注
|
||
|
||
当引用不同可信度的来源时,在正文中标注:
|
||
|
||
```markdown
|
||
## 管理规模
|
||
|
||
截至 2025 年底,管理规模达 1200 亿元。[一手](来源:[[2026-04-06-hrss-policy]])
|
||
|
||
市场排名约第 3 位。[二手](来源:[[2025-industry-report]],非官方数据)
|
||
```
|
||
|
||
## 来源黑名单
|
||
|
||
以下渠道不作为独立来源使用(可作为线索但不引用):
|
||
|
||
| 渠道 | 原因 |
|
||
|------|------|
|
||
| 知乎 | 洗稿严重,信息失真率高 |
|
||
| 微信公众号 | 封闭生态,无法验证,大量二手转述 |
|
||
| 百度百科/百度知道 | 信息陈旧且不可靠 |
|
||
| 未标来源的聚合内容 | 无法追溯,不可审计 |
|
||
|
||
**中文可接受渠道**:36氪、极客公园、晚点 LatePost、财新、第一财经、虎嗅、少数派、机器之心、监管机构官网、上市公司公告。
|
||
|
||
## 工具依赖检查
|
||
|
||
### 首次使用时的环境检查
|
||
|
||
Agent 在第一次执行 ingest 时,检查用户环境中的可用工具:
|
||
|
||
```
|
||
┌─────────────────────────────────────────────────────────┐
|
||
│ 知识编译器 · 环境检查 │
|
||
│ │
|
||
│ ✅ 文件读写 — 可以创建和编辑 wiki 页面 │
|
||
│ ✅ 本地搜索 — 可以 grep wiki 内容 │
|
||
│ │
|
||
│ ⚠️ 以下能力取决于你的配置: │
|
||
│ {?} 网络搜索 — 需要 WebSearch 工具或搜索类 MCP │
|
||
│ {?} 网页读取 — 需要 WebFetch 工具 │
|
||
│ {?} PDF 读取 — 需要 Agent 支持 PDF(Claude Code 支持) │
|
||
│ {?} 领域数据 — 需要对应领域的数据 MCP │
|
||
│ │
|
||
│ 📝 当前模式: │
|
||
│ • 用户提供源文件 → ✅ 随时可用 │
|
||
│ • Agent 自主搜索 → 需要搜索工具 │
|
||
└─────────────────────────────────────────────────────────┘
|
||
```
|
||
|
||
### 两种工作模式
|
||
|
||
| 模式 | 需要的工具 | 说明 |
|
||
|------|-----------|------|
|
||
| **被动模式** | 只需文件读写 | 用户提供源文件,Agent 编译进 wiki。零依赖 |
|
||
| **主动模式** | 搜索 + 网页读取 | Agent 自主搜索信息,再 ingest。需要 MCP/WebSearch |
|
||
|
||
**Skill 默认为被动模式**——用户丢文件进来,Agent 编译。不假设用户有任何搜索工具。
|
||
|
||
**当用户说"帮我研究 XX"但没提供源文件时**:
|
||
|
||
```
|
||
Agent: 你希望我怎么获取材料?
|
||
|
||
1. 你提供文件/文本 → 我直接编译(推荐)
|
||
2. 我自主搜索 → 需要确认你有以下工具:
|
||
- WebSearch 或搜索类 MCP 工具
|
||
- WebFetch(读取网页内容)
|
||
如果没有,我无法自主获取材料。
|
||
```
|
||
|
||
### 搜索工具适配
|
||
|
||
如果用户有搜索工具,Agent 的 ingest 流程扩展为:
|
||
|
||
```
|
||
1. 根据研究主题制定搜索计划(搜什么、去哪搜)
|
||
2. 执行搜索,获取候选来源列表
|
||
3. 按来源可信度分级,优先读取一手/权威来源
|
||
4. 对每个有价值的来源执行标准 ingest 流程
|
||
5. 在 source 摘要页中记录搜索关键词和筛选过程
|
||
```
|
||
|
||
**关键原则:搜索是获取源文件的手段,不改变 ingest 的核心逻辑(读旧比新改旧)。**
|
||
|
||
### Deep-Dive 搜索来源的标注
|
||
|
||
当来源由 deep-dive 管道的自动搜索获取时,source 摘要页需要额外记录 deep-dive 元数据:
|
||
|
||
```yaml
|
||
---
|
||
title: Alpha Corp 2025 年报摘要
|
||
type: source
|
||
source_type: 二手 # 按实际判定,不因搜索方式改变
|
||
source_origin: 财新网
|
||
source_date: 2025-06-15
|
||
source_url: "https://..."
|
||
deep_dive_meta: # deep-dive 特有字段
|
||
search_query: "Alpha Corp 企业年金 年报 2025"
|
||
gap_filled: "single_source:alpha-corp"
|
||
search_date: 2026-04-09
|
||
---
|
||
```
|
||
|
||
**Confidence 上限规则**:
|
||
- 搜索获取的来源,confidence 上限为 medium,除非来源满足"一手"或"二手·权威"标准
|
||
- 多个搜索来源佐证同一结论时,confidence 可提升至 high
|
||
- 来源的 source_type 仍按标准分级判定,不因获取方式(搜索 vs 用户提供)而改变
|