# 信息来源校验 ## 来源可信度分级 每条信息标注来源类型,不同类型对应不同 confidence 默认值: | 来源类型 | 标记 | 默认 confidence | 说明 | |---------|------|----------------|------| | 一手来源 | `[一手]` | high | 本人著作、官方文件、原始数据、亲自参与的会议 | | 权威二手 | `[二手·权威]` | high | 权威媒体报道、学术论文、监管机构发布 | | 普通二手 | `[二手]` | medium | 行业研报、分析文章、第三方整理 | | 转述 | `[转述]` | low | 二次加工内容、社交媒体讨论、未标来源的信息 | | 推断 | `[推断]` | low | Agent 或用户基于已有信息推导的结论 | | 口述 | `[口述]` | medium | 用户口述、会议纪要、未录音的对话 | ### 在 source 摘要页中标注 ```markdown --- title: 人社部企业年金新规 type: source source_type: 一手 # 来源类型 source_origin: 人社部官网 # 来源出处 source_date: 2026-04-01 # 原始材料日期 source_url: "" # 来源 URL(如有) --- ## 关键信息 - [一手] 企业年金可携带转移新规发布... - [一手] 受托人准入门槛提升至... ``` ### 在实体/概念页中标注 当引用不同可信度的来源时,在正文中标注: ```markdown ## 管理规模 截至 2025 年底,管理规模达 1200 亿元。[一手](来源:[[2026-04-06-hrss-policy]]) 市场排名约第 3 位。[二手](来源:[[2025-industry-report]],非官方数据) ``` ## 来源黑名单 以下渠道不作为独立来源使用(可作为线索但不引用): | 渠道 | 原因 | |------|------| | 知乎 | 洗稿严重,信息失真率高 | | 微信公众号 | 封闭生态,无法验证,大量二手转述 | | 百度百科/百度知道 | 信息陈旧且不可靠 | | 未标来源的聚合内容 | 无法追溯,不可审计 | **中文可接受渠道**:36氪、极客公园、晚点 LatePost、财新、第一财经、虎嗅、少数派、机器之心、监管机构官网、上市公司公告。 ## 工具依赖检查 ### 首次使用时的环境检查 Agent 在第一次执行 ingest 时,检查用户环境中的可用工具: ``` ┌─────────────────────────────────────────────────────────┐ │ 知识编译器 · 环境检查 │ │ │ │ ✅ 文件读写 — 可以创建和编辑 wiki 页面 │ │ ✅ 本地搜索 — 可以 grep wiki 内容 │ │ │ │ ⚠️ 以下能力取决于你的配置: │ │ {?} 网络搜索 — 需要 WebSearch 工具或搜索类 MCP │ │ {?} 网页读取 — 需要 WebFetch 工具 │ │ {?} PDF 读取 — 需要 Agent 支持 PDF(Claude Code 支持) │ │ {?} 领域数据 — 需要对应领域的数据 MCP │ │ │ │ 📝 当前模式: │ │ • 用户提供源文件 → ✅ 随时可用 │ │ • Agent 自主搜索 → 需要搜索工具 │ └─────────────────────────────────────────────────────────┘ ``` ### 两种工作模式 | 模式 | 需要的工具 | 说明 | |------|-----------|------| | **被动模式** | 只需文件读写 | 用户提供源文件,Agent 编译进 wiki。零依赖 | | **主动模式** | 搜索 + 网页读取 | Agent 自主搜索信息,再 ingest。需要 MCP/WebSearch | **Skill 默认为被动模式**——用户丢文件进来,Agent 编译。不假设用户有任何搜索工具。 **当用户说"帮我研究 XX"但没提供源文件时**: ``` Agent: 你希望我怎么获取材料? 1. 你提供文件/文本 → 我直接编译(推荐) 2. 我自主搜索 → 需要确认你有以下工具: - WebSearch 或搜索类 MCP 工具 - WebFetch(读取网页内容) 如果没有,我无法自主获取材料。 ``` ### 搜索工具适配 如果用户有搜索工具,Agent 的 ingest 流程扩展为: ``` 1. 根据研究主题制定搜索计划(搜什么、去哪搜) 2. 执行搜索,获取候选来源列表 3. 按来源可信度分级,优先读取一手/权威来源 4. 对每个有价值的来源执行标准 ingest 流程 5. 在 source 摘要页中记录搜索关键词和筛选过程 ``` **关键原则:搜索是获取源文件的手段,不改变 ingest 的核心逻辑(读旧比新改旧)。** ### Deep-Dive 搜索来源的标注 当来源由 deep-dive 管道的自动搜索获取时,source 摘要页需要额外记录 deep-dive 元数据: ```yaml --- title: Alpha Corp 2025 年报摘要 type: source source_type: 二手 # 按实际判定,不因搜索方式改变 source_origin: 财新网 source_date: 2025-06-15 source_url: "https://..." deep_dive_meta: # deep-dive 特有字段 search_query: "Alpha Corp 企业年金 年报 2025" gap_filled: "single_source:alpha-corp" search_date: 2026-04-09 --- ``` **Confidence 上限规则**: - 搜索获取的来源,confidence 上限为 medium,除非来源满足"一手"或"二手·权威"标准 - 多个搜索来源佐证同一结论时,confidence 可提升至 high - 来源的 source_type 仍按标准分级判定,不因获取方式(搜索 vs 用户提供)而改变