行业周报来源账本法:每个结论都可追溯至原始网页

让 AI 直接“写一份本周行业周报”,通常能得到结构完整的文本,却很难回答消息来自哪里、是否属于指定日期范围、同一事件是否重复出现,以及演示文稿中的数字是否与原始材料一致。可交付的周报不是一次生成任务,而是一条保留证据的处理链。本文把来源账本作为单一事实入口,说明如何完成公开资料采集、去重、分析、成稿与跨文件核对;最终结果应允许审阅者从任意结论回到原始来源。
先定义交付物和范围
在搜索前确定统计周期、主题范围、读者和交付文件。例如:
范围:指定起止时间内的产品发布、公司公告和规则变化
读者:产品与运营团队
交付:sources.csv、weekly.md、briefing.pptx
验收:每条事实有来源编号;观点单独标注;跨文件数字一致
日期边界要写出时区。对持续更新的网页,同时记录事件日期和抓取时间,避免把页面更新时间误当成事件发生时间。
第一步:采集阶段只保留材料
采集时不要急着判断趋势。每条记录至少保存标题、事件日期、主体、来源地址、抓取时间和支持该事件的原文片段。访问失败也要留下失败原因,不应让自动化绕过登录、验证码、付费墙或访问控制。
可以要求采集工具输出下面的 CSV 表头:
source_id,event_date,captured_at,subject,event_type,title,source_url,quote,verification,duplicate_group,risk_note
source_id 在首次写入后保持不变。后续摘要、正文和演示文稿都通过它引用来源,避免复制链接时产生不同版本。
第二步:保留原值再做标准化
日期、金额和版本号经常存在格式差异。不要直接覆盖原文,而要同时保留原始表达和标准化字段。例如金额可拆成:
amount_raw:来源中的完整表达
amount_value:能够确定时填写的数值
amount_currency:来源明确说明的币种
无法确定的字段留空,并在 risk_note 中记录原因。模型补齐的数值不能当作来源事实。
第三步:为重复事件分组
同一公告可能被官网、社交账号和多家媒体重复转载。去重时比较主体、核心动作、日期、版本或交易轮次,而不是只比较标题。
处理规则可以写成:
- 不删除原始记录,只填写
duplicate_group; - 每组选择最接近事件主体的一手来源作为主记录;
- 多个来源出现数字冲突时保留冲突,不自行投票;
- 转载内容不能增加原始来源没有提供的确定性;
- 无法判断是否同一事件时进入人工核验清单。
完成后按 duplicate_group 检查,确认正文不会把同一事件计算多次。
第四步:把事实和分析分开
对入选事件先写“已确认事实”,再写“作者分析”和“待验证事项”。推荐使用固定结构:
事件:仅陈述来源能够支持的内容
证据:列出 source_id
分析:说明判断依据和适用条件
待验证:列出缺失或冲突的信息
任何事实句都应能回指来源。模型给出的影响判断属于分析,不能因为语气确定就变成官方结论。
第五步:从账本生成正文
正文只消费已经标记为可用的记录。可按“本周结论、重点事件、产品变化、规则与风险、下周关注”组织,但每节仍保留 source_id。未核实信息只能进入待关注区域,不能写进主要结论。
生成后执行两类检查:
- 完整性:正文中的来源编号都能在账本中找到;
- 一致性:日期、公司、版本和数值与账本完全一致。
这一步最好使用程序检查编号引用,再由人工审阅语义。
第六步:生成演示文稿时禁止新增事实
演示文稿是正文的压缩版本,不是第二次研究。页面标题可以改成结论句,但图表数值必须来自来源账本。没有图片材料时,不要生成会被误认为真实界面或现场照片的视觉内容。
导出后实际打开文件,检查:
- 文本是否溢出或被遮挡;
- 字体替换后是否影响布局;
- 图表数据是否与账本一致;
- 页面中的来源编号是否可读;
- 观点是否仍被标识为分析。
第七步:做逆向抽查
从最终周报或演示文稿随机选择若干结论,逆向经过正文、来源编号回到原网页。抽查时验证:
来源可访问且确实支持该句;
事件日期落在报告周期内;
数字没有在格式转换中变化;
重复来源没有被当作多条独立证据;
分析没有被改写成事实。
若任一步无法回查,应缩小或删除结论,而不是补写一个看似合理的来源。
结论与限制
行业周报的可信度来自可追溯处理链,而不是文字生成速度。以来源账本固定原始证据,再依次完成标准化、去重、事实与分析分离、跨文件一致性检查,能让审阅者定位每个结论的依据。
本文流程适用于公开信息周报,不覆盖付费数据库的授权、内部敏感材料的处理或事实真伪的专业鉴定。网页内容会变化,重要结论仍需在发布前由负责人重新打开一手来源核对。
Related
相关文章推荐

用 Python 验证 Claude Prompt Caching 创建与读取
本文用相同长前缀和两个不同问题发起请求,记录缓存创建与读取 usage,并通过修改前缀的对照请求验证命中条件。

Canvas 射击游戏的循环、碰撞与对象生命周期
Canvas 射击游戏容易出现高刷新率加速、子弹穿透和对象持续增长。本文给出固定时间步、连续碰撞、生命周期控制与运行验收方法。

Claude for Chrome 只读采集与提交确认流程
浏览器自动化既能读取页面也可能改变页面状态。本文用只读采集、表单预填和提交确认三个阶段说明任务约束、验证方法与停止条件。

Claude Agent SDK 的权限求值与会话隔离设计
解释 Agent SDK 中 deny、allow、permission mode、回调与 Hook 的求值关系,并给出任务、授权范围和 Session 的隔离原则。