问 Claude“请介绍一下 X”,通常能得到一份流畅的入门说明,却不一定得到一份能支持判断的研究材料。主流观点、成功案例和常见框架会被优先写出来,实践中的例外、反方证据、利益关系和历史类比则容易消失。本文给出一套不需要安装软件的轻量流程:用五种角色分别审视同一个问题,再把输出整理成可核验的研究材料。它适合选题、方案评估和学习路线设计,不适合替代法律、医疗、投资或安全审查。
STORM 借鉴的是什么
STORM 是 Stanford OVAL 实验室提出的一套长文研究系统,全称是 Synthesis of Topic Outlines through Retrieval and Multi-perspective Question Asking。论文《Assisting in the Creation of Wikipedia-like Articles From Scratch with Large Language Models》发表于 NAACL 2024,项目包含检索、视角提问、文章大纲和引用整理等环节。
相关资料:
- 论文与实验说明:arXiv:2402.14207
- 源码与实现:stanford-oval/storm
- 在线体验:storm.genie.stanford.edu
本文不复刻完整系统,而是借用其中最容易迁移的一步:不要让一个问题只得到一条叙事,先让不同角色独立提出问题和证据。 论文中的效果来自特定数据集、检索器和评测条件,不能直接解释成任何主题都会提升固定比例。可以复用的是研究顺序,不是宣传数字。
为什么一条 Prompt 容易漏信息
单次提问通常隐含了一个视角。例如“某技术值不值得采用”默认了技术供应商的定义,却没有说明谁承担失败成本、哪些证据算数、结论适用于哪个时间范围。
把问题拆给不同角色,可以主动暴露这些前提:
| 视角 | 主要追问 | 常见盲区 |
|---|---|---|
| 实践者 | 真实使用时哪里会坏 | 平均指标掩盖的长尾问题 |
| 学者 | 研究证据支持到哪一步 | 样本、方法和外推边界 |
| 怀疑者 | 哪个反例足以推翻主张 | 成功案例之外的失败成本 |
| 经济学家 | 谁从当前叙事中获利 | 激励、成本与利益分配 |
| 历史学家 | 是否有相似的旧案例 | 技术热潮的兑现周期 |
五个角色不代表五份独立证据。如果它们都引用同一篇文章,只是五种表达;最终仍要回到原始来源、样本和适用范围。
Prompt:多视角扫描
把 [你的话题] 换成具体问题。相比“人工智能怎么样”,下面这些输入更容易得到可用结果:
企业是否应该在今年把客服迁移到 AI Agent长上下文模型是否会取代企业 RAG远程办公对研发团队交付质量的影响
如何验收输出
先不要看文字是否“像专家”,而要检查五个视角是否真的带来了不同的研究动作。
| 检查项 | 合格表现 | 需要重跑的表现 |
|---|---|---|
| 视角差异 | 每个角色提出不同的证据和问题 | 五段话只是替换标题 |
| 来源透明 | 写明来源类型、时间和范围 | 反复使用“研究表明” |
| 不确定性 | 明确需要核验的事实 | 把推断写成已证实结论 |
| 反方质量 | 给出可检验的反例 | 只写一句“也存在风险” |
| 下一步 | 能导出查资料、访谈或小实验 | 读完不知道该验证什么 |
如果五个角色给出了完全相同的结论,可以追加:
什么时候需要联网和人工复核
这套 Prompt 只能组织模型可见的资料,不会自动把过期信息变成最新事实。遇到以下内容,应打开原文或提供权威资料后再判断:
- 价格、政策、产品版本、API 文档和公司状态
- 需要具体数字、论文结论或历史事件的文章
- 会影响投资、招聘、医疗、法律或合规的决定
- 任何只有一个来源、且无法交叉验证的关键主张
保存证据时至少记录“主张、原始来源、发布日期或访问时间、来源直接支持的范围、仍然缺少的信息”。模型的视角数量不能替代来源的独立性。
结语
STORM 最值得借鉴的不是某一条神奇 Prompt,而是把研究顺序改成“多视角提问—比较证据—再写结论”。实践者补现场,学者补证据,怀疑者补反例,经济学家补激励,历史学家补时间跨度。先用这五种视角找出盲区,再决定是否值得继续深挖,通常比从一份漂亮摘要开始更稳妥。




