返回博客

让 Claude 给研究简报做同行评审

人工智能7478
让 Claude 给研究简报做同行评审

多视角研究能让材料更丰富,也会带来一种新的错觉:五个角色都说得很像样,于是结论看起来比单次回答更可信。实际上,五种视角可能共享同一批来源,模型也可能把推测写成事实。同行评审步骤的目标不是让 Claude 给自己盖章,而是把最弱的主张、最需要补的资料和可能缺失的视角暴露出来。它适合做发布前的初筛,不能代替专业审稿或高风险决策审批。

先定义评分口径

没有评分口径时,模型很容易把每条结论都打成 7 到 9 分。可以先约束分数的含义:

分数当前材料的含义建议动作
1–2主要依赖推测、类比或单一弱来源不进入结论,重新研究
3–4有线索,但缺少关键验证列入高优先级核验
5–6有一定支持,但边界或反例明显只做有条件的判断
7–8多个质量较好的来源相互支持形成阶段性结论,并保留边界
9证据直接、独立且范围清楚仍检查时效和适用范围
10几乎没有关键缺口默认禁用,除非证据极强且可复核

分数表示“当前材料的可靠性”,不是概率,也不是模型的自信程度。视角数量不能当作证据数量。

Prompt:同行评审

把研究简报完整粘贴到“待评审简报”位置,最好同时附上关键来源。若只给结论不给证据,评审只能检查表达,不能检查事实。

text
请对下面的研究简报做一次严格的同行评审。

待评审简报:
[粘贴研究简报]

请完成以下任务:

1. 对 5 条关键发现逐条按 1–10 分评分,并解释加分项与扣分项。
2. 区分直接证据、间接证据、案例、历史类比和推测。
3. 找出最弱的一条主张,并列出核实它所需的具体资料、来源类型和判断标准。
4. 检查是否有某一种视角被过度代表,说明它会把结论推向哪里。
5. 指出一个应加入的第六视角,并说明它可能改变哪条结论。
6. 检查是否把相关性写成因果,把可能写成必然,把建议写成事实。
7. 给出总评:当前简报适合入门、内部讨论、公开发布还是高风险决策?说明理由。

请使用以下格式:

## 逐条评分
| 发现 | 分数 | 直接证据 | 主要缺口 | 扣分理由 | 下一步核验 |
## 最弱环节
## 视角偏置
## 缺失的第六视角
## 总评与必须修改项

不能确认的内容标记为“当前资料不足”。不要用“模型认为”“多数视角同意”作为证据。

读懂一份合格评审

一份有用的评审不只是给分,而是把分数变成行动:

要求模型先写扣分理由再给分,可以减少礼貌评分:

text
每个分数必须至少对应一个具体扣分理由。没有扣分理由的评分无效。若关键证据来自单一来源,最高不得超过 6 分;若存在未解决的强反例,最高不得超过 8 分。

五分钟轻量工作流

在资料已经准备好的情况下,可以把四个阶段压缩成一轮短研究:

  1. 多视角扫描:让五个角色独立提出主张和证据。
  2. 矛盾地图:把冲突分成事实、因果、价值和范围问题。
  3. 研究简报:按可靠性排序,写出角色动作和停止条件。
  4. 同行评审:优先核验“低分且影响大”的主张。

这里的“五分钟”只表示 Prompt 执行和初步整理的时间,不表示完成了完整尽调。医疗、法律、投资、招聘、财务、公共安全和生产上线等场景,需要真实资料、专业人员和人工审批。

常见的四种假评审

所有结论都得 8 分

通常是评分口径过松。加入扣分理由、来源独立性和分数上限。

批评很长,却没有核验动作

要求评审把“事实缺口、表达问题、下一步来源”分成三列。长篇批评不等于证据。

把五个角色当成五份独立研究

检查它们是否引用同一批文章、同一组统计和同一条新闻。共享来源时,视角增加的是问题覆盖,不是证据数量。

发现偏见,却不调整结论

评审必须说明偏见会把决策推向哪里,并给出一个修正动作,例如补一组反方访谈、查原始数据或缩小试点范围。

发布前人工检查

在把简报交给老板、客户或团队前,再检查:

  1. 关键数字是否能追溯到原始来源。
  2. 引用是否真的支持相邻那句话。
  3. 是否把相关性写成了“导致”或“证明”。
  4. 结论是否超出样本、时间和行业边界。
  5. 是否存在一条反例足以改变建议。
  6. 输入材料是否包含不应进入模型的个人信息、客户资料或商业秘密。

结语

同行评审 Prompt 的价值,是让“哪里最不可靠”比“文章写得是否流畅”更早被看见。它不能创造缺失的证据,却能帮助你把时间花在真正影响结论的核验上。把评分当作复核排序工具,而不是权威印章,才是这一步的正确用法。

标签:研究方法事实核验Prompt工程

推荐阅读

探索更多前沿洞察与行业干货。