多视角研究能让材料更丰富,也会带来一种新的错觉:五个角色都说得很像样,于是结论看起来比单次回答更可信。实际上,五种视角可能共享同一批来源,模型也可能把推测写成事实。同行评审步骤的目标不是让 Claude 给自己盖章,而是把最弱的主张、最需要补的资料和可能缺失的视角暴露出来。它适合做发布前的初筛,不能代替专业审稿或高风险决策审批。
先定义评分口径
没有评分口径时,模型很容易把每条结论都打成 7 到 9 分。可以先约束分数的含义:
| 分数 | 当前材料的含义 | 建议动作 |
|---|---|---|
| 1–2 | 主要依赖推测、类比或单一弱来源 | 不进入结论,重新研究 |
| 3–4 | 有线索,但缺少关键验证 | 列入高优先级核验 |
| 5–6 | 有一定支持,但边界或反例明显 | 只做有条件的判断 |
| 7–8 | 多个质量较好的来源相互支持 | 形成阶段性结论,并保留边界 |
| 9 | 证据直接、独立且范围清楚 | 仍检查时效和适用范围 |
| 10 | 几乎没有关键缺口 | 默认禁用,除非证据极强且可复核 |
分数表示“当前材料的可靠性”,不是概率,也不是模型的自信程度。视角数量不能当作证据数量。
Prompt:同行评审
把研究简报完整粘贴到“待评审简报”位置,最好同时附上关键来源。若只给结论不给证据,评审只能检查表达,不能检查事实。
读懂一份合格评审
一份有用的评审不只是给分,而是把分数变成行动:
- 低分但影响小:记录缺口即可,不必阻塞整个项目。
- 低分且影响大:先核验,再发布或决策。
- 高分但来源相同:降低独立性判断,补充不同来源。
- 发现明显偏置:修改研究输入,而不是在结尾加一句“保持客观”。
要求模型先写扣分理由再给分,可以减少礼貌评分:
五分钟轻量工作流
在资料已经准备好的情况下,可以把四个阶段压缩成一轮短研究:
- 多视角扫描:让五个角色独立提出主张和证据。
- 矛盾地图:把冲突分成事实、因果、价值和范围问题。
- 研究简报:按可靠性排序,写出角色动作和停止条件。
- 同行评审:优先核验“低分且影响大”的主张。
这里的“五分钟”只表示 Prompt 执行和初步整理的时间,不表示完成了完整尽调。医疗、法律、投资、招聘、财务、公共安全和生产上线等场景,需要真实资料、专业人员和人工审批。
常见的四种假评审
所有结论都得 8 分
通常是评分口径过松。加入扣分理由、来源独立性和分数上限。
批评很长,却没有核验动作
要求评审把“事实缺口、表达问题、下一步来源”分成三列。长篇批评不等于证据。
把五个角色当成五份独立研究
检查它们是否引用同一批文章、同一组统计和同一条新闻。共享来源时,视角增加的是问题覆盖,不是证据数量。
发现偏见,却不调整结论
评审必须说明偏见会把决策推向哪里,并给出一个修正动作,例如补一组反方访谈、查原始数据或缩小试点范围。
发布前人工检查
在把简报交给老板、客户或团队前,再检查:
- 关键数字是否能追溯到原始来源。
- 引用是否真的支持相邻那句话。
- 是否把相关性写成了“导致”或“证明”。
- 结论是否超出样本、时间和行业边界。
- 是否存在一条反例足以改变建议。
- 输入材料是否包含不应进入模型的个人信息、客户资料或商业秘密。
结语
同行评审 Prompt 的价值,是让“哪里最不可靠”比“文章写得是否流畅”更早被看见。它不能创造缺失的证据,却能帮助你把时间花在真正影响结论的核验上。把评分当作复核排序工具,而不是权威印章,才是这一步的正确用法。




