S3-6 · S3 资料岛

准确性纪律:让它只用我给的材料

10 分钟主干(必看)准确性来源
学完你会:让 AI 不跑偏

防错误信息流入制度、政策、分析结论。

课前导读

准确性纪律:让它只用我给的材料

前面学会了喂材料,这一节要立规矩:怎么让 AI 只根据你给的材料回答,不自己瞎补。这对 HR 特别重要——一旦它在制度解读、政策分析里掺进编造的条款,是要出事的。这篇少数派约 10 分钟的文章先讲清 AI 为什么爱"编"(三大成因),再给出五类实用的降幻觉方法,比如设定边界、明确约束、要求标出处。技术部分可以略读,重点吃透"怎么约束它"那几招——这就是你以后每次让 AI 处理材料时的口令。

教学正文

先搞懂:"只用我给的材料"为什么是硬规则不是客气话

前面几节教你喂材料,这一节要立规矩:怎么让 AI 只根据你给的材料回答、不自己瞎补。把它想象成一个爱表现的助理——你问的东西材料里没有,他也不好意思说"不知道",宁可顺口编一个像样的答案。这个"补全"是天性,不是坏心,但在制度解读、政策分析里掺进编造条款,是要出事的。

机制上有两条根因。Google Cloud 把幻觉解释为"grounding(依据绑定)不足"导致模型生成不正确内容;OpenAI 则指出,很多评测奖励"猜"而不是奖励"承认不确定",导致模型不知道时也硬给答案。这两条正好说明:治幻觉要靠"绑材料 + 允许它说不知道"。

关键是把准确性纪律写成"硬规则",而不是"请你准确点"这种没有操作定义的客气话。有效规则包括:只用材料;逐条引用;无依据写"材料未提供";区分原文、解释、建议;输出不确定项;高风险事项人工复核。

还有一条法律红线:《个人信息保护法》要求利用个人信息做自动化决策要透明、公平公正,对个人权益有重大影响的决定,个人有权要求说明、有权拒绝仅由自动化决策作出。翻译成 HR 的话——即便 AI 引用了材料,员工关系、绩效、薪酬、解除、孕产工伤这类决定,也不能只由它作出。

跟我做:一次"材料内问答"测试,两问见真章

这个测试做完一次,你就知道那句防幻觉口令有多值钱。准备一份制度节选,比如《假期管理办法》。

  1. 上传制度节选,先下系统约束式口令。输入:「你是材料内问答助手。接下来所有回答只能用我上传的这份文件,文件没写的必须回答"材料未提供",每个结论必须引原文依据,不得用外部法律、常识、行业惯例或推测。」这句"防幻觉口令"值得存进常用语
  2. 先问一个材料里有答案的问题:「员工请年假需提前多久申请?」——它应该定位条款、摘原文、给答案。
  3. 再问一个材料里根本没写的问题:「员工怀孕期间是否可以调岗?」——这一问才是测试重点。孕产话题它最爱用"劳动法常识"填空,正好测
  4. 看它的反应:老实答"材料未提供,需 HR/法务确认"= 及格;开始补"根据相关法律法规,孕期女职工岗位调整需协商一致……"= 你亲眼见证了一次幻觉。
  5. 一旦它掺了外部知识,追一句抓包:「你刚才用了文件外知识,请改写,只保留材料能支持的内容,文件没写的写"材料未提供,需 HR/法务确认"。」它会开始"收回"——那段就是编的。
  6. 预期输出:材料内答案、原文依据、缺失信息、人工复核提示,四样齐全。

对照:好回答把"原文"和"解读"分开标

坏的输出长这样:问"员工怀孕期间能否调岗",它一看是孕产话题,顺手补一段"根据相关法律法规,孕期女职工岗位调整需协商一致……"——看着专业,其实是它用文件外知识填了空,而这半段很可能和你们公司制度、当地实践对不上。

好的输出长这样:把"原文依据"和"我的解读"分开标注,结尾主动写"需 HR/法务确认"。这个格式不会自动出现——要你在提问时写死:"每个结论后写'依据:原文条款/页码/句子';材料没写的写'材料未提供';输出中区分原文结论、HR 解释、需确认事项。"

把这段设成材料内问答的固定开场,你就有了一条稳定的安全带。深入一层的"答案忠实性评测"(抽 20 个制度问答做测试集,每换工具就测它引对条款没、编造没、承认缺失没)在本页底部展开——这才是把"少编"变成"可管理"的工程化一步。

准确性纪律的五个失败模式

只说"请准确回答":准确没有操作定义。改成"每个结论必须有原文依据"。

不允许 AI 说不知道:模型会填补空白。明确"材料未提供"是合格答案。

混入外部常识:劳动法常识可能与公司制度、地方实践不一致。材料内问答禁止外部知识。

不区分原文和建议:AI 会把解释写成制度口径。输出分"原文依据/解释/需复核"三列。

把材料内回答用于个人重大决定:引用制度也需事实核查和程序。录用、调薪、处分、解除设人工审批。

配套参考资料

学习指引

少数派 · 覆盖 S3-6 · 约10分钟阅读 · 幻觉三大成因+5类降幻觉方法(设定边界/明确约束)

sspai.com为什么AI这么能编?深度解析大模型的"幻觉"机制

限定来源、要求标出处、防止瞎补。

阅读文章

自测

1为什么"请只根据我提供的材料回答,没有的就说没有"这句口令能明显减少胡编?

因为幻觉有两条根因:grounding(依据绑定)不足,和评测奖励"猜"而非奖励"承认不确定"。这句口令一次治两条——"只用材料"把它的依据绑死在你给的文件上,"没有就说没有"明确告诉它"我不知道"是合格答案,它就不必靠编造来填空了。

2测试时为什么要专门问一个"材料里根本没写"的问题?

因为材料里有答案的问题测不出它守不守规矩——它照着答就行。真正的考验是问一个文件没写的(比如孕产调岗),看它是老实说"材料未提供",还是忍不住用劳动法常识填空。后者就是一次现场抓到的幻觉,也说明约束没生效、需要追问收回。

3即便 AI 引用了公司材料,为什么解除劳动合同这类决定仍不能只由它作出?

因为《个人信息保护法》规定,对个人权益有重大影响的决定,个人有权要求说明、有权拒绝仅由自动化决策作出。解除、处分、调薪、孕产工伤这类决定影响重大,必须有人工核查和程序。AI 能帮你准备判断、找依据,但不能替你做判断——这是法律红线,不是习惯问题。

小结

  • 幻觉是"补全"天性 + 评测奖励猜测的产物,治它靠"绑材料 + 允许说不知道"
  • 准确性要写成硬规则:"每条结论有原文依据""没有就写材料未提供",不是"请准确点"
  • 两问测试法:有答案的问一遍,没答案的问一遍,专抓它填空
  • 法律红线:解除/处分/调薪/孕产等重大决定不能只由 AI 作出,人工复核

实操落点

  1. 下次让 AI 解读一份制度或政策文件时,在提问前加一句固定口令:"请只依据我上传的这份文件回答,凡是文件里没有明确写的,请直接说'文件中未提及',不要自行推测;每条结论请标出它在文件的哪一部分。"然后故意问一个文件里其实没写的问题,看它是老实说"未提及",还是给你编一条。试过一次你就知道这句口令有多值钱——它是你把 AI 用在正经材料上的安全带。
深入一层 · 实战演练与研究依据

Worked example:一次"材料内问答"测试,两问见真章

场景:你上传一份《假期管理办法》节选,想验证 AI 到底能不能"只用你给的材料"回答。

先下系统约束式口令:「你是材料内问答助手。接下来所有回答只能用我上传的这份文件,文件没写的必须回答"材料未提供",每个结论必须引原文依据,不得用外部法律、常识、行业惯例或推测。」

然后连问两个问题。第一个材料里有答案:「员工请年假需提前多久申请?」——它应该定位到条款、摘原文、给答案。第二个材料里根本没写:「员工怀孕期间是否可以调岗?」——这一问才是测试的重点。

好的输出长什么样:第二问它答"材料未提供,需 HR/法务确认",不往里掺任何劳动法常识。坏的输出长什么样:它一看是孕产话题,顺手补一段"根据相关法律法规,孕期女职工岗位调整需协商一致……"——**看着专业、其实是它用文件外知识填了空,而这半段很可能和你们公司制度、当地实践对不上。**

抓包动作:一旦它掺了外部知识,追一句「你刚才用了文件外知识,请改写,只保留材料能支持的内容,文件没写的写"材料未提供,需 HR/法务确认"」。它会开始"收回"刚才那段——那段就是编的。

两个翻车点:① 只写"请准确回答"没用,"准确"没有操作定义,要改成"每个结论必须有原文依据";② 不允许它说不知道,它就会填空,必须明确告诉它"材料未提供"是合格答案。

为什么绑材料能治幻觉,以及一条法律红线

Google Cloud 把 AI 幻觉解释为模型生成不正确或误导性内容,成因之一正是 grounding(依据绑定)不足;OpenAI 的文章指出,部分评测会奖励"猜"而不是奖励"承认不确定",导致模型不知道时也硬给答案——这两条正好解释了为什么 HR 制度问答必须绑材料依据、必须允许它说"不知道"。

更硬的一条在法律层面:《中华人民共和国个人信息保护法》要求利用个人信息进行自动化决策要保证透明度和结果公平公正;通过自动化决策作出对个人权益有重大影响的决定时,个人有权要求说明并有权拒绝仅由自动化决策作出。**翻译成 HR 的话:即便 AI 引用了材料,员工关系、绩效、薪酬、解除劳动合同、孕产工伤这类决定,也不能只由它作出——它能帮你准备判断,不能替你做判断。**

可复制口令 + 再深一层

把这段设成材料内问答的固定开场:「你是严格的 HR 材料内问答助手,只用我提供的材料回答。每个结论后写"依据:{原文条款/页码/句子}";材料没写的回答"材料未提供";涉及员工重大权益必须提示"需 HR/法务/业务人工确认";输出中区分原文结论、HR 解释、需确认事项。请先判断材料是否足以回答,再给答案。」

再深一层是"答案忠实性评测":抽 20 个制度问答做测试集,每题都有标准依据;每次换工具或换提示词,就测它是否引对条款、是否编造、是否承认缺失。真要搭知识库机器人,还得加引用回链、答案置信度、人工反馈和版本停用机制——这才是把"少编"变成"可管理"的工程化一步。

参考来源
  • Google Cloud《What are AI hallucinations?》,2025
  • OpenAI《Why language models hallucinate》,2025
  • 全国人大常委会《中华人民共和国个人信息保护法》,2021