课前导读

前面学会了喂材料,这一节要立规矩:怎么让 AI 只根据你给的材料回答,不自己瞎补。这对 HR 特别重要——一旦它在制度解读、政策分析里掺进编造的条款,是要出事的。这篇少数派约 10 分钟的文章先讲清 AI 为什么爱"编"(三大成因),再给出五类实用的降幻觉方法,比如设定边界、明确约束、要求标出处。技术部分可以略读,重点吃透"怎么约束它"那几招——这就是你以后每次让 AI 处理材料时的口令。
教学正文
先搞懂:"只用我给的材料"为什么是硬规则不是客气话
前面几节教你喂材料,这一节要立规矩:怎么让 AI 只根据你给的材料回答、不自己瞎补。把它想象成一个爱表现的助理——你问的东西材料里没有,他也不好意思说"不知道",宁可顺口编一个像样的答案。这个"补全"是天性,不是坏心,但在制度解读、政策分析里掺进编造条款,是要出事的。
机制上有两条根因。Google Cloud 把幻觉解释为"grounding(依据绑定)不足"导致模型生成不正确内容;OpenAI 则指出,很多评测奖励"猜"而不是奖励"承认不确定",导致模型不知道时也硬给答案。这两条正好说明:治幻觉要靠"绑材料 + 允许它说不知道"。
关键是把准确性纪律写成"硬规则",而不是"请你准确点"这种没有操作定义的客气话。有效规则包括:只用材料;逐条引用;无依据写"材料未提供";区分原文、解释、建议;输出不确定项;高风险事项人工复核。
还有一条法律红线:《个人信息保护法》要求利用个人信息做自动化决策要透明、公平公正,对个人权益有重大影响的决定,个人有权要求说明、有权拒绝仅由自动化决策作出。翻译成 HR 的话——即便 AI 引用了材料,员工关系、绩效、薪酬、解除、孕产工伤这类决定,也不能只由它作出。
跟我做:一次"材料内问答"测试,两问见真章
这个测试做完一次,你就知道那句防幻觉口令有多值钱。准备一份制度节选,比如《假期管理办法》。
- 上传制度节选,先下系统约束式口令。输入:「你是材料内问答助手。接下来所有回答只能用我上传的这份文件,文件没写的必须回答"材料未提供",每个结论必须引原文依据,不得用外部法律、常识、行业惯例或推测。」这句"防幻觉口令"值得存进常用语
- 先问一个材料里有答案的问题:「员工请年假需提前多久申请?」——它应该定位条款、摘原文、给答案。
- 再问一个材料里根本没写的问题:「员工怀孕期间是否可以调岗?」——这一问才是测试重点。孕产话题它最爱用"劳动法常识"填空,正好测
- 看它的反应:老实答"材料未提供,需 HR/法务确认"= 及格;开始补"根据相关法律法规,孕期女职工岗位调整需协商一致……"= 你亲眼见证了一次幻觉。
- 一旦它掺了外部知识,追一句抓包:「你刚才用了文件外知识,请改写,只保留材料能支持的内容,文件没写的写"材料未提供,需 HR/法务确认"。」它会开始"收回"——那段就是编的。
- 预期输出:材料内答案、原文依据、缺失信息、人工复核提示,四样齐全。
对照:好回答把"原文"和"解读"分开标
坏的输出长这样:问"员工怀孕期间能否调岗",它一看是孕产话题,顺手补一段"根据相关法律法规,孕期女职工岗位调整需协商一致……"——看着专业,其实是它用文件外知识填了空,而这半段很可能和你们公司制度、当地实践对不上。
好的输出长这样:把"原文依据"和"我的解读"分开标注,结尾主动写"需 HR/法务确认"。这个格式不会自动出现——要你在提问时写死:"每个结论后写'依据:原文条款/页码/句子';材料没写的写'材料未提供';输出中区分原文结论、HR 解释、需确认事项。"
把这段设成材料内问答的固定开场,你就有了一条稳定的安全带。深入一层的"答案忠实性评测"(抽 20 个制度问答做测试集,每换工具就测它引对条款没、编造没、承认缺失没)在本页底部展开——这才是把"少编"变成"可管理"的工程化一步。
只说"请准确回答":准确没有操作定义。改成"每个结论必须有原文依据"。
不允许 AI 说不知道:模型会填补空白。明确"材料未提供"是合格答案。
混入外部常识:劳动法常识可能与公司制度、地方实践不一致。材料内问答禁止外部知识。
不区分原文和建议:AI 会把解释写成制度口径。输出分"原文依据/解释/需复核"三列。
把材料内回答用于个人重大决定:引用制度也需事实核查和程序。录用、调薪、处分、解除设人工审批。
配套参考资料
少数派 · 覆盖 S3-6 · 约10分钟阅读 · 幻觉三大成因+5类降幻觉方法(设定边界/明确约束)
限定来源、要求标出处、防止瞎补。
自测
1为什么"请只根据我提供的材料回答,没有的就说没有"这句口令能明显减少胡编?
因为幻觉有两条根因:grounding(依据绑定)不足,和评测奖励"猜"而非奖励"承认不确定"。这句口令一次治两条——"只用材料"把它的依据绑死在你给的文件上,"没有就说没有"明确告诉它"我不知道"是合格答案,它就不必靠编造来填空了。
2测试时为什么要专门问一个"材料里根本没写"的问题?
因为材料里有答案的问题测不出它守不守规矩——它照着答就行。真正的考验是问一个文件没写的(比如孕产调岗),看它是老实说"材料未提供",还是忍不住用劳动法常识填空。后者就是一次现场抓到的幻觉,也说明约束没生效、需要追问收回。
3即便 AI 引用了公司材料,为什么解除劳动合同这类决定仍不能只由它作出?
因为《个人信息保护法》规定,对个人权益有重大影响的决定,个人有权要求说明、有权拒绝仅由自动化决策作出。解除、处分、调薪、孕产工伤这类决定影响重大,必须有人工核查和程序。AI 能帮你准备判断、找依据,但不能替你做判断——这是法律红线,不是习惯问题。
小结
- 幻觉是"补全"天性 + 评测奖励猜测的产物,治它靠"绑材料 + 允许说不知道"
- 准确性要写成硬规则:"每条结论有原文依据""没有就写材料未提供",不是"请准确点"
- 两问测试法:有答案的问一遍,没答案的问一遍,专抓它填空
- 法律红线:解除/处分/调薪/孕产等重大决定不能只由 AI 作出,人工复核
实操落点
- 下次让 AI 解读一份制度或政策文件时,在提问前加一句固定口令:"请只依据我上传的这份文件回答,凡是文件里没有明确写的,请直接说'文件中未提及',不要自行推测;每条结论请标出它在文件的哪一部分。"然后故意问一个文件里其实没写的问题,看它是老实说"未提及",还是给你编一条。试过一次你就知道这句口令有多值钱——它是你把 AI 用在正经材料上的安全带。
深入一层 · 实战演练与研究依据
Worked example:一次"材料内问答"测试,两问见真章
场景:你上传一份《假期管理办法》节选,想验证 AI 到底能不能"只用你给的材料"回答。
先下系统约束式口令:「你是材料内问答助手。接下来所有回答只能用我上传的这份文件,文件没写的必须回答"材料未提供",每个结论必须引原文依据,不得用外部法律、常识、行业惯例或推测。」
然后连问两个问题。第一个材料里有答案:「员工请年假需提前多久申请?」——它应该定位到条款、摘原文、给答案。第二个材料里根本没写:「员工怀孕期间是否可以调岗?」——这一问才是测试的重点。
好的输出长什么样:第二问它答"材料未提供,需 HR/法务确认",不往里掺任何劳动法常识。坏的输出长什么样:它一看是孕产话题,顺手补一段"根据相关法律法规,孕期女职工岗位调整需协商一致……"——**看着专业、其实是它用文件外知识填了空,而这半段很可能和你们公司制度、当地实践对不上。**
抓包动作:一旦它掺了外部知识,追一句「你刚才用了文件外知识,请改写,只保留材料能支持的内容,文件没写的写"材料未提供,需 HR/法务确认"」。它会开始"收回"刚才那段——那段就是编的。
两个翻车点:① 只写"请准确回答"没用,"准确"没有操作定义,要改成"每个结论必须有原文依据";② 不允许它说不知道,它就会填空,必须明确告诉它"材料未提供"是合格答案。
为什么绑材料能治幻觉,以及一条法律红线
Google Cloud 把 AI 幻觉解释为模型生成不正确或误导性内容,成因之一正是 grounding(依据绑定)不足;OpenAI 的文章指出,部分评测会奖励"猜"而不是奖励"承认不确定",导致模型不知道时也硬给答案——这两条正好解释了为什么 HR 制度问答必须绑材料依据、必须允许它说"不知道"。
更硬的一条在法律层面:《中华人民共和国个人信息保护法》要求利用个人信息进行自动化决策要保证透明度和结果公平公正;通过自动化决策作出对个人权益有重大影响的决定时,个人有权要求说明并有权拒绝仅由自动化决策作出。**翻译成 HR 的话:即便 AI 引用了材料,员工关系、绩效、薪酬、解除劳动合同、孕产工伤这类决定,也不能只由它作出——它能帮你准备判断,不能替你做判断。**
可复制口令 + 再深一层
把这段设成材料内问答的固定开场:「你是严格的 HR 材料内问答助手,只用我提供的材料回答。每个结论后写"依据:{原文条款/页码/句子}";材料没写的回答"材料未提供";涉及员工重大权益必须提示"需 HR/法务/业务人工确认";输出中区分原文结论、HR 解释、需确认事项。请先判断材料是否足以回答,再给答案。」
再深一层是"答案忠实性评测":抽 20 个制度问答做测试集,每题都有标准依据;每次换工具或换提示词,就测它是否引对条款、是否编造、是否承认缺失。真要搭知识库机器人,还得加引用回链、答案置信度、人工反馈和版本停用机制——这才是把"少编"变成"可管理"的工程化一步。
- Google Cloud《What are AI hallucinations?》,2025
- OpenAI《Why language models hallucinate》,2025
- 全国人大常委会《中华人民共和国个人信息保护法》,2021