S1-4 · S1 大模型岛

为什么 AI 会一本正经地胡说

5 分钟主干(必看)幻觉核查
学完你会:AI 的话不能照单全收

制度、数字、法规输出必须人工复核。

课前导读

为什么 AI 会一本正经地胡说

AI 说得再流畅、再自信,也可能是在胡说。它胡说的时候语气和说真话一样,所以 HR 必须养成核实习惯。

教学正文

先搞懂:AI 为什么会编,而且编得那么像

把 AI 想象成一个接话茬的高手:你说上半句,它接下半句——接的标准不是"什么是真的",而是"什么词接在这里最像人会写的"。它读过海量人事政策、法律文书,所以接出来的话术语标准、结构工整,像极了真的。

这就是"幻觉"的机制:它不是在撒谎(撒谎需要知道真相),它是在补全。训练数据里没有你们公司的制度、没有最新的法规修订,它就用"最常见的写法"把缺口填上——填得越顺,你越难察觉。

还有一层:很多 AI 的训练方式奖励"给出答案",而不是奖励"承认不知道"。所以它宁可猜,也很少主动说"我不确定"。除非——你明确允许它这么说。这个"允许"就是本节课要教你的核心动作。

HR 最容易中招的四个场景

① 法律条文:它会写出"根据《劳动合同法》第X条第X款",格式完美——但条款可能不存在,或内容被简化到失真。真编号配假内容,比全编更危险。

② 公司制度:你没上传制度原文,它就按"大多数公司怎么写"补一份。答案合理,但不是你们公司的。

③ 候选人判断:从简历关键词推断"此人抗压能力强"——那是星座分析,不是评估。它没见过这个人。

④ 来源链接:它能生成看起来完全合法的报告名和 URL,点开却是 404。凡是重要数据的来源,必须亲手点一次。

跟我做:10 分钟防幻觉实验(用 Kimi)

这个实验做完一次,你对 AI 的信任边界就校准了。准备一份不含员工个人信息的制度片段(比如考勤管理办法)。

  1. 打开 Kimi(kimi.com),新建对话,上传这份制度文件。其他能传文件的 AI(豆包/通义)同样适用
  2. 先立规矩,输入:「你只能基于我上传的文件回答。每个答案必须引用原文依据。文件没有写的内容,回答『材料未提供』,不得补充常识。」这句就是防幻觉口令,值得存进你的常用语
  3. 问一个文件里有答案的问题,比如「迟到多久算旷工?」——它应该引原文回答。
  4. 再问一个文件里没有的问题,比如「员工怀孕期间能不能调岗?」——这一问才是实验的重点。孕产话题它最爱用"常识"填空,正好测试
  5. 看它的反应:老实说「材料未提供」= 及格;开始背劳动法常识 = 你亲眼见证了一次幻觉。
  6. 最后让它把刚才的问题分成「有依据 / 无依据」两栏输出——这个输出格式以后可以直接用在正式工作里。

对照:好回答 vs 坏回答长什么样

问「员工拒绝调岗能否解除合同」,坏回答是一段法言法语齐全的引用:「根据《劳动合同法实施条例》第二十六条,员工无正当理由拒绝调岗的,视为严重违反规章制度……」——后半句是编的,但你看不出来。

好回答长这样:把「法条原文」和「我的解读」分开标注,结尾主动写「具体适用建议咨询法务」。这个格式不会自动出现——要你在提问时要求:「回答时把法条原文和你的解读分开标注,不确定的明确说不确定。」

完整的抓包过程(三步 30 秒识破一次编造)在本页底部「深入一层」里,学完这节强烈建议看。

两个最阴的坑

多轮对话会"忘规矩":聊得越长,它越可能丢掉你开头立的约束。关键任务每一轮都把「只用材料、无依据就说无依据」重复一遍。

越精确的数字越可疑:「行业平均离职率 18.7%」比「离职率偏高」更像幻觉——精确感是它模仿出来的,不是算出来的。

配套视频演示

学习指引

央视新闻 · 覆盖 S1-4 · AI幻觉科普(权威来源)

为何AI总会一本正经地胡说八道?

自测

1AI 编造内容时,语气和说真话时有区别吗?为什么?

没有区别。它的机制是预测"最像人写的下一个词",编造和真话走的是同一条生成路径,所以流畅度和笃定感完全一样——这正是不能用"听起来可信"来判断的原因。

2看到「根据《劳动合同法》第X条」这类回答,你的第一个动作是什么?

把法条编号丢进官方渠道查原文对照——注意不只查"编号存不存在",还要核对"内容对不对",因为真编号配假内容是最危险的编造形式。

3什么情况下「材料未提供」是你最想看到的答案?

当你用制度/合同等材料问它问题时。它承认材料里没有,说明约束生效了;它顺畅地给出答案反而要警惕——那可能是用"常见写法"补的,不是你们公司的规定。

小结

  • 幻觉不是撒谎,是"预测下一个词"机制的天然产物——流畅度与真实度无关
  • 法条、制度、候选人判断、来源链接是 HR 的四大高危场景
  • 防幻觉三件套:给材料、立口令(只用材料+允许说不知道)、要出处
  • 重要输出永远人工复核——AI 帮你准备判断,不替你做判断

实操落点

  1. 输入:请引用德鲁克在《管理的实践》中关于目标管理的原话,并注明页码。
  2. 再加一句:如果你不确定具体原文或页码,请明确说明。对比两次回答。
深入一层 · 实战演练与研究依据

样品:一次编造法条的实测(含抓包全过程)

你现在就能复现。问:「员工拒绝调岗,公司可以直接解除劳动合同吗?请引用具体法条。」

一个真实典型的坏回答会说:「根据《劳动合同法》第四十条第三款,劳动合同订立时所依据的客观情况发生重大变化……用人单位可以解除。另据《劳动合同法实施条例》第二十六条,员工无正当理由拒绝调岗的,视为严重违反规章制度……」看起来无懈可击,法条编号、条款结构、法言法语全齐。

问题:第一段确有其条,但适用条件被简化到失真(「客观情况重大变化」有严格前提,普通调岗够不上);第二段「视为严重违反规章制度」这半句是编的,实施条例里没这个表述。HR 拿这段去操作解除,大概率吃违法解除的仲裁。

幻觉不是坏心眼,是机制

Google Cloud 把幻觉定义为模型生成不正确或误导性信息,原因包括训练数据不足、偏差、错误假设和缺少 grounding,模型可能生成不存在的链接、错误事实或貌似合理的虚构内容。OpenAI 进一步指出,部分评测机制其实在奖励「猜答案」,而不是奖励模型承认不确定——不确定时猜一个反而更容易得分。

所以「开启深度思考就不会幻觉」是错的:深度推理可能让答案更完整,也可能把一个错误前提推得更像真的。中国信通院 2025 年启动的「可信 AI」大模型幻觉评测把幻觉分成事实性幻觉和忠实性幻觉,还建了中文样本集——说明这已经是国内应用的正式议题,不是个别现象。

抓包动作三步,30 秒现形

一,追问:「请逐条说明这些法条的原文是什么?哪些是你的推断?」编造的部分往往这一步就开始「修正」自己。二,把它给的法条编号丢进官方渠道搜原文对照。三,换个问法再问一遍,两次答案对不上的地方就是重灾区。

两个更隐蔽的坑:只核对法条编号存不存在、不核对内容对不对——AI 常引真编号配假内容,这比全编更危险;以及直接拿 AI 的回答去答复员工——法律相关输出永远只当研究起点,不当答复依据。

再深一层:把「材料未提供」训练成最爱看的答案

可直接抄的防幻觉 prompt:「你只能基于我上传的文件回答,每个结论后标注『依据:原文第几条』。文件没写的内容一律回答『材料未提供,建议咨询 HR/法务』,不得引用外部法律、常识或你的推测。」

更深一层是 RAG 加引用校验:先检索相关片段再让模型基于片段回答,引用校验则检查答案是否真被片段支持。别忘了 AI 在多轮长对话里会忘约束,每轮关键任务重复一遍「只用材料、无依据就说无依据」。

参考来源
  • Google Cloud《What are AI hallucinations?》,2025
  • OpenAI《Why language models hallucinate》,2025
  • 中国信通院《可信 AI 大模型幻觉评测》相关报道,2025