S2-6 · S2 提示词岛

对付 AI 的两个坏毛病:幻觉与偷懒

14 分钟主干(必看)幻觉验收
学完你会:AI 会出错也会偷懒,要会治

防止错误和半成品流入工作。

课前导读

对付 AI 的两个坏毛病:幻觉与偷懒

AI 不仅会幻觉,还会偷懒。正式工作中要用提示词主动要求来源、完整性和自查。

教学正文

幻觉和偷懒是两种病,得分开治

AI 有两个让人头疼的毛病,像两种不同的病,药也不同。"幻觉"是它一本正经地编——编法条、编制度、编来源,语气跟说真话一样。"偷懒"是你感觉它敷衍了——回答变短、套话变多、忽略你的要求、分析变浅。注意"偷懒"不是它真有情绪,而是任务太大、约束打架、上下文太长或目标不清时,你感受到的那种"缩水"。

两种病根子不同。幻觉来自"它优化的是像不像、不是真不真",缺依据时就用最常见的写法填空。偷懒来自任务超载或指令太松,它就挑最省力的路走。根子不同,所以不能用同一句"你认真点"糊弄过去——那既治不了编造,也治不了敷衍。

两种病,两套可验收的药方

治幻觉:给资料、限来源、要引用、允许它说"不知道"。核心是把它从"凭记忆答"逼回"凭材料答"。

治偷懒:拆任务、定格式、规定最低条数和质量标准、让它先列计划再执行。核心是把"详细一点"这种没法验收的话,换成"每个结论必须有依据、至少列 5 条风险、每条含原因和避免方法"这种能一条条数的硬指标。记住铁律:别用情绪化指令("认真点""别偷懒"),要用可验收指令。AI 不理解情绪,但能执行"至少 5 条、每条带依据"。

跟我做:给高风险任务加一道'双重防线'

目标是让一个 HR 回答既不编、也不敷衍。拿"根据员工手册回答请假问题"练。用 DeepSeek 或 Kimi,约 15 分钟。

  1. 打开 DeepSeek 或 Kimi,上传员工手册(脱敏),新建任务。
  2. 第一层防幻觉:「只基于我提供的材料回答。材料没写的,回答"材料未提供"。」
  3. 第二层防偷懒:「回答必须含四块:直接答案、原文依据、风险提醒、需人工确认的问题;每块不少于 2 条,不许只写一句概括。」"每块不少于 2 条"就是把"详细点"变成可数指标
  4. 拿到输出后让它自查:「自检:有没有无依据的推断?有没有漏掉我的格式要求?用表格列出来。」让它自己揪问题,比你逐字对着挑高效
  5. 若有问题:「在不引入任何新事实的前提下修订。」——这句挡住它"边改边编"。
  6. 预期看到:一份带原文依据、结构完整、且经过自查的回答。

'认真点' vs '每条带依据、至少 5 条'

没用:嫌它答得浅,回一句"你认真分析一下"。它可能只是把废话扩写一遍,看着长了,依据还是没有。

有用:「重新回答:每个结论后面标"依据:手册第 X 条",风险至少列 5 条,每条写清原因和避免方法,没依据的地方写"材料未提供"。」——你把"认真"翻译成了能一条条验收的硬指标,它想敷衍都没处躲。AI 不吃"态度"这一套,只吃"可验收标准"。

想学把"生成"和"验证"彻底分成两轮(一轮写、一轮专门当审稿人查),看本页底部"深入一层"。

治这两个毛病的五个错法

只写"不要胡说":不是可执行规则。改成"无依据就说材料未提供"。

只写"详细一点":它可能只扩写废话。规定字段、条数、原因、例子。

一次塞超长复杂任务:容易跳步敷衍。拆成摘要、分类、生成、审查四步。

不让它暴露不确定:它倾向硬给完整答案。要求列"确定 / 不确定 / 需人工确认"。

长对话不重申规则:前面的安全约束会淡化。关键轮次重复边界条件。

自测

1AI 的'幻觉'和'偷懒'为什么要分开治?

因为病根不同。幻觉是它缺依据时用最常见写法编造(优化的是像不像,不是真不真),治法是给材料、限来源、要引用、允许说不知道。偷懒是任务超载或指令太松时它走省力路径,治法是拆任务、定格式、规定最低条数。用同一句"认真点"两个都治不了。

2为什么说'认真点''别偷懒'这类指令没用?

因为 AI 不理解情绪,这类话没有可执行的落点,它可能只是把废话扩写一遍。有用的是可验收指令——"每个结论标依据、风险至少 5 条、每条含原因和避免方法"。把模糊的"认真"翻译成能一条条数的硬指标,它才无处敷衍。

3'双重防线'里的两层分别防什么?

第一层防幻觉——"只基于材料回答、没写的说材料未提供",把它从凭记忆答逼回凭材料答。第二层防偷懒——规定输出必须含直接答案、原文依据、风险提醒、待确认问题四块且每块不少于 2 条,用可数结构堵住敷衍。再加一步自查,让它自己揪出无依据推断和格式遗漏。

小结

  • 幻觉(编造)和偷懒(敷衍)是两种病,病根不同、药方不同,别混着治
  • 治幻觉:给材料、限来源、要引用、允许说不知道
  • 治偷懒:拆任务、定格式、规定最低条数——用可验收指令,不用"认真点"
  • 高风险输出加"双重防线 + 自查":一层防编、一层防糊、最后让它自己揪问题

实操落点

  1. 让 AI 列举 3 条关于试用期的劳动法条款,再加上“请标注具体法律出处,如果不确定请说明”对比结果。
  2. 让 AI 写一份至少 20 章的员工手册目录,如果它省略,就要求完整补充。
深入一层 · 实战演练与研究依据

样品:给一个 HR 任务架两道防线

幻觉和偷懒是两个毛病,得分开治。拿「根据员工手册回答员工请假问题」举例。

第一层防幻觉:「只基于我提供的材料回答,材料没写的内容回答『材料未提供』。」第二层防偷懒:「回答必须包含直接答案、依据原文、风险提醒、需人工确认的问题,每部分不少于 2 条,不能只写概括句。」

输出后再补一刀:「请自查——有没有无依据推断?有没有遗漏我的格式要求?用表格列出。」发现问题就说「在不引入新事实的前提下修订」。把这张自查表当成每个高风险 HR 输出的最后一步。

两个毛病,两套机制

幻觉的机制前面讲过:OpenAI 指出部分评测在奖励「猜」而非承认不确定,Google Cloud 归因于数据质量、信息缺失、偏差和缺乏 grounding,模型会生成错误事实、误导信息或不存在的来源。

「偷懒」不是模型真有态度,是你感受到输出变短、套话变多、忽略约束、分析不足——常来自任务过大、约束冲突、上下文过长、目标不清,或工具端策略变化。2026 年有中文报道记录了用户对部分 AI 工具「变懒」的反馈(套话增多、分析变少、忘记前文要求),但那属于用户体验报道,不等于严格的技术评测。

别用情绪词,用可验收指令

治幻觉:给资料、限来源、要引用、允许说不知道。治偷懒:拆任务、定格式、要求逐步展开、规定最低条数和质量标准、让它先列计划再执行。

五个高频错法:只写「不要胡说」(改成「无依据就说材料未提供」);只写「详细一点」(改成规定字段、条数、原因、例子);让 AI 一次处理超长复杂任务(拆成摘要、分类、生成、审查四步);不让它暴露不确定性(要求列「确定/不确定/需人工确认」);长对话不重申规则(关键轮次重复边界)。别写「认真点」,写「每个结论必须有依据,至少列 5 条风险,每条含原因和避免方法」。

再深一层:把生成和验证拆成两条提示词

先让 AI 生成初稿,再用另一轮提示词当审稿人,专门查事实依据、合规风险、遗漏项和格式。生成型和验证型分开,比让同一轮又写又审靠谱。

学有余力可学 LLM eval 的基本思路:把「好答案」定义成可评分指标,而不是只看语感顺不顺。

参考来源
  • OpenAI《Why language models hallucinate》,2025
  • Google Cloud《What are AI hallucinations?》,2025
  • 中新经纬《AI 怎么突然变懒了?》,2026