S2-1 · S2 提示词岛

同一个工具,为什么效果差十倍

10 分钟主干(必看)输出对比动机
学完你会:提示词值得学

知道为什么同样的 AI,有人用得很强,有人只能得到废话。

课前导读

同一个工具,为什么效果差十倍

同一个工具,会不会提问,效果可能差十倍。提示词不是技术黑话,本质就是把需求说清楚。

教学正文

差十倍,几乎都不是工具的问题

同一个能干的下属,你甩一句"弄个方案"和你说清"给谁用、什么场景、什么格式、什么时候要",交回来的东西质量差十倍。AI 一模一样。它不是不会做,是你没把活派清楚,它只能按"最常见的做法"猜着办。

提示词不是"提问",是"给临时同事派工单"。差距通常来自五个变量没写清:角色不清(用谁的视角)、背景缺失(它不知道你的具体情况)、任务边界模糊(不知道交付什么)、输出格式没定(不知道长什么样)、验收标准没给(不知道怎样算做好)。补齐这五样,同一个工具立刻像换了一台。

别信'万能提示词一招通吃'

这话被夸大了。提示词确实能大幅提升你对 AI 的控制力,但它不是万能钥匙。

有些问题提示词根本救不了:材料不够(得补资料)、任务太大(得拆开)、模型能力不够(得换模型)、需要查实时信息(得接联网或工具)。分清"这是提示词能修的,还是得换别的招",你才不会对着一条提示词反复较劲、越改越糊。

跟我做:一句话提示 vs 派工单提示

这个对比做一次,你对"提示词值多少钱"就有体感了。用 DeepSeek,约 10 分钟。

  1. 打开 DeepSeek(chat.deepseek.com),新建对话。
  2. 先输差提示词:「帮我写一个招聘 JD。」看它输出,记下毛病:岗位不清、公司背景空、任职要求泛化、格式不对。
  3. 新开一轮,输派工单提示:「你是制造业招聘经理。为{城市}{行业}{岗位}写 JD。背景:{公司规模、汇报对象、团队情况、薪资区间展不展示}。要求:岗位职责 6 条、任职要求 6 条、加分项 3 条、候选人画像 3 类;不许夸大薪酬,不许写"抗压能力强"这类空话。」括号里的空一定要填真实信息,填得越具体它越准
  4. 两版并排看,数一数"可以直接用的句子"各有几句。用"可直接用的句子数"当尺子,比"感觉好不好"客观
  5. 把你平时最常用的一句短提示,改写成这样的派工单,存起来复用。
  6. 预期看到:两版输出的可用度肉眼可见的差距,你会记住"越像派工单,越像可交付物"。

'帮我写个 JD'到底缺了什么

坏:「帮我写个 JD。」——它只能猜。猜个行业、猜个层级、套个模板,出来的东西哪家公司都能用,也就是哪家都不能直接用。

好:「你是制造业招聘经理,为佛山一家 500 人的家电厂招"设备维修主管",汇报给设备经理,带 8 人团队,薪资区间展示。输出职责 6 条、要求 6 条、加分项 3 条,不写空话。」——同一个 DeepSeek,这版出来的职责是"负责注塑设备的日常点检与故障响应",而不是"负责相关设备工作"。差别全在你提前把背景和验收喂进去了。

想进一步学"怎么给提示词打分、做 A/B 测试",看本页底部"深入一层"。

五个让效果打折的写法

只说"帮我写":它不知道给谁、用在哪。补上受众、场景、格式。

背景留白:岗位、公司阶段、城市、薪资策略不同,文案完全不同。至少给行业、岗位、层级、用人部门。

没有验收标准:它会给你看着完整、其实不可用的东西。写清字数、条数、语气、禁用词。

一次塞太多:让它同时写 JD + 题库 + 评分表,样样都浅。先 JD,再题库,再评分表。

只说"不满意":没方向它改不动。指出具体病灶——"太像模板""职责不具体""要求过高"。

配套视频演示

学习指引

小鹿线人工智能 · 覆盖 S2-1 到 S2-3 · 41集系列课,挑感兴趣单集看

我用了3年的AI提示词万能公式,5分钟解决70%提示词问题

自测

1同一个工具效果差十倍,问题通常出在哪?

出在提示词,不在工具。差距来自五个变量没写清:角色、背景、任务边界、输出格式、验收标准。提示词的本质是"给临时同事派工单",派不清楚它只能按最常见的做法猜。补齐这五样,同一个工具的输出质量立刻天差地别。

2'万能提示词能一招通吃'这话该信吗?

不该。提示词能大幅提升控制力,但救不了所有问题——材料不够要补资料、任务太大要拆、模型不够强要换、要实时信息要联网。关键是分清"这是提示词能修的,还是得换别的招",否则你会对着一条提示词反复较劲、越改越糊。

3怎么客观判断一版提示词比另一版好?

别靠"感觉好不好",用可数的尺子——比如"输出里能直接用的句子有几句"。把差提示词和派工单提示词的输出并排,数可用句子数,差距一目了然。更进一步可以设准确性、完整性、可执行性等指标,对同一批测试题反复评分。

小结

  • 效果差十倍几乎都是提示词的问题,不是工具的问题
  • 提示词是"派工单"不是"提问",五个变量要写清:角色、任务、背景、格式、验收
  • "万能提示词"被夸大——材料/任务量/模型/实时性的问题得换招,不是硬改提示
  • 判断提示词好坏用可数的尺子(如可直接用的句子数),别靠感觉

实操落点

  1. 分别输入“帮我写个招聘 JD”和“你是一位资深招聘 HR,请帮我写一份 HRBP 岗位 JD……”对比效果。
深入一层 · 实战演练与研究依据

样品:差提示词 vs 好提示词,同一个 DeepSeek

差提示词:「帮我写一个招聘 JD。」输出的毛病很固定:岗位不清、公司背景缺失、任职要求泛化、格式不适配,基本没法直接用。

好提示词:「你是制造业招聘经理。请为{城市}{行业}{岗位}写 JD。背景:公司规模、汇报对象、团队情况、薪资是否展示。要求:岗位职责 6 条、任职要求 6 条、加分项 3 条、候选人画像 3 类,不得夸大薪酬,不写『抗压能力强』这类空话。」

把两版输出并排,数一数「能直接用的句子」有几条,差距一眼看穿。提示词不是「提问」,是「给临时同事派活」——派活不清楚,AI 就按它认为最常见的方式办。

差十倍,差在五个变量

角色不清、背景缺失、任务边界模糊、输出格式没定、验收标准没给——差距几乎都出在这五处,而不是工具不行。

Microsoft 的 Copilot 指南把有效提示拆成目标、上下文、期望、来源;Google Gemini 文档把提示工程定义为测试驱动、迭代式的流程,要明确目标、约束、上下文、示例和输出格式。两家命名不同,指的是同一件事:把任务规格写清楚。

别信「万能提示词一招通吃」

Anthropic 文档说得很直白:提示工程能提高控制力,但不是所有失败都能靠提示解决,有些问题得换模型、加资料、拆任务或接工具。

需要提醒的是,公开来源里能查到的多是官方提示词指南和职场使用调研(超过 50% 职场人用 AI 做文书写作、近 40% 用于数据分析,61.3% 把数据隐私列为首要原则),并没有中国 HR「同一工具换提示词提升十倍」的可靠实验数据。「十倍」是课堂上直观可感的体验,不是被审计过的数字,讲的时候说清楚。

再深一层:给提示词定评分标准

别凭感觉说哪条提示词好。设六个指标:准确性、完整性、可执行性、是否引用材料、是否有风险提示、是否需要二次修改。

学有余力可读 Microsoft、Google、Anthropic 三家的提示词指南,再自己设计 5 道 HR 标准测试题,用同一个工具反复测不同版本的提示词,表现稳的那版留下来当团队模板。

参考来源
  • Microsoft Support《Learn about Copilot prompts》,2026
  • Google Cloud《Prompt engineering overview》,2026
  • 前程无忧/中国日报网《2025 职场 AI 应用趋势报告》报道,2025