S1-2 · S1 大模型岛

什么是大模型 / 生成式 AI

13 分钟主干大模型生成式 AI
学完你会:AI 不神秘

敢开口对话。

课前导读

什么是大模型 / 生成式 AI

大模型听起来很技术,但对 HR 来说,先抓住一句话就够了:它是一个读过大量文字、很会预测下一句话的超级文字助手。

教学正文

大模型是什么:一个会预测下一个词的接话高手

把大模型想成一个"词语接龙"玩到极致的人。你给上半句,它猜下半句——猜的依据不是"什么是真的",而是"在它读过的海量文字里,这个位置最常接什么词"。它读过无数 JD、制度、报告,所以接出来的话结构工整、术语标准,像模像样。

关键在于:它不是记住了原文,而是在训练里学会了语言的统计规律——什么词后面通常跟什么词。所以它生成的,是"最像人会写的那句话",不一定是"真的那句话"。理解这一点,你就理解了它一切能力和一切毛病的根。

它的本事是'材料变形',不是'知道答案'

生成式 AI 真正的能力,是把材料从一种形态变成另一种:长文变摘要、简历变表格、制度变问答、访谈变行动项。它像一台"文字变形机",你喂进去什么,它换个形状还给你。

由此有个关键推论:它不天然知道你们公司的制度、这个岗位的真实情况、这个员工的背景——这些不在它读过的资料里。所以它强在"加工你给的材料",弱在"回答你没给的事实"。分清这条线,你就不会再问它"我们公司年假几天"这种它根本无从知道的问题。

跟我做:亲眼看它是'转换器'不是'搜索引擎'

光听解释记不住,做一遍就懂。准备一份不含个人信息的公开材料,比如一份 JD 或员工手册样例。用 Kimi,约 10 分钟。

  1. 打开 Kimi(kimi.com),新建对话,上传这份文件。豆包、通义也能传文件,操作类似
  2. 输入:「请不要补充任何外部信息。只基于我上传的文件做三件事:①用 150 字讲清文件主要内容;②提取 10 条可问答的知识点;③把内容改写成新员工看得懂的 FAQ。」
  3. 看它输出——同一份材料,变成了摘要、知识点、FAQ 三种形态。这就是"材料变形"。
  4. 再输入:「给每条 FAQ 标出对应的原文依据;找不到依据的,写"材料未提供"。」这一步逼它露出"哪些是材料里的、哪些是它补的"
  5. 对比两次输出:第一次更像"生成",第二次更像"基于材料的问答"——后者才是你正式工作里该要的。
  6. 预期看到:摘要、FAQ、依据列表,以及被标为"材料未提供"的缺口。

同样一份手册,问对问错天差地别

问错:直接问"我们公司试用期多久?"——如果你没上传制度,它会按"大多数公司怎么写"给你补一个"通常 3-6 个月"。听着合理,但那不是你们公司的规定,是它接话茬接出来的。

问对:先上传手册,再问同一个问题,并要求"引用原文第几条"。它要么给你带条款出处的准确答案,要么老实说"材料未提供"。同一台机器,喂了材料和没喂材料,可靠性差一个数量级。

想更深理解"能上传文件"和"能可靠引用文件"不是一回事,看本页底部"深入一层"里关于上下文窗口和 RAG 的部分。

两个最常见的误会

把它当百度:它是"生成答案",不是"检索来源"。需要最新政策、工具功能时,必须打开联网,并让它列出可点开的来源。

以为上传了它就逐字读完:长文可能被截断、压缩、选择性引用。关键任务永远加一句"只基于材料、逐条列依据、没找到就说没找到"。

配套视频演示

学习指引

小黑黑讲AI · 覆盖 S1-2 · 13分18秒 · 大白话讲生成原理(零基础推荐)

深度讲解AI大模型原理,它如何生成文本,又如何模拟对话

自测

1为什么说大模型是'预测下一个词',这跟它会不会出错有什么关系?

它的底层动作是根据上文,从统计规律里挑"最像人会写的下一个词",拼成整段。它优化的是"像不像",不是"真不真"。所以当你问的事不在它资料里时,它照样能拼出一段像模像样、但可能是假的话——它的流畅和它的错误,来自同一个机制。

2生成式 AI 最擅长什么、最不擅长什么?

最擅长"材料变形"——把你给的长文、简历、制度换个形态(摘要、表格、问答)。最不擅长"回答你没给的事实"——你们公司制度、岗位实情、员工背景都不在它读过的资料里。所以用它的正确姿势是"喂材料让它加工",不是"空手问它公司内部的事"。

3上传了文件,为什么还要它'逐条标注原文依据'?

因为长文可能被截断或选择性引用,它也可能把没依据的内容顺手补上。要求逐条标依据、没有就写"材料未提供",等于逼它把"哪些真来自材料、哪些是它编的"分开摊在你面前,你才知道哪些能直接用。

小结

  • 大模型的本质是"预测最像人会写的下一个词"——它优化的是像不像,不是真不真
  • 它的强项是"材料变形"(摘要/表格/问答),弱项是"回答你没给的事实"
  • 它不是搜索引擎、也不是你们公司的知识库——这两件事都得靠你给材料或接内部系统
  • 关键任务永远加一句"只基于材料、逐条列依据、没找到就说没找到"

实操落点

  1. 输入:请用大白话解释什么是大语言模型,要求一个完全不懂技术的人也能听懂,200字以内。
  2. 再输入:请用做菜打比方,解释大语言模型是怎么工作的。对比两次回答的差异。
深入一层 · 实战演练与研究依据

样品:亲眼看一次「预测下一个词」翻车

把这句话喂给任何一个大模型:「请补全这句话:我司试用期员工的社保缴纳基数是」。

它大概率给你一个非常通顺的答案,比如「按员工首月全额工资作为缴纳基数」,措辞专业、语气笃定。问题是它根本不知道「我司」是哪家公司,它没查任何资料,只是在算「这串字后面接什么词最像人写的」。

对照实验:换成「我把公司的《社保缴纳管理办法》发给你,请只根据这份文件回答;文件里没写就直接说没写」,然后先不发文件直接问。诚实的回答是「你还没提供文件」;如果它照样编一个,你就亲眼见证了幻觉的诞生。流畅度和真实度是两个完全无关的指标。

它到底在干什么:材料转换器,不是搜索引擎

DeepSeek 官方服务条款用大白话解释过:模型把你输入的文本、图像、文件转成可处理的编码,预测下一个词元,从而生成文字、表格、代码;只有开启搜索功能时才会检索公开互联网信息。

所以它最擅长的是「把材料变成另一种形态」:长文变摘要、简历变表格、制度变问答、访谈变行动项。它不天然知道你公司制度、岗位实况、员工个案——这些必须你喂进去。

别高估「上传文件」这个动作。Kimi 官方说明它支持长文本、多模态、联网搜索,单文件不超过 100M、最多 50 个文件;但「能上传文件」和「能可靠逐字引用文件」不是一回事,长文可能被截断、压缩或选择性引用。

一个能立刻做的演示

用 Kimi 上传一份不含个人信息的公开 JD 或手册样例,输入:「请不要补充外部信息。只基于我上传的文件:①用 150 字解释主要内容;②提取 10 条可问答知识;③改写成新员工能看懂的 FAQ。」

再追一句:「请标出每条 FAQ 对应的原文依据,找不到依据就写『材料未提供』。」对比两次输出——第一次更像生成,第二次更像基于材料的问答。让学员看到同一份材料能变摘要、变问答、变表格、变题库,比抽象讲「生成式 AI」有效得多。

再深一层:上下文窗口、RAG、工具调用

上下文窗口决定一次能看多少材料,RAG(检索增强生成)决定能否从知识库找证据,工具调用决定能否查网页、跑表格、调系统。三者解决的是完全不同的问题。

RAG 不是「把文档丢给 AI」,而是先检索相关片段、再让模型基于片段回答。学有余力可读 Kimi 的长文档与搜索说明、通义千问 Qwen-Long 文档,把「能装下」和「能引用对」这两件事分清楚。

参考来源
  • DeepSeek《服务条款》,2026
  • Kimi《Kimi 概述》,2026
  • 艾瑞咨询《2024 年中国网络招聘行业研究报告》,2025