课前导读

HR 手里的信息经常是"散装"的——纸质入职登记表、微信里发来的一段个人信息、邮件正文里夹着的联系方式。要用起来,得先一条条抄进 Excel,枯燥又出错。这一节教的就是让 AI 把这些杂乱材料自动提成规整的表格。看视频时重点盯"提取成结构化字段"这一层:不是简单把图转成文字,而是让 AI 认出哪段是姓名、哪段是电话、哪段是学历,各归各列。它偏识图转表,和后面 S4 的 OCR 有点重叠,理解成"识别 + 归类"就对了。
教学正文
先搞懂:"转成文字"和"转成表格"差了关键一步
把结构化提取想象成整理一抽屉名片。"转成文字"是把每张名片上的字都抄下来,你得到一大段文本;"转成表格"是把每张名片的姓名归到姓名列、电话归到电话列、公司归到公司列——多了"字段归类"这一步,抄完直接能筛、能排序、能用。
HR 的杂乱材料特别多:简历、面试记录、离职访谈、培训反馈、满意度开放题、会议纪要。提取的关键不是"让 AI 看懂",而是先设计字段:字段名、字段定义、允许值、缺失值规则、能不能推断。字段设计得越贴合你后续要用的表头,提取越准,事后越少手工调整。
这节课最重要的一条纪律:把"提取"和"判断"劈开。提取字段(岗位、年限、证书、项目、离职原因)可以交给 AI;判断字段(潜力、稳定性、文化匹配)必须人工复核,最好让 AI 只给"依据片段"和"待追问"。结构化输出还要强制缺失值写"未提供",绝不让它猜。
跟我做:从面试记录提取结构化信息(Kimi 或通义千问)
拿一份面试官手打的面试记录。第一步永远是脱敏,别把真人信息喂进公有工具。
- 先脱敏:删掉姓名、电话、邮箱、身份证、具体工号,人名改成"候选人 A"。简历/面试记录原文风险高,脱敏或改用企业授权的招聘系统
- 打开 Kimi 或通义千问,新建对话,粘贴脱敏后的面试记录。
- 只让它提取、不让它判断。输入:「从下面面试记录提取结构化信息,只提取原文明确出现的内容,不得推断。字段:候选人编号、应聘岗位、最近一段工作年限、相关项目经验、管理人数、用过的工具/系统、业绩数据、离职原因、面试官已确认的优势、面试官已确认的风险、需追问的问题。输出 Markdown 表格,未提供写"未提供",每个字段后附原文依据。」"未提供写未提供"这句专治它按职位脑补管理人数
- 复制表格到 WPS 表格,检查字段是否便于筛选。
- 让它自查推断项。输入:「哪些字段是你从原文提取的,哪些可能带推断?推断项改成"需人工确认"。」
- 预期输出:一张候选人信息表——"管理人数"因记录没写老实填"未提供",判断类内容(潜力、匹配度)全进"需追问"列,适合后续人工筛选或面试追问。
对照:字段定义清不清楚,决定表格能不能用
坏做法是字段写"能力强"这种没标准的词——AI 只能主观打分,你拿到"能力:较强"这种没法复核的格子。好做法是把字段改成可观察项:项目规模、用过的工具、工作年限、结果数据。这样每一格都能回原文核对。
另一个高频翻车:允许 AI 推断缺失字段。简历没写管理人数,它可能按"高级经理"这个职位猜个"约 5 人"填进去,看着完整其实是编的。规则必须写死"未出现写未提供",宁可留白也不要脑补。
还有一层容易忽略:结构化表不是判断结果。别把"提取出来的表"直接当"录用结论",把"结论"栏改成"待追问问题"和"依据片段"。深入一层的"字段体系和标签体系"(岗位族、技能、证书、风险标签的统一字典)在本页底部展开——团队要长期抽简历,先定字典才能横向比较。
字段定义不清:"能力强"没有标准。改成可观察项:项目规模、工具、年限、结果数据。
允许 AI 推断缺失字段:简历没写它就按职位猜。未出现一律写"未提供"。
把提取结果当判断结果:结构化表不是录用结论。把"结论"改成"待追问问题"和"依据片段"。
表格格式不可复用:输出长段文字没法粘进 Excel。指定 Markdown 表格或 CSV 字段顺序。
输入含敏感个人信息:简历原文风险高。先脱敏,或只用企业批准的招聘系统。
配套视频演示
覆盖 S3-4 · 约2-4分钟 · 杂乱信息结构化提取(强调"提取成结构化字段"这一层)
【AI】图片转表格,一键可转,效率起飞
自测
1同样是处理一张照片,"转成文字"和"转成表格"关键差在哪一步?
差在"字段归类"。转成文字只是把图上的字抄成一段文本,你还得手动分列;转成表格是让 AI 把每条信息归到对应字段(姓名列、电话列、日期列),抄完直接能筛能排序。这一步让提取结果从"一段文本"变成"能用的数据"。
2为什么提取时要把"提取"和"判断"严格劈开?
因为提取(岗位、年限、证书这些原文明确写的)AI 能做得又快又准,而判断(潜力、稳定性、文化匹配)它没依据、只能瞎猜,还容易被当成结论误用。劈开后,判断类内容进"需追问/需人工确认"列,人来做,既用上了 AI 的速度又守住了判断的责任。
3规则里为什么必须写死"缺失字段写未提供,不得推断"?
因为不加这条,AI 遇到简历没写的字段(比如管理人数)会按职位脑补一个看似合理的值填进去,让错误信息混进一张看起来很完整的表,一路带进后续筛选。写死"未提供",宁可留白也不脑补,表格才可信、可追溯。
小结
- 结构化提取比 OCR 多了"字段归类"这一步,抄完直接能用
- 先设计字段(名/定义/允许值/缺失规则),字段贴合表头则提取更准
- 铁律:提取归 AI、判断归人;缺失写"未提供",不许推断
- 敏感个人信息先脱敏或走企业授权系统,数字/日期/同音字姓名务必抽查
实操落点
- 找一张你手头的纸质表格或一段散乱的人员信息——入职登记表、名片、或者群里同事零散发来的报名信息都行,拍照或粘贴给 AI,明确告诉它:"请提取成表格,列头为:姓名、部门、岗位、手机号、入职日期,缺的填空。"拿到表格后逐行核一遍手机号和日期这两类最容易识别错的字段,确认无误再复制进你的 Excel。原本要抄二十分钟的一叠表,这样几分钟就成型。
深入一层 · 实战演练与研究依据
Worked example:面试记录提取,把"提取"和"判断"劈开
场景:一份面试官手打的面试记录,你要把它变成一张能筛选、能追问的候选人信息表。
第一步永远是脱敏:姓名、电话、邮箱、身份证、具体工号删掉,人名改成"候选人 A"。
坏做法:「帮我评估下这个候选人,值不值得进下一轮。」它会给你一段"综合来看比较匹配、建议推进"的判断——问题是它没见过这人,这判断和星座分析一个性质。
好做法:只让它提取,不让它判断。Prompt:「从下面面试记录提取结构化信息,只提取原文明确出现的内容,不得推断。字段:候选人编号、应聘岗位、最近一段工作年限、相关项目经验、管理人数、用过的工具/系统、业绩数据、离职原因、面试官已确认的优势、面试官已确认的风险、需追问的问题。输出 Markdown 表格,未提供写"未提供",每个字段后附原文依据。」
好的输出长什么样:一张表,"管理人数"这栏因为记录里没写,老实填"未提供",而不是按职位猜个"约 5 人";"业绩数据"栏引着原文"负责的项目上线后投诉率降 30%"。判断类内容(潜力、稳定性、文化匹配)它没碰,都进了"需追问的问题"列。
两个翻车点:① 字段定义写"能力强"这种没标准的词——改成可观察项,如项目规模、工具、年限、结果数据;② 允许它推断缺失字段,简历没写管理人数它就按职位脑补,务必规定"未出现写未提供"。
真实案例与能力边界
通义实验室公开页面列出"实体识别和信息提取",称可快速提取非结构化文本关键信息,覆盖招投标、人力资源、数据服务等领域;Qwen-OCR 官方文档说明可从扫描文档、表格、票据等图像提取文本或结构化数据,内置信息抽取、表格解析、公式识别。海尔 HRSSC 在入职流程里用 OCR 自动填表、公安系统人脸核验、电子合同签署、体检结果自动传输,五险一金办理效率提升 10 倍、年省 1.8 万小时。
注意最后这个案例是企业级系统联动,不等于个人拿公有工具就能复刻——**能力是真的,但"批量、合规、可追溯"要靠企业系统和字段校验规则兜底,不是一句 prompt。**
再深一层:字段体系和标签体系
如果团队要长期抽简历或反馈,先定义统一字典:岗位族、技能、证书、行业、风险标签、反馈主题。这样 AI 提取出来的内容才能横向比较,而不是每次一套新表头。学有余力者了解命名实体识别、信息抽取、OCR 与 JSON Schema,后续可把高频字段接进招聘系统或数据看板。
- 通义实验室《通义实验室》,2026
- 阿里云《文字提取(Qwen-OCR)》,2026
- HREC/智享会《2025 人力资源共享服务中心价值大奖获奖案例集》,2026