S3-4 · S3 资料岛

从杂乱材料里提取结构化信息

4 分钟主干结构化表格
学完你会:杂乱材料能自动整理

登记表、合同、邮件字段提取成表。

课前导读

从杂乱材料里提取结构化信息

HR 手里的信息经常是"散装"的——纸质入职登记表、微信里发来的一段个人信息、邮件正文里夹着的联系方式。要用起来,得先一条条抄进 Excel,枯燥又出错。这一节教的就是让 AI 把这些杂乱材料自动提成规整的表格。看视频时重点盯"提取成结构化字段"这一层:不是简单把图转成文字,而是让 AI 认出哪段是姓名、哪段是电话、哪段是学历,各归各列。它偏识图转表,和后面 S4 的 OCR 有点重叠,理解成"识别 + 归类"就对了。

教学正文

先搞懂:"转成文字"和"转成表格"差了关键一步

把结构化提取想象成整理一抽屉名片。"转成文字"是把每张名片上的字都抄下来,你得到一大段文本;"转成表格"是把每张名片的姓名归到姓名列、电话归到电话列、公司归到公司列——多了"字段归类"这一步,抄完直接能筛、能排序、能用。

HR 的杂乱材料特别多:简历、面试记录、离职访谈、培训反馈、满意度开放题、会议纪要。提取的关键不是"让 AI 看懂",而是先设计字段:字段名、字段定义、允许值、缺失值规则、能不能推断。字段设计得越贴合你后续要用的表头,提取越准,事后越少手工调整。

这节课最重要的一条纪律:把"提取"和"判断"劈开。提取字段(岗位、年限、证书、项目、离职原因)可以交给 AI;判断字段(潜力、稳定性、文化匹配)必须人工复核,最好让 AI 只给"依据片段"和"待追问"。结构化输出还要强制缺失值写"未提供",绝不让它猜。

跟我做:从面试记录提取结构化信息(Kimi 或通义千问)

拿一份面试官手打的面试记录。第一步永远是脱敏,别把真人信息喂进公有工具。

  1. 先脱敏:删掉姓名、电话、邮箱、身份证、具体工号,人名改成"候选人 A"。简历/面试记录原文风险高,脱敏或改用企业授权的招聘系统
  2. 打开 Kimi 或通义千问,新建对话,粘贴脱敏后的面试记录。
  3. 只让它提取、不让它判断。输入:「从下面面试记录提取结构化信息,只提取原文明确出现的内容,不得推断。字段:候选人编号、应聘岗位、最近一段工作年限、相关项目经验、管理人数、用过的工具/系统、业绩数据、离职原因、面试官已确认的优势、面试官已确认的风险、需追问的问题。输出 Markdown 表格,未提供写"未提供",每个字段后附原文依据。」"未提供写未提供"这句专治它按职位脑补管理人数
  4. 复制表格到 WPS 表格,检查字段是否便于筛选。
  5. 让它自查推断项。输入:「哪些字段是你从原文提取的,哪些可能带推断?推断项改成"需人工确认"。」
  6. 预期输出:一张候选人信息表——"管理人数"因记录没写老实填"未提供",判断类内容(潜力、匹配度)全进"需追问"列,适合后续人工筛选或面试追问。

对照:字段定义清不清楚,决定表格能不能用

坏做法是字段写"能力强"这种没标准的词——AI 只能主观打分,你拿到"能力:较强"这种没法复核的格子。好做法是把字段改成可观察项:项目规模、用过的工具、工作年限、结果数据。这样每一格都能回原文核对。

另一个高频翻车:允许 AI 推断缺失字段。简历没写管理人数,它可能按"高级经理"这个职位猜个"约 5 人"填进去,看着完整其实是编的。规则必须写死"未出现写未提供",宁可留白也不要脑补。

还有一层容易忽略:结构化表不是判断结果。别把"提取出来的表"直接当"录用结论",把"结论"栏改成"待追问问题"和"依据片段"。深入一层的"字段体系和标签体系"(岗位族、技能、证书、风险标签的统一字典)在本页底部展开——团队要长期抽简历,先定字典才能横向比较。

结构化提取的五个失败模式

字段定义不清:"能力强"没有标准。改成可观察项:项目规模、工具、年限、结果数据。

允许 AI 推断缺失字段:简历没写它就按职位猜。未出现一律写"未提供"。

把提取结果当判断结果:结构化表不是录用结论。把"结论"改成"待追问问题"和"依据片段"。

表格格式不可复用:输出长段文字没法粘进 Excel。指定 Markdown 表格或 CSV 字段顺序。

输入含敏感个人信息:简历原文风险高。先脱敏,或只用企业批准的招聘系统。

配套视频演示

学习指引

覆盖 S3-4 · 约2-4分钟 · 杂乱信息结构化提取(强调"提取成结构化字段"这一层)

【AI】图片转表格,一键可转,效率起飞

自测

1同样是处理一张照片,"转成文字"和"转成表格"关键差在哪一步?

差在"字段归类"。转成文字只是把图上的字抄成一段文本,你还得手动分列;转成表格是让 AI 把每条信息归到对应字段(姓名列、电话列、日期列),抄完直接能筛能排序。这一步让提取结果从"一段文本"变成"能用的数据"。

2为什么提取时要把"提取"和"判断"严格劈开?

因为提取(岗位、年限、证书这些原文明确写的)AI 能做得又快又准,而判断(潜力、稳定性、文化匹配)它没依据、只能瞎猜,还容易被当成结论误用。劈开后,判断类内容进"需追问/需人工确认"列,人来做,既用上了 AI 的速度又守住了判断的责任。

3规则里为什么必须写死"缺失字段写未提供,不得推断"?

因为不加这条,AI 遇到简历没写的字段(比如管理人数)会按职位脑补一个看似合理的值填进去,让错误信息混进一张看起来很完整的表,一路带进后续筛选。写死"未提供",宁可留白也不脑补,表格才可信、可追溯。

小结

  • 结构化提取比 OCR 多了"字段归类"这一步,抄完直接能用
  • 先设计字段(名/定义/允许值/缺失规则),字段贴合表头则提取更准
  • 铁律:提取归 AI、判断归人;缺失写"未提供",不许推断
  • 敏感个人信息先脱敏或走企业授权系统,数字/日期/同音字姓名务必抽查

实操落点

  1. 找一张你手头的纸质表格或一段散乱的人员信息——入职登记表、名片、或者群里同事零散发来的报名信息都行,拍照或粘贴给 AI,明确告诉它:"请提取成表格,列头为:姓名、部门、岗位、手机号、入职日期,缺的填空。"拿到表格后逐行核一遍手机号和日期这两类最容易识别错的字段,确认无误再复制进你的 Excel。原本要抄二十分钟的一叠表,这样几分钟就成型。
深入一层 · 实战演练与研究依据

Worked example:面试记录提取,把"提取"和"判断"劈开

场景:一份面试官手打的面试记录,你要把它变成一张能筛选、能追问的候选人信息表。

第一步永远是脱敏:姓名、电话、邮箱、身份证、具体工号删掉,人名改成"候选人 A"。

坏做法:「帮我评估下这个候选人,值不值得进下一轮。」它会给你一段"综合来看比较匹配、建议推进"的判断——问题是它没见过这人,这判断和星座分析一个性质。

好做法:只让它提取,不让它判断。Prompt:「从下面面试记录提取结构化信息,只提取原文明确出现的内容,不得推断。字段:候选人编号、应聘岗位、最近一段工作年限、相关项目经验、管理人数、用过的工具/系统、业绩数据、离职原因、面试官已确认的优势、面试官已确认的风险、需追问的问题。输出 Markdown 表格,未提供写"未提供",每个字段后附原文依据。」

好的输出长什么样:一张表,"管理人数"这栏因为记录里没写,老实填"未提供",而不是按职位猜个"约 5 人";"业绩数据"栏引着原文"负责的项目上线后投诉率降 30%"。判断类内容(潜力、稳定性、文化匹配)它没碰,都进了"需追问的问题"列。

两个翻车点:① 字段定义写"能力强"这种没标准的词——改成可观察项,如项目规模、工具、年限、结果数据;② 允许它推断缺失字段,简历没写管理人数它就按职位脑补,务必规定"未出现写未提供"。

真实案例与能力边界

通义实验室公开页面列出"实体识别和信息提取",称可快速提取非结构化文本关键信息,覆盖招投标、人力资源、数据服务等领域;Qwen-OCR 官方文档说明可从扫描文档、表格、票据等图像提取文本或结构化数据,内置信息抽取、表格解析、公式识别。海尔 HRSSC 在入职流程里用 OCR 自动填表、公安系统人脸核验、电子合同签署、体检结果自动传输,五险一金办理效率提升 10 倍、年省 1.8 万小时。

注意最后这个案例是企业级系统联动,不等于个人拿公有工具就能复刻——**能力是真的,但"批量、合规、可追溯"要靠企业系统和字段校验规则兜底,不是一句 prompt。**

再深一层:字段体系和标签体系

如果团队要长期抽简历或反馈,先定义统一字典:岗位族、技能、证书、行业、风险标签、反馈主题。这样 AI 提取出来的内容才能横向比较,而不是每次一套新表头。学有余力者了解命名实体识别、信息抽取、OCR 与 JSON Schema,后续可把高频字段接进招聘系统或数据看板。

参考来源
  • 通义实验室《通义实验室》,2026
  • 阿里云《文字提取(Qwen-OCR)》,2026
  • HREC/智享会《2025 人力资源共享服务中心价值大奖获奖案例集》,2026