AI简历筛选靠谱吗?能用与不能用的清楚边界
有人给你演示过一次:把两百份简历拖进去,喝一杯咖啡的时间,出来一张按分数排好的名单,第一名九十二分,第二名八十九分。演示的人很客气,说这只是辅助,最后还是您来决定。你当时点了点头,回到座位上却一直在想同一个问题——这个分数,我到底能信到什么程度?
这个问题不好回答,是因为它其实是三个问题混在一起:机器有没有把简历读对、有没有按我的标准去比、给出来的名次能不能当结论。三个问题的答案完全不一样,而卖工具的人通常只回答第三个。
还有一件事让这个问题更难查。你用中文去搜这件事,搜出来的东西一大半不是写给你的。排在前面的文章在教求职者怎么写简历才能被机器挑中:多放行业术语、职位名称照抄招聘广告、别用花哨的排版、表格和图片会被读成空白。那些文章有它们的道理,只是站在你的对面——它们在教对手怎么过你这一关。
所以这一篇把立场先摆明:这是写给要用 AI 读简历的人看的,不是写给求职者的。写给在新加坡和马来西亚招人的公司——一年招十几到几十个人,HR 只有一两位,简历从几个渠道同时进来,有中文的、有英文的、也有马来文夹杂的。文章要回答的只有一件事:这套东西哪些地方能用、哪些地方不能用,那条线画在哪里。
AI 简历筛选靠谱吗:一段话的版本
靠谱与否,取决于你让它做哪一件事。AI 读简历实际上是三件事:一是提取——把文件里的内容变成可以比较的字段;二是对照——拿提取到的内容去比你写下的标准;三是排序——给每份简历一个分数和名次。前两件事,机器做得比人稳,因为它不累、不忘、不挑心情;第三件事,机器给出的是一个排队顺序,不是一个录用结论。把它当排队顺序用,非常靠谱;把它当结论用,就会出事。更麻烦的是,第一件事坏掉的时候最安静:简历没读出来就是一片空白,空白自然拿不到分,而系统不会告诉你它其实什么都没读到。
下面这张图把三件事摆开。值得留意的是每一格最后那一行:三件事坏掉的症状完全不一样,所以你只要看症状,就知道该去查哪一步。
换成表格再看一遍,你大概能立刻对上号:
| 步骤 | 它在做什么 | 坏掉的时候你看到什么 | 能不能自己查 |
|---|---|---|---|
| 一 提取 | 把文件里的内容变成字段:年限、学历、技能、待过哪些公司 | 某几份简历分数低得反常,点开一看字段几乎都是空的 | 能,随手抽十份对着原文看一遍 |
| 二 对照 | 拿字段去比你写下的岗位标准,逐条打分 | 你觉得明显合适的人排在中间,说不出理由 | 能,看它给的每一条评分依据 |
| 三 排序 | 把逐条得分合成一个总分和名次 | 排最前面的人,面完你就摇头 | 能,但只有面完几个人之后才看得出来 |
还有一句要在开头说清楚,免得你带着错的期待往下读:这套东西省的是读的时间,不是判断的时间。它把你从翻五百个文件里捞出来,让你有力气去做只有人做得了的那一部分——看懂行业、认出转行的人、闻出写得漂亮但站不住的经历,以及最后决定要不要请这个人来聊一次。如果你指望它替你把人选好,那不管买哪一家,三个月后都会失望。
如果你还没搞清楚这类系统的整体样子,可以先看 招聘系统是什么?它到底帮HR省下哪些时间和成本;如果你想要的是一套不依赖任何工具的人工筛选流程,那篇 简历筛选怎么做?五百份简历的三层筛选法 更对路。这一篇假设你已经在考虑用机器读,只讲边界。
为什么中文搜出来的答案,一半是写给对面的
先花一小段说这件事,因为它会直接影响你怎么读接下来的内容。用中文搜这个题目,排在前面的结果大致分成三类。
第一类是教求职者的。标题写着简历怎么写才能通过机器初筛,内容是一串很具体的技巧:把招聘广告里的职位名称原样抄进简历、技能栏平铺直叙不要玩花样、别用两栏排版和图表、页眉页脚里的信息很可能读不出来、尽量交文字版的文件而不是扫描件或者图片。这些建议在技术上大多是对的,只是它们服务的是投简历的那一方。
第二类是技术文章。讲怎么用程序把简历解析成结构化字段,怎么算相似度,怎么训练一个打分模型。写得很认真,但它假设读者要自己动手做一套。你要的不是做一套,你要的是判断买来的那一套能不能用。
第三类是产品文章。大多来自中国大陆的招聘软件公司,把自己的功能列一遍。问题不在于它们讲得不好,而在于那些产品的服务器、发票、客服、招聘渠道对接,全部围着另一个市场转。你在吉隆坡或者新加坡按下试用按钮,多半会发现连注册的手机号格式都对不上。
还有第四类,藏在前三类中间:论坛和问答里的经验帖。这一类其实最接近真实,因为写的人是同行,说的是自己踩过的坑。但它有两个问题。一是碎,一条讲提取失败,一条讲某家产品客服不接电话,拼不成一个能照着做的流程;二是背景对不上,帖子里的招聘量、岗位类型、法律环境,多半和你差得很远。你可以拿它当线索,但不能拿它当依据。
四类都不回答你的那个问题:这个分数我能信到什么程度。这一篇补的就是这一段。
不过,第一类文章你反而要认真看
这里有一个反直觉的地方,值得单独说:教求职者的那些文章,是你判断这套工具能不能用的重要材料。原因很简单——如果一篇教人怎么骗过机器的文章能排在前面,说明它教的那些办法真的有效;而那些办法之所以有效,是因为很多系统的打分方式还停留在数关键词。
换句话说,那些文章是一面镜子。它照出来的不是求职者不老实,而是市面上有相当一部分打分逻辑,本来就经不起有准备的人对付。你在挑工具的时候,可以直接拿那些文章里的技巧当测试题:
- 如果一份简历把岗位描述里的词原样抄一遍,它的分数会不会明显上去?
- 如果两份简历讲的是同一段经历,一份写得很朴素、一份堆满行业术语,机器会不会偏心?
- 如果某个技能只在兴趣爱好那一栏出现过一次,机器会不会当成会用?
这三个问题,等到第九节讲打分方式的时候会展开。现在只要先记住一件事:能被简历写作技巧轻易推高的分数,本身就不牢靠。
新马这边,还有几件当地才有的事
接下来的内容会不断回到这几条,先在这里摆出来:
| 当地情况 | 它会怎么影响机器读简历 |
|---|---|
| 一份简历里混着两三种语言 | 中文段落、英文职位名、马来文的公司全称同时出现。提取的时候如果按单一语言处理,容易漏字段 |
| 学历来自很多个体系 | 本地大学、英国联合培养、澳大利亚分校、中国大陆本科、专业资格证书混在一起,很难用一条规则排高低 |
| 公司名字外面的人不认识 | 很多本地中型公司在网上几乎查不到,机器没有任何背景知识可以借力,只能看简历上写了什么 |
| 候选人身份类型多 | 本地公民、永久居民、各类工作签证、需要办理配额的岗位——这一栏填错,后面全白做 |
| 个人资料保护有明文规定 | 收集、使用、保留简历都要有依据,不能收进来就一直放着。第十一节专门讲这一条 |
这五条里,前三条是技术问题,第四条是流程问题,第五条是法律问题。而没有一条会在系统里报错。它们只会安静地让某一批人排在后面,或者让你在三个月后接到一通不好回答的电话。
第一件事:提取——最先坏,也坏得最安静
提取的意思是把一个文件变成一堆可以比较的字段。人做这件事是不自觉的:你眼睛扫过一页纸,脑子里已经有了“做了六年、在两家公司、最近一份是团队负责人”这几个结论。机器做这件事要一步一步来,而每一步都有可能卡住。
它要从一份简历里拿出什么
不同产品拿的字段不完全一样,但核心的那几类是共通的:
- 基本信息:姓名、联系方式、所在城市、身份或者签证类型(这一项在新马非常关键)。
- 工作经历:每一段的公司、职位、起止时间、做过什么。时间要能算出年限,还要能识别出中间的空档。
- 教育背景:学校、专业、学位、毕业年份,有时还包括专业资格证书。
- 技能:软件、工具、语言能力、行业专有的操作能力。
- 其他:期望薪资、可到岗时间、推荐人——写了才有,多数简历上没有。
看起来很直白,但每一类都有各自的坑。
五种最常见的提取失败
下面这五种,你在自己的简历堆里几乎一定会遇到:
| 失败情况 | 为什么会发生 | 你看到的现象 | 怎么处理 |
|---|---|---|---|
| 扫描件和图片简历 | 文件里根本没有文字,只有一张照片 | 整份简历所有字段都是空的 | 系统要能明确标出读不出来,而不是给零分 |
| 两栏排版和表格 | 阅读顺序被打乱,左右两栏的内容串在一起 | 公司名和职位对不上,时间乱跳 | 抽查排版花哨的那几份 |
| 时间写法五花八门 | 有人写年月,有人只写年份,有人写至今,有人用英文月份缩写 | 年限算错,六年变成六个月 | 看它算出来的总年限对不对 |
| 中英文混排 | 公司全称是英文或者马来文,职位是中文,机器按一种语言切词 | 公司名被切成几段,或者整段被跳过 | 专门抽查多语言的那一批 |
| 信息藏在页眉页脚 | 联系方式放在页眉,很多解析流程会略过 | 有分数但联系不上人 | 导出联系方式,看空的有多少 |
这五种里,最危险的是第一种。因为一份读不出来的简历,如果被系统默默算成低分,它就永远沉在名单最底下,而你永远不会知道自己漏掉了谁。一个负责任的产品应该给这类简历一个单独的状态——读不出来,请人看一眼——而不是把它混进分数队列里。这是你在试用的时候一定要问清楚的第一个问题。
还有两个提取难点,发生在简历之外
上面五种都在文件里面。实际用起来还有两种失败发生在文件外面,很多人到上线之后才发现:
一是内容根本不在附件里。相当一部分候选人把经历直接写在邮件正文,附件只有一张身份证件照片或者一份作品;也有人给的是一个个人主页的地址。如果你的流程只抓附件,这些人等于没投过。处理办法不复杂——收件那一端要有一条规则,把没有可解析附件的申请单独放一堆,由人打开看一眼,十秒钟的事。
二是同一个人投了好几次。换了岗位再投一次、简历改过之后重投一次、通过不同渠道各投一次,都很常见。如果系统不合并,同一个人会以不同分数出现在名单的不同位置,你还会误以为投递量比实际大。合并的依据通常是邮箱或者手机号,但要注意一点:合并之后应该以最新的那一份为准,同时保留旧版本,因为有时候人是在旧简历里写清楚了某段经历,新版本反而删掉了。
怎么在半小时内验完提取这一关
不需要任何技术背景,按下面这个顺序做一遍就够了:
- 从上一轮招聘里挑十五份简历,故意挑得杂一点:五份普通文字版、三份排版花哨的、三份扫描或者图片的、两份中英混排的、两份有职业空档的。
- 全部导进去,先不看分数,直接看它提取出来的字段。
- 逐份对着原文核:公司名对不对、年限算得对不对、最近一份工作是不是最近一份、联系方式在不在。
- 数一下有几份是空的或者半空的,再看系统有没有把它们标出来。
- 把结果写在纸上:十五份里读得完整的有几份、部分失败的有几份、完全失败的有几份。
这一步做完,你对这套工具的判断就已经比大多数买家扎实了。因为绝大多数人是从看分数开始的,而分数是最后一步。前面读错了,后面算得再漂亮也是在错的材料上算。
顺带说一句给你的候选人:如果你在招聘广告里加一句“请尽量提交文字版的简历文件”,这一关的失败率会明显下降。这句话对双方都有好处,也不需要任何技术投入。
第二件事和第三件事:对照与排序
提取这一关过了,接下来是对照。对照的质量,几乎完全取决于你写下来的那份标准有多具体。这句话听起来像废话,但它是整套工具里最被低估的一环——很多人抱怨机器筛得不准,真正的原因是他们给的标准本身就说不清楚。
含糊的标准,会被含糊地执行
看两组写法的对比:
| 含糊的写法 | 具体的写法 | 差别在哪 |
|---|---|---|
| 有相关工作经验 | 在同一个行业里做过至少三年,其中至少一年是直接对客户 | 前者机器只能靠猜,后者可以逐条核 |
| 沟通能力强 | 简历里能找到一段独立对外沟通的经历,例如带过客户会议或者做过培训 | 把一个形容词换成一件可以在原文里找到的事 |
| 熟悉数据分析 | 做过定期报表,或者用过表格软件之外的分析工具,写得出用来做什么 | 前者会把写了两个字的人和真做过的人算成一样 |
| 学历良好 | 本科及以上,专业不限;若是专业资格证书,需说明发证机构 | 避免把学历悄悄变成学校排名 |
写标准的时候有一个很好用的检验方法:把每一条读出来,问自己“这一条能不能在简历原文里指出对应的那一句”。如果指不出来,那这一条就不该交给机器去比,应该留到面试环节。
一个写完整的例子
抽象说完了,看一个具体的。假设你要招一位客户支持主管,团队三到五个人,客户以本地中小企业为主,中英文都要用。下面是一份写到能直接用的标准,注意每一条后面都跟着一句“在简历里怎么看出来”:
| 条件 | 是硬条件还是加分 | 在简历里怎么看出来 |
|---|---|---|
| 直接面对客户的工作满三年 | 硬条件 | 有一段以上的岗位,职责里明确写着处理客户问题或者对接客户 |
| 带过人,哪怕只有两三个 | 硬条件 | 写得出团队规模、或者写过带教、排班、分工这类动作 |
| 中英文都能对外书写 | 硬条件 | 简历本身的语言、或者写过对外文案、邮件模板、帮助文档 |
| 处理过投诉升级 | 加分 | 能举出一段把不满意的客户接住的经历,写得出做了什么 |
| 用过工单或者客服系统 | 加分 | 点得出具体的系统名字,并且说得出用它做什么 |
| 做过定期的服务数据汇报 | 加分 | 写过报表、月度回顾、或者对某个服务指标负责 |
这份表有两个地方值得学。第一,硬条件只有三条。硬条件多于五条的岗位,基本上招不到人,或者只能招到很会写简历的人。第二,最后一栏全是可以在原文里指出来的东西。没有一条写着有责任心、抗压能力强、学习能力好——那些不是不重要,是不该在这一关比,它们属于面试。
拿这张表去对照你现在正在招的那个岗位的要求,多半会发现两件事:硬条件太多,而且大半条指不出对应的句子。先修这个,比换任何工具都有用。
权重:别让不重要的条件偷偷占大头
对照通常会给每一条一个权重。这里最常见的错误是把容易量化的东西给了太高的权重——年限、学历、技能关键词,这三样都很好算,于是不知不觉占掉总分的大半,而真正决定这个人能不能做好的那些东西,因为不好算,权重就低。
一个简单的做法:先不看工具,自己在纸上把这个岗位的成功要素排个序,写出前五条,再给这五条分配一百分。写完之后再去看工具里的权重设置,如果两边差很远,那多半是你被工具的默认设置牵着走了。
第三件事:分数只是排队号码
排序是把逐条得分合成一个总分。这一步本身没有玄机,但它有一个心理上的副作用,而这个副作用才是真正的风险来源。
一个数字看起来比一句话更像事实。八十七分和八十二分摆在一起,你会自然而然觉得前者比后者好一点。但这五分可能来自一条权重占三分之一、而且你其实并不在乎的条件。人对数字的信任,远远超过数字本身能承担的重量。
所以要养成一个习惯:看名单的时候,眼睛不要停在分数上,要停在依据上。一个合格的产品应该做到,你点开任何一个分数,都能看到它引用了简历里的哪一句话。看不到依据的分数,等于没有分数——你无法核对,也无法在三个月后向任何人解释。
分档比排名更实用
比起一条从高到低的名次,把结果分成几档更符合实际用法。因为你真正要做的决定不是“谁第一”,而是“这一批里哪些人值得花时间”。一个够用的分法是这样的:
| 档位 | 含义 | 接下来做什么 |
|---|---|---|
| 达标 | 硬条件全部满足,依据都能在原文里找到 | 直接进入下一轮,人只做抽查 |
| 可以考虑 | 大部分满足,有一两条缺或者写得不清楚 | 必须由人逐份看,这一档最容易出好人选 |
| 不达标 | 硬条件明显缺失 | 人抽查一部分,确认不是提取失败造成的 |
| 读不出来 | 文件解析失败,没有有效字段 | 必须人工打开原件看,绝不能算成不达标 |
第四档是这张表里最重要的一档,前面已经说过一次,这里再强调一遍:把读不出来和不达标混为一谈,是这类工具最常见、也最难被发现的伤害。
另外,中间那一档——可以考虑——才是你真正该花时间的地方。达标的那些人,机器和你的判断多半一致;不达标的那些,看一眼就知道。真正的好人选,经常藏在“有一两条对不上”的那一堆里,因为他们的经历不标准,而不标准往往正是他们的价值所在。
四件事机器稳过人
把三件事拆完,现在可以回答那个真正的问题了:这套东西哪些地方值得信。下面四件,机器不是偶尔比人做得好,而是稳定地比人做得好——差别不在聪明,在耐力和一致性。
一、读到第三百份的时候,还和第一份一样仔细
这一条是所有优势的根。人筛简历有一条很残酷的规律:前二十份看得很细,中间一百份开始跳着看,最后一百份基本只看第一眼。这不是态度问题,是生理问题。等到下午四点你还剩两百份没看,你的判断标准已经悄悄变松或者变严了,而你自己感觉不到。
机器没有这个曲线。第三百份和第一份走的是同一套流程,用的是同一份标准。这一点带来的好处不是速度,是一致性——同样一份简历,早上进来和傍晚进来,得到的处理是一样的。这在事后需要解释的时候特别重要。
二、不会忘掉标准,也不受当天心情影响
人筛简历的时候,标准是活的。你上午刚看完一个特别出色的候选人,接下来半小时里所有人在你眼里都平庸;你昨天被一个夸大经历的人骗过,今天看到类似的写法就格外挑剔。这些都是人之常情,也都是噪音。
机器把标准写死了。你定的是三年,它就按三年比,不会因为这个人的自我介绍写得漂亮就放宽到两年半。这既是优点也是缺点——它的好处是稳定,坏处是它不会因为看到一段特别的经历而破例,而破例有时候恰恰是对的。所以后面第十节要讲,人必须留一个通道把被机器挡下来的人捞回来。
三、每个判断都留得下一句理由和一段原文
这一条被严重低估,但它可能是这类工具最实在的价值。人筛简历几乎不留记录。你把一份简历放到不合适那一堆,脑子里想的那句“这个人跳槽太频繁”不会写在任何地方。三个月后有人问起来,你只能凭印象重新解释一遍,而印象是会变的。
机器可以在每一条评分旁边留下依据:这一条给分,是因为简历第二段写了什么。这件事在三种场合会救你:
- 老板问为什么没有面某个人——你调出那一行就能回答,不用重新翻简历。
- 候选人写信来问——你有一个基于内容的答复,而不是一句含糊的暂不合适。
- 你自己回头复盘——半年后发现某类人总是被挡下来,你能查到是哪一条标准在挡。
换句话说,它把一件本来只存在于脑子里的事变成了可以查的记录。这件事人也能做,只是几乎没有人会真的做——写下每一份简历的淘汰理由,成本高到不现实。
四、什么格式都啃得动
第三节刚讲过提取会失败,这里说的是另一面:在提取成功的前提下,机器能处理的格式范围比人愿意处理的范围大。一份排版混乱、内容跳来跳去的简历,人看两眼就烦了,很可能草草归到不合适。机器不会烦,它会把能抓到的都抓出来。
这一条对新马的招聘环境有额外的意义。这里的简历格式实在太杂了——本地大学模板、英式简历、中式简历、从求职网站导出来的标准格式,同一批里全都有。人在不同格式之间来回切换会累,而累就会走神。
四件事加起来,省的到底是哪一段时间
说省时间太笼统了,拆开看更有用。一个岗位从收到简历到定出面试名单,时间大致花在四段上:
| 时间花在哪 | 纯人工的时候 | 把读交出去之后 |
|---|---|---|
| 把文件打开、看完、记住谁是谁 | 占掉大半,而且越到后面越敷衍 | 基本消失,剩下抽查 |
| 在一堆人里对比谁更符合要求 | 靠印象,来回翻,容易反复 | 有一份带依据的排序打底,人只做调整 |
| 把决定和理由记下来 | 几乎不做,因为太费事 | 自动留痕,是顺带的 |
| 真正想清楚要不要见这个人 | 被前三段挤到只剩很少 | 变成主要花时间的地方 |
这张表最要紧的是最后一行。好的结果不是总时间变少了一半,而是时间的分布变了:本来花在翻文件上的力气,挪到了判断上。如果用了工具之后你只是提早两小时下班,而没有在中间那一档上多花时间,那这笔投入其实没有换来更好的招聘,只换来更快的招聘——而招聘这件事,快不是最重要的指标。
四件事放在一起看,共同点很清楚:它们全都属于“读”。读得完、读得稳、读得下记录、读得了各种格式。没有一件属于“判断”。这就是下一节要讲的另一半。
四件事人稳过机器
这一节和上一节一样重要,甚至更重要——因为上一节讲的是你可以交出去的部分,这一节讲的是你交出去就会出事的部分。
一、看得懂窄行业里的门道
每个行业都有一套外人看不出来的信号。做物流的人知道,同样写着运营主管,在货代公司和在仓储公司是两种完全不同的工作;做餐饮的人知道,管三家门店和管三十家门店是两个物种;做工程的人一看某个项目名称就知道这个人真正碰过什么。
这些信号不在字面上,在背景知识里。机器读到的是词,你读到的是词背后的那件事。更麻烦的是,这类判断很难写成标准——你没法在岗位要求里写一条“在货代公司做过而不是在仓储公司”,因为写出来就太窄了,而你心里其实允许例外。
新马这边还有一层:很多本地公司在网上查不到任何信息。一家做了二十年的家族企业,官网可能只有一页。机器对这个公司名一无所知,只能当成一个普通字符串;而你可能一眼就认出这是同行里做得挺扎实的一家。这种知识没有任何办法交给工具。
二、认得出转行的人身上能带走的本事
这一条是机器最系统性的短板。按标准比对的逻辑,天生对转行的人不友好——因为他的经历长得不像你写的那份标准。
举个常见的例子:一个做了五年门店店长的人来应聘客户成功岗位。按字段比,他没有相关行业经验、没有用过你要求的那几个工具、职位名称完全对不上,分数一定不高。但你看简历的时候可能会注意到:他每天要处理十几起客户投诉、要带一支流动率很高的团队、要在没有权限的情况下把事情摆平。这些正是客户成功岗位最难教的部分。
机器不会做这种迁移,因为迁移需要理解两件工作的内在结构,而不是比对它们的外在标签。这也是为什么第四节说,中间那一档才是你该花时间的地方——转行的人几乎全在那一档。
三、闻得出写得漂亮但站不住的那几段
简历上的夸大有很多层次。低级的夸大机器也能发现:时间对不上、职位跳得没有道理、同一段经历在两处写得不一样。高级的夸大机器发现不了,因为它在措辞里,不在事实里。
几种常见的写法:
- 把参与写成负责。项目里做了一部分,简历上写成主导,字面看不出破绽。
- 用团队的成绩当个人的成绩。写着让某项指标翻倍,但没说自己在里面做了哪一块。
- 把时间拉长。只写年份不写月份,两段经历中间的空档就消失了。
- 用大词盖住细节。整段都是战略、赋能、闭环,读完不知道他具体做了什么。
这几种写法有一个共同点:它们在字段层面全都是合格的。年限够、职位对、关键词齐全。人之所以能看出来,是因为人会问一个机器不会问的问题——如果这件事真的是他做的,那这一段该写成什么样?
四、最后那一下:要不要请这个人来聊
前三条是能力问题,这一条是责任问题。决定见不见一个人,是一个关于人的决定,必须由人来做,也必须由人来承担。
这不只是道德姿态,也有很现实的理由。一是你要能解释:候选人、老板、将来某一天的监管方,都可能问你为什么。二是你要能改:只有人做的决定才会有人回头去反省它;一个自动执行的规则,除非有人专门去看,否则它会安静地重复同一个错误几百次。
有没有第五件?有一个灰色地带
四件之外还有一个位置,两边都能做,做法不一样,值得单独说:把一段模糊的经历整理成可以比较的形式。比如某个人写着负责区域业务拓展,到底是自己跑客户还是管一个团队,简历上看不出来。
机器的做法是标出不确定,交给人。人的做法是先猜一个,然后在面试里验证。两种都对,但顺序不能反。常见的错误是让机器去猜——它猜的时候不会告诉你这是猜的,猜错了就变成一个看起来有依据的错误结论,比没有结论更危险。
所以挑工具的时候可以多问一句:遇到看不明白的段落,它是给一个中间分数,还是明确标出这里需要人看?后者是更负责任的做法,虽然用起来会让你多一点活。这一条也回到第四节那句话——一个合格的产品会承认自己不知道,而不是把不知道折算成一个分数。
说到底,机器给的是一个排队顺序,人给的是一个决定。排队顺序可以自动生成,决定不可以。这条线在下一节讲完偏见之后会更清楚——因为偏见带来的伤害,正是在决定被自动化的那一刻才真正落地的。
偏见:它不是道德话题,是质量问题
一讲到偏见,很多人会本能地把它当成一个价值观话题,然后跳过去。这里想换个说法:偏见首先是一个质量问题。一套系统如果对某一类人系统性地打低分,而这个类别和岗位表现没有关系,那它就是在稳定地漏掉合格的人。你损失的是人选,不只是名声。
这件事也不是这几年才被提出来的。在大公司的技术文档里,招聘一直是讲这类风险时的头号例子——因为它是典型的“机器分配机会”的场景。
这段文字值得逐句读。它说的是:AI 系统会对特定群体提供或者拒绝提供机会、资源或者信息,示例包括招聘、学校招生和贷款;在这些场景中,某个模型在特定人群中挑选优秀候选人的能力,可能要强于在其他人群中进行挑选的能力。
最后那半句是关键。它没有说模型会歧视,它说的是模型在某一群人里挑得准、在另一群人里挑不准。这就把偏见从一个道德指控,变成了一个可以测量的性能差异。而能测量的东西,就能查、能改。
一个容易被忽略的推论
如果偏见的本质是“在不同人群里的挑选能力不一样”,那有两个推论对你很实用:
推论一:你不需要证明谁有恶意,才能说这套系统有问题。没有人写过一条规则说要排除某一类人。差异是从数据、从标准、从看不见的关联里自己长出来的。所以查偏见的时候不要去找坏人,要去看结果。
推论二:偏见的方向不一定是你以为的那个。它可能表现为某个年龄段的人总是排在后半段,可能是某几所学校毕业的人分数偏高,也可能是简历写得朴素的人整体吃亏。你不去分组看,就永远不知道自己的那套标准偏在哪。
人也有偏见,这不是替机器辩护
有一种常见的反驳:人筛简历一样有偏见,凭什么单挑机器。这句话是对的,但它推不出该放心用机器的结论。差别在规模和速度。
一个人带着偏见筛简历,一天影响几十份,而且他的偏见不稳定——今天严明天松,中午吃饱了心情好一点。一套带着偏见的系统一天影响几千份,而且完全一致:同样的偏差,一次不落地重复。
但这里还有另一面,也要说公道话:人的偏见查不了,机器的偏见查得了。你没有办法把一位同事过去三年的判断拿出来做分组统计,但你可以把系统的输出拿出来做。所以正确的结论不是别用,而是——用,但是要定期查,并且知道怎么查。
下一节就讲怎么查。三个来源、三种症状、一个统一的查法。
偏见的三个来源,和一个统一的查法
偏见不是凭空出现的。它有三个来源,而且这三个来源在你这里的分量很不一样——多数中小公司真正的问题出在第二个,也就是标准本身,而不是那个大家都在担心的第一个。
来源一:来自历史——拿过去的人当样板
如果一套系统的做法是学习你过去录用过的人,那它会把过去的偏好一起学走,包括你不想要的那部分。过去某个岗位一直招男性,它就学到这个岗位的人长那个样子;过去偏爱某几所学校,它就把那几所学校当成了信号。
症状:某一类人总是排在后半段,而你说不清楚是哪一条标准把他们挡下来的。
好消息是,这个来源在中小公司往往不成立。因为你没有足够多的历史录用数据可以学——一年招二十个人,谈不上训练什么。所以如果供应商说他们的模型是学你的历史数据,你反而要多问一句:学的是谁的历史?如果不是你的,那是谁的,那批数据来自哪个市场、哪个年代。
来源二:来自标准——你自己写下去的那几条
这是最常见、也最容易改的一个来源。问题出在替身指标:你真正想要的是某种能力,但那种能力不好写,于是你写了一个和它相关的、好写的条件。
| 你写的条件 | 你真正想要的 | 它顺带筛掉了谁 |
|---|---|---|
| 必须是名牌大学 | 学习能力和基础扎实 | 转学、成人教育、海外非名校但很能干的人 |
| 必须待过大公司 | 见过规范的流程 | 在中小公司做得更全面的人 |
| 不接受空档超过半年 | 工作状态稳定 | 照顾家人、生育、进修、身体原因休息过的人 |
| 要求母语级中文书写 | 能写清楚给客户看的文字 | 写作能力很强但不是母语的人 |
| 要求本地工作经验若干年 | 熟悉本地客户和做事方式 | 刚回来的本地人、跨国调动过来的人 |
症状:换一个说法重新描述同一条标准,名次就大幅变动。这说明分数其实卡在措辞上,而不是卡在能力上。
改法也直接:把每一条替身指标换成它想代表的那件事,并且写成能在简历里找到的形式。不写名牌大学,写“能举出一段需要快速学会新东西的经历”。这样写更难,但它同时提高了准确度和公平度——这两件事在这里是一件事。
来源三:来自关联——你删掉的字段还在别处
这一条最反直觉。把性别、年龄、照片从简历里删掉,并不等于把这些信息删掉了。毕业年份能推出年龄,某些学校和社团带着性别或者族群色彩,居住区域在很多城市和收入相关,名字本身就透露很多。
症状:你删掉了几个敏感字段,重新跑一遍,名次几乎没有变化。这说明那些信息本来就是通过别的路径进来的。
这一条没有彻底的解法,只有减轻的办法:一是尽量减少非必要字段进入打分;二是接受一个事实——盲筛只能挡住直接信息,挡不住关联信息,所以事后的分组检查不能省。
三个来源之外,还有一个放大器
严格说这不是第四个来源,但它决定了前三个来源的伤害有多大:自动化本身。
同样一条写歪的标准,如果是一位同事在心里默默使用,它一天影响几十份,而且这位同事有可能在某一天突然意识到不对,然后改掉。如果它被写进系统,它一天影响几千份,一次不落,而且没有人会突然意识到——因为系统不会觉得别扭。
这带来两条很实际的做法。第一,越是自动执行的规则,越要写得窄。模糊的偏好留给人,明确的事实留给系统。第二,凡是自动挡下来的人,都要留一个能捞回来的通道,并且要有人定期去那个通道里看。一个只进不出的过滤器,用久了一定会把某一类人整个筛没,而你从数据上看不出来,因为那类人早就不在你的名单里了。
说得更直接一点:把判断自动化,等于把你今天的偏好写死成明天的规则。你今天的偏好未必错,但一年之后市场变了、岗位变了、团队缺的东西变了,规则不会自己跟着变。所以第十节那张每周表里,最后一行是每季度回头看——那不是形式,那是唯一能让规则跟上现实的机制。
统一的查法:分组看名次
三个来源,一个查法,而且不需要任何专门工具:
- 拿一批已经跑完的简历,比如最近一个岗位的全部投递。
- 按几个维度分组:毕业年份区间、学校类型、性别(如果你有这个信息)、简历语言、是否有职业空档。
- 算每一组进入前二十名的比例。
- 把差距明显的那一组挑出来,随机看十份原始简历。
- 问自己一句:这个差距,能不能用岗位本身的要求解释?
能解释就留着,不能解释就去改标准。请注意最后一步的顺序:先改标准,再考虑换工具。绝大多数情况下问题在标准里,换一家供应商只会让同样的偏差换一个界面重复一遍。
为什么按关键词打分这条路已经走不通了
回到第二节留下的那个伏笔。搜索结果里排在最前面的那些文章,在教求职者怎么让简历通过机器初筛,办法归纳起来就一句:把招聘广告里的词,搬到简历里去。
这个办法之所以被反复传授,是因为它对不少系统真的有效。而它有效这件事本身,就宣告了一种打分方式的死亡。
关键词打分的三个硬伤
硬伤一:它奖励的是抄写,不是经历。一个照着广告抄了一遍的人,和一个真做过五年的人,在词频上可能看不出差别。甚至抄的人还占优——因为他用的词和你写的一模一样,而真做过的人可能用了行业里另一套叫法。
硬伤二:它分不清出现和会用。某个软件的名字,可能出现在“熟练使用”那一栏,也可能出现在“希望学习”那一句里,还可能出现在前公司的名字里。只数出现次数,这三种情况一样重。
硬伤三:它对同义说法很脆。你写客户成功,他写客户维护;你写数据分析,他写做报表;你写团队管理,他写带过八个人。意思一样,词不一样,分数就差一截。而这恰恰对老实人不利——越是不研究技巧的人,越容易用自己的说法。
三个硬伤加起来的结果很讽刺:这种打分方式筛掉的往往不是不合适的人,而是不懂技巧的人。
该用什么代替:证据式打分
换一个思路。不要问某个词出现了几次,要问一个更接近人的问题:这份简历里有没有一段文字,能作为这条标准成立的证据?
两者的差别可以摆成一张表:
| 比较项 | 关键词打分 | 证据式打分 |
|---|---|---|
| 问的问题 | 这个词出现了几次 | 哪一句话说明了这件事 |
| 输出是什么 | 一个分数 | 一个分数,加一段原文摘录 |
| 能不能核对 | 不能,你只看到结果 | 能,点开就看到依据 |
| 遇到同义说法 | 漏掉 | 能对上,因为看的是意思 |
| 遇到堆词的简历 | 分数上去 | 找不到支撑那句话的经历,分数上不去 |
| 三个月后能不能解释 | 不能 | 能,调出那一行 |
这张表里最要紧的是第三行和最后一行。能不能核对,决定了你是在用一个工具还是在信一个黑盒子;能不能解释,决定了这套流程在你公司里能不能活过第一次质疑。
同一份简历,两种打法会得出什么
用上一节那个客户支持主管的岗位举例。有一位候选人,做了四年,最近一段是在一家本地餐饮连锁做门店督导,简历写得很朴素,全篇没有出现工单、客户成功、服务指标这些词。下面这张表是示意数据,用来说明两种打法的差别,不是任何真实产品的输出:
| 标准 | 关键词打法会怎么看 | 证据式打法会怎么看 |
|---|---|---|
| 面对客户满三年 | 没有出现客户支持、客户成功,判为弱 | 门店督导每天处理顾客投诉,写在职责第二行,判为满足 |
| 带过人 | 没有出现团队管理、下属,判为无 | 写着负责三家门店的排班与带教,摘出这一句,判为满足 |
| 中英文对外书写 | 只看到语言一栏写着中英文,判为一般 | 写过给总部的月度报告和门店操作说明,判为满足 |
| 处理过投诉升级 | 没有出现升级这个词,判为无 | 有一段写着处理食品安全投诉并对接监管部门,判为强 |
| 最终位置 | 排在中后段,多半不会被打开 | 进入可以考虑那一档,人一看就想约 |
差别不在算法多聪明,在问的问题不一样。前者问这些词在不在,后者问有没有一段经历能证明这件事成立。而在新马这样的市场,后者尤其重要——这里大量的中小企业岗位名称五花八门,同一件工作在三家公司可能叫三个名字,只认名称的打法会把大批合适的人挡在外面。
拿三个问题去试供应商
第二节列了三个测试题,现在补上该怎么用。在试用期间,你自己造三份简历,然后看结果:
- 抄写测试。把岗位描述里的整段话,稍微改写一下放进一份很单薄的简历里。如果这份简历冲到前面,说明它在数词。
- 同义测试。拿一份真实的合格简历,把里面的关键说法全部换成同义的另一种叫法,内容一个字不改。如果分数掉很多,说明它对说法太敏感。
- 一次出现测试。把某个要求的技能,只在兴趣爱好那一栏提一次。如果它被算成具备这项技能,说明它不看上下文。
三份简历,半小时能做完,比看任何产品介绍都管用。这三题都过得去的产品,才值得进入下一轮讨论。
顺便回答一个很多人心里的疑问:既然求职者可以针对机器优化简历,那这场博弈是不是没有尽头?在证据式打分下,情况会好一些——因为要伪造一段能自圆其说的经历,比堆几个词难得多,而且那段编出来的经历会被带进面试,在面试里更容易露馅。你把关口从数词换成看证据,等于把博弈从简历环节推到了面试环节,而面试环节是人的主场。
安全边界:机器排序并解释,人来决定
把前面几节收拢,那条边界可以用一句话说完:机器负责把简历读完、按你的标准排好队、并且为每一个位置给出依据;人负责看依据、做决定、并且为决定负责。
听起来简单,落到日常操作上却有很多细节容易走样。下面按四个位置说清楚。
位置一:哪些动作可以完全自动
这些动作不涉及对人的评价,自动化没有争议:
- 收件、去重、把同一个人的多次投递合并到一起。
- 提取字段,建立可以检索的候选人档案。
- 发送收到你的申请的回执。
- 按硬性事实分流,例如工作准证类型不符合这个岗位的法定要求。这一类是事实判断,不是能力判断。
- 把结果整理成一张待处理的名单。
位置二:哪些动作可以自动,但必须留痕并可复核
这一层是打分和分档。可以让机器做完,但要满足三个条件:
- 每一条评分都能点开看到原文依据,没有依据的分数不算数。
- 读不出来的简历有独立状态,不混进不达标那一堆。
- 人可以随时把某个人从任何一档拉到任何一档,并且这个动作本身也留下记录。
第三条常被忽略。如果人不能轻易推翻机器的分档,那这套流程实际上已经在替你做决定了,只是换了一种说法。
位置三:哪些动作必须由人做
- 决定见谁。哪怕只是从名单上勾选,也必须是人在勾。
- 决定不见谁。尤其是中间那一档里被划掉的人,一定要有人真的看过。
- 给出拒绝的答复。可以用模板,但发出去之前要有人过一眼。
- 处理候选人的追问。这件事永远不能自动回复。
位置四:哪些事一件都不要做
这一组是红线,写在这里免得有人越界:
- 不要让系统自动发出拒信。成本极低,风险极高:一次配置错误,几百个人同时收到一封不该收到的信,而且收不回来。
- 不要用简历以外的材料去给人打分。把候选人的社交账号内容抓来做评估,在合规和常识两方面都站不住。
- 不要用与工作无关的个人属性做条件。包括那些看起来中性、实际上是替身的条件,第八节已经列过。
- 不要把分数当成可以对外说的客观事实。它是你自己那套标准的产物,换一套标准就是另一个数字。
两个你迟早会遇到的两难
边界画在纸上很清楚,真到了现场会有两种情况让人想破例,先想好答案:
两难一:岗位很急,中间那一档有一百二十份,看不完。这时候最容易做的事就是只看前二十名。折中的办法不是全看,而是抽样加窄化:先把中间那一档按最关键的那一条硬条件再排一次,只看满足这一条的那一批;剩下的先不删,等这一轮面试完还没定人再回来看。关键是别把没看过的人当成看过了——名单上要留一个明确的标记,写着这批还没有人打开过。
两难二:用人经理只想看前十名,不想听你解释依据。这很常见,也很合理,因为他有本职工作要做。解法不是说服他改,而是把复核的责任明确留在 HR 这边:你先把中间那一档过完,再把捞回来的人放进给他的名单里,并在旁边写一句为什么值得看。他要的是一份短名单,你要的是短名单里没有漏掉人——两件事不冲突。
一个能落地的每周节奏
边界画好了,还要变成日常的做法,不然过两周就忘了。这个节奏适合一位 HR 加一位用人经理的小团队:
| 时间 | 谁做 | 做什么 | 要多久 |
|---|---|---|---|
| 每天 | HR | 看读不出来那一档,逐份打开原件处理掉 | 十分钟 |
| 每周一次 | HR | 把可以考虑那一档全部看一遍,往上或往下挪 | 一小时 |
| 每周一次 | 用人经理 | 从达标档里抽五份,核对依据是否站得住 | 二十分钟 |
| 每个岗位收尾 | 两人一起 | 回看被挡下来又被捞回来的人,找出是哪条标准挡的 | 半小时 |
| 每季度 | HR | 做一次分组检查,看名次分布 | 一小时 |
加起来一周不到两小时,换来的是一套你随时能解释、也随时能修的流程。没有这个节奏,工具用三个月就会退化成一个只看第一页的名单机器——大家只信前十名,中间那一档再也没有人打开。
在新加坡和马来西亚,还要多想三件事
前面十节讲的是技术和判断,适用于任何地方。这一节讲的是你所在的地方特有的部分。先说清楚:下面是提醒你去问对问题,不是法律意见。真要落地,找一位熟悉本地个人资料保护规定的律师看一遍你的流程,成本远低于事后处理一次投诉。
一、简历是个人资料,收进来就有责任
新加坡和马来西亚都有各自的个人资料保护法律,条文不同,但落到招聘上的骨架是相似的三条:收集要有目的、使用不能超出那个目的、保留不能无限期。
把这三条翻译成日常动作,大概是这样:
| 骨架 | 在招聘里对应什么 | 常见的疏忽 |
|---|---|---|
| 目的要说清楚 | 在收简历的那个页面或者邮箱自动回复里,写明收来做什么 | 只有一句我们会保留你的资料,没说保留多久、用来干什么 |
| 使用不超出目的 | 为 A 岗位收的简历,要用到 B 岗位需要另行说明 | 把所有简历倒进一个人才库反复使用 |
| 不能无限期保留 | 定一个保留期限,到期清理 | 三年前的简历还躺在共享文件夹里 |
| 要能回应查询 | 候选人问你手上有他哪些资料,你要答得出来 | 资料散在邮箱、表格、系统三个地方,答不齐 |
| 要有人负责 | 指定一个人对接这类询问 | 没人认领,来信在群里转一圈没下文 |
引入 AI 打分之后,这几条并没有变,但难度变了。因为你现在多了一样东西:分数和评语。它们也是关于这个人的资料,同样属于你要负责的范围。所以两个问题要提前想好——这些分数保留多久,以及如果候选人来问为什么,你打算给他看到什么程度。
二、要不要告诉候选人你用了机器
各地对这件事的具体要求不一样,也在变。但撇开合规不谈,从实际角度看,说出来几乎总是更划算的。
理由有三个。第一,这件事瞒不住多久,被动被发现比主动说明难堪得多。第二,说明本身可以降低误解——很多人反感的不是机器参与,而是以为机器替人做了决定。第三,它逼着你把流程写清楚,而写清楚的流程更经得起检查。
一句够用的说明,大概是这样的意思:我们会用工具协助整理和初步比对简历,所有面试与录用决定均由我们的同事作出;如你希望了解你的申请的处理情况,可以联系某某。关键是最后半句要真的有人接。
保留期限怎么定,才不会变成一句空话
很多公司写了保留期限,但没有人执行,因为没有人知道到期那天该做什么。让它落地的办法是把期限绑在一个自然发生的动作上,而不是绑在日历上。三个可以照抄的做法:
- 岗位关闭时做一次分流。这个岗位定人之后,问一句:哪些人明确说过愿意被保留?没说过的,按你写明的期限处理,别默认留下。
- 把删除写进某个已经存在的例行事项里。比如每季度做分组检查的那一天,顺手清一次到期的资料,一次做两件事更容易坚持。
- 指定一个人签字。不是要走流程,而是让这件事有主人。没有主人的清理动作,第二次就没了。
另外提醒一句:清理不只是清系统里的那一份。简历常常同时躺在邮箱附件、共享文件夹、某个人的电脑桌面上。写流程的时候把这三个地方一起写进去,否则删了主库只是心理安慰。
三、简历里的身份与准证信息,要单独对待
这一条是新马特有的,也最容易出事。岗位是否可以聘用非本地人、需不需要额外的准证或者配额,这些是法定的硬条件,和能力评估是两回事。
处理原则有三条:
- 把它放在打分之外。它是一个是否符合的判断,不该转换成分数参与排名,否则会和能力混在一起,事后说不清。
- 把依据留下来。因为身份类型不符合而不推进的,记录写清楚是依据哪一条规定。
- 不要用它做旁敲侧击的推断。不要从毕业院校所在国、名字、语言习惯去猜身份。要问就在申请表里正式地问一栏,问完就按答案处理。
顺带一提:多语言简历的公平问题
最后一条常被忽略。如果你的岗位不要求中文书写能力,那么中文简历和英文简历应该得到同样的处理质量。实际情况往往不是——很多工具对英文的处理更成熟,中文简历的字段提取失败率更高,于是中文投递的人整体吃亏。
查法很简单,也很值得做:把最近一个岗位的简历按语言分两组,比较提取失败率和进入前二十的比例。如果差得离谱,那不是候选人的问题,是工具的问题,你可以拿这个结果去找供应商谈。
两周试用法:在相信它之前先并跑一遍
知道了边界,接下来是怎么验证。这一节给一个两周的做法,不需要额外预算,也不打扰正在进行的招聘。核心思想只有一句:先让它和你并排跑,再让它小范围上场,最后把规矩写下来。
第一周:只看不用
找一轮已经招完的岗位,最好是招完超过一个月、结果你还记得的那种。步骤如下:
- 把那一批简历全部导进去,标准按当时的岗位要求设定,不要为了好看而调松。
- 先不看机器的结果,自己(或者当时负责的同事)凭记忆和原件重新排一遍前二十。
- 两份名单并排放。算三个数:两边都进前二十的有几个、只有你选中的有几个、只有机器选中的有几个。
- 重点看第三堆——机器选了你没选的人。逐份打开看,问自己当初为什么跳过他。有时候你会发现是自己漏了,这正是这套工具的价值所在。
- 再看第二堆——你选了机器没选的人。这一堆告诉你机器缺了哪种判断,多半和第六节讲的四件事有关。
第一周的产出是一份对照,不是一个结论。不要在这一周决定买不买。
第二周:小范围用
挑一个正在招、但不紧急的岗位。千万别拿最急的那个岗位当试验田——一急就会图快,图快就会跳过复核,跳过复核这次试用就白做了。
- 机器负责排序和分档,人负责逐条读它给出的依据。
- 准备一张空白清单,标题写:站不住的理由。每看到一条依据对不上、或者摘出来的原文和结论不符,就抄一行。
- 中间那一档全部由人看完,被捞回来的人单独标记。
- 读不出来那一档每天清空一次。
- 周末把清单分类:是提取错了、是标准写歪了,还是它确实理解不了这类经历。
两周之后:把规矩写下来
不管你最后决定用还是不用,都要写这三条,写在一张纸上,发给会用到的人:
- 哪些岗位可以这样用。通常是标准清楚、投递量大的岗位;越是靠人脉和判断的岗位越不适合。
- 哪一档必须由人复核。至少是中间那一档和读不出来那一档,一次都不能省。
- 多久回头查一次。建议每个岗位收尾时看一次捞回来的人,每季度做一次分组检查。
三个把试用做废的常见错法
见过不少两周走完却什么都没得到的团队,原因基本逃不出这三个:
错法一:把标准调松,好让结果好看。第一周并跑的时候发现机器的名单和自己的对不上,于是回头去改标准,改到两份名单差不多为止。这样做等于自己给自己写答案,两周结束你只证明了一件事——工具能复现你的偏好,而这本来就不是你要买的东西。
错法二:只用一个岗位、一批简历就下结论。某一批简历格式特别整齐,或者某个岗位的标准特别好写,结果会显得很漂亮。至少跑两个类型不同的岗位:一个标准清楚、投递量大的,一个偏经验判断的。后者大概率会暴露问题,而那正是你需要知道的。
错法三:只有一个人参与。试用从头到尾只有 HR 一个人在弄,用人经理完全没看过依据。等到真要上线,他一句“这分数怎么来的我不清楚”就能把整件事推翻。第一周并排排名的时候,就该拉上他一起。
怎么算试用成功
用四个问题收尾,全是能回答的问题,不是感觉:
| 问题 | 什么样算过关 |
|---|---|
| 提取这一关稳不稳 | 抽查的简历里,字段基本对得上原文;读不出来的有单独标记 |
| 依据站不站得住 | 随手点开十条评分,至少八条的原文摘录能支撑结论 |
| 有没有帮你捡回人 | 第一周的对照里,机器选中而你当初漏掉的人里,至少有一个你现在觉得该面 |
| 省下的时间有多少 | 同样一批简历,从收到到定出面试名单,比过去少花多少个下午 |
四个问题里,第三个最容易被忽略,也最能说明问题。省时间只是效率,捡回人才是效果——如果两周下来一个都没捡回来,那这套工具在你这里的价值只有省力气,值不值那个钱就要重新算。
最后提醒一句:两周结束之后,把当时用的那一批简历和结果留一份存档。半年后你想比较自己有没有进步,需要一个起点。没有起点,任何改进都只是感觉。
常见问题
用了 AI 筛简历,会不会漏掉好人才
会,但漏的类型和人漏的类型不一样,而且是可以查的。机器容易漏的是经历不标准的人——转行的、职业路径弯过的、用自己的说法描述工作的。人容易漏的是排在第三百份之后的所有人。两种漏法你都要防:前者靠人必须看完中间那一档,后者正是机器帮你解决的。真正危险的是既用了机器又不看中间那一档,那等于把两种漏法叠在一起。
它能不能直接告诉我该录用谁
不能,而且任何声称能的产品都该被多问几句。它输出的是一个基于你自己写的标准的排队顺序。标准换一套,顺序就变一遍。录用是一个牵涉团队、预算、时机和直觉的决定,这些信息大部分不在简历里,也不该在。把排队顺序当成候选名单用,把决定留给人,是唯一稳的用法。
小公司一年只招十几个人,有必要用吗
看的不是一年招几个人,是单个岗位收几份简历。一年招十二个人、每个岗位只收二三十份,那用纸笔加一张评分表更快,也更贴切。但如果某一个岗位一次涌进两三百份——在新马,行政、客服、销售这类岗位很常见——那这一个岗位就值得用。换句话说,它解决的是峰值问题,不是总量问题。
候选人已经在针对机器优化简历了,这不是白玩吗
取决于你的工具在数词还是在看证据。数词的系统确实白玩,甚至比人工还差,因为它奖励技巧、惩罚老实。看证据的系统要难糊弄得多——编一段能自圆其说、面试时还禁得住追问的经历,成本比堆几个关键词高一个量级。第九节那三个测试题,半小时就能试出你面前这套属于哪一种。
要不要把机器的评分给候选人看
分数不用给,理由可以给。给分数会引出一场关于分数怎么算的辩论,而那套算法本来就是你内部的判断标准,没有对外解释的义务,也很难解释得清。但如果候选人问为什么没有进入下一轮,你有能力给一个基于内容的答复——例如这个岗位要求某段特定经历,你的简历里我们没有找到——这比一句暂不合适体面得多,对你的招聘品牌也有好处。
系统给的理由,我要不要每条都核
开始的时候要,稳定之后抽查。头两周把每一条都核一遍,你才知道它在哪类判断上不可靠。之后可以降到抽查:每个岗位随手点开十条,看原文摘录支不支撑结论。抽查发现问题就回到全核。这个节奏和第十节那张每周表是配套的。
它能不能替我写岗位描述和面试问题
写初稿可以,直接用不行。岗位描述是整条链的源头——第四节讲过,标准含糊,后面全部跟着含糊。让工具起个草没问题,但那几条硬条件必须由最懂这个岗位的人自己写,而且要写成能在简历里找到对应句子的形式。面试问题同理:生成一批当素材,挑出真正指向你在乎那几条的题目。
用了之后,招聘周期真的会变短吗
从收到简历到定出面试名单这一段会明显变短,但整个周期未必。因为周期里最长的那几段往往不在筛选上——是等用人经理有空看名单、等候选人回复约时间、等第二轮面试凑齐几个人的日程。如果你的瓶颈在那几段,先去修那几段,比买什么都有效。判断方法很直接:把上一个岗位从开放到发出录用通知的时间,按段拆开记一遍,看哪一段最长。多数公司拆完会发现,筛选只占其中一小块。
我们的简历有中文有英文,会不会不公平
很可能会,而且这件事你自己就能量出来。不少工具对英文的处理更成熟,中文简历的字段提取失败率更高,于是中文投递的人整体吃亏——这不是价值判断,是技术差距造成的结果差异。做法是把最近一个岗位的简历按语言分成两组,比较两个数:提取失败率,和进入前二十的比例。差得离谱就拿这个结果去找供应商谈,或者在流程里加一条——中文简历的读不出来那一档,人必须全部打开。
它会不会让我们的招聘变得千篇一律
如果你只看达标那一档,会。因为达标的定义就是长得像你写的标准,而标准是照着过去的人写的。防这件事有一个很省力的办法:每个岗位定人之后,回头看一眼被捞回来的人——就是机器没给高分、但最后进了面试甚至录用的那些。如果连续几个岗位都有这样的人,说明你的标准需要放宽某一条;如果一个都没有,那要警惕的不是工具,是你自己已经不再打开中间那一档了。
要不要为了机器改我们的招聘广告
不要为了机器改,但可以为了双方都清楚而改。把职责写得具体、把硬条件写清楚、说明希望收到文字版的简历文件,这几件事对候选人和对系统都有好处。真正要避免的是反过来——为了让机器好比对,把广告写成一串关键词,那样吸引来的正好是最会针对关键词写简历的那一批人。
几个说法的对照
找资料的时候会碰到不同叫法,对照一下省得绕:
| 常见说法 | 指的是什么 | 容易混淆的地方 |
|---|---|---|
| 简历解析 | 第一件事:把文件变成字段 | 解析成功不等于评估准确,两回事 |
| 简历筛选 | 第二和第三件事:对照标准并分档 | 有人用它泛指整个流程,问清楚对方指哪一段 |
| 智能匹配 | 通常指对照这一步的算法 | 有的是数词,有的是看语义,差别很大 |
| 招聘管理系统 | 管整个流程的系统,筛选只是其中一环 | 它未必自带 AI 打分 |
| 人才库 | 把历史候选人存起来反复使用 | 涉及保留期限和使用目的,见第十一节 |
| AI 面试 | 另一件事:自动化的面试环节 | 和简历筛选是两个话题,风险也不同 |
如果你想把整个招聘流程的各个环节看一遍,而不只是筛选这一段,那篇 招聘系统是什么?它到底帮HR省下哪些时间和成本 从头讲了一遍。英文那边还有一篇专门讲同一个题目的 AI Resume Screening: What Works and Where It Falls Over(是英文文章),角度略有不同,可以对着看。
把这篇收成一页
如果只记得住八句话,记这八句:
- AI 读简历是三件事:提取、对照、排序。问准不准问不出答案,要问哪一步在你这里最容易坏。
- 最先坏、也坏得最安静的是提取。读不出来的简历必须有独立状态,绝不能默默算成低分。
- 对照的质量等于你写的标准的质量。写不出能在原文里指出对应句子的条件,就别交给机器比。
- 分数是排队号码,不是结论。看名单的时候眼睛停在依据上,不要停在分数上。
- 机器稳过人的四件事全属于读,人稳过机器的四件事全属于判断。边界就画在这两栏中间。
- 偏见首先是质量问题:它让你稳定地漏掉合格的人。三个来源里,中小公司的问题多半出在自己写的标准上。
- 按关键词打分已经走不通,因为它奖励抄写、惩罚老实。要看的是有没有一段原文能当证据。
- 两周试用:先并跑,再小用,最后写规矩。别拿最急的岗位当试验田。
还有一句不在清单上、但比清单上任何一条都重要:中间那一档一定要有人看完。达标的那些人机器和你多半意见一致,不达标的看一眼就知道,真正的好人选藏在有一两条对不上的那一堆里——因为他们的经历不标准,而不标准往往正是他们值钱的地方。省掉这一步,这套工具就从帮手变成了筛子。
这个网站上其他的中文文章都收在 Orova 中文博客 里。想先弄清楚这类系统整体长什么样,看 招聘系统是什么?它到底帮HR省下哪些时间和成本;想要一套不依赖工具的人工筛选流程,看 简历筛选怎么做?五百份简历的三层筛选法;英文那边有一篇同题的 AI Resume Screening: What Works and Where It Falls Over(是英文文章),以及一篇讲怎么用证据代替直觉的 Hiring Bias: Why Evidence-Based Screening Beats Gut Feel(是英文文章)。
如果你决定试,边界这一段请读完
上面这两周,用一张评分表和一个下午也能走完,二三十份简历的岗位确实不需要买什么。这一节只是告诉你还有另一条路,以及它的边界在哪——边界那段请一定读完,免得带着错的期待去用。
Orova Recruit 做的正好是这篇讲的前两件事和第三件事的输出部分。具体来说:先为每个岗位把标准定下来,也就是第四节那一段最花心思的活;同一个岗位一次最多处理五百份简历,按你的标准分成通过、待定、不通过;读不出来的简历有单独的状态,不会被默默算成低分——这正是第三节反复强调的那一条;每一个评分都把依据从简历原文里摘出来,对应第九节讲的证据式打分,三个月后有人问起,你调出那一行就能回答。往下还能生成面试问题、把面试录音转成文字存进候选人档案、排面试的时段、单个或者批量做出决定并导出成 PDF 存档。
边界必须说清楚,这几件事它不做:
- 它不替你做决定。分档是分档,按下决定按钮的永远是人——第十节那四个位置,位置三那一栏它一件都不碰。
- 它不发布招聘广告,也不替你去外面找人。简历从哪里来是你的事,它接手的是简历已经回来之后那一段。
- 它不管薪酬和考勤。那是另一类系统的活。
- 它不替你写那份标准。可以帮你起草,但第四节说过,标准含糊后面全部跟着含糊,这份心思省不掉。
- 它不做分组偏见检查的自动报警。第八节那套分组看名次的动作,仍然要有人定期去做。
说得更直白一点:它替你省的是读完五百份的力气和留下记录的成本,不是判断力。这个人的经历能不能迁移、这段话是不是写得太漂亮、要不要请他来聊一次——这些永远是你的活。第一轮最好还是按两周试用法自己走一遍,走完你才知道,哪一段值得交出去。
如果你决定试,边界这一段请读完
Orova Recruit 做的正好是这篇讲的前两件事:先为每个岗位把标准定下来,同一个岗位一次最多处理五百份简历,按你的标准分成通过、待定、不通过;读不出来的简历有单独状态,不会被默默算成低分;每一个评分都把依据从简历原文里摘出来,三个月后有人问起,调出那一行就能回答。往下还能生成面试问题、把面试录音转成文字、排面试时段、单个或批量做出决定并导出 PDF。边界说清楚:它不替你做决定,不发布招聘广告,不替你找人,不管薪酬考勤,也不替你写那份标准。
看看 Orova Recruit