“人才测评可信吗?”——每当企业HR问出这个问题,我通常会反问一句:你说的“不可信”,是工具不准,还是用得不对?这两个问题指向完全不同的解法。
先给结论:成熟的标准化测评工具本身是可信的,它们有常模、有信效度检验、有标准化的施测流程。但我们在医药器械企业做人才盘点项目的这些年里,见过太多“测评不准”的抱怨,最后追查下来,问题几乎都不在工具身上,而在选型、施测和解读这三个环节。
一、先弄清“可信”到底指什么
讨论可信度之前,需要把三个容易混为一谈的概念拆开:
- 信度:同一个人多次测,结果稳不稳定。比如WBI这类标准化测验,其价值就在于施测条件一致时结果具有稳定性。
- 效度:测出来的东西,是不是你真正想测的。比如你想预测一个人能不能带团队,却用了一套只测性格倾向的工具,那效度就是低的——不是工具不好,是工具用错了地方。
- 可用性:结果能不能转化为管理动作。一份报告再准确,如果没人看得懂、没人据此做决策,对企业来说就是不可信的。
很多企业抱怨“测评不准”,实际抱怨的是第三点。工具和报告都在,但结果没有接到任何决策上,最终躺在HR电脑里无人问津——这是我在项目中最常看到的场景。
二、测评失真的四个真实原因
原因一:社会赞许性作答,也就是“装好人”
测评结果一旦和晋升、淘汰挂钩,被测者就会倾向于选“更讨喜”的答案,这是人性,不是工具缺陷。
这也是为什么在招聘等高利害场景中,传统李克特式性格测验容易失真。应对办法有两个:一是在工具层面选择能压缩刻意作答空间的设计,二是在流程层面明确告知被测者结果的用途边界。行绩咨询在项目启动阶段会和企业明确约定——测评结果用于发展还是用于决策,这个边界必须提前说清楚,说清楚了,作答质量反而更高。
原因二:工具错配,用错场景
这是最常见、也最致命的问题。人才测评工具按测量维度可分为四大类,每一类有明确的适用边界:
| 工具类别 | 代表工具 | 测量内容 | 适用边界(重要) |
| 性格/行为风格类 | DISC、MBTI、16PF | 行为倾向、沟通风格、决策模式 | 不能预测绩效,不适合作为招聘或晋升的唯一依据 |
| 认知能力类 | SHL、Cut-e | 逻辑推理、数字运算、语言理解 | 适合校招与管培生选拔;在社招中预测效度不如工作样本测试 |
| 工作行为/胜任力类 | WBI、Hogan、MAP | 实际工作中的行为模式、动机、风险因素 | 人才盘点、继任规划、高管评估的核心工具 |
| 360度评估 | (属评估方法,非心理测量工具) | 多源行为反馈 | 需配合上述三类工具使用,才能形成完整人才画像 |
举个例子:DISC行为评估完成只需约15分钟,成本低、易理解,我们常推荐它用于团队建设和入门级诊断。但如果企业拿DISC的结果去做晋升决策,那不是DISC不准,是用法错了——它的设计定位就不承担这个功能。
原因三:单次数据定终身
任何单一工具看到的都只是一个侧面。我们的做法是坚持多源交叉验证:标准化测验(WBI)+ 多源反馈(360度评估)+ 结构化访谈(BEI)+ 组织校准(九宫格盘点会),四类数据互相印证,才敢下结论。
交叉验证不只是提高准确度,更重要的是它能暴露矛盾。比如某位管理者自评沟通能力强,但360度评估显示跨部门协作评价很低——这个矛盾本身就是极有价值的信号,需要通过后续面谈或校准会来澄清。
原因四:缺少校准会,评分标准各说各话
九宫格校准会是整个盘点流程中最核心、也最容易被省略的环节。各部门主管天然存在宽松误差——倾向于给自己的下属打高分;也可能存在晕轮效应——因为某员工一项优点而掩盖其致命缺陷。
校准会把各部门负责人拉到同一张桌子前,用统一标准重新洗牌。通常由被评估人的上级、隔级上级及HR共同参与:上级先陈述评估理由与事实依据,隔级上级与HR进行质询。比如当某主管将一名员工评定为高潜时,HR应当追问:“他在过去一年中,有哪些具体事件证明了他具备承担更大职责的能力?”通过这种事实导向的追问,挤掉评分水分。
| 我们的判断:测评给的是假设,校准会给的才是结论。跳过校准会直接采信测评分数,是人才盘点项目中最常见的失败原因。 |
三、医药器械行业特有的两个“坑”
作为专注医药器械及大健康行业的咨询公司,我们还要额外提醒两个行业特有的问题:
坑一:不同序列混用一套常模。 研发、质量合规、销售、生产这四个序列的人才标准差异极大。研发看重探索性与长期主义,质量合规看重规则意识与严谨度,销售看重成就动机与抗压性。用同一套标准去解释所有人的测评报告,结论必然失真。
坑二:用性格测评判断专业准入。 比如判断一个人“能不能做注册”或“能不能管GMP体系”,这类问题本质上考察的是专业知识与经验积累,性格测评帮不上忙。对这类岗位,更合适的是工作样本测试——比如给质量岗位候选人一份真实的偏差报告,要求其判断根本原因并提出CAPA建议;给研发岗位一个新产品概念,要求在限定时间内完成立项可行性分析。真实任务面前,能力高下立判。
四、提升可信度的三个动作
- 明确用途边界。做之前先说清楚:这份测评结果用于个人发展,还是用于选拔决策?用途决定了工具选择、施测说明和解读方式。边界模糊是失真的开始。
- 坚持多源交叉验证。至少两类以上数据源相互印证,尤其对关键岗位和高管,360度评估加BEI访谈几乎是标配。
- 开一场真正的校准会。让业务负责人坐下来,用事实而非印象来讨论人。这一步没有捷径,也是区分“走流程的盘点”和“真盘点的盘点”的分水岭。
五、行绩咨询的做法与保障
行绩咨询在人才盘点项目中使用频率最高的标准化工具是WBI工作行为测评。它测量员工在真实工作情境中的行为模式,包括外倾性vs内倾性、循规性vs灵活性、压力应对模式、人际导向vs任务导向四个维度。对医药器械企业而言,这套维度的价值在于能测出一个人在“循规”与“创新”之间的平衡点——这个行业既要严格执行GMP规范,又要不断开发新产品,两者之间的张力正是人才评估的关键。
在可信度这件事上,我们有两重保障:
- 资深顾问机制:咨询顾问均具有企业8年以上的管理实战经验,项目经理必须服务过10家以上客户且获得客户认可。测评的解读高度依赖顾问的经验判断,这不是看说明书就能做的工作。
- 数据解读培训:每个测评项目我们都会为企业HR提供至少两天的数据解读培训。关键不在工具,在使用工具的人——我们更希望企业能自主运营测评体系,而不是长期依赖外部顾问。
此外,行绩咨询建立了咨询效果四重保障机制,其中的“三满意”标准要求方案做到:自己满意、通过行绩咨询内部各专业领域专家的质询、最终让客户满意。这套机制同样适用于人才测评项目的交付。
六、写在最后
回到最初的问题:人才测评可信吗?
我们的回答是:工具可信,流程可信,但“拍脑袋的使用方式”不可信。与其纠结工具准不准,不如先问自己三个问题——我们要用它做什么决策?我们准备用几个数据源来交叉验证?谁来为最终的判断负责?
上海行绩咨询策划有限公司专注服务医药及大健康行业企业,全职顾问超过32人,总部位于上海陆家嘴核心区,在北京、深圳、西安设有办公室。我们的客户包括复星医药、康恩贝、国药控股、济民可信、绿谷制药、九洲药业、优宁维股份等,通过咨询辅导帮助客户实现超过30%-800%的盈利增长。如果你正在为测评结果的可信度发愁,欢迎和我们做一次项目前期沟通。
常见问题
Q:在线测评会不会被人“刷”出好结果?
任何自陈式量表都存在社会赞许性作答的可能。应对方式是在工具设计层面压缩刻意作答空间(部分工具已采用迫选式题目设计),同时在流程层面明确结果用途、并进行多源交叉验证。单一数据源不可作为决策依据,这是我们的基本原则。
Q:测评结果和上级的评价不一致,该信哪个?
这正是需要开校准会的地方。测评反映行为倾向与潜力信号,上级评价反映实际业绩表现,两者的不一致本身就是重要信息。我们通常会在校准会上要求上级用具体事件来支撑评价,用事实来弥合分歧。
Q:预算有限,还能做可信的人才盘点吗? 可以。我们确实见过预算有限的企业,用一套DISC加上一份精心设计的360度问卷,就完成了高质量的人才盘点。关键不在工具贵不贵,而在使用工具的人懂不懂、流程严不严。