量化独立评分人之间的一致程度——一致率、κ 与 ICC,以及回到评分细则层面修不一致。
评分者间信度量化独立评分人对同一批作品的一致程度。简单一致率是入门口径,扣除偶然一致的 κ 与 ICC 才是诚实口径——两个人光靠漂移也能「一致」。
一致率;Cohen's κ =(观察一致−期望一致)/(1−期望一致);连续打分用 ICC。
两位经理给同样 20 份面试记录打分:85% 同分,κ=.62——总体一致,但边界分数带仍需校准会。
凡是由人给主观作品打分的地方都绕不开:面试评审团、360 项目、考试阅卷、细则评估。
一致性低多半是评分细则的 bug,不是评分人的 bug——先修锚定与样例,再谈换人。
单看不够——类别分布偏斜时,纯偶然也能刷出高一致率。必须同时报告扣除偶然后的统计量。
1-5 连续评分用 ICC;类别少且有序用加权 κ。
把概念变成在线评估:评分者间信度
浏览模板 →