在英格兰、威尔士和北爱尔兰,学生要拿到某个 GCSE 或 A-level 等级所需的原始分数,并不是提前定好的——而是在考试结束之后,等资深考官看到当年考生在当年那份实际试卷上的真实表现之后,才决定的。再加上一套叫作「可比结果(comparable outcomes)」的统计方法,这就是为什么比方说 7 级所需的分数,会在不同年份之间上下浮动,即便试卷看起来大体相似。与世界上许多地方相比,这是一个相当不寻常的设计——在很多地方,及格线在考试开始之前就已经固定好了。

在英国的考试制度中,最让家长困惑的部分莫过于分数线。直觉上会觉得,某个等级理应每年都需要固定数量的分数——比如说,7 级需要 70%。但实际情况并非如此,要理解为什么,就必须理解这套体系真正想要保持不变的到底是什么:不是分数本身,而是标准。

考试结束后实际发生了什么

一份试卷考完并阅完卷之后,颁证机构会在最终确定分数线之前,走一套叫作「评定(awarding)」的流程:

  1. 统计预测。 利用关于全国考生群体的数据——最重要的是学生此前的学业表现(对 GCSE 而言,主要是小学阶段 Key Stage 2 的成绩)——统计人员会依据以往类似考生群体在这门资历上的表现,预测大致有多大比例的学生应当拿到每个等级。
  2. 资深考官复核。 一个由经验丰富的考官组成的小组,会独立复核那些分数正好落在拟定分数线附近的真实学生答卷——刚好在及格线上方和下方的那些——判断这些答卷的质量,是否符合 7 级、4 级或 C 级应有的水准。
  3. 协调定案。 最终的分数线会定在统计预测与考官定性判断相吻合之处,或者尽可能接近这一点。

Ofqual 关于设定分数线的指引以及每年发布的评定文件详细描述了这一流程,它适用于 Ofqual 监管下的 AQA、Pearson Edexcel、OCR 与 WJEC/Eduqas。

为什么这真的会让家长感到困惑——以及背后的逻辑

这套体系之所以存在,是因为一项名为**「可比结果」**的原则,Ofqual 自 2011 年起一直采用。其理念是:某届全国考生在某科目上的整体等级分布,应当反映出根据这届考生的能力(通过此前学业表现数据衡量)所能预测出的结果,而不应仅仅因为某一年的试卷恰好写得较难或较易,或者因为按新考纲教学出现了意外的问题,就出现剧烈摆动。

简单来说:如果今年 Year 11 学生的整体水平,从数据上看和去年 Year 11 学生大致相当,那么拿到每个等级的比例也应大致相同——即便今年的考题结果证明更棘手。要让这一点成立,每个等级所需的分数就必须能够灵活调整,以吸收试卷难度带来的差异,因为真正要保持稳定的,是达到该标准的学生比例,而不是原始分数本身。

这与大多数人直觉中「打分应该怎么运作」的理解确实不同,也正因如此,一份学校通讯里写着「今年分数线下降了」,未必是坏消息——它往往意味着这份试卷被判定为更难,而制度做出了相应调整,让这个等级仍然代表着和以往相同的理解水平。Ofqual 自己关于可比结果的说明文件直接阐述了这套逻辑。

其他国家的不同做法

固定分数制

许多国家的体制会在考试之前就定好及格或达标的分数线,考后不再调整。比如,一个学生知道自己需要在满分 20 分中平均拿到 10 分才能通过某项资历,这个数字在考试开始之前就已确定,无论当年考生群体整体表现如何,都不会变动。这种做法牺牲了英国那种「跨年份保持标准一致」的特性,换来了简单和可预期性——学生和老师始终确切知道需要多少分,代价是及格率本身会随着试卷难度的变化而在不同年份之间波动更大。

常模参照制

有些体制走得更远,直接把学生排名放在自己所在的考生群体中比较,完全不参照任何固定分数。韩国的全国大学入学考试「修能(Suneung,CSAT)」就是一个知名例子:成绩部分以标准分和相对于当年考生的百分位排名的方式呈现,由政府运营的韩国课程评估院(Korea Institute for Curriculum and Evaluation,KICE)负责实施。在纯常模参照制中,按定义永远存在最高和最低的百分位——比较的对象是同年参加同一场考试的其他考生,而不是某个外部设定的知识标准。

一个具体的固定分数案例:法国的 baccalauréat(业士文凭考试)

法国的 baccalauréat 是固定分数制最清晰的现实例证。每门科目满分 20 分,通过整体 bac 平均分所需的门槛定为 20 分中的 10 分,且这一门槛是公开发布的既定政策,而不是事后由考官复核答卷再决定的东西。一名各科平均分为 9.8 的学生就是没有通过——这与 GCSE 学生有时候即便分数比分数线低一点点、经过考官判断和可比结果调整后仍能过关的情形不同。法国的 bac 由教育部在全国层面统一组织,这条固定门槛也是法国家长和学生普遍认为这套体制比英格兰的更可预期(虽然对异常难的试卷也更不留情)的原因之一。

值得了解的一种混合模式:芬兰的高中毕业考试

芬兰的全国高中毕业考试(ylioppilastutkinto)比法国或韩国的模式都更接近英格兰的做法,但也并不完全相同。等级——从最高的 laudatur 往下经过六个较低档次——是依据全国所有考生在当年某科考试中的分数分布计算出来的,这一流程由芬兰毕业会考委员会负责运行。由于分数分布是每次考试都重新计算,最高等级所需的原始分数会年年浮动,其精神与英格兰的可比结果颇为相似,尽管具体的计算方式,以及这场考试在结构迥异的学校体系中所扮演的角色,都并不相同。

英国处在两极之间的位置

英格兰的可比结果做法,最好理解为处在这两极之间:它不是固定分数,因为某个等级实际所需的分数确实会变动;但它也不是纯粹的常模参照,因为它瞄准的目标是一种「工作水准」(通过真实考官阅读真实答卷来核实),并以统计方式锚定在「类似考生群体先前的学业表现所能预测的结果」上——而不是简单地「排名前 X% 的人拿 A」。

四种体制并列对比

体制 门槛何时设定 什么决定最终等级 所需分数每年会变动吗
英格兰/威尔士/北爱尔兰(GCSE、A-level) 考后 基于此前学业表现的统计预测 + 资深考官对答卷的复核
法国(baccalauréat) 考前(固定为 20 分中的 10 分) 分数本身,对照公开门槛 不会
芬兰(毕业考试) 考后 当年全国考生群体的分数分布
韩国(CSAT) 考后 相对于当年考生群体的百分位排名 不是分数——是排名

这对家长而言为什么重要,而不只是理论问题

对英国家长而言,实际的启示是:某个分数线比上一年下降了几分,恰恰说明这套制度正按设计运作,而不是标准下滑或试卷放水的证据——事实往往正相反。反过来,像法国 bac 这样采用固定门槛的国家,能提前好几个月就让一个家庭完全清楚需要多少分,但如果某一年的试卷恰好难到在规定时间内很难做完,也不会有任何弥补机制。这两种取舍都不是没有代价的;一个家庭觉得哪一种更让人安心,很大程度上取决于——一个难以预测的数字,和一份未经调整的试卷——哪一种不确定性,感觉起来更容易接受。

结语

把一份考卷转化为一个等级,并不存在唯一「正确」的方法。英格兰的体制优先考虑跨年份标准的可比性,代价是分数线会浮动,从外部看起来也可能显得不透明。固定分数制优先考虑透明度和可预期性,代价是整体及格率会随试卷难度而漂移。常模参照制则把相对排名明确化,而不是把它当作附带产物。这三种做法都是应对同一个根本问题——如何公平地判定「达到及格水准」究竟落在哪里——的合理且成熟的方案。