在 2010 年代中期之前,英格兰的大多数 GCSE 和 A-Level 都是模块化的:学生在课程进行过程中,分阶段报考并逐步积累各单元的考试成绩,往往还会针对某个单元单独补考以提高分数。2015 到 2017 年推行的改革,把这套结构替换成了线性、终结性的考试——在课程结束时,用一整套涵盖全部内容的试卷来考核。包括国际文凭(IB)和德国 Abitur 制度的部分地区在内,其他一些制度至今仍把持续的评估作业与最终考试结合在一起,而「哪种方式对学习或身心健康更有利」,证据上并没有一个干净利落的答案。
如果你自己当年考 GCSE 或 A-Level 是在大约 2017 年之前,那么你孩子现在参加的考试,结构上确实不一样了——不只是换了个新的等级编号那么简单,而是建立在一套关于「一个科目应该在什么时候、以什么方式被考核」的不同理论之上。
「模块化」以前是什么意思
在此次改革之前的模块化制度下,一门 A-Level 或 GCSE 课程会被拆分成若干个独立单元,每个单元分别教学、分别考试、分别评分——通常在 Year 12 结束时考 AS-level 试卷,Year 13 结束时考 A2 试卷,如果学生想在最终成绩计算之前,就某个具体单元的分数进行提升,还可以单独重考该单元。最终的资历成绩,实际上是两年里逐步积累下来的各单元成绩的一个「累计总分」,而不是课程结束时的一次性测量。
变了什么,又是为什么
在 Ofqual 的 GCSE、AS 与 A-Level 改革时间表下推行的改革,把英格兰几乎所有的 GCSE 和 A-Level,都改成了线性结构:教学依然贯穿整个课程,但评估集中在课程结束时的一整批考试中,一次性覆盖整份考试大纲。AS-Level 与 A-Level 也被拆分开来,在大多数科目中,AS-Level 成绩不再自动计入最终的 A-Level 成绩,而课程进行中单独重考某个单元的做法也基本被取消了,因为已经不存在可以单独重考的分单元考试——只剩下整个科目,要重考就是整份重新报考。
英国教育部当时给出的理由,也贯穿在 Ofqual 的落实过程中,主要有两点:一是减少围绕小单元反复补考、以求边际提升成绩的风气;二是鼓励能够建立起对整个科目连贯理解的教学方式,而不是把它当成一串各自可以单独考核的小块内容。这套理由在实践中是否真正得到了验证,属于一个仍在持续的教育界争论,而不是一个已经确定的实证事实,本文也不打算断言其中任何一方。
模块化与持续性评估依然存在的地方
这项变化是英国特有的一项政策决定,而不是一场普遍的转向——本系列涉及的其他几个主要制度,仍然保留着更偏模块化或持续评估的形式。
国际文凭大学预科项目(IB Diploma Programme)明确地把校内评估——由学生自己的老师评分、并接受外部核查的课程作业、项目和口试,在两年课程期间陆续完成——与课程结束时的最终外部考试结合在一起。在大多数 IB 科目中,最终成绩确实是两者的真正融合,而不是单纯的终结性考试结果。
在德国,Abitur 是由每个联邦州(Land)而非全国统一组织的,其中若干个州会在最终成绩中纳入一个分量不小的持续性成分:在最后两年在校期间(Kursstufe)积累下来的评估作业和成绩,会与终结性的笔试和口试一起,共同决定结果,而不是只由考试单独决定。这一点因州而异,这本身就是一个值得了解的结构性事实——德国并没有一套统一的 Abitur 制度,而是十六套,彼此协调但并不完全相同。
一个具体例子:A-Level 数学究竟发生了什么变化
用一个具体例子,更容易看清「模块化」在实践中曾经意味着什么。在旧制度下,A-Level 数学通常由六个独立单元组成——一般是三个「核心」纯数学模块,加上三个应用模块(从力学、统计学或决策数学中选取)——每个单元作为一场单独的考试,往往在 Year 12 和 Year 13 的不同时间点报考,各自单独评分。如果学生对某一个应用模块的成绩不满意,可以只重考那一个单元,而不必重考整份资历的其他部分。在改为线性结构之后,A-Level 数学变成了一份统一的考试大纲,由课程结束在 Year 13 末进行的考试一并覆盖纯数学、力学和统计学——不再存在学生可以提前拿下、以后再也不用管的「Core 3」或「Statistics 1」考试;整个科目在一个考试季里作为一个整体接受考核,重考也就意味着重考整份 A-Level,而不是其中的某一个部分。
另一种对照:美国的持续评估模式
与英格兰的终结性考试模式截然不同的一种替代方案,是美国高中如何看重平均绩点(GPA)——一个由高中四年课程作业、测验和作业成绩累积而成的平均分——把它作为大多数大学看到的主要记录,再辅以在这几年中一个或多个时间点报考的标准化考试,比如大学理事会(College Board)的 SAT 或 ACT。这比 IB 或德国的 Abitur 都更「持续」得多:在大多数美国州份,根本不存在覆盖整个科目内容的单场终结性考试,高中早期表现不佳,会对学生整体学业记录产生实实在在的影响,其程度是英国任何一次 GCSE 或 A-Level 补考都无法完全对应的,因为美国没有类似「整个科目、一次性考试、可以重新开始」的机制。这种权衡的方向和英格兰正好相反:压力是持续、累积地分布在四年当中,而不是集中在课程结束的那一场考试上——这是一种真正不同的风险分布方式,而不只是把 IB 那种混合模式拉得更长而已。
对比:不同制度如何分配评估压力
| 制度 | 模式 | 压力集中在哪里 |
|---|---|---|
| 英格兰(改革后) | 线性——每个科目设一场终结性考试 | 集中在两年课程结束时 |
| 英格兰(2015 年前) | 模块化——各单元分别考试,可单独重考 | 分散在整个课程中,每个单元都有重来的机会 |
| IB Diploma | 混合——校内评估加最终考试 | 分散在整个课程中,外加一个最终考试环节 |
| 德国(Abitur) | 混合,因州而异——Kursstufe 成绩加终结性考试 | 分散在最后两年,外加一场考试 |
| 美国(典型情况) | 持续——由四年课程作业构成的 GPA,加标准化考试 | 累积地分散在整个高中阶段 |
关于压力和学习效果,证据究竟怎么说
这是一个诚实的答案应该是「确实存在争议」,而不是「有明确结论」的领域。单场终结性考试,把两年学习的全部风险,集中压缩进一场考试(或一个较短的考试季)中,许多学生、家长和学生福祉相关机构都认为这带来了极大的压力,恰恰是因为没有更早的成绩可以垫底,也没有别的补救办法,只能靠整个重考。这是关于线性考试一项真实而被广泛报道的担忧,即便没有一个单一、确定的统计数据可以拿来佐证。
模块化和持续性评估的制度,用一种更分散的方式,来交换那种集中的压力:压力分散在整个课程期间,而不是压缩成一个结果。这样做是否真的让整体压力更小,还是只是把同样的压力摊薄了(同时还额外背负了两年里持续不断的评估作业负担),研究基础并没有给出干净利落的定论——理性的人、理性的教育制度,得出了不同的结论,这也正是为什么这两种模式至今仍在国际上并存,而不是其中一种取代了另一种。
结论
英格兰在 2010 年代选择了线性的终结性考试模式,明确是为了摆脱模块化单元反复补考的做法;而 IB 和德国部分州份出于恰恰相反的理由,保留了更持续、更混合的模式——把风险和评估分散在整个课程期间,而不是集中在结尾。两者都是经过深思熟虑、站得住脚的设计,而不是其中一种代表了已被淘汰的过时做法;诚实的比较应该关注的是每一种方式各自放弃了什么,而不是哪一种「才对」。