沙特把 AI 变成了必修课。这对底层的技术提出了什么要求
沙特为超过六百万名学生开设 AI 必修课。这对阿拉伯语交付、测评、教师能力与数据意味着什么。
沙特教育部已把人工智能列为 2025-26 学年起的中小学必修科目,覆盖超过六百万名学生——这是全球范围内规模最大的技术教育部署之一。对一个学校集团、一家出版社或一支部委团队来说,教学大纲是容易的那部分。难的部分是:一门必修课必须以阿拉伯语优先交付,而不是在英语之上盖一层翻译;必须在一门既无往年试卷、也无题目统计的学科里完成测评;由比学生早几周才学会这些材料的教师来教;并记录在海湾地区监管机构会提出具体问题的系统里。
这四件事单看,没有一件罕见。让它们合在一起变难的是期限。试点挑学校;强制令拿下全部学校,在同一个早上。
强制令和试点是两个不同的问题
试点筛选的是热情:一位周末就已经在读这门学科的教师,一间能用的机房,一位希望有人来访的校长。强制令还会把这样的学校一并纳入:只有一间超额预约的实验室,一位在另外两门课之外兼顾这门新科目的教师。按中位数的学校来规划,而不是旗舰校——共用设备,早上八点所有班级同时登录时的稀薄带宽,以及断线后不丢失学生作业、还能继续的会话。
第二个变化是行政上的,容易被低估。一门必修课必须向上举证——向集团办公室、向教育局、向部委——而不只是在课堂上被看见。这项义务会落到持有记录的那个系统上,而且在第一个学期就落下来。
- 每一所学校都在同一个日期进入范围,包括那些绝不会主动报名的学校。
- 覆盖情况必须向上汇报,所以“我们教了”得是一条有人能跑的查询,而不是一次对话。
- 学年中途转学的学生会带着这门新科目的记录走,接收学校必须读得懂它。
- 监护人会问这门课是什么、自己的孩子在里面做什么,而且往往在学校还没决定完的时候就问了。
- 第一届的成绩会成为此后每一届被衡量的基线,不管这条基线好不好。
阿拉伯语优先,而不是事后补上阿拉伯语
阿拉伯语优先的交付
一个把阿拉伯语当作创作、交付、测评和管理的一等语言来构建的平台:每一个界面——包括管理端界面——都采用从右到左的布局;内容以阿拉伯语原生创作,而不是从英语机器翻译过来;当一段从左到右的片段——一段代码示例、一个公式、一个英文缩写——嵌在从右到左的句子里时,渲染依然正确;从试卷到证书,每一份生成的文件里都有阿拉伯语。相比之下,翻译层只翻译界面字符串,其余一切仍保持英语给它的形状。
这门学科对翻译层的惩罚比大多数学科都重。AI 教学材料里满是从左到右的片段——Python 片段、库名、URL、记号——嵌在阿拉伯语行文中。双向渲染正是平台会当场出丑的地方:括号反转,标点跳到行的另一端,一段代码在编辑器里读起来没问题、印到练习册上却错了。要求看一节带代码示例的课,用阿拉伯语,在手机上。这只要一分钟,问题就有答案了。
然后去看没人演示的那一面。被翻译过的通常是学生端界面;协调员的界面、评分队列和导出的 PDF,才是镜像布局被漏掉的地方。一位为了做覆盖率报表而切换到英语的协调员,是在把活干两遍,最后真实记录会留在一张电子表格里。
对一个学习平台来说,阿拉伯语优先到底意味着什么?
意味着阿拉伯语是这个产品被构建时所用的语言,而不是它被翻译成的语言。具体地说:从右到左的布局要覆盖学生端、教师端和管理端,而不只是学生端;当代码示例或公式嵌在阿拉伯语句子里时,混合方向的文本能正确渲染;生成的文档、证书和导出件里都有阿拉伯语,而不只是屏幕上有;搜索、排序和题型在阿拉伯语文本下行为正确。演示时最快的测试,是要求在小屏幕上用阿拉伯语看管理端界面——翻译层通常在学生端是完整的,在别处都很薄。
内容来源值得单独做一个决定。英语的 AI 教学材料远多于阿拉伯语,所以大多数集团会选择翻译或生成。整本教材做机器翻译会产生术语漂移——同一个概念在三章里有三种叫法,而在一门词汇本身就是学习内容的学科里,这是致命的。先用现代标准阿拉伯语定下一份术语表,与将要使用它的教师达成一致,然后让每一个单元都守住它,并由学科教师、而不是译者来审校结果。
测评一门此前无人教过的学科
一门成熟学科所倚仗的一切,在第一年都不存在。没有往年试卷,没有标杆答卷,没有及格线,没有题目难度统计,也没有背后有十五年评分审核经验的考官。所以第一年的测评同时承担两件事:如实报告这一届的情况,并建立起让第二年站得住脚的证据基础。
在写任何题目之前,先把学习结果写成可观察的能力。“能解释为什么在不平衡数据上训练的模型会把较小的那一组分错”可以在四十所学校之间做评分审核;“理解机器学习”不行。在一门新学科里,学习结果的表述是你唯一的固定点,这也是能力框架在这里比在一门成熟学科里更值回票价的原因。
用量规要出于判断,而不是出于习惯。想要一份关于这一届弱在哪里的诊断画像时,用分析式——第一年你非常需要这个。需要在规模上快速给出站得住脚的分数时,用整体式。目标是一份公开标准时,用单点式。然后保留第一次考试的题目统计:每道题的难度和区分度,这样人人都答对的那道题和没人答对的那道题,可以在被复用之前修好。普通的心理测量学在第一年比在第十年更要紧。所有这些机制——量规、评分审核、题目统计——都写在测评页上。
有一个问题是这门学科独有的:学生会用模型来做关于模型的作业。绕开它来设计,而不是去查禁它——课堂上的表现性任务,既保留终稿也保留草稿的作品集,针对某个项目的简短口头答辩。把工具用好本来就是你要教的一部分,所以要测评判断力,而不是打字。
一门没有任何历史数据的学科,怎么测评?
先定义可观察的能力,并把它当作记录的单位,因为能力可以跨学校做评分审核,而分数不行。用表现性任务和作品集来测评,而不是记忆型试卷,因为题库和评分标准都还不存在。使用量规——想要诊断画像时用分析式,需要规模化出分时用整体式——并保留每一次量规判定。然后采集第一次考试的题目统计,让第二年从已校准的题目开始,同时公开说明第一年的数字是校准,不是评判。
教师能力才是真正卡住的约束
在买任何东西之前先算一笔账:要培训的教师人数,乘以每人所需的小时数,除以开学前的周数,再对上真正能授课的培训者。在大多数集团里这个数算不通,通常的答案是层级培训——培训培训者,再由他们培训培训者,再由他们培训教师。每传一手,保真度就掉一截。一堂第四手的神经网络课,不是一堂神经网络课。
在层级传递中活得更好的,是教师能拿在手上的材料:学生拿到的同一个单元,带解析的答案,以及一个能提问、并从懂的人那里得到回答的地方。让教师用和学生同一个平台,这样只有一份记录、一套内容,而不是一个培训门户挨着一个学习门户,各有各的登录,还没有共享报表。
衡量完成,而不是衡量邀请。出勤不能证明谁能教这些内容;一次简短的测评,加上一张写明所证明了什么的证书,更接近证据。另外要建一条回流的通道——哪些课在有三十名学生、十二台能用的机器的真实课堂里会垮掉。这类反馈在第一年比任何一次督导都更有价值,而且保质期很短:一旦教师认定没人看这些报告,他们就不再上报问题了。运营多个校区的集团要协调的这类事,比单所学校更多;学校页讲的是集团层面的版本。
在海湾地区,数据保护的问题问法不一样
沙特的《个人数据保护法》由 SDAIA 负责实施,对个人数据如何处理、以及如何转移出王国境外设定了条件。这里的采购是从数据驻留、跨境转移和次级处理方开始的,而不是从功能清单开始。用 AI 工具来教这门课,还会带出一个地理课从未提出过的问题:学生的作业被送进一个模型之后会发生什么,以及那是谁的模型。
在签字之前,向每一家厂商——包括我们——索取这些问题的书面答复。
- 学生数据存在哪里,在哪个国家,如果这个答案变了,提前多久通知?
- 哪些次级处理方会接触到它——包括点名 AI 功能背后的任何模型提供方——它们各自又在哪里运行?
- 学生作业会被用来训练任何人的模型吗?“不会”应该写进合同,而不是写进一篇博客。
- 学生离校后数据保留多久,谁可以删除,删除能被证明吗?
- 监护人能看到什么,这个范围能按类别划定,而不是全有或全无吗?
- 你们能拿出一份谁读取或修改过某位学生数据的记录吗,并且能证明这份记录未被改动吗?
- 厂商自己的哪些员工能看到学生数据,需要什么审批,这个审批有没有留痕?
“我们符合 GDPR”不是对 PDPL 问题的回答。它通常意味着厂商已经做完了让 PDPL 层面的答复成为可能的那些工程——合法性基础的处理、同意记录、主体访问、擦除——但两者之间的映射该由你的法务团队去核对,而不是由售前工程师去断言。
沙特的学校必须把学生数据存在王国境内吗?
这个问题该问你的法律顾问,而不是厂商,因为答案取决于数据本身、使用目的,以及由 SDAIA 实施的《个人数据保护法》下的实施细则。买方的实际立场要简单些:要求每一家厂商说出存储所在的国家,列出包括任何模型提供方在内的次级处理方,并在合同中承诺,这两者中任何一项发生变化前都会通知你。第一次会议上说不出国家名的厂商,到第三次也不会更快。
一个平台能替你卸下什么,不能卸下什么
没有平台会教这门课。它拿掉的是吞掉一次推广的重复劳动:同一个单元按学校数量重复创作,而不是只做一次;四处追问哪些校点覆盖了哪条学习结果;为了回答教育局的一个问题而导出电子表格;以及给学生跑一套系统、给正在受训教他们的教师跑另一套。
一个租户,下面每所学校一个组织,一个题库,一套能力框架,每一个校点的覆盖情况都能用一条查询回答。
每所学校一套单独部署,一个装满文档的共享盘,以及一次要三周、最后给出一个没人完全相信的数字的数据申请。
我们做的正是这种形状的平台,所以下面这段请当作有利益关系、而非中立的话来读。Lurno 有四种产品语言——英语、全程从右到左布局的阿拉伯语、法语和意大利语——而其中的阿拉伯语覆盖管理端界面,不只是学生端。测评方面:19 种题型,7 种测评类型,支持分析式、整体式和单点式的量规评分,同伴互评,作品集,统一评分队列,以及包含自适应 IRT/CAT 的心理测量——等题库成熟到值得用它的时候再用。能力框架承载证据与自动掌握判定,这正是把“我们教了”变成教育局可以核查的东西的办法。租户隔离在数据库中强制执行,而不是在应用里——676 次迁移中的 868 条行级安全策略——敏感变更会写入哈希链式审计日志。
也直说不存在的部分。SCORM 1.2、SCORM 2004、xAPI 和 LTI 1.3 在开发中——已在产品中建模,运行时仍在构建——所以如果招标要求第一天就符合标准,请在第一次会议上说明。SAML/OIDC 单点登录、MFA 和通行密钥在路线图上;今天已有的是合作方登录(静默 SSO),那是另一样东西,不应该当作同一样来卖。支付、结账和自助注册尚未开发:账号由邀请创建。我们没有 SOC 2 或 ISO 27001 认证;相关实践对齐 ISO 27001,安全页上写明了具体是哪些。
三年后看起来称职的集团,是那些把第一年当作校准来对待的:先写学习结果再写题目,从第一次考试起就保留题目统计,教师能力靠测量而不是假定,阿拉伯语在没人演示的界面上被测试过,数据方面的问题在合同还没定稿时就在合同里回答清楚。教学大纲会被修订——新学科总是会。而到那时你仍然需要的,是关于教了什么、教给了谁、学得如何的记录。