当一个分数必须经得起追问时,Lurno 做了什么
Lurno 端到端地处理测评:出题、安全投放、批改和结果。你从 7 种测评类型中选一种——测验、考试、练习、诊断、问卷、作品集任务或心理测量量表——类型会预先配置投放、诚信、评分、反馈和重考,所以考试一到手就是锁定加计时的,而练习则不限时、可无限次作答且不扣分。题目来自 19 种题型。所有需要人来批改的东西都落进同一个队列,横跨测评、课时和课程,按分析式、整体式或单点式评分量表打分。
- 单点式评分量表
- 只有一列、而不是一整张表格的评分量表。你只描述每条标准上“达标”的样子,再记下哪里不足、哪里超出。批改的人要点的更少,学习者能读到的更多。三种 Lurno 都支持——分析式(标准 × 等级,带权重)、整体式(整份作业一把尺)和单点式。
这些默认值没有一个是写死的。可以在单个测评上改任意设置,也可以为某个类型设定本组织自己的默认值。评分策略由有序的评分轮次组成——自动、人工、同行或 AI 辅助,每一轮可设为必需或盲评——再由一条采纳规则决定最终分数:取首轮、末轮、最高、平均、全体一致,或由复核人裁定。
类型是一组决定,不是一个标签
每一种都是不同的教学形态,因此每一种自带不同的默认值。
| Capability | 类型 | 时间限制 | 作答次数 | 安全模式 | 可否返回上一题 | 正确答案 |
|---|---|---|---|---|---|---|
| 测验自动批改;三次作答取最高分。 | 无 | 3 | No | Yes | 提交后显示 | |
| 考试剪贴板被禁用,切换标签页会记为诚信事件。 | 60 分钟 | 1 | Yes | No | 成绩发布后 | |
| 练习不扣分;答案要等你发布之后才出现。 | 无 | 不限 | No | Yes | 提交后显示 | |
| 诊断用来摸清一个人已经会了什么。答案始终不显示。 | 无 | 1 | No | No | 成绩发布后 | |
| 问卷没有分数也没有答案——用于反馈、信息收集和定期脉搏调查。 | 无 | 1 | No | Yes | 从不显示 | |
| 作品集任务提交作品与里程碑关卡,交由评审人复核。 | 无 | 不限 | No | Yes | 成绩发布后 | |
| 心理测量量表对照量表维度和常模群体计分,而不是打一个十分制的分数。 | 无 | 1 | No | No | 从不显示 |
这些是默认值,不是限制。每一项设置都能在单个测评上修改,组织也可以为某个类型整体覆盖这张表。
按老师实际工作方式整理的待批改堆
测评、课时和课程作业在同一份列表里
待批改的作业不会按产品的哪个模块产生来分堆,这个队列也不这么分。按作业归属、评分轮次、批改人或生命周期状态筛选,然后从最上面拿走下一份。
- 逐题打分,每题和整体都可以写文字反馈或录一段语音。
- 两个批改人打开同一份作答时,第二个人会看到明确的冲突提示,而不是被悄悄覆盖。
- 把某一轮评分指派给一个评审池;评审人认领、批改并提交。盲评轮次会隐藏他人的分数,直到你提交为止。
在风险需要时,加上第二双眼睛
设定复核阈值,超过阈值的成绩会在发布前先留给复核人。已发布的成绩在产品内申诉,而不是靠邮件往来,而且每一个结果都按固定的十二状态生命周期流转。
- 申诉留有完整轨迹——已发布、已申诉、已处理、已终裁——每个结果上还有一条反馈会话。
- 题目是内容库条目,因此同一道题可以出现在多个测评里。参见内容编写与内容库。
作品集、同行评议、评分校准与小组提交
要做上几周的作业,得到的是像样的处理,而不是一个文件上传框。
- 作品集:随时间陆续添加作品,里程碑设有需要通过的关卡,评审人工作台把每一份推进到复核中、要求修改、已接受或已拒绝。
- 同行评议:匿名评审池带截止日期、同行评分、反馈质量评级,以及评审人意见不一致时的调和机制。
- 在锚定样卷上做校准,能在正式批改开始前得出评分者间信度。小组提交可为每位成员设定贡献权重。
自适应心理测量,以及它公平的证据
Lurno 把心理测量量表当作测量工具来运行,而不是当作测验。你可以在题目之上定义维度、子维度和合成分,设定反向计分和权重,导入常模群体和分数转换表,并划定解释区间以及被试会读到的文字说明。计分是确定性的且带版本,因此重新跑一次旧的作答会得到同样的结果。处于自适应模式的量表会按项目反应理论(IRT)挑选下一道题,并在测量足够精确时停止。这指的是自适应心理测量,而不是自适应的课程路径。
- 项目反应理论(IRT)
- 一种为测验建模的方法:每道题都带着自己的参数——有多难、区分强弱有多锐利、猜对的可能性有多大——而被试只带一个能力估计值。两者位于同一把量尺上,因此测验可以挑出接下来信息量最大的那道题,并在估计足够精确时停下来。
公平性工作以记录的形式留存,而不是一份导出后就丢掉的报告。项目功能差异(Mantel-Haenszel 方法,带效应量和标记等级)、效度证据、对照五分之四规则的不利影响检查,以及 Angoff 或 Bookmark 标准设定,每一项都会写入一条哈希链式审计记录。
一个必须说清的限制:IRT 参数是导入的,不是在这里估计出来的。Lurno 是运行引擎,不是参数校准工作台。
与风险相称的检查
该开的地方开,不该开的地方关。练习不需要锁屏。
安全投放
全屏、禁用剪贴板、记录标签页切换、每次作答都打乱顺序。答案在服务端就被剥离,因此根本不会到达浏览器。
诚信事件
切换标签页、复制尝试、同时开着的第二个会话、可疑的作答时间——每一项都记录在这次作答上,并附每道题的用时。
风险预警
交得太快的作答、多个并发会话或参与度过低都会被标记。每条预警都需要有人确认处理。
AI 代写检测
对文字作答跑一次检测,把结果和作业并排看。它为人的判断提供参考,而不替人做判断。
特殊便利
按百分比延长时间、增加作答次数、豁免、高对比度、更大字号、屏幕阅读器、减少动效——按学习者设定,自动生效。
AI 评分初稿
AI 在匿名化的上下文上起草评分量表得分、反馈和建议成绩。在人确认之前,什么都不会生效。