跳转到主要内容
lurno
测评与评分

7 种测评类型。一个批改队列

选好类型,投放、诚信、评分、反馈和重考规则就已经配好。所有需要人来批改的东西——测评、课时、课程作业——都落到同一个地方。

一段话说明

当一个分数必须经得起追问时,Lurno 做了什么

Lurno 端到端地处理测评:出题、安全投放、批改和结果。你从 7 种测评类型中选一种——测验、考试、练习、诊断、问卷、作品集任务或心理测量量表——类型会预先配置投放、诚信、评分、反馈和重考,所以考试一到手就是锁定加计时的,而练习则不限时、可无限次作答且不扣分。题目来自 19 种题型。所有需要人来批改的东西都落进同一个队列,横跨测评、课时和课程,按分析式、整体式或单点式评分量表打分。

单点式评分量表
只有一列、而不是一整张表格的评分量表。你只描述每条标准上“达标”的样子,再记下哪里不足、哪里超出。批改的人要点的更少,学习者能读到的更多。三种 Lurno 都支持——分析式(标准 × 等级,带权重)、整体式(整份作业一把尺)和单点式。

这些默认值没有一个是写死的。可以在单个测评上改任意设置,也可以为某个类型设定本组织自己的默认值。评分策略由有序的评分轮次组成——自动、人工、同行或 AI 辅助,每一轮可设为必需或盲评——再由一条采纳规则决定最终分数:取首轮、末轮、最高、平均、全体一致,或由复核人裁定。

七种类型

类型是一组决定,不是一个标签

每一种都是不同的教学形态,因此每一种自带不同的默认值。

Capability类型时间限制作答次数安全模式可否返回上一题正确答案
测验自动批改;三次作答取最高分。3NoYes提交后显示
考试剪贴板被禁用,切换标签页会记为诚信事件。60 分钟1YesNo成绩发布后
练习不扣分;答案要等你发布之后才出现。不限NoYes提交后显示
诊断用来摸清一个人已经会了什么。答案始终不显示。1NoNo成绩发布后
问卷没有分数也没有答案——用于反馈、信息收集和定期脉搏调查。1NoYes从不显示
作品集任务提交作品与里程碑关卡,交由评审人复核。不限NoYes成绩发布后
心理测量量表对照量表维度和常模群体计分,而不是打一个十分制的分数。1NoNo从不显示

这些是默认值,不是限制。每一项设置都能在单个测评上修改,组织也可以为某个类型整体覆盖这张表。

评分

按老师实际工作方式整理的待批改堆

测评、课时和课程作业在同一份列表里

待批改的作业不会按产品的哪个模块产生来分堆,这个队列也不这么分。按作业归属、评分轮次、批改人或生命周期状态筛选,然后从最上面拿走下一份。

  • 逐题打分,每题和整体都可以写文字反馈或录一段语音。
  • 两个批改人打开同一份作答时,第二个人会看到明确的冲突提示,而不是被悄悄覆盖。
  • 把某一轮评分指派给一个评审池;评审人认领、批改并提交。盲评轮次会隐藏他人的分数,直到你提交为止。
AI 如何协助批改
心理测量

自适应心理测量,以及它公平的证据

Lurno 把心理测量量表当作测量工具来运行,而不是当作测验。你可以在题目之上定义维度、子维度和合成分,设定反向计分和权重,导入常模群体和分数转换表,并划定解释区间以及被试会读到的文字说明。计分是确定性的且带版本,因此重新跑一次旧的作答会得到同样的结果。处于自适应模式的量表会按项目反应理论(IRT)挑选下一道题,并在测量足够精确时停止。这指的是自适应心理测量,而不是自适应的课程路径。

项目反应理论(IRT)
一种为测验建模的方法:每道题都带着自己的参数——有多难、区分强弱有多锐利、猜对的可能性有多大——而被试只带一个能力估计值。两者位于同一把量尺上,因此测验可以挑出接下来信息量最大的那道题,并在估计足够精确时停下来。

公平性工作以记录的形式留存,而不是一份导出后就丢掉的报告。项目功能差异(Mantel-Haenszel 方法,带效应量和标记等级)、效度证据、对照五分之四规则的不利影响检查,以及 Angoff 或 Bookmark 标准设定,每一项都会写入一条哈希链式审计记录。

一个必须说清的限制:IRT 参数是导入的,不是在这里估计出来的。Lurno 是运行引擎,不是参数校准工作台。

诚信

与风险相称的检查

该开的地方开,不该开的地方关。练习不需要锁屏。

安全投放

全屏、禁用剪贴板、记录标签页切换、每次作答都打乱顺序。答案在服务端就被剥离,因此根本不会到达浏览器。

诚信事件

切换标签页、复制尝试、同时开着的第二个会话、可疑的作答时间——每一项都记录在这次作答上,并附每道题的用时。

风险预警

交得太快的作答、多个并发会话或参与度过低都会被标记。每条预警都需要有人确认处理。

AI 代写检测

对文字作答跑一次检测,把结果和作业并排看。它为人的判断提供参考,而不替人做判断。

特殊便利

按百分比延长时间、增加作答次数、豁免、高对比度、更大字号、屏幕阅读器、减少动效——按学习者设定,自动生效。

AI 评分初稿

AI 在匿名化的上下文上起草评分量表得分、反馈和建议成绩。在人确认之前,什么都不会生效。

买家会问的问题

在把考试放上来之前

创建流程里有 7 种类型——测验、考试、练习、诊断、问卷、作品集任务和心理测量量表——每一种都预先配置了投放、诚信、评分、反馈和重考。题型有 19 种,包括完形填空、热区、矩阵、拖放、文件上传和语音作答。

把你已经在用的考试带来。

一张你现在就在用的评分量表、一份作品集任务说明、一套心理测量量表——我们会在通话中把它搭起来,而不是给你看一门示例课程。