人工智能评分¶
概述¶
AI评分使用大型语言模型对ZJUI-Learn中的手动问题进行评分。它将您的评分标准应用于提交的内容、生成分数并生成教师可以审查、调整或覆盖的解释。
使用案例¶
AI 评分适用于使用以下元素的手动评分问题:
常见用例包括:
- 论文和自由回答问题
- 数学证明和推导
- 图表和手写作品
- 代码解释和书面推理
- 简答理由
先决条件¶
在使用 AI 评分之前,您需要:
设置¶
-
导航至评估问题的手动评分。

-
开启“AI评分模式”。
-
打开“AI 评分”下拉菜单。 选择一个选项。

-
选择模型。 使用 ZJUI-Learn 为您的问题类型推荐的模型。
-
对提交进行评分。 在小批量(5 份提交)上进行测试,检查输出,并在运行全套之前完善您的评分标准。
最佳实践¶
- 使用 ZJUI-Learn 推荐的模型。 模型选择会显着影响分级准确性,特别是对于图像提交。推荐模型随着提供商能力的变化而更新。
- 使用评分细则而不是基于分数的评分。评分细则为模型提供了清晰、离散的标准,从而显着提高了准确性和一致性。
- 编写明确的标题项目。每个项目都应准确描述获得或失去学分的内容。不明确的项目会产生不明确的成绩。
- 使用评分者指南。 该字段用于说明模型应遵循的说明,但不应出现在面向学生的标题中 - 例如,“接受等效代数形式”或“不惩罚微小的符号差异”。
- 首先进行小批量测试。 在您花费学分和时间完成全套之前,运行 5-10 个提交会尽早发现标题问题。
- 迭代。 如果您在第一批中看到系统错误,请完善评分标准,而不是逐个覆盖成绩。
审查 AI 评分¶
教师应该在依靠人工智能输出来评分之前检查它。对于每次提交,人工智能评分都会生成评分细则和解释。
-
评分细则 — 模型选择的细则项目及其分值。
手动更改评分标准项目会覆盖 AI 评分。人工智能和人类评分都是可见的。
???示例“评分细则示例”
The AI's selected rubric items appear in the grading panel on the right side of the instance question page.  Once a human also grades the submission, both sets of selections appear side by side: the sparkle column shows the AI's selections, and the person column shows the human grader's. 
-
解释 — 模型评分决策背后的推理。
当提交内容包含图像时,模型对图像内容的转录也会包含在内。
???示例“解释示例”
**Explanation:**  **Transcription** (image submissions only)**:** 
AI和人类成绩同时存在后,ZJUI-Learn还可以显示比较信息:
-
人工智能协议指示器 — 每个项目的人工智能和人类评分者同意或不同意的视图。
一旦人工智能和人类都对提交的内容进行了评分,“人工智能协议”栏就会出现在手动评分表和评分标准编辑器中,标记他们同意或不同意的评分标准项目。
???示例“协议指标示例”
=== "AI/human disagreement"  - **Red plus** — AI selected the item; the human did not. - **Red minus** — The human selected the item; the AI did not. === "Full agreement" 
分级过程¶
AI 评分会根据以下输入组合提示并将其发送到所选模型。
发送到模型的输入:
- 调整的评分器提示(由 ZJUI-Learn 维护)
- 问题提示
- 正确答案
- 红字
- 学生提交
返回的输出:
- 评分细则(逐项评分)
- 解释
- 转录_(仅限图像提交)_
为了提高透明度和调试,发送到模型的确切提示可在每个评分提交中找到。
???示例“示例提示”

旋转校正: 特别是对于 Gemini 模型的图像分级,单独的 LLM 调用首先会旋转图像,以便在分级运行之前笔迹是直立的。
并发性: AI 评分可随时保留最多 20 个正在进行的提交。当一个任务完成后,下一个任务会自动开始。
隐私: 只要提交内容、问题或正确答案中没有包含学生身份信息(姓名、电子邮件、UIN),就不会发送给 LLM 提供商。避免在问题、评分标准、评分者指南或提交内容中包含不必要的个人数据。使用 ZJUI-Learn AI 评分学分时,学生提交的内容不用于模型训练。
计费¶
AI 评分需要 ZJUI-Learn 管理的积分或自定义 API 密钥。计费是按课程实例配置的。
计费方式¶
- ZJUI-Learn 管理的积分 — 设置更简单,无需提供商帐户。您通过 ZJUI-Learn 购买积分,并在提供商成本之外支付 20% 的基础设施费用。
- 自定义 API 密钥 — 携带您自己的提供商密钥(OpenAI、Anthropic、Google)。提供商直接向您计费,ZJUI-Learn 不收取基础设施费用。
您可以随时切换计费模式。购买的积分和保存的 API 密钥将一直存在,直到您明确删除它们为止,因此稍后切换回来不需要重新购买积分或重新输入密钥。
API 密钥静态加密 - ZJUI-Learn 绝不会以明文形式存储它们。
计费配置¶
===“ZJUI-Learn 管理的积分”
1. Go to **Instance settings → AI grading** in your course instance.
2. Click **Purchase credits** and complete checkout.
There are two types of credit:
- **Transferable credit** — Can be moved between course instances.
- **Nontransferable credit** — Locked to the instance it was added to.
The billing page displays usage in two ways:
- **Daily spending chart** — Credit usage broken down by day, so you can spot grading spikes or unexpected spend.
- **Transaction history** — A running log of past credit purchases and deductions.

===“自定义API密钥”
1. Go to **Instance settings → AI grading** in your course instance.
2. Check **Use custom API keys**.
3. Click **Add key** and provide one.
When using custom API keys, instructors are responsible for the provider terms and account configuration.

准确性¶
自 2025 年秋季以来,伊利诺伊大学厄巴纳-香槟分校已在多个 STEM 课程和数千份学生提交的申请中试行人工智能评分。
在一系列开放式问题和前沿模型中,与清晰的学生作业和一致的评分标准配合使用时,评分标准项目的准确性超过 99%。教师和助教报告说,人工智能评分与人类评分者一样准确,可以满足他们的需求,并且节省了大量的评分工作。
有关更多详细信息,请参阅我们发表的研究:
- 文本分级 —Zhao, C.、Fowler, M.、Gertner, Y.、Poulsen, S.、West, M. 和 Silva, M. (2026)。 AI 支持的自由答题评分和评分细化。载于_第 57 届 ACM 计算机科学教育技术研讨会论文集_(SIGCSE TS 2026)。
- 图像分级 — Levine, J.、Aenlle, M.、Zilles, C.、West, M. 和 Silva, M. (forthcoming)。 使用具有视觉能力的法学硕士对手写数学进行自动评分。载于《第 27 届教育人工智能国际会议论文集》(AIED 2026)。施普林格。
成本和运行时间¶
影响成本和运行时间的因素¶
| 因素 | 增加成本 | 降低成本 |
|---|---|---|
| 型号 | 更大的推理模型 | 更小的非推理模型 |
| 提交类型 | 图片提交 | 文字提交 |
| 问题内容大小 | 较长的提示和参考答案 | 更短的提示和参考答案 |
| 缓存输入 | — | 提交内容中重复的内容(例如问题文本、标题) |
ZJUI-Learn 管理的密钥除提供商成本外还需支付 20% 的基础设施费用。
基准测试¶
课程成本因课程长度、提交长度和模型选择而异。下面的数字是代表性的,而不是保证。
以下基准测试使用 ZJUI-Learn 管理的密钥运行,并包括 20% 的基础设施费用。
数值方法问题 - 文本评分(139 份提交):
这是一个数值方法问题,有打字、段落长度的提交,没有随机化,并且有一个标题。
| 型号 | 费用/提交 | 时间/提交 |
|---|---|---|
| GPT-5.4迷你 | 0.0020 美元 | 0.1秒 |
| GPT-5.4 | 0.0058 美元 | 0.2秒 |
| 双子座3.1专业版 | 0.0126 美元 | 0.6秒 |
动力学问题——图像分级(242 份提交):
这是一个介绍动力学问题,包含图像提交、随机化和标题。
| 型号 | 费用/提交 | 时间/提交 |
|---|---|---|
| GPT-5.4迷你 | 0.0042 美元 | 0.3秒 |
| GPT-5.4 | 0.0159 美元 | 0.5秒 |
| 双子座3.1专业版 | 0.0488 美元 | 1.5秒 |
每次提交时间是通过许多正在运行的提交来衡量的 - 单独评分的单个提交将需要更长的时间。