跳转至

人工智能评分

概述

AI评分使用大型语言模型对ZJUI-Learn中的手动问题进行评分。它将您的评分标准应用于提交的内容、生成分数并生成教师可以审查、调整或覆盖的解释。

使用案例

AI 评分适用于使用以下元素的手动评分问题:

常见用例包括:

  • 论文和自由回答问题
  • 数学证明和推导
  • 图表和手写作品
  • 代码解释和书面推理
  • 简答理由

先决条件

在使用 AI 评分之前,您需要:

  • 课程实例
  • 手动评分的问题,至少提交一份
  • 一个标题
  • 课程所有者权限,需要购买学分
  • 为您的课程实例配置的 AI 评分计费

设置

  1. 导航至评估问题的手动评分

    评估问题的手动评分页面。

  2. 开启“AI评分模式”。

  3. 打开“AI 评分”下拉菜单。 选择一个选项。

    打开AI评分下拉菜单的手动评分页面。

  4. 选择模型。 使用 ZJUI-Learn 为您的问题类型推荐的模型。

  5. 对提交进行评分。 在小批量(5 份提交)上进行测试,检查输出,并在运行全套之前完善您的评分标准。

最佳实践

  • 使用 ZJUI-Learn 推荐的模型。 模型选择会显着影响分级准确性,特别是对于图像提交。推荐模型随着提供商能力的变化而更新。
  • 使用评分细则而不是基于分数的评分。评分细则为模型提供了清晰、离散的标准,从而显着提高了准确性和一致性。
  • 编写明确的标题项目。每个项目都应准确描述获得或失去学分的内容。不明确的项目会产生不明确的成绩。
  • 使用评分者指南。 该字段用于说明模型应遵循的说明,但不应出现在面向学生的标题中 - 例如,“接受等效代数形式”或“不惩罚微小的符号差异”。
  • 首先进行小批量测试。 在您花费学分和时间完成全套之前,运行 5-10 个提交会尽早发现标题问题。
  • 迭代。 如果您在第一批中看到系统错误,请完善评分标准,而不是逐个覆盖成绩。

审查 AI 评分

教师应该在依靠人工智能输出来评分之前检查它。对于每次提交,人工智能评分都会生成评分细则和解释。

  • 评分细则 — 模型选择的细则项目及其分值。

    手动更改评分标准项目会覆盖 AI 评分。人工智能和人类评分都是可见的。

    ???示例“评分细则示例”

    The AI's selected rubric items appear in the grading panel on the right side of the instance question page.
    
    ![AI-generated grading shown as selected rubric items with point values.](ai-generated-grading.png)
    
    Once a human also grades the submission, both sets of selections appear side by side: the sparkle column shows the AI's selections, and the person column shows the human grader's.
    
    ![Human-graded rubric with differences from the AI grade highlighted.](ai-human-grading-difference.png)
    
  • 解释 — 模型评分决策背后的推理。

    当提交内容包含图像时,模型对图像内容的转录也会包含在内。

    ???示例“解释示例”

    **Explanation:**
    
    ![AI grading explanation describing the model's reasoning.](ai-grading-explanation.png)
    
    **Transcription** (image submissions only)**:**
    
    ![AI transcription of a student's image submission, shown beneath the explanation.](ai-grading-transcription.png)
    

AI和人类成绩同时存在后,ZJUI-Learn还可以显示比较信息:

  • 人工智能协议指示器 — 每个项目的人工智能和人类评分者同意或不同意的视图。

    一旦人工智能和人类都对提交的内容进行了评分,“人工智能协议”栏就会出现在手动评分表和评分标准编辑器中,标记他们同意或不同意的评分标准项目。

    ???示例“协议指标示例”

    === "AI/human disagreement"
    
        ![AI agreement column on the submission list, showing per-item disagreements.](ai-agreement-column-per-submission.png)
    
        - **Red plus** — AI selected the item; the human did not.
        - **Red minus** — The human selected the item; the AI did not.
    
    === "Full agreement"
    
        ![AI agreement column on the submission list, showing a green checkmark for full agreement.](ai-agreement-column-per-submission-checkmark.png)
    

分级过程

AI 评分会根据以下输入组合提示并将其发送到所选模型。

发送到模型的输入:

  • 调整的评分器提示(由 ZJUI-Learn 维护)
  • 问题提示
  • 正确答案
  • 红字
  • 学生提交

返回的输出:

  • 评分细则(逐项评分)
  • 解释
  • 转录_(仅限图像提交)_

为了提高透明度和调试,发送到模型的确切提示可在每个评分提交中找到。

???示例“示例提示”

![Raw prompt sent to the model for a single submission.](ai-grading-raw-prompt.png)

旋转校正: 特别是对于 Gemini 模型的图像分级,单独的 LLM 调用首先会旋转图像,以便在分级运行之前笔迹是直立的。

并发性: AI 评分可随时保留最多 20 个正在进行的提交。当一个任务完成后,下一个任务会自动开始。

隐私: 只要提交内容、问题或正确答案中没有包含学生身份信息(姓名、电子邮件、UIN),就不会发送给 LLM 提供商。避免在问题、评分标准、评分者指南或提交内容中包含不必要的个人数据。使用 ZJUI-Learn AI 评分学分时,学生提交的内容不用于模型训练。

计费

AI 评分需要 ZJUI-Learn 管理的积分或自定义 API 密钥。计费是按课程实例配置的。

计费方式

  • ZJUI-Learn 管理的积分 — 设置更简单,无需提供商帐户。您通过 ZJUI-Learn 购买积分,并在提供商成本之外支付 20% 的基础设施费用。
  • 自定义 API 密钥 — 携带您自己的提供商密钥(OpenAI、Anthropic、Google)。提供商直接向您计费,ZJUI-Learn 不收取基础设施费用。

您可以随时切换计费模式。购买的积分和保存的 API 密钥将一直存在,直到您明确删除它们为止,因此稍后切换回来不需要重新购买积分或重新输入密钥。

API 密钥静态加密 - ZJUI-Learn 绝不会以明文形式存储它们。

计费配置

===“ZJUI-Learn 管理的积分”

1. Go to **Instance settings → AI grading** in your course instance.

2. Click **Purchase credits** and complete checkout.

There are two types of credit:

- **Transferable credit** — Can be moved between course instances.
- **Nontransferable credit** — Locked to the instance it was added to.

The billing page displays usage in two ways:

- **Daily spending chart** — Credit usage broken down by day, so you can spot grading spikes or unexpected spend.
- **Transaction history** — A running log of past credit purchases and deductions.

![Billing page showing the daily spending chart and transaction history.](transaction-history.png)

===“自定义API密钥”

1. Go to **Instance settings → AI grading** in your course instance.

2. Check **Use custom API keys**.

3. Click **Add key** and provide one.

When using custom API keys, instructors are responsible for the provider terms and account configuration.

![Custom API key billing configuration.](ai-grading-byok.png)

准确性

自 2025 年秋季以来,伊利诺伊大学厄巴纳-香槟分校已在多个 STEM 课程和数千份学生提交的申请中试行人工智能评分。

在一系列开放式问题和前沿模型中,与清晰的学生作业和一致的评分标准配合使用时,评分标准项目的准确性超过 99%。教师和助教报告说,人工智能评分与人类评分者一样准确,可以满足他们的需求,并且节省了大量的评分工作。

有关更多详细信息,请参阅我们发表的研究:

成本和运行时间

影响成本和运行时间的因素

因素 增加成本 降低成本
型号 更大的推理模型 更小的非推理模型
提交类型 图片提交 文字提交
问题内容大小 较长的提示和参考答案 更短的提示和参考答案
缓存输入 提交内容中重复的内容(例如问题文本、标题)

ZJUI-Learn 管理的密钥除提供商成本外还需支付 20% 的基础设施费用。

基准测试

课程成本因课程长度、提交长度和模型选择而异。下面的数字是代表性的,而不是保证。

以下基准测试使用 ZJUI-Learn 管理的密钥运行,并包括 20% 的基础设施费用。

数值方法问题 - 文本评分(139 份提交):

这是一个数值方法问题,有打字、段落长度的提交,没有随机化,并且有一个标题。

型号 费用/提交 时间/提交
GPT-5.4迷你 0.0020 美元 0.1秒
GPT-5.4 0.0058 美元 0.2秒
双子座3.1专业版 0.0126 美元 0.6秒

动力学问题——图像分级(242 份提交):

这是一个介绍动力学问题,包含图像提交、随机化和标题。

型号 费用/提交 时间/提交
GPT-5.4迷你 0.0042 美元 0.3秒
GPT-5.4 0.0159 美元 0.5秒
双子座3.1专业版 0.0488 美元 1.5秒

每次提交时间是通过许多正在运行的提交来衡量的 - 单独评分的单个提交将需要更长的时间。