METHOD · 學習與人才發展

AI 作業批改

AI 標特徵、人給分數,順序不能反——分數要能對學生說明依據。

情境:學習與人才發展也用於:專業審查與合規難度:要搭建|建助手或系統起手工具:ChatGPT
這是學習與人才發展情境下的方法之一(共 6 個)· 看這個情境全部 →
一、這是什麼三十秒判斷關不關你的事

01解決的工作問題

一疊要看計算過程與論述的作業,改到第三十份的時候,標準已經跟第一份不一樣了。這不是不認真,是人的判斷本來就會漂移——而學生會發現,然後來問「為什麼他那樣寫有分我沒有」。AI 在這裡真正能幫的不是打分數,是把「這份作業裡出現了哪些規準上的特徵」標出來,讓你改到第三十份時還對得回第一份的標準。要它直接給分數,你會得到一個很像分數的數字,而且申訴時你答不出它怎麼來的。

真的有人這樣做過?外部佐證

目前沒有找到可公開查證的外部案例。這類工作多半不會有人發新聞稿,找不到不代表沒人做——但在找到之前,這一頁的方法就是作者自己的做法,不借別人的名義。

去找靈感看其他方法的外部案例 →

02什麼時候用、什麼時候別用

什麼情況下該用這一套

什麼情況下別用

由 AI 給分數
分數是評量決定,要有人負責、要能對學生說明。AI 只標特徵。
沒有規準時
沒有規準,AI 會用它心中的「好答案」當標準——通常是網路上最常見的寫法,不是你教的。
高利害的單次評量
升學、證照、資格考這類一次定生死的評量,判分程序另有規範,不適用這個方法。

誰會用到

老師
這是你的主場。守住一件事:分數由你給。AI 標特徵、你判斷,這個順序不能反。
教育訓練
企業內訓的評量同理。差別是學員通常更在意「我到底哪裡不對」,回饋的可行動性比分數重要。
HR
面試評分錨點跟評量規準是同一套技術:沒有行為錨點的等第,每個評分者心中的標準都不同。
行政
學生作業含姓名學號,是個資。去識別化與保存期限要先講清楚。
主管
多位助教共改一疊時,校準比規準本身更重要——規準一樣不代表理解一樣。

所屬工作情境

二、整件事怎麼跑先看圖,再看逐步

03流程圖

這張圖是整篇的骨架:輸入 → 步驟 → 困難點 → AI/Agent/Tool 介入 → 人工檢查 → 產出。紅框是最常出事的位置,綠框是不能下放的人工檢查點,粗框是中止條件。後面每一節都是在展開圖上的某一格。

AI 作業批改:AI 標特徵、人給分數,順序不能反
AI 作業批改:AI 標特徵、人給分數,順序不能反直向流程圖。輸入是題目原文、含行為錨點的評量規準、已去識別化的作業一次五到十份、以及教師自改的五份校準樣本。第一步由人寫規準與行為錨點,每個等第寫成可觀察的表現特徵,寫不出來的維度代表這次不該評它。第二步由人先自己改五份,含一份很好一份很差三份中間,這五份是校準基準也是之後檢查漂移的對照組。第三步由 AI 逐份對照規準標出哪些特徵出現、出現在第幾行,只標有、部分、沒有、無法判定四種,每個標記附引句,不給分數不給等第不下總評。第四步由人把 AI 對校準樣本的標記與自己改的結果比對,不一致的地方通常是規準沒寫清楚,要回頭修規準而不是回頭調 AI。第五步由檢核助手機械檢查同樣的特徵在不同份是否標得一致、有沒有出現規準以外的評語。第六步進入人工檢查點,由教師依特徵對照表給分並寫可行動的回饋,抽驗至少十份確認分數與特徵一致。產出是分數、回饋與抽驗紀錄。右側標示四個困難點:標準會漂移改到第三十份已經不是第一份的標準、AI 直接給分很誘人但學生問起時答不出依據、規準寫成形容詞導致每個助教的理解不同、回饋不可行動學生看完不知道下次要改什麼。中止條件是出現分數等第或規準以外的評語時該批退回重標。檢查點有退回線回到標記步驟。不一致就修規準INPUT / 輸入題目 + 規準(含行為錨點)+ 去識別化作業 + 5 份校準樣本一次 5–10 份HUMAN / 人工步驟人寫規準:每個等第寫成可觀察的表現特徵HUMAN / 人工步驟人先自己改五份(一好一差三中間)當校準基準AI / AI 介入AI 標特徵:有/部分/沒有/無法判定 + 附引句(不給分)CHECKPOINT / 人工檢查人比對 AI 與自改的五份;不一致就回頭修規準AGENT / 助手接手檢核助手掃描:跨份一致性、有無規準外評語CHECKPOINT / 人工檢查教師依對照表給分 + 寫可行動回饋 + 抽驗十份OUTPUT / 產出分數 + 回饋 + 特徵對照表(申訴時的依據)RISK / 困難點規準寫成形容詞:助教甲的「完整」不是助教乙的「完整」RISK / 困難點標準漂移:改到第三十份,已經不是第一份的標準RISK / 困難點AI 直接給分很誘人,但學生問「為什麼是 72 分」你答不出來STOP / 中止條件出現分數、等第或規準以外的評語 → 該批退回重標RISK / 困難點回饋不可行動:「寫得不錯」,學生不知道下次要改什麼
看圖重點:這張圖的第四格是最容易被跳過、也最不該跳過的一步:拿 AI 的標記去對五份自己改過的樣本。重點不在檢查 AI 準不準,在於不一致的地方幾乎都是規準沒寫清楚——而規準沒寫清楚這件事,如果等到改完八十份才發現,那八十份都要重看。另外注意整張圖裡 AI 的位置:它只標特徵,分數在最後一格由人給。順序反過來(先讓它給分、人再調整)看起來比較快,但你會失去唯一能對學生說明的東西:這一條規準,你的作業裡沒有出現。
純文字流程表(手機/螢幕閱讀器建議看這張)
AI 作業批改:AI 標特徵、人給分數,順序不能反(純文字流程表)
類型/角色流程步驟這一步的困難點/中止條件
1Human題目 + 規準(含行為錨點)+ 去識別化作業 + 5 份校準樣本
一次 5–10 份
2Human人寫規準:每個等第寫成可觀察的表現特徵
困難點/風險規準寫成形容詞:助教甲的「完整」不是助教乙的「完整」
3Human人先自己改五份(一好一差三中間)當校準基準
4AIAI 標特徵:有/部分/沒有/無法判定 + 附引句(不給分)
困難點/風險標準漂移:改到第三十份,已經不是第一份的標準
困難點/風險AI 直接給分很誘人,但學生問「為什麼是 72 分」你答不出來
5Checkpoint人比對 AI 與自改的五份;不一致就回頭修規準
6Agent檢核助手掃描:跨份一致性、有無規準外評語
失敗與中止條件出現分數、等第或規準以外的評語 → 該批退回重標
7Checkpoint教師依對照表給分 + 寫可行動回饋 + 抽驗十份
困難點/風險回饋不可行動:「寫得不錯」,學生不知道下次要改什麼
8Output分數 + 回饋 + 特徵對照表(申訴時的依據)

回流線:人比對 AI 與自改的五份;不一致就回頭修規準 → 人寫規準:每個等第寫成可觀察的表現特徵(不一致就修規準)

Mermaid 原始碼(貼進 Mermaid Live 或 draw.io 可再編輯)
可直接複製,改成你自己的流程
flowchart TD
    in1(["<b>Human</b><br/>題目 + 規準(含行為錨點)+ 去識別化作業 + 5 份校準樣本<br/><small>一次 5–10 份</small>"])
    s1["<b>Human</b><br/>人寫規準:每個等第寫成可觀察的表現特徵"]
    s2["<b>Human</b><br/>人先自己改五份(一好一差三中間)當校準基準"]
    a1[/"<b>AI</b><br/>AI 標特徵:有/部分/沒有/無法判定 + 附引句(不給分)"/]
    c1{{"<b>Checkpoint</b><br/>人比對 AI 與自改的五份;不一致就回頭修規準"}}
    g1[["<b>Agent</b><br/>檢核助手掃描:跨份一致性、有無規準外評語"]]
    c2{{"<b>Checkpoint</b><br/>教師依對照表給分 + 寫可行動回饋 + 抽驗十份"}}
    o1(["<b>Output</b><br/>分數 + 回饋 + 特徵對照表(申訴時的依據)"])
    r3>"<b>Risk</b><br/>規準寫成形容詞:助教甲的「完整」不是助教乙的「完整」"]
    r1>"<b>Risk</b><br/>標準漂移:改到第三十份,已經不是第一份的標準"]
    r2>"<b>Risk</b><br/>AI 直接給分很誘人,但學生問「為什麼是 72 分」你答不出來"]
    x1[/"<b>Stop</b><br/>出現分數、等第或規準以外的評語 → 該批退回重標"\]
    r4>"<b>Risk</b><br/>回饋不可行動:「寫得不錯」,學生不知道下次要改什麼"]

    in1 --> s1
    s1 --> s2
    s2 --> a1
    a1 --> c1
    c1 --> g1
    g1 --> c2
    c2 --> o1
    s1 -.->|風險| r3
    a1 -.->|風險| r1
    a1 -.->|風險| r2
    g1 ==>|中止| x1
    c2 -.->|風險| r4
    c1 -.->|不一致就修規準| s1

    classDef clsIn fill:#FFFFFF,stroke:#2C4459,stroke-width:2px,color:#141E2B
    classDef clsHuman fill:#FBFCFD,stroke:#7A8CA0,stroke-width:2px,color:#141E2B
    classDef clsAI fill:#FFF6EA,stroke:#DE9A45,stroke-width:2px,color:#141E2B
    classDef clsAgent fill:#FDEBD2,stroke:#B87A2E,stroke-width:2px,color:#141E2B
    classDef clsTool fill:#EDF2F6,stroke:#2C4459,stroke-width:2px,color:#141E2B
    classDef clsCheck fill:#E8F2EC,stroke:#3F7A5A,stroke-width:2px,color:#123024
    classDef clsOut fill:#141E2B,stroke:#141E2B,stroke-width:2px,color:#F2F6F9
    classDef clsRisk fill:#FCEFEA,stroke:#C0552F,stroke-width:2px,color:#5E2110
    classDef clsStop fill:#F7E1DB,stroke:#8E2F17,stroke-width:3px,color:#5E2110
    class in1 clsIn;
    class s1 clsHuman;
    class s2 clsHuman;
    class a1 clsAI;
    class c1 clsCheck;
    class g1 clsAgent;
    class c2 clsCheck;
    class o1 clsOut;
    class r3 clsRisk;
    class r1 clsRisk;
    class r2 clsRisk;
    class x1 clsStop;
    class r4 clsRisk;

04完整步驟圖的文字版,逐步展開

一句話版(快速回顧)

  1. 寫評量規準:每個等第寫成可觀察的表現特徵,不是形容詞。
  2. 自己先改五份(一好一差三中間)當校準基準。
  3. AI 逐份對照規準,只標「有/部分/沒有/無法判定」並附引句,不給分。
  4. 把 AI 對校準樣本的標記與自改結果比對;不一致就回頭修規準。
  5. 人依特徵對照表給分並寫可行動回饋,抽驗十份確認分數與標記一致。

完整版(每一步誰做、產出什麼)

誰做步驟與說明
1Human寫規準與錨點
每個維度、每個等第寫成可觀察的表現特徵。寫不出來的維度,代表這次不該評它。→ 評量規準
2Human自己先改五份
含一好一差三中間。這五份是校準基準,也是之後檢查 AI 有沒有漂移的對照組。→ 校準樣本
3AI標特徵
逐份對照規準,標出「哪些特徵出現了、出現在第幾行」。不給分數、不給等第、不下總評。→ 特徵對照表
4Human校準檢查
把 AI 對那五份校準樣本的標記,跟自己改的結果比對。不一致的地方通常是規準沒寫清楚。→ 校準結果與規準修訂
5Agent一致性掃描
機械檢查:同樣的特徵在不同份是否標得一致;有沒有出現規準以外的評語。→ 一致性標記
6Human給分與回饋
人依特徵對照表給分,並寫可行動的回饋。抽驗至少十份確認分數與特徵一致。→ 分數 + 回饋 + 抽驗紀錄
三、動手做備料 → 指令 → 產出 → 工具

05開始前要準備什麼標「必要」的沒備齊就先別開始

評量規準(含行為錨點)必要
每個等第對應什麼樣的具體表現。不是「優秀/良好/待加強」,是「有沒有寫出中間步驟」「有沒有引用課本以外的例子」。
去識別化的作業必要
姓名、學號、班級遮蔽。遮蔽由人或工具做,不是叫 AI 忽略。
自己先改的樣本必要
先自己改 5 份(含一份很好、一份很差、三份中間),當成校準基準。
回饋的用途必要
只給分數、還是要給可行動的回饋?後者要花的時間多很多,但學生才學得到東西。
常見錯誤型態可選
這份作業學生最常錯在哪。有這個,AI 標得準很多。

餵進去的東西要長這樣

題目原文 + 評量規準(含行為錨點)+ 已去識別化的作業(一次 5–10 份)+ 教師自改的校準樣本 5 份。

【課程】管理會計 第 3 單元
【題目】請說明為什麼在本案情境下應選用 A 方案而非 B 方案,並附計算過程。

【評量規準(行為錨點)】
C1 有列出兩案的比較基準(至少三項具體項目,如成本、交期、維護)
C2 計算過程完整——列出算式與數值,不只寫「經計算」
C3 有指出 B 方案的優點,而非單向論述 A 好
C4 結論有對回題目給定的情境條件(本案交期、預算限制)
C5 有標明數據來源或所做的假設

【本次不列入規準、由教師直接評】
表達流暢度、版面

【校準樣本(教師已自改)】
樣本 1(高):C1 有、C2 有、C3 有、C4 有、C5 有
樣本 2(低):C1 部分、C2 沒有、C3 沒有、C4 沒有、C5 沒有
樣本 3–5(中):(教師標記略)

【作業(已去識別化,8 份)】
作業 甲|姓名【已遮蔽】|學號【已遮蔽】
「A 方案比較好,因為成本較低。經計算 A 為 48 萬、B 為 55 萬,差 7 萬……」
(其餘 7 份格式相同)

06Prompt(快速/完整/進階)

A 快速版貼上就能用;B 完整實戰版把角色、限制、步驟、輸出格式與驗收標準寫足;C 進階版是拿去建 GPT/Skill/Agent 的系統指令。三種都附可替換變數、使用範例、預期輸出與人工確認點。

A
A. 快速版

手上有規準與一批作業,想先標出每份出現了哪些規準特徵。

適合的工具ChatGPTClaudeM365 Copilot
👇 直接複製,{ } 換成你的內容
以下是評量規準與一批已去識別化的作業。請:
1. 逐份、逐條對照規準,只標「有/部分/沒有/無法判定」四種。
2. 每個「有」與「部分」都附作業中的引句或位置。
3. 整理需教師判斷的地方:同樣標為「部分」但性質不同的情形。
4. 針對每個「沒有」寫一句可行動的建議(寫「下次要做什麼」,不是評價他這次如何)。
不得給分數、等第或總評;不得評論字跡、格式、態度、字數;不得比較或排序學生。
評量規準:{貼上};作業(已去識別化):{貼上}

可替換變數

變數要換成什麼
{貼上}評量規準(含每個等第的行為錨點)。
{貼上}已去識別化的作業(一次 5–10 份)。
完整使用範例(照這樣填)
以下是評量規準與一批已去識別化的作業。請照四個要求處理。(照母提示詞)

【題目】說明為什麼在這個情境下要選用 A 方案而非 B 方案,並附計算。

【評量規準】
C1 有列出兩案的比較基準(至少三項)
C2 計算過程完整(列出算式,不只有答案)
C3 有指出 B 方案的優點(不是只講 A 好)
C4 結論有對回題目的情境條件
C5 有標明數據來源或假設

【作業 甲(已去識別化)】
「A 方案比較好,因為成本較低。經計算 A 為 48 萬、B 為 55 萬,差 7 萬。B 方案雖然交期較快,但本案交期不緊。因此選 A。(成本數字依課本表 3-2)」

【作業 乙(已去識別化)】
「我認為應該選 A 方案。A 方案在成本、維護、擴充三方面都優於 B。經過計算之後可以確定 A 較為划算。所以結論是選 A 方案。」
預期輸出範例(拿到的東西應該長這樣)
【特徵對照表】
| 規準 | 甲 | 乙 |
|---|---|---|
| C1 兩案比較基準 ≥ 3 項 | 部分(成本、交期=2 項) | 有(成本、維護、擴充=3 項) |
| C2 計算過程完整 | 有(「A 為 48 萬、B 為 55 萬,差 7 萬」) | 沒有(「經過計算之後可以確定」,未列算式) |
| C3 有指出 B 的優點 | 有(「B 方案雖然交期較快」) | 沒有 |
| C4 結論對回情境條件 | 有(「本案交期不緊」) | 沒有(未提及本案的情境條件) |
| C5 標明來源或假設 | 有(「依課本表 3-2」) | 沒有 |

【位置與引句】
- 甲 C2:「經計算 A 為 48 萬、B 為 55 萬,差 7 萬」
- 甲 C4:「但本案交期不緊」
- 乙 C1:「在成本、維護、擴充三方面」

【需要你判斷的地方】
1. 甲的 C1 只列了 2 項基準,但那 2 項都用在推論上;乙列了 3 項但沒有任何一項展開。這兩種「部分符合」的性質不同,怎麼給分要你決定。
2. 乙寫「經過計算之後可以確定」——沒有算式。這算 C2 完全沒有,還是有做但沒寫?我無法判斷,建議在回饋中要求補算式。

【我沒有做的事】
- 沒有給任何分數、等第或總評。
- 沒有評論字跡、態度、用心程度,或規準以外的任何面向。
- 沒有比較甲乙誰比較好。

常見錯誤用法

  • 叫 AI「幫我打分數」。它會給一個很像分數的數字,而你答不出它怎麼來的。
  • 沒有規準就丟作業進去。它會用它心中的好答案當標準,通常不是你教的那套。
  • 接受「論述完整」這種標記。什麼叫完整?特徵要寫成看得到的東西。
  • 把 AI 的標記直接轉成分數。中間那一步(人的判斷)才是評量。
這一版另外不適合
  • 沒有評量規準時。
  • 作業尚未去識別化時。
缺少資料時怎麼辦

規準寫不出行為錨點的維度(例如「創意」),要老實標成「本次無法以規準判定」,不要硬標。硬標出來的結果會讓你以為有依據,然後在申訴時發現那個依據站不住。

這一版另外要人確認
  • 分數與等第。
  • 「部分符合」的性質判斷。
  • 可行動回饋的撰寫。
B
B. 完整實戰版

要一份可以支撐分數與申訴的批改紀錄:特徵對照、校準比對、回饋素材。

適合的工具ChatGPTClaudeM365 Copilot
👇 直接複製,{ } 換成你的內容
# 角色
你是作業批改的對照協助者。你的專長是把每份作業對回評量規準,標出哪些特徵出現、出現在哪裡。你不給分數、不給等第、不下總評、不比較學生。

# 背景
- 課程/單元:{名稱}
- 題目:{題目原文}
- 份數:{數量}
- 這次的回饋深度:{只標特徵/要附回饋素材}

# 任務
產出逐份特徵對照表、位置引句、需教師判斷清單與回饋素材。

# 可以使用的資料
只有【評量規準】【作業】兩段。你對這個題目的一般認識、你認為的標準答案、網路上常見的寫法,一律不得作為判定依據。

# 不可以做的事(違反任何一條就是失敗)
1. 不得給分數、等第、百分比或任何可轉為分數的評級。
2. 不得下總評(「整體表現良好」「論述完整」)。
3. 不得評論規準以外的面向:字跡、格式美觀、態度、用心程度、字數多寡。
4. 不得比較不同份作業的優劣,也不得排序。
5. 不得補上作業裡沒有的內容,包含你認為學生「應該是這個意思」。
6. 每一個「有」的標記都要附作業中的引句或位置。

# 處理步驟(請照順序做)
1. 逐份、逐條對照規準,標「有/部分/沒有/無法判定」。
2. 「有」與「部分」都附引句;「無法判定」說明為什麼(例如寫了做過但沒寫過程)。
3. 整理需教師判斷的地方:同樣標為「部分」但性質不同的情形。
4. 若要回饋素材:針對每個「沒有」的規準,寫出一句可行動的建議(要學生下次做什麼,不是評價他這次如何)。
5. 自檢:是否出現分數、等第、總評或規準外評語。

# 輸出格式(嚴格照這個順序,不要加額外段落)
## 一、逐份特徵對照表
(表格:規準|各份一欄|有/部分/沒有/無法判定)
## 二、位置與引句
(表格:份別|規準|引句)
## 三、需教師判斷清單
(同為「部分」但性質不同的情形)
## 四、回饋素材
(每個「沒有」對應一句可行動建議)
## 五、自檢
(未給分數、未下總評、未評論規準外面向、未比較學生)

# 驗收標準(產出後自己檢查一次並回報結果)
- [ ] 沒有分數、等第或任何可轉為分數的評級
- [ ] 沒有總評與規準外評語
- [ ] 每個「有」都附了引句
- [ ] 沒有補上作業裡沒有的內容
- [ ] 沒有比較或排序學生

【評量規準(含行為錨點)】
{貼上}

【作業(已去識別化)】
{逐份貼上}

可替換變數

變數要換成什麼
{名稱}課程或單元名稱。
{題目原文}題目要完整貼上,規準才對得回題目。
{數量}一次 5–10 份。太多份標記會開始不一致。
{只標特徵/要附回饋素材}回饋素材要多花時間,但學生才學得到東西。
完整使用範例(照這樣填)
背景填法示例:課程=管理會計 第 3 單元;題目=說明為何選 A 方案並附計算;份數=8;回饋深度=要附回饋素材。規準與作業照 A 版格式貼上,作業務必先遮蔽姓名學號。
預期輸出範例(拿到的東西應該長這樣)
與 A 版的差別:多出「回饋素材」與「自檢」兩節。回饋素材是針對每個「沒有」寫的可行動建議——注意它寫的是「下次要做什麼」,不是「你這次哪裡不好」。這兩種寫法對學生的效果差很多。

常見錯誤用法

  • 一次丟三十份。標到後面它會開始概括,跟人一樣會漂移。
  • 把回饋素材直接複製給學生。那是素材,要由你依這個學生的狀況調整。
  • 跳過「需教師判斷清單」。那幾項通常就是分數爭議會發生的地方。
這一版另外不適合
  • 高利害的單次評量(升學、證照、資格考)。
缺少資料時怎麼辦

作業寫得含糊、無法判定規準是否符合時,標「無法判定」並說明原因。這比猜一個結果有用——因為那正是回饋要告訴學生的:你可能做了,但沒有寫出來,而沒寫出來的就沒辦法被評到。

這一版另外要人確認
  • 分數與等第。
  • 需教師判斷項目的裁量。
  • 回饋的最終措辭與個別調整。
C
C. 進階版(做成批改一致性助手)

同一份作業有多位助教共改,或每學期都要改同一類作業,要把規準與紅線固定下來。

適合的工具自訂 GPT/Claude ProjectClaude SkillCopilot Studio
👇 直接複製,{ } 換成你的內容
# 你是誰
你是「批改對照助手」。教師或助教把已去識別化的作業貼給你,你依已核定的評量規準標出特徵。你不給分數、不給等第、不下總評、不比較學生。

# 你的資料來源
只有使用者這次貼上的作業,以及建置時附上的三份文件:本課程評量規準(含行為錨點)、校準樣本與教師標準答案標記、常見錯誤型態清單。除此之外一律不得引用,包含你對這個題目的一般認識。

# 絕對規則(違反就是失敗)
1. 不給分數、等第或任何可轉為分數的評級。
2. 不下總評,不評論字跡、格式、態度、用心、字數。
3. 不比較或排序學生。
4. 每個「有」都要附引句。
5. 作業裡沒有的內容不得補,也不得推測學生的意思。

# 條件判斷(依序檢查,先中的先套用)
1. 作業中仍可見姓名、學號、班級 → 停止作業,回覆「請先去識別化」,並列出偵測到的欄位。
2. 規準中含無法觀察的維度(創意、用心、態度)→ 標為「本規準無法以文本判定」,建議改寫或改由教師直接評。
3. 作業內容疑似整段複製(與同批其他份高度雷同)→ 只標示「與第 ○ 份高度雷同」,不判定抄襲,導向 {學術倫理窗口}。
4. 一次超過十份 → 建議分批,說明份數過多會使標記開始不一致。
5. 使用者要求給分 → 拒絕,回覆「本助手不給分;可提供特徵對照供你判分,並保留依據以備申訴」。

# 例外處理
- 使用者說「你就大概給個分我再調整」→ 拒絕。回覆「一旦有了數字,後續的判斷會被它錨定;而學生問起時,那個數字沒有依據」。
- 使用者說「這份寫得很好對吧」→ 回覆「我只能列出它符合哪些規準;好不好是你的判斷」。
- 使用者要求評論學生的學習態度 → 拒絕,回覆「態度無法從一份作業判定,本助手只對照規準」。
- 使用者要求把作業存起來當範例 → 提醒需取得學生同意並去識別化。

# 每次回覆的格式
【去識別化檢查】通過/偵測到 N 個未遮蔽欄位
【特徵對照表】(有/部分/沒有/無法判定)
【位置與引句】
【需教師判斷】(性質不同的「部分符合」)
【回饋素材】(每個「沒有」一句可行動建議)
【與校準樣本的一致性】(本批標記是否與樣本標準一致)
【自檢】(未給分、未總評、未評論規準外面向、未比較)

# 固定結尾
每次回覆最後一行固定加註:「本對照依 {規準版本};分數與回饋由 {權責} 決定並負責說明。本助手不給分、不排序。」

# 自我檢查(每次回覆前執行,不需輸出過程)
- 是否出現數字評級?有就刪。
- 是否出現規準以外的評語?有就刪。
- 每個「有」是否附引句?沒有就補。

# 建置參數
評量規準(含錨點):{附檔,含版本}
校準樣本與教師標記:{附檔}
常見錯誤型態清單:{附檔}
學術倫理窗口:{窗口}
權責:{職稱}

可替換變數

變數要換成什麼
{附檔,含版本}規準要有版本,因為校準之後常會修。
{附檔}校準樣本(含教師自改的標記)與常見錯誤清單。
{窗口}疑似抄襲要導向誰。
{職稱}誰給分、誰對學生說明。
完整使用範例(照這樣填)
建置時把三份文件上傳為知識檔案。上線前用至少二十份歷史作業測過,其中五份要刻意含陷阱:一份未遮蔽姓名學號、一份要求它給分、一份規準含「創意」、兩份內容高度雷同,確認它分別停止作業、拒絕給分、標為無法判定、只標雷同而不判定抄襲。
預期輸出範例(拿到的東西應該長這樣)
與 B 版的差別:這一版會拿校準樣本回頭檢查自己——「本批的標記是否與教師樣本一致」。這是防漂移的機制:人改到第三十份會漂移,AI 標到第三十份也會,差別在於這一版每批都回頭對一次樣本。

常見錯誤用法

  • 為了趕進度讓它給分。分數一旦出現,你後面的判斷都會被它錨定。
  • 規準改了沒同步知識檔案。它會用舊規準標,而且結尾還印著新版本號。
  • 把「與第 ○ 份高度雷同」直接當成抄襲認定。那是提示,不是結論。
這一版另外不適合
  • 高利害的單次評量。
  • 還沒有評量規準與校準樣本時。
缺少資料時怎麼辦

規準無法判定的維度要明講。實務上「創意」「用心」這類維度不是不能評,是不能用這個方法評——它們需要教師直接看,而且評的時候要另外說明依據。

這一版另外要人確認
  • 上線前:用至少二十份歷史作業測過,含五份刻意陷阱。
  • 每批:校準比對、給分、回饋撰寫、申訴說明。
  • 每學期:依校準結果修訂規準並升版。

07產出應該長什麼樣拿到的東西要長這樣

五節:逐份特徵對照表、位置與引句、需教師判斷清單、回饋素材、自檢。全篇不得出現分數、等第或總評。

完成品:校準比對抓到的兩個問題

把 AI 對五份校準樣本的標記,跟教師自己改的結果擺在一起。

─────────────────────────────
【樣本 3|不一致:C1】
教師標記:部分
AI 標記:有
作業原文:「A 在成本、時程、後續維護上都較 B 為佳。」

爭點:規準寫「至少三項具體項目」。學生確實列了三個詞,但沒有任何一項展開說明。
教師的認定:列出詞不等於列出基準,要有比較的內容才算。
AI 的認定:出現三個項目名稱=符合。

處置:**規準沒寫清楚,回頭修規準**(不是回頭調 AI)。
修訂後:「C1 有列出兩案的比較基準至少三項,且每項須有具體比較內容(數值、程度或事實),僅列項目名稱不計入。」
※ 修訂後重跑,AI 對樣本 3 改標為「部分」,與教師一致。

─────────────────────────────
【樣本 5|不一致:C2】
教師標記:有
AI 標記:部分
作業原文:「48 − 55 = −7(萬元)」

爭點:算式完整但沒有寫出「48 是 A、55 是 B」。
教師的認定:前文已說明何者為 A、何者為 B,算式可讀。
AI 的認定:算式本身未標示對象。

處置:這一項是 AI 太嚴格,**規準補一句說明範圍**:「C2 之判定得參照前後文,不以算式單獨呈現為限。」

─────────────────────────────
【校準結論】
五份中兩份不一致,兩次都是規準寫得不夠精確——不是 AI 標錯,也不是教師標錯。
這正是校準要做在批改之前的原因:如果直接改完八十份才發現 C1 有兩種理解,那八十份都要重看。

【修訂後的一致性】
重跑五份校準樣本,五份全部一致。規準升為 v2,本次批改採用 v2。
輸出格式規格(要照著做的人再展開)
  • 標記只有四種:有/部分/沒有/無法判定。
  • 每個「有」與「部分」都要附作業中的引句或位置。
  • 回饋素材寫成「下次要做什麼」,不是「你這次哪裡不好」。
  • 需教師判斷清單要說明爭點,例如「兩份都標部分,但性質不同」。
  • 自檢固定出現:未給分、未總評、未評論規準外面向、未比較學生。
## 一、逐份特徵對照表
| 規準 | 甲 | 乙 | 丙 |
|---|---|---|---|
| C1 比較基準 ≥ 3 項 | 部分(2 項) | 有(3 項) | 有(4 項) |
| C2 計算過程完整 | 有 | 沒有 | 部分(有算式但缺單位) |
| C3 指出 B 的優點 | 有 | 沒有 | 有 |
| C4 結論對回情境 | 有 | 沒有 | 沒有 |
| C5 標明來源或假設 | 有 | 沒有 | 有 |

## 二、位置與引句
| 份別 | 規準 | 引句 |
|---|---|---|
| 甲 | C2 | 「經計算 A 為 48 萬、B 為 55 萬,差 7 萬」 |
| 甲 | C4 | 「但本案交期不緊」 |
| 丙 | C2 | 「48 − 55 = −7」(未標單位) |

## 三、需教師判斷清單
1. 甲的 C1 只有 2 項基準,但兩項都用在推論上;乙有 3 項卻沒有任何一項展開。兩者都是「部分」,性質不同。
2. 丙的 C2 有算式但缺單位——這算完整還是部分?規準未定義是否要求單位,建議補進規準。

## 四、回饋素材
| 份別 | 缺的規準 | 可行動建議 |
|---|---|---|
| 乙 | C2 | 「下次請把算式寫出來(例如 A:48 萬、B:55 萬,差額 7 萬)。只寫『經計算』的話,讀的人無法確認你算了什麼。」 |
| 乙 | C4 | 「結論請對回題目給的條件——本案的交期與預算限制,分別支持哪一個方案?」 |
| 丙 | C4 | 「你的比較很完整,但沒有回到本案情境。請在結論加一句:在本案的交期條件下,這個差額代表什麼。」 |

## 五、自檢
- 未給分數、等第或任何可轉為分數的評級:是
- 未下總評、未評論字跡格式態度用心字數:是
- 未比較或排序學生:是
- 每個「有」與「部分」皆附引句:是

08工具怎麼挑

這幾支都做得到——差別在你手上有哪一支、資料能不能外流。標「起手」的是不知道從哪支開始時的建議,不是限定。

工具什麼時候用為什麼注意
ChatGPT ↗起手
對照規準標特徵
對照規準標特徵、產回饋素材逐條對照並附引句的穩定度不錯。作業含個資,未去識別化不得貼入;也不要用會被納入訓練的帳號。
Claude ↗作業長、論述型長文逐段處理較不會漏掉中段論述。同樣要確認資料處理政策與保存期限。
M365 Copilot ↗學校或機構已導入 M365,作業在內部系統資料不出租戶,較適合含學生資料的檔案。權限範圍要確認,避免讀到其他班級的資料。
自訂 GPT/Claude Project
多助教共改
多位助教共改或每學期重複規準與校準樣本固定,不同人標出來的一致。規準改版要同步知識檔案。
Gemini ↗
讀 Google Classroom 的作業
作業與測驗收在 Google Classroom 或表單作答資料不必匯出,就地對照評分規準標特徵。標特徵可以,給分不行——分數要人給,而且要說得出依據。
四、不要做錯這幾關不下放

09會卡住與會做錯的地方

會卡住的地方(流程困難點)

標準會漂移
改到第三十份,你對「說明清楚」的門檻已經跟第一份不同。而學生會拿彼此的作業比對。
AI 直接給分很誘人
它給的數字看起來很合理。但學生問「為什麼是 72 分不是 78 分」的時候,你沒有東西可以拿出來。
規準寫成形容詞
「論述完整」——什麼叫完整?助教甲跟助教乙的完整不是同一件事。
回饋不可行動
「寫得不錯,繼續加油」——學生看完不知道下次要改什麼。

會做錯的地方(常見失敗方式)

AI 直接給分

數字看起來很合理,但申訴時答不出它怎麼來的。

怎麼修輸出限定四種標記 + 附引句;分數由人給,依據是對照表。

規準寫成形容詞

「論述完整」讓每個助教有自己的理解,分數加不起來。

怎麼修每個等第寫成可觀察的表現特徵;校準不一致時修規準。

沒有校準就開改

改完八十份才發現規準有兩種理解,全部要重看。

怎麼修先自己改五份,AI 標記與之比對,不一致處先修規準。

回饋不可行動

「寫得不錯,繼續加油」,學生不知道下次要改什麼。

怎麼修每個「沒有」對應一句「下次要做什麼」的具體建議。

其他注意事項

10人工把關與安全限制

AI/Agent/Tool 介入在哪幾步

流程位置做什麼/怎麼做
標記階段AI對照規準標出現的特徵
只標「這個特徵有/沒有/部分」,並附作業中的位置或引句。不給分數、不給等第、不下總評。
校準階段Human用五份樣本比對
AI 標記與教師自改結果逐項比對,不一致處回頭修規準,不是回頭改 AI。
掃描階段Agent一致性與越權評語掃描
檢查同一特徵在不同份的標記是否一致,以及是否出現規準以外的評語(例如「態度不佳」)。

這幾關不下放

規準與錨點
要評什麼、什麼算達標,是教學判斷。
分數
AI 不給分。分數要有人負責,也要能對學生說明。
回饋內容
可行動的回饋需要理解這個學生的狀態,AI 只能提供素材。
申訴處理
學生來問時,依據是特徵對照表與規準,不是「系統算的」。

安全與權限限制

學生作業是個資
姓名、學號、班級要先遮蔽;使用哪些帳號、保存多久、何時刪除,依所屬機構規定辦理。
不得作為訓練資料
選用服務時要確認內容不會被納入模型訓練;作業要留作範例須另取得同意並去識別化。
疑似抄襲不由 AI 認定
只標示雷同,學術倫理的認定與程序由權責單位處理。

11Checklist 與驗收標準

做的時候逐項打勾

做完了才檢查:全部成立才算完成

  1. 所有作業都已去識別化,輸出中沒有出現姓名、學號或班級。
  2. AI 未給分數、等第或任何可轉為分數的評級。
  3. 沒有總評,也沒有評論字跡、格式、態度、用心、字數。
  4. 每個「有」與「部分」都附了作業中的引句或位置。
  5. 已用至少五份校準樣本比對,不一致處已回頭修訂規準並重跑。
  6. 分數由教師給出,且抽驗十份確認分數與特徵標記一致。
  7. 回饋寫成「下次要做什麼」的可行動建議。
  8. 疑似雷同的情形僅標示,未由 AI 判定抄襲。
五、延伸看別人做過,然後往下一步

12實際案例

改到第三十份,你已經不是第一份的那個標準了

當時的狀況:一疊八十份的申論作業,改到後段開始出現學生申訴:「他那樣寫有分,我為什麼沒有」。回頭看,兩份確實寫得差不多,但一份改在第五份、一份改在第六十份。中間發生的不是偏心,是標準漂移。

AI 做了什麼
  • 逐份對照規準,只標「有/部分/沒有/無法判定」四種,每個標記附作業中的引句。
  • 指出兩份同樣標為「部分符合」但性質不同的情形,交給教師判斷。
  • 把規準未定義的爭點標出來(算式缺單位算不算完整),建議補進規準。
  • 針對每個「沒有」產出一句可行動的回饋素材,寫成「下次要做什麼」。
人做了什麼
  • 先自己改五份當校準樣本,含一好一差三中間——中間那三份才測得出標準在哪。
  • 把 AI 對這五份的標記跟自己的比對,不一致的地方回頭修規準(而不是回頭調 AI)。
  • 所有分數由自己給,依據是特徵對照表。
  • 抽驗十份,確認分數與標記一致,沒有出現「特徵一樣但分數不同」的情況。

結果:學生來申訴時,能拿出來的不是「系統算的」,是「你的作業裡沒有出現 C4 這個特徵,這是規準第四條」。有沒有這張表,決定了申訴是討論還是爭執。

待補資料:本站不提供批改時間縮短幅度、評分信度等量化數據,本例為說明用的示意情境。學生作業涉個資,處理方式請依所屬機構規定辦理。

13相關方法與下一步

評分錨點怎麼寫

面試評分表跟評量規準是同一套技術。

批改結果回頭修教材

同一個規準大家都沒拿到,通常是教材的問題不是學生的問題。

出題與規準要一起設計

題目怎麼問,決定規準能不能寫得出來。

把規準版本管好

規準會隨校準修訂,用錯版本等於用錯標準。

可直接使用RELATED PROMPTS

Download

這個方法的模板與 Checklist 下載包整理中——訂閱更新,上架後第一時間通知你。

取得 AI 實戰工具與更新

之後會不定期整理:新方法、指令包(Prompt Pack)、Checklist 與模板。免費、無廣告;正式寄送前會先寄確認信,隨時可來信要求刪除。

← 回「學習與人才發展」回找方法 →