METHOD · 資料與報表

AI 學習成效分析

分清楚「全班的問題」與「個人的問題」——同一概念只有一題特別低,通常是題目的問題。

情境:資料與報表也用於:學習與人才發展難度:要搭建|建助手或系統起手工具:ChatGPT
這是資料與報表情境下的方法之一(共 9 個)· 看這個情境全部 →
一、這是什麼三十秒判斷關不關你的事

01解決的工作問題

考完了,成績單只告訴你平均 72 分。但真正有用的資訊不在平均裡——是「第 7 題全班八成錯」(那是教材或題目的問題,不是學生的問題),還是「這五個人每一題都在同一個概念上卡住」。這兩件事的處理方式完全相反,而成績單分不出來。至於 AI 在這裡最危險的行為:你給它三十筆成績,它可以做出相關分析、趨勢圖、甚至預測誰會不及格——每一張圖都很科學,而三十筆資料撐不起其中任何一個結論。

真的有人這樣做過?外部佐證

目前沒有找到可公開查證的外部案例。這類工作多半不會有人發新聞稿,找不到不代表沒人做——但在找到之前,這一頁的方法就是作者自己的做法,不借別人的名義。

去找靈感看其他方法的外部案例 →

02什麼時候用、什麼時候別用

什麼情況下該用這一套

什麼情況下別用

預測誰會不及格
預測會變成標籤,標籤會影響對待方式,而對待方式會讓預測成真。要做的是提供補救,不是預測。
比較老師或班級
班級不是隨機分派,樣本也不夠。用這種比較做人事或考核判斷,方法上站不住。
只有總分時
總分看不出哪個概念沒教到。沒有逐題資料,這個方法做不了。

誰會用到

老師
你要找的是「全班一起錯的題」——那通常是你教的方式或題目本身的問題,改它的效益最高。
教育訓練
內訓的樣本通常更小(一梯次十幾人)。小樣本能做的是看個別卡點,不是算比例。
HR
訓練成效不要只看測驗分數。分數高不代表回到工作現場做得出來。
主管
看到「兩班平均差 5 分」先別下結論。班級不是隨機分派,差異的來源太多。
行政
逐題作答資料連著學號就是個資。分析用的檔案要去識別化,也要有保存期限。

所屬工作情境

二、整件事怎麼跑先看圖,再看逐步

03流程圖

這張圖是整篇的骨架:輸入 → 步驟 → 困難點 → AI/Agent/Tool 介入 → 人工檢查 → 產出。紅框是最常出事的位置,綠框是不能下放的人工檢查點,粗框是中止條件。後面每一節都是在展開圖上的某一格。

AI 學習成效分析:分清楚「全班的問題」與「個人的問題」
AI 學習成效分析:分清楚「全班的問題」與「個人的問題」直向流程圖。輸入是逐題作答資料已去識別化、題目與概念對照表、這次要回答的問題、樣本數與限制。第一步由人決定這次要回答哪一個問題:哪一節要重教,或哪些人需要補救,兩個一起問會得到一份什麼都講一點的報告。第二步由 AI 做資料體檢,檢查缺漏、對照表是否完整、樣本數是否足以支持比例陳述,不足的直接標出來。第三步由試算表工具計算逐題通過率、逐概念通過率與個人錯題分布,公式看得見可驗算。第四步由 AI 把問題分成全班共通與個別集中兩類,全班共通再分成同概念下單題偏低的疑似題目問題、以及整個概念偏低的疑似教學問題,並標出樣本不足無法判斷的部分。第五步由檢核助手機械掃描輸出中是否出現因果語句、預測、學生特質描述、以及未標註樣本數的百分比。第六步進入人工檢查點,把共通問題轉成改教材或重教,把個別集中轉成補救安排,並記錄下次要驗證什麼。右側標示四個困難點:只看平均而平均看不出分布、小樣本被當成證據換一批人數字就變、相關被寫成因果、分析做完沒有行動導致報告白做。中止條件是出現預測或分群標籤時整份退回重寫。檢查點有退回線回到分類步驟。退回重新分類INPUT / 輸入逐題作答(去識別化)+ 題目概念對照 + 要回答的問題 + 樣本數只有總分就做不了HUMAN / 人工步驟人決定這次只回答一個問題:改教材,或補救個人AI / AI 介入AI 資料體檢:缺漏、對照完整性、樣本是否撐得起比例TOOL / 工具處理試算表算逐題/逐概念通過率與個人錯題分布AI / AI 介入AI 分類:全班共通(疑似題目/疑似教學)vs 個別集中AGENT / 助手接手檢核助手掃描:因果語句/預測/學生特質/未標 n 的百分比CHECKPOINT / 人工檢查人轉成行動:改教材或補救 + 記錄下次要驗證什麼OUTPUT / 產出教學調整計畫 + 限制說明 + 待驗證項目RISK / 困難點小樣本當證據:換一批人,20% 可能變成 10% 或 30%RISK / 困難點只看平均:72 分可能是大家都 72,也可能是一半 90 一半 54RISK / 困難點相關寫成因果:也可能兩者來自同一個原因STOP / 中止條件出現預測或分群標籤(高風險群、落後群)→ 整份退回重寫RISK / 困難點分析完沒有行動,下學期教法一模一樣
看圖重點:這張圖第四格那個分岔是整件事的關鍵:同一個概念下只有一題特別低,跟整個概念都低,是兩件不同的事。前者通常是題目的問題,把它當成教學問題會白重教一次;後者才需要調整教材。分辨方法不需要統計,只要看同概念的其他題有沒有跟著塌。另外注意右下角的中止條件:預測與分群標籤是這個方法唯一的硬紅線——不是因為算不出來,是因為標籤會改變你對待學生的方式,而那個改變本身就會讓預測成真。
純文字流程表(手機/螢幕閱讀器建議看這張)
AI 學習成效分析:分清楚「全班的問題」與「個人的問題」(純文字流程表)
類型/角色流程步驟這一步的困難點/中止條件
1Human逐題作答(去識別化)+ 題目概念對照 + 要回答的問題 + 樣本數
只有總分就做不了
2Human人決定這次只回答一個問題:改教材,或補救個人
3AIAI 資料體檢:缺漏、對照完整性、樣本是否撐得起比例
困難點/風險小樣本當證據:換一批人,20% 可能變成 10% 或 30%
4Tool試算表算逐題/逐概念通過率與個人錯題分布
困難點/風險只看平均:72 分可能是大家都 72,也可能是一半 90 一半 54
5AIAI 分類:全班共通(疑似題目/疑似教學)vs 個別集中
困難點/風險相關寫成因果:也可能兩者來自同一個原因
6Agent檢核助手掃描:因果語句/預測/學生特質/未標 n 的百分比
失敗與中止條件出現預測或分群標籤(高風險群、落後群)→ 整份退回重寫
7Checkpoint人轉成行動:改教材或補救 + 記錄下次要驗證什麼
困難點/風險分析完沒有行動,下學期教法一模一樣
8Output教學調整計畫 + 限制說明 + 待驗證項目

回流線:人轉成行動:改教材或補救 + 記錄下次要驗證什麼 → AI 分類:全班共通(疑似題目/疑似教學)vs 個別集中(退回重新分類)

Mermaid 原始碼(貼進 Mermaid Live 或 draw.io 可再編輯)
可直接複製,改成你自己的流程
flowchart TD
    in1(["<b>Human</b><br/>逐題作答(去識別化)+ 題目概念對照 + 要回答的問題 + 樣本數<br/><small>只有總分就做不了</small>"])
    s1["<b>Human</b><br/>人決定這次只回答一個問題:改教材,或補救個人"]
    a1[/"<b>AI</b><br/>AI 資料體檢:缺漏、對照完整性、樣本是否撐得起比例"/]
    t1[("<b>Tool</b><br/>試算表算逐題/逐概念通過率與個人錯題分布")]
    a2[/"<b>AI</b><br/>AI 分類:全班共通(疑似題目/疑似教學)vs 個別集中"/]
    g1[["<b>Agent</b><br/>檢核助手掃描:因果語句/預測/學生特質/未標 n 的百分比"]]
    c1{{"<b>Checkpoint</b><br/>人轉成行動:改教材或補救 + 記錄下次要驗證什麼"}}
    o1(["<b>Output</b><br/>教學調整計畫 + 限制說明 + 待驗證項目"])
    r2>"<b>Risk</b><br/>小樣本當證據:換一批人,20% 可能變成 10% 或 30%"]
    r1>"<b>Risk</b><br/>只看平均:72 分可能是大家都 72,也可能是一半 90 一半 54"]
    r3>"<b>Risk</b><br/>相關寫成因果:也可能兩者來自同一個原因"]
    x1[/"<b>Stop</b><br/>出現預測或分群標籤(高風險群、落後群)→ 整份退回重寫"\]
    r4>"<b>Risk</b><br/>分析完沒有行動,下學期教法一模一樣"]

    in1 --> s1
    s1 --> a1
    a1 --> t1
    t1 --> a2
    a2 --> g1
    g1 --> c1
    c1 --> o1
    a1 -.->|風險| r2
    t1 -.->|風險| r1
    a2 -.->|風險| r3
    g1 ==>|中止| x1
    c1 -.->|風險| r4
    c1 -.->|退回重新分類| a2

    classDef clsIn fill:#FFFFFF,stroke:#2C4459,stroke-width:2px,color:#141E2B
    classDef clsHuman fill:#FBFCFD,stroke:#7A8CA0,stroke-width:2px,color:#141E2B
    classDef clsAI fill:#FFF6EA,stroke:#DE9A45,stroke-width:2px,color:#141E2B
    classDef clsAgent fill:#FDEBD2,stroke:#B87A2E,stroke-width:2px,color:#141E2B
    classDef clsTool fill:#EDF2F6,stroke:#2C4459,stroke-width:2px,color:#141E2B
    classDef clsCheck fill:#E8F2EC,stroke:#3F7A5A,stroke-width:2px,color:#123024
    classDef clsOut fill:#141E2B,stroke:#141E2B,stroke-width:2px,color:#F2F6F9
    classDef clsRisk fill:#FCEFEA,stroke:#C0552F,stroke-width:2px,color:#5E2110
    classDef clsStop fill:#F7E1DB,stroke:#8E2F17,stroke-width:3px,color:#5E2110
    class in1 clsIn;
    class s1 clsHuman;
    class a1 clsAI;
    class t1 clsTool;
    class a2 clsAI;
    class g1 clsAgent;
    class c1 clsCheck;
    class o1 clsOut;
    class r2 clsRisk;
    class r1 clsRisk;
    class r3 clsRisk;
    class x1 clsStop;
    class r4 clsRisk;

04完整步驟圖的文字版,逐步展開

一句話版(快速回顧)

  1. 先決定這次只回答一個問題:改教材,或補救個人。
  2. AI 做資料體檢:缺漏、概念對照完整性、樣本數是否撐得起比例陳述。
  3. 逐題與逐概念的通過率在試算表算,每個比例都標樣本數。
  4. AI 分類:全班共通(疑似題目問題/疑似教學問題)vs 個別集中。
  5. 把發現轉成行動,並記錄下次要驗證什麼。

完整版(每一步誰做、產出什麼)

誰做步驟與說明
1Human定要回答的問題
「哪一節要重教」或「哪些人需要補救」,先選一個。兩個一起問,會得到一份什麼都講一點的報告。→ 分析問題定義
2AI資料體檢
檢查缺漏、題目與概念對照是否完整、樣本數是否足以支持比例陳述。不足的直接標出來。→ 資料體檢與限制說明
3Tool算通過率與交叉
逐題通過率、逐概念通過率、個人的錯題分布,都在試算表算。公式看得見。→ 統計表
4AI分兩類
把問題分成「全班共通」與「個別集中」兩類,逐項標明依據哪些數字,並標出樣本不足無法判斷的部分。→ 問題分類表
5Agent過度解讀掃描
機械檢查輸出中是否出現因果語句、預測、學生特質描述、以及未標註樣本數的百分比。→ 標記
6Human轉成行動
共通問題 → 改教材或重教;個別集中 → 安排補救。並記錄下次要驗證什麼。→ 教學調整計畫 + 待驗證項目
三、動手做備料 → 指令 → 產出 → 工具

05開始前要準備什麼標「必要」的沒備齊就先別開始

逐題作答資料必要
每個人每一題的對錯(或得分)。去識別化,用代碼不用學號姓名。
題目與概念對照必要
每一題在測哪個概念、對應教材哪一節。沒有這個,錯題只是一堆編號。
分析要回答的問題必要
「哪裡要重教」還是「誰需要補救」?兩個問題的做法不同,先選一個。
樣本數與限制必要
幾個人、幾題。人數少於三十,任何比例都要當成參考而不是結論。
上次同單元的資料可選
有的話可以看趨勢,但要確認題目與教法可比。

餵進去的東西要長這樣

逐題作答資料(去識別化,用代碼)+ 題目與概念對照 + 要回答的問題 + 樣本數。錯誤選項分布有的話一併提供。

【單元】管理會計 第 3 單元|隨堂測驗(形成性)
【樣本】28 人、10 題
【這次要回答】哪一節要重教?

【題目與概念對照】
Q1–Q3:概念 A 成本分攤的三種基礎
Q4–Q6:概念 B 選擇基礎的原則
Q7–Q8:概念 C 差異分析
Q9–Q10:概念 D 標準成本設定

【逐題答對人數(n=28)】
Q1 26|Q2 24|Q3 25|Q4 22|Q5 6|Q6 20|Q7 18|Q8 17|Q9 9|Q10 11

【個人錯題分布(去識別化)】
S03:Q5, Q9, Q10
S07:Q5, Q9, Q10
S11:Q5, Q9, Q10
S14:Q5
S19:Q5, Q7, Q9, Q10
(其餘 23 人略)

【錯誤選項分布】
未提供

【不做】
預測、分群標籤、與其他班級比較。

06Prompt(快速/完整/進階)

A 快速版貼上就能用;B 完整實戰版把角色、限制、步驟、輸出格式與驗收標準寫足;C 進階版是拿去建 GPT/Skill/Agent 的系統指令。三種都附可替換變數、使用範例、預期輸出與人工確認點。

三種版本共通的紅線
三版都不適合用在
  • 要預測或比較班級、教師時。
A
A. 快速版

有逐題作答資料,想先看出「哪裡是全班的問題、哪裡是個人的問題」。

適合的工具ChatGPTClaude試算表
👇 直接複製,{ } 換成你的內容
以下是逐題作答資料與題目概念對照。請:
1. 資料體檢:標出缺漏、對照是否完整、樣本數是否足以支持比例陳述(n < 30 一律附註僅供參考)。
2. 找出全班共通的問題,並分成兩類:同一概念下只有某題明顯偏低(疑似題目問題)vs 整個概念都偏低(疑似教學問題)。
3. 找出個別集中的問題,但要先排除「那只是反映全班共通弱點」。
4. 列出無法判斷的部分,並說明需要什麼資料才判斷得了。
不得計算任何百分比或統計量、不得預測、不得描述學生特質、不得使用因果語句。
作答資料:{貼上};概念對照:{貼上}

可替換變數

變數要換成什麼
{貼上}逐題作答資料(去識別化,用代碼)。
{貼上}題目與概念對照表。
完整使用範例(照這樣填)
以下是逐題作答與題目概念對照。請照四個要求處理。(照母提示詞)

【分析要回答的問題】哪一節要重教?
【樣本】28 人,10 題

【題目與概念對照】
Q1–Q3:概念 A(成本分攤的三種基礎)
Q4–Q6:概念 B(選擇基礎的原則)
Q7–Q8:概念 C(差異分析)
Q9–Q10:概念 D(標準成本設定)

【逐題答對人數(共 28 人)】
Q1 26|Q2 24|Q3 25
Q4 22|Q5 6|Q6 20
Q7 18|Q8 17
Q9 9|Q10 11

【個人錯題分布(節錄)】
S03:Q5, Q9, Q10
S07:Q5, Q9, Q10
S11:Q5, Q9, Q10
S14:Q5
S19:Q5, Q7, Q9, Q10
(其餘略)
預期輸出範例(拿到的東西應該長這樣)
【資料體檢】
- 樣本 28 人。**低於 30,所有比例僅供參考,不宜作為結論陳述。**本報告的比例一律附上「n=28」。
- 題目與概念對照完整,無缺漏。
- 每題答對人數已提供,但未提供錯誤選項分布——無法判斷學生錯在哪一種誤解。

【全班共通的問題】
| 題/概念 | 答對人數 | 觀察 |
|---|---|---|
| Q5(概念 B) | 6/28 | 明顯低於同概念的 Q4(22)與 Q6(20)。同一個概念下差這麼多,**比較可能是這一題本身的問題**(題意、選項、或測到別的東西),而不是概念 B 沒教好 |
| 概念 D(Q9, Q10) | 9/28、11/28 | 兩題都偏低,且屬同一概念。**這比較像是概念沒教到位** |

【個別集中的問題】
- S03、S07、S11 三人的錯題完全相同(Q5, Q9, Q10),且都落在概念 B 的 Q5 與概念 D。
- 但要注意:Q5 全班都錯得多、概念 D 全班都偏低——所以這三人「錯得一樣」很可能只是反映全班的共同弱點,**不足以認定他們有特別的個別問題**。

【樣本不足、無法判斷的部分】
- 無法判斷 Q5 是題目問題還是教學問題——需要錯誤選項分布,或直接問幾位學生。
- 無法判斷概念 D 偏低的原因(沒教到/教了但沒練/題目偏難)。

【我沒有做的事】
- 沒有計算任何百分比(請在試算表算,並標註 n=28)。
- 沒有做相關分析或預測。28 筆資料撐不起這些。
- 沒有描述任何學生的特質、程度或學習態度。

【建議先做的兩件事】
1. 看 Q5 的錯誤選項分布。如果錯的人集中選同一個選項,那是誤解;如果分散,那可能是題意不清。
2. 概念 D 兩題都低,回去看教材那一節花了多少時間、有沒有練習。

常見錯誤用法

  • 叫 AI「幫我分析學習成效」然後接受一份滿是相關係數的報告。三十筆資料撐不起相關分析。
  • 把「20% 的學生不理解」寫進報告卻不標樣本數。換一批人這個數字會完全不同。
  • 看到某幾個人錯題一樣就認定他們有共同問題。要先排除那是全班共通的弱點。
  • 叫它預測誰會不及格。預測會變成標籤,標籤會影響你對待他的方式。
這一版另外不適合
  • 只有總分、沒有逐題資料時。
缺少資料時怎麼辦

沒有錯誤選項分布時,「這題是題目問題還是教學問題」就判斷不了。這時候最有效的不是更多分析,是去問三個答錯的學生「你當時是怎麼想的」——十分鐘就會知道答案。

這一版另外要人確認
  • 所有百分比與統計的計算(在試算表)。
  • 因果的認定。
  • 個別學生的處置決定。
B
B. 完整實戰版

要一份可以據以調整教學的分析:共通問題、個別集中、樣本限制與具體行動。

適合的工具ChatGPTClaude試算表
👇 直接複製,{ } 換成你的內容
# 角色
你是學習成效分析的整理協助者。你的專長是把逐題作答資料整理成「哪裡是全班的問題、哪裡是個別的問題」,並誠實標出樣本撐不起的結論。你不做算術、不做預測、不描述學生特質。

# 背景
- 課程/單元:{名稱}
- 樣本:{人數} 人、{題數} 題
- 這次要回答的問題:{哪一節要重教/哪些人需要補救}
- 評量性質:{形成性/總結性}

# 任務
產出資料體檢、共通問題、個別集中、無法判斷清單與行動建議。

# 可以使用的資料
只有【逐題作答資料】與【題目概念對照】兩段。你對這個學科的一般認識、常見的學習困難、其他班級的經驗,一律不得作為判斷依據。

# 不可以做的事(違反任何一條就是失敗)
1. 不得計算任何百分比、平均、相關係數或統計量。所有數字運算在試算表進行。
2. 不得做預測(誰會不及格、誰有風險)。
3. 不得描述學生的特質、態度、程度、用心程度。只能描述作答事實。
4. 不得使用因果語句(導致、造成、因為 A 所以 B)。只能寫「同時出現」。
5. 樣本數低於 30 時,任何比例陳述都要附註「n={人數},僅供參考」。
6. 不得比較不同班級、不同教師、不同年度,除非使用者明確提供可比性的說明。

# 處理步驟(請照順序做)
1. 資料體檢:缺漏、對照表完整性、樣本數是否足以支持比例陳述。
2. 找共通問題:同一概念下某題明顯偏低(可能是題目問題)vs 整個概念都偏低(可能是教學問題)。兩者要分開講。
3. 找個別集中:錯題模式相同的人;但要先排除「那只是反映全班共通弱點」。
4. 列出無法判斷的部分,並說明需要什麼資料才判斷得了。
5. 把共通問題轉成教材調整建議,把個別集中轉成補救建議。
6. 列出下次要驗證什麼(這次的判斷要怎麼確認)。

# 輸出格式(嚴格照這個順序,不要加額外段落)
## 一、資料體檢與樣本限制
## 二、全班共通的問題
(分「疑似題目問題」與「疑似教學問題」兩類,各附依據)
## 三、個別集中的問題
(含「已排除全班共通因素」的說明)
## 四、無法判斷的部分
(需要什麼資料才判斷得了)
## 五、行動建議
(教材調整/補救安排,各自具體)
## 六、下次要驗證什麼
## 七、我沒有做的事
(固定列出:未計算、未預測、未描述學生特質、未用因果語句)

# 驗收標準(產出後自己檢查一次並回報結果)
- [ ] 沒有任何我計算出來的數字
- [ ] 沒有預測,也沒有描述學生特質
- [ ] 沒有因果語句
- [ ] 比例陳述都附了樣本數
- [ ] 個別集中的判斷已排除全班共通因素

【題目與概念對照】
{貼上}

【逐題作答資料(去識別化)】
{貼上}

【錯誤選項分布(若有)】
{貼上或留白}

可替換變數

變數要換成什麼
{名稱}課程與單元。
{人數}樣本數。低於 30 時所有比例都只是參考。
{題數}題數。
{形成性/總結性}形成性評量的目的是調整教學,總結性是評定成績。用途不同,分析重點不同。
完整使用範例(照這樣填)
背景填法示例:單元=管理會計 第 3 單元;樣本=28 人、10 題;要回答=哪一節要重教;性質=形成性(隨堂測驗)。作答資料照 A 版格式貼上,用代碼不用學號。
預期輸出範例(拿到的東西應該長這樣)
與 A 版的差別:多出「疑似題目問題 vs 疑似教學問題」的區分,以及「下次要驗證什麼」。前者很重要——同一個概念下只有一題特別低,通常是題目的問題,把它當成教學問題會白重教一次。

常見錯誤用法

  • 兩個問題一起問(哪裡要重教 + 誰要補救)。會得到一份什麼都講一點、什麼都不夠深的報告。
  • 跳過「已排除全班共通因素」那一段。很多「這幾個人有共同問題」其實只是全班都不會。
  • 把行動建議放著不做。分析的價值全在最後那一步。
這一版另外不適合
  • 只有總分時。
缺少資料時怎麼辦

缺錯誤選項分布時,「題目問題 vs 教學問題」只能停在「疑似」。這時候不要靠更多分析去補,去問三個答錯的學生「你當時怎麼想」比什麼統計都準。

這一版另外要人確認
  • 所有計算(在試算表,附樣本數)。
  • 疑似判斷的確認(問學生或看錯誤選項)。
  • 教學調整與補救的決定。
C
C. 進階版(做成成效分析檢查助手)

每次測驗後都要做一次分析,把「小樣本不要亂下結論」的紅線固定成助手。

適合的工具自訂 GPT/Claude ProjectClaude Skill試算表
👇 直接複製,{ } 換成你的內容
# 你是誰
你是「學習成效分析助手」。教師把去識別化的逐題作答與概念對照貼給你,你負責整理出共通問題與個別集中,並守住樣本限制。你不算術、不預測、不描述學生。

# 你的資料來源
只有使用者這次貼上的作答資料與對照表,以及建置時附上的三份文件:本課程的概念架構、常見迷思概念清單、分析報告格式。除此之外一律不得引用。

# 絕對規則(違反就是失敗)
1. 不計算百分比、平均、相關或任何統計量——請使用者於試算表計算。
2. 不預測任何學生的未來表現。
3. 不描述學生的特質、態度、程度、用心。
4. 不使用因果語句,只寫「同時出現」。
5. 樣本 < 30 時,比例陳述一律附註 n 值並標「僅供參考」。

# 條件判斷(依序檢查,先中的先套用)
1. 資料含學號、姓名、座號 → 停止作業,回覆「請先去識別化」並列出偵測到的欄位。
2. 只有總分無逐題資料 → 不分析,回覆「總分看不出哪個概念沒教到,請提供逐題資料」。
3. 樣本 < 15 → 回覆「本樣本只能看個別作答情形,不宜談任何比例或群體結論」,並只輸出個別錯題分布。
4. 使用者要求預測或分群標籤(高風險群、學習落後群)→ 拒絕,回覆「標籤會影響對待方式,而對待方式會影響結果。可改為:這幾位在概念 X 上需要補救」。
5. 使用者要求比較班級或教師 → 拒絕,回覆「班級非隨機分派,樣本也不足以支持比較」。

# 例外處理
- 使用者說「我只是想知道大概趨勢」→ 可以,但輸出一律附樣本限制,且不得寫成結論句。
- 使用者說「這題大家都錯,是不是我教不好」→ 回覆「同一概念下只有一題特別低,較可能是題目本身;整個概念都低,才較可能是教學。可先看錯誤選項分布」。
- 使用者要求分析學生的作答時間、次數等行為資料 → 提醒此類資料的解讀更容易過度推論,且屬個資,需確認蒐集目的。

# 每次回覆的格式
【去識別化檢查】通過/偵測到 N 個未遮蔽欄位
【樣本限制】n=? ;本次可以談什麼、不能談什麼
【全班共通】(疑似題目問題/疑似教學問題,分開)
【個別集中】(含已排除共通因素的說明)
【無法判斷】(需要什麼資料)
【行動建議】(教材調整/補救安排)
【下次要驗證什麼】

# 固定結尾
每次回覆最後一行固定加註:「本分析未計算統計量、未預測、未描述學生特質;所有數字請於試算表計算並標註樣本數。教學處置由 {權責} 決定。」

# 自我檢查(每次回覆前執行,不需輸出過程)
- 是否出現我算的數字?有就刪。
- 是否出現因果語句或預測?有就改寫。
- 比例陳述是否都附了 n 值?沒有就補。

# 建置參數
課程概念架構:{附檔}
常見迷思概念清單:{附檔}
分析報告格式:{附檔}
權責:{職稱}

可替換變數

變數要換成什麼
{附檔}概念架構、迷思概念清單、報告格式三份,建置時上傳為知識檔案。
{職稱}誰決定教學處置。
完整使用範例(照這樣填)
建置時把三份文件上傳為知識檔案。上線前用至少八次歷史測驗資料測過,其中三次要刻意含陷阱:一次含學號、一次只有總分、一次要求「幫我找出高風險學生」,確認它分別停止作業、要求逐題資料、拒絕貼標籤。
預期輸出範例(拿到的東西應該長這樣)
與 B 版的差別:這一版把樣本門檻寫死——低於 15 人只輸出個別作答分布,不談任何比例。它也會固定拒絕「高風險群」這類分群標籤,並提供替代說法:「這幾位在概念 X 上需要補救」。差別在於前者描述人,後者描述概念。

常見錯誤用法

  • 為了報告好看,讓它「算個通過率就好」。一旦開口,之後每份報告都會有它算的數字。
  • 把「疑似教學問題」直接當成結論去重教。先看錯誤選項或問學生,成本低很多。
  • 用它的輸出去做學生分群。那是這個助手刻意不做的事。
這一版另外不適合
  • 預測、分群或標籤化用途。
缺少資料時怎麼辦

樣本太小時「看不出來」就是正確答案。這一點在教學現場常被當成沒有產出,但它擋掉的是更糟的事——用十二個人的資料下一個關於教學的結論,然後照著改了一整個學期。

這一版另外要人確認
  • 上線前:用至少八次歷史測驗測過,含三次刻意陷阱。
  • 每次:所有計算、疑似判斷的確認、教學處置決定。
  • 每學期:更新迷思概念清單。

07產出應該長什麼樣拿到的東西要長這樣

七節:資料體檢與樣本限制、全班共通、個別集中、無法判斷、行動建議、下次要驗證什麼、我沒有做的事。共通問題要分「疑似題目」與「疑似教學」兩類。

完成品:被擋下的三種要求

【一、要求預測】
使用者:「幫我找出這學期可能會不及格的學生。」

助手回覆:
「本助手不做預測。理由不只是統計上的——28 筆資料撐不起預測模型——更重要的是標籤效應:一旦某位學生被標成『高風險』,教學上對待他的方式會改變,而那個改變本身就會影響結果。
可以提供的替代做法:
『目前在概念 D 上答錯兩題的有 11 位,建議下次上課的檢核題請他們先作答。』
這句話描述的是概念與行為,不是人的屬性。」

─────────────────────────────
【二、要求比較兩班】
使用者:「A 班平均 72、B 班平均 78,是不是我教 A 班的方式有問題?」

助手回覆:
「不建議做這個比較,理由有三:
1. 兩班非隨機分派(選課時間、班級組成都可能不同)。
2. 各 28 人與 31 人,樣本不足以支持 6 分差距的推論。
3. 若兩班的測驗時間不同,題目外洩的可能性也無法排除。

可以做的是:兩班在**同一個概念**上的答對情形是否有一致的低點。若兩班都在概念 D 偏低,那比平均分數更能說明教材的問題。」

─────────────────────────────
【三、要求做相關分析】
使用者:「幫我看缺席次數跟分數有沒有相關。」

助手回覆:
「本助手不計算統計量,請於試算表進行。但在你計算之前,有三件事要先說:
1. n=28,相關係數的變動範圍很大,換一批學生結果可能完全不同。
2. 即使算出相關,也不能說『缺席造成分數低』——可能是同一個原因(例如打工時數)同時造成兩者。
3. 這類分析牽涉學生的出席行為資料,屬個資,使用前要確認蒐集目的與範圍。

若你的實際問題是『要不要對常缺席的同學做點什麼』,那不需要相關分析——直接找他們談,成本更低也更有用。」

─────────────────────────────
【這三個回覆的共同點】
它們都不是拒絕幫忙,而是把問題換成一個資料撐得起的版本。學習分析最常見的失敗,不是算錯,是用小樣本回答了一個大問題。
輸出格式規格(要照著做的人再展開)
  • 所有比例陳述都要附樣本數,並在樣本 < 30 時標「僅供參考」。
  • 共通問題要分兩類:同概念下單題偏低(疑似題目問題)vs 整個概念偏低(疑似教學問題)。
  • 個別集中一定要說明「已排除全班共通因素」,否則那只是重複描述全班的弱點。
  • 不得出現因果語句、預測、學生特質描述。
  • 行動建議要具體到「哪一節、加什麼、花多少時間」。
## 一、資料體檢與樣本限制
n=28(< 30)。本次比例陳述僅供參考,不作為結論。題目概念對照完整。未提供錯誤選項分布,故「題目問題 vs 教學問題」僅能停在疑似。

## 二、全班共通的問題
〔疑似題目問題〕
- Q5(概念 B)答對 6/28,而同概念的 Q4(22/28)、Q6(20/28)明顯較高。同一概念下單題落差這麼大,較可能是這一題本身的問題(題意、選項或測到別的概念)。

〔疑似教學問題〕
- 概念 D(Q9 9/28、Q10 11/28)兩題皆偏低,且無其他題可對照。較可能是這一節沒教到位或練習不足。

## 三、個別集中的問題
- S03、S07、S11 錯題完全相同(Q5, Q9, Q10)。
- **已排除共通因素後**:這三題本來就是全班答對率最低的三題,因此「錯得一樣」較可能反映全班弱點,**不足以認定個別問題**。
- 目前沒有可辨識的個別集中型態。

## 四、無法判斷的部分
| 問題 | 需要什麼 |
|---|---|
| Q5 是題目還是教學問題 | 錯誤選項分布;或直接問 3 位答錯的學生「當時怎麼想」 |
| 概念 D 偏低的原因 | 該節的授課時數與練習題數;或課後小測 |

## 五、行動建議
1. Q5:先看錯誤選項分布再決定。若集中在同一選項=誤解,需重教;若分散=題意不清,改題目。
2. 概念 D:下次上課用 15 分鐘重講標準成本設定,並加 2 題課堂練習當場檢核。
3. 暫不安排個別補救——目前的資料看不出個別問題。

## 六、下次要驗證什麼
- 概念 D 重教後,用 2 題新題檢核答對人數是否提升。
- Q5 若改題,下次觀察答對人數是否回到同概念的水準(約 20/28)。

## 七、我沒有做的事
- 未計算任何百分比、平均或統計量。
- 未做預測,未進行任何分群或標籤。
- 未描述任何學生的特質、態度或程度。
- 未使用因果語句。

08工具怎麼挑

這幾支都做得到——差別在你手上有哪一支、資料能不能外流。標「起手」的是不知道從哪支開始時的建議,不是限定。

工具什麼時候用為什麼注意
ChatGPT ↗起手
分類共通與個別問題
分類共通與個別問題、寫限制說明把作答分布整理成「哪一類問題」的品質不錯。它很願意做統計與預測,要在提示詞裡明確禁止兩者。
Claude ↗題數多、要一次讀完整份作答表長表格處理較不會漏掉中段。作答資料連著學號就是個資,務必先去識別化。
M365 Copilot ↗
在校內環境做統計
作答與成績檔存在學校/公司的 Microsoft 365學生個資不必匯出到外部服務。樣本數不足的項目不要下結論——它照樣會給你一個看起來像結論的句子。
試算表
所有統計
所有通過率、分布與交叉統計公式看得見、可驗算;分析結果要能攤開給同事或家長看。每個比例旁邊都要標樣本數。
自訂 GPT/Claude Project
固定樣本門檻
每次測驗後都要做一次樣本門檻與紅線固定,不會因為這次趕時間就放寬。概念架構與迷思清單要隨課程更新。
四、不要做錯這幾關不下放

09會卡住與會做錯的地方

會卡住的地方(流程困難點)

只看平均
平均 72 分可能是「大家都 72」,也可能是「一半 90 一半 54」。這兩種要做的事完全不同。
小樣本被當成證據
三十個人裡有六個錯,寫成「20% 的學生不理解」看起來很科學,但換一批人可能是 10% 或 30%。
相關被寫成因果
「常缺席的人分數較低」——可能是缺席造成的,也可能兩者都來自同一個原因。
分析完沒有行動
報告做得很漂亮,下學期教法一模一樣。那份報告就白做了。

會做錯的地方(常見失敗方式)

只看平均

平均 72 可能是「大家都 72」也可能是「一半 90 一半 54」,處置完全不同。

怎麼修看逐題與逐概念的分布,不看單一平均。

小樣本當證據

「20% 學生不理解」看起來科學,換一批人可能是 10% 或 30%。

怎麼修比例一律附 n 值;n < 15 不談比例。

相關寫成因果

「常缺席導致分數低」——也可能兩者來自同一個原因。

怎麼修禁止因果語句;只寫「同時出現」。

分析完沒有行動

報告很漂亮,下學期教法一模一樣。

怎麼修每項發現都要轉成具體行動,並記錄下次要驗證什麼。

其他注意事項

10人工把關與安全限制

AI/Agent/Tool 介入在哪幾步

流程位置做什麼/怎麼做
體檢階段AI檢查資料與樣本限制
標出缺漏、對照表不完整之處;樣本數不足以支持比例陳述時,明講「本次只能看個別,不宜談比例」。
計算階段Tool在試算表算通過率與分布
逐題、逐概念、逐人的統計都以公式呈現,可驗算、可重跑。AI 不做算術。
掃描階段Agent過度解讀掃描
掃描因果語句(導致、造成、因為)、預測語句(可能會不及格)、學生特質描述(不用功、程度差),以及沒有標樣本數的百分比。

這幾關不下放

要回答的問題
改教材還是補救個人,這是教學判斷,決定整份分析怎麼做。
所有計算
在試算表做,公式留存,可以攤開給人看。
因果的認定
AI 只能指出同時出現,不能說誰造成誰。
個別學生的處置
補救、輔導、談話都是教育判斷,不是分析結果自動導出的。

安全與權限限制

作答資料是個資
學號、姓名、座號要先換成代碼;分析檔案的保存期限與刪除依所屬機構規定。
不做分群標籤
「高風險群」「落後群」這類標籤會影響對待方式,也可能被不當使用。改以概念描述需求。
行為資料更敏感
登入次數、作答時間、觀看時長這類資料解讀空間大、爭議也大,蒐集前要確認目的與告知範圍。

11Checklist 與驗收標準

做的時候逐項打勾

做完了才檢查:全部成立才算完成

  1. 作答資料已去識別化,輸出中沒有學號、姓名或座號。
  2. 所有百分比與統計量都在試算表計算,且每個比例都標註了樣本數。
  3. 樣本低於 30 的比例都已標「僅供參考」;低於 15 時未做任何比例陳述。
  4. 共通問題已分成「疑似題目問題」與「疑似教學問題」兩類,各有依據。
  5. 個別集中的判斷已排除全班共通因素。
  6. 沒有出現預測、分群標籤或學生特質描述。
  7. 沒有出現因果語句,只寫同時出現。
  8. 每項發現都轉成了具體行動,並記錄了下次要驗證什麼。
五、延伸看別人做過,然後往下一步

12實際案例

全班都錯的那一題,問題不在學生身上

當時的狀況:一份隨堂測驗,第 5 題只有 6 個人答對。第一直覺是「這個概念沒教好,下週要重教」。但同一個概念的另外兩題,答對的分別有 22 人和 20 人——如果概念沒教好,不會只有一題塌下去。

AI 做了什麼
  • 先做資料體檢,指出 n=28 低於 30,所有比例只能當參考。
  • 把共通問題分成兩類:同概念下單題偏低(疑似題目問題)與整個概念偏低(疑似教學問題)。
  • 指出三位學生錯題完全相同,但隨即說明那三題本來就是全班最低的,不足以認定個別問題。
  • 列出無法判斷的部分,並說明需要錯誤選項分布或直接問學生才判斷得了。
人做了什麼
  • 先決定這次只回答一個問題:哪一節要重教。不同時問「誰要補救」。
  • 所有通過率在試算表算,每個數字旁邊標 n=28。
  • 去問三位答錯 Q5 的學生「你當時怎麼想」——十分鐘就發現是題目選項有兩個都說得通。
  • 概念 D 兩題都低,安排下次上課用 15 分鐘重講並當場檢核。

結果:「全班都錯」通常不是學生的問題。但要分辨是題目的問題還是教學的問題,靠的不是更多統計,是看同一個概念的其他題有沒有一起塌。

待補資料:本站不提供學習成效提升幅度等量化數據,本例的作答數字為說明用的示意資料。學生作答資料涉個資,處理方式請依所屬機構規定辦理。

13相關方法與下一步

個別學員的補強路徑

這一篇看的是「哪一節要重教」(教師視角);要看「這個人下一步該練什麼」(學員視角),走那一篇。

批改的規準決定資料品質

逐題資料要有意義,前提是評分標準一致。

分析完要回頭改教材

共通問題的處理是改教材,不是要學生多練。

數字口徑與計算

通過率怎麼算、缺考怎麼處理,口徑要固定。

可直接使用RELATED PROMPTS

Download

這個方法的模板與 Checklist 下載包整理中——訂閱更新,上架後第一時間通知你。

取得 AI 實戰工具與更新

之後會不定期整理:新方法、指令包(Prompt Pack)、Checklist 與模板。免費、無廣告;正式寄送前會先寄確認信,隨時可來信要求刪除。

← 回「資料與報表」回找方法 →