METHOD · 學習與人才發展

AI 面試題與評分表

題目要從這個職位實際的難題長出來——通用題每個人都準備過,答得好只代表準備得好。

情境:學習與人才發展也用於:決策與問題解決難度:進階|要先備料起手工具:ChatGPT
這是學習與人才發展情境下的方法之一(共 6 個)· 看這個情境全部 →
一、這是什麼三十秒判斷關不關你的事

01解決的工作問題

面試最常見的失敗不是問得不夠多,是每個人被問的題目都不一樣——於是最後比的不是能力,是誰比較會聊天。而 AI 產面試題有一個很穩定的壞習慣:它會給你一整頁「你最大的優點與缺點是什麼」「五年後你在哪裡」這種通用題。那些題目每個人都準備過,答得好只代表準備得好。真正有鑑別度的題目,只能從這個職缺實際會遇到的難題長出來。

真的有人這樣做過?外部佐證

目前沒有找到可公開查證的外部案例。這類工作多半不會有人發新聞稿,找不到不代表沒人做——但在找到之前,這一頁的方法就是作者自己的做法,不借別人的名義。

去找靈感看其他方法的外部案例 →

02什麼時候用、什麼時候別用

什麼情況下該用這一套

什麼情況下別用

由 AI 評分或推薦錄取
面試是人的判斷。AI 出題、整理答題重點,但不評分、不排序、不建議錄取。
沒有職務條件時
沒有條件就只能出通用題,而通用題沒有鑑別度。
涉及人格測驗或心理評估
那需要專業工具與資格,不是用提示詞產出來的。

誰會用到

HR
你要守的是「同一批題、同一套評分錨點」。題目因人而異,面試紀錄就沒有比較的基礎。
主管
有鑑別度的題目來自你——這個職位去年最難處理的三件事是什麼?那三件就是題目。
法務
婚育、家庭計畫、宗教、政黨這些不能問,而且不能用「隨口聊聊」的方式問。
老師
面試評分表跟評量規準是同一件事:沒有行為錨點的等第,每個人心中的『4 分』都不一樣。
教育訓練
面試題庫用久了會外流。每半年要換一批情境,核心維度不變。

所屬工作情境

二、整件事怎麼跑先看圖,再看逐步

03流程圖

這張圖是整篇的骨架:輸入 → 步驟 → 困難點 → AI/Agent/Tool 介入 → 人工檢查 → 產出。紅框是最常出事的位置,綠框是不能下放的人工檢查點,粗框是中止條件。後面每一節都是在展開圖上的某一格。

AI 面試題與評分表:題目從實際難題長出來,不是從網路上抄
AI 面試題與評分表:題目從實際難題長出來,不是從網路上抄直向流程圖。輸入是職務條件、要評的三到五個維度、這個職位實際會遇到的難題、禁止提問清單、面試時間與面試官人數。第一步由人選定維度並寫下實際難題,難題寫得越具體題目越有鑑別度。第二步由 AI 把每個維度轉成請描述你曾經開頭的行為題並附兩到三個追問,禁止產出通用題與假設題。第三步由 AI 為每題寫評分錨點,說明什麼樣的回答算一分三分五分,寫成可觀察的回答特徵而不是形容詞。第四步由檢核助手機械掃描題目與追問是否涉及婚育家庭宗教政黨健康等禁止事項,以及是否有誘導性問法。第五步進入人工檢查點,兩位面試官先用同一份假想回答各自打分,差距大的題目要回頭重寫錨點,這一步省不得。最後每位候選人問同一批核心題,當場記錄行為事實,評分於面試結束後立刻完成。右側標示四個困難點:通用題沒有鑑別度因為每個人都準備過、每個人被問的題不一樣導致比的是印象不是能力、評分沒有錨點導致兩人的四分不是同一件事、禁止事項在寒暄閒聊裡被問出來。中止條件是出現通用題假設題或禁止提問時該題退回重寫。檢查點有退回線回到錨點步驟。退回重寫錨點INPUT / 輸入職務條件 + 3–5 個維度 + 實際難題 + 禁止提問清單 + 時間人數難題越具體,題目越有鑑別度HUMAN / 人工步驟人定維度並寫下這個職位去年最難處理的三件事AI / AI 介入AI 產行為題「請描述你曾經……」+ 2–3 個追問(禁通用題與假設題)AI / AI 介入AI 寫評分錨點:1/3/5 分的可觀察回答特徵(不用形容詞)AGENT / 助手接手檢核助手掃描:禁止提問、誘導性問法(含寒暄)CHECKPOINT / 人工檢查兩位面試官用同一份假想回答校準;差距大的重寫錨點OUTPUT / 產出核心題本 + 評分錨點表 + 面試紀錄(記行為事實)RISK / 困難點通用題沒有鑑別度:每個人都準備過,答得好只代表準備得好RISK / 困難點評分沒有錨點:甲的 4 分跟乙的 4 分是兩件事RISK / 困難點「小孩多大了?」從寒暄裡溜出來,一樣是問了不該問的STOP / 中止條件出現通用題、假設題或禁止提問 → 該題退回重寫RISK / 困難點每個人被問的題不一樣,最後比的是投緣不是能力
看圖重點:整張圖的品質全押在第一格:實際難題。這一格如果空著,後面每一步都還是會產出東西——只是產出的會是網路上都有的題目。所以圖上把它畫成 Human 而且放在最前面:去問做過這個職位的人「去年最難處理的三件事」,花二十分鐘,換來整場面試的鑑別度。另一個容易被省略的是倒數第二格的面試官校準:兩個人用同一份回答打出差兩分的結果,代表錨點還沒寫清楚——而這件事在面試現場才發現就來不及了。
純文字流程表(手機/螢幕閱讀器建議看這張)
AI 面試題與評分表:題目從實際難題長出來,不是從網路上抄(純文字流程表)
類型/角色流程步驟這一步的困難點/中止條件
1Human職務條件 + 3–5 個維度 + 實際難題 + 禁止提問清單 + 時間人數
難題越具體,題目越有鑑別度
2Human人定維度並寫下這個職位去年最難處理的三件事
3AIAI 產行為題「請描述你曾經……」+ 2–3 個追問(禁通用題與假設題)
困難點/風險通用題沒有鑑別度:每個人都準備過,答得好只代表準備得好
4AIAI 寫評分錨點:1/3/5 分的可觀察回答特徵(不用形容詞)
困難點/風險評分沒有錨點:甲的 4 分跟乙的 4 分是兩件事
5Agent檢核助手掃描:禁止提問、誘導性問法(含寒暄)
困難點/風險「小孩多大了?」從寒暄裡溜出來,一樣是問了不該問的
6Checkpoint兩位面試官用同一份假想回答校準;差距大的重寫錨點
失敗與中止條件出現通用題、假設題或禁止提問 → 該題退回重寫
7Output核心題本 + 評分錨點表 + 面試紀錄(記行為事實)
困難點/風險每個人被問的題不一樣,最後比的是投緣不是能力

回流線:兩位面試官用同一份假想回答校準;差距大的重寫錨點 → AI 寫評分錨點:1/3/5 分的可觀察回答特徵(不用形容詞)(退回重寫錨點)

Mermaid 原始碼(貼進 Mermaid Live 或 draw.io 可再編輯)
可直接複製,改成你自己的流程
flowchart TD
    in1(["<b>Human</b><br/>職務條件 + 3–5 個維度 + 實際難題 + 禁止提問清單 + 時間人數<br/><small>難題越具體,題目越有鑑別度</small>"])
    s1["<b>Human</b><br/>人定維度並寫下這個職位去年最難處理的三件事"]
    a1[/"<b>AI</b><br/>AI 產行為題「請描述你曾經……」+ 2–3 個追問(禁通用題與假設題)"/]
    a2[/"<b>AI</b><br/>AI 寫評分錨點:1/3/5 分的可觀察回答特徵(不用形容詞)"/]
    g1[["<b>Agent</b><br/>檢核助手掃描:禁止提問、誘導性問法(含寒暄)"]]
    c1{{"<b>Checkpoint</b><br/>兩位面試官用同一份假想回答校準;差距大的重寫錨點"}}
    o1(["<b>Output</b><br/>核心題本 + 評分錨點表 + 面試紀錄(記行為事實)"])
    r1>"<b>Risk</b><br/>通用題沒有鑑別度:每個人都準備過,答得好只代表準備得好"]
    r3>"<b>Risk</b><br/>評分沒有錨點:甲的 4 分跟乙的 4 分是兩件事"]
    r4>"<b>Risk</b><br/>「小孩多大了?」從寒暄裡溜出來,一樣是問了不該問的"]
    x1[/"<b>Stop</b><br/>出現通用題、假設題或禁止提問 → 該題退回重寫"\]
    r2>"<b>Risk</b><br/>每個人被問的題不一樣,最後比的是投緣不是能力"]

    in1 --> s1
    s1 --> a1
    a1 --> a2
    a2 --> g1
    g1 --> c1
    c1 --> o1
    a1 -.->|風險| r1
    a2 -.->|風險| r3
    g1 -.->|風險| r4
    c1 ==>|中止| x1
    o1 -.->|風險| r2
    c1 -.->|退回重寫錨點| a2

    classDef clsIn fill:#FFFFFF,stroke:#2C4459,stroke-width:2px,color:#141E2B
    classDef clsHuman fill:#FBFCFD,stroke:#7A8CA0,stroke-width:2px,color:#141E2B
    classDef clsAI fill:#FFF6EA,stroke:#DE9A45,stroke-width:2px,color:#141E2B
    classDef clsAgent fill:#FDEBD2,stroke:#B87A2E,stroke-width:2px,color:#141E2B
    classDef clsTool fill:#EDF2F6,stroke:#2C4459,stroke-width:2px,color:#141E2B
    classDef clsCheck fill:#E8F2EC,stroke:#3F7A5A,stroke-width:2px,color:#123024
    classDef clsOut fill:#141E2B,stroke:#141E2B,stroke-width:2px,color:#F2F6F9
    classDef clsRisk fill:#FCEFEA,stroke:#C0552F,stroke-width:2px,color:#5E2110
    classDef clsStop fill:#F7E1DB,stroke:#8E2F17,stroke-width:3px,color:#5E2110
    class in1 clsIn;
    class s1 clsHuman;
    class a1 clsAI;
    class a2 clsAI;
    class g1 clsAgent;
    class c1 clsCheck;
    class o1 clsOut;
    class r1 clsRisk;
    class r3 clsRisk;
    class r4 clsRisk;
    class x1 clsStop;
    class r2 clsRisk;

04完整步驟圖的文字版,逐步展開

一句話版(快速回顧)

  1. 選三到五個要評的維度,並寫下這個職位去年最難處理的三件事。
  2. AI 把每個維度轉成「請描述你曾經……」的行為題,並附 2–3 個追問。
  3. AI 為每題寫 1/3/5 分的評分錨點——可觀察的回答特徵,不是形容詞。
  4. 掃描題目與追問是否涉及婚育、家庭、宗教、政黨、健康等禁止事項(含寒暄)。
  5. 兩位面試官先用同一份假想回答各自打分,差距大的題目回頭重寫錨點。

完整版(每一步誰做、產出什麼)

誰做步驟與說明
1Human定維度與難題
選三到五個要評的維度,並寫下這個職位實際會遇到的難題。難題寫得越具體,題目越有鑑別度。→ 維度與難題清單
2AI產行為題
把每個維度轉成「請描述你曾經……」的行為題,並附追問題。禁止產出通用題與假設題。→ 題庫草稿
3AI做評分錨點
為每題寫出各等第的具體行為描述——什麼樣的回答算 1 分、什麼樣算 3 分、什麼樣算 5 分。不是形容詞。→ 評分表(含錨點)
4Agent合規檢查
機械掃描題目與追問是否涉及婚育、家庭、宗教、政黨、健康等禁止事項,以及是否有誘導性問法。→ 合規標記
5Human面試官校準
兩位面試官先用同一份假想回答各自打分,差距大的題目要重寫錨點。這一步省不得。→ 校準紀錄
6Human執行與記錄
每位候選人問同一批核心題,當場記錄行為事實(他說他做了什麼),評分在面試結束後立刻完成。→ 面試紀錄 + 評分表
三、動手做備料 → 指令 → 產出 → 工具

05開始前要準備什麼標「必要」的沒備齊就先別開始

職務條件與實際難題必要
必要條件,加上「這個職位去年最難處理的三件事」。後者才是好題目的來源。
要評的維度必要
三到五個就夠。維度太多,面試官會來不及評,最後憑印象打。
禁止提問清單必要
婚姻、生育計畫、家庭狀況、宗教、政黨、健康(非職務必要)、原生家庭經濟狀況。
面試時間與人數必要
一小時、兩位面試官,能問的核心題大約 5–6 題。先算清楚再出題。
初篩留下的【履歷未提及】可選
初篩沒問到的條件,正好是面試要釐清的。

餵進去的東西要長這樣

職務條件 + 要評的 3–5 個維度 + 實際難題(越具體越好)+ 禁止提問清單 + 面試時間與人數。

【職缺】成本會計專員(財務部)
【階段】複試(用人主管 + HR,2 位)
【時間】50 分鐘|【候選人】6 位

【要評的維度】
D1 成本邏輯的理解
D2 面對數字對不起來時的處理方式
D3 跨部門要資料與推動改變的能力

【這個職位去年最難處理的三件事】
1. 月結時發現某產品線標準成本與實際差 18%,追三天才發現是領料單沒過帳。
2. 生產單位不願配合改領料流程,理由是「一直都是這樣做」。
3. 年度查核被會計師問某筆分攤基礎的依據,當初做的人已離職、無文件。

【禁止提問】
婚姻、生育計畫、家庭狀況、宗教、政黨、原生家庭經濟狀況、健康(非職務必要)、年齡;寒暄階段亦同。

【初篩留下的待釐清】
候選人 C:履歷未提及 ERP 使用經驗。

06Prompt(快速/完整/進階)

A 快速版貼上就能用;B 完整實戰版把角色、限制、步驟、輸出格式與驗收標準寫足;C 進階版是拿去建 GPT/Skill/Agent 的系統指令。三種都附可替換變數、使用範例、預期輸出與人工確認點。

A
A. 快速版

有職務條件與幾個實際難題,想快速產出有鑑別度的行為題。

適合的工具ChatGPTClaudeM365 Copilot
👇 直接複製,{ } 換成你的內容
以下是職務條件、要評的維度與這個職位實際會遇到的難題。請:
1. 把每個維度對到至少一個實際難題;對不到的標出來並說明可能問不出鑑別度。
2. 每個維度出 1–2 題行為題,一律用「請描述你曾經……」的過去事實題型,不出通用題與假設題,每題附 2–3 個追問。
3. 為每題寫評分錨點:1/3/5 分各對應什麼樣的回答特徵。寫成可觀察的特徵,不要用優秀、良好等形容詞。
4. 逐題檢查是否涉及婚姻、生育、家庭、宗教、政黨、健康、年齡(寒暄階段亦同),以及是否有誘導性問法。
職務條件與維度:{貼上};實際難題:{貼上}

可替換變數

變數要換成什麼
{貼上}職務條件、要評的三到五個維度。
{貼上}這個職位實際會遇到的難題(越具體越好)。
完整使用範例(照這樣填)
以下是職務條件、要評的維度與實際難題。請照四個要求出題。(照母提示詞)

【職缺】成本會計專員
【要評的維度】
D1 成本邏輯的理解
D2 面對數字對不起來時的處理方式
D3 跨部門要資料的能力

【這個職位去年最難處理的三件事】
1. 月結時發現某產品線的標準成本與實際差 18%,追了三天才發現是領料單沒過帳。
2. 生產單位不願意配合改領料流程,因為「一直都是這樣做」。
3. 年度查核時被會計師問到某筆分攤基礎的依據,當初做的人已離職,沒有文件。

【面試時間】50 分鐘,兩位面試官
預期輸出範例(拿到的東西應該長這樣)
【核心題(5 題,約 40 分鐘)】

Q1〔D2〕請描述一次你發現帳上數字對不起來的經驗。當時差多少?你從哪裡開始查?最後原因是什麼?
追問:查的過程中,你有沒有一度以為找到原因但其實不是?/你花了多久?/後來有做什麼避免再發生?

Q2〔D1〕請描述一次你需要決定「這筆費用該分攤到哪裡」的情況。你的依據是什麼?有沒有人不同意?
追問:如果當時多一條產品線,你的分攤方式會怎麼變?/這個依據有沒有寫成文件?

Q3〔D3〕請描述一次你需要其他部門配合改變作業方式的經驗。對方一開始的反應是什麼?你怎麼處理?
追問:最後改成功了嗎?/如果沒成功,你認為卡在哪裡?/那件事之後你們的關係怎麼樣?

Q4〔D2〕請描述一次你交出去的數字後來被發現有問題的經驗。你怎麼知道的?後續怎麼處理?
追問:是誰先發現的?/你有沒有主動說?

Q5〔D1〕請描述你目前月結的流程,從收到資料到結完,中間哪一步最容易出問題?
追問:那一步為什麼容易出問題?/你有沒有試過改?

【我沒有出的題目,以及原因】
- 沒有出「你最大的缺點是什麼」「為什麼想來我們公司」這類通用題——每位候選人都準備過,答得好只代表準備得好。
- 沒有出假設題(「如果你遇到 X 你會怎麼做」)——假設題測的是表達能力,行為題測的是實際做過什麼。
- 沒有出涉及婚姻、生育、家庭、宗教、政黨、健康的任何題目,包含寒暄階段。

【時間配置】
5 題 × 8 分鐘 = 40 分鐘;開場 3 分鐘、候選人提問 7 分鐘。
※ 每位候選人都要問完這 5 題。追問可依回答調整,核心題不可增減。

常見錯誤用法

  • 叫 AI「出十五題常見面試題」。你會拿到一整頁網路上都有的題目。
  • 沒給實際難題就出題。沒有難題,AI 只能出通用題。
  • 核心題因人而異。聊得來的多問兩題,最後比的是投緣不是能力。
  • 把追問也寫死。追問本來就要跟著回答走,寫死就變成唸稿。
這一版另外不適合
  • 沒有職務條件或實際難題時。
  • 要 AI 評分或建議錄取時。
缺少資料時怎麼辦

沒有「實際難題」時,先去問做過這個職位的人:去年最難處理的三件事是什麼。這一步花二十分鐘,換來的是整場面試的鑑別度——比多出十題通用題有用得多。

這一版另外要人確認
  • 維度的選定。
  • 實際難題的提供。
  • 評分與錄取決定。
B
B. 完整實戰版

要一份可以直接帶進面試室的題本:核心題、追問、評分錨點、時間配置、合規檢查。

適合的工具ChatGPTClaudeM365 Copilot
👇 直接複製,{ } 換成你的內容
# 角色
你是結構化面試的設計協助者。你的專長是把職務難題轉成有鑑別度的行為題,並寫出可觀察的評分錨點。你不評分、不排序、不建議錄取。

# 背景
- 職缺:{職缺}
- 面試階段:{初試/複試/用人主管面談}
- 時間與面試官人數:{分鐘數、幾位}
- 候選人人數:{人數}

# 任務
產出核心題本、評分錨點表、時間配置與合規檢查。

# 可以使用的資料
只有【職務條件】【要評的維度】【實際難題】三段。你對這個職稱的一般認識、網路上常見的面試題、你覺得該問的軟性問題,一律不得作為題目來源。

# 不可以做的事(違反任何一條就是失敗)
1. 不得出通用題(優缺點、生涯規劃、為什麼選我們、如何看待加班)。
2. 不得出假設題(「如果……你會怎麼做」)。一律用「請描述你曾經……」的過去事實題型。
3. 不得出涉及婚姻、生育計畫、家庭狀況、宗教、政黨、原生家庭、健康(非職務必要)、年齡的題目,寒暄與閒聊也不行。
4. 不得使用誘導性問法(「你應該也覺得……吧」「我們這裡加班很多,你可以吧」)。
5. 評分錨點不得使用形容詞(優秀、良好、普通、不佳),一律寫成可觀察的回答特徵。
6. 不得評分、排序、建議錄取,也不得寫「理想答案」——只寫「這樣回答代表什麼」。

# 處理步驟(請照順序做)
1. 把每個維度對到至少一個實際難題。對不到的維度,標出來並說明可能問不出鑑別度。
2. 每個維度出一到兩題行為題,每題附兩到三個追問。
3. 為每題寫評分錨點:1/3/5 分各自對應什麼樣的回答特徵(可觀察、可記錄)。
4. 依面試時間做配置,算出每題可用幾分鐘,並標明哪些是核心題(每人必問)。
5. 合規檢查:逐題確認未涉禁止事項、無誘導性問法。
6. 列出這份題本測不到的東西(誠實說明限制)。

# 輸出格式(嚴格照這個順序,不要加額外段落)
## 一、維度與難題對照
(表格:維度|對應的實際難題|若無對應則標出)
## 二、核心題本
(每題:維度|題目|追問 2–3 個)
## 三、評分錨點表
(表格:題號|1 分的回答特徵|3 分|5 分)
## 四、時間配置
(含核心題/可省略題的標示)
## 五、合規檢查
(逐題:是否涉禁止事項、是否誘導)
## 六、這份題本測不到的東西

# 驗收標準(產出後自己檢查一次並回報結果)
- [ ] 沒有通用題、沒有假設題
- [ ] 沒有涉及婚育、家庭、宗教、政黨、健康、年齡的題目
- [ ] 每題都有 2–3 個追問
- [ ] 評分錨點都是可觀察的回答特徵,沒有形容詞
- [ ] 沒有評分、排序或錄取建議

【職務條件】
{貼上}

【要評的維度(3–5 個)】
{貼上}

【實際難題】
{貼上:這個職位去年最難處理的三件事}

【禁止提問清單】
{貼上}

可替換變數

變數要換成什麼
{職缺}職缺名稱。
{初試/複試/用人主管面談}階段不同,測的深度不同。
{分鐘數、幾位}時間決定能問幾題。50 分鐘大約 5 題。
{人數}候選人越多,越需要核心題完全一致。
完整使用範例(照這樣填)
背景填法示例:職缺=成本會計專員;階段=複試(用人主管+HR);時間=50 分鐘、2 位;候選人=6 位。維度與難題照 A 版格式貼上,難題務必具體到「差 18%、追了三天、原因是領料單沒過帳」這種程度。
預期輸出範例(拿到的東西應該長這樣)
與 A 版的差別:多出評分錨點表與「這份題本測不到的東西」。錨點表是面試當下真正會用到的東西——沒有它,兩位面試官打出來的分數不能相加。最後一節則是誠實:有些維度(例如長期穩定度)本來就不是一場面試測得出來的。

常見錯誤用法

  • 維度列了八個。面試官來不及評,最後還是憑印象。三到五個就夠。
  • 錨點寫成「回答完整=5 分」。什麼叫完整?錨點要寫成可觀察的特徵。
  • 把「測不到的東西」刪掉。那一節是在提醒你不要用面試決定它測不到的事。
這一版另外不適合
  • 維度與實際難題都還沒定時。
缺少資料時怎麼辦

維度對不到實際難題時,AI 要把它標出來而不是硬出題。硬出來的題目會是通用題,而通用題在面試現場最明顯的症狀是:每個候選人的回答聽起來都差不多。

這一版另外要人確認
  • 面試官校準(兩人先用同一份假想回答各自打分)。
  • 評分與錄取決定。
  • 追問的臨場調整。
C
C. 進階版(做成面試題本助手)

招募是常態,要一個把行為題型與合規紅線固定下來的助手,讓每個職缺的題本品質一致。

適合的工具自訂 GPT/Claude ProjectClaude SkillCopilot Studio
👇 直接複製,{ } 換成你的內容
# 你是誰
你是「面試題本助手」。用人單位把職務條件與實際難題貼給你,你負責產出結構化面試題本與評分錨點。你不評分、不排序、不建議錄取、不寫理想答案。

# 你的資料來源
只有使用者這次貼上的條件、維度與難題,以及建置時附上的三份文件:本單位評分錨點格式、禁止提問清單、既有題庫(供避免重複)。除此之外一律不得引用,包含網路上常見的面試題。

# 絕對規則(違反就是失敗)
1. 只出「請描述你曾經……」的行為題,不出通用題與假設題。
2. 不得出涉及婚姻、生育、家庭、宗教、政黨、原生家庭、健康(非職務必要)、年齡的題目,寒暄亦同。
3. 評分錨點只寫可觀察的回答特徵,不用形容詞,也不寫「理想答案」。
4. 不評分、不排序、不建議錄取。
5. 沒有實際難題時,不得自行編造職務難題。

# 條件判斷(依序檢查,先中的先套用)
1. 未提供實際難題 → 不出題,回覆「請先提供這個職位實際會遇到的難題(建議問做過的人:去年最難處理的三件事)」,並說明沒有難題只能出通用題。
2. 維度超過 5 個 → 提醒面試官來不及評,建議收斂並說明哪幾個可以合併。
3. 使用者要求出「測人格特質」的題 → 回覆「人格測驗需專業工具與資格,本助手只出行為題;可改為觀察過去行為的題目」。
4. 題目與既有題庫重複度高 → 標出重複題並提醒題庫可能已外流,建議更換情境(核心維度不變)。
5. 使用者要求評分或推薦人選 → 拒絕,回覆「本助手只出題與寫錨點;評分與錄取由面試官負責並記錄」。

# 例外處理
- 使用者說「我想知道他會不會久待」→ 回覆「留任意願無法由面試題可靠測得。可改問:請描述你上一份工作待最久的一段時間,那時候什麼讓你留下來?——但這只能作為理解,不作為預測」。
- 使用者說「隨口問一下家庭狀況應該還好吧」→ 回覆「寒暄階段的提問一樣受規範。若實際考量是出差或輪班,請改為職務要求的直接提問」。
- 使用者要求「幫我看這個候選人的回答夠不夠好」→ 拒絕評分,但可以協助對照錨點:「這段回答對應到錨點的哪些特徵」由使用者自行判定。

# 每次回覆的格式
【維度與難題對照】(對不到的標出)
【核心題本】(維度|題目|追問)
【評分錨點表】(1/3/5 分的回答特徵)
【時間配置】(核心題/可省略題)
【合規檢查】(逐題)
【與既有題庫的重複】
【這份題本測不到的東西】

# 固定結尾
每次回覆最後一行固定加註:「本題本僅供結構化面試使用;評分、比較與錄取決定由 {權責} 為之並留存紀錄。本助手不評分、不排序。」

# 自我檢查(每次回覆前執行,不需輸出過程)
- 是否出現通用題或假設題?有就重寫。
- 是否出現禁止事項?有就刪並說明。
- 錨點是否出現形容詞?有就改成可觀察特徵。

# 建置參數
評分錨點格式:{附檔}
禁止提問清單:{附檔}
既有題庫:{附檔}
權責:{職稱}

可替換變數

變數要換成什麼
{附檔}錨點格式、禁止提問清單、既有題庫三份,建置時上傳為知識檔案。
{職稱}誰負責評分與錄取決定。
完整使用範例(照這樣填)
建置時把三份文件上傳為知識檔案。上線前用至少八個歷史職缺測過,其中三個要刻意含陷阱:一個沒有提供實際難題、一個要求測人格特質、一個要求「順便問一下有沒有小孩」,確認它分別拒絕出題、改為行為題、擋下禁止提問。
預期輸出範例(拿到的東西應該長這樣)
與 B 版的差別:這一版會比對既有題庫,標出重複題並提醒外流風險——同一批題目用一年之後,答案會開始出現在求職論壇上。它也會固定拒絕評分,即使你只是想「問問看它覺得如何」。

常見錯誤用法

  • 沒給實際難題就硬要它出題。它拒絕是對的,通用題本會讓整場面試白做。
  • 把它的錨點直接用而不做面試官校準。錨點寫得再好,兩個人的理解仍可能不同。
  • 題庫用一整年不換。核心維度可以不變,情境要換。
這一版另外不適合
  • 沒有實際難題可提供時。
  • 人格測驗或心理評估用途。
缺少資料時怎麼辦

難題缺漏時助手會停下來要——這一步看起來卡,但它擋掉的是最常見的失敗:用一整頁通用題面試六個人,然後發現六份紀錄長得一模一樣,什麼都比不出來。

這一版另外要人確認
  • 上線前:用至少八個歷史職缺測過,含三個刻意陷阱。
  • 每次:面試官校準、評分、錄取決定。
  • 每半年:更換題目情境,核心維度不變。

07產出應該長什麼樣拿到的東西要長這樣

六節:維度與難題對照、核心題本、評分錨點表、時間配置、合規檢查、這份題本測不到的東西。錨點表是現場真正會用到的那一張。

完成品:同一個維度的四種問法,只有一種可用

維度:D2「面對數字對不起來時的處理方式」

─────────────────────────────
【問法一:通用題(不可用)】
「你如何面對工作壓力?」
問題:與這個維度無關,而且每位候選人都準備過。答得好只代表準備得好。

【問法二:假設題(不可用)】
「如果月結時發現差 18%,你會怎麼做?」
問題:測的是表達能力與推理,不是他真的做過什麼。準備充分的人可以答得比實際處理過的人更漂亮。
※ 而且這題直接洩漏了我們的難題,後面幾位候選人會從論壇上看到。

【問法三:誘導題(不可用)】
「遇到數字對不起來,應該要先確認來源對吧?你都怎麼做?」
問題:答案已經寫在題目裡了。

【問法四:行為題(可用)】
「請描述一次你發現帳上數字對不起來的經驗。當時差多少?你從哪裡開始查?最後原因是什麼?」
追問:
- 查的過程中,有沒有一度以為找到原因但其實不是?
- 這件事花了你多久?
- 後來有沒有做什麼避免再發生?

為什麼這題可用:
- 問的是過去事實,不是意見或假設。
- 三個追問分別挖:排錯過程(不是只講結果)、時間成本(判斷事件真實性)、後續改善(判斷是不是只想把事情蓋過去)。
- 沒有洩漏我們的難題。

─────────────────────────────
【對應的評分錨點】
| 1 分 | 3 分 | 5 分 |
|---|---|---|
| 說不出具體事件;或只說「後來就解決了」,講不出差異金額與原因 | 說得出事件與最終原因,但查找過程是被動的——由別人指出或系統報錯才知道 | 說得出差異金額、自己的查找順序、排除過哪些錯誤假設,以及事後做了什麼預防 |

※ 錨點寫的是「回答裡有沒有出現這些特徵」,不是「回答得好不好」。這樣兩位面試官的分數才加得起來。

─────────────────────────────
【校準時發現的問題】
兩位面試官用同一份假想回答試打,Q3 一個給 4 分、一個給 2 分。追下去發現:主管認為「最後沒推動成功」就是 2 分,HR 認為「說得出對方的顧慮」就有 4 分。
→ 錨點重寫,明確寫出「結果成敗不影響評分,評的是他說不說得出對方的實際顧慮與自己的調整」。
輸出格式規格(要照著做的人再展開)
  • 題目一律「請描述你曾經……」,不出假設題與通用題。
  • 每題附 2–3 個追問,追問是拿來挖細節的,不是拿來唸的。
  • 評分錨點寫成可觀察的回答特徵,不得用優秀、良好、普通等形容詞。
  • 核心題要標明「每人必問」,可省略題另外標示。
  • 最後一節要誠實寫出這份題本測不到什麼,避免用面試決定它測不到的事。
## 一、維度與難題對照
| 維度 | 對應難題 |
|---|---|
| D1 成本邏輯 | 難題 3(分攤基礎無依據) |
| D2 對不起來時的處理 | 難題 1(差 18%) |
| D3 跨部門推動 | 難題 2(生產單位不配合) |

## 二、核心題本
Q1〔D2〕請描述一次你發現帳上數字對不起來的經驗。差多少?從哪裡開始查?最後原因是什麼?
追問:有沒有一度以為找到原因但其實不是?/花了多久?/後來做了什麼避免再發生?

Q2〔D1〕請描述一次你決定「這筆費用該分攤到哪裡」的情況。依據是什麼?有人不同意嗎?
追問:多一條產品線時分攤方式會怎麼變?/依據有沒有寫成文件?

Q3〔D3〕請描述一次你需要其他部門改變作業方式的經驗。對方一開始的反應?你怎麼處理?
追問:最後改成功了嗎?/卡在哪裡?/那之後你們的關係如何?

## 三、評分錨點表
| 題號 | 1 分 | 3 分 | 5 分 |
|---|---|---|---|
| Q1 | 說不出具體事件,或只描述「後來就解決了」 | 說得出事件與原因,但查找過程是被動的(別人告訴他) | 說得出差異金額、查找順序、排除過的錯誤假設,以及後續預防措施 |
| Q2 | 只說「照公司規定」,說不出依據內容 | 說得出依據,但未考慮情境變動 | 說得出依據、變動時如何調整,並提到有無留下文件 |
| Q3 | 僅描述對方不配合,未提自己做了什麼 | 說得出溝通過程,結果成敗皆可 | 說得出對方的實際顧慮、自己調整了什麼、以及事後的關係狀態 |

## 四、時間配置
開場 3 分|Q1–Q3 各 9 分(27 分)|Q4–Q5 各 8 分(16 分)|候選人提問 4 分
※ Q1–Q3 為核心題,每人必問。Q4–Q5 時間不足時可省略,但六位候選人要一致省略。

## 五、合規檢查
逐題確認:未涉婚姻、生育、家庭、宗教、政黨、健康、年齡;無誘導性問法。開場寒暄建議使用「今天過來還順利嗎」,避免「家住哪裡/小孩多大」。

## 六、這份題本測不到的東西
- 長期留任意願:一場面試無法可靠預測。
- 與團隊的相處:需試用期觀察。
- 學習速度:可於試用期以具體任務觀察,本題本只能問過去的例子。

08工具怎麼挑

這幾支都做得到——差別在你手上有哪一支、資料能不能外流。標「起手」的是不知道從哪支開始時的建議,不是限定。

工具什麼時候用為什麼注意
ChatGPT ↗起手
難題轉行為題
把難題轉成行為題、寫評分錨點從具體難題長出題目與追問的品質不錯。它預設會給通用題,要在提示詞裡明確禁止。
Claude ↗維度多、要一次產完整題本長輸出的一致性較好,錨點不會前後標準不一。職務難題可能含營運資訊,貼入前確認可行性。
M365 Copilot ↗職務資料在內部系統資料不出租戶,適合含內部作業細節的難題。注意不要帶入其他職缺的候選人資料。
自訂 GPT/Claude Project
固定錨點格式
招募是常態作業錨點格式與禁止清單固定,各職缺的題本品質一致。既有題庫要持續更新,避免重複與外流。
四、不要做錯這幾關不下放

09會卡住與會做錯的地方

會卡住的地方(流程困難點)

通用題沒有鑑別度
「你最大的缺點是什麼」——每個人都準備過。答得好只代表準備得好。
每個人問的題不一樣
聊得投機的多問了兩題,緊張的少問了三題。最後比的是印象,不是能力。
評分沒有錨點
「溝通能力 4 分」——甲的 4 分跟乙的 4 分是兩件事,加起來平均沒有意義。
禁止事項用聊天的方式問出來
「小孩多大了?」在寒暄裡出現,一樣是問了不該問的。

會做錯的地方(常見失敗方式)

整本都是通用題

六份面試紀錄長得一樣,什麼都比不出來。

怎麼修題目一律從實際難題長出來;沒有難題就先去問,不要硬出題。

核心題因人而異

聊得投機的多問兩題,最後比的是印象。

怎麼修核心題標明每人必問,追問才依回答調整。

錨點寫成形容詞

「回答完整=5 分」,甲乙兩人的完整不是同一件事,分數加不起來。

怎麼修錨點寫成可觀察的回答特徵,並先做面試官校準。

禁止事項從閒聊裡溜出來

「小孩多大了?」出現在寒暄,一樣是問了不該問的。

怎麼修禁止清單涵蓋寒暄階段,並在題本裡寫好建議的開場問法。

其他注意事項

10人工把關與安全限制

AI/Agent/Tool 介入在哪幾步

流程位置做什麼/怎麼做
出題階段AI把維度與難題轉成行為題
一律「請描述你曾經……」的過去事實題型,禁止假設題與通用題;每題附兩到三個追問。
錨點階段AI為每題寫等第的行為描述
各等第寫成可觀察的具體回答特徵,不得使用優秀、良好、普通等形容詞。
檢查階段Agent禁止提問與誘導性掃描
掃描婚育、家庭、宗教、政黨、健康、年齡等字眼,以及「你應該也覺得……吧」這類誘導問法。

這幾關不下放

要評什麼維度
這是用人判斷,決定整場面試在測什麼。
實際難題的提供
只有做過這個職位的人說得出來,而題目的鑑別度全靠它。
面試官校準
兩人對同一份回答打出差很多的分數,就代表錨點還沒寫清楚。
評分與錄取
AI 不評分、不排序、不建議錄取。

安全與權限限制

職務難題可能含營運資訊
「去年最難處理的三件事」常牽涉內部作業細節,貼入外部服務前先確認可行性或代稱。
候選人資料
面試紀錄含個資,保存期限與使用範圍依規定與告知內容辦理。
法令風險
禁止提問清單要與就業服務法等規範一致並實測擋得住。本站不提供法律意見。

11Checklist 與驗收標準

做的時候逐項打勾

做完了才檢查:全部成立才算完成

  1. 每一題都從實際難題長出來,沒有通用題與假設題。
  2. 沒有涉及婚姻、生育、家庭、宗教、政黨、健康、年齡的題目,寒暄階段也沒有。
  3. 每題附 2–3 個追問,且追問不是寫死照唸。
  4. 評分錨點寫成可觀察的回答特徵,沒有形容詞。
  5. 核心題已標明每人必問,且所有候選人都被問了同一批。
  6. 兩位以上面試官已做過校準,分數差距大的題目已重寫錨點。
  7. 面試紀錄記的是行為事實(他說他做了什麼),評分於面試結束後立刻完成。
  8. AI 未參與評分、排序或錄取建議。
五、延伸看別人做過,然後往下一步

12實際案例

六份面試紀錄長得一模一樣,因為問的是同一堆通用題

當時的狀況:第一輪面試用的是「請 AI 出十五題常見面試題」的結果:優缺點、生涯規劃、為什麼選我們、如何面對壓力。六位候選人面完,六份紀錄讀起來幾乎沒有差別——每個人都準備過這些題,答得都不錯。

AI 做了什麼
  • 把三個維度分別對到職位去年實際遇到的三件難事,對不到的維度直接標出來。
  • 為每個維度產出「請描述你曾經……」的行為題,並附兩到三個追問。
  • 為每題寫 1/3/5 分的評分錨點,寫成可觀察的回答特徵而不是形容詞。
  • 逐題做合規檢查,包含提醒開場寒暄不要問住哪裡、小孩多大。
人做了什麼
  • 去問做過這個職位的人:去年最難處理的三件事是什麼——這一步花二十分鐘,是整份題本的基礎。
  • 把維度從八個收斂到三個,因為現場來不及評八個。
  • 兩位面試官先用同一份假想回答各自打分,Q3 差了兩分,回頭把錨點重寫。
  • 六位候選人都問同一批核心題,追問才依回答調整。

結果:換成行為題之後,六份紀錄第一次出現明顯差異——差異不是來自誰比較會講,是來自誰真的做過。

待補資料:本站不提供面試效度、錄取後留任率等量化數據,本例為說明用的示意情境。另本方法涉及就業服務法等法令,實際適用請洽貴單位法務或人資主管。

13相關方法與下一步

面試前的初篩

初篩留下的【履歷未提及】,正好是面試要釐清的。

錄取之後的第一個月

面試選對人只是一半,上手包決定他留不留得下來。

評分錨點與評量規準是同一件事

教學評量的規準寫法可以直接借用。

把面試流程寫成 SOP

判準一致,才經得起檢視。

可直接使用RELATED PROMPTS

Download

這個方法的模板與 Checklist 下載包整理中——訂閱更新,上架後第一時間通知你。

取得 AI 實戰工具與更新

之後會不定期整理:新方法、指令包(Prompt Pack)、Checklist 與模板。免費、無廣告;正式寄送前會先寄確認信,隨時可來信要求刪除。

← 回「學習與人才發展」回找方法 →