評量設計怎麼因應 AI:不靠偵測器,靠題目本身

AI 偵測器誤判率高,不適合當處分依據。與其抓學生用了 AI,不如讓題目本身問出只有真正做過的人才答得出來的東西。

作者:鴻綸科技 Steve|最後更新:

我們在AI 融入教學實務指南裡提過一句話:與其偵測,不如改變評量設計。這篇把那句話拆成可以直接照做的東西——四種題型的具體改法、能直接套用的題目範例,以及評分規準要跟著調整的地方。

一、為什麼不能靠 AI 偵測器

市面上的 AI 偵測工具誤判率高,尤其對非母語寫作者、或寫作風格本來就比較制式、詞彙重複性高的學生特別不利,容易把認真寫作的學生誤判成用 AI 代寫。拿一個誤判率高的工具當懲處依據,付出的代價可能比它想解決的問題還大。

更根本的問題是:偵測是在事後補救,評量設計是在事前就讓問題不成立。後者才是可以長期依賴的做法。

二、核心轉向:從「產出結果」到「產出過程」

AI 很擅長生出一份看起來完整的最終答案,但不容易假造思考的軌跡:為什麼選這份資料而不是那份、中間改過哪些判斷、遇到矛盾的資訊怎麼取捨。只要評量要看的是這些過程,題目本身就有了抗代寫的能力,不需要另外加偵測步驟。

這不代表要無限增加作業量。多數做法是把「看得見的部分」從最終產出往前挪一點,讓過程本來就是評分的一部分,而不是額外多交一份東西。

三、四種題型的具體改法

題型具體做法為什麼有效
寫作類 要求提交過程稿與修改紀錄;題目連結課堂特有的討論或在地情境;加入即席口頭說明 AI 沒有那堂課發生了什麼的脈絡,也難以假造連貫的修改軌跡
專題報告類 請學生比較兩個 AI 產出的答案哪個更合理並說明理由;要求指出 AI 回答中的錯誤 評量重點從「有沒有答案」移到「判讀依據」,這一步 AI 代勞不了
計算與選擇題 課堂限時作答;隨堂抽問其中一題請學生說明解法 時間與臨場條件本來就限制了外部工具的介入空間
口頭與口試 針對交上來的書面內容追問延伸問題,看能不能對應 能講出自己寫的東西,是判斷是否真正理解最直接的方式

四、三個可以直接套用的改法

  • 原本:「寫一篇關於在地環境議題的短文。」
    改成:「寫一篇關於在地環境議題的短文,附上你查資料的過程紀錄(至少兩個來源、為什麼選這兩個、有沒有互相矛盾的地方)。」——多加的不是字數,是判讀依據。
  • 原本:「請 AI 幫忙回答這道申論題,並整理成報告。」
    改成:「請兩個不同 AI 工具回答同一道申論題,比較兩份答案的差異,指出你認為哪一份比較合理、為什麼。」——把「用 AI」本身變成評量的一部分,而不是要防堵的事。
  • 原本:「小組專題成果簡報。」
    改成:「小組專題成果簡報+現場隨機抽點一位組員,針對簡報內容追問兩個問題。」——不是不信任學生,是讓分工不均或整份外包的情況能被看見。

五、評分規準要跟著調整

評量重點移到過程與判讀之後,規準也要明確列出對應項目(例如「過程稿完整度」「口頭說明能否對應書面內容」),否則老師自己容易不小心又評回最終產出的完成度,等於題目改了、評分標準沒跟著改。

如果學校用的是 Classroom,出作業時可以先生成規準草稿再依這篇的原則調整,作法見Classroom 能自動生成評分量表了;規準完成後掛進作業的步驟見Classroom 教學:建課程到成績單

六、常見誤區

  • 把「用了 AI」直接當成作弊本身。學校多數已依作業目標分三級管理 AI 使用(不得使用/可用但須標註/鼓勵使用),詳見學生使用 AI 的校內規範怎麼訂;先確認這份作業屬於哪一級,再談有沒有違規。
  • 只加口試就以為夠了。如果題目本身還是「找出答案並寫下來」,額外的口試環節只是多一道關卡,學生一樣可以先用 AI 產出答案再臨時背誦。真正有效的是題目本身要求的東西 AI 就給不出來,口試是補強不是主力。
  • 全面禁止當成最簡單的解法。禁止令在學生於家中作業、不同作業性質適用性不同的情況下難以落實。評量設計是禁止之外更持久的做法:不管學生用不用 AI,題目問得出真實理解,過度依賴代寫的學生自然在過程環節露出破綻。

這週可以先做的三件事

  • 挑一份下一次要出的作業,套用上面任一個改法。不用一次全上,先從加一句「附上過程紀錄」開始。
  • 回頭檢查現有評分規準,補上對應過程與判讀的項目。題目改了,規準也要跟著動。
  • 跟同科老師對一次題目屬於哪一級。確認作業設計與學生使用規範的三個層級是不是對得起來,避免老師之間標準不一致。

若想針對整個學年的評量設計做系統性調整,可參考校園研習服務,內容會依實際課程與科別調整。

常見問題

為什麼不能用 AI 偵測器判斷學生有沒有用 AI 寫作業?
目前市面上的 AI 偵測工具誤判率高,尤其對非母語寫作者、寫作風格較制式或詞彙重複性高的學生特別不利,容易把認真寫作的學生誤判成用 AI。拿誤判率高的工具當處分依據,風險比它想解決的問題還大。更務實的方向是不依賴偵測,改讓評量設計本身就問得出真實理解。
評量設計的核心改變是什麼?
把評量重點從「產出結果」移到「產出過程」。AI 擅長生出看起來完整的最終答案,但不容易假造思考的軌跡:為什麼選這個資料來源、中間改了哪些判斷、遇到矛盾資訊怎麼取捨。只要評量要看的是這些過程,題目本身就有了抗 AI 代寫的能力,不需要額外的偵測步驟。
寫作類作業具體要怎麼改?
三個常用做法:一、要求提交過程稿與修改紀錄,讓老師看得到從草稿到定稿的軌跡;二、把題目連結到課堂特有的討論內容或在地情境,AI 沒有那堂課發生了什麼的脈絡;三、加入課堂即席的口頭說明環節,請學生用自己的話重述論點與寫作時的選擇。三個做法可以只挑一個開始,不必一次全上。
改成這樣,會不會增加老師的批改負擔?
會增加一些,但不是全面增加。多數做法是把負擔從「事後判斷是不是 AI 寫的」移到「事前設計題目與過程稿」,而題目設計是一次性的工作,設計好之後可以重複使用;口頭說明環節如果抽點而非全班進行,時間成本也可控。真正該避免的是同時做偵測又做評量重新設計,那才是雙重負擔。
全面禁止學生用 AI 寫作業,是不是最簡單的做法?
禁止令執行不了太多情況(學生在家使用、不同作業性質適用性不同),也不符合多數學校目前依作業目標分級管理 AI 使用的方向,詳見我們另一篇的三級分法。評量設計是禁止之外的第二條路:不管學生用不用 AI,只要評量本身問得出真實理解,過度依賴 AI 代寫的學生自然在過程環節會露出破綻,不需要用禁令去賭學生會不會遵守。
評分規準要不要跟著改?
要。評量重點若移到過程與判讀,規準也要明確列出「過程稿完整度」「口頭說明能否對應書面內容」這類項目,否則老師自己容易不小心又評回最終產出的完成度。如果學校用的是 Classroom,出作業時可以直接生成規準草稿再依這篇的原則調整,做法見我們寫的 Classroom 評分量表生成那篇。

想為校內教師辦一場評量設計工作坊?

告訴我們對象與時數,內容會配合實際的課調整。

聯絡我們