同樣是 GPT-4,為什麼一種幫忙解題,另一種比較像在教你?

核心研究
Generative AI without guardrails can harm learning: Evidence from high school mathematics
有一群高中生在數學練習時拿到 GPT-4。使用接近一般聊天助手的版本後,他們的練習成績比控制組高約 48%。
接著研究人員把電腦收走,讓所有人獨立考一場相近概念的測驗。
結果反了過來:剛才做題明顯變順的 GPT Base 組,無輔助測驗反而比從頭到尾沒用 AI 的控制組低約 17%。
這是 Bastani 等人在 2025 年發表於 PNAS 的大型實地隨機實驗。它把一個常被混在一起的問題拆開了:AI 能不能幫你把眼前的題目做對,和你之後能不能自己做,並不是同一件事。
三組學生,底層模型相同但學習歷程不同
研究在土耳其一所大型高中進行,涵蓋約 50 個九到十一年級班級、接近 1,000 名學生。四次 90 分鐘課程中,學生先複習,再進行有資源的練習,最後立刻做一場不能用 AI、不能看書的測驗。
學生以班級為單位分成三組。
控制組使用課本和筆記。
GPT Base 組多了一個 GPT-4 聊天助手。學生可以請它說明,也可以直接問答案。
GPT Tutor 組同樣使用 GPT-4,但研究團隊和教師替它準備了更完整的教學結構:正確解法、學生常犯的錯、遇到錯誤時要給的提示,以及「不要直接把完整答案交出去」的規則。
這個差別很重要。GPT Tutor 並不是在一般 ChatGPT 前面多放一句「請當個好老師」。教師事先提供了問題特定的內容,建置本身需要額外工作。
AI 在手上時,兩種版本都很好用
Table 1 的練習結果很亮眼。
控制組的平均練習分數是 0.284。GPT Base 的 treatment effect 是 +0.137,約等於控制組平均的 48%;GPT Tutor 是 +0.361,約等於 127%。
如果只在這裡停下來,兩種工具都像成功的教育科技,GPT Tutor 甚至看起來特別強。
真正把兩者分開的是後面的無輔助測驗。
控制組平均分數是 0.321。GPT Base 的估計值是 -0.054,約等於控制組平均的 17%,而且達統計顯著。GPT Tutor 則是 -0.004,和控制組沒有統計上的差異。
因此,GPT Tutor 在這項研究裡最準確的說法是「避免了 GPT Base 出現的負向測驗效果」。它沒有證明學生離開 AI 後比傳統方式學得更多。
學生自己沒有察覺這個落差
研究還問學生,他們覺得 AI 對自己的學習和考試表現有沒有幫助。
GPT Base 組實際考得比較差,卻沒有覺得自己學得比較少。
GPT Tutor 組的無輔助考試沒有超過控制組,主觀上卻覺得自己表現更好。
這個結果很適合提醒我們:使用 AI 時的流暢感,很容易被拿來當成學習的代理指標。題目完成得快、解法看起來懂、對話進行得順,都可能讓人產生「我會了」的感覺。
真正的檢查要等支援拿掉之後才看得出來。
錯答案很多,但它不是完整解釋
當時的 GPT-4 本身也有明顯限制。
研究團隊把 57 道練習題各問 GPT Base 十次,使用學生最常見的問法:「答案是什麼?」
平均約 51% 的回答完全正確,42% 出現邏輯錯誤,8% 出現算術錯誤。這些數字只適用研究中的模型、prompt 和題目集,不能拿來當今天 ChatGPT 的數學正確率。
如果學生只是被 AI 的錯答案教壞,錯誤較多的練習題應該更容易在後續相近考題留下痕跡。
研究沒有看到清楚的這種 spillover。
GPT 的邏輯錯誤會拖累當下練習,但對應的 exam problem 沒有出現顯著的額外下降。再加上學生對話紀錄,作者較支持另一個解釋:不少 GPT Base 學生直接取得完整答案,沒有充分進行原本需要自己完成的解題過程。
這條機制有行為證據支持,但還不是完整的因果中介分析。學生是否直接問答案並沒有被研究者另外隨機分派。
後來的研究讓圖像更清楚,也更複雜
後續證據沒有得到「生成式 AI 一定傷害學習」這種簡單答案。
2025 年另一項 120 名大學生的隨機實驗,讓一組使用 ChatGPT 學習,另一組採傳統方式。45 天後突襲測驗,ChatGPT 組平均答對 57.5%,傳統組 68.5%。這和 Bastani 的「AI 在場時很方便,離開後可能留下較少」方向一致,但族群、內容和時間尺度都不同,不能叫做直接 replication。
同一年,Harvard 大學物理課的一項 RCT 得到另一種結果。研究者使用依教育心理學與課程內容設計的 AI tutor,觀察到正向的學習效果。這類結果提醒我們,AI tutor 並不是一個單一 treatment。
到了 2026 年,一篇 STEM 教育的 systematic review 和 meta-analysis 納入 85 篇 eligible studies,其中 49 篇、59 個 effect sizes 進入量化統合。研究之間的異質性非常高,I² = 96.32%;校正 publication bias 後,整體平均效果接近零。
其中一個能解釋部分差異的因素,是生成式 AI 到底如何改變學生的認知活動。當 AI 主要增加回饋、支援原本的學習活動時,效果通常比較正向;當它替學生完成原本需要自己做的認知工作時,結果較差。這仍是跨研究 moderator pattern,不能當成一條已完成因果驗證的萬用定律。
目前比較合理的結論,是停止把「有沒有用 AI」當成完整描述。
一個很簡單的自我檢查
如果你習慣用 ChatGPT 學數學、統計、程式或其他需要自己操作的技能,可以借用這篇研究的邏輯做一個小檢查。
先照平常方式使用 AI。
結束後把 AI 關掉,找一道同類型但沒有看過的新題,自己做一次。
如果仍能獨立完成,前面的 AI 對話比較可能真的轉成你的能力。
如果一離開 AI 就卡住,剛才改善的可能主要是「有工具時的表現」。
這個方法是從研究設計延伸出的應用,不是 Bastani 等人直接測過的介入措施。但它至少把注意力放在一個更可靠的 outcome:沒有支援時,你還能不能做。
參考資料
- Bastani, H., Bastani, O., Sungu, A., Ge, H., Kabakcı, Ö., & Mariman, R. (2025). Generative AI without guardrails can harm learning: Evidence from high school mathematics. Proceedings of the National Academy of Sciences, 122(26), e2422633122. https://doi.org/10.1073/pnas.2422633122
- Barcaui, A. (2025). ChatGPT as a cognitive crutch: Evidence from a randomized controlled trial on knowledge retention. Social Sciences & Humanities Open, 12, 102287. https://doi.org/10.1016/j.ssaho.2025.102287
- Kestin, G., Miller, K., Klales, A., Milbourne, T., & Ponti, G. (2025). AI tutoring outperforms in-class active learning: an RCT introducing a novel research-based design in an authentic educational setting. Scientific Reports, 15, 17458. https://doi.org/10.1038/s41598-025-97652-6
- Boolzen, C., Kuhn, J., Flegr, S., Rott, E.-M., Stausberg, N., et al. (2026). Evidence of impact and interpretational limits of generative AI in STEM education: a systematic review and meta-analysis on cognitive learning outcomes. Artificial Intelligence Review, 59, 223. https://doi.org/10.1007/s10462-026-11665-9