追蹤 2.6 萬中學生後發現,使用 AI 會讓考試成績大幅下滑!

來源: 更新:

今天的通用AI已經能夠解答常見的中小學題目,而老師儘管可以規定課堂上不用AI,卻很難知道學生離開教室以後怎麼做作業。2025年,中國青少年研究中心做了一次問卷調查,回收了八千多份有效問卷。調查結果顯示,超六成受訪中小學生用過AI,其中18.3%經常使用;在列舉使用方向時,超過七成學生選了“輔助完成作業”[1]。

學生作業是反映學生學習狀態的窗口,作業交得更快、分數更高,通常會被當成學得更好。可如果學生用 AI 幫助做作業,這個推斷還成立嗎?在 AI 的幫助下完成作業,學生是否能學到真本事呢?

最近有一項研究發現,當中學生可以自由選擇 AI 工具和用法時,他們的作業交得更快、分數更高,然而閉卷考試成績卻下滑了。換句話說,學生用AI做作業,可能沒有真正掌握知識。這個結論雖然並不算出人意料,但反映出的問題卻必須慎重對待。

圖片爲AI生成


作業變好了,考試卻更差

2026年6月,三位研究者發佈了一篇工作論文,名叫《生成式人工智能的學習懲罰:來自中國中等教育的證據》。研究對象是中國中部一個100多萬人口的縣,包括當地5所初中、4所高中,共26811名初一到高三學生,約佔全縣中學生的90%。研究者取得了最長30個月的校內閉卷月考成績、週末作業分數和作業平臺記錄,還取得了一部分學生的縣統考及中高考成績[2]。

數據來自文獻[2]丨由經濟學人重製,編者漢化


2025年6月,學生接受調查,並回憶自己第一次使用生成式AI的月份。截至調查時,約80%的學生報告使用過AI,常用工具包括豆包、DeepSeek、ChatGLM、文心一言和通義千問。在使用AI的學科中,數學最常見,其次是英語。

研究者用的是一種叫“雙重差分法”的統計方法。大概可以這樣理解:原來李雷和韓梅梅的成績走勢很接近。從某個月起,李雷開始用AI寫作業,韓梅梅沒有。那麼,如果李雷的成績曲線從這時候開始明顯偏離了原來的軌道,而韓梅梅仍然按原來的走勢發展,那麼這段額外的偏離就可能與AI有關。放大到兩萬多名學生的規模,研究者比較的正是這種“用AI前後的變化”與“沒用AI的同齡人同期變化”之間的差距。

這個方法比單純的“用AI前和用AI後”的對比更可靠,但仍然不是隨機實驗。學生是自己決定什麼時候開始用AI的,而如果“開始用AI”這件事本身和其他同時發生的變化有關——比如某個階段學習動力下降,或者是“因爲跟不上進度,纔想着找AI幫忙”——那麼這些因素帶來的成績變化都可能被算在AI的賬上。研究者用了長達30個月的連續月考數據去檢查兩組學生在用AI之前的走勢是否確實接近,這能在一定程度上降低這種風險。

研究結果顯示,在使用AI六到十個月後,差距就已經很明顯了。週末作業分數平均提高約18%;每次作業從領取到提交的時間,平均從約64分鐘縮短到45分鐘;與此同時,校內閉卷月考平均成績下降了約20%。

論文還報告了中考和高考結果。在累計使用AI至少兩年的學生中,中考成績約下降24%,高考成績約下降18%。不過,因爲這些數據只有很少幾個結果時點,證據比較弱。

來自文獻2 編者漢化


論文還發現,自由使用AI帶來的學習損失在不同學科和性別間並不均勻。政治和地理等社會科學類科目的損失最大,其次是理科,語文和英語等語言類相對較小;按性別看,男生的降幅比女生更明顯。這可能說明,AI導致的成績下降和具體學科的作業形式,以及不同羣體使用AI的方式有關。

研究者注意到,一部分學生從領取作業到提交作業所用的時間很短,得分卻很高,而隨後的閉卷考試成績又比較低。作者按照行爲特徵分類,把作業完成時間少於50分鐘的叫做“外包”,少於45分鐘叫做“完全外包”。按這種行爲分類,使用AI超過五個月的學生中,81%被歸入“外包”組,50%被歸入“完全外包”組。

學習損失也主要集中在這些“外包”和“完全外包”組上。那些即使用了AI、但完成作業的時間仍然和不用AI的同學相近的學生,學習損失很小。換句話說,問題似乎不只在於“用沒用AI”,還在於AI有沒有替代學生自己的嘗試和思考。

人們常把AI看成一種能力槓桿,以爲它會讓強者更強。但至少在這項研究中,結果恰恰相反:原來成績較高的學生,估算出的成績降幅反而更大。

圖庫版權圖片,轉載使用可能引發版權糾紛


研究者按照學生尚未使用AI時的平均考試成績,把他們從低到高平均分成三組。論文估算,開始使用AI六到十個月後,原來成績排在前1/3的學生,月考成績下降約24%;原來排在後1/3的學生,下降約16%。把中考和高考合併估算後,兩組的降幅分別約爲18%和11%。

研究者還發現,自稱每週使用AI不足一小時的學生,月考成績估計下降約5%;自稱使用五小時以上者下降約30%。初中生的成績降幅也比高中生更大。

不過需要注意,這是一項觀察性研究,研究對象也侷限於一個縣。學生何時開始使用 AI 的數據來自事後回憶,可能存在誤差;論文中的百分比是統計模型估算的平均變化,而不是每名學生都會出現的固定降幅。


AI究竟替學生做了哪一步

雖然數字很嚇人,但僅憑這項研究,並不能推出“只要使用AI,中學生就一定學得更差”。畢竟,同樣是使用AI,實際發生的事情可能完全不同。

讓AI查找一個數據、調整文檔格式,是使用;讓AI檢查自己的答案、指出遺漏和錯誤,也是使用;要求AI提示一個難懂概念、換一種方式講解,仍然是使用;讓模型生成解題步驟、寫好作文,直接交出可以複製粘貼的成品,也叫使用。


一種更有用的分類方法,是看AI在作業中扮演什麼角色。它可以是資料助手,幫助搜索、整理和排版。它也可以是編輯,評價學生已經完成的答案。它還可以是導師,只給提示、追問和反饋。AI可以是共同作者,和學生討論不同方案。但AI也可以是槍手,從理解題目到生成答案全部包辦,留給學生的任務只剩提交。

因此,與其問學生有沒有用AI,不如繼續問:是在動筆前就索要答案,還是做完以後請AI檢查?AI給的是完整成品,還是繼續思考的提示?關掉AI以後,能不能解釋答案,再獨立完成一道相似的題目?

最後一個問題尤其重要。關掉AI後還能夠解釋、重做和舉一反三,纔是學習的重要證據。前面的數據與“助手、編輯、導師”式使用和“槍手”式使用的區別相一致,雖然使用了AI但作業完成時間沒有明顯變化的學生,學習損失很小。


異種嵌合技術登場

今天的通用AI很擅長快速組織答案,但作業的目的不只是得到答案。學生先嚐試、發現自己的薄弱點,再尋找辦法、檢查錯誤並重新完成,這些步驟構成了學習過程。

學習科學早就區分了“表現”和“學習”。表現是做當前任務時的速度、正確率和流暢度;學習則是比較持久的變化——過一段時間還能想起來,換一道題還能做出來。更順暢地完成作業,不一定意味着真正掌握知識;而有些練習雖然在當時更困難,但以後留下的東西反而更多[3]。

學生自己不一定能察覺這種差別。AI把答案直接放到屏幕上以後,“眼前已經有答案”很容易被誤認爲“我已經會了”。

可以把一次學習粗略地看成迴路:先嚐試,找到自己卡住的地方;複習或搜索,得到一個暫時答案;再驗證、發現錯誤,修改自己的理解;最後重新做一遍。

而AI可以在每一步給提示、出反例、檢查錯誤,也可以直接跳到終點,交出完整成品。如果學生放棄自己嘗試,那麼答案不會變成學生自己的能力。看懂一道數學題的解答,並不等於合上屏幕後還能做出來。

寬泛地講,學習的目的是讓我們形成一些知識框架和基礎信息,能夠提出一個好問題,能把新信息放進已有框架中,能看出錯誤和不合理之處,以及能做出良好的決策。要形成這些能力,學習者需要反覆回憶、理解、判斷、糾錯和遷移。如果AI直接越過這些環節交出答案,學生就失去了形成能力所需的練習。

當然,學習的關鍵從來不是“動腦越累越好”,無意義的重複也不會因爲痛苦就自動變成有效學習。學習的重點是通過獲取和理解新信息而改變大腦加工能力。卡住、犯錯、檢查和重做,正是這些加工能力的改進過程。

這是學習過程中的必要摩擦,而這些摩擦必然不會愉快。所以容易理解,如果評價只看結果而不看過程,最省力的使用方式——使用AI做作業——就會更受學生歡迎。

那麼,是否應該一刀切,徹底禁止 AI 進學校呢?

這恐怕也不是個好答案。在教師規定用法、安排練習並檢查學生是否真正掌握的實驗中,AI 確實可能幫助學習。

一項綜述分析了2022至2024年間發表的69篇ChatGPT相關實驗研究,發現平均效果爲正[4];另一項聚焦“批判性思維、創造力、問題解決”等高階思維能力的三層元分析,綜合了19項實驗研究,也得到中等程度的正面結果[5]。不過,這些研究大多持續時間較短,以大學生樣本居多,不同研究之間的結果差異也很大。

這兩項研究和之前我們看到的那篇論文都是成立的。兩者回答的問題並不相同:一個問“精心設計的AI教學干預有沒有用”,一個問“讓學生自由使用AI會發生什麼”。


AI既能輔助教學,也能代做作業。區別不在於工具,而在於學生是否自己嘗試、判斷和糾錯。

以後總能用AI爲什麼還要閉卷考試?

如果一份作業只要求從公開材料中拼裝格式固定的文字,那麼作業設計顯然有問題。禁止使用AI,也不會讓這樣的機械勞動變成有效學習。

但由此得出“以後總能使用AI,現在就不必練習獨立完成”,又走得太遠了。即使使用AI,人也要擁有判斷問題是什麼、答案大概應當是什麼樣,以及哪裏必須檢查的能力。

學校和職場對一項任務的要求並不相同。工作任務要求成品按時交付且質量合格;而學校佈置一道題目,則是希望學生在做題過程中更熟練地掌握方法。

職場裏常說AI會讓“強者更強”。一位資深人士可以把重複步驟交給AI,把精力投入到檢查和取捨上;而一個新人如果把同樣的工作交給AI,卻會失去學習的機會。

所以,AI時代的教育需要把兩類任務分開:一些任務可以允許學生與AI一起完成,用來練習提問、選擇和核驗;另一些任務需要不使用AI,用來判斷學生是否掌握了所需的知識和方法。


可以用三個問題作判斷:

1. 這項任務首先要求儘快交付成品,還是要求學生學會一種以後要獨立使用的方法?

2. AI替代的是搜索、排版等輔助勞動,還是本應由學生完成的設計、分析、判斷和糾錯?

3. 不使用AI時,學生能不能解釋、重做,並把所學用到一道稍有變化的新題上?


落實到一次具體學習中,可以先讓學生獨立嘗試,寫下自己卡住的地方;遇到困難後,再讓AI提示、追問、舉反例或指出錯誤,而不是直接交出成品;最後關閉AI,由學生重新解釋、獨立完成,再嘗試一道變式題。這樣,AI提供了認知支架和反饋,而不是替學生踏過整條學習迴路。

美國康涅狄格州的柴郡學院正在做類似嘗試。一名法語教師會讓學生先用AI修改作業,再逐條檢查哪些地方確實改對了,哪些雖然變得更“標準”,卻抹掉了自己的表達。AI只給出修改意見,學生仍然要自己判斷[6]。

這家學校還給不同作業標上“交通燈”:綠燈允許充分使用AI,紅燈禁止使用,黃燈則由教師確定哪些工具和步驟可以交給AI。例如,一份作業可以允許使用AI做拼寫檢查,卻不允許直接問聊天機器人。這種方式也許可以給我們一些啓示:學生開始做作業前就知道,當前任務是在練習人機協作,還是在檢驗自己能否獨立完成[6]。

中國《中小學生成式人工智能使用指南(2025年版)》已經提出分學段、以人爲本和避免過度依賴,明確不應把生成內容簡單複製爲作業,也不能把AI作爲替代性教學主體。這與上述判斷大體一致[7]。

進入職場以後,使用AI的理由會更加充分,但人仍然需要知道什麼時候可以委託,什麼時候必須接過判斷權。一項針對管理諮詢顧問的實驗發現,在模型擅長的創意、分析和寫作任務中,AI可以讓參與者完成得更快、更好;換成表面相似但模型不擅長的任務,使用AI的人反而更容易答錯。研究者把這種忽高忽低的能力邊界稱爲“鋸齒狀技術前沿”。能判斷什麼時候可以相信AI,成了重要的能力[8]。

因此,學校不能只培養一種與工具隔絕的考試能力。沒有AI時,學生應當能夠回憶、解釋、判斷,並把學過的方法用到新問題上;有AI時,學生還要會提出問題、交叉覈驗、發現AI的錯誤或幻覺,併爲最終答案負責。

AI可以參與作業,但不能讓學習者完全不做作業。判斷AI是否真正幫助了學習,應該看在不使用AI工具以後,學生還會做些什麼。作業成績和完成速度無法證明是否真正學會,只有關掉AI之後,才見分曉。


參考文獻

[1] 孫宏豔. 調查發現超六成受訪中小學生用過 AI[N]. 中國青年報, 2026-03-26(08).

[2] Strömberg D, Lei V, Wu Y. The Generative AI Learning Penalty: Evidence from Chinese Secondary Education[R]. CEPR Discussion Paper No. DP21577, 2026-06-02.

[3] Soderstrom N C, Bjork R A. Learning Versus Performance: An Integrative Review[J]. Perspectives on Psychological Science, 2015, 10(2): 176-190.

[4] Deng R, Jiang M, Yu X, Lu Y, Liu S. Does ChatGPT Enhance Student Learning? A Systematic Review and Meta-analysis of Experimental Studies[J]. Computers & Education, 2025, 227: 105224.

[5] Liu X, Guo B, He W, Hu X. Effects of Generative Artificial Intelligence on K-12 and Higher Education Students'' Learning Outcomes: A Meta-Analysis[J]. Journal of Educational Computing Research, 2025, 63(6): 1460-1492.

[6] Hall P, Santos R. How to Encourage Smarter AI Use in the Classroom[EB/OL]. MIT Technology Review, 2026-08-24. https://www.technologyreview.com/2026/08/24/1142630/ai-school-classroom-policies/

[7] 教育部基礎教育教學指導委員會. 中小學生成式人工智能使用指南(2025年版)[Z]. 2025-05-13.

[8] Dell''Acqua F, Mollick E, Lifshitz-Assaf H, et al. Navigating the Jagged Technological Frontier: Field Experimental Evidence of the Effects of Artificial Intelligence on Knowledge Worker Productivity and Quality[J]. Organization Science, 2025.


策劃製作

作者丨猛獁 哈爾濱理工大學教師

審覈丨於乃功 北京工業大學教授 中國人工智能學會理事

蘇哲倫 上海市語文高級教師

策劃丨徐來

責編丨丁崝

相關推薦
請使用下列任何一種瀏覽器瀏覽以達至最佳的用戶體驗:Google Chrome、Mozilla Firefox、Microsoft Edge 或 Safari。為避免使用網頁時發生問題,請確保你的網頁瀏覽器已更新至最新版本。
Scroll to Top