近日,南京大學(xué)歷史學(xué)院公布了“我用AI寫歷史”論文競賽的最終結(jié)果。這場發(fā)起于3個月前的實(shí)驗(yàn)性論文競賽,吸引全國近900名本科生報(bào)名參與。比賽鼓勵學(xué)生充分使用AI輔助寫作,但要求公開全部操作痕跡。
作為一次大膽的實(shí)驗(yàn),其結(jié)果如何?“我們并不覺得應(yīng)該有下一次比賽?!备傎惏l(fā)起人、南大歷史學(xué)院副院長王濤教授告訴記者,本次比賽已經(jīng)證明了一個令人不安的事實(shí)——即便是在如此倉促的前提下,本科生借助AI也能提交一份像模像樣的學(xué)術(shù)論文。這讓他認(rèn)為,傳統(tǒng)意義上的課程論文,正在失去作為成果檢驗(yàn)工具的效力。
![]()
有人有上百頁對話記錄,有人“一鍵出稿”
作為一項(xiàng)實(shí)驗(yàn)性賽事,“全程留痕”是競賽的核心設(shè)計(jì)。參賽者需在南京大學(xué)自主研發(fā)的“數(shù)智文獻(xiàn)處理平臺”上完成創(chuàng)作,所有文獻(xiàn)處理、檢索、提問與回答等操作軌跡均被自動記錄。
然而,參賽者在留痕上的投入程度差異明顯。王濤透露,有的同學(xué)提交的交互證據(jù)僅有寥寥數(shù)頁,屬于“一鍵出稿+少量修改”模式;也有同學(xué)提交了上百頁的與AI對話記錄,而最終成文僅十余頁,每一輪提問、史料核對、論證修正都留下了清晰的迭代痕跡?!斑@部分同學(xué)的寫作過程相當(dāng)用心,真正把AI當(dāng)成了協(xié)作者,而不是代筆者?!蓖鯘f。
關(guān)于賽前普遍擔(dān)憂的“AI幻覺”問題,主辦方通過推薦使用指定的數(shù)智文獻(xiàn)平臺,“鎖死”了材料來源,從技術(shù)層面最大程度降低了幻覺風(fēng)險(xiǎn)。但仍有部分同學(xué)選擇使用其他AI工具,且未對生成內(nèi)容進(jìn)行有效核實(shí),提交的論文存在明顯的史實(shí)錯誤和文獻(xiàn)虛構(gòu)問題?!肮ぞ弑旧聿皇菃栴},問題在于使用者是否具備歷史學(xué)的基本素養(yǎng)和求證意識?!蓖鯘硎尽?/p>
提問記錄難解“原創(chuàng)性”追問,人機(jī)評分差異大
本次競賽最受矚目的創(chuàng)新,在于評審環(huán)節(jié)引入了“人機(jī)雙軌制”,50多位人類專家與一套AI評分系統(tǒng)各自獨(dú)立打分,再取均值形成最終榜單。
然而,評審過程暴露出的問題,遠(yuǎn)比預(yù)想中復(fù)雜。
首先,“全程留痕”并未真正降低評審難度。 根據(jù)賽制,專家在評閱論文時需同時查看學(xué)生的提問記錄與AI回答。但多位專家反饋,這一設(shè)計(jì)“增加了評審難度”——如何判斷學(xué)生在整個過程中到底做了多少智力貢獻(xiàn)?提問的質(zhì)量能否等價(jià)于思考的深度?這些問題至今沒有答案。王濤坦言:“如何判斷學(xué)生在AI輔助下的真實(shí)工作量,或許將成為AI時代論文評審的核心困境?!?/p>
其次,AI評委比人類專家更為寬松,兩者評分標(biāo)準(zhǔn)存在系統(tǒng)性偏差。
數(shù)據(jù)顯示,AI評委給出的中位分為86分,而人類專家的中位分僅為80分;最高分同樣出自AI之手。
進(jìn)一步統(tǒng)計(jì)顯示,專家均分與AI評分的相關(guān)系數(shù)較低,說明兩者對“好論文”的認(rèn)知框架存在顯著差異。
這種差異直接體現(xiàn)在具體的評審結(jié)果上,有爭議的論文大量存在。此次特別增設(shè)的“最具爭議獎”頒給了兩篇分差最大的作品:《簡要分析西漢翔鷺紋銅鼓紋飾反映的民俗文化》(專家高分 vs AI低分),以及《論明征安南之戰(zhàn)中明軍火器戰(zhàn)術(shù)的應(yīng)用》(專家低分 vs AI高分)。王濤認(rèn)為,這跟論文風(fēng)格沒有關(guān)系,還在于行文邏輯和論證過程,“我們甚至推測,AI評審更側(cè)重于形式規(guī)范,如結(jié)構(gòu)、引用等,而專家看重歷史思維和問題意識,這成為爭議的焦點(diǎn)。”
值得注意的是,人類專家內(nèi)部也并非意見統(tǒng)一。據(jù)統(tǒng)計(jì),專家內(nèi)部分差大于20分的論文達(dá)38篇,占總數(shù)的18%。這表明,即使在純?nèi)斯ぴu審時代,學(xué)術(shù)評價(jià)的主觀性也遠(yuǎn)未被充分討論。人機(jī)分歧,某種程度上只是將這一固有矛盾推向了前臺。
歷史學(xué)本科教育或需重新定義“何為成果”
王濤解釋,本次競賽的目的并非打造一個更完美的“人機(jī)協(xié)作大賽”,而是通過實(shí)驗(yàn)揭示一個已到來的事實(shí):在一個僅持續(xù)數(shù)月、多數(shù)參賽者倉促上陣的競賽中,已涌現(xiàn)出相當(dāng)數(shù)量“像模像樣”的學(xué)術(shù)論文。如果AI能在如此短的時間內(nèi)輔助本科生完成達(dá)到發(fā)表水準(zhǔn)的文本,那么傳統(tǒng)意義上以課程論文為終端的考核方式,其檢驗(yàn)學(xué)生學(xué)術(shù)能力的效力正面臨根本性質(zhì)疑。
“如果技術(shù)再進(jìn)步十年,”王濤說,“歷史學(xué)本科教育中絕對不能被AI替代的部分,不是史料檢索、文獻(xiàn)綜述,甚至不是初稿撰寫,而是提出真正問題的能力、對史料進(jìn)行批判性質(zhì)疑的直覺,以及將碎片納入宏大敘事的歷史想象力。這些東西,AI可以模仿,但無法‘擁有’?!?/p>
據(jù)了解,本次競賽的所有數(shù)據(jù)、論文與評審記錄將全部開源,供全國高校文科教育工作者參考。主辦方將于近期召開專題研討會,以這場實(shí)驗(yàn)為起點(diǎn),推動關(guān)于“AI時代歷史學(xué)本科教育何為”的進(jìn)一步討論。
揚(yáng)子晚報(bào)/紫牛新聞記者 楊甜子
校對 朱亞萍